Claude Code(클로드 코드 — Anthropic이 만든 터미널용 AI 코딩 도구)에 새로 추가된 claude plugin eval 명령을 쓰면, 내가 만든 플러그인(Plugin — Claude Code 기능을 확장하는 부가 기능 묶음)이 실제로 도움이 되는지, 아니면 아직 더 다듬어야 하는지를 점수로 확인할 수 있습니다. 플러그인을 켰을 때와 껐을 때의 결과를 같은 테스트 케이스로 비교해 주기 때문에, "느낌상 좋아진 것 같다"가 아니라 숫자로 판단할 수 있습니다.
claude plugin eval란 무엇인가요?
claude plugin eval은 내가 만든 플러그인이나 스킬(Skill — 특정 작업을 위해 미리 짜 둔 지침 묶음)의 실제 효과를 테스트 케이스로 측정해 주는 명령입니다. 공식 발표(@ClaudeDevs, 2026년 9월 11일)에 따르면, 테스트 케이스를 만들어 플러그인을 적용한 상태로 실행해 점수를 매긴 뒤, 같은 케이스를 플러그인 없이 다시 실행해 두 결과를 비교해 줍니다. 예를 들어 "코드 리뷰를 더 꼼꼼하게 해 주는 플러그인"을 만들었다면, 이 명령으로 실제로 리뷰 품질이 올라갔는지를 확인할 수 있습니다.
시작 전 준비물
- Claude Code 설치 및 최신 버전 — 터미널에서
claude update를 실행해 최신 버전으로 올려 두어야 새 명령을 쓸 수 있습니다. - 테스트할 플러그인 폴더 — 이미 만들어 둔 플러그인이나 스킬 프로젝트 폴더가 있어야 합니다. 아직 플러그인이 없다면 이 기능을 바로 쓸 수 없습니다.
- 실제 사용 프롬프트 몇 개 — 플러그인을 평가할 때 쓸 실제 질문·요청 예시를 몇 개 미리 떠올려 두면 다음 단계가 수월합니다.
단계별 실행 방법
전체 과정은 초기화, 시범 실행, 전체 실행, 결과 확인 순서로 진행됩니다.
- 플러그인 폴더로 이동해 초기화합니다. 터미널에서 플러그인 폴더로 들어간 뒤 다음 명령을 실행합니다.
이렇게 보이면 성공: Claude가 좋은 결과와 나쁜 결과가 무엇인지 물어보고, 테스트 케이스 초안을 만들어 보여줍니다.claude plugin eval init - 좋은 결과와 나쁜 결과, 실제 프롬프트를 알려줍니다. 화면 안내에 따라 "이런 답변이면 성공, 이런 답변이면 실패"를 설명하고 준비해 둔 실제 프롬프트 몇 개를 입력합니다. Claude가 테스트 케이스와 채점 기준을 초안으로 작성하고, 시범 실행을 해 본 뒤 전체 실행에 드는 예상 비용을 알려줍니다.
- 시범 실행으로 먼저 확인합니다. 평가는 실제로 모델을 호출하므로 토큰(Token — AI가 글을 처리하는 단위이자 API 요금 계산 기준)을 소모하고 결과가 매번 조금씩 달라질 수 있습니다. 전체 실행 전에 다음처럼 한 번만 돌려 보는 것이 안전합니다.
claude plugin eval --runs 1 - 문제가 없으면 전체 실행을 합니다.
이렇게 보이면 성공: 터미널에 각 테스트 케이스별로 플러그인을 켰을 때와 껐을 때의 점수가 나란히 표시되고, 상세 내용을 담은 HTML 보고서가 함께 생성됩니다.claude plugin eval
결과 확인하기
결과 확인은 터미널 점수 비교와 HTML 보고서, 두 가지로 이루어집니다. 터미널에는 각 테스트 케이스마다 "플러그인 있음" 점수와 "플러그인 없음" 점수가 함께 나오므로, 두 점수의 차이가 곧 이 플러그인이 실제로 더해 주는 가치입니다. 계정이 이 기능을 지원하면 같은 결과가 비공개 아티팩트(Artifact — Claude가 만든 결과물을 저장·공유하는 공간)로도 저장됩니다.
자주 막히는 지점과 주의할 점
- 비용과 결과 변동 — 평가는 실제로 모델을 호출하는 작업이라 토큰 요금이 들고, 실행할 때마다 점수가 조금씩 달라질 수 있습니다. 처음에는 반드시
--runs 1로 시범 실행부터 해 보세요. - 신뢰할 수 있는 플러그인만 평가 — 플러그인에 딸린 훅(Hooks — 특정 시점에 자동으로 실행되는 스크립트)과 MCP(Model Context Protocol — 외부 도구를 연결하는 규약) 서버는 내 계정 권한으로 실행됩니다. 출처를 모르거나 신뢰하지 않는 플러그인은 평가하지 마세요.
- claude update를 먼저 실행 — 명령이 보이지 않는다면 Claude Code 버전이 오래된 경우가 많습니다.
claude update로 업데이트한 뒤 다시 시도하세요.
자주 묻는 질문
Q. claude plugin eval을 쓰려면 무엇부터 준비해야 하나요?
평가할 플러그인 폴더와 실제로 쓰는 프롬프트 몇 개, 그리고 최신 버전의 Claude Code가 필요합니다. 폴더 안에서 claude plugin eval init을 실행하면 나머지는 Claude가 안내합니다.
Q. 전체 실행 전에 꼭 시범 실행을 해야 하나요?
공식 안내에 따르면 필수는 아니지만 권장됩니다. 평가가 모델을 호출해 토큰을 소모하고 결과가 실행마다 달라질 수 있어, --runs 1로 먼저 비용과 결과를 확인한 뒤 전체 실행을 하는 것이 안전합니다.
Q. 결과는 어디에서 볼 수 있나요?
기본적으로 터미널에 케이스별 점수가 표시되고, 상세 내용은 HTML 보고서로 함께 만들어집니다. 계정이 지원하는 경우에는 같은 보고서가 비공개 아티팩트로도 저장됩니다.
Q. 아무 플러그인이나 평가해도 안전한가요?
주의가 필요합니다. 평가 중에는 플러그인에 포함된 훅과 MCP 서버가 내 계정 권한으로 실행되므로, 출처가 분명하고 신뢰할 수 있는 플러그인만 평가하는 것이 안전합니다.