본문 바로가기

Claude Code claude plugin eval 사용법 — 플러그인 성능 평가하기

Claude Code에 새로 추가된 claude plugin eval 명령으로 내가 만든 플러그인이 실제로 도움이 되는지 점수로 확인하는 방법을 알아봅니다.

Claude Code(클로드 코드 — Anthropic이 만든 터미널용 AI 코딩 도구)에 새로 추가된 claude plugin eval 명령을 쓰면, 내가 만든 플러그인(Plugin — Claude Code 기능을 확장하는 부가 기능 묶음)이 실제로 도움이 되는지, 아니면 아직 더 다듬어야 하는지를 점수로 확인할 수 있습니다. 플러그인을 켰을 때와 껐을 때의 결과를 같은 테스트 케이스로 비교해 주기 때문에, "느낌상 좋아진 것 같다"가 아니라 숫자로 판단할 수 있습니다.

1. init 실행 2. 좋은/나쁜 예시·프롬프트 3. 시범 실행 (--runs 1) 4. 전체 실행 claude plugin eval 5. 점수 비교 (있음 vs 없음)

claude plugin eval란 무엇인가요?

claude plugin eval은 내가 만든 플러그인이나 스킬(Skill — 특정 작업을 위해 미리 짜 둔 지침 묶음)의 실제 효과를 테스트 케이스로 측정해 주는 명령입니다. 공식 발표(@ClaudeDevs, 2026년 9월 11일)에 따르면, 테스트 케이스를 만들어 플러그인을 적용한 상태로 실행해 점수를 매긴 뒤, 같은 케이스를 플러그인 없이 다시 실행해 두 결과를 비교해 줍니다. 예를 들어 "코드 리뷰를 더 꼼꼼하게 해 주는 플러그인"을 만들었다면, 이 명령으로 실제로 리뷰 품질이 올라갔는지를 확인할 수 있습니다.

시작 전 준비물

  • Claude Code 설치 및 최신 버전 — 터미널에서 claude update를 실행해 최신 버전으로 올려 두어야 새 명령을 쓸 수 있습니다.
  • 테스트할 플러그인 폴더 — 이미 만들어 둔 플러그인이나 스킬 프로젝트 폴더가 있어야 합니다. 아직 플러그인이 없다면 이 기능을 바로 쓸 수 없습니다.
  • 실제 사용 프롬프트 몇 개 — 플러그인을 평가할 때 쓸 실제 질문·요청 예시를 몇 개 미리 떠올려 두면 다음 단계가 수월합니다.

단계별 실행 방법

전체 과정은 초기화, 시범 실행, 전체 실행, 결과 확인 순서로 진행됩니다.

  1. 플러그인 폴더로 이동해 초기화합니다. 터미널에서 플러그인 폴더로 들어간 뒤 다음 명령을 실행합니다.
    claude plugin eval init
    이렇게 보이면 성공: Claude가 좋은 결과와 나쁜 결과가 무엇인지 물어보고, 테스트 케이스 초안을 만들어 보여줍니다.
  2. 좋은 결과와 나쁜 결과, 실제 프롬프트를 알려줍니다. 화면 안내에 따라 "이런 답변이면 성공, 이런 답변이면 실패"를 설명하고 준비해 둔 실제 프롬프트 몇 개를 입력합니다. Claude가 테스트 케이스와 채점 기준을 초안으로 작성하고, 시범 실행을 해 본 뒤 전체 실행에 드는 예상 비용을 알려줍니다.
  3. 시범 실행으로 먼저 확인합니다. 평가는 실제로 모델을 호출하므로 토큰(Token — AI가 글을 처리하는 단위이자 API 요금 계산 기준)을 소모하고 결과가 매번 조금씩 달라질 수 있습니다. 전체 실행 전에 다음처럼 한 번만 돌려 보는 것이 안전합니다.
    claude plugin eval --runs 1
  4. 문제가 없으면 전체 실행을 합니다.
    claude plugin eval
    이렇게 보이면 성공: 터미널에 각 테스트 케이스별로 플러그인을 켰을 때와 껐을 때의 점수가 나란히 표시되고, 상세 내용을 담은 HTML 보고서가 함께 생성됩니다.

결과 확인하기

결과 확인은 터미널 점수 비교와 HTML 보고서, 두 가지로 이루어집니다. 터미널에는 각 테스트 케이스마다 "플러그인 있음" 점수와 "플러그인 없음" 점수가 함께 나오므로, 두 점수의 차이가 곧 이 플러그인이 실제로 더해 주는 가치입니다. 계정이 이 기능을 지원하면 같은 결과가 비공개 아티팩트(Artifact — Claude가 만든 결과물을 저장·공유하는 공간)로도 저장됩니다.

플러그인 켠 상태 테스트 케이스 점수 플러그인 끈 상태 테스트 케이스 점수 두 점수의 차이 = 플러그인이 더하는 실제 가치

자주 막히는 지점과 주의할 점

  • 비용과 결과 변동 — 평가는 실제로 모델을 호출하는 작업이라 토큰 요금이 들고, 실행할 때마다 점수가 조금씩 달라질 수 있습니다. 처음에는 반드시 --runs 1로 시범 실행부터 해 보세요.
  • 신뢰할 수 있는 플러그인만 평가 — 플러그인에 딸린 훅(Hooks — 특정 시점에 자동으로 실행되는 스크립트)과 MCP(Model Context Protocol — 외부 도구를 연결하는 규약) 서버는 내 계정 권한으로 실행됩니다. 출처를 모르거나 신뢰하지 않는 플러그인은 평가하지 마세요.
  • claude update를 먼저 실행 — 명령이 보이지 않는다면 Claude Code 버전이 오래된 경우가 많습니다. claude update로 업데이트한 뒤 다시 시도하세요.

자주 묻는 질문

Q. claude plugin eval을 쓰려면 무엇부터 준비해야 하나요?
평가할 플러그인 폴더와 실제로 쓰는 프롬프트 몇 개, 그리고 최신 버전의 Claude Code가 필요합니다. 폴더 안에서 claude plugin eval init을 실행하면 나머지는 Claude가 안내합니다.

Q. 전체 실행 전에 꼭 시범 실행을 해야 하나요?
공식 안내에 따르면 필수는 아니지만 권장됩니다. 평가가 모델을 호출해 토큰을 소모하고 결과가 실행마다 달라질 수 있어, --runs 1로 먼저 비용과 결과를 확인한 뒤 전체 실행을 하는 것이 안전합니다.

Q. 결과는 어디에서 볼 수 있나요?
기본적으로 터미널에 케이스별 점수가 표시되고, 상세 내용은 HTML 보고서로 함께 만들어집니다. 계정이 지원하는 경우에는 같은 보고서가 비공개 아티팩트로도 저장됩니다.

Q. 아무 플러그인이나 평가해도 안전한가요?
주의가 필요합니다. 평가 중에는 플러그인에 포함된 훅과 MCP 서버가 내 계정 권한으로 실행되므로, 출처가 분명하고 신뢰할 수 있는 플러그인만 평가하는 것이 안전합니다.

관련 글

이 글이 도움이 됐나요?

이어서 읽어보세요

Claude Code '프로젝트' 재설계, 데스크톱·웹에 베타 출시

Anthropic 공식 X 계정 @ClaudeDevs가 Claude Code 데스크톱·웹 버전에 새로워진 '프로젝트' 기능을 베타로 출시했다고 밝혔습니다. 하나의 대화에서 목표를 설명하면 Claude가 작업을 여러 스레드로 나눠 병렬 클라우드 세션으로 실행하고, 컨텍스트를 공유하며 자리를 비워도 계속 진행합니다. 우선 일부 Pro·Max 사용자를 대상으로 베타가 시작됩니다.

12

앤트로픽 교육 보고서: 대학교수들은 Claude를 이렇게 씁니다

앤트로픽이 대학 교원 7만4천여 건의 Claude 대화를 분석한 교육 보고서를 공개했습니다. 교수들이 어떤 업무에 Claude를 쓰는지, 어떤 업무는 사람이 직접 판단해야 하는지 살펴봅니다.

7

클로드 코워크와 채팅이 하나로 합쳐진다

Anthropic 공식 계정 @claudeai가 클로드 코워크(Cowork)와 채팅을 하나의 대화로 통합한다고 발표했습니다. 간단한 질문부터 보고서 작성 같은 복잡한 작업까지 같은 대화창에서 처리할 수 있으며, Pro·Max 플랜부터 순차 적용됩니다.

15

Claude에서 Salesforce 출시 (베타)

Salesforce in Claude라는 플러그인이 베타로 출시되었습니다. 이 플러그인은 판매자의 Salesforce 계정, 영업 기회, 파이프라인 정보를 Claude 내에서 바로 확인할 수 있게 해주며, 37개의 사전 구축된 판매 기술을 포함하고 있습니다.

8