Agent 평가

세 가지 Grader 유형: 코드, 모델, 인간

Grader는 평가 시스템의 심판입니다. 잘못된 Grader를 선택하면 평가 결과를 신뢰할 수 없습니다. 프로덕션 환경의 경험에 따르면, 세 가지 Grader를 조합하여 각각의 장점을 살리는 것이 가장 효과적입니다. 은탄환은 없지만, 최적의 조합은 있습니다.

Grader 1: 코드 평가기

코드 Grader

프로그램 로직으로 정오를 자동 판정합니다
구분 상세 내용
방법 문자열 매칭, 정규식, 정적 분석(AST), 단위 테스트 pass/fail, 도구 호출 검증(올바른 API와 파라미터 호출 여부)
장점 속도 빠름(밀리초 단위), 비용 거의 없음, 완전히 객관적이고 재현 가능, CI/CD 자동화에 적합
단점 합리적인 변형에 지나치게 엄격(예: 변수명이 다르면 오답 처리), 의미론적 이해 부족, 주관적 품질 평가 불가
적합한 상황 명확한 정답이 있는 작업: 코드 컴파일 성공 여부, API 반환값 정확성, 파일 형식 준수 여부, 수학 계산 정확성
Grader 2: 모델 평가기 (LLM-as-Judge)

모델 Grader (LLM-as-Judge)

다른 LLM이 채점 기준에 따라 점수를 매깁니다
구분 상세 내용
방법 Agent의 출력과 채점 Rubric을 심사 LLM에 함께 전달하여, 미리 설정된 기준에 따라 점수와 이유를 반환하게 합니다
장점 주관적 품질 평가 가능(문체, 논리성, 창의력), 자구 매칭을 넘어 의도 이해, 다양한 작업 유형에 유연하게 대응
단점 비용 높음(평가마다 token 소비), 채점 편향 가능성, 정교한 채점 기준 설계 필요, 결과 완전 재현 불가
적합한 상황 개방형 작업: 연구 보고서 품질 평가, 코드 스타일 평가, 대화 자연스러움, 요약 완성도와 정확성
핵심 팁: Rubric은 각 점수마다 구체적으로 정의하세요
「출력 품질을 0~1점으로 평가하라」와 같은 모호한 기준은 거의 쓸모가 없습니다. 좋은 Rubric은 다음처럼 명확해야 합니다:
0점 = 전혀 답변하지 않았거나 심각한 사실 오류 포함
0.3점 = 답변은 했지만 핵심 정보 누락
0.7점 = 완전하고 정확하지만 구성이 혼란스럽거나 중복됨
1점 = 완전하고, 정확하며, 간결하고, 구조가 명확함
Grader 3: 인간 평가기

인간 Grader

도메인 전문가가 직접 평가합니다
구분 상세 내용
사용 시점 평가 초기 채점 기준 교정, LLM 평가의 명확한 맹점 발생 시, 전문가 판단이 필요한 고위험 영역(의료, 법률, 금융)
장점 최고 품질의 피드백, 자동화 방법의 사각지대 발견, 개선 방향에 대한 심층 인사이트 제공
단점 확장 불가(인간 시간 제한), 속도 느림(시간~일 단위), 비용 높음, 평가자 간 의견 불일치
적합한 상황 모델 Grader 정확도 주기적 점검, 새로운 도메인의 평가 기준 수립, 중요한 제품 결정의 최종 검증
혼합 전략: 권장 워크플로
3단계 평가 체계
1
코드 Grader로 기반 구성
모든 결정론적 시나리오를 먼저 커버합니다: 컴파일, 형식 검증, API 호출 정확성. 빠르고 저렴합니다.
2
모델 Grader로 확장
주관적 시나리오를 커버합니다: 출력 품질, 논리적 일관성, 사용자 경험. 잘 설계된 Rubric이 핵심입니다.
3
인간의 주기적 교정
모델 Grader 점수가 편향되지 않았는지 주기적으로 점검하고, 편견을 수정하여 평가 시스템의 신뢰성을 유지합니다.
핵심 논리: 코드 Grader는 최저선을 보장하고(큰 실수 방지), 모델 Grader는 상한선을 높이며(출력 품질), 인간 Grader는 심판을 교정합니다(공정성 확보). 세 가지 모두 빠질 수 없습니다.
실제 사례
Descript
동영상 편집 Agent
Descript의 평가 시스템은 세 가지 차원을 중심으로 구성되며, 각 차원을 독립적으로 채점한 후 종합 평가합니다:
손상 없음 -- 편집 후 영상 무결
올바른 실행 -- 지시 사항 정확히 수행
잘 수행 -- 전문적인 편집 품질
Bolt AI
코드 생성 Agent
Bolt AI는 세 가지 Grader 유형을 조합하여 완전한 평가 파이프라인을 구성합니다:

  • 정적 분석(코드 Grader): 생성된 코드가 컴파일되고 lint를 통과하는지 확인
  • 브라우저 Agent 테스트(코드 Grader): 생성된 페이지를 자동으로 열어 UI가 기대에 부합하는지 검증
  • LLM Judge(모델 Grader): 코드 품질, 가독성, 모범 사례 준수 여부 평가
은탄환은 없습니다 — 세 가지 Grader를 조합하는 것이 최선입니다. 코드 Grader로 최저선을 지키고, 모델 Grader로 상한선을 높이며, 인간 Grader로 교정합니다. 이것이 여러 최고 Agent 팀에서 검증된 모범 사례입니다.