Agent 평가
세 가지 Grader 유형: 코드, 모델, 인간
Grader는 평가 시스템의 심판입니다. 잘못된 Grader를 선택하면 평가 결과를 신뢰할 수 없습니다. 프로덕션 환경의 경험에 따르면, 세 가지 Grader를 조합하여 각각의 장점을 살리는 것이 가장 효과적입니다. 은탄환은 없지만, 최적의 조합은 있습니다.
Grader 1: 코드 평가기
코드 Grader
프로그램 로직으로 정오를 자동 판정합니다
| 구분 | 상세 내용 |
|---|---|
| 방법 | 문자열 매칭, 정규식, 정적 분석(AST), 단위 테스트 pass/fail, 도구 호출 검증(올바른 API와 파라미터 호출 여부) |
| 장점 | 속도 빠름(밀리초 단위), 비용 거의 없음, 완전히 객관적이고 재현 가능, CI/CD 자동화에 적합 |
| 단점 | 합리적인 변형에 지나치게 엄격(예: 변수명이 다르면 오답 처리), 의미론적 이해 부족, 주관적 품질 평가 불가 |
| 적합한 상황 | 명확한 정답이 있는 작업: 코드 컴파일 성공 여부, API 반환값 정확성, 파일 형식 준수 여부, 수학 계산 정확성 |
Grader 2: 모델 평가기 (LLM-as-Judge)
모델 Grader (LLM-as-Judge)
다른 LLM이 채점 기준에 따라 점수를 매깁니다
| 구분 | 상세 내용 |
|---|---|
| 방법 | Agent의 출력과 채점 Rubric을 심사 LLM에 함께 전달하여, 미리 설정된 기준에 따라 점수와 이유를 반환하게 합니다 |
| 장점 | 주관적 품질 평가 가능(문체, 논리성, 창의력), 자구 매칭을 넘어 의도 이해, 다양한 작업 유형에 유연하게 대응 |
| 단점 | 비용 높음(평가마다 token 소비), 채점 편향 가능성, 정교한 채점 기준 설계 필요, 결과 완전 재현 불가 |
| 적합한 상황 | 개방형 작업: 연구 보고서 품질 평가, 코드 스타일 평가, 대화 자연스러움, 요약 완성도와 정확성 |
핵심 팁: Rubric은 각 점수마다 구체적으로 정의하세요
「출력 품질을 0~1점으로 평가하라」와 같은 모호한 기준은 거의 쓸모가 없습니다. 좋은 Rubric은 다음처럼 명확해야 합니다:
0점 = 전혀 답변하지 않았거나 심각한 사실 오류 포함
0.3점 = 답변은 했지만 핵심 정보 누락
0.7점 = 완전하고 정확하지만 구성이 혼란스럽거나 중복됨
1점 = 완전하고, 정확하며, 간결하고, 구조가 명확함
0점 = 전혀 답변하지 않았거나 심각한 사실 오류 포함
0.3점 = 답변은 했지만 핵심 정보 누락
0.7점 = 완전하고 정확하지만 구성이 혼란스럽거나 중복됨
1점 = 완전하고, 정확하며, 간결하고, 구조가 명확함
Grader 3: 인간 평가기
인간 Grader
도메인 전문가가 직접 평가합니다
| 구분 | 상세 내용 |
|---|---|
| 사용 시점 | 평가 초기 채점 기준 교정, LLM 평가의 명확한 맹점 발생 시, 전문가 판단이 필요한 고위험 영역(의료, 법률, 금융) |
| 장점 | 최고 품질의 피드백, 자동화 방법의 사각지대 발견, 개선 방향에 대한 심층 인사이트 제공 |
| 단점 | 확장 불가(인간 시간 제한), 속도 느림(시간~일 단위), 비용 높음, 평가자 간 의견 불일치 |
| 적합한 상황 | 모델 Grader 정확도 주기적 점검, 새로운 도메인의 평가 기준 수립, 중요한 제품 결정의 최종 검증 |
혼합 전략: 권장 워크플로
3단계 평가 체계
1
코드 Grader로 기반 구성
모든 결정론적 시나리오를 먼저 커버합니다: 컴파일, 형식 검증, API 호출 정확성. 빠르고 저렴합니다.
2
모델 Grader로 확장
주관적 시나리오를 커버합니다: 출력 품질, 논리적 일관성, 사용자 경험. 잘 설계된 Rubric이 핵심입니다.
3
인간의 주기적 교정
모델 Grader 점수가 편향되지 않았는지 주기적으로 점검하고, 편견을 수정하여 평가 시스템의 신뢰성을 유지합니다.
핵심 논리: 코드 Grader는 최저선을 보장하고(큰 실수 방지), 모델 Grader는 상한선을 높이며(출력 품질), 인간 Grader는 심판을 교정합니다(공정성 확보). 세 가지 모두 빠질 수 없습니다.
실제 사례
Descript
동영상 편집 Agent
Descript의 평가 시스템은 세 가지 차원을 중심으로 구성되며, 각 차원을 독립적으로 채점한 후 종합 평가합니다:
손상 없음 -- 편집 후 영상 무결
올바른 실행 -- 지시 사항 정확히 수행
잘 수행 -- 전문적인 편집 품질
Bolt AI
코드 생성 Agent
Bolt AI는 세 가지 Grader 유형을 조합하여 완전한 평가 파이프라인을 구성합니다:
- 정적 분석(코드 Grader): 생성된 코드가 컴파일되고 lint를 통과하는지 확인
- 브라우저 Agent 테스트(코드 Grader): 생성된 페이지를 자동으로 열어 UI가 기대에 부합하는지 검증
- LLM Judge(모델 Grader): 코드 품질, 가독성, 모범 사례 준수 여부 평가
은탄환은 없습니다 — 세 가지 Grader를 조합하는 것이 최선입니다. 코드 Grader로 최저선을 지키고, 모델 Grader로 상한선을 높이며, 인간 Grader로 교정합니다. 이것이 여러 최고 Agent 팀에서 검증된 모범 사례입니다.