「벤치마크 1위」 모델이, 왜 써 보면 별로일까요?
「새 모델이 순위표를 휩쓸었다」는 뉴스를 보고 신나서 바꿨는데, 주간 보고서를 쓰니 예전만 못해요. 여러분이 잘못 쓴 것도, 순위표가 조작된 것도 아니에요. 다만 순위표가 재는 것과 여러분이 원하는 것이, 처음부터 맞춰진 적이 없었을 뿐이에요.
순위표가 재는 건 시험이고, 여러분이 원하는 건 일이에요. 문제집은 외워질 수 있고, 시험 범위에 여러분의 장면이 없을 수도 있어요. 벤치마크 점수는 참고만 하면 돼요. 모델을 고르는 가장 확실한 방법은 자기 일로 직접 시험해 보는 것이에요.
아래는 가상의 모델 두 개예요. A는 벤치마크 95점, B는 88점. 순위표대로라면 당연히 A를 고르겠죠. 하지만 잠깐, 아래 실제 과제 세 개를 눌러 각각의 실력을 보세요.
모델 A
95점모델 B
88점순위 올리기
순위표 문제집이 인터넷에 오래 돌다 보면, 모델의 학습 데이터에 섞여 들어가기 마련이에요. 시험 전에 답을 외운 셈이죠: 점수는 예쁜데, 실력은 그만큼이 아니에요. 업계에는 점잖은 이름이 있어요. 「데이터 오염」이라고요.
시험에 과적합
업체는 사람들이 순위를 본다는 걸 아니까, 시험 포인트에 맞춰 최적화해요. 입시 교육의 「문제 풀이 고수」와 같아요: 시험 점수는 최상위인데, 일상 대화와 손재주는 오히려 희생될 수 있어요.
시험 범위에 여러분의 장면이 없어요
순위표는 수학, 코드, 지식 Q&A를 보지만, 「당신네 업종을 아는지」는 안 보고, 「사람을 위로하는지」도 안 봐요. 여러분이 가장 신경 쓰는 그 과목이, 시험 범위에 아예 없을 수도 있어요.
비교적 믿을 만한 순위도 있어요: 사람이 하는 블라인드 투표. 모델 두 개의 답을 나란히 놓고 이름을 가린 뒤, 실제 사용자 다수가 어느 쪽이 나은지 투표해요. 이런 순위는 외울 고정 문제집이 없고, 채점관이 살아 있는 사람이라, 순위를 올리기가 훨씬 어려워요.
하지만 이것도 「비교적」 믿을 만한 수준일 뿐이에요. 투표하는 사람이 여러분과 같은 일을 한다는 보장은 없고, 대중이 좋다고 느끼는 답변 스타일이 여러분의 장면에 맞지도 않을 수 있어요. 중국 모델이 여러 실제 장면에서 어떻게 나오는지가 궁금하면, 중국 모델 고르기 페이지로 가 보세요.
가장 믿을 만한 평가 기관은 여러분 자신이에요. 방법은 투박하지만 아주 잘 먹혀요: 자기 일에서 실제 질문 10개를 모아 문서 하나로 저장하세요. 모델을 바꾸고 싶을 때마다 10문제를 한 바퀴 돌리면, 쓸 만한지 한눈에 보여요.
나만의 문제집 모으는 법(예시)
- 가장 자주 하는 일을 고르세요: 주간 보고서, 기획안, 메일. 매주 하는 일 3가지를 고르면 돼요
- 가장 전문적인 일을 고르세요: 업계 은어와 내부 맥락이 들어간 질문으로, 당신 업종을 아는지 시험하세요
- 예전에 사고 친 일을 고르세요: AI가 이미 망친 질문일수록, 새 모델의 실력을 가장 잘 가려요
- 쉬운 점수 주는 문제 하나, 까다로운 문제 하나를 남겨 두세요: 쉬운 문제도 못 하면 바로 탈락, 까다로운 문제는 격차를 벌리는 용도예요
- 답이 좋은지는 여러분이 정해요: 「제출해도 되는」 출력이 어떤 건지, 어떤 순위표보다 여러분이 더 잘 알아요
✅ 이 페이지에서 나누고 싶은 것
- 벤치마크는 입학시험이고, 여러분이 원하는 건 수습 기간의 실력이에요: 둘은 관련이 있지만, 그 관련은 제한적이에요
- 고득점은 문제를 외운 결과일 수 있어요: 문제집은 학습 데이터로 새어 들어가고, 시험 포인트는 핀포인트로 최적화돼요
- 사람 블라인드 투표 순위는 비교적 믿을 만해요: 고정 문제집이 없고, 채점관이 살아 있는 사람이에요
- 나만의 열 문제짜리 시험지를 만드세요: 모델을 바꿀 때 한 바퀴 돌리면 5분이면 결론이 나요. 뉴스를 쫓는 것보다 쓸모있어요