제로 챕터 · 왕초보 FAQ

「벤치마크 1위」 모델이, 왜 써 보면 별로일까요?

「새 모델이 순위표를 휩쓸었다」는 뉴스를 보고 신나서 바꿨는데, 주간 보고서를 쓰니 예전만 못해요. 여러분이 잘못 쓴 것도, 순위표가 조작된 것도 아니에요. 다만 순위표가 재는 것과 여러분이 원하는 것이, 처음부터 맞춰진 적이 없었을 뿐이에요.

한 줄 답변

순위표가 재는 건 시험이고, 여러분이 원하는 건 이에요. 문제집은 외워질 수 있고, 시험 범위에 여러분의 장면이 없을 수도 있어요. 벤치마크 점수는 참고만 하면 돼요. 모델을 고르는 가장 확실한 방법은 자기 일로 직접 시험해 보는 것이에요.

반전 데모 · 고득점자는 누구에게 졌을까요

아래는 가상의 모델 두 개예요. A는 벤치마크 95점, B는 88점. 순위표대로라면 당연히 A를 고르겠죠. 하지만 잠깐, 아래 실제 과제 세 개를 눌러 각각의 실력을 보세요.

모델 A

95점
순위표 상위권, 뉴스의 단골

모델 B

88점
순위표 성적은 평범, 보도도 없음
과제 세 개를 다 시험해 봤어요. 결론은 이미 나와 있어요: 95점과 88점의 차이는 일상 일에서는 거의 안 느껴질 수도 있고, 오히려 뒤집힐 수도 있어요. 점수가 매기는 건 시험장 좌석이고, 일을 잘하는지는 직접 써 봐야 알아요.
왜 이럴까요 · 이유 세 가지
📖

순위 올리기

순위표 문제집이 인터넷에 오래 돌다 보면, 모델의 학습 데이터에 섞여 들어가기 마련이에요. 시험 전에 답을 외운 셈이죠: 점수는 예쁜데, 실력은 그만큼이 아니에요. 업계에는 점잖은 이름이 있어요. 「데이터 오염」이라고요.

🎯

시험에 과적합

업체는 사람들이 순위를 본다는 걸 아니까, 시험 포인트에 맞춰 최적화해요. 입시 교육의 「문제 풀이 고수」와 같아요: 시험 점수는 최상위인데, 일상 대화와 손재주는 오히려 희생될 수 있어요.

🗺️

시험 범위에 여러분의 장면이 없어요

순위표는 수학, 코드, 지식 Q&A를 보지만, 「당신네 업종을 아는지」는 안 보고, 「사람을 위로하는지」도 안 봐요. 여러분이 가장 신경 쓰는 그 과목이, 시험 범위에 아예 없을 수도 있어요.

어떤 순위가 비교적 믿을 만할까요 · 사람 블라인드 테스트를 보세요

비교적 믿을 만한 순위도 있어요: 사람이 하는 블라인드 투표. 모델 두 개의 답을 나란히 놓고 이름을 가린 뒤, 실제 사용자 다수가 어느 쪽이 나은지 투표해요. 이런 순위는 외울 고정 문제집이 없고, 채점관이 살아 있는 사람이라, 순위를 올리기가 훨씬 어려워요.

하지만 이것도 「비교적」 믿을 만한 수준일 뿐이에요. 투표하는 사람이 여러분과 같은 일을 한다는 보장은 없고, 대중이 좋다고 느끼는 답변 스타일이 여러분의 장면에 맞지도 않을 수 있어요. 중국 모델이 여러 실제 장면에서 어떻게 나오는지가 궁금하면, 중국 모델 고르기 페이지로 가 보세요.

직접 고르는 법 · 나만의 문제집을 만드세요

가장 믿을 만한 평가 기관은 여러분 자신이에요. 방법은 투박하지만 아주 잘 먹혀요: 자기 일에서 실제 질문 10개를 모아 문서 하나로 저장하세요. 모델을 바꾸고 싶을 때마다 10문제를 한 바퀴 돌리면, 쓸 만한지 한눈에 보여요.

나만의 문제집 모으는 법(예시)

이 문제집에는 숨은 이점도 있어요: AI에게 대체 뭘 시켜야 하는지 생각하게 만들어요. 모델을 석 달이나 바꿔 놓고, 진짜 문제는 프롬프트가 허술했다는 걸 나중에야 아는 사람이 많아요. 문제집만 있으면 모델 교체 결론이 5분이면 나요. 더 이상 뉴스를 쫓아다닐 필요가 없어요.

✅ 이 페이지에서 나누고 싶은 것