완성에서 대화로

Chat Template + SFT: 대형 모델이 드디어 "말"을 배우다

완성 기계에서 대화 어시스턴트로, 차이는 바로 이 훈련 패러다임입니다.

OpenAI가 형식을 규정하고, 그 형식에 특화하여 모델을 재훈련했더니, 대형 모델이 진짜로 대화를 할 수 있게 되었습니다
완성에서 대화로의 진화
1
대화 형식 표준화 (Chat Template)
Jinja 템플릿 언어를 참고하여 special token 정의: <|im_start|> / <|im_end|> 로 각 메시지를 감쌈
2
형식에 따라 모든 메시지 조합
system / user / assistant 세 가지 역할을 줄바꿈 없이 하나의 텍스트로 연결하여 모델에 전달
3
SFT (지도 미세조정)
대량의 "형식화된 대화 데이터"로 계속 훈련하여 모델이 이 형식 하에서 어시스턴트 역할을 배우고, 더 이상 단순히 텍스트를 이어쓰지 않도록 합니다
4
규모 확장 (Scale Up)
모델은 점점 커지고, 훈련 데이터도 더 많아집니다: GPT-3 → ChatGPT → GPT-4, 성능이 기하급수적으로 향상
Chat Template vs. SFT 비교
클릭하여 관점 전환
<|im_start|>system← 시스템 Prompt 역할 마커 당신은 도움이 되는 AI 어시스턴트입니다.← System Prompt 내용 <|im_end|>← 종료 마커
<|im_start|>user← 사용자 메시지 시작 紫霞仙子是谁?(쯔샤 선녀는 누구인가요?) <|im_end|>
<|im_start|>assistant← 모델이 여기서부터 완성 시작 (모델 완성 영역)← SFT가 여기서 출력 방법을 훈련 <|im_end|>
SFT 이전 (Base 모델)
사용자: 紫霞仙子是谁?(쯔샤 선녀는 누구인가요?)
紫霞仙子是哥哥,哥哥你喜欢我,你说你喜欢我…
(학습 데이터의 문체로 계속 이어씀 — 질문에 답하는 것과 전혀 다름; 중국어 예시는 의도적으로 보존됨)
SFT 이후 (Chat 모델)
사용자: 紫霞仙子是谁?(쯔샤 선녀는 누구인가요?)
쯔샤 선녀(紫霞仙子)는 영화 《서유기》에 등장하는 인물로, 아테나 추(朱茵)가 연기했습니다. 그녀는 지존보의 운명적인 사랑으로, 그를 위해 모든 것을 희생했습니다.
(무엇이 답변인지 이해하고, 어시스턴트로서 응답함)
SFT(Supervised Fine-Tuning)는 본질적으로 여전히 Token 예측입니다. 달라진 것은 훈련 데이터가 "형식화된 대화 + 고품질 답변"으로 바뀐 것입니다.
모델은 <|im_start|>assistant 이후에 제대로 된 답변을 출력하는 법을 배우고, 더 이상 학습 데이터를 단순히 이어쓰지 않습니다.
이 순간, "완성 기계"가 "대화 어시스턴트"로 진화했습니다