기초 원리
Base 모델: Token으로 Token을 예측하는 기계
학습 완료 후 얻는 원시 모델, 그것이 하는 일은 단 하나입니다.
학습 완료 후
얻게 되는 것은
냉정한 Token-by-Token 예측 기계입니다
이 모델이 아는 것은 단 하나입니다:
앞에 있는 모든 Token이 주어지면, 가장 가능성 높은 다음 Token을 예측합니다.
앞에 있는 모든 Token이 주어지면, 가장 가능성 높은 다음 Token을 예측합니다.
Context Token
→
확률 분포
→
샘플링
→
새 Token
→
반복
이 모델은 하지 않습니다
질문 이해 · 답변 추론 · 지식 검색
오직 확률만 보고, Token만 출력합니다.
오직 확률만 보고, Token만 출력합니다.
이것이 의미하는 바
「紫霞捧着月光宝盒,轻声问:哥哥」(쯔샤가 월광보합을 두 손에 들고 조용히 물었습니다: 오라버니…)를 입력하면,
통계적으로 가장 가능성 높은 다음 글자를 예측해 이어갑니다,
하지만 자신이 무엇을 쓰고 있는지는 알지 못합니다.
통계적으로 가장 가능성 높은 다음 글자를 예측해 이어갑니다,
하지만 자신이 무엇을 쓰고 있는지는 알지 못합니다.
Token 생성 데모
컨텍스트 (이전 Token)
紫霞
→
捧着
→
月光
→
宝盒
→
,
→
轻声
→
问
→
:
→
哥哥
이것이 Base 모델의 전부입니다: 종료 Token이 생성될 때까지 가장 높은 확률의 단어를 시퀀스 끝에 계속 추가합니다.
의도도, 기억도, 상식 판단도 없습니다. 오직 확률, 오직 Token뿐입니다.
하지만 이 단순한 루프가 모든 대형 언어 모델 능력의 근본 엔진입니다.