기초 원리
1. 원시 말뭉치
LLM 학습의 첫 번째 단계: 인간이 제공한 방대한 텍스트 데이터를 읽어들입니다.
다음: 텍스트 토큰화
전역 Token 연관 가중치 행렬
(
)
약한 연관
강한 연관
哥哥
→
?
재샘플링
Temperature
0.70
Top-P
0.90
후보 Token 확률 분포