편 요약
정리 (상) · LLM이란? + 환각
제1편 · 복습 및 정리 · 상반부: LLM 기초 — 무엇인지, 왜 환각이 발생하는지.
1 · LLM이란?
LLM이란?
반드시 갖춰야 할 3가지 핵심 인식
학습의 본질
LLM = 초대형 확률 예측 기계
학습 = 방대한 텍스트에서 다음 Token을 반복적으로 예측. 파라미터는 통계적 패턴을 기억할 뿐, 이해를 하지 않습니다. 추론 시 파라미터는 동결되며 조건부 확률 계산만 수행합니다.
P( 다음 Token | 모든 알려진 Token )
Token & Context Window
Token ≠ 글자 · Context Window는 "작업 공간"
중문 글자 1개는 약 1-2 Token, 영어 단어 1개는 약 1 Token입니다. Context Window가 모델이 볼 수 있는 양을 결정합니다. 초과하면 잘리고 영구적으로 사라집니다.
현재 주요 윈도우 크기: Qwen 3.6 (1M), Kimi K2.5 (200K), Claude 4.6 (200K), GPT-5.4 (128K)
현재 주요 윈도우 크기: Qwen 3.6 (1M), Kimi K2.5 (200K), Claude 4.6 (200K), GPT-5.4 (128K)
발전 경로
3단계: Base → SFT → Chat
Base Model(텍스트 이어쓰기) → SFT 지시 파인튜닝(대화 형식 학습) → Chat API(다단계 대화 시뮬레이션).
API를 호출할 때마다 본질적으로 정교하게 설계된 Message List를 구성하여 모델이 원하는 내용을 이어쓰게 하는 것입니다.
API를 호출할 때마다 본질적으로 정교하게 설계된 Message List를 구성하여 모델이 원하는 내용을 이어쓰게 하는 것입니다.
[system] + [user/assistant …] + [user_now]
2 · 환각: LLM의 선천적 한계
환각: LLM의 선천적 한계
제거 불가, 완화만 가능
사실적 환각
존재하지 않는 사실, 데이터, 인용 조작
출처 환각
존재하지 않는 논문/링크/저자 인용
추론 환각
전제는 맞지만 추론 단계에서 오류
코드 환각
존재하지 않는 API / 함수 호출
근본 원인 1
파라미터 지식 오류
학습 데이터에 원래 잘못된 정보가 포함되어 있었으며, 지식 마감일 이후의 내용은 알 수 없습니다.
근본 원인 2
컨텍스트 이해 편차
Prompt가 불명확하면 모델은 의도를 추측할 수밖에 없습니다. 컨텍스트가 모순될 때 항상 가장 가능성 높은 이어쓰기를 선택하지만, 가장 가능성 높은 것이 가장 정확한 것과 같지 않습니다.
핵심 인식
→ 환각은 완전히 제거할 수 없습니다 — 확률 예측의 필연적 산물이기 때문입니다
→ PreTraining 후 파라미터가 동결되어 지식을 자동 업데이트할 수 없습니다 — 이것이 환각의 근본 원인입니다
→ 올바른 접근법: 공학적 수단으로 완화하세요 — 모델이 더 똑똑해지면 환각이 저절로 사라질 것이라 기대하지 마세요