편 요약

정리 (상) · LLM이란? + 환각

제1편 · 복습 및 정리 · 상반부: LLM 기초 — 무엇인지, 왜 환각이 발생하는지.

1 · LLM이란?
🧠
LLM이란?
반드시 갖춰야 할 3가지 핵심 인식
학습의 본질
LLM = 초대형 확률 예측 기계
학습 = 방대한 텍스트에서 다음 Token을 반복적으로 예측. 파라미터는 통계적 패턴을 기억할 뿐, 이해를 하지 않습니다. 추론 시 파라미터는 동결되며 조건부 확률 계산만 수행합니다.
P( 다음 Token | 모든 알려진 Token )
Token & Context Window
Token ≠ 글자 · Context Window는 "작업 공간"
중문 글자 1개는 약 1-2 Token, 영어 단어 1개는 약 1 Token입니다. Context Window가 모델이 볼 수 있는 양을 결정합니다. 초과하면 잘리고 영구적으로 사라집니다.

현재 주요 윈도우 크기: Qwen 3.6 (1M), Kimi K2.5 (200K), Claude 4.6 (200K), GPT-5.4 (128K)
발전 경로
3단계: Base → SFT → Chat
Base Model(텍스트 이어쓰기) → SFT 지시 파인튜닝(대화 형식 학습) → Chat API(다단계 대화 시뮬레이션).

API를 호출할 때마다 본질적으로 정교하게 설계된 Message List를 구성하여 모델이 원하는 내용을 이어쓰게 하는 것입니다.
[system] + [user/assistant …] + [user_now]
2 · 환각: LLM의 선천적 한계
👻
환각: LLM의 선천적 한계
제거 불가, 완화만 가능
사실적 환각
존재하지 않는 사실, 데이터, 인용 조작
출처 환각
존재하지 않는 논문/링크/저자 인용
추론 환각
전제는 맞지만 추론 단계에서 오류
코드 환각
존재하지 않는 API / 함수 호출
근본 원인 1
파라미터 지식 오류
학습 데이터에 원래 잘못된 정보가 포함되어 있었으며, 지식 마감일 이후의 내용은 알 수 없습니다.
근본 원인 2
컨텍스트 이해 편차
Prompt가 불명확하면 모델은 의도를 추측할 수밖에 없습니다. 컨텍스트가 모순될 때 항상 가장 가능성 높은 이어쓰기를 선택하지만, 가장 가능성 높은 것이 가장 정확한 것과 같지 않습니다.
핵심 인식
→ 환각은 완전히 제거할 수 없습니다 — 확률 예측의 필연적 산물이기 때문입니다
→ PreTraining 후 파라미터가 동결되어 지식을 자동 업데이트할 수 없습니다 — 이것이 환각의 근본 원인입니다
→ 올바른 접근법: 공학적 수단으로 완화하세요 — 모델이 더 똑똑해지면 환각이 저절로 사라질 것이라 기대하지 마세요