환각과 대응
RAG의 비용과 최적화 전략
RAG 쿼리마다 추가 비용이 발생합니다. 최적화하지 않으면 사용량이 늘어날수록 비용이 빠르게 제어 불능 상태가 됩니다.
추가 비용 발생 원인
문서 벡터화
낮음(1회성)
Embedding을 DB에 저장할 때 한 번 실행, 이후 재사용
질문 벡터화
낮음
쿼리당 약 0.1위안/백만 Token
벡터 검색
중간
대규모 지식 베이스에서 지연이 현저히 증가
Prompt 증가
높음
매 요청마다 500–2000 Token 추가 주입, LLM 비용 2배 증가 ⚠
가장 핵심적인 최적화: 먼저 의도를 파악하여 RAG가 필요한지 판단합니다. 대화의 70%는 사실 문서 검색이 필요 없습니다. LLM을 직접 사용하는 것이 더 빠르고 저렴합니다.
PM 대응 전략
검색 명중률 평가 시스템 구축: 몇 개의 질문이 올바른 문서를 성공적으로 검색했는지 파악합니다
인용 출처 강제 표시: 사용자가 검증할 수 있게 하고, 지식 베이스 품질 향상을 촉진합니다
정기적인 지식 베이스 정리: RAG 품질 상한 = 지식 베이스 품질
네 가지 최적화 전략 (클릭하여 펼치기)
키워드 트리거 (필터링)
비용 절감: 30–70% 쿼리 스킵
먼저 질문에 검색이 필요한지 판단합니다. "오늘 며칠이에요?"는 문서를 검색할 필요 없이 바로 답합니다. "환불 정책이 어떻게 되나요?"는 RAG를 트리거합니다.
구현: 의도 분류기 또는 간단한 규칙으로 사전 판단하여 불필요한 검색 경로를 건너뜁니다.
구현: 의도 분류기 또는 간단한 규칙으로 사전 판단하여 불필요한 검색 경로를 건너뜁니다.
모델 라우팅 (단계적 처리)
전체 LLM 비용 60–80% 절감
간단한 질문은 소형 모델(저렴), 복잡한 질문에만 플래그십 모델을 사용합니다. "안녕하세요"에 GPT-4를 쓰는 낭비를 방지합니다.
구현: 질문 복잡도 분류 + 모델 계층 설정 (소형 모델 기본, 대형 모델 필요시 호출).
구현: 질문 복잡도 분류 + 모델 계층 설정 (소형 모델 기본, 대형 모델 필요시 호출).
시맨틱 캐싱
고빈도 쿼리 지연·비용 50% 절감
유사한 질문은 동일한 검색 결과를 재사용합니다. "환불 정책"과 "환불 방법"의 결과는 거의 동일하여 중복 검색이 불필요합니다.
구현: 질문 벡터 유사도 ≥ 0.95이면 캐시를 바로 반환하여 전체 RAG 경로를 건너뜁니다.
구현: 질문 벡터 유사도 ≥ 0.95이면 캐시를 바로 반환하여 전체 RAG 경로를 건너뜁니다.
정밀 청킹 (Chunking 전략)
정확도 20–40% 향상
문서 분할 단위가 검색 품질에 영향을 미칩니다. 너무 크면 불필요한 Token이 주입되고, 너무 작으면 맥락이 손실됩니다.
베스트 프랙티스: 512–800 Token/청크, 제목/단락 경계를 기준으로 의미적 완정성을 유지합니다.
베스트 프랙티스: 512–800 Token/청크, 제목/단락 경계를 기준으로 의미적 완정성을 유지합니다.