비용 최적화

다중 턴 대화가 왜 점점 비싸지나요?

LLM은 입력 Token 수 기준으로 과금됩니다. 매 턴마다 전체 대화 히스토리를 모델에 재전송해야 합니다. 히스토리가 길수록 Token이 많아지고 비용이 높아집니다. 슬라이더를 드래그하여 비용 누적을 시뮬레이션해 보세요.

비용 시뮬레이터
현재 대화 턴 수 1턴
이번 턴 입력 Token
이번 턴 비용
누적 총 비용
턴별 입력 구성
턴별 입력 구성 시각화 (빨간색 = 현재 턴, 회색 = 히스토리)
턴별 비용 명세
신규 Token이번 턴 입력비용
마지막 몇 턴이 왜 이렇게 비싼가요?
10번째 턴의 입력 = System Prompt + 이전 9턴의 모든 Q&A + 현재 질문. 매 턴마다 모델에 전체 대화 히스토리를 다시 전송합니다.
📈 비용은 턴 수에 따라 선형적으로 증가합니다. 다음: KV Cache가 캐싱을 통해 반복 계산 비용을 70% 이상 낮추는 방법.