컨텍스트 관리
로컬 압축 vs LLM 압축
컨텍스트를 압축하는 두 가지 방법이 있습니다:로컬 처리(정규식 교체, 잘라내기)는 비용이 없지만 거칠고, LLM 요약은 비용이 있지만 정확합니다. 어떻게 선택할까요? 답은 둘 다 쓰되 순서가 있습니다.
두 가지 방식 비교
| 항목 | 로컬 압축 | LLM 압축 |
|---|---|---|
| 원리 | 정규식 매칭, 문자 잘라내기, 템플릿 교체 | 다른 LLM이 읽고 요약문을 작성 |
| 비용 | 0원(순수 로컬 계산) | 유료(API 1회 호출) |
| 지연 | <1ms | 1~5초 |
| 품질 | 거칠며 핵심 정보 누락 가능 | 정확하며 핵심 의미 보존 |
| 적합 시나리오 | 도구 출력, JSON 결과, 반복 내용 | 다중 턴 대화 요약, 복잡한 컨텍스트 압축 |
사례 비교:같은 대화의 두 가지 압축
로컬 압축
원본 대화(10회 · 4200 tokens):
사용자:베이징에서 상하이 가는 고속철 검색해줘(중국어 예시:帮我查北京到上海的高铁)
AI:네, 조회하겠습니다…(200자 상세 답변)
[도구] 12306 조회 결과:G1 07:00-11:28 ¥553、G3 08:00-12:35 ¥553、G7 09:00-13:28 ¥553…(총 15건, 800자)
AI:총 15개 열차 발견, G1 추천…(300자 분석)
사용자:G1 좋네요, 비즈니스석 있는지 확인해줘
[도구] 좌석 조회 결과:{json 데이터 500자}
AI:G1 비즈니스석 잔여 3매, ¥1748…(200자)
사용자:그럼 비즈니스석으로, 호텔도 검색해줘
[도구] 호텔 검색 결과…(600자)
AI:푸동 샹그릴라 추천…(400자)
사용자:이 호텔로 예약하고, 출장 체크리스트 만들어줘
사용자:베이징에서 상하이 가는 고속철 검색해줘(중국어 예시:帮我查北京到上海的高铁)
AI:네, 조회하겠습니다…(200자 상세 답변)
[도구] 12306 조회 결과:G1 07:00-11:28 ¥553、G3 08:00-12:35 ¥553、G7 09:00-13:28 ¥553…(총 15건, 800자)
AI:총 15개 열차 발견, G1 추천…(300자 분석)
사용자:G1 좋네요, 비즈니스석 있는지 확인해줘
[도구] 좌석 조회 결과:{json 데이터 500자}
AI:G1 비즈니스석 잔여 3매, ¥1748…(200자)
사용자:그럼 비즈니스석으로, 호텔도 검색해줘
[도구] 호텔 검색 결과…(600자)
AI:푸동 샹그릴라 추천…(400자)
사용자:이 호텔로 예약하고, 출장 체크리스트 만들어줘
압축 결과
위 버튼을 클릭하여 확인
LLM 압축
원본 대화(10회 · 4200 tokens):
(좌측과 완전히 동일한 원본 대화)
(좌측과 완전히 동일한 원본 대화)
압축 결과
위 버튼을 클릭하여 확인
올바른 순서:무료 먼저, 유료 나중에
컨텍스트 압축 권장 파이프라인
1
로컬 잘라내기
도구 출력 삭제
초장문 JSON 잘라내기
초장문 JSON 잘라내기
→
2
템플릿 교체
반복 구조를
플레이스홀더로 교체
플레이스홀더로 교체
→
3
충분한지 확인
여전히 윈도우 초과?
다음 단계로
다음 단계로
→
4
LLM 요약
비용을 들여 AI가
컨텍스트 정제
컨텍스트 정제
먼저 무료 방법으로 최대한 압축하고, 정말 안 될 때만 비용을 들여 AI에게 도움을 요청하세요. 이 순서를 바꿔서는 안 됩니다.로컬 압축과 LLM 압축은 파이프라인의 순차적 단계이며, 하나를 선택할 필요가 없습니다.