컨텍스트 관리

로컬 압축 vs LLM 압축

컨텍스트를 압축하는 두 가지 방법이 있습니다:로컬 처리(정규식 교체, 잘라내기)는 비용이 없지만 거칠고, LLM 요약은 비용이 있지만 정확합니다. 어떻게 선택할까요? 답은 둘 다 쓰되 순서가 있습니다.

두 가지 방식 비교
항목 로컬 압축 LLM 압축
원리정규식 매칭, 문자 잘라내기, 템플릿 교체다른 LLM이 읽고 요약문을 작성
비용0원(순수 로컬 계산)유료(API 1회 호출)
지연<1ms1~5초
품질거칠며 핵심 정보 누락 가능정확하며 핵심 의미 보존
적합 시나리오도구 출력, JSON 결과, 반복 내용다중 턴 대화 요약, 복잡한 컨텍스트 압축
사례 비교:같은 대화의 두 가지 압축
로컬 압축
원본 대화(10회 · 4200 tokens):
사용자:베이징에서 상하이 가는 고속철 검색해줘(중국어 예시:帮我查北京到上海的高铁)
AI:네, 조회하겠습니다…(200자 상세 답변)
[도구] 12306 조회 결과:G1 07:00-11:28 ¥553、G3 08:00-12:35 ¥553、G7 09:00-13:28 ¥553…(총 15건, 800자)
AI:총 15개 열차 발견, G1 추천…(300자 분석)
사용자:G1 좋네요, 비즈니스석 있는지 확인해줘
[도구] 좌석 조회 결과:{json 데이터 500자}
AI:G1 비즈니스석 잔여 3매, ¥1748…(200자)
사용자:그럼 비즈니스석으로, 호텔도 검색해줘
[도구] 호텔 검색 결과…(600자)
AI:푸동 샹그릴라 추천…(400자)
사용자:이 호텔로 예약하고, 출장 체크리스트 만들어줘
압축 결과
위 버튼을 클릭하여 확인
LLM 압축
원본 대화(10회 · 4200 tokens):
(좌측과 완전히 동일한 원본 대화)
압축 결과
위 버튼을 클릭하여 확인
올바른 순서:무료 먼저, 유료 나중에
컨텍스트 압축 권장 파이프라인
1
로컬 잘라내기
도구 출력 삭제
초장문 JSON 잘라내기
2
템플릿 교체
반복 구조를
플레이스홀더로 교체
3
충분한지 확인
여전히 윈도우 초과?
다음 단계로
4
LLM 요약
비용을 들여 AI가
컨텍스트 정제
먼저 무료 방법으로 최대한 압축하고, 정말 안 될 때만 비용을 들여 AI에게 도움을 요청하세요. 이 순서를 바꿔서는 안 됩니다.로컬 압축과 LLM 압축은 파이프라인의 순차적 단계이며, 하나를 선택할 필요가 없습니다.