강좌 피날레

요약 (하) · 비용 최적화 + PM 관점

2장 복습 · 2페이지 중 2페이지: 5층 비용 최적화 체계와 AI PM이 가져가는 완전한 엔지니어링 관점.

Part 3 · 비용 최적화
💰
III. 5층 비용 최적화 체계
복합 적용 시 Token 비용 70–90% 절감 가능
모델 라우팅 단순 작업은 경량 모델(분류, 추출) 사용; 복잡한 추론에만 플래그십 모델 사용 60-80% 절감
구문 레이어 JSON 대신 YAML(15-30% 절감), 배열 대신 CSV(40%+ 절감), Markdown 장식 제거 15-40% 절감
의미 레이어 동적 Few-Shot 벡터 매칭(87% 절감), LLMLingua-2로 긴 문서 압축(60% 절감), 핵심 정보는 처음/끝에 배치 60-87% 절감
출력 레이어 부정적 제약(불필요한 내용 정밀 제거), Diff 편집(변경 부분만 출력), Stop Sequence(적시 중단) 20-50% 절감
KV Cache 고정된 System Prompt 접두사 → 높은 캐시 적중률; 동적 타임스탬프 회피(매번 다름 = 항상 MISS) 30-60% 절감
❌ 동적 타임스탬프
매번 다른 접두사
System Prompt에 "현재 시간: {time}" 포함 시 매 요청마다 접두사 변경 → KV Cache 항상 MISS
✅ 정적 접두사
접두사 불변, 안정적 캐시
시간은 user message에, system에는 넣지 않음; System Prompt 고정 유지 → 지속적 HIT
Part 4 · AI PM 통합 관점
🎯
IV. AI PM 통합 관점
기초부터 엔지니어링까지—완전한 관점
🖼️
이미지 Token 비용
해상도 ≠ 품질. 거친 분류는 512px로 충분, OCR은 1K–2K, 고정밀 감지에만 4K. 작업별 매칭으로 이미지 비용 60–90% 절감 가능.
🛡️
Prompt 보안
4가지 공격 유형: 권한 초과 주입 / 역할 탈출 / Few-Shot 오염 / 기호 주입. 4층 방어: 입력 필터링 + 권한 계층화 + 출력 검증 + 감사 로그.
📊
멀티턴 대화 비용
매 턴마다 전체 히스토리 포함 → 비용 지수적 증가. 적극적 컨텍스트 압축과 히스토리 관리 전략이 필수입니다.
🔄
스트리밍 출력
Markdown과 XML은 스트리밍 친화적; JSON/YAML은 전체 응답을 기다려야 파싱 가능. 형식 선택이 사용자 경험과 엔지니어링 복잡도에 영향을 미칩니다.
두 챕터의 궁극적 결론
AI Harness의 본질은 모든 Message를 세심하게 설계하는 것입니다. 컨텍스트 관리부터 비용 최적화까지, 모든 것은 모델에게 보내는 Message List를 설계하는 것입니다.
당신이 마스터한 능력
LLM 원리 이해 환각 식별 및 완화 Prompt 설계 출력 형식 평가 Agent 아키텍처 계획 체계적 비용 절감 Prompt 공격 방어
2장 완료 · AI Harness 완전 학습 완료를 축하드립니다 · 기초 인식부터 엔지니어링 구현까지, AI PM의 핵심 관점을 갖추셨습니다.