입력 주도: 62:1 I/O Ratio
일반 Chatbot은 일문일답이고, Agent는 「생각 → 행동 → 관찰 → 다시 생각」 루프예요. 핵심 인식: 매 턴 Input에 전체 히스토리가 들어갑니다—턴이 늘수록 Input이 길어지고 비용이 누적·팽창해요.
일반 Chatbot이 「농담 하나 해줘」(10 Token)라고 물으면 답은 150 Token—I/O Ratio ≈ 1:15, 출력 주도예요. 반면 Agent가 코드 수정 작업을 하면 System Prompt·도구 반환·과거 출력을 매 턴 다시 읽어요. 세 턴이면 총 Input 16,790, 총 Output 270—I/O Ratio 62:1, 입력 주도예요.
작업: 「이 Excel 표를 분석해서 매출 1위 제품을 찾고, 차트를 만들어 줘.」 「다음 턴」을 눌러 매 턴 누적 Input이 어떻게 불어나는지 보세요.
작업이 N턴에 끝나고 System Prompt 길이가 S, 매 턴 추가(출력 + 도구 반환)가 약 Δ라고 하면, N번째 턴 Input ≈ S + Q + Δ×(N-1)이고 총 Input은 모든 턴의 합—안에 1+2+3+…+(N-1) 등차수열이 숨어 있어요. 매 턴 500 Token이 늘면 5턴 루프의 총 Input만 15,000+; 턴이 두 배가 되면 비용은 거의 네 배가 돼요.
| Agent 프레임워크 (SWE-bench 실측) | 평균 I/O Ratio | 설명 |
|---|---|---|
| 단순 RAG Agent | 10:1 ~ 20:1 | 검색 + 답변 |
| OpenHands | 20:1 ~ 50:1 | 코드 수정 작업 |
| AutoGPT 계열 | 30:1 ~ 100:1 | 개방형 작업, 루프 많음 |
그래서 KV Cache(11절)가 Agent에게 결정적이에요: 매 턴 같은 접두사를 다시 읽으니, 캐시 히트 여부가 곧 5배 가격 차예요. I/O Ratio를 모니터링해야 하는 이유도 같아요—비율이 50:1을 넘으면 Agent가 「공회전」하는 경우가 많아, 흐름을 고치거나 작업을 다운그레이드해야 해요.
Agent는 입력 주도예요: 매 턴 Input에 전체 히스토리가 들어가고, 총량은 턴 수의 제곱급으로 팽창해요.
한 번 실행은 싸 보여도, 규모에서 본색이 드러나요: 0.02위안 작업 × 실패 재시도 × 백만 호출이면 청구서 질식 순간이에요.
I/O Ratio를 건강 지표로 모니터하세요: >50:1이면 Agent가 공회전 중—절약보다 먼저 흐름을 점검하세요.
출처: 저자 팀 내부 공유 《AI Token 비용 엔지니어링 전략 공유》 「Agentic 앱의 과금 메커니즘」에서 정리했어요. 업계 데이터는 SWE-bench Agent Token 소비 실증 연구를 참고(마무리 절 읽기 자료). Agent 루프 원리는 실전편을 보세요.