Token 비용 엔지니어링 · 7 / 13

입력 주도: 62:1 I/O Ratio

일반 Chatbot은 일문일답이고, Agent는 「생각 → 행동 → 관찰 → 다시 생각」 루프예요. 핵심 인식: 매 턴 Input에 전체 히스토리가 들어갑니다—턴이 늘수록 Input이 길어지고 비용이 누적·팽창해요.

ReAct 루프입력 주도I/O Ratio누적 팽창
Chatbot vs Agent: 과금 구조가 완전히 달라요

일반 Chatbot이 「농담 하나 해줘」(10 Token)라고 물으면 답은 150 Token—I/O Ratio ≈ 1:15, 출력 주도예요. 반면 Agent가 코드 수정 작업을 하면 System Prompt·도구 반환·과거 출력을 매 턴 다시 읽어요. 세 턴이면 총 Input 16,790, 총 Output 270—I/O Ratio 62:1, 입력 주도예요.

270글자 결과를 위해 16,790글자 「읽기 요금」을 냈습니다. 이게 Agent의 입력 주도 특성이에요.
일반 Chatbot 일문일답과 Agent 루프 실행 비교
Chatbot은 한 턴으로 끝나고, Agent는 매 턴 입구에 전체 히스토리를 들고 들어가 Input이 누적·팽창해요. (그림: 저자 공유 원본)
I/O Ratio: Agent의 입력 주도 특성
코드 수정 작업 세 턴 분해: 총 Input 16,790, 총 Output 270, I/O Ratio 62:1. (그림: 저자 공유 원본)
인터랙티브 데모 · 「간단한」 작업의 실제 청구서

작업: 「이 Excel 표를 분석해서 매출 1위 제품을 찾고, 차트를 만들어 줘.」 「다음 턴」을 눌러 매 턴 누적 Input이 어떻게 불어나는지 보세요.

Excel 분석 작업 · 5턴 실행
Excel 작업의 턴별 분해와 실제 청구서
다섯 턴 누적 Input 31,460, Output 450, 합계 약 0.014–0.026위안. 주의: 이건 한 번 성공한 실행일 뿐이고, 실패 재시도·디버깅·반복의 숨은 비용이 더 있어요. (그림: 저자 공유 원본)
팽창의 수학: 왜 제곱급인가

작업이 N턴에 끝나고 System Prompt 길이가 S, 매 턴 추가(출력 + 도구 반환)가 약 Δ라고 하면, N번째 턴 Input ≈ S + Q + Δ×(N-1)이고 총 Input은 모든 턴의 합—안에 1+2+3+…+(N-1) 등차수열이 숨어 있어요. 매 턴 500 Token이 늘면 5턴 루프의 총 Input만 15,000+; 턴이 두 배가 되면 비용은 거의 네 배가 돼요.

Agent 프레임워크 (SWE-bench 실측)평균 I/O Ratio설명
단순 RAG Agent10:1 ~ 20:1검색 + 답변
OpenHands20:1 ~ 50:1코드 수정 작업
AutoGPT 계열30:1 ~ 100:1개방형 작업, 루프 많음

그래서 KV Cache(11절)가 Agent에게 결정적이에요: 매 턴 같은 접두사를 다시 읽으니, 캐시 히트 여부가 곧 5배 가격 차예요. I/O Ratio를 모니터링해야 하는 이유도 같아요—비율이 50:1을 넘으면 Agent가 「공회전」하는 경우가 많아, 흐름을 고치거나 작업을 다운그레이드해야 해요.

핵심 요점

Agent는 입력 주도예요: 매 턴 Input에 전체 히스토리가 들어가고, 총량은 턴 수의 제곱급으로 팽창해요.

한 번 실행은 싸 보여도, 규모에서 본색이 드러나요: 0.02위안 작업 × 실패 재시도 × 백만 호출이면 청구서 질식 순간이에요.

I/O Ratio를 건강 지표로 모니터하세요: >50:1이면 Agent가 공회전 중—절약보다 먼저 흐름을 점검하세요.

출처: 저자 팀 내부 공유 《AI Token 비용 엔지니어링 전략 공유》 「Agentic 앱의 과금 메커니즘」에서 정리했어요. 업계 데이터는 SWE-bench Agent Token 소비 실증 연구를 참고(마무리 절 읽기 자료). Agent 루프 원리는 실전편을 보세요.