요금표 한눈에 보기와 세 가지 티어
자주 쓰는 모델 가격을 한 표에 펼치면, 세 가지 티어가 또렷이 보입니다. 그런데 뭐가 비싸고 뭐가 싼지만 알아서는 턱없이 부족해요——진짜 비용 암살자는 가격이 뛰는 경계선에 숨어 있습니다.
아래는 당시 저자 팀이 주로 쓰던 모델 가격입니다(할인 후 단가로 환산, 단위: 위안 / 백만 Token). 세 열은 비캐시 입력·캐시 입력·출력——캐시 요금이 보통 표준 요금의 1/5 이하인 점에 주목하세요. 이 거대한 격차가 곧 레슨 11 KV Cache의 복선입니다.
| 모델 | 구간 | 입력(비캐시) | 입력(캐시) | 출력 |
|---|---|---|---|---|
| GLM-4.6 (355B A32) | Input ≤32k · Output ≤200 | 1 | 0.2 | 4 |
| Input ≤32k · Output >200 | 1.5 | 0.3 | 7 | |
| Input 32k–200k | 2 | 0.4 | 8 | |
| Qwen3-Max | Input 0–32k | 1.6 | 0.32 | 6.4 |
| Input 32k–128k | 3.2 | 0.64 | 12.8 | |
| Input 128k–252k | 4.8 | 0.96 | 19.2 | |
| Qwen-Plus (235B A30) | 0–128k · 비사고 | 0.4 | 0.08 | 1 |
| 0–128k · 사고 모드 | 0.4 | 0.08 | 4 | |
| Qwen-Flash | Input 0–128k | 0.075 | 0.015 | 0.75 |
| Input 128k–256k | 0.3 | 0.06 | 3 | |
| GLM-4.5V / 4.5-Air | Input 0–32k | 1 | 0 | 3 |
| Input 32k–64k | 2 | 0 | 6 |
빨간 숫자는 「구간 점프 후」 가격이에요. 같은 모델 안에서도 가격이 2–3배 차이——이 경계선이 레슨 4·5·6의 주인공입니다.
Qwen3-Max, GLM-4.6(긴 출력 구간)
출력은 비싸고, 능력 천장. 복잡한 추론·코드 생성·다중 모델 중재처럼 「틀리면 손실이 더 큰」 일에 남겨 두세요.
Qwen-Plus, GLM-4.5-Air
가성비 균형. 일상 대화·RAG 질의·요약 정리의 주력, 대부분의 요청이 이 층에 떨어져야 해요.
Qwen-Flash
거의 공짜(캐시 입력 0.015 위안/M). 데이터 정제·의도 분류·고빈도 모니터링에 마음껏, 큰 모델 「보조」에도 최적이에요.
실제 비즈니스 시나리오 다섯 개, 가장 맞는 티어를 고르세요. 원칙: 싼 걸로 되면 비싼 걸 쓰지 말고, 틀릴 대가가 크면 아끼지 마세요.
먼저 티어를 나누고 선택: T0는 난제, T1은 일상, T2는 대량. 대부분의 비용 사고는 「T0로 T2 일을 시킨」 경우예요.
캐시 요금은 표준 요금의 1/5 이하. 이 할인을 먹을 수 있는지는 아키텍처 설계에 달렸습니다(레슨 11).
같은 모델 안에서도 가격이 2–3배. 구간 점프 경계선(출력 200, 입력 32k)이 모델 선택 자체보다 더 주목할 만해요.
출처: 저자 팀 내부 공유 《AI Token 비용 엔지니어링 전략 공유》에서 정리. 표는 당시 저자의 할인 후 계약가이며, 각사 정가와 할인은 수시로 바뀌니 선택 전에 DeepSeek 요금, 알리클라우드 바이롄(百炼), 즈푸(智谱) 오픈 플랫폼의 실시간 요금을 확인하세요.