Token 비용 엔지니어링 · 3 / 13

요금표 한눈에 보기와 세 가지 티어

자주 쓰는 모델 가격을 한 표에 펼치면, 세 가지 티어가 또렷이 보입니다. 그런데 뭐가 비싸고 뭐가 싼지만 알아서는 턱없이 부족해요——진짜 비용 암살자는 가격이 뛰는 경계선에 숨어 있습니다.

T0 플래그십T1 주력T2 대량캐시 요금
요금표 전경

아래는 당시 저자 팀이 주로 쓰던 모델 가격입니다(할인 후 단가로 환산, 단위: 위안 / 백만 Token). 세 열은 비캐시 입력·캐시 입력·출력——캐시 요금이 보통 표준 요금의 1/5 이하인 점에 주목하세요. 이 거대한 격차가 곧 레슨 11 KV Cache의 복선입니다.

모델구간입력(비캐시)입력(캐시)출력
GLM-4.6
(355B A32)
Input ≤32k · Output ≤20010.24
Input ≤32k · Output >2001.50.37
Input 32k–200k20.48
Qwen3-MaxInput 0–32k1.60.326.4
Input 32k–128k3.20.6412.8
Input 128k–252k4.80.9619.2
Qwen-Plus
(235B A30)
0–128k · 비사고0.40.081
0–128k · 사고 모드0.40.084
Qwen-FlashInput 0–128k0.0750.0150.75
Input 128k–256k0.30.063
GLM-4.5V / 4.5-AirInput 0–32k103
Input 32k–64k206

빨간 숫자는 「구간 점프 후」 가격이에요. 같은 모델 안에서도 가격이 2–3배 차이——이 경계선이 레슨 4·5·6의 주인공입니다.

세 가지 티어
T0 · 플래그십

Qwen3-Max, GLM-4.6(긴 출력 구간)

출력은 비싸고, 능력 천장. 복잡한 추론·코드 생성·다중 모델 중재처럼 「틀리면 손실이 더 큰」 일에 남겨 두세요.

T1 · 주력

Qwen-Plus, GLM-4.5-Air

가성비 균형. 일상 대화·RAG 질의·요약 정리의 주력, 대부분의 요청이 이 층에 떨어져야 해요.

T2 · 대량

Qwen-Flash

거의 공짜(캐시 입력 0.015 위안/M). 데이터 정제·의도 분류·고빈도 모니터링에 마음껏, 큰 모델 「보조」에도 최적이에요.

기술을 아는 사람은 모델 파라미터를 보고, 경영을 아는 사람은 가격 사다리를 봅니다. AI 엔지니어링은 둘 다 알아야 해요.
인터랙티브 연습 · 이 작업에는 어느 티어

실제 비즈니스 시나리오 다섯 개, 가장 맞는 티어를 고르세요. 원칙: 싼 걸로 되면 비싼 걸 쓰지 말고, 틀릴 대가가 크면 아끼지 마세요.

핵심 요점

먼저 티어를 나누고 선택: T0는 난제, T1은 일상, T2는 대량. 대부분의 비용 사고는 「T0로 T2 일을 시킨」 경우예요.

캐시 요금은 표준 요금의 1/5 이하. 이 할인을 먹을 수 있는지는 아키텍처 설계에 달렸습니다(레슨 11).

같은 모델 안에서도 가격이 2–3배. 구간 점프 경계선(출력 200, 입력 32k)이 모델 선택 자체보다 더 주목할 만해요.

출처: 저자 팀 내부 공유 《AI Token 비용 엔지니어링 전략 공유》에서 정리. 표는 당시 저자의 할인 후 계약가이며, 각사 정가와 할인은 수시로 바뀌니 선택 전에 DeepSeek 요금, 알리클라우드 바이롄(百炼), 즈푸(智谱) 오픈 플랫폼의 실시간 요금을 확인하세요.