제로 챕터 · 왕초보 FAQ
AI 영상 생성은 왜 이렇게 비쌀까요?
앞 페이지에서 이미지 한 장이 0.3위안 안팎이라고 했죠. 영상은요? 초 단위로 과금돼요. 1초에 1.5~5위안 — 10초짜리 짧은 영상 하나면 AI와 수만 마디를 나눌 수 있는 돈이에요. 왜 그럴까요?
한 줄 답변
영상은 「이미지 한 장」이 아니라 초당 20여 장의 반드시 이어져야 하는 이미지들이기 때문이에요. 여기에 동기화된 소리와 합리적인 물리 운동까지 얹어야 하죠. 생성량은 이미지의 수십 배인데, 난이도는 수십 배로도 모자라요.
움직여 보기 · 여러분이 원하는 영상 뒤에는 「프레임」이 몇 장일까요
영상을 하나 생성하고 싶어요, 길이:5초
—
생성해야 하는 프레임(24프레임/초 기준)
—
같은 비용으로 채팅할 수 있는 횟수
—
대략적인 비용(위안)
가격은 2026년 8월 주류 영상 모델 API의 자릿수로 추정했어요(예: Google Veo 3 초당 $0.2~0.75, 소리 포함이면 더 비싸요. 중국의 Kling, Jimeng도 크레딧 환산 시 같은 자릿수예요). 위의 작은 네모 하나하나가 프레임이에요 — 게다가 각자 따로 그리면 안 되고, 만화책의 연속 컷처럼 빈틈없이 이어져야 해요.
어디가 비싼가 · 「그림이 많아서」만이 아니에요
프레임끼리 「서로를 기억」해야 해요
인물의 옷 색깔, 배경 속 컵, 빛의 방향이 프레임마다 달라지면 안 돼요. 모델은 수백 프레임의 내용을 동시에 「기억」하며 서로 맞춰야 해요 — 독립적으로 수백 장을 그리는 것보다 훨씬 어렵고, 초기 AI 영상에서 인물이 걷다가 「얼굴이 바뀌던」 이유이기도 해요.
물리가 합리적이어야 해요
사과는 아래로 떨어지고, 물은 낮은 곳으로 흐르고, 머리카락은 바람 따라 날려야 해요. 모델은 방대한 영상에서 물리 법칙을 「깨우쳐야」 어색해지지 않아요 — 이 능력이 훈련 비용을 가장 많이 태워요.
소리는 입 모양까지 맞아야 해요
새 세대 모델(Veo 3, Sora 2 등)은 더빙과 효과음까지 바로 생성해요. 입 모양, 발소리, 환경음이 모두 화면과 동기화돼야 하죠 — 영상과 오디오 두 가지 일을 동시에 하는 셈이라, 「소리 포함」 가격이 「무음」보다 한 단계 비싸요.
좋은 소식은: 이 가격은 계속 내려가고 있다는 거예요. 불과 2년 전만 해도 같은 품질의 영상이 몇 배는 더 비쌌어요. 순서도 기억해 둘 만해요: 먼저 저렴한 텍스트로 대본을 다듬고, 그다음 0.3위안짜리 이미지로 화면 느낌을 확정하고, 마지막에야 초 단위 과금인 영상을 돌리는 것 — 전문 팀들이 다 이렇게 아껴요.
✅ 이 페이지에서 나누고 싶은 것
- 영상은 초 단위 과금: 1초에 1.5~5위안, 10초 ≈ 채팅 수만 번
- 비싼 이유의 본질: 초당 20여 프레임 × 프레임 간 연속성 × 물리 합리성 × 음성·화면 동기화
- 절약 순서: 텍스트로 대본 다듬기 → 이미지로 화면 정하기 → 마지막에 영상 생성
- 추세는 좋아요: 가격은 해마다 내려가요. 오늘의 「비쌈」은 일시적이에요