제로 챕터 · 왕초보 FAQ

AI 영상 생성은 왜 이렇게 비쌀까요?

앞 페이지에서 이미지 한 장이 0.3위안 안팎이라고 했죠. 영상은요? 초 단위로 과금돼요. 1초에 1.5~5위안 — 10초짜리 짧은 영상 하나면 AI와 수만 마디를 나눌 수 있는 돈이에요. 왜 그럴까요?

한 줄 답변

영상은 「이미지 한 장」이 아니라 초당 20여 장의 반드시 이어져야 하는 이미지들이기 때문이에요. 여기에 동기화된 소리와 합리적인 물리 운동까지 얹어야 하죠. 생성량은 이미지의 수십 배인데, 난이도는 수십 배로도 모자라요.

움직여 보기 · 여러분이 원하는 영상 뒤에는 「프레임」이 몇 장일까요
영상을 하나 생성하고 싶어요, 길이:5초
생성해야 하는 프레임(24프레임/초 기준)
같은 비용으로 채팅할 수 있는 횟수
대략적인 비용(위안)
가격은 2026년 8월 주류 영상 모델 API의 자릿수로 추정했어요(예: Google Veo 3 초당 $0.2~0.75, 소리 포함이면 더 비싸요. 중국의 Kling, Jimeng도 크레딧 환산 시 같은 자릿수예요). 위의 작은 네모 하나하나가 프레임이에요 — 게다가 각자 따로 그리면 안 되고, 만화책의 연속 컷처럼 빈틈없이 이어져야 해요.
어디가 비싼가 · 「그림이 많아서」만이 아니에요
🎞️

프레임끼리 「서로를 기억」해야 해요

인물의 옷 색깔, 배경 속 컵, 빛의 방향이 프레임마다 달라지면 안 돼요. 모델은 수백 프레임의 내용을 동시에 「기억」하며 서로 맞춰야 해요 — 독립적으로 수백 장을 그리는 것보다 훨씬 어렵고, 초기 AI 영상에서 인물이 걷다가 「얼굴이 바뀌던」 이유이기도 해요.

🍎

물리가 합리적이어야 해요

사과는 아래로 떨어지고, 물은 낮은 곳으로 흐르고, 머리카락은 바람 따라 날려야 해요. 모델은 방대한 영상에서 물리 법칙을 「깨우쳐야」 어색해지지 않아요 — 이 능력이 훈련 비용을 가장 많이 태워요.

🔊

소리는 입 모양까지 맞아야 해요

새 세대 모델(Veo 3, Sora 2 등)은 더빙과 효과음까지 바로 생성해요. 입 모양, 발소리, 환경음이 모두 화면과 동기화돼야 하죠 — 영상과 오디오 두 가지 일을 동시에 하는 셈이라, 「소리 포함」 가격이 「무음」보다 한 단계 비싸요.

좋은 소식은: 이 가격은 계속 내려가고 있다는 거예요. 불과 2년 전만 해도 같은 품질의 영상이 몇 배는 더 비쌌어요. 순서도 기억해 둘 만해요: 먼저 저렴한 텍스트로 대본을 다듬고, 그다음 0.3위안짜리 이미지로 화면 느낌을 확정하고, 마지막에야 초 단위 과금인 영상을 돌리는 것 — 전문 팀들이 다 이렇게 아껴요.

✅ 이 페이지에서 나누고 싶은 것