第零篇章 · 小白三千问

AI 生成视频为什么这么贵?

上一页说一张图两三毛。视频呢?按秒计价,一秒一块五到五块钱——生成一条 10 秒的短视频,够你和 AI 聊上万句。为什么?

一句话回答

因为视频不是「一张图」,是每秒二十几张必须连贯的图,还要配上同步的声音、合理的物理运动。生成量是图片的几十倍,难度还不止翻几十倍。

拖一拖 · 你要的视频背后是多少张「帧」
我想生成一条视频,时长:5 秒
要生成的帧(按 24 帧/秒)
同样成本能聊多少次天
大致费用(元)
价格按 2026 年 8 月主流视频模型 API 的量级估算(如 Google Veo 3 每秒 $0.2~0.75,带声音更贵;国内可灵、即梦按积分折算在同一量级)。上面每个小方块就是一帧——而且它们不能各画各的,必须像连环画一样严丝合缝。
贵在哪 · 不只是「图多」
🎞️

帧和帧必须「记得住彼此」

人物的衣服颜色、背景里的杯子、光线的方向,每一帧都不能变卦。模型要同时「记住」几百帧的内容互相对齐——这比独立画几百张图难得多,也是早期 AI 视频人物走着走着会「变脸」的原因。

🍎

物理要合理

苹果要往下掉、水要往低处流、头发要跟着风飘。模型得从海量视频里「悟」出物理规律,才能不穿帮——这部分能力最烧训练成本

🔊

声音还要对上口型

新一代模型(Veo 3、Sora 2 等)直接生成配音和音效,嘴型、脚步声、环境音都要和画面同步——等于同时在做视频和音频两份工作,所以「带声音」的价格比「无声」的贵一截。

好消息是:这个价格一直在往下走。就在两年前,同样质量的视频还要贵好几倍。顺序也值得记住:先用便宜的文字打磨脚本,再用两三毛的图片确定画面感觉,最后才动用按秒计费的视频——专业团队都是这么省钱的。

✅ 这一页想和你分享的