第零篇章 · 小白三千问
AI 生成视频为什么这么贵?
上一页说一张图两三毛。视频呢?按秒计价,一秒一块五到五块钱——生成一条 10 秒的短视频,够你和 AI 聊上万句。为什么?
一句话回答
因为视频不是「一张图」,是每秒二十几张必须连贯的图,还要配上同步的声音、合理的物理运动。生成量是图片的几十倍,难度还不止翻几十倍。
拖一拖 · 你要的视频背后是多少张「帧」
我想生成一条视频,时长:5 秒
—
要生成的帧(按 24 帧/秒)
—
同样成本能聊多少次天
—
大致费用(元)
价格按 2026 年 8 月主流视频模型 API 的量级估算(如 Google Veo 3 每秒 $0.2~0.75,带声音更贵;国内可灵、即梦按积分折算在同一量级)。上面每个小方块就是一帧——而且它们不能各画各的,必须像连环画一样严丝合缝。
贵在哪 · 不只是「图多」
帧和帧必须「记得住彼此」
人物的衣服颜色、背景里的杯子、光线的方向,每一帧都不能变卦。模型要同时「记住」几百帧的内容互相对齐——这比独立画几百张图难得多,也是早期 AI 视频人物走着走着会「变脸」的原因。
物理要合理
苹果要往下掉、水要往低处流、头发要跟着风飘。模型得从海量视频里「悟」出物理规律,才能不穿帮——这部分能力最烧训练成本。
声音还要对上口型
新一代模型(Veo 3、Sora 2 等)直接生成配音和音效,嘴型、脚步声、环境音都要和画面同步——等于同时在做视频和音频两份工作,所以「带声音」的价格比「无声」的贵一截。
好消息是:这个价格一直在往下走。就在两年前,同样质量的视频还要贵好几倍。顺序也值得记住:先用便宜的文字打磨脚本,再用两三毛的图片确定画面感觉,最后才动用按秒计费的视频——专业团队都是这么省钱的。
✅ 这一页想和你分享的
- 视频按秒计价:一秒一块五到五块,10 秒 ≈ 上万次聊天
- 贵的本质:每秒二十几帧 × 帧间连贯 × 物理合理 × 音画同步
- 省钱顺序:文字打磨脚本 → 图片定画面 → 最后才生成视频
- 趋势向好:价格逐年下降,今天的「贵」是暂时的