AI 生图

文生图 vs 垫图:两种完全不同的事

以 Alice(AI Agent 桌面应用)为例:同样是「生成一张 Alice 在书房的图」,有没有参考图,产出的质量天差地别。这是产品经理在设计生图功能时必须搞清的第一个决策。

两种模式,用 Alice 来看

文生图 (Text-to-Image)

输入:只有文字
「爱丽丝在书房看书,温暖灯光,书架背景,蓝裙白围裙」
模型凭想象力生成
文生图结果:爱丽丝在书房

模型按文字描述生成,但每次角色长什么样,全靠运气

垫图 (Image-to-Image)

输入:参考图 + 文字
Alice 角色参考图
参考图 + 「Alice 在书房办公,笔记本电脑,暖色调」
以参考图为锚点生成
垫图结果:Alice 在书房办公

模型根据参考图约束外貌,Alice 每次都长一样

核心区别:文生图是从无到有,模型每次对 Alice 的想象都不同;垫图是以图为锚,参考图锁定了 Alice 的外貌,模型只在这个约束下变换场景和动作。
什么场景用哪种?
场景 推荐模式 原因
纯背景/环境图 文生图 不涉及角色,纯场景描述即可
食物、物品特写 文生图 无需人物一致性约束
角色出镜(Alice 做某事) 垫图 必须保证还是 Alice,需要参考图锚定
角色换装 垫图 脸不变衣服变,必须有脸部参考
多场景系列图 垫图 一组图里角色外貌需一致
创意发散/概念探索 文生图 不需要锁定形象,越多变越好
文生图 = 无中生有,适合不需要一致性的场景;垫图 = 以图为锚,适合角色必须稳定的场景。在 Alice 这样有固定形象的产品里,绝大多数出图都走垫图,因为用户不能接受「每次 Alice 长得不一样」。