AI 生图
文生图 vs 垫图:两种完全不同的事
以 Alice(AI Agent 桌面应用)为例:同样是「生成一张 Alice 在书房的图」,有没有参考图,产出的质量天差地别。这是产品经理在设计生图功能时必须搞清的第一个决策。
两种模式,用 Alice 来看
文生图 (Text-to-Image)
输入:只有文字
「爱丽丝在书房看书,温暖灯光,书架背景,蓝裙白围裙」
模型凭想象力生成
模型按文字描述生成,但每次角色长什么样,全靠运气
垫图 (Image-to-Image)
输入:参考图 + 文字
参考图 + 「Alice 在书房办公,笔记本电脑,暖色调」
以参考图为锚点生成
模型根据参考图约束外貌,Alice 每次都长一样
核心区别:文生图是从无到有,模型每次对 Alice 的想象都不同;垫图是以图为锚,参考图锁定了 Alice 的外貌,模型只在这个约束下变换场景和动作。
什么场景用哪种?
| 场景 | 推荐模式 | 原因 |
|---|---|---|
| 纯背景/环境图 | 文生图 | 不涉及角色,纯场景描述即可 |
| 食物、物品特写 | 文生图 | 无需人物一致性约束 |
| 角色出镜(Alice 做某事) | 垫图 | 必须保证还是 Alice,需要参考图锚定 |
| 角色换装 | 垫图 | 脸不变衣服变,必须有脸部参考 |
| 多场景系列图 | 垫图 | 一组图里角色外貌需一致 |
| 创意发散/概念探索 | 文生图 | 不需要锁定形象,越多变越好 |
文生图 = 无中生有,适合不需要一致性的场景;垫图 = 以图为锚,适合角色必须稳定的场景。在 Alice 这样有固定形象的产品里,绝大多数出图都走垫图,因为用户不能接受「每次 Alice 长得不一样」。