第零篇章 · 小白三千问

为什么有的 AI「看不懂」图片?

你可能遇到过:给 AI 发照片,它回「抱歉,请用文字描述」。也见过能把照片里的菜谱都认出来的。同样是 AI,差在哪?

一句话回答

因为「会说话」和「会看」是两套独立的本事。语言模型天生只认文字;想让它看图,得额外给它装一双「眼睛」——装了的叫多模态模型,没装的就只能对图片说抱歉。

小实验 · 给两个模型各发一张猫的照片
模型 A · 纯文本模型(没装眼睛)
🖼️ 猫咪照片.jpg
「抱歉,我无法查看图片。你可以描述一下图片内容,我来帮你分析。」
模型 B · 多模态模型(装了眼睛)
🖼️ 猫咪照片.jpg
「一只橘猫趴在飘窗上晒太阳,右前爪压着一个毛线球。看它的体型……这位可能需要控制一下饮食了 😄」
原理 · 「眼睛」是怎么装上去的
✂️

第一步:把图切碎

「眼睛」(视觉编码器)把图片切成许多小方块,每块转译成模型认识的「词」——一张图就变成了一段特殊的「文字」

🔤

第二步:当话来接

转译完成后,图片对模型来说就和一段话没区别了,照常「接话茬」。所以看图能力的本质,还是那台接话机器。

🏋️

为什么不都装上?

装眼睛要用海量「图 + 文」配对数据重新训练,成本高、模型更大更贵。很多场景根本用不到看图,纯文本模型反而更快更便宜。

顺带说清一个常见的混淆:「看懂图」和「画出图」也是两回事。能看图的模型不一定能生成图片——前者是「眼睛」,后者是完全不同的「画手」(下一页就讲它为什么那么贵)。你用的 AI 应用如果既能看又能画,那是它在幕后同时接了好几个不同的模型。

✅ 这一页想和你分享的