编程基础篇 · 搜索与决策

贪心与采样:AI 选词时的两种性格

大模型原理篇你看过 AI 逐词元续写时脑子里的候选概率条,也调过 Temperature 旋钮。当时是「体感」,这一课给它算法学的名字:每步挑最大的叫贪心,按概率掷骰子叫采样。同一个开头,两种性格各生成三次——差别一眼就能看穿。

同一个开头 · 两种性格

开头固定是「周末的计划是」。先玩上面这台:贪心模式(temperature=0),每步永远选概率条最长的那根。连点三次「再生成」,留意下方堆叠的结果列表——有没有哪怕一个字的不同?

😤 贪心模式

temperature = 0
周末的计划是
每一步的候选——它永远拿最长那根
没有骰子、没有悬念:概率最大者胜

再玩下面这台:采样模式,每步按概率加权掷骰子。先在 0.7 档连点三次,看结果是不是各不相同;再切到 1.2 档试试——留意概率条的形状变化:温度越高,条与条越接近,冷门词翻身的机会就越大。

🎲 采样模式

按概率掷骰子
temperature
周末的计划是
经温度调整后的概率——骰子按这个掷
同样的候选表,掷骰子选——每次都可能走上不同岔路
概念卡 · 两种性格的账本

😤 贪心:每步拿眼前最大的

快、稳、可复现——跑一万次都是同一句话。但它有个致命盲点:每步的局部最优,加起来不一定是整体最优。第一步选了最顺口的词,可能把整句话带进死路。这个坑怎么填?下一课的 Beam Search 就是解药——先卖个关子。

🎲 采样:给随机留个口子

用确定性换多样性。按概率掷骰子,大概率的词常被选中(所以还是通顺的),小概率的词偶尔翻身(所以有惊喜)。温度就是拨给「惊喜」的额度:T 越高,概率分布被压得越平,冷门词越敢冒头

面试标准答案,一句话版:temperature = 0 时就是贪心解码,输出完全确定;T 越高,softmax 分布越平坦,模型越敢选低概率词,多样性和「胡来」的风险一起上升。你在大模型原理篇拨的那颗旋钮,拨的就是贪心和采样之间的位置。
生活里你见过贪心党:自助餐里每一轮都直奔当下最贵的菜——三文鱼、牛排、帝王蟹一路夹过去,最后肚子没了,主打的现切和牛一口没吃上。每步最优 ≠ 整体最优,胃是有限的,上下文窗口也是。

✅ 这一课想和你分享的