GEO:让 AI 引擎愿意引用你
越来越多的用户跳过搜索框,直接把问题丢给 ChatGPT、Kimi 或豆包。答案由 AI 组织,你的站在不在答案里,成了新的生死线。这门手艺有个名字:GEO(Generative Engine Optimization)。这一节讲它的四个杠杆,每个都配一个当场能玩的教具。
SEO 和 GEO 争的东西不一样。搜索引擎给用户十条蓝色链接,你争的是排位;AI 引擎直接给一段组织好的答案,你争的是答案里的一句引用、一个署名。用户可能永远不点进你的站,但「据某某站」这几个字就是新时代的曝光。
| 维度 | SEO(搜索引擎) | GEO(AI 引擎) |
|---|---|---|
| 用户看到什么 | 一排链接,自己挑 | 一段答案,AI 已经替他挑完了 |
| 你争什么 | 排名和点击 | 被引用、被推荐、被当作出处 |
| 内容被怎么消费 | 用户进站读全文 | AI 摘走能独立成立的那一段 |
| 基础设施 | sitemap、robots、结构化数据 | 全都要,再加 llms.txt 和可引用的段落写法 |
好消息是两者不冲突:上一节的最低可行清单是 GEO 的地基,AI 引擎同样从抓取和索引开始。这一节讲的是在那之上,AI 特有的四个杠杆。
AI 引擎回答问题前,检索回来一堆候选段落,从里面挑能直接用的。你来当一次 AI:用户问「个人开发者的产品怎么定价」,检索回来三段内容,逐段点开,看它们的命运和理由。
自包含段落最省力的落法:每页 H1 下面,先用两三句话把这页的问题直接答掉。是什么、为什么重要、一句话记住。剩下的正文再展开细节。用户扫一眼有收获,AI 摘一段能引用,双赢。
下面这页讲「API 限流」,开头写得很典型。点两个按钮,看两种改法怎么把它救活。
这个「答案前置」的写法和第 2 节的 description 是一对:description 给搜索结果页看,一句话答案块给 AI 和赶时间的读者看。本站每个课程页 H1 下面那行「一句话速览」就是这个杠杆的落地,全站由构建脚本批量注入。
如果你的页面本身就是一问一答(帮助文档、常见问题、本站的小白三千问都是),有一个几乎白捡的杠杆:FAQPage 结构化数据。在页面里放一段 JSON-LD,用机器能读的格式声明「这页的问题是什么、答案是什么」,引擎不用猜,直接拿走。
别被「结构化数据」四个字吓住,它就是一段固定格式的 JSON。下面填上你自己的问答,生成一段能直接贴进页面的代码。
生成后拿 Google 的富媒体测试工具验一下(搜「rich results test」第一个就是)。本站给 37 个小白三千问页面补上 FAQPage 后2026-08-10 改造,这批「Token 是什么」「AI 客服为什么蠢」式的原生问题,成了全站最容易被 AI 引用的页面。
robots.txt 告诉爬虫哪能去哪不能去,llms.txt 反过来,是主动递给 AI 的一份站点导览:放在根目录的一个 Markdown 文件,列出你有什么内容、每页讲什么、地址在哪。配套还有一个加强版 llms-full.txt,直接把全站正文拼成一个大文件,AI 一次就能读完你的站。
要说实话的是:这是 2024 年由社区提出的民间约定,不是官方标准,各家 AI 引擎的支持程度不一也在变化。但它成本极低(一个脚本自动生成),赌的是「让 AI 读懂你的成本越低,被引用的机会越大」这个朴素逻辑。本站的 llms.txt 覆盖全部 317 节课的目录和描述2026-08-10 口径,llms-full.txt 把免费页全文、受限页预览段拼在一起,体积一到两兆。
llms.txt 长这样,一眼就懂:
同一节还有个容易漏的杠杆:新鲜度信号。在 JSON-LD 里带上 datePublished 和 dateModified,AI 引擎偏爱能判断时效的内容,尤其是「2026 年还…吗」这类问题。日期从 git 提交记录里取,脚本一次搞定,别手填。
GEO 做没做进去,有一个最诚实的信号:AI 爬虫来没来、来得勤不勤。它们都在请求日志里留名(User-Agent)。点开下面六张卡,认识最常见的几位访客。
最后一个提醒,也是很多人漏掉的:ChatGPT 的联网搜索大量依赖 Bing 的索引(公开资料和各家站长的实测都指向这一点)。也就是说 Bing 收录得少,ChatGPT 就搜不到你。上一节让你提交 Bing Webmaster,伏笔在这里,下一节用本站的真实数字给你看差距有多大。
要不要拦训练类爬虫(GPTBot、ClaudeBot),是个立场问题不是技术问题:拦了,内容不进未来模型的知识库;不拦,等于免费供料。本站的选择是全放行,因为免费课的目标本来就是被更多人(和 AI)学到。你的站自己权衡,robots.txt 里一行就能表态。
| 杠杆 | 做一次要多久 | 怎么验收 |
|---|---|---|
| 一句话答案块 | 每页两三句,存量页面批量补需要几天 | 随机摘一段问自己:单独读成立吗 |
| FAQPage 结构化数据 | 脚本活,半天 | Google 富媒体测试通过 |
| llms.txt / llms-full.txt | 脚本活,半天 | 根目录能访问,随构建更新 |
| 日期信号 | 脚本活,两小时 | 抽查 JSON-LD 日期与 git 记录一致 |
GEO 争的是引用:用户看答案不看链接,你要成为 AI 愿意摘走的那一段。SEO 的地基照打,四个杠杆加在上面。
自包含段落是第一杠杆:每页开头两三句直接给答案,摘走之后依然成立。铺垫体和「看我主页置顶」体永远不被引用。
Q&A 页加 FAQPage、根目录放 llms.txt、JSON-LD 带日期:三件事全是一次性脚本活,做完 AI 读懂你的成本大幅下降。
爬虫日志是 GEO 的仪表盘:GPTBot、PerplexityBot 这些 UA 单独归档看曲线。另外记住那条暗线:Bing 收录数直接影响 ChatGPT 能不能搜到你。
被 AI 转述不全是坏事:通用知识换署名曝光,产品和第一手经验留作进站理由。内容分层设计,别一刀切拦爬虫。
内容来源:小山学堂「被搜到」专题原创。llms.txt 为 2024 年社区提案(llmstxt.org),各引擎支持程度以其官方文档为准;文中本站数据均注明口径日期,完整改造记录见第 4 节。