被搜到 · 3 / 6

GEO:让 AI 引擎愿意引用你

越来越多的用户跳过搜索框,直接把问题丢给 ChatGPT、Kimi 或豆包。答案由 AI 组织,你的站在不在答案里,成了新的生死线。这门手艺有个名字:GEO(Generative Engine Optimization)。这一节讲它的四个杠杆,每个都配一个当场能玩的教具。

引用竞标一句话答案FAQ 生成器爬虫点名册
搜索给链接,AI 给答案

SEO 和 GEO 争的东西不一样。搜索引擎给用户十条蓝色链接,你争的是排位;AI 引擎直接给一段组织好的答案,你争的是答案里的一句引用、一个署名。用户可能永远不点进你的站,但「据某某站」这几个字就是新时代的曝光。

维度SEO(搜索引擎)GEO(AI 引擎)
用户看到什么一排链接,自己挑一段答案,AI 已经替他挑完了
你争什么排名和点击被引用、被推荐、被当作出处
内容被怎么消费用户进站读全文AI 摘走能独立成立的那一段
基础设施sitemap、robots、结构化数据全都要,再加 llms.txt 和可引用的段落写法

好消息是两者不冲突:上一节的最低可行清单是 GEO 的地基,AI 引擎同样从抓取和索引开始。这一节讲的是在那之上,AI 特有的四个杠杆。

动手 · 站在 AI 的位置,挑一段引用

AI 引擎回答问题前,检索回来一堆候选段落,从里面挑能直接用的。你来当一次 AI:用户问「个人开发者的产品怎么定价」,检索回来三段内容,逐段点开,看它们的命运和理由。

引用竞标现场 看过 0 / 3
用户提问:个人开发者的产品怎么定价?
点每段候选,看 AI 的取舍
候选一 · 某产品博客落选
定价是一门艺术,也是一门科学。正如我们在上一篇文章中提到的,很多因素都会影响你的决策。在深入探讨之前,让我们先回顾一下什么是价值主张…
读完这段,问题一个字都没被回答。它在铺垫、在引用自己的上一篇、在「即将深入探讨」。AI 摘不出任何能独立成立的句子,只能放弃。很多人的文章通篇都是这种「即将说到」体。
候选二 · 某独立开发者的复盘被引用
个人开发者定价的常见做法是三档:免费档给核心功能拉新,标准档定在同类产品的六到八折(2026 年个人效率工具普遍在每月 30 到 60 元),专业档放团队功能。我的工具站从每月 19 元涨到 39 元,付费率从 2.1% 降到 1.7%,但收入涨了六成。
这段被引用,因为它自包含:单独摘出来仍是一个完整回答,有具体做法、有价格区间、有第一手数据。「据一位独立开发者的实测」就是这么来的。
候选三 · 某问答社区高赞落选
这个问题问得好,楼上说的都有道理。我补充一点,其实定价没有标准答案,主要看你的用户群体。我之前踩过坑,说多了都是泪,有兴趣的可以看我主页置顶。
口语化没问题,问题是信息密度为零:没有数字、没有做法、关键内容还要跳去「主页置顶」。AI 不会替你跳转,段落之外的东西等于不存在。
三段看完,规律浮出来了:AI 挑的是能单独摘走、摘走之后依然成立的段落。这就是 GEO 第一杠杆「自包含段落」的全部含义,下面立刻练。
杠杆一 · 每页开头给一段「一句话答案」

自包含段落最省力的落法:每页 H1 下面,先用两三句话把这页的问题直接答掉。是什么、为什么重要、一句话记住。剩下的正文再展开细节。用户扫一眼有收获,AI 摘一段能引用,双赢。

下面这页讲「API 限流」,开头写得很典型。点两个按钮,看两种改法怎么把它救活。

开头急救:从铺垫体到答案体 两步改写
这页的开头(H1 下的第一段)
在当今快速发展的互联网时代,API 已经成为系统间通信的重要方式。随着业务规模的不断扩大,如何保障服务的稳定性成为了一个值得深入探讨的话题。本文将带你一步步了解限流的方方面面。
可引用度 很低

这个「答案前置」的写法和第 2 节的 description 是一对:description 给搜索结果页看,一句话答案块给 AI 和赶时间的读者看。本站每个课程页 H1 下面那行「一句话速览」就是这个杠杆的落地,全站由构建脚本批量注入。

杠杆二 · Q&A 页加 FAQ 结构化数据

如果你的页面本身就是一问一答(帮助文档、常见问题、本站的小白三千问都是),有一个几乎白捡的杠杆:FAQPage 结构化数据。在页面里放一段 JSON-LD,用机器能读的格式声明「这页的问题是什么、答案是什么」,引擎不用猜,直接拿走。

别被「结构化数据」四个字吓住,它就是一段固定格式的 JSON。下面填上你自己的问答,生成一段能直接贴进页面的代码。

FAQPage 生成器 填一填
改下面两个框,代码实时更新;贴进页面 head 或正文末尾都行
已复制,贴进你的页面就行

生成后拿 Google 的富媒体测试工具验一下(搜「rich results test」第一个就是)。本站给 37 个小白三千问页面补上 FAQPage 后2026-08-10 改造,这批「Token 是什么」「AI 客服为什么蠢」式的原生问题,成了全站最容易被 AI 引用的页面。

一条纪律顺带立在这:结构化数据必须和页面可见内容一致。页面上没有的问答,别塞进 JSON-LD,那属于给引擎和用户两套内容,下一节讲这条线为什么碰不得。
杠杆三 · llms.txt:给 AI 引擎的导览图

robots.txt 告诉爬虫哪能去哪不能去,llms.txt 反过来,是主动递给 AI 的一份站点导览:放在根目录的一个 Markdown 文件,列出你有什么内容、每页讲什么、地址在哪。配套还有一个加强版 llms-full.txt,直接把全站正文拼成一个大文件,AI 一次就能读完你的站。

要说实话的是:这是 2024 年由社区提出的民间约定,不是官方标准,各家 AI 引擎的支持程度不一也在变化。但它成本极低(一个脚本自动生成),赌的是「让 AI 读懂你的成本越低,被引用的机会越大」这个朴素逻辑。本站的 llms.txt 覆盖全部 317 节课的目录和描述2026-08-10 口径,llms-full.txt 把免费页全文、受限页预览段拼在一起,体积一到两兆。

llms.txt 长这样,一眼就懂:

# 小山学堂 > 免费的 AI 实战课程,从零基础到 Agent 开发。 ## 课程 - [Token 是什么](https://xueai.app/slides/zero-q-token.html): 用打字计费的比喻讲清 Token 与上下文窗口 - [Agent 为什么会卡死](https://xueai.app/slides/agent-3.html): 循环起因排查与三种止损方式 - …(共 317 节,每节一行标题加一句描述)

同一节还有个容易漏的杠杆:新鲜度信号。在 JSON-LD 里带上 datePublished 和 dateModified,AI 引擎偏爱能判断时效的内容,尤其是「2026 年还…吗」这类问题。日期从 git 提交记录里取,脚本一次搞定,别手填。

杠杆四 · 认识来抓你的 AI 爬虫

GEO 做没做进去,有一个最诚实的信号:AI 爬虫来没来、来得勤不勤。它们都在请求日志里留名(User-Agent)。点开下面六张卡,认识最常见的几位访客。

AI 爬虫点名册 认识 0 / 6
点卡片看它是谁、来干什么
GPTBot
OpenAI
给模型训练收集语料。它来得勤,说明你的内容在进未来模型的知识库。
OAI-SearchBot
OpenAI
服务 ChatGPT 的搜索功能,和训练爬虫分开。想被 ChatGPT 搜到,别把它拦了。
ClaudeBot
Anthropic
给 Claude 收集训练语料,抓取节奏通常比较克制。
PerplexityBot
Perplexity
服务答案引擎的实时检索。Perplexity 每条答案都带引用,是最容易观测 GEO 效果的平台。
Google-Extended
Google
控制内容能不能用于 Gemini 训练的开关标识,拦它不影响正常搜索收录。
Bytespider
字节跳动
豆包背后的爬虫,中文站的常客,抓取量常常大得惊人。
六位都认识了,去日志里点个名。很多统计工具默认把 bot 流量全丢掉,等于把 GEO 的唯一仪表盘扔了。把这几个 UA 单独归档、按天看抓取量,曲线上升就是内容在进 AI 索引的直接证据。本站后台的「AI 抓取」页就是这么来的,下一节拆。

最后一个提醒,也是很多人漏掉的:ChatGPT 的联网搜索大量依赖 Bing 的索引(公开资料和各家站长的实测都指向这一点)。也就是说 Bing 收录得少,ChatGPT 就搜不到你。上一节让你提交 Bing Webmaster,伏笔在这里,下一节用本站的真实数字给你看差距有多大。

要不要拦训练类爬虫(GPTBot、ClaudeBot),是个立场问题不是技术问题:拦了,内容不进未来模型的知识库;不拦,等于免费供料。本站的选择是全放行,因为免费课的目标本来就是被更多人(和 AI)学到。你的站自己权衡,robots.txt 里一行就能表态。

四个杠杆,一张速查表
杠杆做一次要多久怎么验收
一句话答案块每页两三句,存量页面批量补需要几天随机摘一段问自己:单独读成立吗
FAQPage 结构化数据脚本活,半天Google 富媒体测试通过
llms.txt / llms-full.txt脚本活,半天根目录能访问,随构建更新
日期信号脚本活,两小时抽查 JSON-LD 日期与 git 记录一致
考一下 · 被 AI 转述了,该哭该笑
AI 把你的教程完整转述给了用户,用户没点进你的站。这对你意味着什么? 单选
这是 GEO 时代最常见的焦虑,值得想清楚
A纯亏:流量被 AI 截走了,应该用 robots 把 AI 爬虫全拦掉
B看内容定位:教程被转述换来了署名曝光,产品和独家经验才是要用户进站的部分
C无所谓,反正流量本来也不值钱
D去投诉 AI 厂商侵权
本节要点

GEO 争的是引用:用户看答案不看链接,你要成为 AI 愿意摘走的那一段。SEO 的地基照打,四个杠杆加在上面。

自包含段落是第一杠杆:每页开头两三句直接给答案,摘走之后依然成立。铺垫体和「看我主页置顶」体永远不被引用。

Q&A 页加 FAQPage、根目录放 llms.txt、JSON-LD 带日期:三件事全是一次性脚本活,做完 AI 读懂你的成本大幅下降。

爬虫日志是 GEO 的仪表盘:GPTBot、PerplexityBot 这些 UA 单独归档看曲线。另外记住那条暗线:Bing 收录数直接影响 ChatGPT 能不能搜到你。

被 AI 转述不全是坏事:通用知识换署名曝光,产品和第一手经验留作进站理由。内容分层设计,别一刀切拦爬虫。

内容来源:小山学堂「被搜到」专题原创。llms.txt 为 2024 年社区提案(llmstxt.org),各引擎支持程度以其官方文档为准;文中本站数据均注明口径日期,完整改造记录见第 4 节。