被搜到 · 4 / 6

拆本站:Google 收录 693 页,Bing 只有 50 页

前两节的清单和杠杆,这一节全部落在一个真实病人身上:小山学堂自己。2026 年 8 月 10 日我们给全站做了一次 SEO / GEO 审计,查出十个缺口,当周修完一轮。这一节挑五个最有代表性的,每个讲清怎么发现的、改了什么、拿什么验收。

真实案例收录对比审计报告软墙拆解
先交代病人的底子

审计那天的本站是这样的:759 个 HTML 页面,中英韩三语,绝大多数页面有 description(743 页)和 JSON-LD(741 页)2026-08-10 实测。也就是说,上一节那张最低可行清单,它大部分是过关的。按很多教程的标准,这已经算「SEO 做得不错的站」了。

但一做实测就露馅了。这正是本章反复强调「自己动手核对」的原因:清单过了不代表没病,数字才是诊断书。第一项实测就查出了全场最大的病。

动手 · 第一项实测:两边的收录数

第 1 节教的三分钟粗诊,第一步就是 site: 查收录。给本站跑这一步,结果如下。点按钮跑一次。

site:xueai.app 收录数实测 2026-08-10 口径
同一个站,同一天,两个引擎
Google
Bing
差了将近 14 倍,而且短的那头最要命。上一节埋的伏笔在这里兑现:ChatGPT 的联网搜索大量依赖 Bing 的索引。Bing 只认识你 50 页,意味着不管另外 640 页写得多好,ChatGPT 替用户搜的时候都翻不到它们。诊断结论:本站在 Google 眼里是个内容站,在 ChatGPT 眼里接近不存在。处方在下面的审计报告里(缺口一)。

复盘这个病的成因很典型:站长平台只注册了 Google,Bing 全靠自然爬。Google 的爬虫勤快、配额大,慢慢也能爬全;Bing 对没提交的小站爬得很保守。不是内容有差别,是你根本没跟 Bing 打过招呼。

动手 · 审计报告板:五个缺口逐个拆

十个缺口里挑五个最有教学价值的。每条点开,按「怎么发现、改了什么、拿什么验收」三段看。注意每条的「发现」都是一个可复制的动作,你可以原样用在自己站上。

2026-08-10 审计报告(节选五条) 拆开 0 / 5
点一条展开一条
1Bing 收录约 50 页,Google 约 693 页
发现两个引擎各跑一次 site:xueai.app,肉眼对比结果数。成本三十秒。
修法注册 Bing Webmaster、提交 sitemap;接 IndexNow,发版脚本自动把变更页面地址推给 Bing。第一次推送还吃了个 403,原因是 key 文件没先放到站点根目录,key 验证通过后恢复正常。
验收定的目标是两周内 Bing 收录从 50 到 300 以上,每周在站长后台记一次数。
2sitemap 漏了全部英文和韩文页面,约 470 个地址
发现打开自己的 sitemap.xml 数条目:约 330 条,全是中文页。但站上明明有 .en 和 .ko 页面,它们全在靠外链随缘被发现。英文内容恰恰是海外 AI 引擎引用的主要语言,等于把 GEO 的半张牌桌让了。
修法改生成脚本:每个课程页输出中英韩三条 <url>,条目内用 hreflang 互指三个语言版本,引擎就知道它们是同一页的翻译,不会当成重复内容。
验收sitemap 条目从约 330 涨到约 950,站长工具无格式报错。
337 个天然 Q&A 页只标了 Article,白扔 FAQ 引用
发现本站的小白三千问系列每页就是一问一答(「Token 是什么」「AI 客服为什么蠢」),全是小白会原样打进 AI 的问题。查 JSON-LD 却只有 Article 类型,上一节讲的 FAQPage 杠杆一个没用上。
修法构建脚本对这批页面额外注入 FAQPage:页面标题当 Question,页首答案块的文本当 acceptedAnswer。全自动,不逐页手写。
验收Google 富媒体测试通过;每月拿这批问题问一遍 Perplexity,记录本站被引用的次数。
4JSON-LD 没有日期,AI 引擎判断不了新鲜度
发现抽查几页的 JSON-LD,datePublisheddateModified 都没有。「2026 年学 AI 该从哪开始」这类问题,引擎会偏向能证明自己新鲜的内容。
修法日期不手填:脚本从 git 提交记录取每页的首次提交和最近内容提交,写进 JSON-LD 并缓存,构建时批量注入。
验收抽查十页 schema 校验通过,日期与 git 记录一致。
5统计脚本把爬虫流量全丢了,GEO 效果不可度量
发现流量统计脚本为了数字干净,把所有 bot 请求直接过滤掉。人的访问是干净了,代价是 GPTBot 来没来、来了抓什么,一概不知道。改造做没做进 AI 的索引,没有任何仪表能看。
修法过滤改成归档:bot 请求单独存,按 UA 统计 GPTBot、ClaudeBot、PerplexityBot、Bytespider 等的日抓取量和热门路径,后台加一张「AI 抓取」表。
验收后台能看到各 AI 爬虫近 7 天的抓取曲线。上一节说的「GEO 仪表盘」,就是这张表。
五条拆完,注意一个共性:每条的修法都进了脚本和流程,没有一条靠手工。一个人维护几百个页面,手工必漏;让构建脚本每次发版自动做对,才是一人公司的 SEO 姿势。
动手 · 软墙:付费内容怎么既让爬虫看见又不白送

本站有个绕不开的矛盾:五百多节课要登录才能学,但整页拦住的话,引擎和 AI 也一个字都抓不到。审计前的做法就是这样的「硬墙」,531 个受限页对引擎完全不可见。改造后换成「软墙」。切换看两种墙下,用户和爬虫各自看到什么。

硬墙 vs 软墙 切一切
未登录用户看到的
xueai.app/slides/agent-3.html
爬虫抓到的源码(节选)

软墙和骗引擎的 cloaking 只隔一层纸,隔开它们的是那行 isAccessibleForFree: false 声明:在 JSON-LD 里明说「这页有付费部分,受限范围在哪」,这是 Google 官方认可的做法(Flexible Sampling)。删掉声明、给引擎全文却给用户空页,就滑进违规了。改完的结果:531 个受限页全文可抓,可索引页从 28 涨到 186,再到审计后的全量2026-08 改造记录

动手 · 改造前后,六张牌翻一翻

整轮改造的成绩单收在六张牌里,点一张翻一张。左上角第一张是最重要的提醒:有些数字改造当天不会动,要等引擎消化。

改造前 → 改造后 翻开 0 / 6
数字口径:2026-08-10 审计与当周改造记录
sitemap 条目
~330 条
漏掉全部英韩页
llms.txt 体系
仅目录
没有全文版
Q&A 结构化数据
0 页
全标成普通文章
新鲜度信号
引擎判断不了时效
AI 爬虫监控
全丢弃
GEO 效果盲飞
Bing 收录
~50 页
改造当天不会变
注意最后一张牌的诚实:Bing 收录数在改造当天一页都不会多。SEO 和 GEO 的动作是当天做完的,效果是按周计的。所以验收标准里才全是「两周内」「每周记一次」这种带时间的写法,当天出效果的 SEO,多半是骗子。

六张牌背后的工作量交代一下:审计半天,改造集中在一周内完成,绝大部分是改一个构建脚本。一个人、一周、几乎零现金成本,这就是把动作全部脚本化之后,SEO / GEO 对一人公司的真实价格。

照抄清单 · 给自己的站做同款审计

这轮审计用到的动作全部可以照抄,一个下午能跑完。按顺序来:

  1. Google 和 Bing 各跑一次 site: 查询,两个数记进台账,差距大就知道该先补哪家。
  2. 打开自己的 sitemap.xml 数条目,和实际页面数对一对,缺的就是引擎不知道的。
  3. 随机抽五页看源码:正文在不在、description 有没有、canonical 对不对、JSON-LD 带不带日期。
  4. 找出站上所有一问一答形态的页面,查它们标没标 FAQPage。
  5. 翻请求日志搜 GPTBot,搜不到就查是不是被统计脚本或防火墙丢弃了。
  6. 有付费内容的话,用爬虫视角(curl 或站长工具的抓取测试)看受限页,确认引擎抓到的和用户看到的是同一份内容。

每查一项记一行:现状、影响、修法。查完你手里就是自己站的这份审计报告。

整轮改造的节奏表

最后交代这轮改造的排期,供你安排自己的版本时参考。核心原则:按「引擎根本看不到」「看到了但不引用」「放大与防守」三层排优先级,每层做完再做下一层。

阶段做什么为什么排这个位置
第 1 周sitemap 补多语言、llms-full.txt、补齐缺失的 description、注册站长平台并提交全是「看不到」级别的病,不修的话后面做什么都白做。三项改的是同一个构建脚本,一次发版
第 2 周FAQPage 结构化数据、JSON-LD 日期、爬虫监控面板「看到了但不引用」层。监控面板要早于内容动作上线,否则后面的效果没仪表可看
第 3~4 周全站一句话答案块唯一以周计的内容工作量:几百页的摘要句由 AI 批量起草、人工过一遍。放最后是因为它慢,不是因为它不重要
每周例行记录收录数、看爬虫曲线、看 AI 来源 referrer改造是一次性的,度量是长期的。数字进台账,带日期

注意第一周三件事挤在一起的原因:它们改的是同一个构建脚本。一个人做优化,按「改哪个文件」分组排期,比按「哪个更重要」排期省一半力气,这是工程直觉在 SEO 上的应用。

改完拿什么持续验收 · 第 6 节这轮改造的验收标准沉淀成了 12 项清单和四个度量口径,每次上线都能复用。
考一下 · 合规的边界在哪
下面哪种做法越过了软墙的合规线? 单选
软墙和作弊只隔一层纸,这道题就是那层纸
A全文进 HTML,未登录用户见前 40%,JSON-LD 声明受限范围
B识别爬虫 UA 时返回全文,普通用户访问时整页只有登录框,页面不做任何声明
C免费页全文开放,付费页只把预览段放进 llms-full.txt 并注明「全文见链接」
D给 locked.html 提示页加 noindex,不让它占收录坑位
本节要点

清单过了不代表没病:本站 759 页里 743 页有 description,看着健康,一实测 Bing 收录只有 50 页。数字才是诊断书。

每个缺口都要配「怎么发现、改了什么、拿什么验收」:发现要可复制,修法要进脚本,验收要带时间和数字。

软墙靠声明合规:付费内容全文进 HTML 让引擎可抓,用 isAccessibleForFree 声明受限范围。删了声明就从优化滑进作弊。

效果按周计:动作当天做完,收录数、引用率要等引擎消化。验收全部写成带日期的目标,当天见效的承诺别信。

按「改哪个文件」分组排期:一个人做优化,同一个脚本里的改动挤进同一周,一次发版全上。

内容来源:本站 2026 年 8 月 10 日 SEO / GEO 审计与当周改造的第一手记录。文中全部数字(Google 约 693 页 / Bing 约 50 页、sitemap 约 330 → 约 950 条、743/759 页有 description、531 个受限页、37 个 Q&A 页、317 节 llms.txt)均为 2026-08-10 实测口径,收录数会随时间变化,方法不会。