SEO 最低可行清单:能被抓、能被读懂、能被收录
SEO 这个词被各种「秘籍」搞得神神叨叨,其实对一个人的小站来说,值得做的部分很小、很明确:让爬虫抓得到、让引擎读得懂、让收录查得着。这一节只讲做了就有效、不做就归零的部分,每一条都能自己动手核对。
传统 SEO 是个大行业:外链建设、竞品词库、站群、老域名…那套东西面向有团队有预算的公司。一个人做产品,学那些是浪费生命。好消息是,搜索引擎这些年一直在把游戏往一个方向推:把内容做好、把技术障碍清掉的站,自然会被善待。
所以最低可行清单的逻辑是:只做那些不做就直接出局的事。按照上一节漏斗的分层,它们正好分成三组:能被抓(抓取层)、能被读懂(理解层)、能被收录(索引层)。三组都通了,剩下的交给内容质量,那是第 5 节的事。
| 分组 | 解决什么 | 不做的后果 |
|---|---|---|
| 能被抓 | 爬虫来了能拿到正文 | 抓到空壳,后面全归零 |
| 能被读懂 | 引擎知道每页在讲什么 | 收录了也不知道该在什么问题下展示你 |
| 能被收录 | 引擎知道你存在、有哪些页 | 收录靠随缘,快慢不可观测 |
先治最要命的病。AI 生成的前端偏爱单页应用:页面打开先是个空壳,内容由 JS 请求数据再渲染出来。用户看到的一切正常,爬虫拿到的是另一回事。下面同一个产品页,切换两种实现方式,右边是爬虫实际抓到的源码。
上传合同,自动生成合规的发票申请单。支持增值税普票和专票,三分钟搞定过去要跑一下午的事。
免费开始主流引擎宣称能执行 JS,但执行有配额、有延迟,小站排不上优先队列;多数 AI 爬虫干脆不执行 JS,抓到什么算什么。对策不用推翻架构:关键页面(首页、功能页、文章页)保证 HTML 源码里就有正文,交互部分继续用 JS 没问题。用 AI 写页面时把这句放进提示词,成本为零。
能被抓之后,第二件事是让引擎读懂每一页。原则只有一条:一页回答一个问题。什么都讲的页面,引擎不知道该在什么问题下展示它,最后哪个问题都轮不到。主题定了,title 和 description 就是这页在搜索结果里的脸:用户扫一眼这两行字,决定点不点。
下面是一个工具站在搜索结果页里的三条真实病例,点一条,看它怎么改。
拍一张体检单,自动存档并设置下次提醒。支持多宠家庭,数据可导出给兽医。
· 体重曲线自动生成
· 就诊记录一键分享
这局对决顺便回答一个常见纠结:炫和被搜到冲突吗?不冲突,有先后。先保证 HTML 里有完整正文,动画和交互往上叠加,本章这些课件页自己就是这么做的:你现在读的每一个字都在源码里,交互组件全是额外加的。
抓得到、读得懂之后,最后一组动作是主动把站送到引擎面前。四样东西,一个下午能全部做完,做完收录从玄学变成一个能看数字的过程。
| 动作 | 做什么 | 为什么值得 |
|---|---|---|
| sitemap.xml | 一个 XML 文件列出你全部页面的地址,放在站点根目录。多语言站每个 URL 还要用 hreflang 互指各语言版本 | 引擎照着清单抓,不用自己摸索你的站有几页。本站 2026 年 8 月补上英韩页面后,sitemap 条目从约 330 涨到约 950 |
| robots.txt | 根目录下的一个文本文件,声明哪些路径欢迎抓、哪些别抓,末尾指向 sitemap 的地址 | 它是爬虫进站看的第一个文件。写错一行 Disallow 能把全站封掉,改完务必用站长工具验证 |
| canonical | 每页 head 里一行 <link rel="canonical">,声明这页的正式地址 | 带参数的地址、多个入口指向同一页时,引擎知道该把权重记在谁头上,不会自己人分自己人的票 |
| 站长平台提交 | Google Search Console 和 Bing Webmaster 各注册一次,验证域名、提交 sitemap。Bing 顺手开通 IndexNow:发版后把变更页面的地址推给它 | 从此收录数、抓取错误、展示次数全部有报表。别只提交 Google:下一节的 GEO 会讲为什么 Bing 同样重要 |
这四样都不需要每天维护。sitemap 让构建脚本自动生成,站长平台每周看一眼报表,就够了。
这张清单漏一项会怎样 · 第 4 节本站就漏过:sitemap 少了 470 个地址、Bing 没提交。第 4 节整节复盘这些坑的代价和修法。这一节讲的东西全部收进十项清单。对照你的站逐项点亮做到的,没有站就先收藏,上线那天回来过一遍。
这一节的多数要求,可以在让 AI 写页面时一次性说清。下面这段拿去就能用,贴在你的项目提示词或规则文件里:
一段话的成本,换来每个新页面天生合格。这也是本章反复出现的模式:能进提示词和脚本的要求,就别放进记忆和自觉里。
最低可行三组:能被抓(正文进 HTML)、能被读懂(一页一主题,title 说人话)、能被收录(sitemap、robots、canonical、站长平台)。只做不做就出局的事。
JS 空壳是 AI 前端的头号病:用户看着正常,爬虫抓到空白。给 AI 提需求时写明「关键页面正文要在 HTML 源码里」,零成本。
title 和 description 是搜索结果页里唯一的开口机会:title 写用户会搜的问题,description 写这页帮他做什么。
提交平台把收录变成可观测:Google 和 Bing 都要提交,从此有报表有基线。十项清单打完分,缺哪补哪。
能进提示词和脚本的要求,别放进记忆和自觉:那段固定提示词贴进项目规则,每个新页面天生合格。
内容来源:小山学堂「被搜到」专题原创。文中 sitemap 条目数(约 330 → 约 950)为本站 2026 年 8 月改造的真实数据,详见第 4 节完整复盘。