Skip to content

第 12 章 · 谷歌如何理解网页:机制与三大禁忌 ​

本章替你解决的问题:站做完了、也上线了,谷歌凭什么能看到你、看懂你、收下你?这一章把谷歌处理网页的全过程拆开给你看,再讲清三个"一犯就白干"的禁忌,以及被收录之后怎么让爬虫常来。读完你能回答:我的站谷歌是怎么读的?哪三种做法会让所有努力作废?怎么加快收录?

12.1 一条流水线:谷歌怎么"读"你的网页 ​

先认识一个角色:爬虫(谷歌派出来抓网页的程序,也叫蜘蛛)。它对你的网址发一个 GET 请求,拿回 HTML 代码——注意,它只拿代码,不执行代码。拿到之后走一条四步流水线(来源:卡片 01-articles-2《谷歌如何理解网页:爬取→解析→索引→处理链接,以及三个致命禁忌》):

  1. 爬取:向网址发请求,拿回 HTML 源码;
  2. 解析:从 HTML 里提取正文内容和所有链接;
  3. 索引(把网页存进谷歌数据库):对正文分词、做语义理解,建立正排和倒排索引——倒排索引就是"某个词 → 哪些网页包含它"的反查表;
  4. 链接处理:解析出的新链接进入待爬列表,爬虫接着去爬,循环往复。

还有一个容易被忽略的事实:谷歌目前只有移动端爬虫——网站不适配手机,PC 端也无法拿到排名(来源:卡片 03-tutorial-1《移动端优先不是口号:谷歌只有移动端爬虫》)。

想亲眼看看这条流水线,可以用哥飞开源的谷歌搜索模拟器:它直观演示爬虫抓取→分词→正排/倒排索引→候选集排序的全过程,对理解 On-Page SEO 很有帮助(来源:卡片 02-daily-1《谷歌搜索模拟器:理解排名机制的学习工具》)。

12.2 三大禁忌:一犯就白干 ​

理解了"爬虫只读 HTML",三个禁忌就不用死记了,全是这条机制的直接推论。

禁忌一:不要前端渲染。 前端渲染指页面内容靠浏览器执行 JS 之后才生成——爬虫拿到的是空模板,里面没有内容。谷歌只给大网站"运行 JS"的算力优待,小站必须做 SSR(Server-Side Rendering,服务端渲染:服务器直接返回带完整内容的 HTML)。但也要纠偏:谷歌给不给曝光与技术栈无关,只看最终输出的 HTML 里有没有内容——Astro、Next.js 都行,实测 Astro 写的站曝光比 Next.js 还快不少;JS 重的应用可以拆一个 SEO 子域名专门出 HTML 版(来源:卡片 01-articles-2、02-daily-1《GSC 曝光快慢与技术栈无关,SSR 输出 HTML 即可》)。

禁忌二:多语言不能用 JS 切换。 点按钮切换语言时网址不变,爬虫只能抓到其中一种语言,其余语言等于白做。正确做法是不同语言用不同网址(子目录),每种语言一个独立 URL(来源:卡片 01-articles-2、01-articles-4《谷歌如何理解网页:爬虫只抓 HTML 不执行 JS》)。

禁忌三:工具站必须配内容。 谷歌不会运行你的工具来判断它有什么用,只能靠页面上的文字理解。工具站不是只有工具就可以——还需要内容支撑,搜索引擎才知道你的工具是干什么的。谷歌的处理方式是"先当所有人可信,再用搜索用户的表现验证,言过其实就降权"(来源:卡片 01-articles-2、01-articles-1《两个可直接抄的 SEO 友好开源站》)。

12.3 收录不等于排名:加快收录的两板斧 ​

收录(网址进入谷歌的数据库)只是第一步,之后爬虫会继续抓取、分析关键词、赋予权重,不同词有不同的排名——所以收录不等于排名,品牌词被收录即可搜到,竞争词还得靠后续的站内优化和外链(来源:卡片 01-articles-2《谷歌收录与排名基础:收录≠排名,先收录再等权重》)。

新站怎么加快收录?两板斧(来源:卡片 01-articles-2、01-articles-1《上线后三件事》):

  1. 高权重站留链:去 V2EX、知乎专栏、掘金这类爬虫每分钟光顾的网站发帖留链接,实测新站不到 1 小时被收录;只发一处不够——爬虫的待爬列表有排序,多个外链等于多个发现渠道,等于"插队"。
  2. 主动提交:谷歌搜 site:你的域名 唤起入口,进入 Google Search Console(GSC,谷歌官方的免费站长后台)验证域名、提交 sitemap.xml。

GSC 里还有一手动加速动作,按顺序做(来源:卡片 02-daily-1《GSC 手动提交加速收录:test live url + request indexing》):

  1. 打开 GSC 的"网址检查",输入想加速的页面网址;
  2. 点 "test live url"(测试实际网址);
  3. 点 "request indexing"(请求编入索引),实测几个链接马上收录;
  4. 注意限额:手动提交每天 10 个。

前提永远是页面质量——内容不行的页面,手动提交也不收录。反过来,如果词够新、竞争接近零,零外链也能秒收录:哥飞曾上午 10 点上线一个几乎没竞争的新词资讯站,仅两个静态页面、零外链、只提交了 GSC,当天谷歌、Bing、ChatGPT 各完成一次真实访问收录,部分地区已进谷歌首页(来源:卡片 02-daily-1《新站零外链秒收录实验:零竞争新词当天进首页》)。

12.4 让爬虫常来:首页常新、归档页与页面深度 ​

收录之后的问题是:爬虫多久来一次?三个抓手。

第一,控制页面深度。 页面深度指从首页到达该页的最短点击路径,常规建议不超过 5 层,哥飞的建议是 3 层内——任何页面点击三次可达;做法可参考 Toolify 把深层页面在页脚摊成广度入口(来源:卡片 01-articles-2《页面深度与无 Sitemap 收录法:首页常新 + 全站翻页列表》)。

第二,首页滚动更新最新内页。 爬虫抓取频率跟网站更新频率正相关:V2EX、Toolify、Pollo 用 site: 查最近 1 小时收录都有几十上百个页面,因为爬虫一直在爬。关键是让最新内页合理地不断出现在首页——首页一直在变,爬虫每次来都能抓到新东西,就会越养越勤快(来源:卡片 03-tutorial-2《首页滚动更新最新内页,把爬虫"养勤快"》)。但有一条红线:该模块只放标题链接,千万别把全文输出到首页——ChatGPT4o.ai 曾把"最新问答"全文输出,首页从约 400 单词膨胀到两三千单词,核心关键词密度被稀释,谷歌随即减少曝光降排名(来源:卡片 01-articles-4《首页放"最新内容模块"引爬虫》)。

第三,给爬虫一个全站入口。 加一个能一页一页翻、列出全站所有页面的归档页。Sitemap 对谷歌只是"建议"可以不听,谷歌更喜欢顺链接爬行——哥飞有站一个月收录十几万页且压根没提交 sitemap,方法就两条:首页不断列出最新内容 + 全站翻页归档页(来源:卡片 01-articles-2《页面深度与无 Sitemap 收录法》)。

12.5 不止谷歌:Bing、小引擎与 ChatGPT 爬虫 ​

Bing(微软的搜索引擎)与谷歌规则不同:Bing 爬虫为省钱不够强大,更依赖站长提交 Sitemap;对网页的理解不如谷歌的语义分析,更依赖 Title、Description、结构化数据、社交信号这些经典细节,所以"页面细节做得好"的站在 Bing 更容易出排名。风险是 Bing 喜怒无常——新站上线一个月后被无故 K 站(从索引里除名)的案例真实存在;但被 K 的站也别放弃,Bing 算法会周期性回看,有站被除名半年后因持续内容更新被重新评估恢复(来源:卡片 03-tutorial-1《Bing 与谷歌 SEO 的差异》、02-daily-2《Bing 被 K 站点会周期性重估》)。

Bing 长期"已发现未爬网"的解法(来源:卡片 04-updates-1《Bing"已发现未爬网"终极解法》):

  1. 打开 bing.com/webmasters/urlinspection 输入网址检查;
  2. 点"请求编制索引",等几天无效再用下一步;
  3. 到 bing.com/webmasters/support 提交表单反馈:选对域名 → Indexing → My site is not in index → 勾选 yes → 问题写得越详细越好,一般 24 小时内回邮件。

批量推送用 IndexNow(一个协议,一次提交铺开 Bing/Yandex 等多个搜索引擎):生成 API Key 传根目录再提交 URL,可拼 curl 或用浏览器插件一键导入 sitemap 提交;Cloudflare 自带的 IndexNow 效果差不推荐(来源:卡片 04-updates-2《Bing SEO 四个常见问题的解决方案》)。

小引擎也有肉:哥飞发现自己的站从越南搜索引擎 Coccoc 来的付费开始变多,建议把站提交到 Coccoc 试试,无需专门做越南语版本。通用策略是"各个大大小小的搜索引擎都去提交,说不定东边不亮西边亮,小引擎里拿到的流量可能比谷歌更多"(来源:卡片 02-daily-2《小搜索引擎也有肉:主动提交 Coccoc 等各路引擎》)。补充一个流量属性:Bing 带来的流量大部分是中国用户,做 AdSense 广告变现的站反而合适,做订阅付费要谨慎(来源:卡片 04-updates-1《Bing 流量特点》)。

ChatGPT 爬虫可能是你新站的第一个访客。 Tally.so 来自 ChatGPT 的注册数曾在 5 月初一夜增长 5 倍;有群友的新站、做老词、没发外链,ChatGPT 半个月带来近 80 个访问、40 个注册登录。想让 GPT 更快爬到你,办法本质还是外链——让网址出现在能被爬到的地方(被收录的页面、GitHub、社区帖子)。做站时同步考虑 GEO(Generative Engine Optimization,生成式引擎优化:让 ChatGPT 这类 AI 在回答里推荐你)已成必选项(来源:卡片 02-daily-2《ChatGPT 爬虫:新站的第一个真实访客可能来自 GPT》)。

本章要点回顾 ​

  • [ ] 能口述谷歌流水线:爬取(拿 HTML 不执行代码)→ 解析 → 索引 → 链接进待爬列表
  • [ ] 三大禁忌:前端渲染(新站必须 SSR)、JS 切语言(网址必须变)、工具站不配内容(谷歌不运行工具)
  • [ ] 知道曝光快慢与技术栈无关,只看输出给爬虫的 HTML 里有没有内容
  • [ ] 分得清收录与排名;会用两板斧加快收录:高权重站留链 + GSC 提交
  • [ ] 会做"test live url + request indexing"手动加速(每天限 10 个)
  • [ ] 记住三条养爬虫纪律:页面深度 3 层内、首页常新但绝不全文输出、全站翻页归档页
  • [ ] 主站稳定后把 Bing、IndexNow、Coccoc 都提交一遍,并知道 ChatGPT 爬虫已是必选项

网页被谷歌读懂、收进库,只是拿到了入场券。下一章讲拿到入场券后最影响排名的站内功夫——On-Page SEO:TDH 三件套怎么写,什么样的页面谷歌才喜欢。