上线前核对抓取与索引配置,核心不是“让搜索引擎立刻收录”,而是确认三件事:搜索引擎能抓到页面、抓到的内容是你想展示的版本、允许被抓的页面没有被自己挡住。对时间和人手有限的汕头网站开发项目,最先处理的应是 robots.txt、页面级 meta robots、canonical 和 sitemap 这四项,而不是急着提交收录或反复刷新搜索结果。
很多团队把上线流程理解成“部署完成 → 提交网址 → 等收录”。提交只是告诉搜索引擎“这里有个地址”,并不等于它一定会抓、一定会索引。如果 robots.txt 屏蔽了整站、页面带有 noindex、或者 canonical 指向了测试域名,提交再多次也不会得到预期结果。
更隐蔽的情况是:开发阶段为了防止测试站被收录,往往加了全站屏蔽;上线时只改了域名,却忘了撤掉这层屏蔽。结果就是线上页面看起来正常,搜索引擎却拿不到。因此核对的重点不是“提交了吗”,而是“允许抓取和索引的条件是否已经全部放开”。
robots.txt 放在网站根目录,用来告诉爬虫哪些路径可以抓、哪些不可以。上线前打开浏览器访问你的域名加 /robots.txt,逐行确认:
Disallow: / 这类屏蔽整站的规则,如果有,说明全站被抓取被禁止。判断结果:如果发现 Disallow: /,这是必须最先修的问题;如果只是屏蔽了后台或临时目录,属于正常配置,可以保留。
robots.txt 管的是“能不能抓”,页面里的 meta robots 管的是“抓到后能不能索引”。用浏览器查看网页源代码,搜索 meta name="robots":
noindex 表示该页不允许被索引,正式页面不应保留。nofollow 表示不追踪页面链接,是否保留要看页面用途。同时检查 canonical 标签。canonical 用来指明“哪个地址是这条内容的正式版本”。如果它指向测试域名、带参数的地址或另一个不相关的页面,搜索引擎可能把权重和索引归到错误地址上。正确做法是让 canonical 指向该内容在线上唯一的正式 URL。
适用条件:如果网站有多个域名或多个入口指向同一内容,canonical 尤其重要;如果每个页面只有一个干净地址,canonical 指向自身即可,不必复杂化。
配置改完后不能只看代码,要做一次可执行的验证。步骤如下:
/sitemap.xml,确认能正常打开,里面列出的都是正式域名下的可索引页面。noindex,canonical 指向自身正式地址。判断结果:如果抓取工具显示“已屏蔽”或“不允许索引”,回到前两步排查;如果显示可抓取且内容正确,说明基础配置已就绪。此时再提交 sitemap 才有意义。
如果只能安排一个人、半天时间,按这个顺序做:先看 robots.txt 有没有全站屏蔽,再看首页和主要栏目页有没有 noindex,然后确认 canonical 域名正确,最后检查 sitemap 能否打开且地址正确。这四步覆盖了最常见的上线故障,做完再考虑提交收录和后续观察。
下一步建议:把上述检查项做成一张上线前核对清单,每次部署后由执行人逐项打勾并记录检查时间,避免同一类屏蔽问题在下次改版时重复出现。