上周帮一个做小家电出口的客户排查流量下滑原因。谷歌搜索控制台数据显示,近三个月收录页面数从两千多掉到三百多。排查了服务器日志、页面状态码、内容质量,都没问题。后来打开robots.txt文件一看,差点气笑了——Disallow: /后面跟了个空格,整站被禁止抓取。一个空格导致三个月流量持续下跌,损失了多少询盘不敢想。
robots文件是独立站seo里体积最小、影响最大的文件。配置对了默默守护网站健康,配置错了直接断送搜索引擎流量。广州独立站制作过程中,robots文件经常被当默认配置一放就忘,出了问题才发现这个小文件能惹大麻烦。
Robots文件是什么,怎么工作的
robots.txt是放在网站根目录下的纯文本文件,告诉搜索引擎爬虫哪些页面可以抓取、哪些不能抓取。搜索引擎爬虫访问网站的第一件事就是读取robots.txt,按里面的规则决定抓取范围。
robots文件的生效机制是"君子协定",不是强制执行。正规搜索引擎如谷歌、必应都遵守robots协议,恶意爬虫不遵守。robots文件不能用来保护敏感数据,敏感内容要通过登录验证、IP限制等手段保护。
robots.txt的存放位置是网站根目录,通过yourdomain.com/robots.txt直接访问。WordPress建站的话,WordPress会自动生成一个基础的robots.txt,也可以用Yoast seo或者Rank Math插件自定义编辑。自定义开发的网站,在服务器根目录下创建robots.txt文件即可。
Robots文件的基本语法
robots.txt的语法不复杂,几个核心指令掌握就能应对大部分场景。
User-agent指定规则适用的爬虫。User-agent: *表示所有爬虫都适用。针对特定爬虫可以写User-agent: Googlebot、User-agent: Bingbot。不同爬虫可以有不同的规则,按User-agent分段。
Disallow禁止抓取的路径。Disallow: /admin/禁止抓取admin目录下所有内容。Disallow: /wp-admin/禁止抓取WordPress后台。Disallow后面什么都不跟或者写Disallow:表示不禁止任何内容,全部允许抓取。
Allow允许抓取的路径,通常配合Disallow使用。Disallow: /products/禁止了产品目录,Allow: /products/best-seller/又允许抓取畅销产品页面。Allow的优先级高于Disallow。
Sitemap指定站点地图的位置。Sitemap: https://yourdomain.com/sitemap.xml。可以写多条Sitemap指令,指定多个站点地图文件。搜索引擎爬虫通过这个指令找到站点地图,加快页面发现和收录。
Crawl-delay设置抓取间隔,单位是秒。Crawl-delay: 10表示爬虫每次请求间隔至少10秒。这个指令谷歌不支持,谷歌通过搜索控制台设置抓取速率。必应和部分其他搜索引擎支持。
外贸独立站Robots配置最佳实践
外贸独立站的robots.txt配置有几个固定套路,根据实际情况微调就行。
WordPress后台和管理页面必须禁止。Disallow: /wp-admin/、Disallow: /wp-login.php。这些页面没有seo价值,被搜索引擎抓到后台地址增加安全隐患。
搜索功能和筛选参数页面要处理。站内搜索结果页面、产品筛选参数生成的URL,这些页面容易产生大量低质量和重复内容。用Disallow: /?s=禁止搜索页面,用Disallow: /*?禁止所有带参数的URL,根据网站实际情况调整。
感谢页、购物车页、结账页、我的账户页这些功能性页面禁止抓取。Disallow: /cart/、Disallow: /checkout/、Disallow: /my-account/。这些页面对搜索引擎没有价值,抓取浪费爬虫配额。
标签归档、作者归档、日期归档页面建议禁止。WordPress自动生成的这些归档页面内容重复度高,质量低,会稀释网站权重。Disallow: /tag/、Disallow: /author/、Disallow: /20。日期归档按年份匹配。
PDF和媒体文件目录可以不禁。产品目录PDF、白皮书下载这些文件如果包含有价值内容,允许搜索引擎索引能带来流量。图片目录通常不禁,图片搜索也是流量来源。
外贸独立站的典型robots.txt配置大概是这样:User-agent: *,下面列出Disallow的路径,加上Sitemap指令。文件写好之后在浏览器直接访问yourdomain.com/robots.txt检查能正常访问且内容正确。
Robots配置的常见错误
错误一:禁止了整个网站。Disallow: /会把全站禁止抓取,这个错误一旦发生,搜索引擎直接清空所有索引。文章开头那个客户就是类似的情况,配置时不仔细检查,上线就是灾难。
错误二:禁止了CSS和JS文件。Disallow: /wp-content/或者Disallow: /assets/会阻止爬虫抓取样式表和脚本文件。谷歌渲染页面需要这些资源,抓不到CSS和JS会影响页面渲染质量评估,间接影响排名。CSS和JS目录不要禁止。
错误三:大小写问题。robots.txt的路径匹配在部分搜索引擎是区分大小写的。Disallow: /Products/和Disallow: /products/不一样。建议全部用小写,URL结构也全部用小写。
错误四:robots.txt本身被禁止访问。服务器配置错误导致robots.txt返回403或者404状态码。爬虫读不到robots文件会假设没有限制,全部允许抓取。这个看似没问题,但正确的robots配置才能精确控制抓取范围。
错误五:生产环境和测试环境用同一套robots。测试站、开发站的robots.txt通常Disallow: /禁止全站抓取。把测试站的robots直接搬到生产环境,生产站也被禁止了。上线前检查robots文件是必做项。
Robots配置与noindex的区别
robots的Disallow和meta标签的noindex是两个不同的东西,很多人搞混。
Disallow禁止爬虫抓取页面,页面不会出现在搜索结果中。如果页面已经被收录,Disallow后页面会在搜索结果中显示"由于robots.txt限制,无法显示此结果的描述"。Disallow阻止抓取但不阻止索引,已收录页面的URL和锚文本信息仍然可能出现在搜索结果中。
noindex告诉搜索引擎不要把这个页面放入索引。页面可以被抓取,分析内容,不会出现在搜索结果中。noindex是彻底的移除索引,Disallow是阻止抓取但已索引内容可能残留。
需要彻底从搜索结果中移除的页面用noindex。不想让爬虫浪费配额抓取的页面用Disallow。两者配合使用效果更好,Disallow减少爬虫浪费,noindex清除历史索引。
Robots文件的验证和监控
robots文件配置完要做验证。谷歌搜索控制台里有robots.txt测试工具,输入URL检查是否被规则阻止或允许。这个工具在"设置-抓取-robots.txt"里找到。
定期查看搜索控制台的"索引-页面"报告,关注"已抓取但未编入索引"和"被robots.txt阻止"的页面数量。如果"被robots.txt阻止"的页面数量异常增加,说明robots配置可能误伤了重要页面。
网站改版、新增功能模块、调整URL结构时,同步检查robots配置是否需要更新。新增的功能页面要不要禁止抓取?改版后的URL路径有没有被现有规则误伤?这些检查纳入上线流程。
robots.txt是独立站seo基础设施里最不起眼但杀伤力最大的一个。配置正确了没感觉,配置错了代价惨重。花十分钟认真检查一下你的robots文件,比花十个小时排查流量下降原因划算得多。
广州网站建设
如没特殊注明,文章均为高端网站定制专家万智网络原创,转载请注明来自https://www.wanzhiweb.com/xwzx/jyfx/17000.html


