Skip to main content

robots.txt 优化

5.1 robots.txt基础

robots.txt 是一个放在网站根目录的纯文本文件(你的域名/robots.txt),告诉爬虫”哪些页面可以抓取,哪些不可以”。 所有遵守规范的爬虫(包括AI代理爬虫)在抓取你的网站前,都会先读这个文件。

5.2 传统爬虫 vs AI爬虫

2024-2026年,大量新的AI爬虫出现。它们和传统搜索引擎爬虫使用不同的User-Agent:

5.3 推荐配置

对于希望最大化AI可见性的电商网站:

5.4 AI训练 vs AI浏览:一个重要区别

建议: AI浏览爬虫必须允许(否则AI代理推荐你时看不到页面)。AI训练爬虫取决于你的态度,但允许训练通常意味着AI对你的品牌和商品有更好的理解。

5.5 各平台的robots.txt管理

Shopify

Shopify通过主题文件 robots.txt.liquid 控制:
  1. Online Store → Themes → Edit code
  2. 找到 robots.txt.liquid
  3. 添加你需要的AI爬虫规则

WordPress / WooCommerce

WordPress自动生成 robots.txt。通过以下方式自定义:
  1. Yoast SEO: SEO → Tools → File editor
  2. RankMath: General Settings → Edit .htaccess & robots.txt
  3. 手动: 在WordPress根目录创建物理 robots.txt 文件(会覆盖WordPress自动生成的)

自建站

直接在网站根目录创建或编辑 robots.txt 文件即可。

5.6 常见错误

5.7 验证

  1. 访问 你的域名/robots.txt 确认文件存在且格式正确
  2. 使用 Google Robots Testing Tool 验证规则
  3. 确认AI爬虫的User-Agent没有出现在 Disallow 规则中

下一章: llms.txt编写指南 — 给AI代理的”公司简介”