robots.txt 优化
5.1 robots.txt基础
robots.txt 是一个放在网站根目录的纯文本文件(你的域名/robots.txt),告诉爬虫”哪些页面可以抓取,哪些不可以”。
所有遵守规范的爬虫(包括AI代理爬虫)在抓取你的网站前,都会先读这个文件。
5.2 传统爬虫 vs AI爬虫
2024-2026年,大量新的AI爬虫出现。它们和传统搜索引擎爬虫使用不同的User-Agent:5.3 推荐配置
对于希望最大化AI可见性的电商网站:5.4 AI训练 vs AI浏览:一个重要区别
建议: AI浏览爬虫必须允许(否则AI代理推荐你时看不到页面)。AI训练爬虫取决于你的态度,但允许训练通常意味着AI对你的品牌和商品有更好的理解。
5.5 各平台的robots.txt管理
Shopify
Shopify通过主题文件robots.txt.liquid 控制:
- Online Store → Themes → Edit code
- 找到
robots.txt.liquid - 添加你需要的AI爬虫规则
WordPress / WooCommerce
WordPress自动生成robots.txt。通过以下方式自定义:
- Yoast SEO: SEO → Tools → File editor
- RankMath: General Settings → Edit .htaccess & robots.txt
- 手动: 在WordPress根目录创建物理
robots.txt文件(会覆盖WordPress自动生成的)
自建站
直接在网站根目录创建或编辑robots.txt 文件即可。
5.6 常见错误
5.7 验证
- 访问
你的域名/robots.txt确认文件存在且格式正确 - 使用 Google Robots Testing Tool 验证规则
- 确认AI爬虫的User-Agent没有出现在
Disallow规则中
下一章: llms.txt编写指南 — 给AI代理的”公司简介”