从 robots.txt 到 LLMs.txt 的演变:核心框架
这一转变反映了网络治理从访问控制向内容策展的范式迁移。以下是系统性对比:
| 维度 | robots.txt | LLMs.txt |
|---|---|---|
| 核心目的 | 访问控制——告诉爬虫_不能去哪里_ | 内容策展——告诉AI_应该关注什么_ |
| 语法格式 | 纯文本指令(User-agent, Disallow, Allow) | Markdown结构化文档(标题、链接、描述) |
| 与AI的关系 | 防御性:阻止或允许爬虫 | 主动型:为LLM提供"内容路线图" |
| 典型内容 | 路径规则(如 Disallow: /private/) | 高价值页面链接+摘要(文档、FAQ、产品信息) |
关键演进动力
robots.txt 的局限性日益凸显 [2]:
- 60%的正规新闻网站已禁止至少一个AI爬虫,而虚假信息网站仅9.1%这样做——形成"数据不对称"
- 许多AI爬虫根本不请求robots.txt,使规则形同虚设 [4]
- 无法表达"允许爬取但限制用途"等细粒度意图
LLMs.txt 的设计逻辑 [1][5]:
- 定位为推理时工具(用户实时查询时调用),而非仅用于训练
- 节省爬虫预算:避免AI通过试错发现页面结构
- 人类可读 + 机器可解析的双重友好
当前状态:承诺与争议
| 支持信号 | 质疑声音 |
|---|---|
| OpenAI、Anthropic的爬虫已主动获取llms.txt/llms-full.txt [6] | 无官方平台承诺采用,可能仅是"探索性爬取" |
| 被描述为"AI聊天机器人和代理最高效的文件格式" [7] | 存在"游戏化"风险:可向AI展示与人类不同的内容 [6] |
| 与robots.txt/sitemap.xml并列的潜在标准路径 [5] | 缺乏W3C背书、多利益相关方参与 [6] |
实践建议
协同使用策略 [1]:
robots.txt = 门卫(设定边界)
LLMs.txt = 导游( highlight 价值内容)关键对齐原则:robots.txt规则覆盖LLMs.txt——若某路径在robots.txt中被禁止,列入LLMs.txt无效。
资源延伸:
- LLMs.txt目录实例:llmstxt.cloud [4]
- 创建指南:建议关注文档、指南、产品描述等高信息密度页面,保持简洁维护 [1]
参考资料:
- https://higoodie.com/blog/llms-txt-robots-txt-ai-optimization
- https://arxiv.org/html/2510.10315v1
- https://www.webless.ai/blog/from-search-engines-to-ai-bots-the-role-of-robots-txt-sitemap-xml-and-the-rise-of-llm-txt
- https://dev.to/astro-official/new-ai-web-standards-and-scraping-trends-in-2026-rethinking-robotstxt-3730
- https://llmstxt.org/
- https://getpublii.com/blog/llms-txt-complete-guide.html
- https://www.wix.com/studio/ai-search-lab/llms-txt-use-cases
