---
url: /blog/pacwb4w5/index.md
---
这一转变反映了网络治理从**访问控制**向**内容策展**的范式迁移。以下是系统性对比：

| 维度         | robots.txt                               | LLMs.txt                |
| :--------- | :--------------------------------------- | :---------------------- |
| **核心目的**   | 访问控制——告诉爬虫\_不能去哪里\_                        | 内容策展——告诉AI\_应该关注什么\_      |
| **语法格式**   | 纯文本指令（`User-agent`, `Disallow`, `Allow`） | Markdown结构化文档（标题、链接、描述） |
| **与AI的关系** | 防御性：阻止或允许爬虫                              | 主动型：为LLM提供"内容路线图"       |
| **典型内容**   | 路径规则（如 `Disallow: /private/`）            | 高价值页面链接+摘要（文档、FAQ、产品信息） |
|            |                                          |                         |

***

## 关键演进动力

**robots.txt 的局限性日益凸显** \[2]：

* 60%的正规新闻网站已禁止至少一个AI爬虫，而虚假信息网站仅9.1%这样做——形成"数据不对称"
* 许多AI爬虫根本不请求robots.txt，使规则形同虚设 \[4]
* 无法表达"允许爬取但限制用途"等细粒度意图

**LLMs.txt 的设计逻辑** \[1]\[5]：

* 定位为**推理时工具**（用户实时查询时调用），而非仅用于训练
* 节省爬虫预算：避免AI通过试错发现页面结构
* 人类可读 + 机器可解析的双重友好

***

## 当前状态：承诺与争议

|支持信号|质疑声音|
|:--|:--|
|OpenAI、Anthropic的爬虫已主动获取llms.txt/llms-full.txt \[6]|无官方平台承诺采用，可能仅是"探索性爬取"|
|被描述为"AI聊天机器人和代理最高效的文件格式" \[7]|存在"游戏化"风险：可向AI展示与人类不同的内容 \[6]|
|与robots.txt/sitemap.xml并列的潜在标准路径 \[5]|缺乏W3C背书、多利益相关方参与 \[6]|

***

## 实践建议

**协同使用策略** \[1]：

```
robots.txt = 门卫（设定边界）
LLMs.txt   = 导游（ highlight 价值内容）
```

**关键对齐原则**：robots.txt规则覆盖LLMs.txt——若某路径在robots.txt中被禁止，列入LLMs.txt无效。

***

**资源延伸**：

* LLMs.txt目录实例：[llmstxt.cloud](https://llmstxt.cloud/) \[4]
* 创建指南：建议关注文档、指南、产品描述等高信息密度页面，保持简洁维护 \[1]

参考资料：

1. https://higoodie.com/blog/llms-txt-robots-txt-ai-optimization
2. https://arxiv.org/html/2510.10315v1
3. https://www.webless.ai/blog/from-search-engines-to-ai-bots-the-role-of-robots-txt-sitemap-xml-and-the-rise-of-llm-txt
4. https://dev.to/astro-official/new-ai-web-standards-and-scraping-trends-in-2026-rethinking-robotstxt-3730
5. https://llmstxt.org/
6. https://getpublii.com/blog/llms-txt-complete-guide.html
7. https://www.wix.com/studio/ai-search-lab/llms-txt-use-cases
