一句话总结
llms.txt 是放在网站根目录的 Markdown 文件,用简洁格式告诉 AI"这个网站是什么、哪些内容最值得读",是让 AI 优先引用你的内容的关键基础设施。
背景:AI 爬虫与人类网页的矛盾
网页是为人类设计的:导航、广告、弹窗、JavaScript 渲染——这些对 AI 来说都是噪音。AI 爬虫抓取一个页面时,从 HTML 中提取干净文本既困难又不精确,而且上下文窗口有限,无法消化整个网站。
2024 年 9 月,Answer.AI 联合创始人 Jeremy Howard 正式提出 llms.txt 提案(规范托管在 llmstxt.org),用一个纯 Markdown 文件告诉 AI 模型:网站是什么、哪些信息最重要、该先读哪些页面。
llms.txt 与 robots.txt、sitemap.xml 的区别
| 文件 | 职责 | 类比 |
|---|---|---|
| robots.txt | 控制访问权限(哪些不能爬) | 大门与门禁 |
| sitemap.xml | 列出所有 URL(发现页面) | 楼层平面图 |
| llms.txt | 引导理解与优先级(什么值得读) | 私人导览 |
robots.txt 是"禁止指令",sitemap.xml 是"完整目录";llms.txt 则是推荐清单——主动告诉 AI 该看什么,是协作而非控制。
格式规范(llmstxt.org v2)
一个标准的 llms.txt 按顺序包含:
- H1 标题:网站或项目名称(唯一必需部分)。
- 引用块:一句话简介,包含理解后续内容所需的关键信息。
- 普通段落:更详细的背景说明(不能是标题)。
- H2 分组的链接列表:每组下列出 Markdown 链接及简短说明。
链接格式:
markdown
- [链接名称](https://完整URL): 链接的简要说明编写要点:
- 每条链接后必须有一句话描述,说明这个页面讲什么、值不值得引用。
- 按优先级排序,最重要的内容放最前面。
- 只收录核心、有引用价值的页面,不是越全越好。
谁在用
- AI 厂商自己:OpenAI、Anthropic、Google Gemini 的开发者文档均发布了 llms.txt。
- Chrome Lighthouse:在 agentic browsing 检查中审计站点是否有 llms.txt。
- 文档平台:Mintlify 等文档工具自动为站点生成 llms.txt。
本站的做法
本站通过 vitepress-plugin-llms 在构建时自动生成 /llms.txt 与 /llms-full.txt:
llms.txt:全站核心内容的 Markdown 导航(标题 + 摘要 + 链接)。llms-full.txt:所有页面的完整 Markdown 内容合集,AI 一次请求即可获得全部核心信息。
你可以直接访问本站的 llms.txt 查看效果。
发布后的验证
- 浏览器直接访问
https://你的域名/llms.txt,确认能正常打开。 - 在 Google Search Console、Bing Webmaster Tools 提交站点。
- 一段时间后在 DeepSeek、豆包、ChatGPT 等搜索本站核心关键词,观察 AI 答案是否引用本站内容。
数据来源与参考
- llms.txt 规范(v2):llmstxt.org
- 规范提案仓库(AnswerDotAI/llms-txt):github.com/AnswerDotAI/llms-txt
- Mintlify 官方对 llms.txt 的说明:mintlify.com/docs/ai/llmstxt