llms.txt 详解:规范、实际应用及如何发布
llms.txt 承诺为 AI 提供您网站的清晰地图。以下是规范的实际要求、爬虫是否已经使用它的诚实评估,以及如何发布。
llms.txt 是一个简单的想法,正在引起广泛关注:在您网站的根目录放置一个 markdown 文件,为大型语言模型提供您所提供内容的清晰、精心策划的地图,而不是让它们从充满广告的 HTML 中提取意义。理解这一点很重要——因为规范有实质内容,而围绕它的营销则有过度承诺。本指南涵盖了格式的实际要求、AI 爬虫今天是否尊重它的诚实评估,以及如何发布。
文件存在的原因
由 Answer.AI 于 2024 年 9 月提出的建议,源于一个真实的限制:LLM 的上下文窗口太小,无法吞下大多数网站,并且将复杂的 HTML(导航、广告、脚本)转换为清晰文本是有损且不精确的。llms.txt 通过在一个可预测的地方为模型提供简洁的专家级信息来规避这一点。关键词是推理:此文件旨在帮助模型在用户询问时,而不是用于训练。它是一个精心策划的概览,手工撰写,而不是所有内容的转储。
规范,精确地说
文件位于/llms.txt,用 markdown 编写,按固定的部分顺序排列,以便程序解析和模型读取:
- 一个H1项目或网站名称。这是唯一必需的部分。
- 一个blockquote摘要,提供理解其余内容所需的关键背景。
- 零个或多个 markdown 部分(段落、列表 - 无标题)提供更多细节。
- 零个或多个H2“文件列表”:每个项目是一个 markdown 链接
[name](url),后跟一个可选的:和简短说明。 - 一个特殊的## Optional部分,当需要更短的上下文时可以跳过其链接。
有一个配套建议:在相同 URL 处提供任何页面的干净 markdown 版本,附加.md(目录 URL 为index.html.md),以便模型可以直接获取可读版本。以下是一个最小的有效文件:
# QuantumProxies
> Residential, ISP, datacenter, mobile and IPv6 proxies plus SERP, Scraper and
> Extract APIs for web data collection at scale.
Stable API endpoints, per-request rotation, and 200+ country geo-targeting.
## Docs
- [Scraper API](https://quantumproxies.io/scraper-api): Markdown/JSON/HTML output, JS rendering on demand
- [SERP API](https://quantumproxies.io/serp-api): Google, Bing and DuckDuckGo plus verticals
## Guides
- [Feeding LLMs fresh web data](https://quantumproxies.io/blog/feeding-llms-fresh-web-data-2026): grounding and RAG patterns
## Optional
- [All blog posts](https://quantumproxies.io/blog): the full archive, skip for short context

它与 robots.txt 和 sitemap.xml 的区别
它与您已经知道的两个文件并列,遵循相同的根路径约定。robots.txt声明访问规则 - 谁可以爬取什么 - 我们在robots.txt 指南中涵盖了这一点。sitemap.xml为搜索引擎列出每个可索引的人类页面。两者都不能替代 llms.txt:站点地图很少链接页面的 markdown 版本,从不指向有用的外部资源,总体上太大,无法适应上下文窗口。llms.txt 是这两者从未设计成的精心策划的、适合 LLM 的概览。
AI 爬虫是否真的尊重它?一个诚实的答案
这里诚实很重要。llms.txt 是一个建议,不是官方标准,采用情况不均。截至 2025 年,没有主要的 AI 爬虫公开确认它使用 llms.txt 来排名或回答 - Google 明确表示它不使用该文件,Chrome 的文档将其描述为“新兴惯例”。诚实的立场是:发布一个文件成本低且无害,它可以帮助那些确实摄取文档的工具(一些面向开发者的助手和文档平台使用它),而且它不会花费您任何费用来为未来做好准备。但不要期望获得 SEO 或 AI 流量的丰厚回报。任何将 llms.txt 销售为排名技巧的人都在夸大一个建议。将其视为低成本的卫生措施,而不是增长杠杆。
如何发布一个
为小型网站手工撰写文件 - 它应该是精心策划的,深思熟虑的 30 行文件胜过自动生成的 300 行文件。对于大型网站,VitePress、Docusaurus、Mintlify 和 Drupal 的插件可以从您的内容生成它,llmstxt.site 等目录收录已发布的文件。参考工具llms_txt2ctx将您的文件扩展为一个可以在真实模型上测试的单一上下文块 - 它生成一个没有 Optional 链接的精简版本和一个包含它们的完整版本:
# Install the reference CLI and expand your file into an LLM context blob
pip install llms-txt
# Lean context (skips the ## Optional links)
llms_txt2ctx llms.txt > llms-ctx.txt
# Full context (includes Optional)
llms_txt2ctx --optional true llms.txt > llms-ctx-full.txt
一次写入的陷阱是陈旧。指向重命名或删除页面的 llms.txt 会产生误导。如果您的文件是从文档生成的,请将其连接到您的构建中;如果是手工撰写的,请按与站点地图相同的节奏进行审核。保持链接的.md版本的新鲜是任何基础管道背后的相同纪律 - 我们关于不陈旧的 RAG 管道的指南直接适用。

清洁网页数据的来源
llms.txt 是关于为您自己的网站发布清晰的上下文。镜像问题 - 从其他人的网站获取清晰、适合 LLM 的 markdown 以供您自己的模型或代理使用 - 是我们web data for LLMs服务的存在原因。Scraper API 可以将任何页面返回为 markdown,这正是 llms.txt .md镜像和 RAG 摄取管道所需的形态。如果您正在构建一个需要读取实时网页的助手,那么这种以 markdown 为先的输出就是缺失的一环;我们关于为 LLM 提供新鲜网页数据的概述将其整合在一起。
常见问题解答
什么是 llms.txt?
它是一个建议的 markdown 文件,放置在您网站的根目录(/llms.txt),为大型语言模型提供您内容的简洁、精心策划的概览,并链接到关键页面的详细 markdown 版本。它旨在帮助模型在推理时 - 当用户提出问题时 - 而不是在训练时,仅需一个 H1 名称作为其唯一必需部分。
AI 模型真的使用 llms.txt 吗?
使用情况不一致。它是一个建议,而不是被采纳的标准;截至 2025 年,没有主要的 AI 爬虫确认使用它来排名或回答,Google 表示不使用它。一些面向开发者的助手和文档工具确实摄取它。发布一个文件成本低且为您的网站做好未来准备,但将其视为卫生措施,而不是经过验证的流量或排名杠杆。
llms.txt 与 robots.txt 有何不同?
它们服务于相反的意图。robots.txt 设置访问规则 - 哪些机器人可以爬取哪些路径 - 并且通常用于阻止爬虫。llms.txt 邀请 AI 进入,并为其提供精心策划的阅读地图。它们遵循相同的根路径约定并共存;llms.txt 不替代 robots.txt 或您的 XML 站点地图。
如何创建 llms.txt 文件?
对于小型网站,手工撰写:一个 H1 名称,一个 blockquote 摘要,然后是列出带注释 markdown 链接的 H2 部分,带有一个## Optional部分用于可跳过的额外内容。对于大型网站,使用适合您平台的生成器插件。通过使用llms_txt2ctx CLI 扩展它并询问模型有关您内容的问题来测试它。
llms.txt 是一个值得采用的小而合理的想法,因为它是一个精心策划的上下文文件,而值得对其销售的内容持怀疑态度。发布一个干净的文件,保持其新鲜,并将其与真正适合 LLM 的网页数据配对,您就覆盖了两方面:您展示的内容,以及您的模型消费的内容。