开发者生态
morning
llms.txt:尚未有主要 AI 平台确认使用的提议标准
2026-08-19
1 阅读
约6分钟阅读
jon-lbm
字号:
实施 · 有争议的 llms.txt,老实说,该文件的大多数文章都是在推销东西。以下是测量结果,接下来是我们仍然建议的内容以及为什么这两件事并不冲突。简短的回答 llms.txt 是您网站根目录下建议的 Markdown 文件,其中列出了最重要的页面,以便 AI 系统知道首先要阅读什么。它不是一个标准,目前表明它影响人工智能引用的证据也很薄弱。无论如何还是寄一张吧。它需要二十分钟,不会有什么坏处,而且对于代理在机器可读的站点表面上路由的未来来说,这是一个便宜的选择。只是不要在此基础上制定策略。 01 2026 年的数据显示,采用率约为十分之一。一项针对 300,000 个域名的 SE 排名研究发现,采用率为 10.13%,而在人工智能引用最多的 50 个域名中,只有一个拥有该文件。爬虫几乎无法获取它。 Limy.ai 对 90 天窗口内超过 5 亿个 AI 机器人事件的监控分析发现,只有几百个直接针对 /llms.txt 的请求。 GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot 和 Google-Extended 主要抓取 HTML。谷歌已经说不。 Gary Illyes 证实 Google 不支持 llms.txt,也不打算支持;约翰·穆勒 (John Mueller) 将其与信誉不佳的关键字元标记进行了比较。谷歌的 2026 年生成人工智能文档将其列为不必要的策略。没有提供商做出承诺。截至 2026 年,没有一家大型人工智能公司公开承诺在生产中阅读 llms.txt 或对其采取行动。现有文件的很大一部分都是垃圾。 HTTP Archive 的 2025 年网络年鉴发现,大约 40% 的已发布文件是插件生成的默认文件,而不是精心策划的文档。 02 那么为什么要运送一件呢?三个站得住脚的理由,其中没有一个是“这会让我被引用”。成本接近于零,并且选择是真实的。如果代理路由确实实现了标准化,那么二十分钟就可以为您赢得一个位置。这是一个明智的不对称赌注。编写它是一个有用的强制函数。对四十个最重要的页面进行一句话描述会出现重复、孤立的内容和实际上没有说明任何内容的页面。一些团队从审计中获得的价值比文件更大。这是一个企业对代理的界面,而不是 SEO 工件。有趣的用例不是搜索引文——它是一个代理试图找出你的公司提供什么以及每件事的权威页面在哪里。 03 如何正确撰写该提案指定 Markdown:包含网站或品牌名称的 H1、块引用摘要、可选的自由散文,然后是列出链接的 H2 部分,每个部分都有一句话描述。保持精心策划——十到四十个真正重要的页面,而不是站点地图转储。 # 示例公司 > 用一段文字描述该组织的业务、> 其服务对象以及其内容具有权威性的原因。可选的散文:网站的范围、涵盖和不涵盖的内容、许可或引用偏好。 ## 核心指南 - [什么是 X](https://example.com/what-is-x):一句话说明本页的答案。 - [X 的工作原理](https://example.com/how-x-works):一句话说明本页的答案。 ## 参考 - [词汇表](https://example.com/glossary):整个网站使用的 40 个术语的定义。 ## 可选 - [全文](https://example.com/llms-full.txt):每页的纯文本副本。我们自己的 llms.txt 和 llms-full.txt 已上线并遵循此形状。复制它们。经验法则 将其作为文本/纯文本在站点根目录中提供,即 /llms.txt 。使用绝对 URL。严格管理——该文件相对于站点地图的唯一优势是编辑判断。包括最后审查的日期并实际保持最新。过时的文件比没有更糟糕。除非正确处理索引,否则不要将每个页面复制为 Markdown 镜像。 04 如何检查是否有任何东西读取它 不要猜测。过滤您的访问日志以查找已知 AI 用户代理对 /llms.txt 和 /llms-full.txt 的请求。您还可以在文件中嵌入一个在其他地方不会出现的唯一 URL(只有自动阅读器才会跟踪的蜜罐)并监视点击。 Cloudflare 的机器人分析将通过用户代理分解此问题,而无需触及原始日志。优先检查 如果本季度您的时间有限,请将其花在爬网访问、答案结构和原始数据上,然后再花时间处理此文件。该顺序是堆栈的整个参数。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱