llms.txt是什么?它从哪里来,对网站有什么作用?

llms.txt是一份供兼容AI Agent使用的网站阅读导航。本文说明它的起源、工作方式,与robots.txt、Sitemap和Schema的区别,以及它能做什么、不能承诺什么。

晚霞映照下的树木与停车场灯光
摄影:陈甜佳

一页看懂

llms.txt是什么?它从哪里来,对网站有什么作用?

llms.txt是一份供兼容AI Agent使用的网站阅读导航。本文说明它的起源、工作方式,与robots.txt、Sitemap和Schema的区别,以及它能做什么、不能承诺什么。

  1. llms.txt从哪里来?

    LLMs是Large Language Models,也就是“大语言模型”的复数形式。llms.txt这一名称延续了Web上使用根目录文本文件传递机器可读信息的习惯,但它与robots……

  2. 一份llms.txt通常包含什么?

    按照原始提案,它通常是一份使用Markdown组织的纯文本文件,放在网站根目录:

  3. 它和robots.txt、Sitemap、Schema有……

    这四种技术文件经常一起出现,但它们承担的任务不同。

  4. robots.txt管理访问规则

    robots.txt是一套长期存在的爬虫约定,主要用于说明哪些User-agent可以或不可以访问某些路径。它不负责解释企业是谁,也不负责推荐重点内容。

读图之后继续往下

正文会展开概念、依据、应用方法、注意事项和材料来源。

赵岩讲解文章重点的卡通形象

事橙营销 · 一页看懂系列

如果你第一次在网站根目录看到llms.txt,很容易把它理解成“专门让ChatGPT收录网站的文件”。更准确的说法是:llms.txt是一份提供给兼容AI Agent的网站阅读导航,它用简洁的Markdown告诉机器,这个网站是谁、有哪些重要内容,以及进一步了解某个主题时应该访问哪些页面。

它不是Google、OpenAI或某一家搜索平台制定的官方收录标准,也不是能够直接提高排名或AI引用率的技术开关。它更像一份由网站编辑主动整理的重点阅读指南:当一个支持这种约定的AI Agent来到网站时,可以先读这份目录,再选择真正相关的页面,而不必从复杂的导航、脚本和数百个网址中自行猜测。

llms.txt从哪里来?

LLMs是Large Language Models,也就是“大语言模型”的复数形式。llms.txt这一名称延续了Web上使用根目录文本文件传递机器可读信息的习惯,但它与robots.txt不是同一种协议。

这项提议由Jeremy Howard和Answer.AI在2024年9月提出,原始说明发布在llmstxt.org。它是一项开放的社区提案,并非W3C、IETF或ISO批准的正式互联网标准。

提出这份文件,主要是为了解决AI读取网页时的一个现实问题:网页首先是为人设计的,不只包含正文,还包含导航、页脚、按钮、广告、交互组件、脚本和各种视觉代码。人可以根据版式判断什么重要,AI Agent却要先把这些内容转换成文本,再从中寻找需要的信息。

这会带来几个问题:

  • AI需要处理大量与当前任务无关的页面元素;
  • 网站的重要页面可能藏在多层导航中;
  • 同一主题可能存在服务页、文章、FAQ和历史页面,机器不容易判断哪个更值得优先阅读;
  • 整个网站内容可能超过一次对话或一次任务可以使用的上下文范围;
  • 解析页面、筛选内容和重复请求都会增加时间与计算成本。

因此,llms.txt的基本思路是:与其让AI完全依赖自动猜测,不如由网站所有者提供一份简洁、可读、经过筛选的内容地图。

一份llms.txt通常包含什么?

按照原始提案,它通常是一份使用Markdown组织的纯文本文件,放在网站根目录:

https://example.com/llms.txt

文件可以包含网站名称、简短说明、必要的背景信息,以及按主题整理的重要链接。例如:

网站名称:某某企业

> 这是一家为B2B企业提供数字营销服务的公司。

## 核心服务

- [SEO服务](https://example.com/services/seo/): SEO服务内容与适用场景
- [SEM服务](https://example.com/services/sem/): 搜索广告账户诊断与运营

## 重要资料

- [知识中心](https://example.com/learn/): 面向B2B市场团队的公开课程
- [常见问题](https://example.com/faq/): 客户在合作前经常提出的问题

它没有必要把整站所有URL全部复制进去。真正有价值的,是用较少的内容说明网站定位、重点栏目和可信入口。把上千个链接不加筛选地堆进文件,反而失去了“阅读导航”的意义。

它和robots.txt、Sitemap、Schema有什么区别?

这四种技术文件经常一起出现,但它们承担的任务不同。

文件或技术主要回答的问题更接近什么角色
robots.txt哪些机器人可以访问哪些区域门禁与抓取规则
sitemap.xml网站有哪些正式URL,页面何时更新网站地址簿
Schema结构化数据当前页面是什么类型,涉及哪些实体、作者和日期页面身份证与字段说明
llms.txtAI如果想了解网站,建议先读什么、怎样理解内容关系编辑整理的阅读指南

robots.txt管理访问规则

robots.txt是一套长期存在的爬虫约定,主要用于说明哪些User-agent可以或不可以访问某些路径。它不负责解释企业是谁,也不负责推荐重点内容。

所以,把llms.txt简称为“AI版robots.txt”虽然容易理解,却不够准确。前者主要在提供内容导航,后者主要在声明抓取规则。

Sitemap列出可发现的正式URL

Sitemap的目标是帮助搜索引擎发现网站URL。它可以覆盖大量页面,并提供修改时间等信息,但通常不会解释“为什么这个页面重要”“这个栏目适合解决什么问题”。

llms.txt更强调人工筛选和语义说明。一份网站地图可能列出几百个页面,而一份好的llms.txt只需要给出AI理解网站所需的核心入口。

Schema解释当前页面是什么

Schema结构化数据附着在具体页面上,可以说明这是Article、Person、Organization、Service还是FAQPage,以及作者、发布时间、企业实体等信息。

llms.txt则从站点或栏目层面组织重要资源。两者可以互相补充,但不能替代。AI通过llms.txt找到文章后,仍然需要依靠正文、Schema、作者页和来源信息判断页面内容与可信度。

llms.txt真正可能带来什么帮助?

帮助兼容的AI Agent快速理解网站定位

当网站同时包含服务、课程、文章、FAQ、动态和作者页面时,机器可能只能看到大量彼此相邻的URL。llms.txt可以先给出一句清楚的企业介绍,再按主题指向不同入口,减少系统仅根据零散文章推断公司定位的概率。

为重要内容建立优先级

网站所有页面并不具有相同价值。隐私政策、分页页面和历史动态可能需要正常存在,但不一定是AI了解企业时最先应该读取的内容。llms.txt允许网站编辑明确推荐服务页、方法文章、作者资料、课程与高价值FAQ。

降低机器寻找信息的成本

如果一个Agent需要确认“这家公司是否提供B2B SEM服务”,它可以先从llms.txt找到SEM服务页,再进入该页面读取适用客户、服务范围和合作方式。相比遍历整站,这条路径更短,也更不容易偏离问题。

帮助组织跨页面关系

一个成熟网站往往不是靠单篇文章解释业务。服务页说明提供什么,案例或方法文章提供证据,FAQ回答合作前的具体疑问,作者页说明由谁负责。llms.txt能够在更高层面把这些资源组织成一张可读地图。

需要强调的是,上述作用都以“读取它的系统支持或主动使用这项约定”为前提。如果系统根本不读取llms.txt,这份文件就不会自动产生效果。

它不能做什么?

不能保证搜索引擎收录或提高排名

Google已经在官方AI搜索优化说明中明确表示,Google Search不需要llms.txt,也不会因为网站拥有这份文件而提高或降低搜索可见性和排名。Google可能像发现其他文本文件一样抓到它,但这不等于把它作为特殊排名信号。

因此,网站仍然需要正常做好可访问的HTML正文、Canonical、内部链接、Sitemap、robots规则、移动端体验和真实有价值的内容。llms.txt不能修复内容薄弱、页面重复或技术索引问题。

不能保证ChatGPT或其他AI引用网站

不同AI产品采用不同的搜索、检索和回答机制,目前没有一个通用规则保证所有平台都会读取llms.txt。即使某个Agent读取了它,也仍然会根据问题相关性、内容质量、证据、时效和来源可信度决定是否使用某个页面。

所以,不能把“已经创建llms.txt”表述为“AI一定会引用品牌”。它最多降低兼容系统寻找核心内容的成本,无法替代可信内容本身。

不能控制AI训练授权

llms.txt不是许可协议,也不是禁止模型训练的控制文件。网站是否允许特定爬虫访问,通常仍需通过robots.txt、服务器权限、平台提供的User-agent规则以及法律与授权条款处理。

不能替代清晰的网站信息架构

如果网站导航混乱、同一内容存在多个URL、标题与正文不一致、作者和来源不可核验,仅仅增加一份漂亮的llms.txt并不会消除这些问题。机器最终仍然要进入实际页面,而真正决定理解质量的是页面本身。

什么网站更适合维护llms.txt?

它更适合内容较多、栏目关系复杂,或者希望AI Agent快速找到权威入口的网站,例如:

  • 产品文档和开发者文档较多的软件公司;
  • 拥有大量服务页、知识文章和FAQ的B2B企业;
  • 需要说明产品版本、能力边界和官方来源的技术企业;
  • 拥有公开课程、研究资料或知识库的网站;
  • 希望为自动化Agent提供稳定阅读入口的网站。

如果一个网站只有首页、关于页和联系方式,且内容很少,llms.txt带来的增量价值可能有限。维护它同样需要成本:页面下线、路径变化、内容过期以后,文件也要同步更新。

事橙官网为什么保留这份文件?

事橙官网目前同时包含SEOGEO、SEM和内容营销服务页,也包含Blog、AI实践、常见问题、营销词典、课程、作者页和公司动态。完整Sitemap适合帮助搜索引擎发现URL,但不适合向AI解释这些内容在客户决策中的不同作用。

因此,事橙的`llms.txt`承担的是一份补充性阅读目录:先说明事橙是谁,再把兼容AI Agent引导到核心服务、知识内容与可信实体页面。

我们不会把它当成AI收录或引用的捷径,也不会用它替代网站内容建设。对事橙而言,更重要的工作仍然是:把真实经验整理成独立页面,说明作者和来源,使用稳定URL,建立清楚内链,保持Schema与可见内容一致,并让页面能够被正常访问和索引。

怎样判断一份llms.txt是否值得保留?

可以从五个问题检查:

  1. 文件是否准确说明网站是谁,而不是堆砌营销口号;
  2. 是否只列出真正重要、当前有效的正式页面;
  3. 每个链接的说明是否能够帮助机器判断用途;
  4. 文件内容是否与网站导航、Canonical和Sitemap保持一致;
  5. 页面新增、改名或下线以后,是否有人同步维护。

满足这些条件时,它是一项成本较低的网站基础设施;如果文件长期过期、塞满重复URL,或者声称能够保证AI引用,就偏离了原始用途。

结语

llms.txt来自AI Agent开始大量读取网页以后产生的一项社区提案。它试图解决的不是“怎样讨好AI”,而是一个朴素的信息组织问题:当机器来到一个复杂网站时,怎样更快找到由网站所有者确认的重要内容。

它可以成为AI友好型网站的一块辅助拼图,却不是收录、排名或引用的保证。对企业官网来说,正确顺序仍然是先建立有价值、可访问、可核验的页面,再用Sitemap、Schema、内链和llms.txt等方式帮助不同系统发现和理解这些页面。

资料来源与编辑说明

  • 作者:赵岩
  • 原始提案The /llms.txt file,Jeremy Howard,首次提出于2024年9月
  • 平台边界Google Search关于生成式AI功能的网站优化说明
  • 编辑说明:AI辅助核对公开资料、整理文章结构与语言校对,最终观点与公开版本由赵岩确认。本文介绍的是社区提案及网站实践边界,不构成搜索排名、收录或AI引用承诺。