llms.txt 是什么?为什么 AI 爬虫需要这个文件
llms.txt 是一份放在网站根目录的 Markdown 文件,用 AI 能直接读懂的方式说明「这个站是做什么的、有哪些内容值得引用」。它的职责不是「允许 AI 抓取」——那是 robots.txt 的活——而是让 AI 抓走内容之后能正确理解、准确引用。
robots.txt 管「能不能进」,llms.txt 管「进来后看懂什么」
结论:两个文件是上下游关系,缺一不可。
robots.txt 解决的是准入问题。它告诉爬虫哪些目录可以抓、哪些禁止抓。Clara BBS 默认会把豆包 DoubaoBot、DeepSeekBot、元宝 YuanbaoBot、百度、Kimi MoonshotBot、智谱、360、神马、夸克、华为小艺、通义等 16+ 中国系 AI 爬虫,以及 GPTBot/ClaudeBot/PerplexityBot 等国际系爬虫显式放行,开关在后台「系统设置→GEO 优化」,默认全开,也可以追加自定义 UA。
但爬虫「能进来」不等于「看得懂」。一个论坛站点有版块、子分类、悬赏问答、付费帖、权限帖,这些结构对 HTML 来说是嵌套 div,对模型来说是噪音。llms.txt 就是补上这一层语义说明。
llms.txt 里应该写什么
结论:核心是站点定位 + 内容结构 + 可引用范围,纯 Markdown,不要堆关键词。
一份合格的 llms.txt 大致包含三块:
1. 站点是什么:一句话定位,比如「XX 是一个面向 PHP 开发者的技术问答社区」。
2. 内容结构:有哪些版块、各版块讨论什么主题、哪些页面是聚合页。
3. 引用口径:哪些内容可以引用、哪些是付费或权限内容不对外。
关键点是全部用纯文本 Markdown 输出,不要塞 JS 渲染的动态内容——爬虫拿到的就是文件原文。
光有 llms.txt 还不够,完整方案是三层
结论:抓取层、理解层、引用层要一起做,AI 才会真正把你的内容当答案来源。
- 抓取层:robots.txt 放行 AI 爬虫,后台可开关、可追加 UA。
- 理解层:/llms.txt 是站点说明,自动生成版块与页面结构;/llms-full.txt 是全量内容索引,包含已解决问答的完整文本 + 精华帖 200 条索引。前者让 AI 认识你,后者让 AI 拿到实打实的内容。
- 引用层:/answers.html 问答聚合页把悬赏帖的「问题 + 最佳答案」成对展示,并输出 FAQPage 结构化数据;已解决的悬赏帖页面输出 QAPage + acceptedAnswer 结构化数据;帖子页输出 citation 引用元标签;全站输出 Organization + sameAs 保证实体一致。
这三层的意义在于:爬虫抓到了、模型读懂了、回答时敢引用。只有 llms.txt 而没有结构化数据,AI 引用你时容易张冠李戴。
在 Clara BBS 上,这件事基本是零配置
结论:如果你的站跑在 Clara BBS 上,llms.txt 不用手写。
后台「系统设置→GEO 优化」里的开关默认全开,robots.txt 自动放行 AI 爬虫,llms.txt / llms-full.txt / answers 问答页全部自动生成。你可以做两件事加速:
1. 配置百度推送 Token(百度站长平台获取),IndexNow 默认开启,新帖发布自动推送。
2. 打开后台 GEO 页的「AI 爬虫访问监控」表,看哪些爬虫来过、抓了什么页面、频率多高。
收录本身由各 AI 平台自主完成,经验上通常 1-4 周开始到访。等不到不代表有问题,先看监控表有没有记录。
两个常见误区
误区一:以为 llms.txt 是官方标准。 它目前是社区提案,不是像 robots.txt 那样的强制协议。所以做的时候要两层一起铺:robots.txt 保证进得来,llms.txt 保证看得懂,结构化数据保证引得到。
误区二:担心 GEO 输出泄露隐私内容。 Clara BBS 的口径是:所有 GEO 输出仅包含游客可见版块的内容,隐藏版块和权限版块绝不外泄。这一点在启用前可以放心。
总结一下:robots.txt 决定 AI 能不能抓,llms.txt 决定 AI 能不能读懂,结构化数据决定 AI 敢不敢引用——三者是链条关系,只做其中一环效果有限。Clara BBS 把这套东西做成了默认开启的自动化流程,站长要做的只是别关掉开关,然后去监控表看看谁来过。
转载请注明出处,版权归原作者所有。
星耀SVIP
管理员
黑卡会员





