⭐ 推荐:社区规则条款 V1.0

llms.txt 字段规范与最佳实践

CLARA轻量论坛系统
CLARA轻量论坛系统 星耀SVIP星耀SVIP管理员管理员 黑卡会员黑卡会员
发布于 2026-10-11 15:39 ·3 浏览 ·0 回复
内容摘要

llms.txt 是根目录下的极简 Markdown 文件,由站点名、摘要、可选段落和分节链接列表四部分组成,只收录游客可见内容并配 llms-full.txt 提供全文;它与管抓取许可的 robots.txt 分工不同;Clara BBS

llms.txt 的字段规范本质上是"Markdown 的极简约定":一级标题写站点名、紧跟一段引用块摘要、再按二级标题分节列出链接列表,每条一行、格式为 - [名称](URL): 一句话说明;最佳实践是三件事——只放游客可见内容、每条说明写清"这页能回答什么问题"、并配一份 llms-full.txt 放正文全文。它由 Answer.AI 的 Jeremy Howard 在 2024 年 9 月提出,不是新协议,也不替代 robots.txt。

llms.txt 的字段规范到底是什么?

结论:llms.txt 就是放在域名根目录(https://你的域名/llms.txt)的一个纯 Markdown 文件,只有 4 个组成要素,没有 XML、没有 JSON、没有 schema 校验。

按顺序是:

  1. H1 标题:# 站点名,全文件只出现一次,写站点/项目正式名称。
  2. 引用块摘要:紧接 H1 的 > 一句话,说明这个站是干什么的,建议控制在 100 字内。
  3. 可选补充段落:正文段落,写站点定位、内容范围、更新频率等,1-3 句即可。
  4. H2 分节 + 链接列表:每个 ## 小节名 下面跟若干条目,条目统一写成 - [页面对外名称](绝对 URL): 该页面内容的简短说明。

关键细节:URL 必须写绝对地址(带 https://),不能写 /bbs/123.html 这类相对路径——AI 爬虫解析时不保证有正确的 base 上下文。文件编码用 UTF-8,缩进和空行不敏感,但每条占一行、冒号后留一个空格,兼容性最好。

llms.txt、llms-full.txt 和 robots.txt 有什么区别?

结论:robots.txt 管"能不能抓",llms.txt 管"哪些页面最值得抓",llms-full.txt 管"直接把正文喂给你"。三者分工不重叠。

robots.txt 是允许/禁止协议,爬虫看的是 User-agent 和 Disallow;llms.txt 是导航索引,爬虫读了之后知道站内哪些页面信息密度高;llms-full.txt 则是把关键页面的正文全文拼成一个大文件,爬虫一次请求就拿到全部内容,省掉逐页抓取的多次往返。

对 Clara BBS 站点来说,这三份文件都由系统自动生成,不用手写:/llms.txt 输出站点说明加版块与页面结构,/llms-full.txt 输出已解决问答的完整文本加上精华帖 200 条索引。后台「系统设置→GEO 优化」里各开关默认全开。

一份合格的 llms.txt 条目该怎么写?

结论:条目的价值全在冒号后面那句话——它决定了 AI 会不会在回答里引用这个链接,所以别写"点击查看详情"这种废话。

三条可执行规则:

  • 名称用"问题式"或"实体名"。写 - [发帖提示页面已过期怎么解决](https://example.com/faq/csrf.html): CSRF 校验未通过的三种成因与处理步骤,比写 - [帮助中心](...) 有用得多。
  • 说明里放数字和结论。比如"上传失败三步排查:扩展名白名单、PHP 上限、目录权限",这类含参数、含步骤的说明更容易被整段摘引。
  • 分节控制在 5 个以内,每节条目 10-30 条,优先放问答页、教程页、产品说明页,登录页、搜索结果页、分页 ?page=3 这类低价值 URL 直接不放。

Clara BBS 站点要不要手写 llms.txt?

结论:不要手写。Clara BBS 的 /llms.txt、/llms-full.txt、/answers.html 问答聚合页都是系统自动生成的,手写反而会在内容更新后与站内实际结构脱节。

你需要做的只有三件事:后台「系统设置→GEO 优化」确认开关是打开状态;确保每个版块、每个帖子都发布了完整内容(llms-full.txt 取的是真实正文,空帖不会产生有效条目);去同一页的「AI 爬虫访问监控」表里看有哪些爬虫来过、抓了哪些页面,判断收录进度。新帖发布时系统会自动走 IndexNow 与百度主动推送,不需要额外配置。

隐私口径必须说清楚:**结论:GEO 输出只包含游客可见版块的内容,隐藏版块和权限版块的帖子不会进入 llms.txt、llms-full.txt 或问答聚合页。** 所以不要把敏感版块设成"游客可见"再指望它不被收录。

最容易踩的三个坑

第一,把 llms.txt 当成 sitemap.xml 用,塞进全站几万个 URL,结果爬虫读了但没有重点。第二,描述写营销话术("行业领先""全网最全"),不含任何可检索的名词和数字。第三,只在首页放链接、不在 robots.txt 里放行对应爬虫 UA——Clara BBS 已默认放行豆包 DoubaoBot、DeepSeekBot、元宝 YuanbaoBot、Kimi MoonshotBot、百度、智谱、360、神马、夸克、通义等 16 家以上中国系爬虫及 GPTBot、ClaudeBot、PerplexityBot,后台可开关也可追加 UA。

回到开头:llms.txt 的规范简单到只有 4 个字段,难的是把每条说明写成"一眼能判断是否值得引用"的一句话;搭 Clara BBS 的站,这件事系统已经替你做完了,你要盯的是内容质量和后台爬虫监控里的实际到访记录。

本文转载自 Clara轻量论坛系统,原文地址:https://www.leleweb.cn/thread-791.html
转载请注明出处,版权归原作者所有。

全部回复 0

还没有回复,来抢沙发~