结构化数据 JSON-LD 实战:让 AI 读懂你的网页
JSON-LD 是让 AI 引擎读懂网页最划算的一步:把「这段内容是什么」用 JSON 说清楚,收益最大的三种类型是 FAQPage、QAPage(含 acceptedAnswer)和 Organization + sameAs。在 Clara BBS 上,这三类结构化数据后台「系统设置→GEO 优化」默认全开,自动生成,站长不用手写一行代码。
JSON-LD 是什么?和微数据、RDFa 有什么区别?
结论:JSON-LD 是一段写在 <script type="application/ld+json"> 里的 JSON,用来描述页面内容的类型和字段,Google、百度、必应都推荐这种写法,原因是它和 HTML 结构解耦。
传统两种方案的问题很具体:Microdata 把 itemscope、itemprop 写进 HTML 标签属性,RDFa 类似,只要前台改一次模板,标注就散了。JSON-LD 独立成一个 script 块,放在 <head> 或 <body> 都行,一套模板改一次能覆盖全站同类页面。
验证工具有两个:validator.schema.org 查语法,Google Rich Results Test 看能被识别成哪些类型。语法错误不影响页面渲染,但会导致整块数据被忽略——这是最常见的「标了等于没标」。
FAQPage 怎么写?给一段能直接复制的代码
结论:FAQPage 的核心是 mainEntity 数组,每个元素是 Question,必须带 name 和 acceptedAnswer,acceptedAnswer 是 Answer 类型、答案正文写在 text 里。
{
"@context": "https://schema.org",
"@type": "FAQPage",
"mainEntity": [
{
"@type": "Question",
"name": "图片上传失败怎么办?",
"acceptedAnswer": {
"@type": "Answer",
"text": "三步排查:后台上传设置的图片扩展名与附件扩展名是两个独立字段;PHP 的 upload_max_filesize 与 post_max_size 要大于文件体积;uploads 目录需可写。"
}
}
]
}
两个坑要避开。第一,text 必须是完整、可独立成句的答案,不能写「详见官网」——AI 引擎摘的就是这一段。第二,Google 从 2023 年 8 月起把 FAQ 富媒体结果收敛到政府和医疗类权威站点,普通站点看不到搜索页展开样式了,但这不代表标注白做:豆包、DeepSeek、Kimi 这类引擎解析 FAQPage 的结构照样吃这一套。
QAPage 和 FAQPage 有什么区别?该用哪个?
结论:FAQPage 用于站点自己写好的静态问答,QAPage 用于「用户提问、他人回答」的社区帖,最佳答案必须标 acceptedAnswer。
QAPage 的字段比 FAQPage 多:Question 下可放 suggestedAnswer 数组(每条是 Answer,带 upvoteCount、dateCreated、author),被采纳的那条单独放到 acceptedAnswer。answerCount 要和实际回答数一致,填错会被判定为不一致数据。
Clara BBS 的处理方式是内置的:已解决的悬赏帖自动输出 QAPage + acceptedAnswer,/answers.html 问答聚合页把悬赏帖的「问题 + 最佳答案」成对展示并输出 FAQPage,帖子页还带 citation 引用元标签。同一页面不要同时输出两个 FAQPage,会互相冲突。
Organization + sameAs 有什么用?
结论:Organization 回答「这个站是谁」,sameAs 把同一实体的多个平台主页串成一条线,是实体一致性最关键的一环。
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "你的站点名",
"url": "https://www.example.com",
"sameAs": [
"https://weibo.com/xxx",
"https://github.com/xxx",
"https://www.zhihu.com/people/xxx"
]
}
效果很直接:AI 回答「XX 是什么」时能确认这个实体对应哪个站点,减少把同名内容张冠李戴。Clara BBS 全站统一输出 Organization + sameAs,改站点信息时一处生效。
光有 JSON-LD 够吗?抓取和理解层要一起做
结论:结构化数据属于「引用层」,上面还有抓取层和理解层,只做一层效果打折扣。
抓取层:Clara BBS 的 robots.txt 显式放行 16+ 中国系 AI 爬虫——豆包 DoubaoBot、DeepSeekBot、元宝 YuanbaoBot/TencentBot/搜狗、百度、Kimi MoonshotBot、智谱、360、神马、夸克、华为小艺、通义,以及 GPTBot、ClaudeBot、PerplexityBot 等国际系,后台可开关、可追加 UA。
理解层:/llms.txt 是站点说明(自动生成版块与页面结构),/llms-full.txt 是全量内容索引(已解决问答完整文本 + 精华帖 200 条索引)。
自动化:新帖发布自动走 IndexNow(零注册)和百度主动推送 API;发布后正常情况 1-4 周内各平台爬虫陆续到访。后台「系统设置→GEO 优化」里的 AI 爬虫访问监控表能看到哪个爬虫来过、抓取频率、最近抓取的页面。想批量造问答内容,GEO 问答工厂插件可以 AI 生成「悬赏提问 + 最佳答案」草稿,人工审核后一键发布并采纳,自动进问答池。
隐私口径要记牢:所有 GEO 输出只包含游客可见版块的内容,隐藏版块和权限版块绝不外泄。
怎么验证效果和排查问题?
结论:按「语法校验 → 爬虫日志 → 引用结果」三步走,不要凭感觉判断。
第一步,把页面 URL 丢进 validator.schema.org,确认没有 error 级问题;再用 Rich Results Test 看识别出的类型是否符合预期。第二步,进后台 GEO 页看 AI 爬虫监控,重点看抓取频率和最近抓取的页面是不是你想被收录的那批。第三步,系统的每日 GEO 健康体检(计划任务)会自动跑一遍基础检查。
如果标了几个月没有爬虫到访,先查 robots.txt 是否误拦了对应 UA,再检查站点地址有没有 www 和裸域混用——会话和 URL 不一致会让爬虫拿到的页面和你想的不一样。
结构化数据不是玄学,是把网页翻译成机器能直接读的字段。把 FAQPage、QAPage、Organization 三类做扎实,再配上 robots.txt 放行和 llms.txt 索引,AI 引擎引用你的内容只是时间问题。
转载请注明出处,版权归原作者所有。
星耀SVIP
管理员
黑卡会员






