快速答案
结构化数据(Schema / JSON-LD)能让机器更准确地识别「这是什么公司、这个产品多少钱、有没有货」,是值得做的基础工作,但不能保证 AI 会采用。llms.txt 是一份写给大模型的网站内容地图,目前是社区提出的做法,还不是各家 AI 公司公开承诺支持的标准,做起来成本很低,可以当作补充。最重要的仍然是:关键信息用文字写在页面上,AI 的搜索爬虫能正常访问。
详细说明
AI 能读到网站的哪些内容
- 能读到:服务器直接返回的 HTML 里的文字、标题、列表、表格,以及结构化数据。
- 可能读不到:图片里的文字、需要执行复杂前端脚本才出现的内容、登录后才能看的页面、被 robots.txt 或防火墙拦截的页面。
- 容易被误读:同一事实在不同页面写法不一致、没有日期的旧页面。
结构化数据
结构化数据是写在网页里、给机器读的标注,常用 JSON-LD 格式,词汇来自 schema.org。常见类型:
| 类型 | 用途 |
|---|---|
| Organization | 公司名称、官网、logo、联系方式、社交账号 |
| Product / Offer | 产品名称、品牌、价格、币种、库存状态 |
| FAQPage | 页面上的问答内容 |
| Article | 文章标题、作者、发布和更新时间 |
一个 Organization 的最小示例:
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "示例公司",
"url": "https://www.example.com",
"logo": "https://www.example.com/logo.png",
"sameAs": ["https://weibo.com/example"]
}
注意事项:
- 必须和页面上看得到的内容一致。结构化数据里写的价格和页面上的不同,比不写更糟。
- FAQPage 仍然可以用来描述问答内容,但 Google 已经大幅收紧了在搜索结果里展示 FAQ 富结果的范围,不要为了富结果而堆砌问答。
- 写错了会怎样:搜索引擎可能忽略它,严重不一致时可能被视为误导;AI 读到错误的价格或名称,也可能照搬。上线前用验证工具检查,价格变动时同步更新。
llms.txt
llms.txt 是放在网站根目录的一个 Markdown 文件,用简短的说明和链接,告诉大模型「这个网站是什么、最重要的内容在哪里」。
- llms.txt:简短的目录,列出最重要的页面,最好指向这些页面的 Markdown 版本。
- llms-full.txt:把关键内容的全文合并成一个文件,便于一次读取。
一个简化示例:
# 示例公司
> 示例公司提供企业级数据备份服务。本文件列出官网的主要内容。
## 产品
- [产品介绍](https://www.example.com/product/index.md)
- [价格说明](https://www.example.com/pricing/index.md)
## 帮助
- [常见问题](https://www.example.com/faq/index.md)
它和 sitemap 的区别:sitemap 列出所有页面,给搜索引擎做索引;llms.txt 只列最关键的内容,并附上简短说明,写给大模型看。
给 AI 读的 Markdown 版本有用吗
为每个页面提供一个去掉导航、广告和脚本的 Markdown 版本,能让模型更干净地读到正文。它不能替代 HTML 页面本身。两者内容必须一致,并且在 HTML 页面里标明规范地址(canonical)。
怎么让大模型更好地读网站
- 关键事实用文字写,重要数字注明单位和更新时间。
- 一页讲清一件事,标题直接回答问题。
- 放行 AI 的搜索与读取爬虫,检查 CDN 防护设置。
- 主要内容不要只靠前端脚本渲染。
- 加上结构化数据,并保持和页面一致。
- 可选:提供 llms.txt 和页面的 Markdown 版本。
- 用固定问题在联网状态下测试,看 AI 是否读到并引用了这些页面。
常见问法
Q: 网站需要做 llms.txt 吗?
A: 成本很低,可以做,但不要指望它单独带来推荐。先确保页面本身可读、事实清楚。
Q: Product schema 对 AI 推荐有影响吗?
A: 它帮助机器准确识别产品名称和价格等事实,能减少被说错的机会;是否被推荐,仍然取决于内容和来源的整体情况。
相关事实
联系:contact@winin.ai