发布内容前后,品牌在 AI 回答中的表现可能发生变化。要解释这些变化,需要保存原始回答、固定可比条件、明确每个指标的分母,并记录同期发生的其他变化。本文提供指标拆分、记录模板和报告边界,帮助把观察与推断分开。
问题换了,指标也要换
用户把「买什么好」「哪家靠谱」丢给生成式助手时,得到的是一段综合答案,而不是十条蓝链。品牌侧因此需要另一套可操作问题(此框架沿用旧稿开篇的三层问题):
- 有没有出现(mention)
- 有没有进入候选名单(shortlist)
- 描述是否准确、有没有站得住的推荐理由(accuracy / recommendation reason)
这里有一条常被忽略的边界:页面被抓取、页面被索引、答案被引用、品牌被推荐,是四个不同层次。一个页面可以被抓取却未被索引,可以被索引却未被答案引用,可以被引用却未被推荐。把「爬虫来过」当成「会被推荐」,是采购决策里最常见的误判来源。
Google 官方说明 AI 搜索功能沿用现有 SEO 基础,并不要求站点额外提供 Markdown 或 llms 文件,也不保证内容会被索引或出现在 AI 功能中(https://developers.google.com/search/docs/appearance/ai-features )。Google 排名靠前,不能自动推出「生成式答案里也会被正确推荐」,也不能推到「渠道一定引用了你」——这是两件事。
建议拆开的观测单元
把一次观测记成:问题 × 模型(或引擎)× 时间 × 采样条件。至少区分下列四类结果(表格沿用旧稿,并补充边界说明):
| 观测 | 含义 | 常见误用 |
|---|---|---|
| Mention | 答案中点名品牌/产品 | 把「被点名」当成「被推荐」 |
| Shortlist | 进入可比较的候选集合 | 与广告位、购物卡混为一谈 |
| Accurate & recommended | 事实正确且给出可选理由 | 用单次截图当趋势 |
| Citation | 是否露出可点的来源 URL | 把某次引用当作渠道长期引用品牌的证据 |
示例(示例,非真实监测记录):你问某助手「中小企业用的 CRM 有哪些」,答案里出现了你的品牌名(mention),但没有进入它列出的候选清单,也没有给理由。这就是「有提及、无入选」。记录时不能只写「出现了」,要写清出现类型。
没有真实监测记录时,不要宣称「某个渠道引用了我们」。同理,n≥3 只是最底线重复次数,并不保证统计可信,也不能据此设定通用阈值。
为什么「测一次」不够
生成式答案会随模型版本、检索路径、个性化与时间漂移。更稳妥的做法是(沿用旧稿「四个固定」):
- 固定问题集(品类题 / 对比题 / 购买题分开)
- 固定模型组与采样条件
- 保留原始答案与可见引用来源
- 改完内容或信源后,用同一条件再测一轮
没有同条件复测,很难区分「你的改动生效了」还是「模型自己波动了」。
记录模板(示例)
| 字段 | 示例值 |
|---|---|
| 测试日期 | 2026-09-11 |
| 问题 | 「中小企业适用的 GEO 监测工具推荐」 |
| 平台 + 模型版本 | 某助手(模型名+版本号,示例) |
| 重复次数 | 第 1/3 次 |
| 提问原文 | 与基线一字不差 |
| 你的品牌是否出现 | 是 / 否 |
| 出现类型 | mention / shortlist / 准确推荐 |
| 描述是否准确 | 是 / 否,并记具体错误 |
| 可见引用来源 | 记下 URL,若无则写「无」 |
| 备注 | 竞品出现情况、答案语气、待查现象 |
四类缺口(诊断视角)
沿用旧稿的四类缺口,作为从「现象」到「可执行任务」的入口:
- 缺席:品类推荐里没有你。先确认是没被抓取、没被索引,还是被抓取但事实源矛盾,不要直接跳到「内容不够多」。
- 错述:价格、规格、是否在售等过时或错误。优先核对中文与英文站点、电商主图价、旗舰参数是否存在 canonical 冲突。
- 提及但不给理由 / 理由归竞品:有名字,但理由栏写的是竞品,或干脆没有理由。
- 不可观测:没有存档与趋势,现象变不成任务。
诊断步骤(示例流程,非效果承诺)
- 用固定问题集在固定模型组跑一轮,保存原始答案。
- 按上表给每条答案打「出现类型」标签。
- 对「缺席」项,先查该页面是否被抓取、是否被索引,再查事实源是否互相矛盾。
- 对「错述」项,定位是哪一处公开信息给出旧价格或旧规格。
- 记录当下模型版本与采样条件,作为下一轮的对照基准。
- 改完后再用同一条件复测,只看同条件前后对比。
工具与自建脚本共同的底线问题
无论用商业监测还是自建采样,选型或设计时建议写进检查单(沿用旧稿五项,并补充边界):
- 能否按「问题 × 模型 × 时间」下钻到原文?
- 是否区分 mention / shortlist / accurate recommendation?
- 是否支持同条件复测与前后对比存档?
- 是否覆盖你真正关心的模型,含国内主力助手?
- 优化建议是否绑定已核验事实,而不是任意生成文案?
- 报告是否会区分「抓取/索引/引用/推荐」四层,而不是混成一个总分?
第 6 项是本文相对旧稿补充的边界。采购时可要求对方就同一批问题各自说明四层证据,而不是只给一个综合分数。
常见问题
Q:只看提及率够不够做 GEO 决策? A:不够。提及、入选、准确推荐是不同层,把被点名当成被推荐会高估现状。至少要分开记录。
Q:n≥3 是不是就够统计可信了? A:n≥3 只是最低重复次数,不保证统计可信,也不能据此设通用阈值。是否可信取决于问题集结构、采样条件与波动幅度。
Q:如果不做多轮复测,能不能下结论? A:单次结果只能描述「某条件下的一次观察」。要谈趋势,至少需要同条件多轮。不要把一轮结果写成「效果证明」。
Q:爬虫放行和 AI 可见性是什么关系? A:抓取只是可能路径的起点,不保证索引,不保证被引用,不保证被推荐。各层请分开陈述。
相关链接
- 同条件复测方法与操作细节:/zh/digest/same-conditions-retest-playbook/
- 阶段语义参考:/zh/facts/stages-reach-shortlist-recommended/
- 相关答案入口:/zh/answers/measure-chatgpt-brand-visibility/ · /zh/answers/is-mention-rate-enough-for-geo/
- 官方爬虫文档:OpenAI GPTBot、Anthropic ClaudeBot、Google-Extended、PerplexityBot(链接见上文)
方法论与业务有关的一段说明:本文的观测单元、记录模板与四层边界,来自团队在品牌 AI 可见性项目中反复使用的编辑框架,用于把笼统的「有没有效果」拆成可核验的记录单元。是否适用你的场景,仍应用你自己的问题集实测判断。
抓取配置的具体步骤见 AI 爬虫配置指南。