同条件复测的意思是:用相同的问题、相同的条件重复测量,让优化前后可以比较,同时说清哪一部分变了、哪一部分还不确定。它的价值不在于「测了很多次」,而在于「前后两次的数字可以放在一起看」。
一、为什么必须先有基线
AI 答案会变。同一条问题,今天和下周的答案可能不一样,模型版本更新、检索结果变化、竞品发布内容都会影响它。如果没有固定基线和完整存档,你就无法向管理层说明:发布事实页之后,份额或推荐理由到底有没有变化;更无法区分「变化来自你的动作」还是「变化来自模型漂移」。没有基线,讨论最后都会变成观点之争。
二、第一步:把问题集做成可复用的资产
做法是:从买家会问的话出发,而不是从关键词出发。
示例:假设你卖企业级项目管理 SaaS,题面可能是「预算有限的小团队用什么项目管理工具」,也可能是「有没有支持本地部署的项目管理软件」。这两条意图不同,答案的候选集合通常也不同,要分别记录。
具体规则:
- 每条题面固定语言、固定措辞、固定标点。中英文算两条不同的题面。
- 题面数量建议从 10 到 30 条开始,覆盖品类推荐、横向比较、使用场景、替代方案、预算约束等不同意图。不要把多个意图压进一句话。
- 题面开始记录后冻结。需要调整就新增一条,不要就地修改旧题面。
- 给每条题面编号,并写一句「这条题面代表什么购买意图」,方便向别人解释。
三、第二步:固定所有会变的条件
- 模型组:例如分一组全球模型、一组中文模型,名单写死,不要中途替换。
- 入口与开关:是消费端产品还是直接调 API,有没有开联网检索,有没有登录或个性化记忆,全部固定。
- 采样窗:记录日期与时间段,并写明每条题面采样几次。
- 存档要求:保留原始答案全文,不要只留一个「有/没有」的打勾。
四、第三步:用同一张表记录
建议的列:
date|model|query|language|entry_retrieval|mentioned|shortlisted|recommended|reason_owner|accuracy_notes|cited_urls|competitor_set|uncertainty_notes
其中 reason_owner 记录「推荐理由归谁」,uncertainty_notes 记录「这次结果里解释不了的部分」。这两列在后期做归因时最常被用到。
五、第四步:五个数分开算,分母写清楚
提及、推荐、引用、访问、商机必须分开统计,并且每个数字都要能追溯到分母。
示例:假设你用 10 个模型 × 20 条题面 × 每条采样 1 次,一共 200 个「答案位」。结果是:提及 60 次、进入推荐清单 18 次、引用了你的页面 5 次。这三个数不能用一个百分比概括,也不能用「提及 60 次」去说明商机。访问和商机还需要另外的测量方式(例如带参数的链接或分渠道统计),并且要说明仍然存在其他解释来源。以上数字是示例,不是实测结果。
六、第五步:只在「已发布的变更」之后复测
复测的前提是:你确实发布了一版可被引用、可核对的事实内容。记录变更的时间戳和 URL,让复测结果能对得上你改了什么。如果只是在内部文档里改了一版,外部世界看不到,复测就没有意义。
七、三层工作的区别,最好写进方案里
- 初始信号:少量固定问题、每条一次采样、少量模型接口。它的作用是看方向,明确不是正式基线。
- 正式基线:自定义题面、模型与节奏,可以反复复测的完整基线。
- 品牌与产品 GEO 执行:在基线之上做策略、站点内容与渠道执行,再回到同条件复测验证。
把这三层写清楚,主要是为了避免拿「初始信号」的结果去承诺执行层的效果。
八、节奏建议(实践参考,非合同条款)
- 每周:轮换一个子集复测,保持连续性。
- 每月:跑一次全量基线。
- 触发式:竞品有重大发布,或出现错价、停产等事实错误时,立即补测。
九、解释结果时怎么说
正确:「在相同题面与相同模型组下,进入推荐清单的比例从 A 变成了 B;这段时间里我们发布了一版事实页;仍有部分模型没有引用该页,原因尚未完全确定。」
错误:「因为我们做了 GEO,所以提升一定是我们带来的。」
前一种说法保留了不确定性,后一种把相关性直接当成了因果。
十、什么情况下结论不可用
- 只采样一次就下结论。单次结果只能当信号。
- 改了题面之后仍然称之为「同比」。
- 把模型自身的版本变化当成优化成果。
- 拿别人匿名案例的涨幅当作自己的预期。
- 把某个平台关于抓取与收录的说明,当成所有模型都会推荐你的依据——不同平台的机制并不相通。
常见问题
一个问题只采样一次,够吗?
作为初始信号可以,但要明确它不代表正式基线。要用于经营判断,需要固定基线和重复采样。
分母到底该怎么写?
写成可以复算的形式,例如「模型数 × 题面数 × 采样次数」。任何指标都必须能追到这个分母,否则涨跌无法解释。
Winin 在这件事上的做法,是把监测、事实治理、授权执行和同条件复测放在同一条流程里:先拿到可比的基线,再决定改什么,改完之后用相同条件确认变化。具体范围取决于你的问题集和模型清单。