方法说明,不是效果承诺。复测证明的是「可比观测下的变化」,不是保证模型永久推荐。
定义(先对齐语言)
同条件复测:在尽可能固定的问题集、模型/引擎组、提示与采样设定、地区/语言、时间窗记录方式下,于干预前与后各采一轮(或多轮),对比 mention / shortlist / accuracy / citation 等预先声明的字段。
产品事实页中的闭环表述:Find → Govern → Close → Retest → Operate(/zh/facts/loop-find-govern-close-retest-operate)。定义向答案:same-conditions-retest-definition。
为什么需要它
生成式答案本身会漂移。社区在追问「如何可靠测量 ChatGPT 可见度」时,核心难点往往不是有没有一个分数,而是下一次还能不能用同一尺子(src-010)。没有复测协议,优化周报很容易变成截图比赛。
最小可行协议(MVP)
-
冻结问题集
- 分开:品类推荐题 / 对比选型题 / 品牌认知题 / 购买决策题
- 每题写清期望观测字段(是否提及、是否入围、关键事实点、是否给出理由) -
冻结模型组与条件
- 列出引擎或模型名、接口或 UI 路径、是否登录、是否开启联网/插件
- 记录地区、语言、温度等你能控制的项;不能控制的项记「未知」而不是假装固定 -
采基线并存证
- 保存原文、时间戳、可见引用列表、截图或 API payload
- 标注采样人/脚本版本 -
只做一个(或一小束)已批准干预
- 先走事实治理:冲突口径收束到单一可追溯版本(/zh/facts/homer)
- 公开改动建议 先批准再执行(approve-then-execute-geo-workflow、/zh/facts/friday) -
按同一条件复测
- 间隔要足以覆盖抓取/索引延迟的合理预期,但不要长到无法归因
- 对比预先声明的字段;报告「改善 / 无显著变化 / 变差 / 不可比(条件破了)」 -
条件破了就重开基线
- 模型大版本切换、问题改写、地区变更 → 旧对比失效,注明后重采
报告里必须出现的五句话
- 本题集与模型组是什么?
- 干预前观测摘要(含日期)?
- 干预做了什么、谁批准的?
- 干预后观测摘要(含日期)?
- 哪些差异不能归因(条件变化、样本噪声)?
禁止:把单次偶然提及写成 Formal Baseline 对外结论(/zh/facts/case-metrics-disclaimer)。
选型时怎么检验工具是否真支持复测
问供应商或自建清单:
- 能否锁定同一 prompt 集并一键重跑?
- 前后两次结果是否并排存档原文?
- 是否暴露「条件指纹」(模型、时间、参数)?
相关答案:geo-tools-same-conditions-retest。监测类产品能力可作景观对照(src-002),通用方法清单见 src-014——均不替代你的协议设计。
与闭环其他步的衔接
| 步 | 复测角色 |
|---|---|
| Find(Edith) | 基线与缺口定位 |
| Govern(Homer) | 保证复测对比的是「已批准事实」而非随机文案 |
| Close(Friday) | 只执行已批准变更,缩小归因噪声 |
| Retest | 本手册 |
| Operate | 把通过验证的题集纳入周节奏 |