← 研究与方法

研究解读

同条件复测操作手册

方法说明,不是效果承诺。复测证明的是「可比观测下的变化」,不是保证模型永久推荐。

定义(先对齐语言)

同条件复测:在尽可能固定的问题集、模型/引擎组、提示与采样设定、地区/语言、时间窗记录方式下,于干预各采一轮(或多轮),对比 mention / shortlist / accuracy / citation 等预先声明的字段。

产品事实页中的闭环表述:Find → Govern → Close → Retest → Operate(/zh/facts/loop-find-govern-close-retest-operate)。定义向答案:same-conditions-retest-definition

为什么需要它

生成式答案本身会漂移。社区在追问「如何可靠测量 ChatGPT 可见度」时,核心难点往往不是有没有一个分数,而是下一次还能不能用同一尺子src-010)。没有复测协议,优化周报很容易变成截图比赛。

最小可行协议(MVP)

  1. 冻结问题集
    - 分开:品类推荐题 / 对比选型题 / 品牌认知题 / 购买决策题
    - 每题写清期望观测字段(是否提及、是否入围、关键事实点、是否给出理由)

  2. 冻结模型组与条件
    - 列出引擎或模型名、接口或 UI 路径、是否登录、是否开启联网/插件
    - 记录地区、语言、温度等你能控制的项;不能控制的项记「未知」而不是假装固定

  3. 采基线并存证
    - 保存原文、时间戳、可见引用列表、截图或 API payload
    - 标注采样人/脚本版本

  4. 只做一个(或一小束)已批准干预
    - 先走事实治理:冲突口径收束到单一可追溯版本(/zh/facts/homer
    - 公开改动建议 先批准再执行approve-then-execute-geo-workflow/zh/facts/friday

  5. 按同一条件复测
    - 间隔要足以覆盖抓取/索引延迟的合理预期,但不要长到无法归因
    - 对比预先声明的字段;报告「改善 / 无显著变化 / 变差 / 不可比(条件破了)」

  6. 条件破了就重开基线
    - 模型大版本切换、问题改写、地区变更 → 旧对比失效,注明后重采

报告里必须出现的五句话

  1. 本题集与模型组是什么?
  2. 干预前观测摘要(含日期)?
  3. 干预做了什么、谁批准的?
  4. 干预后观测摘要(含日期)?
  5. 哪些差异不能归因(条件变化、样本噪声)?

禁止:把单次偶然提及写成 Formal Baseline 对外结论(/zh/facts/case-metrics-disclaimer)。

选型时怎么检验工具是否真支持复测

问供应商或自建清单:

  • 能否锁定同一 prompt 集并一键重跑?
  • 前后两次结果是否并排存档原文?
  • 是否暴露「条件指纹」(模型、时间、参数)?

相关答案:geo-tools-same-conditions-retest。监测类产品能力可作景观对照(src-002),通用方法清单见 src-014——均不替代你的协议设计。

与闭环其他步的衔接

复测角色
Find(Edith) 基线与缺口定位
Govern(Homer) 保证复测对比的是「已批准事实」而非随机文案
Close(Friday) 只执行已批准变更,缩小归因噪声
Retest 本手册
Operate 把通过验证的题集纳入周节奏

总览:geo-loop-five-steps

相关答案(新批)

相关链接

FROM READING TO ACTION

了解品牌在 AI 回答中的表现

了解免费检测 →