---
title: "AI 推荐监测怎么做：从问题集到可比复测"
lang: "zh-Hans"
canonical: "https://winin.ai/zh/guides/same-conditions-retest/"
alternate: "https://winin.ai/en/guides/same-conditions-retest/"
datePublished: "2026-09-12"
dateModified: "2026-09-12"
section: "guides"
---

# AI 推荐监测怎么做：从问题集到可比复测

同条件复测的意思是：用相同的问题、相同的条件重复测量，让优化前后可以比较，同时说清哪一部分变了、哪一部分还不确定。它的价值不在于「测了很多次」，而在于「前后两次的数字可以放在一起看」。

## 一、为什么必须先有基线

AI 答案会变。同一条问题，今天和下周的答案可能不一样，模型版本更新、检索结果变化、竞品发布内容都会影响它。如果没有固定基线和完整存档，你就无法向管理层说明：发布事实页之后，份额或推荐理由到底有没有变化；更无法区分「变化来自你的动作」还是「变化来自模型漂移」。没有基线，讨论最后都会变成观点之争。

## 二、第一步：把问题集做成可复用的资产

做法是：从买家会问的话出发，而不是从关键词出发。

示例：假设你卖企业级项目管理 SaaS，题面可能是「预算有限的小团队用什么项目管理工具」，也可能是「有没有支持本地部署的项目管理软件」。这两条意图不同，答案的候选集合通常也不同，要分别记录。

具体规则：

1. 每条题面固定语言、固定措辞、固定标点。中英文算两条不同的题面。
2. 题面数量建议从 10 到 30 条开始，覆盖品类推荐、横向比较、使用场景、替代方案、预算约束等不同意图。不要把多个意图压进一句话。
3. 题面开始记录后冻结。需要调整就新增一条，不要就地修改旧题面。
4. 给每条题面编号，并写一句「这条题面代表什么购买意图」，方便向别人解释。

## 三、第二步：固定所有会变的条件

- **模型组**：例如分一组全球模型、一组中文模型，名单写死，不要中途替换。
- **入口与开关**：是消费端产品还是直接调 API，有没有开联网检索，有没有登录或个性化记忆，全部固定。
- **采样窗**：记录日期与时间段，并写明每条题面采样几次。
- **存档要求**：保留原始答案全文，不要只留一个「有／没有」的打勾。

## 四、第三步：用同一张表记录

建议的列：

date｜model｜query｜language｜entry_retrieval｜mentioned｜shortlisted｜recommended｜reason_owner｜accuracy_notes｜cited_urls｜competitor_set｜uncertainty_notes

其中 reason_owner 记录「推荐理由归谁」，uncertainty_notes 记录「这次结果里解释不了的部分」。这两列在后期做归因时最常被用到。

## 五、第四步：五个数分开算，分母写清楚

提及、推荐、引用、访问、商机必须分开统计，并且每个数字都要能追溯到分母。

示例：假设你用 10 个模型 × 20 条题面 × 每条采样 1 次，一共 200 个「答案位」。结果是：提及 60 次、进入推荐清单 18 次、引用了你的页面 5 次。这三个数不能用一个百分比概括，也不能用「提及 60 次」去说明商机。访问和商机还需要另外的测量方式（例如带参数的链接或分渠道统计），并且要说明仍然存在其他解释来源。以上数字是示例，不是实测结果。

## 六、第五步：只在「已发布的变更」之后复测

复测的前提是：你确实发布了一版可被引用、可核对的事实内容。记录变更的时间戳和 URL，让复测结果能对得上你改了什么。如果只是在内部文档里改了一版，外部世界看不到，复测就没有意义。

## 七、三层工作的区别，最好写进方案里

- **初始信号**：少量固定问题、每条一次采样、少量模型接口。它的作用是看方向，明确不是正式基线。
- **正式基线**：自定义题面、模型与节奏，可以反复复测的完整基线。
- **品牌与产品 GEO 执行**：在基线之上做策略、站点内容与渠道执行，再回到同条件复测验证。

把这三层写清楚，主要是为了避免拿「初始信号」的结果去承诺执行层的效果。

## 八、节奏建议（实践参考，非合同条款）

- 每周：轮换一个子集复测，保持连续性。
- 每月：跑一次全量基线。
- 触发式：竞品有重大发布，或出现错价、停产等事实错误时，立即补测。

## 九、解释结果时怎么说

正确：「在相同题面与相同模型组下，进入推荐清单的比例从 A 变成了 B；这段时间里我们发布了一版事实页；仍有部分模型没有引用该页，原因尚未完全确定。」

错误：「因为我们做了 GEO，所以提升一定是我们带来的。」

前一种说法保留了不确定性，后一种把相关性直接当成了因果。

## 十、什么情况下结论不可用

- 只采样一次就下结论。单次结果只能当信号。
- 改了题面之后仍然称之为「同比」。
- 把模型自身的版本变化当成优化成果。
- 拿别人匿名案例的涨幅当作自己的预期。
- 把某个平台关于抓取与收录的说明，当成所有模型都会推荐你的依据——不同平台的机制并不相通。

## 常见问题

**一个问题只采样一次，够吗？**

作为初始信号可以，但要明确它不代表正式基线。要用于经营判断，需要固定基线和重复采样。

**分母到底该怎么写？**

写成可以复算的形式，例如「模型数 × 题面数 × 采样次数」。任何指标都必须能追到这个分母，否则涨跌无法解释。

Winin 在这件事上的做法，是把监测、事实治理、授权执行和同条件复测放在同一条流程里：先拿到可比的基线，再决定改什么，改完之后用相同条件确认变化。具体范围取决于你的问题集和模型清单。

