先明确测试的是哪个 AI 入口
| 入口 | 主要测试什么 | 需要注意什么 |
|---|---|---|
| 闭卷模型 API | 模型本身掌握的知识 | 不等同于面向消费者的联网搜索产品 |
| 带检索的 API | 模型与指定搜索工具的组合 | 结果会受到搜索源、工具和具体设置影响 |
| 消费者 AI 产品 | 客户可能实际使用的产品体验 | 账号、地区、个性化和产品更新可能影响回答 |
| 搜索引擎 AI 功能 | 基于搜索索引生成的答案 | 收录和展示方式会随市场与问题变化 |
这些入口要分开统计。每次测试都记录供应商、使用入口、模型版本、联网状态、账号类型、语言、地区和时间。
从客户真实决策生成问题
身份理解
品牌是谁,具体提供什么?
品类发现
不写目标品牌时,哪些企业或产品进入候选?
场景适配
具体客户、任务或限制条件下,什么方案合适?
比较选择
目标与指定替代方案有什么差异?
证据来源
重要主张由哪些来源支持?
风险边界
什么情况下产品或服务并不适用?
带品牌名的问题测量理解准确度;不带品牌名的品类和场景问题测量发现与候选机会。两者必须使用不同样本范围。
中国市场怎样选择模型
中文项目优先围绕 DeepSeek、Kimi、Qwen(通义千问)、GLM、豆包和 MiniMax 等中国市场常用模型与产品入口设计监测。最终范围取决于客户所在市场和目标用户真正使用什么,不用固定模型清单代替项目合同。
每次运行都记录供应商、具体模型或产品入口、联网状态、语言、市场和时间。中文问题要独立设计和测试,不能把英文翻译当成等价测试。
每次测试至少保留什么
- 固定的问题类型、完整问题原文和版本编号
- 供应商、使用入口和可确认的模型版本
- 联网状态、账号类型、语言、地区和时间
- 完整原始回答和回答中展示的来源网址
- 调用失败、拒答、限流和未展示引用等运行状态
- 分别判断品牌提及、事实支持、进入候选、推荐和引用
- 运行编号和重复测试序号
看长期变化,不看单次截图
同一个问题要多次测试,再按问题类型比较模型。每个比率都同时展示样本量。问题、模型、联网方式或评分规则改变时,重新开始一段记录,保证前后数据可以解释。
每轮监测都要给出下一步行动:继续观察、纠正事实、改进页面、加强信源,或进一步调查新问题。这样监测结果才能真正进入日常运营。
继续了解测量方法
查看 GEO 效果怎么衡量与 Winin 测量方法论,了解样本范围、优化前基线和复测要求。