一套方法,三套产品各负其责。
01 · 观察
Edith 监测与复测
保存问题、模型条件、原始回答、回答中展示的来源、正式基线和同条件复测。
了解 Edith →02 · 对齐Homer 管理事实与版本
管理来源、冲突、负责人、市场、获批版本、有效期和公开权限。
了解 Homer →03 · 推进Friday 推进获授权工作
记录有证据的任务、具名审批、实际发布的核验记录、内容版本和回滚信息。
了解 Friday →共同协议:方法版本、评估方式、人工复核、资格状态和适用范围由三套产品共同遵守。
测量原则
分开不同结果
企业能力、AI 实测结果和运营成熟度分别报告。
保留原始记录
每个结论都能追溯到来源、回答或测试记录。
记录版本变化
问题集、模型、评估方式、权威事实和评分规则都有生效日期。
判断变化是否稳定
通过多次测试判断变化的幅度、一致性和持续性。
建立比较基准
所有改动都对照保留的基线和相关比较任务。
说明适用范围
说明覆盖范围、数据充分度和复核状态,让结论更容易用于决策。
证据记录包含什么
| 记录 | 主要负责 | 可回查内容 |
|---|---|---|
| 问题与运行 | Edith | 客户问题、语言、模型、模式、检索状态和时间 |
| 模型测试 | Edith | 原始回答、回答中展示的来源、拒答、工具调用和运行状态 |
| 事实决定 | Homer | 来源、候选、冲突、负责人、获批版本和有效期 |
| 任务与发布 | Friday | 发现、任务、内容版本、批准人、目标网址和发布核验 |
| 同条件复测 | Edith | 匹配的测量合同、比较记录和边界清楚的结论 |
如何持续校准
- 基准样本维护优点、缺陷和已知改动都清楚的网站。
- 人工复核重要信息由两人分别评分,再处理判断分歧。
- AI 评估只在可靠性经过验证的任务中使用带版本的 AI 评估。
- 在线验证比较预期改善与重复实测结果。
- 回归测试模型、爬虫或规则变更后重跑固定任务。
方法变更政策
方法版本不会在无人知晓的情况下被替换。重大改动会发布新版本、迁移说明与验证结果;历史报告保留生成时的规则和系统。
当前公开状态:V1 研究协议。权重校准与跨行业基准数据仍在持续验证。