研究目标
估计不同企业可控 AI 就绪能力与实际 AI 呈现结果的分布,并检验哪些能力指标能够跨行业、语言与模型变化保持可靠。
计划分层
行业
B2B 科技、专业服务、金融、医疗、制造与消费服务;证据规则不同时分别报告。
市场与语言
覆盖英文与简体中文任务,并分别记录国家和地区影响。
企业规模
依据公开运营规模分层,而不是凭官网是否精美来猜测。
证据成熟度
从事实分散到建立统一、带版本的证据系统。
AI 呈现
跨多个模型、时间和联网方式重复测试相同任务。
Agent 能力
是否具备有明确文档、经过管理的操作、API 和机器可读接口。
校准设计
- 试点在优缺点已知的样本中测试评分规则。
- 双人复核比较两位审核者的判断,对重要结论进行复核。
- 稳定性通过多次测试,判断网站和模型自身的正常波动。
- 实际价值验证能力指标能否预测后续实际结果。
- 固定版本固定评估方法,说明适用范围并保留原始记录。
参与与发布
参与企业需要允许测试公开网站、指定事实负责人,并约定匿名方式。评分依据统一标准执行,利益关系、赞助和排除项会随报告说明。
当前状态:正在完善研究方案并招募试点,首批基准数据将在采集和复核完成后发布。