可复现评测

评测方法

AI之上如何设计统一任务、记录版本与环境、计算结果并发布可验证证据。

先定义问题,再选指标

每次横评先明确读者的实际决策,再选择能够回答该问题的任务。不同题材使用不同任务,不把通用跑分生搬到所有产品。

测试记录的最低要求

  • 测试日期、产品与模型版本、工具版本。
  • 机器、操作系统、运行时、网络区域及关键配置。
  • 测试仓库或公开输入、统一提示词、任务描述和失败判定。
  • 每次运行的原始输出、耗时、Token、估算成本和人工干预次数。
  • 成功率、首次完成率和自动修复成功率使用分子/分母展示。

评分

分数必须由公开的权重和原始结果计算。数据不足、候选版本不一致或任务无法公平执行时,不给综合分,只呈现事实差异。成本估算必须注明使用的官方价格与核验日期。

证据

  • 真实界面截图保留可识别版本信息并遮盖账号、密钥和隐私数据。
  • 终端记录、Git Diff、失败输出和请求日志与结论一并保存。
  • 架构图标为示意图;图表由公开数据集生成,不手动画柱高。
  • 无法访问付费功能时明确写“未测试”,不以官方演示替代第一手证据。