可复现评测
评测方法
AI之上如何设计统一任务、记录版本与环境、计算结果并发布可验证证据。
先定义问题,再选指标
每次横评先明确读者的实际决策,再选择能够回答该问题的任务。不同题材使用不同任务,不把通用跑分生搬到所有产品。
测试记录的最低要求
- 测试日期、产品与模型版本、工具版本。
- 机器、操作系统、运行时、网络区域及关键配置。
- 测试仓库或公开输入、统一提示词、任务描述和失败判定。
- 每次运行的原始输出、耗时、Token、估算成本和人工干预次数。
- 成功率、首次完成率和自动修复成功率使用分子/分母展示。
评分
分数必须由公开的权重和原始结果计算。数据不足、候选版本不一致或任务无法公平执行时,不给综合分,只呈现事实差异。成本估算必须注明使用的官方价格与核验日期。
证据
- 真实界面截图保留可识别版本信息并遮盖账号、密钥和隐私数据。
- 终端记录、Git Diff、失败输出和请求日志与结论一并保存。
- 架构图标为示意图;图表由公开数据集生成,不手动画柱高。
- 无法访问付费功能时明确写“未测试”,不以官方演示替代第一手证据。