BENCHMARK PROTOCOL · v0.1 · 2026-10-09
Work Agent Reality Index
AI Agent 能不能把真实工作交付完,而不仅是回答问题?我们准备检查最终文件、失败原因、人工介入、成本与耗时。
12 个候选 · 0 次已完成对比测试
当前仅为方法草案,尚未让任何 Agent 运行这些任务。测试数据和验收器还未冻结,没有排名。
评测方法
方法:先冻结测试数据和验证器;每个 Agent 独立运行三次;检查交付物与安全边界;公布全部运行记录及不确定性。
成功必须由独立的产物验证确定,不能采信 Agent 自称成功。