NEWLAB.SI

BENCHMARK PROTOCOL · v0.1 · 2026-10-09

Work Agent Reality Index

AI Agent 能不能把真实工作交付完,而不仅是回答问题?我们准备检查最终文件、失败原因、人工介入、成本与耗时。

12 个候选 · 0 次已完成对比测试

当前仅为方法草案,尚未让任何 Agent 运行这些任务。测试数据和验收器还未冻结,没有排名。

评测方法

方法:先冻结测试数据和验证器;每个 Agent 独立运行三次;检查交付物与安全边界;公布全部运行记录及不确定性。

成功必须由独立的产物验证确定,不能采信 Agent 自称成功。

候选任务分类

代码仓库交付

REP-01

修复失败的回归测试

REP-02

安全重构配置

REP-03

修正文档与 CLI 不一致

浏览器与技术文档

WEB-01

解决 API 文档冲突

WEB-02

核对指定日期的功能对比

WEB-03

梳理 API 迁移

研究到交付文件

ART-01

生成有来源的 CSV

ART-02

总结互相矛盾的证据

ART-03

制作公式正确的工作簿

跨工具与长任务

CROSS-01

不部署的发布前审计

CROSS-02

核对模拟界面和 CSV 数据

CROSS-03

恢复中断的多阶段任务

公开测试方案

候选任务清单(JSON)

Full protocol / 完整方法 / 詳細手順