BENCHMARK PROTOCOL · v0.1 · 2026-10-09
Work Agent Reality Index
AIエージェントは回答だけでなく実務を最後まで完了できるのか。成果物、失敗、人の介入、費用、所要時間を検証する計画です。
候補12件 · 完了した比較実行0件
現在は評価手順の草案です。これらのタスクを実行したエージェントはまだありません。データと検証器は未確定で、順位もありません。
評価方法
手順:データと検証器を固定し、各エージェントを新しいコンテキストで3回実行。成果物と安全性を検証し、失敗を含む全記録を公開します。
成功判定には成果物の独立検証が必要です。エージェントの自己申告は根拠になりません。