NEWLAB.SI

BENCHMARK PROTOCOL · v0.1 · 2026-10-09

Work Agent Reality Index

AIエージェントは回答だけでなく実務を最後まで完了できるのか。成果物、失敗、人の介入、費用、所要時間を検証する計画です。

候補12件 · 完了した比較実行0件

現在は評価手順の草案です。これらのタスクを実行したエージェントはまだありません。データと検証器は未確定で、順位もありません。

評価方法

手順:データと検証器を固定し、各エージェントを新しいコンテキストで3回実行。成果物と安全性を検証し、失敗を含む全記録を公開します。

成功判定には成果物の独立検証が必要です。エージェントの自己申告は根拠になりません。

候補タスクの分類

リポジトリ作業

REP-01

失敗する回帰テストを修正

REP-02

設定を安全にリファクタリング

REP-03

READMEとCLIの不一致を修正

ブラウザーと技術文書

WEB-01

API文書の矛盾を解決

WEB-02

日時を指定した機能比較を検証

WEB-03

API移行手順を調査

調査から成果物へ

ART-01

出典付きCSVを作成

ART-02

相反する証拠を要約

ART-03

正しい数式の表計算を作成

複数ツールと継続性

CROSS-01

デプロイせず公開前監査

CROSS-02

模擬画面とCSVの差異を確認

CROSS-03

中断した複数段階の作業を再開

公開プロトコル

候補タスク一覧(JSON)

Full protocol / 完整方法 / 詳細手順