本文へ移動
by SAGUS
開発ツールと作り方

エージェントの「完了」報告は記録と食い違う Microsoftが20回ずつ試して示す

米Microsoftと米Hugging Faceが、AIエージェントをデータベースに残った記録で採点する評価環境「ThinkingBox」を公開した。同じ業務を20回解かせると首位級のモデルでも全回成功したタスクは半分に届かず、1回の成功では本番で頼れるかが分からないことが分かった。

緑のチェック印が押されたのに、罫線の中身が空のままの帳簿のページ

米Microsoftと米Hugging Faceは2026年10月3日、AIエージェントの評価環境「ThinkingBox」を公開した。エージェントが「完了」と報告しても、業務の記録が正しく書き換わっているとは限らない。1回うまくいったエージェントが、次も同じ仕事をこなすとも限らない。ThinkingBoxは、業務の記録を収めたデータベースが最後にどうなったかで採点する。507件の業務を20回ずつ解かせると、1回あたりの成功率が首位級のモデルでも、20回すべて成功したタスクは半分に届かなかった。

報告は正しくても記録が違う

ThinkingBoxを紹介する公式ブログは、冒頭で顧客対応の事例を挙げる。745ドルの家電が、配送の例外処理で15日間止まっていた。エージェントは9回のツール呼び出しを正しくこなした後、チケットを「解決済み」で閉じた。ところが本来は、運送会社の対応を待つ「保留」にすべき案件だった。

ブログによると、ツール呼び出しを点検するAIの採点役には、9回とも正しい呼び出しに見える。誤りが残っていたのは、データベースの記録のほうだ。

ThinkingBoxは、作業が終わった後のデータベースの状態と、そこに残った変更で合否を決める。507件のうち477件は記録の状態だけで採点し、残る30件には応答の中身を問う基準も加えた。書き込みの誤り、書き忘れ、余計な書き換えのどれかがあれば不合格になる。

20回試して安定ぶりを見る

ベンチマーク「ThinkingBox-Bench」は、小売、自動車保険、旅行、ネット銀行、コンサルティングの5分野で、計507件のタスクをそろえた。どのタスクも、記録を書き換えながら進む業務の流れを再現している。エージェントは、AIと外部のツールをつなぐ標準の手順「MCP」を通じて業務システムを操作する。タスクは実在の業務の型をもとに作った架空のもので、登場する顧客も実在しない。

各タスクは、同じ初期状態から20回ずつ実行する。試行のたびにまっさらなデータから始めるので、前の試行の影響は残らない。結果は、1回あたりの成功率 (pass@1)、20回のうち1回でも成功したタスクの割合 (pass@20)、20回すべて成功したタスクの割合の3つで示す。評価したのは18モデルで、これとは別に、12モデルについて条件をそろえた比較もした。

ThinkingBoxのコードはMITライセンス、ベンチマークのデータセットはCDLA-Permissive-2.0で公開された。Hugging Faceの評価環境「OpenEnv」からも動かせる。

1回の成功と安定は別物だ

18モデルのうち、1回あたりの成功率が最も高かったのは米AnthropicのClaude Opus 5.5で、67.16%だった。Claude Opus 5が66.50%、米OpenAIのGPT-5.4が65.36%で続く。ところが20回すべて成功したタスクに絞ると、Opus 5.5とOpus 5はともに241件 (47.53%) で、半分に届かない。GPT-5.4は128件 (25.25%) まで下がった。

ThinkingBoxの論文も要旨で、Opus 5が66.50%から47.53%に下がる点を挙げた。GPT-6 Astraは1回あたりの成功率こそ58.31%だが、20回すべて成功したタスクは231件 (45.56%) ある。20回続けても1回あたりの成功率の大半を保てたのは、GPT-6 Astra (78%) とOpus 5.5、Opus 5 (ともに71%) の3つだけだ。分野でも差が大きく、各モデルの平均は小売が59.52%、自動車保険が33.83%だった。

差が最も目立つのは、重みを公開したモデル「オープンウェイト」の中で首位のKimi-K3だ。507件中476件 (93.89%) を少なくとも1回は解いたが、20回すべて成功したのは68件 (13.41%) にとどまる。ブログは「1回うまくいけば、そのモデルが仕事をこなせることは分かる。また同じようにこなすかは分からない」と指摘した。

失敗はエラーを出さずに起きる

12モデルについて条件をそろえて比べると、12万1680回の試行のうち7万9853回が記録の検査で不合格だった。その67.24%は、正常に終わり、データを書き換えるツールを呼び、最後のツール呼び出しでもエラーを出していない。つまり、エラーの記録を見張るだけでは、失敗の3回に2回を見逃す。

検査で見つかった誤りを分けると、書き込んだ値の誤りが77.61%、意図しない余計な書き換えが43.30%、必要な書き込みの漏れが25.36%だった。1回の失敗が複数に当たることがあるため、合計は100%を超える。

安く見えるモデルが高くつく

費用の比べ方を変えると、最も安いモデルが入れ替わる。1回の成功あたりの費用が最も安いのはGPT-5.6 Solの0.127ドルで、GPT-5.4は0.131ドル、Opus 5.5は0.276ドルだった。20回分の費用を、20回すべて成功したタスクの数で割ると、GPT-5.4が6.80ドルで最も安く、Opus 5.5は7.80ドルになる。1回あたりで最安だったSolは9.76ドルかかり、GPT-5.4とOpus 5.5を上回った。

20回すべて成功したタスクは、Opus 5.5の241件に対し、GPT-5.4は128件、Solは82件にとどまる。つまり、1回あたりの費用が安くても、毎回解けるタスクが少なければ、そのタスク1件あたりでは高くつく。

ブログは「正しい答えを最も安く得る方法は、頼れる答えを最も安く得る方法ではない」と書く。そのうえで、正常に終わったのに失敗した実行を1つ選び、データベースで実際に何が変わったかを見るよう勧めた。何回試し、何回中何回の成功を数えたのかを明記することも求めている。

ThinkingBoxの数字は、1回の成功率で選んだモデルが、毎回同じ仕事をこなすとは限らないことを示した。エージェントは「完了」の報告ではなく記録の中身で、1回ではなく繰り返しで測らなければ、本番で頼れるかは分からない。

編集部の見方

編集部は、エージェントの評価は1回の成功ではなく、完了の定義と繰り返しの測定で組み立てるべきだと見る。ThinkingBoxは「解決済み」と「保留」の違いのように、何をもって完了とするかを記録の状態で定め、20回の結果で安定ぶりを測った。自社でエージェントを試す時も、完了した状態を先に書き出し、同じ業務を何度か流して、報告ではなく記録を確かめるとよい。エラーを出さずに終わる失敗が多い以上、人が記録を確かめる工程も残す必要がある。ただしタスクはすべて架空のもので、自社の業務で同じ差が出るかはまだ分からない。

この記事をシェア