本文へ移動
by SAGUS
開発ツールと作り方

ServiceNow、エージェントの「失敗」を学習データに変える 弱点を狙って鍛える

米ServiceNowは、AIエージェントが解けなかった課題を起点に、学習用の課題を自動で作る手法「AutoSynthData」を公開した。業務システムを再現した試験環境では、オープンモデルの正答率が上がった。

しゃがんでパズルの欠けたピースを拾う顔のない人物

米ServiceNowは2026年10月2日、AIエージェント向けの学習データを自動で作る手法「AutoSynthData」を公開した。エージェントを自社の業務に合わせて鍛えるには、弱点に絞った学習データが要る。同社の手法では、その中身を評価の結果から自動で決める。エージェントが解けなかった課題を起点に、同じ力を試す新しい課題を作り、検証してから学習に回す。業務システムを再現した試験環境では、オープンモデルの正答率が上がった。

解けなかった課題が次の学習材料になる

開発したのは、同社のAIチーム「ServiceNow CoreAI」だ。AutoSynthDataの解説記事によると、企業が求めるのは、自社の環境で働けるエージェントだという。その環境は、使っているシステム、守るべき規則、データの状態で決まる。チームは、モデルがつまずく箇所を学習データに変える作業を自動にした。

作業は評価から始まり、鍛えたいモデルに診断用の課題を解かせて、苦手な能力を洗い出す。同じ課題を、手本役になる、より強いモデル「教師モデル」にも解かせ、成功したやり方を集める。これらの結果をまとめたのが、身につけるべき能力、使うツール、成功の条件を書いた「能力の仕様カード」だ。

新しい課題は、システムの設定、利用者の依頼文、正否を判定する検証の手順の3つで1組になる。生成は2段階で、まず仕様カードから中心となる課題を作る。次に、合格した課題の依頼文や初期の状態を変えて、別の課題に増やしていく。学習を終えたモデルは評価し直し、残った弱点に合わせて方針を変えながら繰り返す仕組みだ。

試験の問題は学習に使わない

課題を作る側には、点数を測るための元の課題について、依頼文、登場するデータ、解き方、検証の中身を渡さない。渡すのは、中身を伏せた能力の仕様カードだけだ。つまり、点数を測る課題と、学習に使う課題が分かれている。

品質の確認は2段構えで、まず1件ごとに、想定した解き方で課題が解けるか、誤った結果がきちんと不合格になるかを確かめる。通らない課題は、回数に上限を設けたうえで、批評と修正にかけられる。さらに一定の件数がたまるごとに、似た課題に偏っていないか、抜けた能力がないかを調べ、次の生成の方針を変える。

正答率は7.2ポイント上がった

試験の場には、ServiceNowが2026年3月にEnterpriseOps-Gymの論文で発表した評価環境を使った。論文によると、外から切り離した試験用の環境に164のデータベースの表と512のツールを用意し、顧客サービス、人事、ITなど8分野の課題を1000件余り収める。14のモデルを試したところ、首位の米Anthropicの「Claude Opus 4.5」でも成功率は37.4%にとどまった。EnterpriseOps-Gymのデータセットは、Apache 2.0のライセンスで公開されている。

鍛える対象には、米Googleのオープンモデル「Gemma-4-26B-A4B-it」を選んだ。複数の分野のツールをまたいで使う「Hybrid」の分野では、教師モデルを「Qwen3.8-27B」とし、約18時間で2000件の課題を作っている。この2000件で追加学習させると、1回目で正解する率 (Pass@1) の平均が7.2ポイント上がった。学習前と比べて35%の伸びで、基準にしたモデルとの点差のうち59%を縮めたという。

IT運用の分野「ITSM」では、教師モデルを「DeepSeek-V4.1-Flash」に替え、66時間で1994件を作った。Pass@1は18.77%から27.18%に上がった。Hybridより時間がかかったのは、より大きな教師モデルを使い、処理を速める改良を入れる前に実行したためだという。

効果を確かめた範囲は限られる

今回の実験は、正解の例を見せて学ばせる教師あり学習 (SFT) に限られる。解説記事は、同じ仕組みを強化学習にも使えるとし、モデルの実力に合わせて難しさを変えながら課題を作る方法を、SFT以外でも試す計画だと書く。

解説記事は、手法のコードの公開や、同社の製品への組み込みに触れていない。他の学習データの作り方と比べた数字や、基準にしたモデルの名前も載っていない。結果について記事は、条件を管理した試験環境でのものだと断る。

ServiceNowが公開したのは、エージェントの失敗を評価で見つけ、そこを狙った課題を作って学ばせ、測り直す手順だ。学習に使う課題の中身は、評価の結果から決まる。

編集部の見方

編集部は、エージェントの品質を決めるのは評価の設計だと見る。AutoSynthDataでは、評価で見つけた失敗から学習用の課題が作られ、課題ごとに正否を判定する検証の手順が付く。つまり、評価をどう組むかで、何を学ばせるかが決まる。自社でエージェントを鍛えたい企業は、まず自社の業務で「できた」と判定する手順を書けるかを確かめるとよい。ただし数字はServiceNow自身の評価環境での結果で、他の作り方との比較もない。自社の環境で同じ伸びが出るかは、まだ分からない。

この記事をシェア