Google、「Gemini 4 Argon」を防御側に先行提供 一般向けは時期未定
米Googleは新しい最上位モデル「Gemini 4 Argon」を発表し、まず審査を通ったサイバー防御の組織に提供した。比較表の多くで首位に立つが、一般向けの提供時期は示されておらず、数字の多くは各社の自己申告だ。

米Googleは2026年9月30日、新しい最上位モデル「Gemini 4 Argon」を発表した。最初に使えるのは、同社が審査したサイバー防御の組織と、一部の試験利用者に限られる。同社の比較表では19項目のうち13項目で単独首位に立ち、出力できる量の上限も100万トークンに広がった。ただし比較に使った他社の数字の多くは、各社の自己申告だ。一般の開発者や企業が自社の業務で試せる時期も、まだ示されていない。
まず使えるのはサイバー防御の組織
Google DeepMindの上級副社長でチーフAIアーキテクトのKoray Kavukcuoglu氏が、発表ブログ「Gemini 4 Argon: our next era of frontier intelligence」で新モデルを公開した。ブログによると、Argonは長く複雑な作業を通して深く推論するよう作られ、ソフトウェア開発、法務や財務の知的作業、サイバー防御を得意とする。出力の上限は従来の6万4000トークンから100万トークンに増えた。社内では数千人の社員がすでに使っているという。
最初の利用者は、一部の試験利用者と、「Fairwind Program」の説明ページが定める組織だ。対象は各国の政府とサイバー当局、医療・通信・エネルギー・金融網などの重要インフラ事業者、主要な技術基盤の企業、防御を研究する大学である。Googleは応募した組織の経歴を調べる。使えるのは、許可を得た攻撃の模擬やマルウェア解析など、防御と研究の目的だけだ。参加組織は世界で650を超え、アクセスの共有や転売は認めていない。
発表ブログによると、Googleはこれらの組織と自社のチームに、サイバー分野の安全制限を外した版を出す。Argonは重大な脆弱性を自ら見つけ、確かめ、修正までできる。世界の病院で使われる医療ソフトから、個人情報が漏れる重大な脆弱性を見つけた例もある。
一般の開発者や企業には、有料のAPI利用者と上位プラン「Google AI Ultra」の契約者から「できるだけ早く」広げるとした。具体的な時期は示していない。広く出す前に、有害な依頼の拒否、社内外の専門チームによる攻撃試験、モデルの思考と行動の監視などの対策を重ねるという。
13項目で首位、5項目は他社が上
Googleは評価資料「Gemini 4 Argon Model evaluation」で、米OpenAIの「GPT-6 Astra」、米Anthropicの「Claude Fable 5.1」と「Claude Opus 5.5」と19項目を比べた。Argonは13項目で単独首位、1項目で同率首位となった。残る5項目では他社が上回っている。
差が大きいのは業務の自動化と法務だ。米Zapierが作る、業務の流れを最初から最後まで実行させる「AutomationBench」では、Argonが51.3%で、2位のOpus 5.5の42.5%を引き離した。米Harveyの法律事務の指標でも、Argonの19.6%に対し、他の3モデルは7%に届かない。金融・法務・税務などの仕事をまとめて測る「Vals Index」も68.9%で首位だった。
一方、コーディングの評価は割れた。実際の開発作業を測る「DeepSWE v1.1」では、Argonが77.9%で首位に立った。ところが端末の操作で課題を解く「Terminal-bench 4.0」では57.4%で、Opus 5.5の66.4%に9ポイント届かない。パソコンの画面を操作する「OSWorld-2.0」でもGPT-6 Astraが上回った。
長い文書の扱いでは差が開いた。25万6000〜100万トークンの長さの問題を解く「GraphWalks」の区分で、Argonは84.2%と、2位のGPT-6 Astraの71.8%を上回る。サイバー分野の「CWE-bench」は68.0%で、GPT-6 Astraと同率首位である。
比較の数字は誰が測ったかで違う
評価資料の注記によると、他社モデルの数字は原則として各社が自ら公表した値を引いている。Argonの数字は、GoogleがGemini APIで最も深く考える設定にして測った。たとえばDeepSWEは、Argonが自社計測、GPT-6 Astraが公開ランキング、Claudeの2モデルがAnthropicの技術文書の値だ。つまり同じ表の中に、測った人も条件も違う数字が並んでいる。
第三者の測定もある。調査会社Artificial Analysisは独自の総合指標による評価で、Argonを53点とした。GPT-6 Astraの最上位設定と同点で、「GPT-6.1 Sol」を1点上回る。誤った答えをもっともらしく返す割合 (ハルシネーション率) は15%で、GPT-6 Astraの51%を大きく下回った。ただし同社も、Argonは一部の利用者に順次提供している段階で、一般には使えないと記している。
1回の作業の費用は出力量で決まる
料金は導入価格で、入力100万トークンあたり2ドル、出力は10ドルだ。同じ入力を再利用する分 (キャッシュ) は、入力の価格から95%引きになる。導入期間が終わると入力4ドル、出力20ドルに上がるが、いつ終わるかは示していない。
Artificial Analysisの測定では、Argonは1つの課題に平均6万2000トークンを出力した。GPT-6 Astraの2万7000トークンの2倍を超える量だ。このため1課題あたりの費用は、導入価格なら1.99ドルでGPT-6 Astraの3.26ドルを下回るが、通常価格では3.98ドルと上回る。Googleは、1回の作業で数十万トークンを出力して深く考えられるようにするため、上限を広げたと説明している。
Argonは多くの比較で首位に立ったが、今使えるのは審査を通ったサイバー防御の組織と、一部の試験利用者だけだ。比較の数字は測り方がそろっておらず、一般向けの提供時期も、導入価格がいつ終わるかも、まだ示されていない。
編集部の見方
編集部は、Argonの数字を「誰が測り、いつ・いくらで使えるか」で読むべきだと見る。比較表には自社計測と他社の自己申告が混ざり、一般向けの提供時期も導入価格の終わりも示されていない。費用も、出力が多ければトークン単価の安さだけでは決まらない。読者が今決めるのは、乗り換えるかどうかではない。提供が始まった時に、自社の業務の課題を数件用意し、正答率と1件あたりの費用を手元で測り直せる準備だ。通常価格の時期や提供範囲の広がり方によっては、この比較の結論は変わり得る。
出典
- 発表ブログ「Gemini 4 Argon: our next era of frontier intelligence」(blog.google)
- 「Fairwind Program」の説明ページ(deepmind.google)
- 評価資料「Gemini 4 Argon Model evaluation」(storage.googleapis.com)
- 「Vals Index」(vals.ai)
- 「CWE-bench」(cwe-bench.com)
- 独自の総合指標による評価(artificialanalysis.ai)



