本文へ移動
by SAGUS
モデル

CoreWeaveが「Vera Rubin」を本番提供 4.8倍は顧客1社の自社計測

米CoreWeaveが米NVIDIAの新世代AIサーバー「Vera Rubin NVL72」の提供を始め、最初の本番顧客の米Cognitionは処理量が最大4.8倍になったという。この数字は稼働直後のクラスタで1社が自社の処理を測った結果で、誰がどう測ったかを切り分けて読む必要がある。

サーバーの基板の上に斜めに置かれた木製の定規。重ねた文字は「CoreWeave」と「4.8倍は顧客1社の自社計測」。

米CoreWeaveは2026年9月30日、米NVIDIAの新世代AIサーバー「Vera Rubin NVL72」の提供を始めたと発表した。最初に本番の処理を載せたのは、コーディング用のAIエージェントを手がける米Cognitionで、前世代と比べてトークンの処理量が最大4.8倍になったという。ただしこの数字は、9月上旬に立ち上げたクラスタで、Cognitionが自社の処理を測った1社の結果だ。数字を読む時は、誰がどの処理で測ったかを切り分ける必要がある。

最初の本番顧客はCognition

CoreWeaveは、AI専用に作ったクラウドを提供する会社だ。Vera Rubin NVL72の提供開始の発表によると、発表の場はサンフランシスコで開いた自社の会議「Fully Connected」だった。

Cognitionは、このシステムで本番の処理を動かす「世界で最初の顧客」だ。CoreWeaveで製品と技術を統括するChen Goldberg氏は、同社の投資の成果をこう述べた。Cognitionのような顧客が「数日のうちに本番の処理を動かせる」点に表れているという。

Vera Rubin NVL72は、NVIDIAの新世代GPU「Rubin」72基とCPU「Vera」36基を1つのラックに収めたシステムだ。NVIDIAのVera Rubin NVL72の製品ページは、1つ前の世代のGB200 NVL72と比べて性能を示している。CoreWeaveは2026年6月、Vera Rubin NVL72の立ち上げと検証を終えたと伝える発表で、AIクラウドの事業者として最初だと説明していた。

NVIDIAは同日、CoreWeaveとの協業を伝えるブログを公開した。ブログによると、ネットワークにはNVIDIAの「Spectrum-X」のEthernet (102.4T) を使う。

4.8倍は顧客が自ら測った値

Cognitionは9月上旬、CoreWeaveと組んでVera Rubin NVL72のクラスタを立ち上げた。CoreWeaveの発表によると、Cognitionの技術者が自ら推論の性能を測り、GB200 NVL72のクラスタを比較の基準にした。顧客が自分で実行したVera Rubinの推論の計測は、これが初めてだという。

測った処理は、Cognitionのコーディング用モデル「SWE-2」の推論だ。NVIDIAのブログによると、ソフトウェア開発の課題集「FrontierCode」から一部の課題を抜き出し、AIエージェントに解かせて負荷を作った。結果は、処理したトークンの総量で最大4.8倍だった。CoreWeaveの発表文は本文で「4.8倍」と書くが、同じ発表に載ったCognitionの研究責任者Silas Alberti氏の発言は「最大4.8倍」としている。

つまり、この4.8倍は、1社が自社の処理で、立ち上げ直後のクラスタを測った結果だ。NVIDIAが製品ページに載せる数字とは、測り方が違う。

製品ページは、電力1メガワットあたりのトークン数が最大10倍、100万トークンあたりの費用が10分の1になるとしている。費用の数字は、別のモデル (Kimi-K2-Thinking) でGB200 NVL72とVera Rubin NVL72を比べた値だ。ページは、推論の性能が今後変わりうるとも注記している。どちらもCognitionの計測とは指標が違い、費用の数字はモデルも違うため、二つの倍率は並べて比べられない。

Alberti氏は、NVIDIAのブログでこう語った。「一つの基盤にすべてがそろい、NVIDIAとCoreWeaveの技術者が難しい問題に一緒に取り組むことが、どんな単体の仕様よりも重要だ」。今回の発表に、CoreWeaveでの利用料金は示されていない。

エージェントの実行環境も速く

NVIDIAは同じ場で、CPU「Vera」をCoreWeaveのクラウドに出すと明らかにした。NVIDIAはVeraを「AIエージェントのために作った最初のCPU」と呼ぶ。提供の時期は示していない。

CoreWeaveは、エージェントが処理を動かすための、外から切り離した実行環境「サンドボックス」を提供している。NVIDIAのブログによると、CoreWeaveの計測で、Vera CPU上ではこのサンドボックスの起動が3倍以上速くなった。評価用の課題集「Terminal-Bench」でも、解けた課題全体で1.7倍の性能向上が出たという。

つまり、エージェントの速さはGPUの推論だけでは決まらない。両社は、実行環境の立ち上げのようなCPU側の処理も、速くする対象に含めた。

作る・測る・直すを一つの場所で

CoreWeaveは同日、モデルとエージェントを開発する環境「CoreWeave Forge」も発表した。CoreWeave Forgeの提供開始を伝える発表によると、Forgeは訓練・推論・評価・エージェント開発を、1つのつながった環境で扱う。Weights & Biasesの実験管理、OpenPipeの追加学習の知見、オープンソースのノートブック「marimo」を、自社のサービスとまとめた。

中身には、本番で動くエージェントの挙動を見る新しい道具「Agent Lens」や、正式提供に入ったサンドボックスがある。CoreWeave自身のコーディングエージェント「ARIA」も正式提供に入り、実験結果の分析を手伝う。強化学習や蒸留などの追加学習を、サーバーを管理せずに回す機能も入る。料金はFree、Pro、Enterpriseの3段階で、Proは30日間無料で試せる。

同社は、開発の道具が別々の会社に分かれ、本番の記録が次の訓練に生かされない点を課題に挙げる。Goldberg氏は、技術者は「実際の運用条件の下で、変更が効いたかを測る」必要があると述べた。

Vera Rubin NVL72は本番で動き始めたが、4.8倍は顧客1社が自社の処理で測った最初の値だ。数字を読む時は、誰がどの処理で測ったかを切り分ける必要がある。

編集部の見方

編集部は、4.8倍という数字を、新世代で一律に速くなる証拠ではなく、1社が自社の処理で測った結果として読むべきだと見る。測ったのは立ち上げ直後のクラスタで、指標はトークンの総量だ。製品ページの10倍は別の指標による値で、推論の性能は変わりうると注記されており、両者は比べられない。読者が確かめたいのは、自社で動かすエージェントの処理がCognitionの例に近いかと、いくらで使えるかだ。料金が示されていない今は、提供条件がそろってから自社の業務で測り直すのが順番になる。ほかの利用者の計測でも同じ程度の伸びが続けば、この見方は改める。

この記事をシェア