本文へ移動
by SAGUS
モデル

「GPT-6 Astra」の高速版がBedrockで利用可能に 料金は標準の6倍

AWSがBedrockでGPT-6 Astraの高速版「Ultrafast」を提供し始めた。応答は最大6倍速くなるが、料金は標準の6倍で、処理は米国内か世界の拠点で行われる。

大きな金貨を屋根に載せて走る小さなレースカー

米AWSは9月30日、「Amazon Bedrock」で米OpenAIの「GPT-6 Astra」を速く動かす「Ultrafast」の提供を始めた。応答の速さが要る用途で、企業はAWSの権限管理と監査の仕組みのまま、OpenAIの最上位モデルを速く動かせるようになる。ただし料金は標準の6倍で、処理は米国内か、世界のどこかの拠点で行われる。日本国内で処理を閉じたい企業は、この区分を使えない。

応答の速さが最大6倍になる

Bedrockでの提供開始を伝えるAWSの告知によると、Ultrafastは「速さが最も重要な処理」向けの上位の料金区分だ。OpenAIの仕様として、API経由の推論が最大6倍速くなり、毎秒最大300トークンを出力すると紹介した。想定する用途には、リアルタイムのコーディング支援、対話型のエージェント、顧客向けのサービスを挙げている。

GPT-6 Astraは、OpenAIが9月に出した最も高性能なモデルである。複雑な推論、コーディング、コンピューター操作、調査、文書作成に向き、一度に105万トークンの入力を扱える。

OpenAIは9月29日、自社のAPIでAstraのUltrafastを提供し始めた。Bedrockでの提供は、その翌日になる。OpenAIの開発者向け変更履歴によると、呼び出しの際に「service_tier」という項目で「ultrafast」を指定すれば切り替わる。

OpenAIのUltrafastの開発者向けガイドによると、AstraのUltrafastはOpenAIのAPIを使う全員に開放されている。ただし当初の利用上限は低く、担当の営業チームがいる企業は引き上げを申請できるという。

料金は標準の6倍に上がる

BedrockのGPT-6 Astraのモデルカードによると、Ultrafastの料金は標準の6倍に設定された。世界のどこにでも処理を振り分ける方式では、100万トークンあたり入力60ドル、出力300ドルかかる。標準ではそれぞれ10ドルと50ドルだ。入力が27万2000トークンを超える長い依頼では、Ultrafastは入力120ドル、出力450ドルに上がる。

OpenAIのAPI料金表も、AstraのUltrafastを入力60ドル、出力300ドルとしている。Bedrockの全世界向けの価格は、OpenAIの価格と同じだ。ところが、処理を米国内にとどめる方式を選ぶと、OpenAIの価格に10%が上乗せされ、入力66ドル、出力330ドルになる。

利用上限の数え方も、モデルカードに書かれている。Bedrockは上限を1分あたりのトークン数で管理し、出力の1トークンを10トークン分として数える。

処理は国内にとどまらない

Bedrockでは、処理する場所を3つの方式から選ぶ。1つの地域に処理をとどめる方式、米国のような地理的な範囲の中で振り分ける方式、世界のどこにでも振り分ける方式だ。モデルカードは、3つ目を「データの所在に制約がない時に使う」方式と説明している。

Ultrafastを使える経路は限られる。米国内で振り分ける方式と、世界に振り分ける方式、それに米国東部(バージニア北部)の拠点に直接送る方式の3つだ。米国西部(オレゴン)の拠点は、標準の速さにしか対応しない。

OpenAIのガイドも、Ultrafastは米国内での処理と全世界での処理にだけ対応すると書く。EUなど、米国以外の地域で処理を閉じる窓口では使えない。

AWSの管理の中で使える

AWSは告知で、Bedrockの推論の仕組みが本番運用に要る性能と安全性、信頼性を備えると説明した。アクセスの統制や、モデルの呼び出しの監査も、AWSのセキュリティ機能で賄えるという。

モデルカードによると、BedrockのAstraはOpenAIのSDKからも呼び出せる。OpenAIのAPIと同じ形式の窓口を持ち、呼び出しの記録や、出力をJSONの型に合わせる機能にも対応する。AWS独自の「Converse API」で呼べば、不適切な入出力を止める「ガードレール」も使える。

つまり、企業は既存のAWSの権限と監査の仕組みのまま、Astraの応答を速くできるようになった。その代わりに料金は標準の6倍になり、処理は日本国内にとどまらない。速さを選ぶことは、費用と処理場所の2つの条件を受け入れることでもある。

編集部の見方

編集部は、今回の発表を速さの数字より、使える条件で読むべきだと見る。最大6倍、毎秒300トークンという数字は、AWSがOpenAIの仕様として紹介したもので、Bedrock上で同じ速さが出るかは告知から読み取れない。一方、料金が標準の6倍になることと、処理が米国内か世界の拠点に限られることは、モデルカードと料金表に明記されている。読者は、応答の速さが成果を左右する用途が本当にあるかを先に決め、その用途で処理が米国内か世界に振り分けられても問題ないかを確かめるとよい。東京や大阪の拠点にUltrafastの経路が加われば、この見方の前提は変わる。

この記事をシェア