OpenAIがUltrafast modeをプレビュー公開|「最大14倍速」は業務のどこに効くのか

OpenAIは2026年8月13日、APIに新しいサービスティア「Ultrafast mode」をプレビュー公開しました。最上位モデルのGPT-5.6 SolをCerebrasのハードウェア上で動かし、標準処理に対して最大14倍、最大750出力トークン/秒で生成するというものです。数字だけを見ると強烈ですが、この手の発表でいちばん誤解されやすいのが「速い」の中身です。LLM APIのレイテンシは複数の要素の足し算でできていて、Ultrafastが縮めるのはそのうちの一部でしかありません。この記事では、公式ドキュメントとアナウンスで確認できる事実を先に固めたうえで、出力トークン生成速度が上がると本当に体感が変わる処理と、ほとんど変わらない処理を切り分けます。GPT-5.6ファミリーの価格改定そのものについては別記事で扱っているため、ここでは「レイテンシとスループットを軸にしたサービスティアの選択」に絞ります。
何が発表されたのか
事実関係を先に固めます。OpenAIの公式チェンジログには2026年8月13日付で、GPT-5.6 Sol向けの新しいAPIサービスティアとしてUltrafast modeを告知し、標準処理に対して最大14倍速で動作するという趣旨の記載があります。同日にOpenAI Developer Communityへ投稿された公式アナウンスでは、Ultrafastは「GPT-5.6 Solを標準処理の最大14倍で動かす新しいサービスティア」であり、「Cerebrasによって提供され、最大750出力トークン/秒を生成できる」と説明されています。提供形態は「まずOpenAI APIから」で、「現時点では一部の顧客に対する限定プレビューとして提供され、キャパシティの拡大に応じてアクセスを広げていく」とされています。
ハードウェア側の説明は、同じ2026年8月13日付でCerebrasが自社ブログに公開しています。同社のWafer-Scale Engineアーキテクチャを使い、ウェハーサイズのチップ1枚あたり44GBのSRAMを搭載する構成でGPT-5.6 Solを動かす、という内容です。従来のGPUベースの推論では、モデルの重みを外部メモリから読み出す帯域がトークン生成速度の制約になりますが、チップ上の大容量SRAMに重みを載せることでその制約を緩める、という発想です。
この記事の事実関係は、OpenAI公式チェンジログ(developers.openai.com)、OpenAI Developer Communityの公式アナウンススレッド、公式のAPIリファレンスおよびPricingページ、Cerebras公式ブログの2026年8月13日付記事をもとに、執筆時点(2026年8月18日)で確認できた範囲で整理しています。OpenAIのニュースルーム側の発表ページ(openai.com)は、本稿の確認手順ではボット遮断により内容を取得できなかったため、出典には含めていません。
一方で、公開されていない情報のほうも同じくらい重要です。執筆時点で、Ultrafast modeの価格は公表されていません。公式Pricingページの料金表にもUltrafastの列はなく、GA(一般提供)の時期も示されていません。
APIリクエストでの指定方法については、公式のAPIリファレンス(Create a model response)に記載があります。service_tierの取り得る値の1つとしてultrafastが挙げられ、「ultrafastを指定するとアクセス制御されたUltrafast Processingサービスティアで処理される」「このティアは現時点でgpt-5.6-solで利用できる」「このティアで処理されたレスポンスはservice_tier=ultrafastを返す」と説明されています。ただし、既存のFast modeやFlex processingにあるような専用のガイドページはまだ存在せず、対応機能やレート制限といった運用面の詳細はまとまっていません。アクセス希望者向けの登録フォームが案内されている段階です。「発表された」と「使える」の間にはまだ距離がある、というのが現在地です。
既存のサービスティアの中でどこに位置するのか
OpenAIのAPIは、以前から同じモデルを複数の「サービスティア」で呼び分けられるようになっています。Ultrafastは、その並びに最速側の選択肢が1つ増える形です。公式ドキュメントで確認できる範囲で整理すると、次のようになります。
| ティア | 指定方法 | ねらい | 公式ドキュメントで確認できる内容 |
|---|---|---|---|
| Standard | service_tier: "default" | 標準 | 選択したモデルの標準的な価格と性能で処理される。未指定時の既定値は"auto"(プロジェクト設定のティアを使う。特に設定していなければ"default") |
| Fast mode | service_tier: "fast"(旧"priority") | レイテンシ短縮 | 最大2.5倍速でレイテンシがより安定する。単価は標準の2倍(公式Pricingページの100万トークンあたり単価で、SolのShort contextは入力10.00ドル・出力60.00ドル)。ファインチューニング済みモデルとembeddingsは非対応 |
| Flex processing | service_tier: "flex" | コスト削減 | 応答が遅くなることと、まれにリソース不足が起きることと引き換えに低コスト。単価はBatch API相当。容量不足時は429が返るが課金されない。ベータ提供で対応モデルは限定(公式Pricingページに一覧) |
| Batch API(参考) | 専用エンドポイント(service_tierの値ではない) | 大量・非同期処理 | 完了ウィンドウは24時間。同期APIに対して50%割引。レート制限は別枠で余裕が大きい |
| Ultrafast mode | service_tier: "ultrafast" | 最速 | GPT-5.6 Solで最大14倍速・最大750出力トークン/秒。APIリファレンスに「アクセス制御されたティア」と記載。限定プレビューで価格は未公表 |
Fast modeについては補足があります。もともと「Priority processing」という名称でしたが、公式のFast modeガイドに記載のとおり2026年7月30日にFast modeへ改称され、service_tierには"fast"と旧称の"priority"のどちらも使える後方互換が保たれています。さらに公式チェンジログの2026年8月5日付エントリでは、GPT-5.6のSol・Terra・LunaでFast modeが長文脈リクエストに対応し、272Kトークンを超えるプロンプトもFast modeで処理できるようになった(標準ティア比で最大2.5倍速)と告知されています。速度側の選択肢は、Ultrafastの登場前からじわじわ動いていたわけです。
あわせて読みたい
OpenAIがGPT-5.6のLunaとTerraを値下げ|業務で見直すこと、見直さなくていいこと
メモ
「速い」の内訳を分解する
ここからが本題です。LLM APIの応答時間は、おおまかに次の要素に分解できます。
- リクエストがキューに入ってから処理が始まるまでの待ち時間
- 入力(プロンプト)を処理して最初のトークンが返るまでの時間
- 出力トークンを1つずつ生成していく時間(出力トークン数÷生成速度)
- アプリケーション側の処理、ツール呼び出しや外部API・DBへの往復、ネットワーク
公式が数値で示しているのは、このうち3つ目です。最大750出力トークン/秒という数字は「1秒あたりに何トークン吐けるか」の上限であって、キュー待ちや最初のトークンが返るまでの時間がどうなるかについては、OpenAI・Cerebrasのどちらも説明していません。少なくとも4つ目、アプリケーション側の処理やツール呼び出し・外部APIの往復時間は、ティアを変えても短くなりません。
この分解が実務上どれくらい効くかは、OpenAI自身のレイテンシ最適化ガイドが端的に示しています。同ガイドは「トークンの生成は、LLMを使うときにほぼ常に最もレイテンシの高いステップである」とし、経験則として「出力トークンを50%削れば、レイテンシも約50%削れる可能性がある」と書いています。対照的に「プロンプトを50%削っても、レイテンシの改善は1〜5%程度にとどまるかもしれない」とも書かれています。つまり公式ドキュメント自身が、多くのケースでレイテンシの主因になるのは出力トークンの生成だと説明しているわけです。あくまで「ほぼ常に」という留保つきの経験則ですが、その主因である生成速度を一桁上げるというのがUltrafastの位置づけになります。
なお、最大750トークン/秒を最大14倍で割れば標準処理は50トークン/秒台という数字が出てきますが、これは意味のある逆算ではありません。どちらも独立に示された「最大」値であって、同一条件で測った実測値の比ではないからです。標準処理側の生成速度が公式に数値で示されているわけでもありません。ここは「倍率と上限値が別々に示されただけ」と受け止めるのが正確です。
効く業務、効かない業務
上の分解をそのまま当てはめると、Ultrafastのような出力速度の向上が効く処理と効かない処理が見えてきます。
効きやすいのは、出力トークン数が多く、その生成時間が待ち時間の大半を占める処理です。
- 長い文章をストリーミングで読ませる用途。記事・報告書・仕様書のドラフト生成のように、数千トークンを吐き続ける処理は生成速度がそのまま体感に出ます。
- コード生成。まとまった量のコードを一気に書かせるケースや、生成したコードを実行して直してまた生成する反復ループ。
- 音声対話。応答の頭出しと、その後の途切れない生成の両方が体験を左右します。
- エージェントの多段ループ。1回あたりの生成は短くても、ツール呼び出しと生成を何十回も繰り返せば、生成時間の合計は無視できない大きさになります。
逆に、効きにくいのは次のような処理です。
- 入力が巨大で出力が短い処理。数万トークンの文書を読ませて「該当するカテゴリを1つ返す」ような分類や、短い要約の生成では、削れる部分がもともと小さい。
- 外部待ちが支配的なRAG。検索・ベクトル検索・DBアクセス・外部APIの往復がレイテンシの大半を占めているなら、生成側を14倍にしても全体はほとんど動きません。
- 人間の確認・承認が挟まる業務。担当者がレビューして次に進む設計では、機械側の数秒は業務のリードタイムに埋もれます。
- バッチ的な夜間処理。締め切りが「翌朝までに終わっていればよい」なら、速度に払うコストの見返りが小さく、Batch APIやFlexのほうが合理的です。
注意
あわせて読みたい
LLMアプリのオブザーバビリティ|トレーシングとログ設計で「なぜこの出力になったか」を後から追えるようにする
推論モデルの「思考トークン」という論点
もう1つ、出力速度が効く可能性のある領域として、推論(reasoning)モデルの思考時間があります。OpenAIの公式のReasoningガイドには、推論トークンについて「APIからは見えないが、モデルのコンテキストウィンドウの容量を占め、出力トークンとして課金される」と明記されています。課金上も内部的にも出力トークンとして扱われるということは、生成速度の向上はそのまま「考えている時間」の短縮に効きうる、という理屈になります。
同ガイドは、推論の深さを制御するreasoningのeffort設定について、noneからmaxまで段階があり、低い設定は速度とコスト効率を優先し、高い設定はより踏み込んだ分析を可能にすると説明しています。レイテンシに敏感なアプリケーションでは低めのeffortから始めることが推奨されています。裏を返すと、これまでは「速くしたいなら考えさせる量を減らす」というトレードオフしかなかったところに、「考える量は減らさずに、考えるのを速くする」という別の軸が加わりうる、というのがUltrafastの潜在的な意味です。
ただし、この点についてOpenAIが公式に「推論の待ち時間が何倍短くなる」と示したわけではありません。あくまで、公式ドキュメントで確認できる「推論トークンは出力トークンである」という事実からの推論です。実際の効き方はeffort設定・タスク・キュー状況に依存するはずで、使えるようになってから自分のワークロードで測るべき領域です。
ベンチマークの主張は誰のものか
Cerebrasの公式ブログには、いくつか具体的なベンチマーク数値が載っています。ここは出所を正確に扱う必要があります。
同ブログは、Humanity's Last Exam(2,500問)について、Ultrafast modeのGPT-5.6 Solが全問を11時間11分で回答し、Claude Fable 5は78時間27分を要したとしています。同ブログはこれを「同等の精度をおよそ7倍速く達成した」と要約しており、「7倍」という表現自体もCerebras側のものです。また経済的に価値のある知識労働タスクを対象としたGDP-Valでは、Ultrafastがエンドツーエンドで5.6倍の高速化を「品質の劣化なしに」実現したとしています(こちらは2026年7月31日にCodex上でmedium設定の測定と注記されています)。そして同ブログには、これらのベンチマークがCerebras自身によって実施されたものであることが明記されています。
この点は誤読しないほうがよい部分です。数値はハードウェアを提供する側の自社測定であり、第三者による独立検証ではありません。前提条件も対称ではなく、同ブログの注記によればHLEの測定はGPT-5.6 Sol Ultrafastが2026年7月10日にCodex上で、Claude Fable 5が7月13日から15日にClaude Code上で実施されています。測定日もエージェント側の実行環境も揃っていない比較だということです。推論のeffortはどちらもxhighと注記されていますが、並列度やリトライの扱いといった条件は示されておらず、この種の総所要時間の比較はそれらによって大きく変わり得ます。「Claudeより7倍速い」という要約だけを取り出して社内の技術選定資料に載せるのは、根拠の強度に対して踏み込みすぎです。
メモ
あわせて読みたい
LLMアプリの評価(eval)の作り方|「動いた気がする」で止めないための実務手順
今わかっていないことを、わかっていないままにしておく
ニュース記事としていちばん誠実な整理は、未確定の項目を明示することだと考えています。執筆時点(2026年8月18日)で確認できていない事項は次のとおりです。
Ultrafast modeについて未確認・未公開の事項
- トークン単価。Fast modeは標準のちょうど2倍、Flex/Batchは標準の半額という構造が公式Pricingページで公開されているが、Ultrafastの価格体系は一切示されていない
- GA(一般提供)の時期。「キャパシティの拡大に応じて広げる」とのみ説明されている
- 運用面の詳細。service_tierの値はAPIリファレンスにultrafastと記載されているが、Fast modeやFlex processingのような専用ガイドページはなく、挙動やフォールバックの扱いはまとまっていない
- 対応する機能の範囲。長文脈・構造化出力・ツール呼び出し・画像入力などがどこまで使えるかは示されていない(Fast modeにはファインチューニング済みモデル非対応などの制約が明記されている)
- レート制限・スループット上限の扱い。Fast modeは標準とレート制限を共有し、Scale Tierとは別建てという整理が公開されているが、Ultrafastの扱いは不明
- GPT-5.6 Sol以外のモデルへ広がるかどうか
これだけ空欄が多い段階なので、「Ultrafastを前提にしたアーキテクチャ」を今から設計するのは早すぎます。特に、速度が出ることを前提に「エージェントの試行回数を10倍にする」「同期処理で長文を返す画面を作る」といった設計に寄せてしまうと、価格が判明した時点や、プレビューの対象外だった場合に、まるごと作り直しになりかねません。
待っている間に実務でやっておくこと
とはいえ、何もできないわけではありません。むしろ、この待ち時間は自社のレイテンシ構造を把握する好機です。
- 1
現状のレイテンシを区間ごとに測る
1リクエストの総時間だけでなく、最初のトークンが返るまでの時間、生成に要した時間、ツール呼び出しや外部API・DBの往復時間を分けて記録します。分けて測らないと、速いティアが自社に効くかどうかを判断できません。 - 2
出力トークン数の分布を見る
多くの処理では、レイテンシの主因は出力トークン数です。処理種別ごとに出力トークン数の中央値と上位パーセンタイルを出し、「生成時間が支配的な処理」がどれかを特定します。推論モデルを使っているなら、思考トークンを含めた出力トークン数で見ます。 - 3
既存ティアの使い分けを先に詰める
速度が要る処理はFast mode、締め切りが緩い処理はFlexやBatch、という振り分けは今日からできます。全部を標準処理で流している状態なら、Ultrafastを待つ前にここで得られる改善を先に取りにいくほうが現実的です。 - 4
出力トークンそのものを減らせないか検討する
公式ガイドの経験則どおり、出力を半分にすればレイテンシもおよそ半分になります。冗長な前置きをやめさせる、構造化出力で余分な装飾を省く、複数ステップを1回のリクエストにまとめる、といった調整は速いティアを使わなくても効きます。 - 5
評価セットを用意しておく
ティアやハードウェアを変えたときに品質が変わっていないかを確かめる手段がなければ、速いティアへ移す判断ができません。移行判断の材料は、速度計測と品質評価の両方です。
ヒント
あわせて読みたい
プロンプトキャッシュ(Prompt Caching)とは|LLM APIのコストとレイテンシを下げる仕組みと実務
長文の要約のように、そもそも処理の分割方法でレイテンシが大きく変わるタスクもあります。設計パターンの選択で改善できる余地は、ティアを変える前に一度洗っておくとよいでしょう。
あわせて読みたい
長文ドキュメントのLLM要約設計パターン|stuff・map-reduce・refine・抽出ハイブリッドの使い分け
よくある質問
Ultrafast modeは今すぐ使えますか
料金はどれくらいかかりますか
ChatGPTのアプリでも速くなりますか
自社の処理が速くなるかどうかを、使う前に見積もれますか
モデルをSolからLunaのような軽いモデルに変えるのと、どちらが速度改善に効きますか
Cerebrasのハードウェアで動くと、出力の内容は変わりますか
まとめ
Ultrafast modeの発表は、LLM APIの選択肢に「モデルを変えずに出力生成速度だけを大きく上げる」という軸が加わりうることを示したものです。ただし現在地はアクセス制御された限定プレビューで、価格もGA時期も公開されていません。ベンチマークの具体的な数値はハードウェア提供側の自社測定であり、第三者検証ではありません。
実務としてやるべきことは、速度の話に引きずられる前に、自社の処理のどこに時間が使われているかを区間ごとに測ることです。出力トークンの生成が支配的なら、Ultrafastは待つ価値があります。外部待ちや人の確認が支配的なら、14倍という数字は自社にはほとんど関係しません。そしてどちらの場合でも、Fast・Flex・Batchという既存のティアの使い分けと、出力トークン数そのものを減らす工夫は、Ultrafastの提供を待たずに今日から着手できます。新しいティアが来たときに正しく判断するための土台は、その計測と評価の中にあります。
出典・参考
- Changelog - OpenAI API(公式・一次。2026年8月13日のUltrafast mode告知、8月5日のFast mode長文脈対応)
- Ultrafast mode preview: GPT-5.6 Sol at up to 14X the speed in the API - OpenAI Developer Community(OpenAI公式のアナウンススレッド)
- Accelerating GPT-5.6 Sol Ultrafast with OpenAI - Cerebras(Cerebras公式。ハードウェア構成と自社実施ベンチマークの主張)
- Fast mode - OpenAI API(公式・一次)
- Flex processing - OpenAI API(公式・一次)
- Batch API - OpenAI API(公式・一次)
- Latency optimization - OpenAI API(公式・一次)
- Reasoning - OpenAI API(公式・一次)
- API reference - Create a model response - OpenAI API(公式・一次。service_tierの各値の定義)
- Pricing - OpenAI API(公式・一次。Fast modeの単価とPriority processing改称の注記)
関連する記事
OpenAIがGPT-5.6のLunaとTerraを値下げ|業務で見直すこと、見直さなくていいこと
2026年7月30日にOpenAIが実施したGPT-5.6のAPI価格改定を、公式Pricingページで確認しながら業務目線で整理します。Lunaは80%、Terraは20%の引き下げでSolは据え置き、Priority processingはFast modeへ改称。事実を押さえたうえで、大量処理の経済性・モデル階層の引き直し・価格が動く前提の設計・乗り換え前の評価と、値下げでも変わらない要件を切り分けます。
プロンプトキャッシュ(Prompt Caching)とは|LLM APIのコストとレイテンシを下げる仕組みと実務
プロンプトキャッシュは、共通するプレフィックスのKV計算をサーバ側で使い回し、初回応答時間とコストを下げる仕組みです。仕組みの基本、Anthropic・OpenAI・Googleの差分、落とし穴、実務での取り入れ方までを変動前提で整理します。
LLMアプリのオブザーバビリティ|トレーシングとログ設計で「なぜこの出力になったか」を後から追えるようにする
LLMアプリ・AIエージェントの観測をどう設計するかを実務目線で整理します。通常のWebアプリのログとの違い、最低限とるべきシグナル、OpenTelemetryのGenAI semantic conventions(現在Development段階)の使い方、入出力本文を残すかどうかの判断、コスト可視化とアラート設計、評価(eval)との接続、既存APMとLLM専用ツールの選び分けをまとめます。


