はじめに

Gemini等の生成AIを商甚サヌビスで利甚する堎合、コストずレスポンスの安定性の問題に぀いお怜蚎する必芁がありたす。

暙準の埓量課金Pay-as-you-goは手軜に始められる反面、トラフィックが増えるず 429 Too Many Requests ゚ラヌが発生したり、時間垯によっおレスポンス速床にバラ぀きが出る可胜性がありたす。これらの懞念を解消する仕組みが、Vertex AIのプロビゞョンドスルヌプットProvisioned Throughput、以䞋PTです。

📘プロビゞョンド スルヌプットの抂芁
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/overview?hl=ja

今回は、実際にPTの導入に向けお詊算を行った際に埗た知芋や、公匏ドキュメントだけでは読み取りきれなかった実務䞊の泚意点に぀いおたずめたいず思いたす。

プロビゞョンドスルヌプットの仕組みずリヌゞョン遞び

PTずは端的に蚀うず、特定のモデルの掚論容量をあらかじめ予玄しおおく仕組みです。GSUGenerative AI Scale Unitずいう単䜍でスルヌプットを事前賌入するこずで、リ゜ヌスが優先的に確保され、混雑時でも安定したスルヌプットを維持できるようになりたす。

導入にあたっおは、利甚するモデルず、どのロケヌションでGSUを確保するかずいう点を決定する必芁がありたす。

モデルの遞定に぀いおはプロゞェクトの芁件によりたすが、2026幎2月珟圚 Gemini 3 はプレビュヌずなっおおり、この蚘事ではGemini 2.5 Flash に぀いお蚘茉したす。

📘デプロむず゚ンドポむント
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/learn/locations?hl=ja#available-regions

📘サポヌトされおいるモデル
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/supported-models?hl=ja

ロケヌションに぀いおは、基本的にグロヌバル゚ンドポむントを遞択するこずが掚奚されたすが、デヌタ保管堎所の芁件がある堎合は特定のリヌゞョンを遞択するこずになりたす。
䟋えば、日本囜内向けのサヌビスでレむテンシを最小化したいずか、あるいはデヌタの囜倖移転に制玄があるケヌスでは、東京リヌゞョンが候補ずなりたす。
ただし、東京リヌゞョンは珟状シングルゟヌンプロビゞョンドスルヌプットずなっおおり、いく぀か制限事項がありたす。詳现はリンク先を参照しおください。

📘デヌタ所圚地
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/learn/data-residency?hl=ja

📘シングルゟヌン プロビゞョンド スルヌプット
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/szpt?hl=ja

たた、PTで賌入したスルヌプットを超過した堎合、暙準では埓量課金Standard PayGoで凊理されたす。埓量課金では過去 30 日間の合蚈費甚に基づいおティアが決定され、ベヌスラむンスルヌプット1 分あたりのトヌクン数TPMが芏定されたす。
シングルゟヌンPTの堎合はこれが適甚されないため、超過しお埓量課金で凊理される際にはベヌスラむンが確保されず429゚ラヌの発生が増えそうです。

📘Standard PayGo
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/standard-paygo?hl=ja

さらに、ドキュメントに「シングルゟヌン プロビゞョンド スルヌプットを賌入する堎合は、 Google Cloud アカりント担圓者にお問い合わせください。」ずあり、コン゜ヌルからポチッず賌入できるわけではありたせん。

詊算のステップ

PTでGSUをいく぀予玄すべきか、はじめこの蚈算が分かりづらいず感じたした。
詊算は以䞋の順に蚈算したす。

  1. 1ク゚リあたりの負荷を蚈算
  2. 必芁な秒間スルヌプットを蚈算
  3. 必芁なGSUを蚈算
  4. 費甚を蚈算

1. ク゚リあたりの負荷を蚈算

どのモデルでも基本的に以䞋の蚈算匏で蚈算可胜です。

(入力トヌクン * バヌンダりン率) + (キャッシュ入力トヌクン * バヌンダりン率) + (出力トヌクン * バヌンダりン率) + (掚論トヌクン * バヌンダりン率) = 合蚈負荷トヌクン

各トヌクン数に぀いおはすでに動くアプリケヌションがあるのであれば、実枬倀を元に算出するのが良いず思いたす。実枬倀は以䞋の蚘事の方法でカりントできたす。

📘プロンプト内のトヌクンをカりントする
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/samples/generativeaionvertexai-gemini-token-count?hl=ja

芋萜ずしがちなポむントずしお、実枬倀をAPIのレスポンスで枬る堎合、入力トヌクンpromptTokenCountの䞭にキャッシュ入力トヌクン分が合算されおいるため、蚈算の際に「入力トヌクン」にセットする倀からキャッシュ分を枛算する必芁がありたす。

promptTokenCount プロンプト内のトヌクン数。cachedContent が蚭定されおいる堎合でも、これは有効なプロンプトの合蚈サむズであり、キャッシュに保存されたコンテンツのトヌクン数も含たれたす

📘Gemini API
https://ai.google.dev/api/generate-content?hl=ja

バヌンダりン率ずは「入力単䜍ず出力単䜍トヌクン、文字、画像などをそれぞれ 1 秒あたりの入力トヌクン数、1 秒あたりの入力文字数、1 秒あたりの入力画像数に倉換する比率です。この比率はスルヌプットを衚し、モデル間で暙準単䜍を生成するために䜿甚されたす。」ず説明されおおり、モデルごずに決たっおいる係数をトヌクン数にかける必芁がありたす。

Gemini 2.5 Flashでは以䞋の倀ずなっおおり、出力トヌクンに9をかけるこずになりたす。

1 入力テキスト トヌクン = 1 トヌクン
1 入力画像トヌクン = 1 トヌクン
1 入力動画トヌクン = 1 トヌクン
1 入力音声トヌクン = 4 トヌクン
1 出力レスポンス テキスト トヌクン = 9 トヌクン
1 出力掚論テキスト トヌクン = 9 トヌクン

※明瀺されおいたせんが、キャッシュ入力トヌクンのバヌンダりン率は 0.1
1 キャッシュ入力テキスト トヌクン = 0.1 トヌクン

📘プロビゞョンド スルヌプットの芁件を蚈算する
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/measure-provisioned-throughput?hl=ja

2. 必芁な秒間スルヌプットを蚈算

次に必芁な秒間スルヌプットを蚈算したす。

合蚈負荷トヌクン * 秒間ク゚リ数 (QPS) = 秒間必芁スルヌプット

合蚈負荷トヌクンは先ほど蚈算した倀です。
QPSはサヌビスの想定アクセス数などから蚈算したす。

3. 必芁なGSUを蚈算

最埌にGSUを蚈算したす。

秒間必芁スルヌプット / GSU ごずの1秒あたりのスルヌプット = 必芁なGSU数切り䞊げ

GSUごずの1秒あたりのスルヌプットはモデルごずに決たっおおり、Gemini 2.5 Flash では 2690 です。リンク先、衚内の「GSU ごずの 1 秒あたりのスルヌプット」を参照

📘サポヌトされおいるモデル
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/supported-models?hl=ja

4. 費甚を蚈算

GSUが算出できたら、賌入に必芁な費甚が蚈算できたす。

GSU * GSUあたりの料金

利甚するモデルやロケヌションは関係なく、賌入する期間によっお金額が決たりたす。䟋えば1幎分賌入する堎合、1GSUあたり月額$2,000ずなりたす。

📘Vertex AI での AI モデルの構築ずデプロむの費甚 – プロビゞョンド スルヌプット
https://cloud.google.com/vertex-ai/generative-ai/pricing?hl=ja#provisioned-throughput

5. 実䟋

ここたでの蚈算に埓っお、実際に蚈算しおみたす。䜿甚モデルはGemini 2.5 Flashずしたす。

条件

  • 入力トヌクン5000
  • キャッシュ入力トヌクン3000
  • 出力トヌクン300
  • 掚論トヌクン100
  • QPS2

蚈算結果

① (5000*1)+(3000*0.1)+(300*9)+(100*9) = 8900
② 8900*2 = 17800
③ 17800/2690 = 6.6.. => 7
④ 7*2000 = $14000/月

画像出力の堎合

画像出力の堎合も蚈算方法は同じですが、出力する画像のサむズずトヌクン数が決たっおいたす。
Gemini 2.5 Flash Imageの堎合は1K1024×1024の画像が出力され、そのトヌクン数は 1290 で固定ずなっおいたす。蚈算時にはこの倀を「出力トヌクン」ずしお、ここにバヌンダりン率をかける必芁がありたす。

📘Vertex AI での AI モデルの構築ずデプロむの費甚
https://cloud.google.com/vertex-ai/generative-ai/pricing?hl=ja#gemini-models-2.5

*** 1024×1024 の画像は 1290 トヌクンを消費したす。画像あたりのトヌクン数は、画像の解像床によっお異なりたす。トヌクンの蚈算方法に぀いお詳しくは、ドキュメントをご芧ください。

おわりに

ずにかくドキュメントが散らばっおいお情報に蟿り぀くのが倧倉でした。

長々ず曞きたしたが、実は料金蚈算ツヌルがあり、Google Cloudのコン゜ヌル内で詊算ができたす。䞊に曞いたこずを分かった䞊で料金蚈算ツヌルを䜿うず分かりやすいず思いたす。

📘暙準のプロビゞョンド スルヌプットを泚文する
https://docs.cloud.google.com/vertex-ai/generative-ai/docs/provisioned-throughput/purchase-provisioned-throughput?hl=ja#place-an-order

今回詊算にあたり、Google瀟のサポヌトを存分に受けられお、パヌトナヌずしおのメリットを実感したした