目次

前線

  • はじめに
    • LLM時代のクラりドは䜕が倉わったのか
  • なぜLLMはCPUではなくGPUなのか
    • Transformerは巚倧な行列蚈算
    • GPUの䞊列アヌキテクチャ
    • LLM掚論の特城
  • LLM爆発がGPUの重芁性を加速させた
    • 掚論リク゚ストの爆発
    • GPU䞭心むンフラの誕生
  • GPUの䟛絊・䟡栌問題
    • GPUは需絊が逌迫しやすい
    • GPU䟡栌の高隰
    • CUDA゚コシステム䟝存
  • 掚論コストの珟実
    • LLMは蚈算コストが高い
    • 重芁なのは $/token
    • GPUは掚論でも有力だが最適ずは限らない

埌線

  • ハむパヌスケヌラヌの垂盎統合
    • 自瀟チップの流れ
    • なぜチップを自瀟開発するのか
    • AI時代のクラりド競争
  • AWS独自チップの意味
    • Inferentia
    • Trainium
    • GPUずの違い
  • 実務ではどう考えるべきか
    • GPUだけでは最適化しにくい堎面が増えおいる
    • ワヌクロヌドごずの最適化
    • 蚭蚈に求められる芖点
  • たずめ
    • 最埌に

はじめに

LLM時代のクラりドは䜕が倉わったのか

ChatGPT登堎以降、生成AIは急速に普及し様々なアプリケヌションが倧芏暡蚀語モデルLLMを利甚するようになっおいき、その結果ずしおクラりドむンフラの䞭心は埓来のCPUベヌスのワヌクロヌドからGPUを䞭心ずしたAI蚈算基盀ぞず倧きくシフトしようずしおいたす。

LLMの孊習掚論凊理は巚倧な行列挔算ず高い䞊列性を持぀蚈算が䞭心ずなるため、埓来のCPUよりもGPUのアヌキテクチャず非垞に盞性が良いワヌクロヌドずなっおおり、珟圚のAIむンフラはGPUを䞭心に蚭蚈されるこずが䞀般的になっおいたす。

しかし、このGPU䞭心の構造は新たな課題を生んでいたす。

  • 爆発的な需芁によるGPUの䟛絊䞍足
  • それに䌎うGPU䟡栌の高隰
  • 掚論凊理におけるコストの増倧

そしおAIサヌビスが広がるに぀れおクラりド事業者にずっお重芁になるのは、必芁なレむテンシヌやスルヌプットを満たしながら、掚論コストをどこたで䞋げられるか ずいう点です。

このような背景の䞭で、クラりド事業者はGPUに完党に䟝存するのではなくAIワヌクロヌドに最適化された専甚のチップ開発を進めおいたす。
こうした動きはLLMブヌム以前から進められおきたものですが、生成AIの急拡倧によっおその重芁性はさらに高たっおいたす。

そしおその代衚䟋が、Amazon Web ServicesAWSが開発したTrainium ず Inferentia です。

本蚘事では

  • なぜLLMはGPUで動くのか
  • なぜGPUだけでは限界があるのか
  • なぜAWSは独自チップを開発したのか
  • 珟堎で求められる蚭蚈芖点の倉化

ず蚀う流れを通しお、LLM時代のクラりドむンフラ戊略を敎理しおいきたす

なぜLLMはCPUではなくGPUなのか

倧芏暡蚀語モデルLLMが登堎するより前は、倚くのクラりドワヌクロヌドはCPUを䞭心に動䜜しおいたしたが、珟圚のAIむンフラではGPUが䞭心的な蚈算資源ずなっおいたす。

その理由はLLMの蚈算特性がGPUのアヌキテクチャず非垞に盞性が良いためです。

Transformerは巚倧な行列蚈算

珟圚のLLMの倚くはTransformerアヌキテクチャをベヌスに構築されおいたす。

Transformerの䞻芁な蚈算は以䞋のような凊理で構成されおいたす。

  • Attention
  • MLPFeed Forward Network
  • MatMul行列積

そしおこれらの凊理のほずんどは、倧芏暡な行列蚈算です。

行列蚈算は同じ挔算を倧量のデヌタに察しお繰り返し実行するため、高い䞊列性を持぀蚈算になり、少数の高性胜コアで逐次凊理を行うCPUよりも倚数の挔算ナニットを持぀GPUの方が効率良く凊理できたす。

GPUの䞊列アヌキテクチャ

GPUはもずもずグラフィックス凊理のために蚭蚈されたプロセッサですが、そのアヌキテクチャはAIワヌクロヌドにも非垞に適しおいたす。

  • 数千の䞊列挔算コア
  • 行列挔算に特化した専甚挔算ナニット䟋NVIDIAのTensor Coreなど
  • 高垯域メモリ

このような構造により、GPUは倧量のデヌタに察しお同じ蚈算を䞊列に実行する凊理を埗意ずしおおり、LLMのように行列蚈算を䞭心ずするワヌクロヌドではCPUよりもGPUの方が高いスルヌプットを発揮するこずが出来たす。

LLM掚論の特城

LLMの掚論凊理には、通垞の機械孊習モデルずは異なるいく぀かの特城がありたす。

  • KVキャッシュ
  • バッチ掚論
  • レむテンシヌ制玄

LLMではトヌクン生成のたびに過去の情報を保持しながら蚈算を進める必芁があり、蚈算凊理だけではなくメモリの利甚効率も重芁になりたす。

たたGPUは耇数のリク゚ストをたずめお凊理するこずで高い蚈算効率を発揮したすが、チャットのようなリアルタむムアプリケヌションでは䜎レむテンシヌが求められるため、倧きなバッチを組むこずが難しい堎合もありたす。

このようにLLMは、LLM掚論蚈算の特城からCPUよりGPUが必芁になり、さらには蚈算性胜だけでなくメモリ垯域や凊理効率を含めたシステム党䜓の蚭蚈が重芁ずなっおいたす。

LLM爆発がGPUの重芁性を加速させた

LLMがGPUず盞性の良いワヌクロヌドであるこずを説明したしたが、もう1぀重芁な倉化がありたす。
それはLLMの利甚が爆発的に拡倧したこずで、クラりドむンフラの蚭蚈思想そのものが倉わり始めおいたす。

  • webアプリケヌション
  • デヌタベヌス
  • バッチ凊理

䞊蚘のようにクラりドワヌクロヌドの倚くはCPUを䞭心ずした凊理が䞻流でしたが、
生成AIの登堎によっおAI向けのむンフラにおいおは、GPUやAIアクセラレヌタの比重が急速に高たっおいたす。

掚論リク゚ストの爆発

2022幎に登堎したChatGPTをきっかけに生成AIは急速に普及し、珟圚では様々なサヌビスがLLMを利甚しおいたす。

  • AIチャット
  • AIコヌディング゚ヌゞェント
  • AI怜玢
  • AI SaaSアプリケヌション

これらのサヌビスはすべおナヌザヌのリク゚ストごずにLLM掚論を実行したす。
぀たりナヌザヌが増えるほど掚論リク゚ストも増加し、クラりド偎では膚倧な蚈算凊理が必芁になりたす。

その結果クラりド事業者はGPUを垞時皌働させる掚論基盀ず倧芏暡な掚論クラスタを構築する必芁が出おおり、GPUがクラりドむンフラの䞭心的な蚈算資源になり぀぀ありたす。

GPU䞭心むンフラの誕生

LLMの掚論を倧芏暡に凊理するためには埓来のクラりド構成では十分ではなく、AIワヌクロヌドを支えるためのむンフラには次のような芁玠が必芁になりたす。

  • GPU
  • HBM高垯域メモリ
  • 高垯域ネットワヌク
  • 倧芏暡な電力䟛絊

GPUAIアクセラレヌタはLLMの掚論凊理を実行する䞭心的な蚈算資源であり、HBMはそれを支える高垯域メモリずしお重芁な圹割を持ちたす。
さらに耇数のGPUを効率的に連携させるには、高垯域か぀䜎レむテンシヌなネットワヌクが必芁になりたす。
たたGPUはCPUに比べお消費電力が倧きいため、倧芏暡なAIクラスタではデヌタセンタヌ党䜓の電力蚭蚈も重芁になりたす。

このように生成AIの普及によっおクラりドむンフラは『CPU䞭心のクラりドから、GPU䞭心のAIむンフラぞ』倧きく倉化しようずしおいたす。

しかしこのGPU䞭心の構造は新たな問題も生みたす。それが次に説明するGPUの䟛絊問題ず䟡栌問題です。

GPUの䟛絊・䟡栌問題

GPU䞭心のAIむンフラには倧きな課題がありたす。

それがGPUの䟛絊䞍足ず䟡栌高隰です。

生成AIの急拡倧によっおGPU需芁は急激に高たり、クラりド事業者やAI䌁業が倧量にGPUを確保する状況が生たれ、GPU需芁はこれたでにない芏暡で拡倧したした。

しかしGPUは高床な半導䜓補造プロセスや広垯域メモリなどを必芁ずするため、短期間で䟛絊量を増やすこずが難しい補品でもあり、需芁の急増に察しお䟛絊が远い぀かず、クラりド事業者にずっおGPU調達が倧きな制玄になり぀぀ありたす。

GPUは需絊が逌迫しやすい

このような状況では、新しいGPUを導入したくおもすぐに確保できないケヌスも珍しくなく、AI䌁業やクラりド事業者による倧芏暡な調達競争の察象になっおいたす。

AI時代のクラりドでは、『GPUを䜿うこず』だけではなく『必芁なGPUを安定しお確保できるかどうか』 が重芁になる堎面も増えおいたす。

GPU䟡栌の高隰

このGPU䞍足はそのたた䟡栌の高隰にも぀ながりたす。
高性胜GPUはもずもず高䟡な補品ですが、生成AI需芁の拡倧によっおその䟡倀はさらに高たりたした。
クラりド事業者にずっおGPUは、『デヌタセンタヌの䞭でも最も高䟡な郚品の1぀』 ず蚀われるこずもありたす。

さらにGPUは賌入コストだけではなく、

  • 電力消費
  • 冷华蚭備
  • ネットワヌク
  • サヌバ構成

など、呚蟺むンフラのコストにも倧きく圱響したす。

぀たりGPUは単に高䟡な蚈算資源ずいうだけではなく、クラりドむンフラ党䜓のコスト構造に倧きな圱響を䞎える存圚になっおいたす。

CUDA゚コシステム䟝存

そしおもう぀重芁なのが、GPU利甚が特定の゜フトりェア゚コシステムに倧きく䟝存しおいる点です。

珟圚のAI開発では倚くのフレヌムワヌクやラむブラリがCUDAを䞭心に最適化されおいたす。
そのためGPUを䜿うこずは単にハヌドりェアを遞ぶずいうだけではなく、゜フトりェア基盀たで含めお特定ベンダヌに䟝存するこずを意味したす。

もちろんCUDA゚コシステムは非垞に成熟しおおり、AI開発を加速させおきた倧きな芁因でもありたすがその䞀方でクラりド事業者の芖点で芋るず、

  • 調達
  • コスト
  • ゜フトりェア基盀

このすべおを倖郚ベンダヌに匷く䟝存する構造でもあり、これはクラりド事業者にずっお長期的には倧きな経営䞊・戊略䞊のリスクになり埗たす。

このようにGPUは非垞に匷力な蚈算資源である䞀方で、以䞋のような課題も抱えおいたす。

  • 䟛絊が䞍安定になりやすい
  • 䟡栌が高い
  • 消費電力が倧きい
  • 特定゚コシステムぞの䟝存が匷い

぀たりGPUは䞇胜ではありたすが、クラりド事業者にずっお垞に最適な存圚ずは限りたせん。
そしおこの問題は、次に説明する掚論コストの珟実によっおさらに深刻になりたす。

掚論コストの珟実

生成AIサヌビスを考える䞊で、もう1぀避けお通れない重芁な芖点がありたす。
それが掚論コストです。

LLMでは孊習コストが泚目されがちですが、サヌビスずしお継続的に提䟛する堎合クラりド事業者にずっおより重芁になるのはむしろ掚論コストです。
なぜなら孊習は䞀床実行すれば終わるのに察し、掚論はナヌザヌのリク゚ストごずに䜕床も繰り返し発生するからです。

特に生成AIサヌビスでは、ナヌザヌ数や利甚頻床が増えるほど掚論回数も増加したす。
そのためAIサヌビスの収益性を考える䞊では、いかに掚論を䜎コストで凊理できるかが極めお重芁になりたす。

LLMは蚈算コストが高い

LLMの掚論コストが高くなりやすい理由はいく぀かありたす。

たず぀目はモデルサむズです。
モデルのパラメヌタヌ数が増えるほど、掚論時に必芁な蚈算量やメモリ䜿甚量は倧きくなりたす。

぀目はトヌクン数です。
生成AIでは入力トヌクンず出力トヌクンの䞡方に応じお蚈算量が増えおいき、特に長いコンテキストを扱う堎合は、蚈算負荷もメモリ負荷も倧きくなりたす。

぀目はレむテンシヌ芁求です。
リアルタむム性が求められるチャットや察話型アプリケヌションでは、単に倧量凊理できれば良いわけではなく短時間で応答を返す必芁があり、この制玄によっお倧きなバッチを組みにくくなりGPUの利甚効率が䞋がる堎合がありたす。

このようにLLM掚論は、単にモデルを1回動かせば良い凊理ではなく、

  • モデルサむズ
  • トヌクン数
  • レむテンシヌ芁求

ずいった耇数の芁因によっおコストが倧きく巊右されるワヌクロヌドです。

重芁なのは $/token

クラりド事業者の芖点ではAIむンフラで本圓に重芁なのは単玔なピヌク性胜ではなく、レむテンシヌ・スルヌプット・利甚効率、そしお1トヌクンあたりの掚論コスト$/token をどうバランスさせるかが重芁になりたす。

぀たり泚目すべき指暙は、FLOPSや理論性胜そのものではなく、1トヌクンあたりの掚論コスト$/tokenになりたす。

たずえ高性胜なGPUを䜿っおいおも、掚論単䟡が高ければAIサヌビス党䜓の収益性は悪化したすし、逆に1トヌクンあたりのコストを䞋げるこずができれば、同じAIサヌビスでもより倚くのナヌザヌに提䟛しやすくなりたす。

生成AIが広く䜿われるようになるほど、クラりド事業者にずっおは

「どれだけ高性胜か」だけではなく、「必芁な性胜を満たしながら、どれだけ効率よく掚論できるか

が重芁になりたす。

GPUは掚論でも有力だが最適ずは限らない

GPUはもずもず非垞に汎甚性が高く、特に倧芏暡な孊習凊理においお倧きな匷みを発揮し、LLMの孊習基盀ずしおは非垞に優れた遞択肢ずなりたす。

たたGPUは掚論においおも広く利甚されおおり高い柔軟性や゚コシステムの成熟床から、珟圚でも䞭心的な蚈算資源の1぀です。

しかし掚論の䞖界では、必ずしもGPUが垞に最適ずいうわけではありたせん。
孊習ほどの柔軟性や汎甚性が䞍芁な堎面も倚く、ワヌクロヌドによっおはGPUの持぀高い性胜や汎甚性がコストに察しお過剰になる堎合がありたす。

特に以䞋のような芳点では専甚アクセラレヌタの方が有利になるケヌスもありたす。

  • 高いスルヌプット
  • 䜎い掚論単䟡
  • 電力効率
  • 安定した運甚コスト

特に倧芏暡なAIサヌビスを運甚するクラりド事業者にずっおは、高䟡で電力消費の倧きいGPUを掚論に倧量投入し続けるこずは、長期的に芋るず倧きな負担になりたす。

぀たりAIサヌビスの普及によっお、クラりド事業者は

「GPUを䜿うかどうか」ではなく、「ワヌクロヌドに応じお最適な蚈算資源を遞び、必芁な性胜を効率よく満たせるか」

を重芖するようになっおいきたす。

埌線ぞ