åç·šããã©ããïŒ
ç®æ¬¡
åç·š
- ã¯ããã«
- LLMæä»£ã®ã¯ã©ãŠãã¯äœãå€ãã£ãã®ã
- ãªãLLMã¯CPUã§ã¯ãªãGPUãªã®ã
- Transformerã¯å·šå€§ãªè¡åèšç®
- GPUã®äžŠåã¢ãŒããã¯ãã£
- LLMæšè«ã®ç¹åŸŽ
- LLMççºãGPUã®éèŠæ§ãå éããã
- æšè«ãªã¯ãšã¹ãã®ççº
- GPUäžå¿ã€ã³ãã©ã®èªç
- GPUã®äŸçµŠã»äŸ¡æ Œåé¡
- GPUã¯é絊ãéŒè¿«ãããã
- GPUäŸ¡æ Œã®é«éš°
- CUDAãšã³ã·ã¹ãã äŸå
- æšè«ã³ã¹ãã®çŸå®
- LLMã¯èšç®ã³ã¹ããé«ã
- éèŠãªã®ã¯ $/token
- GPUã¯æšè«ã§ãæåã ãæé©ãšã¯éããªã
åŸç·š
- ãã€ããŒã¹ã±ãŒã©ãŒã®åçŽçµ±å
- èªç€Ÿãããã®æµã
- ãªãããããèªç€Ÿéçºããã®ã
- AIæä»£ã®ã¯ã©ãŠãç«¶äº
- AWSç¬èªãããã®æå³
- Inferentia
- Trainium
- GPUãšã®éã
- å®åã§ã¯ã©ãèããã¹ãã
- GPUã ãã§ã¯æé©åãã«ããå Žé¢ãå¢ããŠãã
- ã¯ãŒã¯ããŒãããšã®æé©å
- èšèšã«æ±ããããèŠç¹
- ãŸãšã
- æåŸã«
ãã€ããŒã¹ã±ãŒã©ãŒã®åçŽçµ±å
ãããŸã§èŠãŠããããã«ãLLMæä»£ã®ã¯ã©ãŠãã§ã¯GPUã®äŸçµŠäžè¶³ãäŸ¡æ Œé«éš°ããããŠæšè«ã³ã¹ãã®å¢å€§ã倧ããªèª²é¡ã«ãªã£ãŠããŸãã
ãããã課é¡ã«å¯ŸããŠãã¯ã©ãŠãäºæ¥è ã¯åã«GPUã調éããŠæäŸããã ãã§ã¯ãªããèªãã€ã³ãã©ã®äžæ žãèšèšããæ¹åãžãšé²ã¿å§ããŸããã
ãã®æµãã®äžå¿ã«ããã®ãããã€ããŒã¹ã±ãŒã©ãŒã«ããåçŽçµ±åã§ãã
ããã§èšãåçŽçµ±åãšã¯ãã¯ã©ãŠãäºæ¥è ãã¢ããªã±ãŒã·ã§ã³åºç€ããœãããŠã§ã¢ã ãã§ãªããèšç®è³æºãã®ãã®ãŸã§èªç€Ÿã§æé©åããããšããåããæããŸãã
èªç€Ÿãããã®æµã
ãã®æµãã¯ããã§ã«äž»èŠãªã¯ã©ãŠãäºæ¥è ã®æŠç¥ãšããŠæç¢ºã«è¡šããŠããŸãã
ããšãã°Googleã¯TPUãéçºããèªç€Ÿã®AIåºç€ã«çµã¿èŸŒãã§ããŸããã
AWSãTrainiumãšInferentiaãå±éããåŠç¿ãšæšè«ã®äž¡æ¹ã§ç¬èªã®éžæè¢ãçšæããŠããŸãã
MicrosoftãMaiaãã¯ãããšããç¬èªAIã¢ã¯ã»ã©ã¬ãŒã¿ã®éçºãé²ããŠããŸãã
ã€ãŸãçŸåšã®ã¯ã©ãŠãç«¶äºã¯CPUãGPUãšãã£ãæ¢åã®æ±çšããããã©ã䜿ãããšããæ®µéãããã¯ã©ãŠãäºæ¥è èªèº«ãAIåãã®èšç®åºç€ãã©ãäœãããšããæ®µéã«å ¥ã£ãŠããŸãã
ãªãããããèªç€Ÿéçºããã®ã
ã¯ã©ãŠãäºæ¥è ãèªç€Ÿããããéçºããçç±ã¯ã倧ããåãããš3ã€ãããŸãã
1ã€ç®ã¯ãGPUäŸåãäžããããã§ãã
AIéèŠãæ¥å¢ããäžã§ãå€éšãã³ããŒã®GPUäŸçµŠã«å
šé¢çã«äŸåããæ§é ã¯èª¿éé¢ã§ãäŸ¡æ Œé¢ã§ã倧ããªå¶çŽã«ãªããŸãã
2ã€ç®ã¯ãã³ã¹ããæé©åããããã§ãã
ç¹ã«æšè«ã§ã¯ãæ±çšæ§ã®é«ãGPUãããç¹å®ã®ã¯ãŒã¯ããŒãã«æé©åããå°çšãããã®æ¹ãå¹ççã«åãããå ŽåããããŸãã
ããã¯åãªãããŒããŠã§ã¢ã®çœ®ãæãã§ã¯ãªããé»åå¹çãéçšã³ã¹ããŸã§å«ããå
šäœæé©ã®è©±ã§ãã
3ã€ç®ã¯ãã¯ã©ãŠããšããŠã®å·®å¥åã§ãã
åãGPUã䞊ã¹ãã ãã§ã¯ãå瀟ã®ã¯ã©ãŠãã«æ¬è³ªçãªéãã¯åºãã«ãããªããŸãã
äžæ¹ã§ãèªç€ŸããããšãœãããŠã§ã¢ã¹ã¿ãã¯ãçµã¿åãããŠæé©åã§ããã°ãäŸ¡æ Œãæ§èœãéçšæ§ã®é¢ã§ç¬èªã®äŸ¡å€ãåºãããããªããŸãã
ã€ãŸãèªç€Ÿãããã®éçºã¯ãåãªãæè¡ã¢ããŒã«ã§ã¯ãªã調éã»ã³ã¹ãã»å·®å¥åãåæã«è§£ãããã®æŠç¥ãšèšããŸãã
AIæä»£ã®ã¯ã©ãŠãç«¶äº
ãã®ããã«èŠããšãAIæä»£ã®ã¯ã©ãŠãç«¶äºã¯åãªãGPU調éç«¶äºã§ã¯ãããŸããã
ããããã®ç«¶äºã§åãããã®ã¯ã以äžã®ãããªã€ã³ãã©èšèšãã®ãã®ã®åã§ãã
- ã©ãã ã倧éã®èšç®è³æºãæãŠãã
- ã©ãã ãå®ãæšè«ãæäŸã§ããã
- ã©ãã ãã¯ãŒã¯ããŒãã«åãããŠæé©åã§ããã
åŸæ¥ã®ã¯ã©ãŠãã§ã¯ãä»®æ³ãã·ã³ãã¹ãã¬ãŒãžããããã¯ãŒã¯ãã©ãçµã¿åãããããéèŠã§ããã
ãããLLMæä»£ã®ã¯ã©ãŠãã§ã¯ããã®å段ãšããŠã©ã®èšç®è³æºããã©ã®çšéã«ãã©ã®ã³ã¹ãã§å²ãåœãŠãããããéèŠã«ãªã£ãŠããŸãã
ã€ãŸãã¯ã©ãŠãã®ç«¶äºè»žã¯ããµãŒãã¹ã®è¡šå±€ã ãã§ã¯ãªãèšç®åºç€ã®èšèšåãã®ãã®ãžãšç§»ã£ãŠããŸãã
ãããŠAWSã®TrainiumãšInferentiaãããŸãã«ãã®æèã®äžã§çãŸãããã®ã§ãã
AWSç¬èªãããã®æå³
ãããŸã§èŠãŠããããã«LLMæä»£ã®ã¯ã©ãŠãã§ã¯GPUã®äŸçµŠäžè¶³ãäŸ¡æ Œé«éš°ããããŠæšè«ã³ã¹ãã®å¢å€§ã倧ããªèª²é¡ã«ãªã£ãŠããŸãã
ããããç¶æ³ã®äžã§AWSãé²ããŠããã®ããç¬èªãããã«ããAIåºç€ã®æé©åã§ããã®äžå¿ã«ããã®ãæšè«åãã«æé©åãããInferentiaãšãå€§èŠæš¡åŠç¿åãã«èšèšãããTrainiumã§ãã
ãããã¯åã«GPUã®ä»£æ¿ãšããŠäœããããã®ã§ã¯ãããŸããã
AWSãèªç€Ÿã¯ã©ãŠãã®äžã§ãAIã¯ãŒã¯ããŒããããå¹çããåŠçããããã«èšèšããã¯ã©ãŠãæé©ååã®èšç®åºç€ãšèŠãã¹ãã§ãã
Inferentia
Inferentiaã¯AWSãæšè«åŠçåãã«èšèšããå°çšãããã§ãã
æšè«ã§ã¯åŠç¿ã»ã©ã®æè»æ§ãæ±çšæ§ãããã以äžã®èŠçŽ ãéèŠã«ãªããŸãã
- é«ãã¹ã«ãŒããã
- äœãæšè«å䟡
- é»åå¹ç
- å®å®ããéçšã³ã¹ã
Inferentiaã¯ãããããæšè«ã¯ãŒã¯ããŒãã®ç¹æ§ã«åãããŠæé©åããããããã§ãã
ç¹ã«ã¯ã©ãŠãäžã§å€§éã®æšè«ãªã¯ãšã¹ããåŠçããçšéã§ã¯GPUã®ãããªé«ãæ±çšæ§ããããæ±ºãŸã£ãåŠçãå¹çããäœã³ã¹ãã§å®è¡ããããšãéèŠã«ãªããŸãã
ã€ãŸãInferentiaã¯åã«æšè«ãé«éåããããã®ãããã§ã¯ãªããæšè«ãã¹ã±ãŒã«å¯èœãã€æç¶å¯èœãªã³ã¹ãã§æäŸããããã®èšç®åºç€ãšèšããŸãã
Trainium
Trainiumã¯AWSãå€§èŠæš¡åŠç¿åãã«èšèšããå°çšãããã§ãã
LLMã®åŠç¿ã§ã¯ãèšå€§ãªèšç®éãé·æéã«ããã£ãŠåŠçããå¿ èŠããããåäœæ§èœã ãã§ãªãå€§èŠæš¡ã«åæ£ããããšãã®å¹çãéèŠã«ãªããŸãã
ãã®ããåŠç¿åºç€ã§ã¯ã
- å€§èŠæš¡ãªåæ£åŠç
- ãããã¯ãŒã¯ãå«ããå šäœèšèš
- é·æééçšæã®ã³ã¹ãå¹ç
ãšãã£ã芳ç¹ãéèŠã«ãªããŸãã
Trainiumã¯ããããå€§èŠæš¡åŠç¿ã®ç¹æ§ãèžãŸããããã§ãAWSã®ã¯ã©ãŠãäžã§å¹ççã«åŠç¿åŠçãå®è¡ã§ããããæé©åãããŠããŠãNeuron SDKãéããŠãœãããŠã§ã¢ã¹ã¿ãã¯ãšäžäœã§æäŸãããŠããç¹ãç¹åŸŽã§ãã
ã€ãŸãTrainiumã¯ãåã«åŠç¿åŠçãå®è¡ããããã®ãããã§ã¯ãªãAWSäžã§å€§èŠæš¡ãªæ©æ¢°åŠç¿ãå¹çããã¹ã±ãŒã«ãããããã®èšç®åºç€ãšèšããŸãã
GPUãšã®éã
ããã§éèŠãªã®ã¯ãGPUãšAWSç¬èªãããã®ç«ã¡äœçœ®ã®éãã§ãã
GPUã¯éåžžã«æ±çšæ§ãé«ããåŠç¿ã«ãæšè«ã«ãå¹
åºã察å¿ã§ããæè»æ§ã®é«ãã¯å€§ããªåŒ·ã¿ã§ãããçŸåšã®AIã€ã³ãã©ã«ãããŠäžå¿çãªååšã§ããããšã¯ééããããŸããã
äžæ¹ã§AWSã®ç¬èªãããã¯GPUã®ãããªæ±çšæ§ãæåªå
ã«ããèšèšã§ã¯ãããŸããã
AWSã®ã¯ã©ãŠãã§å®éã«çºçããã¯ãŒã¯ããŒããã€ãŸã
åŠç¿ã»æšè«ã»ã³ã¹ãã»é»åå¹çã»éçšæ§ãšãã£ã芳ç¹ãèžãŸããŠããç®çã«ç¹åããŠæé©åãããŠããŸãã
ã€ãŸãGPUãæ±çšçãªé«æ§èœèšç®è³æºã ãšããã°ãTrainiumãInferentiaã¯ã¯ã©ãŠãäºæ¥è ãèªç€Ÿã®AIåºç€ãæé©åããããã®èšç®è³æºã§ãã
ãã®éãã¯éåžžã«éèŠã§ãAWSãç¬èªããããéçºããæå³ã¯åã«ãGPU以å€ã®éžæè¢ãå¢ããããšãã§ã¯ãªããæ¬è³ªã¯AIæä»£ã®ã¯ã©ãŠãã«å¿ èŠãªæ§èœã»ã³ã¹ãã»äŸçµŠã»éçšæ§ããèªç€Ÿã§ã³ã³ãããŒã«ã§ããããã«ããããšã«ãããŸãã
ãããŠããã¯AWSãAIæä»£ã®ã¯ã©ãŠãç«¶äºãããŒããŠã§ã¢èª¿éã®åé¡ã§ã¯ãªããã€ã³ãã©å šäœã®èšèšåé¡ãšããŠæããŠããããšã瀺ããŠããŸãã
å®åã§ã¯ã©ãèããã¹ãã
ãããŸã§èŠãŠããããã«TrainiumãšInferentiaã¯åãªãæ°ãããããã§ã¯ãªããAWSãLLMæä»£ã®ã¯ã©ãŠãã«åãããŠèšç®åºç€ãã®ãã®ãåèšèšããçµæã§ããã®å€åã¯AWSãå©çšããåŽã«ãšã£ãŠãç¡èŠã§ããªããã®ã§ãããå®éã®èšèšã®èãæ¹ã«ã圱é¿ãäžãå§ããŠããŸãã
ãªããªãããããã®AIæ¡ä»¶ã§ã¯åã«GPUç°å¢ãçšæããã ãã§ã¯ååã§ã¯ãªããã¯ãŒã¯ããŒãã«å¿ããŠæé©ãªèšç®è³æºãéžã³ãå šäœãèšèšããããšãæ±ããããããã§ãã
GPUã ãã§ã¯æé©åãã«ããå Žé¢ãå¢ããŠãã
ãããŸã§AIåºç€ã®èšèšã§ã¯ããAIãªããšããããGPUããšããèãæ¹ãäž»æµã§ããã
ãã¡ããä»ã§ãGPUã¯éèŠãªèšç®è³æºã§ãããç¹ã«åŠç¿ãé«ãæè»æ§ãå¿
èŠãªçšéã§ã¯äžå¿çãªåœ¹å²ãæ
ããŸãã
ãã ãããã¹ãŠã®ã¯ãŒã¯ããŒããGPUã ãã§åŠçããèšèšã¯ã³ã¹ããéçšã®é¢ã§å¿ ãããæé©ã§ã¯ãªããAIã€ã³ãã©ã¯GPUã ãã§å®çµããããã®ã§ã¯ãªããGPUãšå°çšãããã驿驿ã§äœ¿ãåããèšèšãžãšå€ãã£ãŠãã£ãŠããŸãã
ã¯ãŒã¯ããŒãããšã®æé©å
éèŠãªã®ã¯ãããã®æ§èœãåäœã§æ¯èŒããããšã§ã¯ãªããã©ã®ã¯ãŒã¯ããŒãã«ã©ã®èšç®è³æºãé©ããŠããã®ããæŽçããŠèããããšã§ãã
ããšãã°ãã¢ãã«åŠç¿ã§ã¯äŸç¶ãšããŠGPUãTrainiumãæåãªéžæè¢ã«ãªããŸãã
äžæ¹ã§ãæšè«APIã®ããã«ç¶ç¶çãªã³ã¹ãæé©åãéèŠãªé åã§ã¯Inferentiaãæå¹ãªã±ãŒã¹ããããŸãã
ããã«å°èŠæš¡ãªåŠçãåšèŸºã·ã¹ãã ã§ã¯CPUãé©ããŠããå Žé¢ãå°ãªããããŸããã
ã€ãŸãå®éã®èšèšã§ã¯ã
| çšé | é©ããèšç®è³æº |
|---|---|
| ã¢ãã«åŠç¿ | GPU / Trainium |
| å€§èŠæš¡æšè«ã»ãµãŒãã³ã° | GPU / Inferentia / Trainium |
| æšè«API | GPU / Inferentia |
| å°èŠæš¡æšè«ã»åšèŸºåŠç | CPU / Graviton |
ã®ããã«ãã¯ãŒã¯ããŒãããšã«åœ¹å²ãåããŠèããå¿
èŠããããŸãã
ããããã®AIåºç€èšèšã§éèŠãªã®ã¯ããã©ããæåŒ·ãããæ±ºããããšã§ã¯ãªããã©ãã«äœãå²ãåœãŠããšå
šäœæé©ã«ãªãããèããããšã§ãã
èšèšã«æ±ããããèŠç¹
ãã®å€åã®äžã§ãAIã€ã³ãã©ã«æ±ããããèŠç¹ãå€ãã£ãŠããŠããŸãã
ãããŸã§ã¯ãGPUã€ã³ã¹ã¿ã³ã¹ãéžå®ããŠç°å¢ãæ§ç¯ããããšèªäœã䟡å€ã«ãªãå Žé¢ããããŸããããä»åŸã¯ããã ãã§ã¯äžååã§ããéèŠã«ãªãã®ã¯æ¬¡ã®ãããªèгç¹ã§ãã
- æšè«ã³ã¹ããã©ããŸã§äžããããã
- åŠç¿ãšæšè«ãã©ãåé¢ããŠèšèšããã
- GPUäŸåãã©ã®çšåºŠäžããããã
- AWSã®å°çšããããã©ãçµã¿èŸŒãã
ã€ãŸãããããéèŠã«ãªãã®ã¯åãªãç°å¢æ§ç¯ã§ã¯ãªããAIã€ã³ãã©å šäœãã©ãèšèšããããšããèŠç¹ã§ãã
顧客ã«ãšã£ãŠæ¬åœã«éèŠãªã®ã¯ããGPUãäœå°äœ¿ãããã§ã¯ãªãã
- ãµãŒãã¹ãç¶ç¶å¯èœãªã³ã¹ãã§éçšã§ããã
- å°æ¥çãªéèŠå¢å ã«èããããã
- ç¹å®ã®ãªãœãŒã¹äžè¶³ã«åŒãããããªãã
ãšãã£ãç¹ã§ãã
ãã®æå³ã§ãTrainiumãInferentiaãçè§£ããããšã¯åã«AWSã®æ°ãµãŒãã¹ãç¥ãããšã§ã¯ãªããAIæä»£ã®ã¯ã©ãŠãèšèšãã©ãèããã¹ãããçè§£ããããšãã®ãã®ã§ãã
éèŠãªã®ã¯ãGPUäžå¿ã®äžçãåæã«ããã®ã§ã¯ãªããGPUã»å°çšãããã»CPUãå«ããå šäœã®èšç®è³æºãã©ãçµã¿åãããããèšèšã§ããããã«ãªãããšã§ãã
ä»åŸã®AIæ¡ä»¶ã§ã¯ãããããèŠç¹ãæãŠããã©ãããææ¡ãèšèšã®å·®ã«ã€ãªãã£ãŠããã¯ãã§ãã
ãŸãšã
æ¬èšäºã§ã¯LLMã®èšç®ç¹æ§ããå§ãŸããçæAIã®æ®åã«ãã£ãŠã¯ã©ãŠãã€ã³ãã©ãã©ã®ããã«å€åããŠããã®ããæŽçããŠããŸããã
LLMã¯ããšããšGPUãšçžæ§ã®è¯ãã¯ãŒã¯ããŒãã§ãããããã®å©çšãççºçã«æ¡å€§ããããšã§ã¯ã©ãŠãã®åæãã®ãã®ãå€ããå§ããŠããŸãã
ãŸãGPUäžå¿ã®ã€ã³ãã©ã¯é«ãæ§èœãæäŸããäžæ¹ã§ãäŸçµŠäžè¶³ã»äŸ¡æ Œé«éš°ã»æšè«ã³ã¹ãã®å¢å€§ãšãã£ã課é¡ãæ±ããŠããŸãã
ç¹ã«çæAIãµãŒãã¹ã§ã¯åŠç¿ã³ã¹ã以äžã«æšè«ã³ã¹ããéèŠã«ãªããã©ãã ã髿§èœãã§ã¯ãªããã©ãã ãäœã³ã¹ãã§æšè«ã§ããããã¯ã©ãŠãäºæ¥è ã«ãšã£ãŠã®éèŠãªææšã«ãªã£ãŠããŸãã
ããããèæ¯ã®äžã§AWSã¯TrainiumãšInferentiaãéããŠãGPUã«äŸåããªãæ°ããéžæè¢ãæç€ºããŠããããããã¯åãªãä»£æ¿ææ®µã§ã¯ãªãAIã¯ãŒã¯ããŒãã«åãããŠèšç®è³æºãæé©åãããšããã¯ã©ãŠãã®æ°ããæ¹åæ§ã瀺ããã®ã§ãã
ãããŠãã®å€åã¯åã«ã€ã³ãã©ã®è©±ã«ãšã©ãŸããŸããã
AIæä»£ã®èšèšã«ãããŠéèŠãªã®ã¯ãGPUã䜿ãããšã§ã¯ãªããã¯ãŒã¯ããŒãã«å¿ããŠæé©ãªèšç®è³æºãéžã³ãçµã¿åãããããšãšãªããŸãã
æåŸã«
AIã€ã³ãã©ã®æä»£ã«æ±ããããã®ã¯ãGPUã䜿ãããšãã®ãã®ã§ã¯ãããŸããã
ã¯ãŒã¯ããŒãã«å¿ããŠæé©ãªèšç®è³æºãéžã³ãçµã¿åãããŠããããšã§ãã
ãããŠãã®èšèšåãããããããã®AIæä»£ãæ¯ããéèŠãªåã«ãªã£ãŠããã¯ãã§ãã