計算資源予測
Romeo Dean|2025年4月
図1:AI 2027に登場する訓練ラン。その想定は、本補遺の計算資源の生産、計算資源の配分、計算資源の用途の各節を根拠にしている。
概要
計算資源は、AIの進歩を左右する主要な投入要素の一つである。この補遺ではAI関連の計算資源だけを扱う。補遺全体を通じてH100換算(H100-equivalents、H100e)という単位をたびたび使う。これは、AI関連の計算資源の処理性能を、NvidiaのH100 GPU何台分にあたるかに換算したものである。処理性能が最も直接に関係するのは訓練計算量だが、推論計算量のよい代理指標にもなる。
第1節では、サプライチェーンのボトルネックを調べてAI関連の計算資源の生産をモデル化する。そのうえで、世界で利用できるAI関連の計算資源は、2025年3月と比べて2027年12月までに10倍に増え(年2.25倍)、1億H100eに達すると見積もる。
図2:AI関連の計算資源の世界全体の保有量は、2027年12月までに10倍に増えると予測する。
第2節では、関係する主体のあいだで計算資源がどう配分されるかをモデル化し、計算資源の所有者と、計算資源を借りるか自ら所有して使うエンドユーザーの両面から内訳を示す。計算資源の利用は、トップクラスのAGI企業(OpenAI、Anthropic、xAIなど)と、大手テック企業内部のAGI開発部門(Google、Metaなど)に集中していくと予想する。そのうち上位2〜3社は、2027年末までにそれぞれ世界で利用できるAI計算資源の15〜20%(約1500万〜2000万H100e)を占めるようになる。現在のシェアは5〜10%(約50万H100e)である。
図3:AI関連の計算資源の世界的な配分は、トップクラスのAI企業に集中していく(世界の計算資源保有量に占める各社のシェアはおよそ3倍になる)と予測する。中国は世界の計算資源に占めるシェアをほぼ一定(約12%)に保つが、それを単一の国家的AI開発に集約していく。
図4:首位のAI企業が使える計算資源は、2027年12月までに40倍に増えると予測する。そのうち約10倍は世界のAI関連計算資源の保有量の増加により、約4倍は保有量全体に占める同社の利用シェアの拡大による。
図5:2027年12月までの、世界の計算資源の増加傾向(年2.25倍)と、首位のAI企業が使うシェアの拡大(年1.5倍)。両者を掛け合わせると、首位のAI企業の計算資源は年3.4倍で増える。FLOPの数値はモデルFLOP利用率40%を前提とする。
第3節では、トップクラスのAI企業が自社の計算資源をどう使うと予想されるかを述べる。事前学習と外部展開から、事後学習、合成データの生成、社内展開(つまり研究の自動化と研究用の実験)へと重心が移っていく。首位のAI企業の中では、計算資源の用途が研究の自動化に集中していくと予測する。AIの実行そのものに使われる割合は比較的小さく(5〜10%)、合成訓練データの生成(20%)と、AIに与える潤沢な研究実験用の計算予算(35%)が大きな割合を占める。実際の訓練ランと外部展開が占める割合はより小さい(20%)が、絶対量で見れば、それぞれに使われる計算資源は依然として2024年の20倍を超える。
図6:計算資源の用途は研究の自動化へ集中していく。データ生成も増える。
第4節では、2027年に予想されるAI研究の自動化について推論計算量を分析し、運用されるAIモデルのコピー数と速度を見積もる。2027年末までにアルゴリズムの効率が大きく進歩すれば、首位のAI企業は計算資源の6%を使い、主に推論専用チップによって、人間の50倍の思考速度(毎秒500語)で動く超知能AIのコピーを約100万体運用できるようになると予想する。
図7:推論専用チップを使った、2027年の研究自動化のためのAI研究アシスタントの運用見込み。緑の線は、首位のAI企業のH100e計算資源の6%を使う場合を示す。
第5節では、2027年までの首位のAI企業について、訓練ラン、総費用、総収益、総電力使用量の予測を具体的に見る。収益と費用の伸びはどちらも年約3倍と予測する。首位のAI企業の電力使用量は2027年12月までに約10GWに達し、米国の電力容量の約0.8%を使うことになる。AI全体では世界で60GW、米国で50GWを使い、これは予測される米国の電力容量(現在の1.28TWから増えて1.35TW)の約3.5%にあたる。
2027年の主要指標
図8:第5節の予測のまとめ。
すべての推計は公開情報にもとづいているが、公開情報は乏しく不確かである。大まかに言えば、第1節と第2節は比較的根拠がしっかりしており、AI 2027のシナリオからも独立している。一方、第3節・第4節・第5節は、AI 2027で起こる急速なAI能力の向上をはるかに強く前提にしている。
謝辞:David Schneider-Joseph、Erich Grunewald、Konstantin Pilz、Lennart Heim、Mauricio Baker、Tao Lin。
はじめに
計算能力は、AIの進歩を左右する主要な投入要素の一つである。AIの訓練と推論に使われる計算の大半は並列に実行できる。AIチップ(AIアクセラレータ)は、こうした並列計算を特に効率よくこなす計算装置(GPUなど)であり、そのためAIの計算処理ではCPUのような従来型プロセッサよりはるかに高い性能を発揮する。
実際、この補遺で扱うのはAI関連の計算資源だけである。これは具体的には、総処理性能(Total Processing Performance、TPP)が4,000以上、かつ性能密度(Performance Density, PD = TPP / ダイサイズ)が4以上を達成できる計算ユニットと定義する。この基準は、2021年時点のNVIDIAの最先端チップであるA100 SXM GPUをわずかに下回るように設定した。参考までに、NvidiaのH100 GPUの公称値はTPP約15,800、PD 19.4である。直感的には、この定義は「H100の少なくとも¼の効率があるものはすべて数に入れる」と考えればよい。
補遺全体を通じて、AI関連の計算資源の単位としてH100換算(H100e)をたびたび使う。これは、計算の処理性能(TPP)を、H100の処理能力(約15,800 TPP)の何台分かに換算したものである。TPPに注目するため、本補遺の分析が最も直接に関係するのは訓練計算量だが、推論計算量のよい代理指標にもなる。ただし、研究エージェントを動かすための推論計算量を扱う節では、TPPではなくメモリ帯域幅で計算する。
第1節:計算資源の生産
確度:不確実だが、根拠はある。この節は公開情報にもとづく、根拠のある予測である。
図9:計算資源の生産予測のまとめ。
世界のAI関連計算資源の総保有量は、今後3年間で年2.25倍に伸び、現在の1000万H100eから2027年末までに1億H100eに達すると予想する。この推計では、H100eで測った計算資源の総量の伸びを、(A)チップの効率の向上と(B)チップの生産量の増加に分解する。それぞれの基準となる伸び率は1.35倍と1.65倍である。
| 2023 | 2024 | 2025 | 2026 | 2027 | |
|---|---|---|---|---|---|
| 生産される平均的なチップの性能密度(PD)の倍率(H100 = 1倍) | .66x | .9x | 1.22x | 1.64x | 2.4x |
| 生産されるAIチップの総面積(H100サイズのチップ = 1) | 3M | 5.5M | 9M | 16M | 25M |
| 生産されるAIチップの総量(H100eの処理性能(TPP)換算) | 2M | 5M | 11M | 25M | 60M |
| 利用可能なH100eの累計 | 4M | 8.5M | 18M | 40M | 100M |
| H100eあたりの総所有コスト | $50k | $40k | $25k | $20k | $15k |
| AIデータセンターへの総支出 | $110B | $270B | $400B | $600B | $1T |
| H100eあたりのデータセンター総所要電力 | 1.3kW | 1.0kW | 750W | 700W | 550W |
| AIデータセンターの総所要電力 | 5GW | 9GW | 15GW | 29GW | 62GW |
スプレッドシートのモデル全体も参照のこと。
チップの効率
チップの効率(性能 / 面積)の向上については、Epoch AIが示した年1.35倍という過去の傾向を外挿した。この値は、NVIDIAのGB200のように今後登場するチップについてすでに報じられている性能とも、以下で詳しく述べるRubinシリーズの噂されている計画とも整合する。
(1 x 10^15 FLOP/s)
(2.5 x 10^15 FLOP/s)
(6 x 10^15 FLOP/s)
2024年に広く採用されている最先端のGPUはNVIDIAのH100で、素の性能はFP16で1e15 FLOPである。3年後に広く採用されている最先端のGPUは、NVIDIAのRubin GPU(R200)になると予測する。R200は、B200(2025〜2026年に広く使われる)の約2.4倍に向上し、FP16で6e15 FLOPの性能に達すると見込む。この向上は、ダイサイズの1.2倍の拡大、TSMCのN4プロセスからN3プロセスへの移行による1.7倍、その他の細かな改良による1.1倍によって実現すると考える。
効率の向上とダイサイズの拡大を混同しないよう、H100からR200への最先端GPUの性能の向上(全体で6倍)から、両チップ間のダイサイズの拡大(約2.4倍)の分を差し引く必要がある。すると、今後3年間のチップの効率の向上は全体で2.5倍となり、年1.35倍という過去の傾向と一致する。最先端のNVIDIA GPUの傾向は、毎年利用できる平均的なGPUの傾向のよい代理指標になると仮定する。その理由は、NVIDIAのGPUがチップの大半を占めるからというだけではない。他の人気チップ(GoogleのTPUシリーズなど)の性能も、TSMCの製造プロセスの進歩のように、相関の強い上流の要因に左右されるはずだからである。
チップの生産
図10:チップ生産モデルのまとめ。
チップの生産量の増加については、生産を左右する3つの主要な要素にさらに分解する。(B.1)ウェハーの生産(主にTSMCのN5・N3プロセスが担う)、(B.2)先端パッケージングの生産能力(これも主にTSMCのCoWoS技術が担う)、(B.3)広帯域メモリ(HBM)(主にSK Hynixが供給し、MicronとSamsungの供給も増えている)である。
2023年にNvidiaが出荷したのは120万H100eで、これがAI計算資源市場全体の約60%を占めたと推計する。残りの大半は、Broadcomの支援を受けたGoogleの自社製TPUの生産による。合計すると、2023年は200万H100eになる。2024年には500万H100eに増え、やはりその約60%をNvidiaが占めたと見込む。
主にTSMCとSK Hynixの生産量に注目する。両社はそれぞれの市場で約90%と約60%のシェアを占めており、市場の残りの部分も同様の傾向をたどると予想するからである。全体として、今後3年間のAIチップの生産は、先端パッケージングとHBMの生産がボトルネックとなり、年約1.65倍に抑えられると予測する。
ウェハーの生産
NvidiaのBlackwell世代のGPUには、TSMCの4Nノード(N5プロセスの一種)が採用された。2026年後半に量産が始まると見込まれるRubin GPUには、おそらくN3プロセスが使われる。2023年にAIアクセラレータが使ったのは、TSMCのN5とN3の生産ライン全体のうち、おそらく多くて3%である。これらの生産ラインは稼働率がわずか70%にとどまることもあると報じられており、今後3年間にウェハーの生産がAIチップ生産のボトルネックになる可能性はきわめて低い。たとえAIチップの生産量が毎年倍増しても、新たに稼働する生産能力(年約15%の拡大)を考えに入れなくてさえ、2027年までにAIチップの生産が製造能力の約40%を超えることはないはずである。ただし、2027年より先には、ウェハー生産の限界によって、チップ生産の伸びが年1.65倍から約1.25倍へ鈍ると予想する。
先端パッケージング
AIアクセラレータには、AIの処理に必要な高いスループットを実現するため、ロジックとメモリを高密度に接続する先端パッケージングが欠かせない。現在、TSMCの先端パッケージングの生産能力は大半がAIアクセラレータに使われており、2023年から2024年にかけて2.5倍に拡大したと報じられている。TSMCはAI需要の伸びを年50%と見込んでいるので、これらの生産ラインをそれほど積極的には拡大しないだろうと予想する。実際、TSMCは2026年まで生産能力を年1.6倍で増やす計画を発表している。とはいえ、2024年に約2.5倍の拡大が見られたことから、生産量そのものの拡大は予想を上回り、年約2倍で続くと見込む。一方で、チップの効率を高めるには、製造プロセスの難しさも予想を上回るほど増していく(具体的には3Dパッケージングや、その先の技術への移行)。そこで、生産能力そのもの(難度の上昇を無視したもの)は年2倍で伸びるとモデル化したうえで、製造の難しさ(歩留まりの低下や、新たな要件に合わせた生産ラインの変更など)の分として年1.2倍を差し引き、今後3年間の伸びを全体で年1.65倍とした。
広帯域メモリ
AIの処理は大量のメモリを必要とし、高価で高速な広帯域メモリ(HBM)を要する。HBMの生産は、複数のDRAMチップを精密に積み重ねて接続する高度な工程である。SK Hynixはこの技術を最初に開発し、最新世代のHBM3eを最初に生産している。MicronとSamsungも追い上げており、HBM4以降の世代でSK Hynixと競えるロードマップを描いている。HBMの生産ラインは、2024年に2023年比で2.5倍に拡大されたと報じられているが、SK Hynixは今後の需要の伸びを1.6倍としか見込んでいない。先端パッケージングと同様に、HBMの生産(難度の上昇を無視したもの)はこの見込みを上回って年2倍で伸びると予想する。ただし、ここでも製造の難しさの増加(特に8-Hiから12-Hi、16-Hiの積層への移行)を考えて1.2倍を差し引き、今後3年間の伸びを年1.65倍とする。
ハードウェア研究開発の自動化
AIの能力全般と、AI研究開発についての私たちの予測に沿って、2027年にはトップクラスのAI企業が専用チップの設計を自動化し、自社でのチップ生産を増やすと予想する。そうした野心の兆しはすでに見えている。たとえばOpenAIは、実績豊富なGoogle TPUの設計者を採用し、2025年に初の自社チップを設計する計画を立てている。とはいえ、チップの効率を年1.35倍で高め続けることはますます難しくなっている。また、研究の自動化は主に別の方面に向けられると私たちは予想している。そのため、こうした取り組みの大半は平均的なチップの効率をわずかに押し上げる程度にとどまり、平均効率はH100の2.4倍(基準となる傾向どおりなら2.2倍)になると予想する。その押し上げは主に、推論に特化したチップの生産の波によってもたらされる。
第2節:計算資源の配分
確度:不確実だが、根拠はある。この節は、限られた公開情報にもとづく、根拠のある予測として読んでほしい。
図11:計算資源のエンドユーザーへの配分予測のまとめ。
この節では、2027年までについて、世界のAI関連計算資源のうち計算資源の提供者が所有するシェアと、エンドユーザーが利用するシェアを予測する。計算資源の所有者とは、AI計算クラスターを所有・運用する主体である。エンドユーザーとは、自らのAI処理のために計算クラスターを使う主体である。提供者とエンドユーザーを兼ねる場合もある(Google、Meta、xAIなど)。一方、所有者が計算資源の大半を他の主体に貸し出す場合もある(MicrosoftがOpenAIに、AmazonがAnthropicに、OracleがOpenAIに貸し出す場合など)。所有者とエンドユーザーは、次の網羅的な分類で整理する。
関係する主体の分類
| 所有者 | エンドユーザー |
|---|---|
| Microsoft | OpenAI |
| Anthropic | |
| Amazon | GoogleのAGI開発 |
| Meta | Googleのその他 |
| xAI | MetaのAGI開発 |
| Oracle | Metaのその他 |
| 中国の大手4社(Bytedance、Alibaba、Tencent、Baidu) | xAI |
| 首位のAI企業 | 中国のAGI開発 |
| 米国のその他 | 米国のその他 |
| その他の国々 | その他の国々 |
私たちの予測では、トップクラスのAI企業が持つAI計算資源は、絶対量で見て2024年12月と比べ2027年12月までに20〜40倍になる。そのうち10倍は、すでに述べた計算資源の利用可能量の増加による。3倍は、トップクラスのAI企業とそのAGI開発部門へ計算資源の集中が進むことによる。
計算資源の所有者
近年の状況
計算資源の生産の節では、世界で利用できるAI関連の計算資源を、2023年末に400万H100e、2024年末までに850万H100eと推計した。Epoch AIによる先行研究(Can scaling continue through 2030? の付録B)は、2024年初めの時点でMetaとMicrosoftがそれぞれ15万〜60万H100e、GoogleとAmazonがそれぞれ40万〜140万H100eを保有していたと推計している。2024年初め(2023年12月31日)についての私たちの点推計は、公開情報が乏しいため不確かだが、Epoch AIの推計幅の中ほどに収まり、重なり合う複数の情報源とも整合する。2024年の生産量と購入量についてのこの報道をもとに、その結果として生じる2024年12月時点の配分を推計した。
図12:計算資源の所有者ごとの、AI計算資源の内訳の推計(H100e、過去の実績)。
Omdia(Financial Timesの報道による)によれば、2024年にAIサーバーへの支出が多かった米国企業の上位5社は下表のとおりである。あわせて、各社が取得したH100eの量と、そこから求めたH100eあたりの支出額の私たちの推計も示す。Googleの支出効率が高いのは、すでに第6世代に達した自社製TPUがあるからである。AmazonとMetaにも本格的な自社設計のチップがあるが、研究開発の段階はまだ早い。MicrosoftとxAIが購入したのは、ほぼすべてNvidiaのチップである。
| 2024年のAIサーバーへの支出 | 2024年のH100e増加量(2023年比) | H100eあたりの支出 | |
|---|---|---|---|
| Microsoft | $32B | 800K | $39k |
| Amazon | $26B | 700K | $37k |
| $22B | 1M | $22k | |
| Meta | $20B | 550K | $36k |
| xAI | $7B | 200K | $37k |
2025年の中間予測
| 2025年のAIサーバーへの支出(予測) | 2025年のH100e増加量(2024年比) | 2025年のH100eあたりの支出 | |
|---|---|---|---|
| Microsoft | $56B | 2.4M | $23k |
| Amazon | $48B | 2.2M | $22k |
| $44B | 2.2M | $20k | |
| Meta | $35B | 1.6M | $22k |
| xAI | $30B | 1.3M | $23k |
2025年の計算資源の配分を予測するため、AIへの支出額が多い米国の上位5社と、2024年に各社の支出のうちAIサーバーが占めた割合を調べた。結果は次のとおりである。
Microsoftは2025年にAIへ800億ドルを支出すると発表した。昨年は支出の55%がAIサーバーに向けられた(560億ドルのうち310億ドル)。AIサーバーの割合は70%に上がると予想し、2025年のAIサーバーへの支出を560億ドルと推計する。
Googleは2025年にAIへ750億ドルを支出すると発表した。昨年は支出の42%がAIサーバーに向けられた(520億ドルのうち220億ドル)。AIサーバーの割合は58%に上がると予想し、2025年のAIサーバーへの支出を440億ドルと推計する。
Amazonは2025年に1000億ドルを支出すると発表した。昨年は支出の33%がAIサーバーに向けられた(780億ドルのうち260億ドル)。AIサーバーの割合は48%に上がると予想し、2025年のAIサーバーへの支出を480億ドルと推計する。
Metaは2025年に650億ドルを支出すると発表した。昨年は支出の50%がAIサーバーに向けられた(400億ドルのうち200億ドル)。AIサーバーの割合は54%に上がると予想し、2025年のAIサーバーへの支出を350億ドルと推計する。
xAIは、2025年のAIサーバーへの支出を約300億ドルとすると発表した(1:05:00あたり)。
図13:計算資源の所有者ごとの、AI計算資源の内訳の予測(H100e)。
2027年の予測
図14:AI計算資源の所有者別シェアの予測(値はH100e)。
計算資源の生産の節では、2027年までに利用可能な計算資源の総量が1億H100eに増えると見込んだ。これは年2.25倍の増加にあたる。これほど爆発的な伸びがあれば、計算資源の配分はたやすく塗り変わると考えるべきだろう。この伸びを牽引するのは、エンドユーザーであるAI開発企業からの持続的な需要だと予想する。これらの企業は、自社のAIモデルで年間数百億ドル規模の収益を上げはじめる。
私たちの予測は次のとおりである。
Microsoftは(OpenAIとの関係に後押しされて)積極的に規模を拡大し、世界の計算資源に占めるシェアを13%から18%に伸ばす。
Googleはすでに計算資源に余力があるため拡大のペースが遅く、計算資源のシェアは21%から18%へわずかに下がる。
Amazonは積極的に規模を拡大する。Anthropicからの持続的な需要と自社のAI事業が積極的な設備増強を正当化し、シェアは18%までじわりと上がる。
Metaの12%のシェアは9%に下がる。主にオープンソースで公開しているAIモデルからの収益が伸び悩み、2026年と2027年に他社と同じほど積極的な設備増強を正当化できないからである。ただし、それでもMetaの計算資源は絶対量で110万H100eから750万H100eへと7倍に増える。
xAIは積極的に規模を拡大する。そこそこのAI収益とElon Muskの後ろ盾に支えられ、ハードウェアへの設備投資の総額は2027年までに約1000億ドルに達し、計算資源のシェアは2%から9%に伸びる。
米国のその他には、OracleやCoreweaveのような比較的大きな事業者のほか、小規模な提供者や所有者が含まれる。これらはいくぶん押しのけられ、大手と同じほど積極的に規模を拡大する経済的な動機もやや弱い。全体として、米国のその他のシェアは18%から9%に下がる。
中国の大手4社は、輸出規制のために、AI計算資源の確保にやや苦労するようになる。ただし、中国の国内生産が拡大し、Nvidiaにおよそ3年遅れる品質のチップを大量に生産する。それでも、米国の輸出規制は相変わらず十分に執行されないため、大手4社のシェアは9%から8%へわずかに下がるだけである。また、他の中国企業へも大量に密輸されるため、中国国内の計算資源の総量はこれよりかなり多くなる。SMICを通じた国内生産も拡大するが、効率では数年遅れている。
その他の国々も、米国の小規模事業者と同様の理由でいくぶん押しのけられ、シェアは9%から5%に下がる。
最後に、将来の「首位のAI企業」は、2026年の終盤から2027年にかけて自社のデータセンターを建設すると決めると予想する。これは、同社の収益が2026年末までに年換算で500億ドルに達し、そのAI能力が2027年に自社専用GPUの開発を後押しすることと整合すると考える。全体として、同社は約900億ドルの支出で、世界のAI計算資源の約6%を効率よく取得すると予測する(自社チップ設計の研究開発費は含まない)。
計算資源のエンドユーザー
近年の状況
OpenAIの最近の費用に関する報告によれば、同社は2024年を通じて平均約25万台のH100を借りている。後半ほど多く、年末には46万台に達すると予想する。主な供給元はMicrosoftで、OracleやCoreweaveとの契約も使っている。これにより、年末時点でOpenAIのシェアは世界全体の850万H100eのうち約5%になる。
Anthropicの計算資源の利用は、収益とユーザー数がより少なく、そのため資金へのアクセスも限られることから、やや少ない4%と見込まれる。年末までに約36万H100eを利用できると予想し、その多くは最近Amazonが提供した40万基のTrainium2クラスターによるものである。
xAIは拡張中の20万台のH100クラスターを持ち、シェアは2%になる。
GoogleとMetaのAI計算資源は、それぞれ世界の21%、13%を占める。ただし、AGI開発に使われるのはこれらのクラスターの約30%にとどまると予想する。GoogleとMetaのAI計算資源の残りの大半は、世界中で使われる膨大な数の推薦アルゴリズムの開発と運用に充てられている。
AmazonとMicrosoftの残りの計算資源や、ネオクラウド、小規模な提供者の計算資源に対するクラウドサービス需要の大半は、米国のその他とその他の国々の企業やスタートアップが使うと予想する。シェアはそれぞれ約20%になる。
中国は、中国の大手4社が所有する計算資源の実質的にすべてを使うと予想する。さらに、「その他の国々」の区分が所有する計算資源の約半分も使う。この区分の計算資源の多くはマレーシアとシンガポールに集中しており、それらはおそらく中国によって使われている(あるいは中国へ直接密輸されてさえいる)からである。これにより、中国の計算資源の利用は合計で14%と推計される。2024年後半にはそのうち20%がAGI開発に充てられると予想し、中国のAGI開発のシェアは合計で3%になる。
2027年の予測
この節では便宜上、2027年の首位のAI企業をOpenAIと仮定する。したがって、ここでの予測は、OpenAIが首位のAI企業であり続けるシナリオで計算資源の内訳がどうなるかを示す一例にすぎない。 **
図15:AI計算資源のエンドユーザー別シェアの予測(値はH100e)。
OpenAIとAnthropicはどちらも積極的に規模を拡大する。それが出資者であるMicrosoftとAmazonの積極的な設備増強を促し、やがて両社は自社のデータセンターもいくつか所有するようになる。世界のAI計算資源に占めるOpenAIの利用シェアは、2024年末の5%から20%へと跳ね上がり、Anthropicは4%から14%になる。
xAIは、計算資源の所有者の項で説明した自社所有の計算資源をすべて使い続けるため、利用シェアも2%から9%に伸びる。
GoogleとMetaは、今や計算資源のそれぞれ90%と80%をAGI開発に充てる。そのため、GoogleのAGI開発のシェアは6%から16%に、MetaのAGI開発のシェアは4%から6%に伸びる。
中国の計算資源の総シェアは約13%にとどまるが、AGI開発に充てる割合が40%から90%に上がるため、中国のAGI開発のシェアは2%から12%に伸びる。
最後に、提供者の項と同様の理由で、米国のその他とその他の国々のエンドユーザーは押しのけられ、利用シェアはそれぞれ23%から11%、18%から11%に下がると予想する。
図16:AI計算資源のエンドユーザー別内訳の予測(H100e)。
第3節:計算資源の用途
確度:探索的で不確実。この節は根拠のある予測ではなく、最善の推測である。
図17:計算資源の用途予測のまとめ。
首位のAI企業の社内での計算資源の用途の内訳は、次のようになると予想する。根拠は、現在の用途についての公開情報と、今後の開発・展開・研究の優先度の相対的な変化についての、知識にもとづく推測である。この節の残りでは、次の表の値を1行ずつ根拠づけていく。
| 2024 | 2025 | 2026 | Q1 ‘27 | Q2 ‘27 | Q3 ‘27 | 2027年第4四半期(競争) | ||
|---|---|---|---|---|---|---|---|---|
| 計算資源の総使用量と費用 | 期間中に使われた計算資源の平均 (H100e) | 250K | 1M | 4M | 7M | 9M | 12M | 15M |
| → 期間中の計算資源への支出 | $5.4B | $12.5B | $30B | $20B | $25B | $30B | $45B | |
| → fp16 FLOP換算の計算予算(利用率30%) | 2.5e27 | 1e28 | 4e28 | 2e28 | 2.5e28 | 3e28 | 4e28 | |
| 内訳 | ||||||||
| 訓練 | 1) 訓練ラン | 40% | 40% | 40% | 30% | 27% | 22% | 20% |
| → 事前学習の割合 | 60% | 50% | 40% | 10% | 8% | 5% | 5% | |
| → 事後学習 | 40% | 50% | 60% | 90% | 92% | 95% | 95% | |
| 社内の処理 | 2) 合成データの生成 | 20% | 20% | 20% | 27% | 23% | 22% | 22% |
| 3) 研究実験 | 4% | 5% | 6% | 14% | 21% | 28% | 35% | |
| 4) 研究の自動化 | 1% | 3% | 4% | 6% | 6% | 6% | 6% | |
| 社内の合計 | 25% | 28% | 30% | 47% | 51% | 57% | 63% | |
| → 能力向上の割合 | 95% | 96% | 97% | 97% | 97% | 97% | 97% | |
| → アラインメントの割合 | 5% | 4% | 3% | 3% | 3% | 3% | 3% | |
| 外部向けの推論 | 5) 外部展開 | 33% | 30% | 28% | 20% | 19% | 18% | 13% |
| その他 | 6) 監視 | 2% | 2% | 2% | 3% | 3% | 3% | 4% |
計算資源の総使用量と費用
これらの行は、計算資源の生産と配分についての全体的な予測にもとづき、世界の計算資源の利用に占めるシェアが2024年から2027年にかけて約5%から約20%に伸びる、典型的な首位のAI企業を描いたものである。それらの節では、首位のAI企業が使うAI計算資源は年3.4倍で増え、計算の価格性能比(FLOP/$)はおおよそ年1.4倍で向上すると予測した。費用の予測について詳しくは財務の節を参照のこと。
訓練ランへの計算資源の使用
2024年、OpenAIは計算資源の平均40%を訓練に使ったと推計する。そのうち大部分(約60%)は次世代の事前学習ランへの規模拡大の試みに、残り(約40%)は推論能力とエージェント性に重点を置いた、強化学習による事後学習に使われたと予想する。これは、fp16で約3e26 FLOPの事前学習ランを1回実施したこと(H100 10万台を4か月使うことに相当し、過去のスケーリングの傾向と一致する)と、平均10万台のH100を強化学習の処理に2.5か月使ったことと整合する。OpenAIは約10万台のH100からなる単一のクラスターを比較的集中的に使えるようだ。一方で、計算資源をCoreweave、Oracle、Microsoftという少なくとも3つの提供者から調達していることを考えると、これより大きな訓練ランを可能にするほどチップが集中し、データセンター間で十分に接続されているとは考えにくい。さらに、OpenAIには社内展開と外部展開で大きな計算資源の需要があり、総量の残りはそちらに充てられていると考えるほうが妥当である。
今後については次のように予想する。
今後2年間、訓練に使われる割合は40%前後で推移する。
訓練計算量のうち事後学習に充てられる割合が、ますます大きくなる。
2027年には大規模な事前学習ランは行われず、訓練計算量はほぼすべて、2026年に訓練された大規模モデルの事後学習の処理に向けられる。
合成データの生成
2024年には、OpenAIの計算資源のおおよそ20%が合成データの生成に使われると予想する。主な用途はおそらく、報じられている「Orion」モデルや、より弱いベースモデルから、推論時の手法(木探索にもとづくものなど)で出力を引き出し、評価と選別(棄却サンプリングなど)を通じて、o1や最近発表されたo3のようなモデルの事後学習に使うデータを作ることだろう。これは、年間を通じて平均5万台のH100を使うこと、つまりfp16で2.5e26 FLOPに相当する。使い方の一例としては、Orionで5兆回(Orionはfp8精度で運用される、密モデル換算2兆パラメータのモデルと仮定する)、GPT-4oで500兆回のフォワードパスを実行することが考えられる。私たちの推測では、Orionのフォワードパスは選別されず、そのまま5兆トークンの高品質な訓練データとして使われる。一方、GPT-4oのフォワードパスは、(探索と評価を経て)高品質なトークン1個を得るのにおおよそ16回を要し、さらに30兆トークンを生み出す。こうして生成されるトークンは合計35兆で、おそらくo1とo3の事後学習に使われる。これでGPT-4oの事後学習に約1e26 FLOPを使えることになる。合成データの生成は、事後学習の処理とともに重要性を増していき、約20%を保ったのち、2027年には約30%に伸びると予想する。
研究実験
2024年には研究実験がかなりの優先事項だったと予想する。2024年を通じて平均1万台のH100が使われた。これは合計でfp16の約1e26 FLOPに相当する。相当な量であり、大小さまざまな訓練やアーキテクチャの実験ができたはずである。重点が訓練ランと外部展開からAI研究開発の自動化へ移るにつれ(特に2027年)、この割合は着実に伸びると予想する。アルゴリズム研究の取り組みが拡大し、実験予算のより大きな割合を必要とするからである。研究の労働がますます自動化されると、実験用の計算資源が進歩のボトルネックとしてますます重要になる。そのため、この用途の割合は2024年の4%から、2027年初めには15%、2027年後半には35%へと急増すると予測する。これは、2027年の実験用計算資源がfp16で2e28 FLOPを超えることに相当する。
研究の自動化
2024年の時点では、社内での研究の自動化はごく限られていたと予想する。従業員が研究作業の補助にo1やo3のようなモデルを先行利用する程度だった。平均1000台のH100、つまりfp8で2e25 FLOPあれば、Orion(私たちの最善の推測では密モデル換算2兆パラメータ)や、推論コストが同程度かもしれないo1やo3のようなモデルで、2500億回のフォワードパスを実行するのに十分である。検算として、従業員を1000人と仮定すると、これは従業員1人あたり2億5000万トークン、1日あたりにしておよそ80万トークンになる。思考の連鎖の比率を8:1、スループットを毎秒100トークンとすると、従業員1人あたり1日に約1000秒、つまり16分の生成時間にあたる。平均としては妥当な値に思える。今後、社内のモデルの能力が上がるにつれて、この利用は大幅に拡大すると予想する。従業員1人あたりに動かすモデルのコピー数も、モデルを運用する際の典型的な足場(スキャフォールディング)の方式(したがって推論時の計算量の倍率)も大きくなる。これは特に2027年、高価なモデルを使って研究開発のワークフローを自動化しようとする動きにともなって急増し、現在の1%から約6%に達する。ただし、それ以上には伸びない。それ以上に増やせば研究の労働力が余り、実験用の計算資源が足りなくなるからである。
外部展開への計算資源の使用
OpenAIは2024年を通じて計算資源のおおよそ30%を外部展開に使っており、これは年間平均で7万5000台のH100にあたると予想する。運用中のモデル(リクエストをまとめて処理するのが難しいと見込まれる)で、推論の利用率が平均10%(出力トークンと入力トークンの合計で)に達するとすれば、これはGPT-4oの約800兆回のフォワードパス、つまり1日あたり約2兆トークンに相当する。
これはおおよそ妥当に思える。2024年2月、Sam AltmanはOpenAIが1日に1000億語を生成しているとツイートした。これが年央までにおおよそ3倍の4000億トークンになり(利益率がやや縮むため、収益の伸びをわずかに上回る)、推論計算量を不釣り合いに多く使うo1-preview、o1、o1-proの公開によってさらにおおよそ4倍の1.6兆トークンになったと仮定する。入力と出力のトークン比を平均1:1(文書などの入力があるため)と仮定すれば、年間を通じた平均は入力と出力それぞれ1日あたり約1兆トークン、合計2兆トークンになる。
今後については次のように予想する。
この割合は2025年を通じてほぼ変わらず、その後は減りはじめる。社内での優先事項が増えるうえに、AIの能力によって社内のAI研究開発の生産性が大きく高まるため、2027年の最先端モデルの公開が遅れるからである。
今後3年間で、収益に占める割合は企業顧客へとますます移っていくと予想する。ビジネスモデルの中心が「オンラインのチャットボット」から「すぐに業務に組み込めるリモートワーカーのサービス」へ移るからである。
なお、割合は減っても、絶対量では依然としてきわめて大きな伸びになる。2024年の7万5000台のH100から、2027年には200万台になる。これは私たちが予想する収益の伸びとほぼ比例している。
監視への計算資源の使用
ごく大まかな目安として、平均推論コストが運用中のモデルの平均推論コストの約10分の1のモデルが、さまざまな場面で全入出力トークンのおおよそ半分を検査すると予想する(外部展開の監視や、後年には研究の自動化も含む、より広範なAI制御の仕組みなど)。そこで、外部展開と研究アシスタントの割合を足して20で割り、監視に使う計算資源の割合を推計した。その結果、この割合は期間を通じて約2〜4%でほぼ一定に保たれる。
第4節:AI研究の自動化
確度:不確実だが、根拠はある。この節は公開情報にもとづく、根拠のある予測である。
図18:研究の自動化への計算資源の使用の節で予測したとおり、OpenBrainがH100e計算資源の6%を使う場合に直面すると予想される、AI研究エージェントの運用のトレードオフのまとめ。
この小節では、AIモデルを運用する際の、速度と並列コピー数のあいだの推論のトレードオフを分析する。対象は、AI 2027でAI研究の自動化に使われるかもしれないと私たちが考える、具体的なAIモデルである。推論の処理では、総メモリ帯域幅が性能を最も直接に表す指標となる。トークンを逐次デコードするには、増え続けるKVキャッシュを高速メモリに保持し、トークンを1つ生成するたびに、それをモデルの重みとともにプロセッサへ読み込まなければならないからである。そこでこの節では、H100帯域幅換算(H100-bandwidth-equivalents、H100-Be)を単位とする。これは総帯域幅3.6TB/sを1単位とするものである(H100 NVLとH100 SXMがほぼ同数生産されたと仮定し、両者の中間値を基準にした)。
既存のハードウェアのロードマップ
Nvidia GPU
| GPUの帯域幅 | H100-Be | メモリ容量 | メモリの世代 | 利用のピーク | 所有コスト | |
|---|---|---|---|---|---|---|
| NVIDIA H100 | ~3.6 TB/s | 1 | 90 GB | HBM3 | 2023-2024 | $40k |
| NVIDIA H200 | 4.8 TB/s | 1.3 | 141 GB | HBM3e | 2024-2025 | $40k |
| NVIDIA B200 | 8 TB/s | 2.2 | 192 GB | 8x8Hi HBM3e | 2025-2026 | $50k |
| NVIDIA R200 Ultra | 19.2 TB/s | 5.3 | 768 GB | 12x16Hi HBM4 | 2027 | $100k |
| NVIDIA R300 Ultra | 25.6TB/s | 7.1 | 1TB | 16x16-Hi HBM4 | 2027-2028 | $120k |
ウェハースケールの推論チップ
| GPUの帯域幅 | H100-Be | メモリ容量 | メモリの種類 | 利用のピーク | 所有コスト | |
|---|---|---|---|---|---|---|
| Cerebras WSE-3 | 21,000 TB/s | 5800 | 44 GB | SRAM | 2025-2026 | $2-3M |
| WSE-2027 | 34,000 TB/s | 9500 | 72 GB | SRAM | 2027-2028 | $3-4M |
2027年の自社製推論チップ
この表は、首位のAI企業が利用できる2027年の典型的な推論チップ(2027-IC)の予測である。ハードウェア研究開発の自動化の小節で述べたとおり、2027年にはトップクラスのAI企業が専用チップの設計を自動化し、自社でのチップ生産を増やすと予想する。そうした野心の兆しはすでに見えている。たとえばOpenAIは、実績豊富なGoogle TPUの設計者を採用し、2025年に初の自社チップを設計する計画を立てている。
| TSMCのプロセス | ダイサイズ | H100e | GPUの帯域幅 | H100-Be | メモリ容量 | メモリの世代 | 所有コスト | |
|---|---|---|---|---|---|---|---|---|
| 2027 -IC | 3nm | 60xH100 | 100 | 720 TB/s | 200 | 17.8 TB | HBM4e | $600k |
(7.2 TB/s)
(720 TB/s)
| Q1 2027 | Q2 2027 | Q3 2027 | 2027年第4四半期(競争) | ||
|---|---|---|---|---|---|
| 研究の自動化に使われる計算資源 | 研究の自動化の割合 | 6% | 6% | 6% | 6% |
| 研究の自動化のための計算予算(H100e) | 400K | 600K | 800K | 1M | |
| 研究の自動化のための帯域幅予算(2027-IC) | 4K | 6K | 8K | 10K | |
| 研究の自動化のための帯域幅予算(H100-Be) | 800K | 1.2M | 1.6M | 2M | |
| 内訳 | |||||
| 運用のトレードオフ | 運用されるコピー数(インスタンス数 × 平均バッチサイズ) | 300K | 400K | 500K | 600K |
| 平均の素の速度(毎秒のフォワードパス数) | 230 | 290 | 360 | 430 | |
| モデルの規模(パラメータ数、fp8、密モデル換算、運用中のモデルの平均) | 10T | 10T | 5T | 2T | |
| AI研究開発の進歩 | |||||
| AI研究開発の進歩への効果(期間中の平均) | 研究能力水準のマイルストーン | 超人的コーダー | 超人的コーダー | 超人的AI研究者 | 人工超知能 |
| AI研究開発の進歩倍率 | 4x | 10x | 50x | 2000x | |
最先端モデルの規模とアーキテクチャ
計算資源の用途の推計にもとづけば、2027年初めには最先端の訓練ランが約2e28 FLOP(fp8精度では4e28 FLOP)に達すると予想する。GPT-4との比(約1000倍)から素朴に考えると、そのようなAIモデルのアクティブパラメータはおおよそ10兆になると予測される。 AI 2027が予測するほどAI研究の自動化が進めば、蒸留の効果が大きく働き、同じ水準の能力を、はるかに小さく効率的なモデルで再現できるようになると予想する。AI企業は、さまざまな小型モデルと、事後学習を続けて能力を高めている最大モデルの新しいチェックポイントとを、どちらも幅広く運用するだろう。それでも、話を簡単にするため、速度とコピー数の計算は密モデル換算で10兆パラメータに固定したモデルを単位として行う。混合エキスパート(mixture of experts)などの将来のアーキテクチャは、推論の経済性にもとづいて「密モデル換算」のパラメータ数に換算できると仮定する。そのうえで、後の期間については、モデルの規模の縮小に合わせて速度とコピー数の計算を調整する。特に、最も賢いモデルの規模は、2027年末までに密モデル換算で約10兆パラメータから2兆パラメータへと縮小すると予想する。その間、モデルの質的な能力は、人間の研究者の中央値並みから、はるかに超知能的な研究者へと高まっていく。これは、アルゴリズムの効率が爆発的に向上し、知能の限界に近づくからである。
利用できる計算資源とメモリ
私たちの計算資源の配分予測によれば、2027年の首位のAI企業は世界の計算資源の15〜20%を持つ。また社内での用途の予測によれば、そのうち6%を研究の自動化のためにAIを動かすことに使う。これは帯域幅予算にして、2027年第1四半期に約4000基、2027年第4四半期までに1万基の2027年自社製推論チップ(2027-IC)にあたる。計算は2027年自社製推論チップ1000基(2027-IC 1000基)を単位として行う。これは計算能力でH100 10万台、帯域幅でH100 20万台に相当する。そのうえで、第1四半期から第4四半期までの運用のトレードオフ曲線を逆算する。
並列コピー数と速度のトレードオフ
推論を実行するときは、並列コピーを増やして速度を落とすことも、その逆もできる。このトレードオフには、メモリのボトルネック(コピーを増やす場合)とレイテンシのボトルネック(コピーを減らして速度を最大化する場合)という限界がある。言い換えれば、GPUサーバー(または密に接続されたGPUサーバー群)のHBMの総メモリに収まる以上に並列コピーを増やすと、より低速なメモリ帯域幅の接続を使わざるをえなくなり、大幅な速度低下が起きはじめる。一方、バッチサイズを減らしたり、テンソル並列・モデル並列の度合いを上げたり(モデルをより多くのGPUに分散させること)して、あまりに極端にコピーを減らすと、各リクエストがクラスター内のより多くのチップを行き来しなければならなくなり、通信のボトルネックが生じる。
並列コピーを増やす場合
推論をfp4精度で実行すると仮定すると、10兆パラメータには5TBのメモリが必要になる。2027-ICチップ1基では、これでHBMが12.8TB空く。そのうち1.8TBをその他の用途に確保し、11TBをKVキャッシュに回すと仮定できるだろう。平均シーケンス長を2万トークン、隠れ次元を5万、層の総数を250とすると、最大バッチサイズは440になりうる。したがって、インスタンスが1000個(2027-ICチップ1基に1個)なら、44万の並列コピーに相当する。1バッチあたり1トークンにつき16TBの帯域幅が必要になるので、推論速度は毎秒45トークンになる。
並列コピーを減らす場合
理論上は、1000台のサーバー全体で1つのモデルインスタンスだけを動かすまで減らすこともできるが、そうすると通信のボトルネックに大きく苦しむことになる。より現実的には、1つのモデルインスタンスを2027-ICチップ10基に分散させ、バッチサイズをわずか10にすると仮定できるだろう。この場合、並列コピーはわずか1,000になる。1バッチあたり1トークンにつき5.3TBの帯域幅が必要になるので、10基のチップ間の接続が十分で、チップ間通信のボトルネックがないと仮定すれば、推論速度は毎秒1,350トークンになる。
運用のトレードオフの予測
この「並列コピーを増やす」と「並列コピーを減らす」という両極端を組み合わせれば、その間のさまざまな運用の選択肢を計算でき、図16に示すように、各期間の平均的な運用のトレードオフ曲線が得られる。これらの曲線は、現在または将来の並列化手法やチップ間通信のボトルネックを十分に考慮して計算したものではない。ただし、それらが曲線に大きく影響する可能性は低いと、比較的強く確信している。
図19:研究の自動化への計算資源の使用の節で予測したとおり、OpenBrainがH100e計算資源の6%を使う場合に直面すると予想される、AI研究エージェントの運用のトレードオフ。
素朴な推測だが、2027年を通じて、並列コピー数の多さと速度の高さはおおよそ同程度に好まれ、運用のトレードオフは平均して約30万コピー、平均速度は人間の思考速度の約20倍に落ち着くと考える。本稿の範囲外だが、2028年には好みがやや逐次的な処理のほうへ移ると予想する。知能の限界に近づくにつれて、モデルのコピーを増やすことの収穫逓減が強まり、2027年半ば〜後半に生まれた新しいハードウェアの発明も、製造されて広く使われるだけの時間を経るからである。
| Q1 2027 | Q2 2027 | Q3 2027 | Q4 2027 | |
|---|---|---|---|---|
| 並列コピー数 | 300K | 400K | 500K | 600K |
| 速度 | 230 tok/sec | 290 tok/sec | 360 tok/sec | 430 tok/s |
| パラメータ | 10T | 10T | 5T | 2T |
第5節:業界の指標
確度:不確実だが、根拠はある。この節は公開情報にもとづく、根拠のある予測である。
この節では、2028年までの首位のAI企業の最先端の訓練ランを予測し、それにともなう費用、収益、所要電力の予測を論じる。
訓練ラン
図20:AI 2027に登場する訓練ラン。
私たちの計算資源の生産予測では、世界のAI関連計算資源は2024年から2027年にかけて年2.25倍で伸びる。首位のAI企業が世界の保有量に占めるシェアは年1.4倍で伸び、社内で訓練ランに使う割合は2027年まで40%を保ち、2027年に20%へ下がる。これらをすべて組み合わせて、次のような訓練ランを予測する。
| モデル | 訓練期間 | 訓練期間中の世界の計算資源(H100e) | 世界の計算資源に占めるシェア | 社内での用途に占める割合 | 訓練計算量 |
|---|---|---|---|---|---|
| Agent-0 | 2024年10月〜2025年5月 | 10M | 6% | 40% | 1e27 |
| Agent-1 | 2025年7月〜2026年2月 | 18M | 9% | 40% | 4e27 |
| Agent-2 | 2026年4月〜2027年3月 | 38M | 14% | 36% | 2e28 |
| Agent-3 | 2027年3月〜2027年8月 | 60M | 16% | 24% | +1e28^ |
| Agent-4 | 2027年8月〜2027年12月 | 80M | 18% | 20% | +1e28^^ |
使用されるチップ
計算資源の生産と計算資源の配分の節をもとに、2027年までに首位のAI企業が使うと予想されるチップを示す。大半はNvidiaのチップで、2027年には自社製推論チップが加わると予想する。
図21:2027年12月までに首位のAI企業が使うチップ。
財務
この小節では、2027年までの首位のAI企業の費用と収益を予測する。2025年より前の傾向を把握するためにOpenAIを基準とし、そのうえで他の予測を使って先を外挿する。
図22:首位のAI企業OpenBrainの、費用と収益のおおよその予測。
計算資源の費用の予測
New York Timesの報道によれば、OpenAIは2024年の計算コストを54億ドルと見込んでいる。また、2022年半ばに3か月かけて訓練されたGPT-4の訓練費用は約1億ドルと推計されている。GPT-4の訓練がその年の計算資源への支出の20〜40%だったと仮定すると、2022年から2024年にかけて、OpenAIの計算資源への支出はおおよそ年11〜22倍で増えたことになる。
一方、計算の価格性能比(FLOP/$)は、A100からH100にかけて16か月で倍増した。これは、最先端のAIチップにおける年約1.4倍に近い傾向からの、やや外れた値だったと考える。今後については、首位のAI企業の計算資源についての年3.4倍という予測から、FLOP/$の1.5倍の向上分を差し引くと、首位のAI企業によるAI計算資源への支出は平均で年2.4倍という予測が得られる。ただし、この伸びは最初の1〜2年はより速く、その後は自社設計チップの競争力が高まるにつれて鈍ると予想する。
収益の予測
OpenAIの2023年の収益10億ドルと2024年の収益約40億ドルをもとに、短期の傾向を組み立てる。この傾向は徐々に鈍ると予想するが、エージェント型のモデルが「すぐに業務に組み込めるリモートワーカー」のような製品で高額の契約者を引きつけるため、2027年まで持続的な指数関数的成長が続くと見込む。
| 2023 | 2024 | 2025 | 2026 | 2027 | |
|---|---|---|---|---|---|
| 年間収益 | $1B | $4B | $14B | $45B | $140B |
| 収益の前年比成長率 | - | 300% | 250% | 221% | 211% |
| 年間の計算コスト | $1.8B | $6B | $16B | $40B | $100B |
| 計算コストの前年比成長率 | - | 233% | 166% | 150% | 150% |
FutureSearchは、OpenBrainの収益がどのように伸びて2027年半ばに1000億ドルに達しうるかを予測した。FutureSearchは、10億ドルから1000億ドルへと最も速く成長した企業群の全体的なスピードを調べ、その移行にかかる期間が時代とともに短くなってきたことを見いだした。首位の企業がわずか4年でこの飛躍を遂げれば史上最速になるが、それも傾向の延長線上にある。さらにFutureSearchは、最も需要が高くなりそうなエージェントの種類(顧客サービス担当者から研究開発の研究者まで)とその価格帯を検討し、OpenBrainの収益がどこから生まれる可能性が最も高いかを詳しく描き出した。詳しくはFutureSearchの報告書の全文を参照のこと。
所要電力
最後に、2028年までに首位のAI企業が使う計算資源の所要電力をモデル化する。根拠は、使われると予想されるNvidiaの主要チップについて、報じられている電力効率と予測される電力効率である。これを使えば、首位のAI企業が必要とする総電力と、そこから導かれる世界全体のAIデータセンターの総電力使用量を逆算できる(首位のAI企業の電力使用効率は平均的だと仮定する)。
| 性能(fp16、FLOP/s) | 利用のピーク | データセンターのピーク電力使用量 | エネルギー効率 | |
|---|---|---|---|---|
| NVIDIA H100/200 GPU | 1 x 1015 | 2023-2024 | 1000W | 1.0 |
| NVIDIA B100/200 GPU | 2.5 x 1015 | 2025-2026 | 1700W | 1.47 |
| NVIDIA R100/200 GPU | 6 x 1015 | 2027-2028 | ~3300W | 1.81 |
図23:2027年12月までの所要電力の予測。
浮動小数点演算(FLOP)で測る。FLOPは計算量の単位で、特定のビット長(本文書ではfp16を想定する)の浮動小数点数の乗算または加算1回を指す。AIモデルの訓練と推論は、システムの水準で見ればほぼすべてが浮動小数点数の行列同士の乗算と加算からなるので、FLOPは計算コストの単位になる。
推論はメモリ帯域幅がボトルネックになりやすく、それが推論の処理で使える総処理性能(TPP)を目減りさせる。ただし、研究エージェントを動かすための推論計算量を扱う節では、TPPではなくメモリ帯域幅で計算する。
特に、タイムライン予測で定義・説明している自動化コーダーのマイルストーンに、2027年3月に到達すること。
浮動小数点演算(FLOP)で測る。FLOPは計算量の単位で、特定のビット長(本文書ではfp16を想定する)の浮動小数点数の乗算または加算1回を指す。AIモデルの訓練と推論は、システムの水準で見ればほぼすべてが浮動小数点数の行列同士の乗算と加算からなるので、FLOPは計算コストの単位になる。
行列の乗算では各要素を独立に計算できる(そのため、どの順序で計算してもよい)。
モデルFLOP利用率(model flop utilization、MFU)を約40%とした場合
推論はメモリ帯域幅がボトルネックになりやすく、それが推論の処理で使えるTPPを目減りさせる。
2027年は、ハードウェア研究開発の自動化により、効率が傾向をやや上回る。
チップはおおよそ4年間使えると仮定する。
すべての計算用ハードウェア(サーバー、ネットワーク機器など)を含み、データセンターと構内のインフラ(冷却、電力、相互接続など)は含まない。
すべての計算用ハードウェア(サーバー、ネットワーク機器など)とデータセンターのインフラ(冷却、エネルギーなど)を含む。
Epoch AIによる年1.26倍の電力効率の傾向を仮定する。H100からB100では、消費電力1.7倍でFLOP性能2.5倍を達成しており、電力効率は年1.2倍で向上したことになる。Rubinへの移行では、基盤となるノードがN4からN3に変わるため、比率で見た向上はさらに大きくなると予想する。
これは、Epochの過去のデータをダウンロードし、機械学習ハードウェアのFP16とFP32の性能をダイ面積で割り、その傾向をプロットすれば計算できる。当初、私(Romeo)は、ダイサイズがほぼ横ばいであるという傾向とチップの性能の傾向を目分量で見て、これも年1.35倍だと仮定し、厳密に確かめるのを忘れていた。2025年12月になって、Robi RahmanがこのXの投稿で指摘してくれたおかげでようやく厳密に確かめたところ、最も重要で長く使われてきた精度形式について、実際にもちょうど年1.35倍だった。詳しい説明とグラフはこのXでの返信にある。
その後NvidiaはGTC 2025での発表でRubin GPUシリーズについてより具体的な詳細を明らかにしたが、この予測にはまだ反映していない。
向上の大部分は、おそらくトランジスタ密度の向上によるものだろう。
1.1倍という推計は次のように得た。B200は、同じTSMC N4クラスのノードで、ダイサイズは2倍にしかなっていないのに、H100の2.5倍の性能を達成した。つまり、2.5/2 = 1.25倍の向上は他の手段によって達成されたことになる。N4からN3への移行にともない、こうしたノード内での最適化の効果はおそらく小さくなるため、その分を差し引いた。
H100からB200で2倍、さらにB200からR100で1.2倍に拡大する。
6 / 2.4 = 2.5
そのうち65万台が実際のH100で、残りは主にA100か、中国市場向けに特別に作られたA800とH800である。
この情報源からは、Nvidiaが約300万H100eを出荷したことがうかがえる(上位10社の購入者が約180万で、全体の60%を占める)。GoogleのTPU、AmazonのTrainium、AMDのチップ、MetaとMicrosoftのその他の自社製チップが、さらに推定200万H100eを加える。これは、AIインフラへの世界の支出2300億ドル(そのうち約80%、1800億ドルがおそらくチップそのものへの支出)と、Nvidiaのチップの売上1000億ドルとの比率とおおむね一致する。
2023年にTSMCが生産したN3とN5の12インチウェハーは約250万枚だった(TSMCのノード別の売上とノードごとの価格から逆算した)。ウェハー1枚からは、H100サイズの正常に動作するチップを約28個作れる。GoogleのTPUは性能が低い一方でサイズも小さいが、古いNVIDIAチップは性能に比べて大きなウェハー面積を使うので、出荷されたH100サイズのチップは合計200万個と仮定する。全体として、ウェハーの生産能力はH100サイズのチップにして250万 * 28 = 7000万個分あったので、AIアクセラレータが使ったのはTSMCのN3とN5を合わせた生産能力のわずか3%である。
どちらの分類にも「その他の国々」の区分があるので、網羅的であるのは自明である。これらの分類は、最も重要な主体だと私たちが考えるものを最もわかりやすく示すように設計した。
OpenAIやAnthropicのようなトップクラスのAI企業は、2027年までに自前の計算資源を大量に所有しはじめると予想する。この節では首位の企業1社だけをモデル化する。AI開発でのリードには複利的な効果がある(収益が計算資源へのアクセスの拡大につながるだけでなく、社内での研究の自動化も効いてくる)と予想するからである。この点の不確実性は比較的大きく、ここでの「首位のAI企業」の予測は、実のところ上位1〜3社のAI企業についての予測と見てよい。
こちらで詳述されている設備増強の計画を見ると、Microsoftの計画はGoogleより(Googleが現在優位にあるにもかかわらず)やや積極的である。
1時間あたりのレンタル費用で測る。
「減速」エンディングでは、ここが急増する。
事前学習でのモデルFLOP利用率を35%、事後学習の処理では20%と推計して調整した。
ただし、巧妙な訓練アルゴリズムを使って最大の訓練ランを分散させ、限界を押し広げていくだろうとは予想する。場合によっては2〜3か所のデータセンターにまたがる。
この時点では訓練計算量の絶対量は一定に保たれ、そのため割合は下がると予想する。事後学習の処理には手を加えず(モデルの重みをより多くの場所へ移すことへのセキュリティ上の懸念も一因である)、新しい計算資源は研究アシスタントの運用拡大と研究実験の規模拡大に優先して回されるからである。
密モデル換算でXパラメータとは、推論コストが、Xパラメータの標準的な密トランスフォーマーと同じであることを意味する。たとえば、アクティブパラメータ2兆、総パラメータ16兆の8エキスパートのMoEは、おそらく密モデル換算で約8兆パラメータになる。
訓練コストの目安「6×パラメータ数×トークン数」を使い、事後学習の処理での利用率を20%と仮定した。
外部展開の割合が下がりうる理由はほかにもある。より機微な能力(大規模に展開できるAIサイバー防御エージェントなど)に到達すると、それらは企業や機関の顧客向けに売り込まれるかもしれない。そうした顧客は、公開前の特別な期間に先行利用するために高い価格を払うことをいとわないと思われる。
1秒あたりにSRAMへ移せるデータ量(双方向)。
サーバー全体の費用(ネットワーク機器など)を含み、データセンターのインフラ(冷却やエネルギーなど)は含まない。
SXM版とNVL版の平均。
GPU1基あたり12スタックのHBM4Eというネット上の噂にもとづく。
2027年に登場し、GPU1基あたりHBM4のスタックを4つ増やすと予測する。帯域幅を増やすために、ロジックの面積をいくらか犠牲にするかもしれない。
サーバー全体の費用(ネットワーク機器など)を含み、データセンターのインフラ(冷却やエネルギーなど)は含まない。
メモリ容量はかなり小さい。そのため、帯域幅は桁外れに大きいものの、チップ1基で運用できるのは約400億パラメータまでのモデルに限られる。この問題は、チップ間の相互接続を加え、パイプライン並列でより大きなモデルを運用することで解決できる。現在の一般的なチップ間の帯域幅でも、推定10基ほどのチップでLlama 405bを効率よく推論できる。
TSMCの2NノードによるSRAM密度の60%向上という楽観的な見込みと、パッケージング技術が改善する可能性にもとづく予測。
自社製チップなので、チップ設計の利ざやがかからず、直接の製造コストに近くなる。直接の製造コストは約40万ドルで、その大部分はHBMメモリの費用だと予想する。
12-HiのHBM4eスタックを360個。各スタックの帯域幅は2TB/s、メモリは24GBで、3Dパッケージングでロジックの真上に直接積層する。
密モデル換算でXパラメータとは、推論コストが、Xパラメータの標準的な密トランスフォーマーと同じであることを意味する。たとえば、アクティブパラメータ2.5兆、総パラメータ20兆の8エキスパートのMoEは、密モデル換算で約10兆パラメータになる。
2e28 / 2e25.
GPT-4oのアクティブパラメータは2000億と推計されている。このアクティブパラメータ数にsqrt(1000)を掛け、Agent-2のアクティブパラメータを約6.3兆と見積もった。話を簡単にするため、以下の計算では10兆を使う。これが密モデルになるか、MoE(あるいはMoEに似た将来のアーキテクチャ)になるかは問わない。ルーティングの仕組みがうまくできていれば、10兆パラメータの密モデルを運用するのとおおよそ同等になると予想するからである。
アルゴリズムの効率は極端に進歩し、特に年末に急伸すると予測する(「競争」エンディングの場合)。これは知能の「限界」に近づくかもしれないと予想する。人間の脳はきわめてスパースな、fp8で100兆パラメータのニューラルネットワークと推計されているので、密モデル換算ではfp8で約1兆パラメータになると予想する(1e23〜1e25 FLOPでの最適な訓練から導かれる)。人間の脳は、知能と学習におけるアルゴリズムの効率の限界に十分収まっていると予想する。
OpenAIのAPIに見られるように、これは現在では一般的な値である。
11e12 Bytes / (20K (平均シーケンス長) * 50k (隠れ次元) * 250 (層数) * 0.1 (グループ化クエリアテンション) * 0.5 (fp4) * 2 (キー+バリュー)) = 440。
「並列コピー数」=「モデルインスタンス数」*「バッチサイズ」
720 TB/s / 16 TB/tok = 45 tok/sec。
720 TB/s * 10チップ / 5.3 TB/tok = 1,350 tok/sec。
GoogleやMetaのような大企業が首位のAI企業になった場合、この節ではそのAI部門だけの収益と費用を予測していることになる。つまり、その企業のAI事業を、OpenAI、Anthropic、xAIのようなAI専業のスタートアップと同様の、仮想的な子会社として扱う。
ほかに重要なデータ点はB200だけである。B200はH100より1.3倍高価で、計算性能は2.5倍とされる。これは約20か月でFLOP/$が差し引き1.9倍になったことを意味し、年率にすると年1.5倍である。A100からB200までの2階微分を素朴に見ると、FLOP/$の次の倍増には24か月かかると推測でき、平均すると年約1.5倍の傾向になる。AI 2027の能力予測のもとでは、2027年にAIチップの争奪が劇的に激しくなり、価格が上がるため、2027年のFLOP/$の向上は1.2倍にとどまると予想する(不確実性は大きい)。これらをすべて平均すると、今後3年間で年約1.4倍になる。
FP16 petaFLOP/s / kW
B200に対して25%の効率向上を当てはめた値にもとづく。