プランAの計算資源

Romeo Dean

本補足資料では、計算資源に関する数値の推定と予測を説明する。 大きく二部に分かれ、第一部は2029年より前、第二部はプランAを条件とする2029年以降を扱う。 2029年以前の部では、世界の計算資源総量を年ごとに予測し、AI関連と非AI関連の計算資源をはじめ、分析に有用な区分へ分解する。単体デバイスとクラスター、地域別所有、また、AI関連クラスターについてはデータセンター規模も区分する。 2029年以降の部では、AIによるハードウェア研究開発と生産の加速を受けてどれだけの計算資源を生産できるかを説明し、企業別の計算資源集中度、フロンティアAI用計算資源の用途別配分、プランAにおけるAIコピー数と速度も予測する。

図でまとめたもの

AI関連AI関連ではない
クラスターAIクラスターAIサーバーとポッド。非AIクラスターCPUサーバー。
単一デバイス専門消費者ハイエンドのワークステーションとゲームカード。消費者向け計算資源携帯電話、PC、ゲーム用GPU。

2つのカットオフが分割を定義し、チップはAI関連AI計算資源パフォーマンスの下限をクリアしている場合、およびクラスター少なくとも1つの他のチップに5 GB/s以上でリンクされている場合。

EUV増設(§1.1)+中国国内分(§1.3)
05,000万1億1.5億2億530万20241,400万20253,600万2026投影 →8,100万20271.6億2028
AI計算資源:フローとストック - ai-2040.com

追加H100eは、年間設備投資に費用効率を掛けて求める(2024/25の実績5.09M、13.6Mを基準とし、以後を予測し)、年末時点の設置済み計算資源残高も示す。黒い棒はEUV制約を反映した§1.1の増強量(~1.55億2028年に追加、約2.8億installed by end-2028); the red caps add China’s off-EUV domestic manufacturing (§1.3), for a ~2.89億世界合計。 §1.2有用性係数によって再スケールするには、「効果的」に切り替える。

AI関連非AI
01億2億3億4億1,400万20242,000万20253,500万2026投影 →7,400万20271.57億20283.14億2029
世界の全計算資源残高 - ai-2040.com

AI関連計算資源と非AI関連計算資源を含む、世界中のすべての計算資源の予測。生のH100eと、メモリとネットワーク要素を調整した実効H100eメトリクスの両方で測定し、世界にインストールされている計算資源の在庫は1月1日に測定される。

米国中国その他の地域
07,500万1.5億2.25億3億20251,700万20264,300万20271.04億1,800万20282.24億2,600万3,900万2029
AI計算資源の所有者は誰であるか - ai-2040.com

所有者=計算資源を所有またはリースしている企業の国。世界の計算資源は§1.1に基づく。中国は§1.3.1のボトムアップ予測であり、中国以外の残りは米国とその他地域に85対15で配分する。

10M+1 DC-1,000万·3.5%1M-10M74 DC-1.49億·51.4%100K-1M257 DC-7,600万·26.4%10K-100K497 DC-1,500万·5.3%1K-10K823 DC-260万·0.9%<1K1.2千 DC-39.7万·0.1%輸送中3,500万·12.0%AI消費者25.5万 単位-93.8万·0.32%米国 - 2億2,400万 - 77%中国 - 2600万 - 9%列 - 39M - 14%
データセンターのサイズごとに場所を計算する (2029年1月1日) - ai-2040.com
合意なし取引(プランA)
2029年の設備投資借金を財源とする企業が打撃を受ける$3.5T$2.4T-31%H100e追加(2029)設備投資 × 効率、EUV 追加料金控除後2.47億1.99億-19%H100e導入(2029年末)既存のベースでクッションされる5.37億4.89億-9%
プランAの反実仮想 - ai-2040.com

協定なしとプランAを、協定から1年後(2029年末まで)で比較する。プランAでは、キャッシュフローで賄う設備投資は傾向どおり維持する一方、負債調達分をゼロとし、2029年の総設備投資を~31%減らす。

プランAキャップ&トレードなし
5Q1T20292030203220342036203820401億10億100億1,000億1T10T100T1Q10Q100QH100相当を搭載、対数スケール
上限あり/なしのプランA計算資源 - ai-2040.com

プランAの計算資源について、異なる制約を解除した場合を比較する。二つの制約は、2032年に導入され生産量を制限するキャップ・アンド・トレード政策と、爆発的に増えるハードウェア研究開発労働力が計算資源費用を下げすぎ、チップ製造を容易にしすぎるのを防ぐハードウェア研究開発の展開制限である。

米国中国その他の地域濃色はフロンティア、淡色はその他
2029ハイライト = フロンティア (上位3)
AnthropicOpenAIGDMSpaceXMetaその他の米国その他の中国他の行米国中国その他の地域
企業別・計算資源の最終利用者 - ai-2040.com
プランAにおけるフロンティアAI計算資源の配分
公共展開内部推論トレーニング実験安全性オフライン/移行
0%25%50%75%100%2029年協定公共の導入実験トレーニング安全性20262028203020322034203620382040

計算資源の定義

計算資源の測定:物理H100eと実効H100e

この補足資料で用いる主要指標はH100相当(H100e)Nvidia H100 GPU 1基分を単位として測定した総処理性能(TPP)

ただし、関連するハードウェアパフォーマンスの指標は計算資源だけではない。 AIワークロードに対する計算資源の有用性は、次のような他の多くの要因にも依存する。メモリ帯域幅メモリ容量(計算資源にデータを保存し供給する)ほか、相互接続(チップ間でデータを送信するため)。計算資源 (H100e)が私たちが焦点を当てている主要な指標であるが、全体的なAIの有用性も考慮したいため、他の4つのハードウェアリソースも調べて、それらを組み合わせて全体的な指標を作成する。実効H100eメトリック:

リソース何をするのかH100 (per H100e)
計算性能(TPP)演算スループット自体 (単位を定義)15,800TPP
メモリ帯域幅データを計算資源 (HBM)にフィードする。3,350GB/秒
メモリ容量データを計算資源 (HBM)の近くに保存する80 GB
スケールアップサーバー内のチップをリンクする (NVLink)900GB/秒
スケールアウトクラスタ全体でサーバーをリンクする (イーサネット)50GB/秒

実効H100e生のH100e (計算資源のみをカウント)を単一の有用性係数で調整する。UU

実効H100e  =  生のH100e×U\text{effective H100e} \;=\; \text{raw H100e} \times U

UU は、上の表にある他の4つのリソースから構築される。すべて2024年の100Kを基準として、その時代の代表的なAIワークロードに合わせて、実際にメモリを提供し、他のチップと通信するチップの能力を調整する。H100 SXM正確にスコアを付けるクラスターU=1U=1

メモリが豊富で、FLOP/sが適切にネットワーク化されているハードウェアのスコアは1を超える可能性がある (大量のメモリを搭載し、比較的少ない計算資源でネットワーキングを行う非AI CPUサーバーのスコアは~1.4)、たとえば、ネットワーク能力が低い計算資源 (ゲーム用GPUや携帯電話など)のスコアは1未満である。

有用性の要素については、次のセクションで詳しく説明されている。付録

計算資源の4つのカテゴリ

補足資料はモデル化を試みる世界中のすべての計算資源次に、それを2つの独立した方法で分割して、4つのカテゴリー

パーティション1: AI関連と非AI関連。チップを考慮AI関連それが私たちの4つのフロアすべてをクリアした場合AI関連のカットオフ閾値A100 GPUのすぐ下に設定する。

メートル法カットオフA100H100RTX4090
計算資源4,000TPP4,99215,8005,285
メモリ帯域幅1.0TB/秒2.03.351.01
メモリ容量32GB808024
ネットワーク (NIC)100Gb/秒20040064

パーティション2: クラスターと単一デバイス。

クラスター = 少なくとも2台のデバイスが少なくとも5 GB/秒の双方向速度で接続されているマルチデバイス設定で積極的に使用される。

単一デバイス= 単一のデバイス (電話、PC、ゲームカードなど)としてアクティブに使用されているか、クラスター定義を満たしていない。

これらの定義により、計算資源の4つのカテゴリが得られる。

AI関連AI関連ではない
クラスターAIクラスターAIサーバーとポッド。非AIクラスターCPUサーバー。
単一デバイス専門消費者ハイエンドのワークステーションとゲームカード。消費者向け計算資源携帯電話、PC、ゲーム用GPU。

2つのカットオフが分割を定義し、チップはAI関連AI計算資源パフォーマンスの下限をクリアしている場合、およびクラスター少なくとも1つの他のチップに5 GB/s以上でリンクされている場合。

パート1。協定前の計算 (2029年以前)

1.1 AI関連の計算資源

このセクションでは、デマンドサイドの方法を使用してAI関連の計算資源生産を予測する。

支出された設備投資 ($)×\timesコスト効率 (H100e / $) = 追加された計算資源 (H100e)

AIの設備投資の傾向2023年第3四半期から2025年第4四半期まで、年間約1.72xだった。一方、費用対効果(1ドル当たりのH100e)は年約1.4倍のペースで改善している。

AI設備投資 (~1.72×/年)

出典: Epoch AI — ハイパースケーラーの設備投資

これらの傾向を素朴に推定すると、次のような計算資源予測が得られる。

05,000万1億1.5億2億510万20241,400万×2.720253,300万×2.42026投影 →7,900万×2.420271.9億×2.42028
単純なベースライン予測 - ai-2040.com

この方法は、追加された H100e = 設備投資 × 費用効率であり、どちらも上記の傾向から単純に外挿される (設備投資 ~1.72×/年、$ 当たりの H100e ~1.4×/年)。 2024/25 は実際のEpoch データ (AIチップの販売: 2024年の2,600億ドルの支出に509万H100eが追加、2025年の4,480億ドルから1,360万)。

このセクションの残りの部分では、この単純なベースラインから予測を改善することを試みる。

設備投資予測の改善

2025年までの増強費用は、ほぼ全額が大手ハイテク企業の営業キャッシュフローから支払われた。しかし、この傾向が続けば、設備投資は2026年第3四半期頃にはハイパースケーラーの営業キャッシュフローを追い越す勢いである。

これを考慮した予測を行うために、設備投資の予測を3つのソースに分割した。既存のトレンドのハイパースケーラーのキャッシュフローAIキャッシュフロー (AI企業の収益による追加の計算資源支出、フロンティアAI企業の収益予測の80%と概算)、そして負債・株式による資金調達(すでに2025/2026年に成長が見られ始めている)。

私たちの予測は次のとおりである。

  • 既存のトレンドのハイパースケーラーのキャッシュフロー年間約20%の成長を続け (Epoch社の約4,780億ドル → 6,030億ドル、フロンティアAI企業の収益を除く)、シェアの上昇それをビルドアウトに入れて、投資割合が~75 → 85%に上昇設備投資によりキャッシュフローがより多く消費されるためである。

  • AIキャッシュフロー(フロンティアAI企業全体の)合計ARRを追跡するには300億ドル (2026年開始) → 1,800億ドル → 5,000億ドル → 1兆ドル (2029年開始)、と認識された収益の80%追加の計算資源支出としてカウントされる。

  • 負債と株式の調達手動で (労力が少なく)予測される。係数の低下AI収益の割合:係数3x (2025)、2.8x (2026)、1.8x (2027)、1.6x (2028)これは非常に不確実であり、一方ではAI収益の増加がレバレッジを促すものの、調達する債務総額が増えれば金利も上昇しやすい。また、この水準のレバレッジは、シナリオどおりAIの急速な進歩が続き、貸し手が収益成長を信じ続けることを暗黙の前提とする点にも留意が必要であり、収益経路そのものと同様、無条件の予測ではなく、このシナリオと整合する入力である。

2024-25まではEpoch社の広範な設備投資 (2,600億ドル / 4,480億ドル)に固定されており、これによりAI設備投資総額は2028年に~2.4兆ドル、借金が到達して~9000億ドル(2028年の増強の38%)。 (AI設備投資総額の代理としてハイパースケーラーBroad CapExを使用する。ハイパースケーラーは世界のAI支出の約60%-90%、その設備投資の~60-90%がAI向けであるため、二つの差はおおむね相殺すると仮定するため、これは、~1.72x/yrの傾向を外挿した単純な基準値である2028年の設備投資$2.28Tより7%高い。強気のAI収益予測と、その急成長が促すと考える負債調達が、傾向をむしろわずかに押し上げるためである。

0$1T$2T$2,600億2024$4,480億2025$7,970億2026投影 →$1.4T2027$2.4T2028
AI構築への資金提供 - ai-2040.com
ハイパースケーラーのキャッシュフロー (既存の傾向)AIキャッシュフロー負債と株式の調達

AI設備投資総額 = Epoch社 ハイパースケーラーの広範な設備投資 直接(2024/25年は2,600億ドル/4,480億ドル)。私たちはハイパースケーラーは次のようなものであると考えている。 世界支出の約60%〜90% 設備投資の約60%〜90%がAIであるため、単純化するための仮定として、この2つはほぼ相殺されると想定する。 ハイパースケーラーのキャッシュフロー (既存の傾向) double-counting(二重計上)を避けるためフロンティアAIの収益は除外し、投資比率が約75→85%へ上がるのに伴い、年間約20%で成長すると予測する。AIキャッシュフロー AI企業の収益による追加の計算資源支出であり、フロンティアAI企業の収益予測の80%と概算される。 負債と株式の調達私たちは次のように厳選する係数の低下AIの収益は3× / 2.8× / 1.8× / 1.6×(2025 ~ 28年)、2028年までに~9,230億ドルに達する。これにより、2028年に~2.4兆ドルの設備投資

AIの収益と負債の予測

私たちのAI収益予測は、フロンティアAI企業全体のARR(年換算収益)の経路に従う。その経路は300億ドル → 1800億ドル → 5000億ドル → 1兆ドル(年の境界2026.0から2029.0)。AI収益は年間で認識されたフローであり、ARRランレートではないことに注意が必要であり、これは、2025年: 150億ドル / 2026年: 840億ドル / 2027年: 3,130億ドル / 2028年: 7,210億ドルの年間認識収益に換算される。このうち80%を追加の計算資源支出(上記の「AIキャッシュフロー」)として数えると、120億ドル/670億ドル/2,510億ドル/5,770億ドルとなる。フロンティアAI企業全体のARR予測は手作業で作成しており、不確実性が非常に大きい。大まかには、Anthropicが売上高で首位のAI企業になるにつれて同社の直近の年約10倍というARR成長率は鈍化し、AI企業全体の売上成長率は年約3倍へ戻り、その後は、推論用計算資源が年約2倍で増える一方で、売上高/推論用計算資源(ドル/FLOP)をおおむね横ばいに維持するため、やや低下すると見込んでいる。これは計算資源の数値といくらか循環しているが、現時点での(不確実性の非常に大きい)予測である。

この収益傾向を考慮すると、妥当な負債調達率はどれくらいだろうか?まず、ハイパースケーラー5社が発行したのは、2025年に約1,210億ドルの債券発行(2020-24年の平年値は年間約$28B)、BofA/JPMorganは2026年を約$175-300Bと予測し、債務で資金調達するCoreWeaveなどのネオクラウドは収益が約4x約50億ドルの収益に対して210億ドルの債務を抱え、これはモルガン・スタンレーのポッドキャスト2025-28の2.9兆ドルの増強のうち、約1.15兆ドルは借金で賄われると見ている。米国の投資適格発行総額は~1.5兆ドル/年。 SpaceXのIPOはまた、OpenAIとAnthropicによる同様の/より大規模な増資が続く可能性のある大規模な株式調達の可能性を示している。これらのアンカーを使用して、負債をアドホックに手動で設定する。AI総収益の係数, 3x (2025年) → 2.8x (2026年) → 1.8x (2027年) → 1.6x (2028年)となり、2025年から2028年にかけて負債で調達されたAIの設備投資は~360億ドル / 1,880億ドル / 4,520億ドル / 9,230億ドルとなる。つまり、約5.1兆ドルの総増強のうち、約1.6兆ドルが借金で賄われている(2025年から2028年、約31%が借金で賄われている)、おおよそモルガン・スタンレーの負債総額約1.15兆ドルを39%上回っており、総額約2.9兆ドルを約75%上回っている。ただし、注目すべきことにモルガン・スタンレーの数字は株式調達を無視している。

コスト効率予測の改善(供給側)

設備投資の予測は需要側の予測であるが、コスト効率を考えると供給側に注目するのが理にかなっている。特に、このセクションでは、H100eをどれだけ生産できるかに関して予想される主なボトルネックとして、リソグラフィー (主にEUV)のキャパシティに焦点を当てる。

EUVは最先端ロジックに必要で、現在は主要なHBM DRAMノードでも使われる(DRAMは最近までEUVなしで製造され、Micronが導入したのも2025年であるため、厳密な要件というより費用最適化上の選択であり、EUVを避けても同じ需要が共有DUV装置群へ移るだけである)。EUV装置は複雑でサプライチェーンへの依存も広いため、短期間での増設が極めて難しく、最も重要で情報量の多いボトルネックになると予想する。価格シグナルを受けても生産をすぐ増やしにくいという時間的な非弾力性があるため、EUV装置群の将来量も比較的予測しやすい。

EUVフリート(年初)EUV追加数/年フリートパス/年AIロジックウェーハ / 年AI向けHBMウェハ/年AI EUVパス/年フリートのAIシェア
2024220+448,700万20万110万700万7%
2025264+481.04億40万250万1,500万15%
2026312+651.24億70万460万3,400万27%
2027377+801.5億100万800万6,800万45%
2028457+1001億8300万160万1,300万1.18億65%
2029年(プランAなし)557+1252.23億210万1,700万1.72億77%

EUVフリートの長期推移とAIの使用シェア。フリートは、2024年に220の運用ツールで開始される (ASMLでは、2021年末時点で~127のEUVツールが使用され、その後2022/23年に54/42が出荷されたと推定している)。ASMLの年次報告書。出典を含む設備数の積上げは下の詳細欄に示し)、設備数は出荷の加速に伴って増える。EUV added列はASMLの年間出荷台数であり、ASMLの見通しは2026年に「60+」、2027年に~80である。Fleet passes/yrは年中平均の装置台数 x 装置1台当たり~360k passesで求める。AIが使用する露光回数は、ロジックウェハー(1枚当たり~12-24のEUV層、N4→N2)とHBM-DRAMウェハー(積層・パッケージ歩留まりを考慮し、1枚当たり~4-7のEUV層)の合計である。AIの比率は~15%(2025)から~77%(2029、プランAなし)へ上昇する。

EUVスキャナーによるH100eの製造方法

フリートに対するAIの主張は両方から来ているロジックとメモリしたがって、この2つを1つのユニットに追加する。EUVパス= 1枚のウェーハに対する1回のEUV露光 (印刷内容に関係なく、ツールは年間約360kの画像を作成する)。これが2025年のビルドアップである。

1. フリート → パス数。各スキャナーは、実際には約40 ~ 50 wph相当の速度でしか稼働せず、これに対し、ネームプレートは1時間あたり約160枚のウェーハに相当するが、実際のパターンは、仕様で想定されているよりも長い露光時間が必要であり (線量が高く、光源の出力によって制限される)、ツールは時間の約75%-82%しか稼動せず、露光フィールド間を移動する時間の損失 (レチクルのオーバーヘッド)が発生する。これらを差し引くと~360,000有効パス/ツール/年(単純な160 wph x 8,760 h ≈ 1.1 ~ 1.4Mは3 ~ 4x高すぎる)。 2つの逆算が一致する。フレデリック・チェン(実効速度は毎時50語未満)かつSemiAnalysis (約1,500枚のウェーハ/月x約20回の露光)。 Starting from ~2024年の初めには220の運用ツール(ASMLは 2021年末に ~127 EUVを稼働していたが、2022-23にかけて ~54 EUVと ~42 EUVを出荷した。TSMCだけで容量の約56%を実行)フリートは~100M passes/yr 2025年時点から約〜まで増加2029年までに2億2,000万ASMLのEUV出荷が加速するにつれて (2025年に年間約48個、2029年までに年間約120個に)。

2. AIのロジック描画。AIアクセラレータが必要とするのは~0.4Mの最先端ウェーハ2025年には、おおよそTSMCの~3M ≤5nmウェハの~12% (Epoch社の直接見積もり; Blackwell は N4、Nvidia は現在 N3に参入している)。 N4の ~14 EUV レイヤーでは、~500万パス。 (約800mm² のダイでは、ウェーハあたり約42個の良好なダイが約70%の歩留まりで生産される。大脳現在はウェーハ当たり約28-36 H100eだが、FP4、N4→N3→N2への微細化、Rubinの高いH100e/チップが重なり、2029年には約120へ増えるため、ロジックだけの上限は約200Mから年間約1.2B H100eとなる。微細化にはEUV上の代償があり、EUVへ移る層が増えるにつれ、モデルではロジックウェーハ当たりのパス数を2024年の約12から2029年の約24へ増やす。)

3. AIのメモリ使用量 (大きい方の半分)。基本的にすべてのHBMはAIに移行し、HBMはGBあたり多くのウェーハを使用する。 2025年のHBMを報告TSV/バックエンド容量ウェーハ数は月あたり約400,000枚 (SK Hynix 〜 170,000 + Samsung 〜 165,000 + Micron 〜 60,000、TrendForce)、しかしそれは容量の上限であり、利用されていない状態が始まる。ネッティング利回り、AIの実際のドローは~250万のHBMコアウェーハ/年:24Gb DRAMダイのウェハーは総容量が約1,400 GBで、コア製造・積層(KGSD/TSV)の歩留まり約57%とCoWoS組立の歩留まり約88%を加味すると、実効容量は約開始ウェーハあたり700正味GB出荷一方、2025年のフリートには~18億GBのHBMである(ボトムアップでは約11.7M基のアクセラレータ×約150 GBで、業界全体の約$35B/約2B-GBとも整合する)。先端HBMノードでは実際にEUVを使用する(SK Hynix 1bは約4層、1c ~6)、それでは~で4層つまり〜 1,000万パス、AIのEUV描画の約3分の2。 (GBあたり、HBM書き込みDDR5ウェーハの約3x.)

4. AIのフリートシェア。ロジック (~5M) + HBM (~10M) = ~15Mパス / ~104Mフリート ≈ 15% 2025年に。HBMボリュームとEUV層数の増加に加え、EUVを多用するN3/N2ロジックへのAIの移行により、2028年までに~64%、2029年までに~77%、AI需要は2029-30年ごろにEUV装置群の飽和へ近づく。この需要は費用上乗せへフィードバックされ、EUV使用量が増えるほど上乗せ額が高まり、1ドル当たりのH100eが減るため、モデル内で自己整合的に解かれ、これにより後期の増設量は抑えられ、2028年の追加分は単純推計の約190Mに対して約155Mとなる。

5. なぜウェハ枚数ではなくパス数なのか。AIのウェーハは混在しており、HBMウェーハにはEUV露光は約4回しか必要ないが、最先端のロジックウェーハには約14~22回の露光が必要となる。ウエハースは、チップ群に対する性質のまったく異なる取り分を同等に扱ってしまう。AI向けのウェーハ構成はHBMの比重が大きいため、ウェーハ枚数で数えると初期のシェアを過大に見せる(2025年は、露光パス数で数えた約15%をはるかに上回ってしまう)。二つの指標が2029年までに収束する理由は単純で、その頃にはAIがロジックとHBMの双方のウェーハ供給の大半を使う立場になり、構成の違いが効かなくなって、どちらの数え方でも約80%に落ち着くからである。

EUV装置群に占めるAI向けの比率は、2024年の約7%から上昇し、2028年までに~64% (そして2029年までに約77%となり、飽和に近づく)。フリートの他の用途 (電話、PCなど)を上回る入札が必要となるため、これにより価格が高くなることが予想される。これをモデル化するために、手動で選択した追加料金フリートの使用状況に依存する曲線 (不確実性の高いアドホックな選択)。

0%25%50%75%100%飽和7%202415%202527%2026投影 →45%202765%2028
EUVの容量と追加料金 - ai-2040.com

ロジックとメモリの両ウェハーを含み、歩留まりも考慮した、AIが使用する世界のEUV稼働時間(露光回数)の比率予測。値は~7%は2024年に~ に向けて652028年までに % (2029年までに約77%)となるため、AIは2029 ~ 30年頃にEUVの壁にぶつかりる。コスト追加料金 (曲線タブ)、追加料金 = A-u^K (デフォルトA = 100%、K = 2.5)、この導出されたパスにキー設定され、計算予測にフィードバックされる(描画が増加→追加料金が増加→H100eが減少)し、固定点まで解決されるため、次のように上昇する。 ~33%を2028年までに達成し、後期の増強を抑制する。 KおよびAスライダーは、ユーザーがプレイする際にどのくらいの強さで噛むかを調整する。パラメータは手作業で選択されており、非常に不確実である。

この追加料金を単純な価格パフォーマンスの傾向に適用すると、平均して最新の計算資源費用効率の傾向が得られる。~1.25x/年2025年から2028年までは、これまでの年間約1.4xではなく、2028年には追加料金が重なり、年間わずか約1.1xに減速する。

0$2万$4万$6万$5.1万2024$3.3万2025$2.3万2026投影 →$1.8万2027$1.6万2028
計算資源コストの分解 - ai-2040.com

H100eあたりのコストは次のように分解される。ウェーハあたりのドル ÷ ウェーハあたりのH100e

ウェーハ番号の由来

コストの数字がアイデンティティであり、$/H100e = (ウェーハあたりの合計金額) / (ウェーハあたりのH100e)、そして3つの量のうち2つの適切な推定値があるので、バックアウトする。Bドル当たりのウェーハ数(オールイン$/ウェーハの逆数)残留物そして、それが示唆するウェーハコストが妥当であるかどうかを確認する。

$/H100e (既知)。2024/25年が観察される (年間設備投資 / H100e追加: ~51,000ドル、~33,000ドル)。 2026-28については、年間約1.4xの価格パフォーマンスの傾向を考慮し、EUV追加料金によってペナルティを課し、約23,000ドル / ~ 18,000ドル / ~ 16,000ドルとする。

ウェーハあたりのH100e (既知、~28 → ~98)。~800mm²のレチクル制限ダイでは、300mmウェハ当たり~64~72個の総ダイが生産され、~70%の歩留まりで~42個の良品が得られ、下流工程の損失(パッケージング歩留まり)を差し引くと、2024年にはウェーハあたり約28個のH100eが販売可能。これは年間約1.4xに上昇し、2028年までに~98 (2029年までに~120) FP4/精度(EUVフリー)、N4→N3→N2シュリンク(追加のEUVレイヤで支払われる)、およびRubinの高いH100e/チップはすべて、ダイサイズ、ノード、および精度の推定に合理的に根拠がある。 (2025年のチェック: ~0.38M AI最先端ウェーハで~1360万H100e ≈ ~36 H100e/ウェーハ。)

Bドルあたりのウェーハ (残差)。両者を掛け合わせると、次の推計値が得られるウェーハあたりのオールインドルウェーハ当たり設備投資は、約$1.43M(2024)→約$1.18M(2025)→約$1.20M→約$1.36M→約$1.56M(2028)であり、$B当たりのウェーハ数は約700→845→640となる。2025年の低下は観測値を直接反映しており、2024年は立ち上がり期で供給制約が強かった一方、2025年にはBlackwellが量産に入ったため、先端ウェーハ当たりの総費用が下がった。2026年以降に$/waferが上がるのは想定どおりで、TSMC ASPが年+5-10%(N2は約$30KでN3比+10-20%)、CoWoSが年+15-20%、データセンターの$/MWが上昇し、EUV上乗せも加わるためである。この水準は、ボトムアップのウェーハ当たり積み上げとも整合する。ファウンドリが約$25-30K、ウェーハ当たり約28ダイ分のHBMが約$50-70K、CoWoSが約$10-15Kで、チップ設計企業の約4-5倍の上乗せを加えると、ウェーハ当たり約$400-500Kのアクセラレータ価値(アクセラレータ1個当たり約$15K)になる。残るウェーハ当たり約$0.7-1.1M(アクセラレータ1個当たり約$25-40K)は、データセンター、電力、土地、ネットワークからなるチップ以外の構築費である。したがって残差は妥当であり、2025年以降のウェーハ費用は軽い逆風にすぎず、$/H100eが約$51Kから約$16Kへ下がる分はすべて計算密度の向上から生じる。

希少性上乗せを含む。 この費用効率の基準値に設備投資総額を掛けると、年間追加量が得られる。追加H100e (~1.55億2028年)、そして設置済み計算資源残高~の2.8億2028年末までに。また、チップ生存率もわずかに下方修正する。中国国内で製造された計算資源 (§1.3)はこのEUVサプライチェーンを活用していないため、これを個別に予測してこの合計に追加し、世界のAIストックは~ になる。2.87億

EUV増設(§1.1)+中国国内分(§1.3)
05,000万1億1.5億2億530万20241,400万20253,600万2026投影 →8,100万20271.6億2028
AI計算資源:フローとストック - ai-2040.com

追加H100eは、年間設備投資に費用効率を掛けて求める(2024/25の実績5.09M、13.6Mを基準とし、以後を予測し)、年末時点の設置済み計算資源残高も示す。黒い棒はEUV制約を反映した§1.1の増強量(~1.55億2028年に追加、約2.8億installed by end-2028); the red caps add China’s off-EUV domestic manufacturing (§1.3), for a ~2.89億世界合計。 §1.2有用性係数によって再スケールするには、「効果的」に切り替える。

リソース集約度: 未加工のH100eから効率的な計算資源まで

AIフリートであっても、効果的なH100eと生のH100eは乖離する。の記憶の壁実効性を1未満に押し下げる(FP4で増強されたTPPの伸びがHBMの帯域幅と容量を上回る)一方、拡大するコヒーレントNVLink環境(HGX-8 → NVL72 → NVL144 → NVL576)と押し上げられる。この2つはほぼ相殺され、2024年には緩やかなプレミアム (フリートのメモリが豊富な場合は約1.16)があるが、メモリの壁と大規模な学習実行がより重要になり始めるため、2029年までには約1に向かって薄れる。これは、§1.2.3と同じ有用性モデルである (完全な派生は付録);それを推進する展開重視のフリート入力 (H100eでのスケールアップの世界 = コヒーレント チップ x H100e/チップ):

AIフリート(展開量加重)202420262028
H100e当たりHBM帯域幅(GB/s)4,0803,3303,610
H100e当たりHBM容量(GB)1109185
スケールアップワールド(H100e)184436929
チップあたりH100e1.152.585.34
生あたりの有効H100e1.161.061.04

1.2すべての計算資源

§1.1 AI関連の計算資源を予測する。現在、世界中のすべての計算資源に拡張している。すべての計算資源を6つのデバイスカテゴリに分割する。

カテゴリAI関連
AIデータセンターAIアクセラレータ (H100、B200、MI300)はい
非AIサーバーデータセンターのCPUと非AIアクセラレータいいえ
パソコンラップトップとデスクトップいいえ
電話スマートフォンいいえ
ゲームゲーム用GPUいいえ
その他マイクロコントローラー、自動車、エッジいいえ

私たちの方法は2つの量を調べることによって機能する。のデバイス側は、出荷されたユニット数と各デバイスで実行される平均計算資源を数えることから得られる計算資源である。のリソグラフィー面は、ファブが生産できるウェハー数と、各ウェハーから得られる計算資源量を基に算出した、世界で生産可能な計算資源量である。

デバイス側\toH100e = 単位×\timesH100e/ユニット

リソグラフィー面\toH100e = ウェーハ×\timesウェーハあたりH100e

ウェーハあたりの計算量は、最も確実ではない量であるため、これを履歴から突き止めようとする (他のすべての値について適切な推定値を得ることができる)。

1.2.1校正 (2015年から2024年)

2015年から2024年にかけて、デバイス需要(出荷されたユニットとユニットごとに計算)およびリソグラフィー供給(出荷されたウェーハ)、これを使用してウェーハあたりの計算資源の推定値を逆算し、ウェーハの割り当てとウェーハの供給予測に基づいてカテゴリごとに将来の計算資源を予測することができる (供給側は比較的予測可能なリソグラフィの上限で予測できるため、デバイスの需要予測よりも容易である)。

デバイス側

出荷数 (百万個/年)20152018202020222024
電話1千1千1千1千1千
276259304292263
ゲーム4450403836
あい0.10.30.62.07.5
非AIサーバー8.011131413
別の1.2万2万2.4万2.8万3万
出荷元
  • 携帯電話は1.43B(2015)から1.24B(2024)へ減少した。ピークは1.47B(2016)、パンデミック期の底は1.21B(2022)である。出典: IDC Worldwide四半期携帯電話トラッカー /オムディア/カウンターポイント。
  • 個数: 276M (2015) → 263M (2024)。新型コロナウイルスのピークは〜3億4,900万(2021年)、谷は〜2億6,000万(2023年)。IDCは Chromebook をカウントしているため、2020年から 2021年にかけて Gartnerを約3,000万上回っており、IDCベースを使用する。出典: ガートナー / IDC PCDトラッカー.
  • ゲーム: ディスクリートデスクトップアドインボードGPUのみ (iGPUやデータセンターは除く)。 4,400万 (2015年) → ~3,500万 (2024年)。出典: ジョン・ペディ調査AIBレポート.
  • AIはAIデータセンター全体を指し、単位数はアクセラレータ数で測る。TechInsightsによると、2023年のNVIDIAデータセンターGPUは3.76M基(シェア98%)で、2024年は全ベンダー合計で約7.5M基(NVIDIA約4M、Google TPU約2.5M、AWS Trainium約1.2M、AMD MI300約0.4M)である。出典: DCD経由のTechInsights; EpochAI;オムディア/モルガン・スタンレー。
  • その他: 高度なノードのデジタルチップ (ネットワークASIC、ベースバンド、自動/IoTロジック)のみ。完全なMCUとアナログの世界ははるかに広大である (MCUだけで年間約25〜35B基)、ただし、ほとんどは、このモデルが追跡する300 mmリソグラフィプールの外側のトレーリングノード/200 mm容量である。
1基当たりTPP20152018202020222024
電話0.55.02560100
8.0203862100
ゲーム152505501千2千
あい3501千2千5千1万
非AIサーバー3075150320500
別の0.10.30.50.70.9
TPP単位当たりのソース

TPPは各精度のピーク高密度TOPSにビット長を掛け、精度間で最大化した値で、米国 BISの輸出管理指標(ECCN 3A090)である。尺度を固定する基準値は、V100 ≈ 2,000、A100 = 4,992、H100 ≈ 15,800、RTX 4090 = 5,285(4,800の規制線をわずかに上回る)、B200 ≈ 36,000である。最上位製品は販売台数のごく一部なので、すべて販売加重平均で示す。出典: Federal Register 88 FR 73458 CSETの説明者 プリンストンISCA 2025

  • 電話機: NPU INT8 TOPS × 8。Apple A11 = 0.6 TOPS (2017) → A17 Pro = 35 TOPS (2023); Snapdragon 8 Gen 3 = 45 TOPS (2024)。2017年以前はほぼゼロだった。2024年に売上加重で ≈ 100 TPPとなる。出典: Apple Neural Engine TOPSテーブル.
  • PC:大半のPCはNPUを搭載していない(2024年の出荷台数に占める「AI PC」は約17%にすぎない)。2024年の販売台数加重平均は約100 TPPである。出典: Canalys AI-PCシェア.
  • ゲーミングは高密度INT8 TOPS×8で、RTX 3060=815、RTX 4060=968(4060 Tiは1,412)、RTX 4090=5,285である。販売構成の大半はxx60クラス(Steam調査)なので、2024年の販売加重平均は、RTX 4090の5,285ではなく約1,500 TPPとなる。出典: Steamハードウェア調査.
  • AI向けは全ベンダーの販売台数で加重平均した性能であり、H100/H200 = 15,800、A100 ≈ 5,000、TPU/Trainium はそれより低いため、2024年は ≈ 9,500 TPPと NVIDIAの最上位製品を下回る。約 7.5M 台を掛けると、2024年は約 4.5M H100eとなり、2025年の接続点で プランAの予測と一致するボトムアップ推計値となる。 Source: NVIDIA/Google/AWS datasheets; TrendForce構成比.
  • その他: ~30B チップ/年、ほとんどが MCU/アナログで AIスループットは~0であり、わずかな自動車・ADASとエッジNPUだけが何らかの影響を与えるため、ユニット加重平均は 2024年までにわずか約 1.5 TPPになる。

露光工程側

ウェハ(百万枚/年)20152018202020222024
電話1.81.91.91.92.1
0.70.70.90.90.9
ゲーム0.20.30.20.30.3
あい0.00.00.00.00.3
非AIサーバー0.10.20.30.30.3
別の5.59.7121517
デバイス需要(合計)8.313151820
ウェハ出荷量の出典
  • 各カテゴリーのウエハース=その ロジックウェハ (ユニット × デバイスあたりのダイ数 ÷ ウェハあたりの良好なダイ数)に加えて、 メモリウェーハ (HBM、DRAM、NAND)が同梱される。単位は上記出荷表となる。メモリウェーハは、各デバイスのメモリ内容と、DRAM/NAND/HBMノード上の現在のウェーハあたりのGBから決定される。
  • 300mmウェーハ当たりの良好なダイ数 (歩留まり): 電話機~600 (~100 ~ 120 mm²)、PC ~300 (~200 mm²)、ゲーム~130 (~400 mm²)、AI ~42 (~70%歩留まりでレチクル制限ダイの~800 mm²)、「その他」~1,800 (~30 mm²)。出典: AnySilicon;レチクル/ダイサイズの開示 (TSMC、NVIDIA、WikiChip)。
  • 完成したデバイスごとのダイ数: 非 AI ≈ 1 (デバイスごとに 1 つの SoC/CPU/GPU)。 AIは 1 (H100) → ~1.5 (2024、デュアルダイ B200) → 2030年までに ~8 ~ 11 (Rubin クラスのチップレット) に増加する。 Sources: NVIDIA roadmap; SemiAnalysis.
  • ダイ面積はすでに歩留まり調整済みであるため、別個の歩留まり係数は適用しない。

カテゴリー別のリソグラフィー利用状況を以下に示す。私たちでは、すべてのカテゴリを、そのロジックと関連メモリ (HBM、DRAM、NAND)を備えたパッケージとして扱う。

リソグラフィーの割り当て、2015 ~ 2024年

年間EUV露光回数(構成比では見えない絶対量を示す)。EUVの量産利用は2019年ごろに始まり、当初はほぼすべてがスマートフォンとPC向けで、AI向けは2022年ごろまで表面化しない。

0万1,200万2,300万3,500万4,600万'15'16'17'18'19'20'21'22'23'24
あい非AIサーバー電話ゲーム別の
ウェーハごとの独立した計算資源推定による健全性チェック

ウェーハあたりの計算量は、(ウェーハあたりの良好なダイ) x (ダイあたりのTPP) / 15,800であり、どちらも、ファブの稼働率とは無関係にデバイスの仕様から推定される。

  • 300mmウェーハあたりの良好なダイ数(歩留まり、ダイ領域から、上記のウェーハボックス内のソース): AI ~42 (~70%の歩留まりで ~800 mm² レチクル制限ダイ)、ゲーム ~130 (~400 mm²)、PC ~300 (~200 mm²)、電話 ~600 (~100 ~ 120 mm²)、「その他」の商品 ~1,800 (~30 mm²)。

  • ダイ当たりTPP = ユニットあたりの各カテゴリのTPP (上記のデバイス側) / デバイスあたりのダイ。 2024年には、AIは~9,500 / ~1.5 ≈ 6,300 TPP/ダイ、ゲームは~1,500、電話とPCは~100、「その他」は~1.5になる。

したがって、AIの大型でTPPの高いダイは、ウェーハあたりの密度が最も高く、「その他」の商品 (TPPがほぼゼロの小さなダイ)が最も低くなり、これは、各カテゴリの計算資源をウェーハで割ると次のようになる。

暗黙のH100e / ウェハ20152018202020222024
電話0.030.231.12.43.8
0.200.460.831.31.9
ゲーム0.192.85.69.212.3
あい1.45.07.214.216.8
非AIサーバー0.110.250.460.901.3
別の0.010.040.060.090.10

さらなるチェックとして、これらのレートが示すウェーハ需要を、私たちの推定値と照らし合わせて確認すること。リソグラフィプール(広範な世界的なロジックウェーハ生産量、2024年には約3,000万ウェーハ、SEMIの300mm生産能力と一致する規模)は、10年間を通じてプールの約62%から約69%であり、プールを超えることは決してない、もっともらしい安定したシェアである。プールレベル自体はその範囲内に収まるように調整されているため、ダイサイズ、計算資源、および容量の推定値は、いずれか1つを個別に検証するのではなく、相互に一貫していることが分かる。

カテゴリごとに毎年追加される結果のH100eを、生のH100eと有効なH100eの両方で以下に示す。

カテゴリ別世界H100e、2015 ~ 2024年

Raw H100eはカテゴリごとに毎年追加される。

0500万1,000万1,500万2,000万'15'16'17'18'19'20'21'22'23'24
あい非AIサーバー電話ゲーム別の

1.2.2予測(2025年から2028年)

§1.1からAIの計算資源予測を取得し、残りのリソグラフィー容量を他の計算資源カテゴリに割り当てる。まずAIがリソグラフィーの使用を主張し、次にAI以外の各カテゴリーが、残っているウェーハのうち凍結された2024年のシェアを維持する。これにより、次の投影が得られる。

流量 (H100e/年)2025202620272028
電話1,200万 (33%)1,660万 (25%)2,150万 (18%)3,100万 (14%)
280万 (7.7%)410万 (6.2%)550万 (4.5%)880万 (4.0%)
ゲーム520万 (14%)720万 (11%)940万 (7.8%)1,420万 (6.5%)
あい1,420万 (39%)3,570万 (54%)8,060万 (67%)1.597億 (73%)
非AIサーバー55.8万 (1.5%)72.5万 (1.1%)90.1万 (0.7%)120万 (0.5%)
別の200万 (5.4%)230万 (3.4%)260万 (2.2%)320万 (1.5%)
合計3670万6,660万1.205億2億1810万

AIは§1.1に基づき、非AIは、残ったロジック ウェーハ × ウェーハあたりの上昇する TPPを取得する。カウンティングロジック + HBM、AIは ~15%65% 2028年までにEUVフリート容量の増加 (フリート~100%全体的に利用されている)、しかし~だけである40%すべてのロジックウェーハの。

AIのウェーハクレーム、残留プール、部品表
ウェーハ/年2025202620272028
AI向けロジックウェハ37.8万66.4万100万160万
+ AI HBMウェーハ (高度なDRAM)250万460万800万1280万
=AI最先端ウェーハ(ロジック+HBM)290万520万910万1,440万
  EUVフリート容量の % (ロジック + HBM)15%27%45%65%
  広範なリソグラフィプールの % (すべてのノード)9.3%16%27%40%
割り当て可能な論理プール (× util)2,090万2,200万2,320万2,440万
非AI向け残余分2,060万2,140万2,210万2280万

出典: AI予測とアクセラレータごとの部品表

  • AI H100eの軌跡。 §1.1のEUV制約の解決 (設備投資のトップライン ÷ コスト効率 ÷ EUV追加料金)より: インストールされたH100e在庫 (1月1日) 8.6M - 22.4M - 57.1M - 135.2M2.89億 2029年までに年間生産量を増やす 14.2M - 35.7M - 80.6M - 159.7M。 §1.2では、§1.1からのこのAIビルドアウトを変更せずに取り込み、非AIの残り部分のみをモデル化しているため、2つのセクションは構造的に一致している。出典: §1.1 (プランAの設備投資トップラインに基づく)。
  • アクセラレータ当たりのHBMは、H100=80 GB、H200=141、MI300X=192、B200=192である。販売加重平均は2024年の約130 GBから2030年までに約600へ増える。約7.5M基を掛けると2024年に約1 EBのHBMとなり、TrendForceの業界推計と一致する。出典:NVIDIA/AMDのデータシート。 TrendForce.
  • アクセラレータごとのシステムDRAMとストレージ。8 GPUノードは、約1 ~ 2 TBのホストDRAM (GPUあたり約150 ~ 250 GB)に加えて、マルチTBのローカル + ネットワークNVMeを搭載する。2024年にはアクセラレータあたり約300 GBのDRAMと約2 TBのNANDをモデル化する (2030年までに約1TB/約6TBに増加)し、HBMが汎用メモリではなく、AIの最も重いウェーハ描画を維持できるようにサイズ設定されている。出典: NVIDIA DGX/HGX H100のスペック;ハイパースケーラーのリファレンス デザイン。
  • 在庫と生産の慣例。AIのフリートは累積的に扱われるため (5年未満の期間での退役はない)、1月 1日の各在庫は生産の累計となる。非 AI カテゴリに使用されるボトムアップの退職再帰を実行するのではなく、ストックを直接取得し、生産量によって、毎年のウェーハの請求額が決まる。

このセクションの残りの部分は、その表の背後にある供給側の正当性、つまり各カテゴリが使用するリソグラフィの上限の割合である。

リソグラフィーの割り当て、2024 ~ 2028年

年間に描画されるEUV露光パス。 AIの利用が爆発的に増加し、2028年までにフリートが飽和状態に近づく。

0万4,700万9,300万1.4億1.86億20242025202620272028
あい非AIサーバー電話ゲーム別の
ロジックとメモリの比較

ロジックとメモリに送られるEUVおよびDUVパスのシェア

0%25%50%75%100%'15'16'17'18'19'20'21'22'23'24'25'26'27'28
ロジック記憶

EUVの利用率は、それまでに拘束力のある制約になると予想されるため、2024年のわずか52%から、単純なモデルでは2028年までに約100%に達する。この数字は稼働時間と実現スループットをすでに個別に計算しており、どちらも2024年の比率で維持されている。使用率が文字通り100%に達するとは予想していないが、稼働時間と実現スループット (理論上のピークスループットの割合として)は2028年までに少し改善され、そのギャップはほぼ相殺されるはずであるという近似値には満足している。

EUVパスプール (月/年)20242028
要求されたパス4,530万1億8250万
パスキャパシティ8,710万1億8250万
EUVの利用52%100%
液浸(DUV)の利用20%25%

使用率 = 要求されたパス ÷ パス能力。 EUVと浸漬は両方とも実効ベース (稼働時間とスループット調整済み)に基づいているため、2つの使用率は直接比較される。

ノード構造: ウェーハおよびノードの組み合わせごとのパス
ノードEUV/WF193i/wfウエハース2024ウエハース2028
論理層
主導的12→2230200万320万
ドゥバドゥ233200万520万
成熟した該当なし61,640万1,600万
メモリ階層
ドラマアド412420万2,070万
DRAMマット該当なし8580万760万
NAND該当なし44,020万4,500万

三つの層(LEADING = ≤N3/N5/N2、EUV、DUVADV = N7/N16、MATURE = 28nm/legacy)。製品構成がN5→N3→N2へ移るにつれ、ウェハー1枚当たりの先端EUV露光回数は12→22へ増える。赤はEUV露光を示す。この表は稼働率の診断用であり、計算資源量や設備残高の計算には使わない。

ノード構成 (2024年のカテゴリ別ウェーハ面積シェア)

カテゴリ主導的ドゥバドゥ成熟した
電話53%27%20%
42%40%18%
ゲーム55%45%該当なし
あい95%5.0%該当なし
非AIサーバー50%42%8.0%
別の該当なし5.0%95%

AIはほぼすべて最先端であり、携帯電話/PC/ゲームは先端から成熟プロセスまでにまたがり、「その他」(MCU)はすべて成熟している。広範なロジック プール (2,950万2024年のウェーハ)は、非AI割り当てを供給する。

デバイスごとのメモリとウェーハのコスト

メモリウェーハ = デバイス数 × デバイスあたりのGB ÷ ウェーハあたりのGB。 HBMは、使用可能なGBあたり約3×のウェーハ面積 (8 ~ 12スタック、TSV、ベースロジックダイ)を必要とし、ほぼ完全にAIに使用されるため、AIアクセラレータのメモリはウェーハ上のロジックを上回る。

デバイスごと (2024 → 2028)HBMドラムNAND
電話該当なし8→13GB200→333GB
該当なし16→27GB700→1033GB
ゲーム該当なし14→21GB該当なし
あい130→400GB300→767GB2000→4667GB
非AIサーバー該当なし512→683GB26000 → 36667GB
別の該当なし0.05 → 0.05GB2→3GB
  • ウェーハあたり GB (2024年): DRAM ~2,800、NAND ~21,000、HBM ~900; 2030年までにすべてが ~1.7×に成長する。HBMは ~11% 2024年のDRAMウェーハの割合 (TrendForce: ~14%)。出典: セミ;TechInsights;トレンドフォース。
  • 非 AI サーバー行にはデータセンターのストレージ層 (SSD アレイ、ネットワーク化された NVMe) が搭載されているため、その NANDは大きくなる (サーバーあたり約 26 TBに相当)。これは大容量ストレージに組み込まれており、デバイスごとの厳密なカウントミスが発生し、Trendfocus と一致して、2024年には世界の NAND ≈ 845 EB (約 4,400 万ウェーハ) に到達し、出典: トレンドフォース;トレンドフォーカス; IDC/オムディア。
リソ供給源: EUVレイヤー/ノード、フリート、スループット、ノード構成
  • ノード当たりのEUV層数は、N5/N4が約13〜14、N3Eが約19、N3Bが約25(double-patterned)、N2が約23〜25である。double-patterned層には2回の露光が必要なので、パス数は層数以上となり、先端層のパス数は12→24(2024→2029)へ増えるとモデル化する。出典: SemiAnalysis;ウィキチップ; TSMC。
  • メモリ EUV: 高度な DRAM (1α/1β/1γ) は、約 1 ~ 6 の EUV 層を使用し、ランピングする。 3D NANDは何も使用しない。高度な DRAMはウェハあたり約 4 EUV パス、成熟した DRAMと NANDは 0 でモデル化し、出典: SK Hynix / Samsung / Micron の開示情報、TechInsights。
  • EUVフリート: ~220 2024年までにシステムを構築、~457 ASMLガイダンスに基づいて2028年までに。スループット: 〜 360,000実効露出/ツール年 (〜 160 wph仕様を下回る)。出典: ASML.
  • 浸漬フリート: ~1,330 (2024) → ~1,800 (2028);豊富なので、193i は決してバインドしない。スループット: 〜 950k 実効パス/ツール年 (〜 180 万ネームプレートのランレートの約半分、EUVと同じ稼働時間/スループットに基づいて定格を下げる)。ノード混合はウェーハ面積のシェアである: Counterpointによると≤5nm 上の 2024 の電話機 SoC ユニットの約 43% → ウェーハ面積の約 53%。出典: ASML / SEMI;Counterpoint; TSMC.

1.2.3結果

廃棄を差し引いた生産量を累計すると、カテゴリごとの設置在庫が得られる。生のH100eを実効的なH100eに再スケーリングする (生のxUU、リソース調整されたAIワークロード有用性モデル。付録).

効果的なH100eは、有用性係数によって各カテゴリの生の計算資源を再スケーリングする。U、で導出された付録

有用性U2024202620282029
電話0.210.110.070.05
0.350.080.040.03
ゲーム0.040.050.060.04
あい1.161.061.041.02
非AIサーバー1.381.401.411.40
別の0.530.430.340.30
チップごとの入力とクランプされていないモデル出力

U を駆動するチップごとのリソース入力 (カテゴリ別) (2024)。実際の計算資源と HBM クラスの帯域幅および大規模な NVLink コヒーレント ドメインを組み合わせるのは AI アクセラレータだけである。他のすべてのカテゴリは事実上 1 つのチップである (スケールアップ ワールド=1)で、非AIサーバーはメモリが豊富であるが、計算資源は小さく、民生用チップは帯域幅が狭く、クラスタ化されず、「その他」(MCU/エッジ)はどの軸でも小さい。

チップあたり (2024)H100e/チップメモリ帯域幅 (TB/秒)メモリ (GB)スケールアップした世界
電話4.0e-30.03271
6.6e-30.085121
ゲーム0.0970.41111
あい1.154.7126160チップ
非AIサーバー0.0300.705121
別の5.7e-50.0060.11

Over the forecast, H100e/chip roughly doubles every ~1.5 years while memory bandwidth and capacity per H100e fall (the memory wall) and AI’s NVLink world grows (NVL72 → NVL576); the §1.1 resource-intensity box tracks the AI fleet’s trajectory in full.

生のU、非AI ≤ 1キャップの前

カテゴリ (生のU)2024202620282029
電話0.210.110.070.05
0.350.080.040.03
ゲーム0.040.050.060.04
あい1.161.061.041.02
非AIサーバー1.381.401.411.40
別の0.530.430.340.30

サーバーと「その他」(MCU/edge)のスコアが > 1 になるのは、計算資源の小さいチップではper-FLOP比がどれも潤沢に見え、ネットワーク・ペナルティがほぼ消えて計算資源上限に張り付くためである。非AIサーバーでは、実際にメモリが豊富なので妥当であり、生のH100eに占める割合も~1–2%と小さいため、生のUを用いる。MCU/edgeの「その他」ではアーティファクトなので≤1に制限するが、「その他」は生の構成比が~8–23%と大きく、上限を1としてもAIへの有用性を過大評価している可能性が高い。

象限ごとのワールド計算資源

各年1月1日時点の導入済みH100eを配備象限別に示す。stock↔flow、raw↔effective、level↔shareを切り替えられる。

01億2億3億4億2,000万20253,500万20267,400万20271.57億20283.15億2029
AI×クラスター(AIデータセンター)
AI×単一デバイス(特殊用途のコンシューマー機器)
非AI×クラスター(非AIサーバー)
非AI×シングルデバイス(コンシューマ)

クラスターと単一デバイスの分割。また、計算資源をクラスターと単一デバイスに分類し、非AIサーバーを非AI関連クラスター、携帯電話、PC、ゲーム用 GPU、組み込みチップは非 AI 単一デバイスである。 AI 関連の計算資源は、ほぼ完全にデータセンター (AI 関連クラスター) で実行されるアクセラレーター内にあるが、AI 関連のシングルデバイス チップの量はわずかに増加しているが、これは現在では無視できる程度であり、データセンター クラスの GPUがデスクトップ フォーム ファクターに達するにつれて増加する (例: NVIDIAのDGXステーション).

H100e有効在庫 (1月1日)20202024202620282029
AI関連 - クラスター (AIデータセンター)101K (4.1%)360万 (26%)2,370万 (67%)1億4,080万 (90%)2億9520万 (94%)
AI関連 - 単一デバイス (専門消費者)000218K (0.1%)938K (0.3%)
非AI - クラスター (非AIサーバー)294K (12%)140万(10%)260万 (7.5%)470万 (3.0%)610万 (1.9%)
非AI - 単一デバイス (消費者)210万 (84%)870万 (63%)910万人 (26%)1,150万 (7.3%)1,260万 (4.0%)
AI関連の単一デバイスの計算資源を予測する方法 (専門消費者)

ここでいうスタンドアロンAIワークステーションとは、高性能GPU(帯域幅1 TB/秒以上、メモリ32 GB以上、4,000 TPP以上)と100 Gb/秒NICを備え、AI関連性の4基準をすべて満たす機器である。RTX PRO 6000クラスのGPUを搭載したワークステーションから、NVIDIA DGX Station(GB300を1基、約2.5 H100e)まで幅がある。DGX Spark(約0.5 H100e)のような低価格の小型機は帯域幅の下限を満たさず、一般的なゲーミングPCには100 Gb/秒NICがない。価格は1台約$10,000〜$100,000で、販売台数は多くない。年間販売台数と1台当たりH100eを推定し、合算する。

出荷年出荷されたユニットH100e/台追加H100e設置された(1月1日)
202615K2.53.8万0
202760K318万3.8万
2028180K472万21.8万
2029450K5230万93.8万

その設置された(1月1日)列は各年の初めの現在の在庫であり、まさに上の表の専門消費者行である (~93.8万H100e 2029.0まで、約 0.3% AIフリートの~255K単位)。新しいカテゴリーのため、台数はおおよその目安となる。

1.3地域の所有権

このセクションでは、§1.1のAI関連計算資源について、地域ごとの世界の計算資源所有権を予測する。所有権を次の3つの方法で分割する。米国、中国、その他世界。中国は輸出規制によって世界の主要なサプライチェーンから切り離されており、支出に占める割合を大まかに見積もって特定するのが最も難しい地域となっているため、別の中国の計算資源予測に焦点を当てることが最も有益であるとわれわれは考えている。

したがって、以下に示すのは、中国に到達するさまざまな計算資源ソースごとに分類された、独立した中国の計算資源予測である。次に、世界全体の米国とその他の地域の割合の大まかな推定を行いる。中国国内の製造業は、同じ(EUVベースの)サプライチェーンから来ていないため、§1.1の世界計算合計予測とは別個に扱われるため、§1.1の合計に再び加算される。

1.3.1中国の計算資源予測

私たちは中国のAI計算資源を4つの供給源に分類し、そのうち3つは世界のサプライチェーンからのものである (すでに§1.1の世界合計に含まれている)。法的な輸入 (輸出準拠チップ: 例: 歴史的にはH20、現在のライセンス方針ではH200)、密輸されたチップスと、抜け穴(密輸されたチップダイ梱包前、または中国企業が所有するオフショアデータセンター、または海外からのリース)。 4つ目は国内製造チップ (SMIC 7nmロジック / CXMT HBM / Ascend)。中国の計算資源能力は2026年から2029年にかけて約9xに成長するが、世界的な規模の拡大がそれを上回っているため、世界シェアは依然として約9%に向かって低下している。

0400万800万1,200万90万2024170万2025340万2026投影 →680万20271,300万2028
中国のAI計算資源 - ai-2040.com
国内合法輸入抜け穴(オフショアDC・レンタル)密輸
観測データに固定された2024 ~ 2025年のアンカー:
チャンネル20242025基礎
国内25万60万SMIC ≤7nm + Cambriconでアセンドし、一度限りの外国HBM備蓄 (約1,300万スタック、ほとんどがサムスン約1,140万 ≈ 160万910C)と約290万ダイのTSMC 「ダイバンク」(SemiAnalysis); ~0.8 未加工 H100e/910C
正規流通20万15万2024年に約 100 万の H20が抑制される (それぞれ約0.2 H100e)で、2025年の純量は約15万個のみ:4月の禁止、7月からの部分的再ライセンス、中国政府の購入控え前の第1四半期出荷
抜け穴25万45万中国企業が所有するオフショアDCまたは 海外でレンタルするここでの2024年と2025年の累計(2025年末までに約0.7M基)は、確認済みレンタル分の下限である約670K基以上(ByteDance約520K基)をわずかに上回る。
密輸16万48万グレーマーケットで禁止されている部品、に固定されている Epoch
2026年から2028年の予測

3つのグローバルチャネルは、§1.1の世界生産のシェアとして予測される。

グローバルチャネルルール (§1.1世界のシェア)202620272028
密輸~3.5% → 2% (それ以上) 執行126万212万299万
抜け穴~2% (~1.5% 確定賃貸フロア + 他のソース)70万160万315万
正規流通~1%35万80万160万

合法的なルートは、この約1%ルールよりも2 ~ 3x高くなる可能性があるが、北京側の輸入制限により実現出荷量は減少しているが、現在のライセンス政策はすでにそれを超える量をカバーしている。

国内HBMに依存しており、最近のものを見る半分析CXMTピース:

国内の蓄積202620272028
CXMT HBM容量 (kwspm開始)3055100
8-hiスタック収量 (成熟時)25%31%37%
ウェーハ当たりの良好な8-hiスタック (~88総x歩留まり)222733
→ 良好な910C相当/年 (kwspm x 12k xスタック数 / 8)100万220万490万
910C相当の生のH100e (ロジック + HBM3Eゲイン)0.800.820.85
→ CXMTメモリ上の生のH100e80万180万420万
上昇: 密輸されたHBM + 他の企業+30%+25%+20%
= 国内110万230万500万

これは楽観的な見積もりで、CXMTのHBMランプを額面どおりに受け入れる (半分析CXMTピースは、2028年までに世界のHBMウェーハ供給量の約12%になると予測している)が、その増加分はバックロードされており (2026年の列はおそらくゼロに近い可能性がある)、同じファブの利益率の高い汎用DRAMと競合する。

DUV容量は豊富である。Ascend ロジックと CXMT メモリは両方とも中国の ArF 浸漬 (DUV)装置群で製造され、これらの AI チップの投影では、そのほんの一部のみが使用される。

DUV液浸フリート20262028基礎
フリート (ツール)~290~4002024年に購入された~200基本 + ~90 ArFi (ほとんどが NXT:1980Fiクラス、275〜330 wph、ASMLの129台の70%、$5-7B)で、その後、オランダの規制で輸入は減速した(AEI)
実現容量 (パス/年)約5.2億~720Mフリートxツール/年あたり実現パス数約180万 (生産では1日あたり約5 ~ 6,000ウェーハと、 ~240万のネームプレート;参照:§1.1の ~360k EUV)
アセンドロジック~500万 (~1%)~1,700万 (~2%)~8 → 28 kwspm SMIC ≤7nmスタート x ~40 ~ 60パス/ウェーハ (SAQPクアッドパターニング)
CXMT HBM~400万 (~1%)~1,200万 (~2%)~30 → 100 kwspm CXMT HBMが開始する × ~10パス/ウェーハ

AI向け需要は装置能力の~2%(2026年)、~4%(2028年)にすぎず、制約となるのはHBMである。中国がDUV装置群をAIチップで埋めないと考える理由もここにあり、HBMなしにAscend logicを増やしても利用可能なAI computeは増えず、SMICの≤7nm着工量は露光装置数でなくmulti-patterningの歩留まりと費用に制約され、装置群の大半は中国が支配を狙う成熟ノード市場(自動車・産業機器・家電)へ回す方が採算に合う。

4つのチャネルを組み合わせたもの (M raw H100e):

H100e (注記がない限り年間)20242025202620272028
国内25万60万110万230万500万
リーガル西部劇20万15万35万80万160万
抜け穴(オフショアDC・レンタル)25万45万70万160万315万
密輸16万48万126万212万299万
合計追加/年90万170万340万680万1270万
→中国株(年末)130万290万630万1,320万2,590万
→ 中国が世界の%14.7%13.1%11.1%9.7%9.0%

1.3.2結果

世界の合計 (§1.1)、中国の予測 (§1.3.1)、および残りの米国/RoWの85/15の分割を組み合わせると、地域ごとの所有権が得られ、米国が全体で大部分を占め、中国が~15% → ~9%となる。

米国中国その他の地域
07,500万1.5億2.25億3億20251,700万20264,300万20271.04億1,800万20282.24億2,600万3,900万2029
AI計算資源の所有者は誰であるか - ai-2040.com

所有者=計算資源を所有またはリースしている企業の国。世界の計算資源は§1.1に基づく。中国は§1.3.1のボトムアップ予測であり、中国以外の残りは米国とその他地域に85対15で配分する。

1.4データセンターのサイズ

このセクションでは、§1.1のAI計算資源が、ギガワット規模のトレーニングキャンパスから小規模な地方サイトのロングテールまで、データセンターの規模全体にどのように分散されるかを予測する。この方法は比較的単純である (そして不確かである)。 AI計算資源の合計予測 (§1.1から)を取得し、それをデータセンターの総数に分散し、3つの集中アンカーでデータセンターサイズの曲線を当てはめ、その結果を米国、中国、およびその他の国々の所有権に分割する (§1.3から)。

10M+1 DC-1,000万·3.5%1M-10M74 DC-1.49億·51.4%100K-1M257 DC-7,600万·26.4%10K-100K497 DC-1,500万·5.3%1K-10K823 DC-260万·0.9%<1K1.2千 DC-39.7万·0.1%輸送中3,500万·12.0%AI消費者25.5万 単位-93.8万·0.32%米国 - 2億2,400万 - 77%中国 - 2600万 - 9%列 - 39M - 14%
データセンターのサイズごとに場所を計算する (2029年1月1日) - ai-2040.com
データセンターのサイズモデル

セットアップ。AI計算資源の合計を取得するC (§1.1)およびデータセンター数N (2025年には約1,000サイト、デフォルトで年間30%ずつ増加し、2029年までに約2,850サイトに達する)。次に、サイズ分布に基づいてデータセンターのサイズを割り当てる。

アンカー。ピン留めする3つの集中アンカーを使用したサイズ分布、最大の1、10、および100クラスターが保持するすべての計算資源のシェア、S1,S10,S100S_1, S_{10}, S_{100}これはおよそ4%、20%、70%になると予想される (手動設定、上方修正) Epochのデータセンターデータセット)、時間が経っても平らに保たれる:

S1=c1/CS10=(c1++c10)/CS100=(c1++c100)/C\begin{aligned} S_1 &= c_1 / C \\ S_{10} &= (c_1 + \dots + c_{10}) / C \\ S_{100} &= (c_1 + \dots + c_{100}) / C \end{aligned}

フィット。次に、4つの係数を使用して、対数ランクの3次として対数サイズをモデル化する。a,b,c,da, b, c, d:

log(ci)=a+blog(i)+clog(i)2+dlog(i)3\log(c_i) = a + b\log(i) + c\log(i)^2 + d\log(i)^3

これら4つの係数は固定されているまさに4つの方程式、3つのアンカーに合計を加えたものによって計算される (対数ランクの3次関数には4つの自由度があり、4つの制約に一致するため、曲線は完全に固定され、自由パラメーターは残りない)。

c1/C=S1(c1++c10)/C=S10(c1++c100)/C=S100c1++cN=C\begin{aligned} c_1 / C &= S_1 \\ (c_1 + \dots + c_{10}) / C &= S_{10} \\ (c_1 + \dots + c_{100}) / C &= S_{100} \\ c_1 + \dots + c_N &= C \end{aligned}

第1式はlog1=0\log 1 = 0から直ちに得られる。a=logc1=log(S1C)a = \log c_1 = \log(S_1 C);他の 3 つは数値的に解決される。これにより、あらゆるデータセンターのサイズが回復されるcic_iちょうどからNC、そして3つのアンカー。

地域。カーブを分割するには米国、中国、その他世界、各地域の所有権シェアを予測するSrS_r総計算資源の割合 (目標を与える) Tr=SrCT_r = S_r C)を選択し、そのシェアに比例して各データセンターをリージョンに割り当てる。オプションのスキュー θr\theta_r 合計を固定したまま、地域をより小さなサイトまたはより大きなサイトに向けて傾けることができる(最大のクラスターが異なることが知られている地域(中国など)に一致させるため)。デフォルトではオフになっている(θCH=θRoW=0\theta_{CH} = \theta_{RoW} = 0)、したがって、各領域はグローバル曲線の同じ形状のスライスにすぎない。

デフォルトのパラメータ。

パラメータデフォルトそれが制御するもの
N0N_0 (2025年のサイト)1,0002025年のデータセンター数
成長 gg30%/年データセンター数の増加 (→ 2029年までに約2,850サイト)
S1S_14%単一最大クラスターの計算シェア
S10S_{10}20%約10社のシェアを計算する
S100S_{100}70%約100のシェアを計算する
スキュー θCH,θRoW\theta_{CH}, \theta_{RoW}0(オフ)オプションの地域サイズの傾斜、 0 = 比例

これらの集中シェアは厳選されており不確実であり、以下から調整されている。Epochが観測した現在のデータセットこれは、フロンティアクラスターを完全にカバーしていないことを前提としている (2025年後半の時点で、その最大の追跡サイトは世界のAI計算資源の約15%をカバーしている)。

パート2。協定後の計算資源 (2029年以降)

このセクションでは、プランAが実施された後に何が起こるか、またプランAが実施されなかった場合の1年間のデフォルトの反事実を予測する。

2.1合意なき離脱の反事実

デフォルト(合意なし)経路がさらに1年続くことを予測するために、我々は§1.1手法(および中国国内の追加については§1.3)を2029年末の導入在庫まで拡張する。プランAでは、研究開発の一時停止と協定実施中の一般的な不確実性により設備投資が一時的に低下すると予想している。私たちは、プランAの下で、現金による設備投資が傾向を維持する一方で、負債で調達した増強部分をゼロに崩壊させることでこれを近似する。推論のみの検証の迅速な実装と推論計算資源の割り当ての増加により、AIの収益予測はデフォルトの反事実と同等になると予想される。

総じて、協定が適切に実施されれば、研究開発はいずれ再開できるという見通しを企業に与えられると考えており、実現済みの能力水準と、研究開発再開後も減速しながら続く急速な改善を踏まえれば、AI投資はなお極めて魅力的である。透明性が高まりアルゴリズム上の参入障壁がなくても、経済価値は計算資源の所有者に帰属し、所有者は最良モデルを先に学習して最も広い利用者層へ提供できるため、この結論は変わらない。

合意なし取引(プランA)
2029年の設備投資借金を財源とする企業が打撃を受ける$3.5T$2.4T-31%H100e追加(2029)設備投資 × 効率、EUV 追加料金控除後2.47億1.99億-19%H100e導入(2029年末)既存のベースでクッションされる5.37億4.89億-9%
プランAの反実仮想 - ai-2040.com

協定なしとプランAを、協定から1年後(2029年末まで)で比較する。プランAでは、キャッシュフローで賄う設備投資は傾向どおり維持する一方、負債調達分をゼロとし、2029年の総設備投資を~31%減らす。

2.2協定後のAI関連の計算資源

プランAがさらに進むにつれて、特にAIとロボットがハードウェアの研究開発と生産を自動化し、これまで人間に制約されていた労働力を大幅に増やすことができるようになるにつれて、計算資源の増加に対する不確実性が増大している。不確実性を考慮すると、§1.1計算資源パスを開始点として2040年まで実行する比較的単純なモデル (JonesとWrightの法則の学習)を使用するのが合理的であると考えられる。ハードウェアの研究開発と生産における制約のないAIとロボットの導入によってデフォルトで予想されるハードウェアの爆発的な増加と、これが不安定化するという事実 (とりわけ、取引の離脱の容易さと取引内の検証の負担の増大)を考慮すると、プランAは、ハードウェアの爆発を制御可能な (それでも大幅に増加した)ハードウェアレベルまで遅らせるためのキャップアンドトレード制度を特徴としている。

ハードウェアの急速な成長が期待される理由。計算資源単位あたりのコストを下げる2つの別々の力が考えられる。

  • デザインの改善 (Jonesをモデル化)。設計を改善すると、チップレイアウト、メモリ設計、トランジスタ密度、パッケージングなどが改善され、AIチップ生産の固定単位あたりの計算量が増加し、これは研究開発なので、労力を費やしてモデル化できるが、安易なアイデアが使い果たされると利益は減少する (Jones 1995(次の研究に基づき較正: Bloom et al. 2020)。また、同時点で投入する並列労働を増やしても収穫は逓減する。これは「ウェーハ当たりの計算性能」の歴史的改善に相当し、ノード微細化も生産規模ではなくチップ・製造装置の研究から生じるため、ここでは設計R&Dに分類する。現在、半導体産業で働く人は約200万人であり、2030年代初頭には、チップ・製造装置R&Dに投入される人間、AI、ロボットの合計労働量が約100xになると予測する。モデルのパラメーター上、それでも「Moore’s Law」の進歩速度は約1.1xにしか高まらない。

  • 生産規模の拡大 (Wright)。計算資源の製造規模が拡大すると、歩留まり、スループット、稼働率、規模の経済を通じて、学習効果による効率改善が生じうる。歴史的には「1ドル当たりのウェーハ数」の改善に相当する。単位費用は累積生産量が倍加するたびに約15%下がるとモデル化しており、半導体や太陽光の長期学習率に近い。AIやロボットによるファブ建設・運営の自動化がこの傾向を速めるかは不明だが、規模拡大の効果が設計改善とは別に続くという前提は、妥当な基準線である。

計算資源1単位当たりの費用($ / H100e)を、二つの要素、すなわち生産単位当たりの計算資源量(compute / unit produced)と、$当たりの生産単位数(units produced / $)の積として扱い、歴史的には生産単位をウェハーとしてきたが、将来の技術体系では変わりうる。各要素を2025年に1へ正規化し、以後は低下させる。§1.1の終点を出発点に、この二つのモデルを2040年まで進める。

Jones&Wrightの法則のコストモデル

AI計算資源の単位あたりのコストは、2025年の1つのアンカーに、どちらも1から始まり時間の経過とともに低下する2つのインデックス (製造インデックス)を掛けたものである。W(t)W(t)そしてデザインインデックスD(t)D(t):

MC(t)=MC2025×W(t)×D(t)MC(t) = MC_{2025} \times W(t) \times D(t)

Wrightの法則(製造)。累積生産量に応じてコストが下がりる、古典的な学習曲線である。

W(t)=(Qcum(t)/Qcum(2025))bW(t) = \left(Q_{\rm cum}(t)\,/\,Q_{\rm cum}(2025)\right)^{-b}

したがって、累積生産量が 倍加になるごとに製造コストが削減される。12b1 - 2^{-b}私たちが使用するのはb=0.25b = 0.25、倍加につき約16%で、長期的な半導体学習率と同様である(太陽のスワンソンの法則に近い)。

Jonesデザインの研究開発。毎年の設計コストの低下は、研究開発の労働力が増加するにつれて拡大し、収益も減少する。

レート(t)=rbase(Lcog(t)/Lcog(2025))λ,D(t+1)=D(t)(1レート(t))\text{rate}(t) = r_{\rm base}\left(L_{\rm cog}(t)\,/\,L_{\rm cog}(2025)\right)^{\lambda}, \qquad D(t{+}1) = D(t)\,(1 - \text{rate}(t))

どこでLcogL_{\rm cog}これは、AI / ロボットの労働量とその能力 (自動化できるタスクの割合)を組み合わせた経済モデルの「有効労働量」から取得された、人間とAIの認知労働量 (導入された計算資源に応じてスケールされる)を組み合わせたものである。rbaser_{\rm base}は基本ペースであり、λ\lambdaは「つま先を踏む」調整である(Bloom et al. 2020): 100xの研究部隊が購入できる進歩は100xよりはるかに小さい。

パラメータAIチップ
Wright型学習 bb0.25(約16% / doubling)
Jones基本レート rbaser_{\rm base}25%/年
Jonesがつま先を踏む λ\lambda0.05
2025年の製造コスト$5,000 / H100e
累積生産量、2025年20M H100e

基本レート (25%/年)は、年間約1.35xの計算資源効率の傾向を追跡する。λ=0.05\lambda = 0.05足元を強く保つ、100xのAI研究力が得られるのは設計進捗率の約1.3xだけであるため、AI人材が増大しても、チップ設計はわずかしか加速されない。上のアンカーは、作るチップ(限界生産コスト、2025年に約 5,000 ドル)――これはコストの数字が追跡するものであり、値上げにデータセンターと電力を加えると、合計コストは約 33,000 ドルになり、これが、投資額に相当する。どちらも同じ方向に落ちるW×DW \times D曲線。以下では、プランAの2つの制約 (計算資源キャップとR&Dコントロール)を使用した場合と使用しない場合にこのループを実行する。

ハードウェアの爆発には、プランAの2つのスロットルがある。これらの制約がなければ、進歩が大きすぎて、離脱の容易さや検証負担の面から合意の安定性を損なう。計算資源が増えるとハードウェアの研究開発と生産が進み、さらに多くの計算資源と安価なハードウェアを生むフィードバック・ループがある。プランAでは、このループの異なる箇所へ二つの制約をかけ、生産量を上限で抑えるとともに(2032年以降のキャップ・アンド・トレード政策)、数量上限があっても計算資源の製造が容易かつ安価になりすぎないよう、研究開発の展開を制限する。

プランA(キャップ + ハードウェアR&Dコントロール)キャップなし、ハードウェアの研究開発が管理されている上限なし + 制約のないハードウェアの研究開発
5Q1T20292030203220342036203820401億10億100億1,000億1T10T100T1Q10Q100QH100相当を搭載、対数スケール
上限付きプランAの計算資源とデフォルトの比較 - ai-2040.com

プランAの計算資源について、異なる制約を解除した場合を比較する。二つの制約は、2032年に導入され生産量を制限するキャップ・アンド・トレード政策と、爆発的に増えるハードウェア研究開発労働力が計算資源費用を下げすぎ、チップ製造を容易にしすぎるのを防ぐハードウェア研究開発の展開制限である。

各シナリオの前提条件

3つのシナリオはすべて、上限が制限され始めるまで (~2034) プランAの計算資源パスに従い、その後は2つのレバーで異なる。

  • 計算資源キャップ(キャップアンドトレード、2032年以降)。オン: インストールされた計算資源は、プランA政策パス、2040年までに~1T H100eに固定される。オフ: 制約のない再投資ループが数量を設定し、実行される。

  • ハードウェアの研究開発。制御あり:チップ設計の進歩は年約10%、おおよそ2010年以降のトランジスタ当たり費用の低下ペースに抑える(AIの計算効率の年約25%という趨勢を大きく下回る)。制約なし:ハードウェア研究開発の実効労働力は経済モデルの実効AI労働力(能力×量)なので、設計費用の低下もそれに応じて加速する(基準率は年25%、stepping-on-toesλ=0.05\lambda = 0.05、上限は60%/年)。

シナリオ計算資源キャップハードウェアの研究開発何が起こるか
プランAオン、2040年までに約1T制御されたドキュメントの残りの部分が使用する境界付きパス
キャップなし、ハードウェアの研究開発が管理されているオフ制御された量は上限の数千係数に爆発する
上限なし + 制約のないハードウェアの研究開発オフ制約のない量もコストも暴走してチャートから外れる

有効労働力は、すべてのシナリオで同じ系列である (econ モデルの A_eff、能力 x 量、そのシナリオの計算資源によってスケールされる)、研究開発の管理は、労働力の合計ではなく、そのうちのどれだけが設計の進捗に反映されるかに基づいて行われる。

ハードウェアの研究開発AIの効率的な労働力、2040年 (HE = 人間相当)設計コストの低下
制御(プランA)~400B HE年約10%、2010年以降のトランジスタ当たり費用のペースで維持
管理されている(キャップなし)~2×10^15 HE従業員数が大幅に増えたにもかかわらず、年率約10%を維持
制約なし (両方)~2×10^21 HE25%/年、60%/年の上限まで拡張

非制約率は、まさに経済モデルのJones式 (25%/年x (A_eff成長)^0.05、λ=0.05\lambda = 0.05);制御された上限は、プランAの最上位に重ねられた R&D 制御政策であり、基本経済モデルはこれを課しない。

研究開発は有効労働力のどのくらいの割合を占めているか?有効労働力の一定割合であり、重要なのはその成長率だけなので割合自体は相殺され、特定の比率は仮定しない。この有効労働力には経済モデル上の実効AI労働(A_eff、能力 x 数量)を用い、各シナリオの計算資源量をプランA比で調整するため、研究開発の進展には能力と数量の増加がともに反映される。ロボットは固定のプランAのキャップアンドトレードパスに基づいて維持され、これらのシナリオ間で変更されることはない。

供給側への影響と健全性チェック。

プランAでデフォルトで可能な計算資源生産は比較的単純にモデル化されており、キャップアンドトレードの軌道は、他の制約 (検証と取引の安定性)によりかなり低く設定されている。このボックスでは、キャップアンドトレードの軌道が供給側にどのような影響を与えるかを説明しながら、可能となるキャップアンドトレードの軌道を動機づける。特に、歴史的成長と比較して必要となるリソグラフィーに注目する。

方法。プランAの年間生産量 (新規H100e/年、2040年までに約5,700億H100e/年に増加)をシリコンウェーハに変換し (これがパラダイムのままであると仮定)、ウェーハを必要なリソグラフィー露光パスに変換し、次に1台のリソグラフィー装置のスループット (機械年当たりの実現パス)で割って、必要な機械年数を求める。

必要な機械(t)=新しいH100e(t)  ×  H100eあたりのリソパス(t)機械年あたりのパス(t)\text{machines needed}(t) = \frac{\text{new H100e}(t)\;\times\;\text{litho passes per H100e}(t)}{\text{passes per machine-year}(t)}

デフォルトのリソグラフィーフリート。我々は 2029年(§1.1 より、H100e あたり約 0.7 EUV パス)を基準に、その歴史的経過にあるリソグラフィ フリート(2029年に稼動しているマシンは約 620台、年率約 20% 増加。ASMLは現在、年間約 125台を出荷)と比較し、また、マシンのスループットを年間約 10% 増加させ、これは 1時間あたりのウェハ数の歴史的な上昇 (2019年から 2024年でおよそ 125 ~ 220 枚) に匹敵する。

デフォルトの計算密度。時間の経過とともにH100e/ウェーハが増加約35%/年;デフォルトの傾向と比較して、リソグラフィーのビルドアウトが示唆する 3 つの異なる可能性を検討する。

ウェーハあたりの計算資源の増加0%/年 (凍結された2029年のテクノロジー)35%/年 (継続的なテクノロジートレンド)50%/年 (技術トレンドの加速)
2040年までに必要な露光装置~1,100,000~14,000~4,400
とチップ群の歴史的趨勢(2040年までに約4,300)との比較係数~255x係数~3x係数~1x
現在と比較した暗黙の年間生産量 (~125/年)係数~4,400x係数~29x係数~6x

プランAでは、中央の列のようなことが起こると予想される。

プランAの計算資源増強が含意する投資額は、検算のためドル換算でも示せる。各年の推定投資額は、その年に追加した計算資源にH100e当たりの総費用を掛けて求め、この総費用は、上のモデルによる生産費用に、AI設備投資1ドルで購入するその他すべて、すなわちチップメーカーの利益、データセンター、電力、ネットワークを含む上乗せ係数を掛けた値である。この上乗せ係数は、2025〜2028年についてPart 1の設備投資予測、2028年で約2.4兆ドルを正確に再現し、2029年について§2.1の合意年を再現するよう較正すると、約7x〜8xになる。その後は、ロボットが建設するファブやデータセンターが生産費用に近い価格でハードウェアを供給し、後述の効率改善によってH100e当たりの電力・データセンター費用も縮小するため、2040年までに約1.2xへ下がると予想する。

$1,000億$1.0T$10T$100T取引→$2.43T$47T202620292032203520382040
暗黙のAI計算資源投資 - ai-2040.com

上限のないパスについては非常に不確実であるが、制約のないデフォルトは上限のあるパスよりも桁違いに高くなる可能性が高いと考えられる。 AIやロボットがハードウェアの研究開発やチップ生産に対応できるようになると、ハードウェアの研究開発やチップ生産に利用できる効率的な労働力が大幅に拡大する。私たちは、積み重ねられたJonesの法則とWrightの法則の学習曲線の力学が、これがどのようになるかを合理的に単純に近似したものであると考えている。

歴史的に、チップ設計の改善は電力効率の改善と密接に結びついていたため、上記のコストモデルと同じJones設計トレンドに基づいて、同じパラメータ (25%/年基本レート、つま先立ち)を使用して計算電力効率をモデル化する。λ=0.05\lambda = 0.05)をプランAの制約下の研究開発ペースで進めると、次の軌道となる(とりわけ、その軌道はCMOSトランジスタの理論限界を越えない。Epoch推定).

10005002001005020105CMOS制限~200×H100(Epoch)20252027202920312033203520372039204027 W
計算電力効率 - ai-2040.com

H100eあたりの施設の総電力 (in Epoch社の規約:チップのTDPにサーバーのその他の構成要素と冷却などのクラスター級オーバーヘッドを加えた、電力網側での総消費電力)の設置済み機器全体の平均を、経済モデルのプランAにおけるエネルギー軌道から算出する(コストモデルと同じ、制約付きのJones型設計トレンドを使用)。2040年には2025年のチップの~37× に達するが、それでもなお次の値を大幅に上回る。 CMOSの実用限界 Epoch推定 (~200 × 現在のH100e)。

2.3企業の集中

このセクションでは、計算資源が企業間で時間の経過とともにどのように分散されるかについての予測を示す。私たちは追跡するAI企業のエンドユーザー (計算資源を実際に使用する会社)所有者(自分の計算資源を他の人に使用または貸与する可能性がある)。初期のほとんどの計算資源は、ハイパースケーラーが所有する集中的な方法 (Googleが計算資源の約25%を所有)であるが、AI企業のエンドユーザーは集中力が低い、最大のものは2026年に世界の計算資源の約10%を使用する (GDMとOpenAIは同様である)。

トップ企業トップ3トップ10
0%20%40%60%80%20262028203020322034203620382040~8%~20%~5%~13%~31%
企業の計算資源集中 - ai-2040.com

AI企業が使用するシェアは時間の経過とともに増加しており、プランAが実施されるまでこの傾向は今後も続くと予測している。2030年以降、プランAの透明性体制により参入障壁が低くなる。AIへの投資が拡大してより均等に広がり、計算資源がより多くの企業に分散されるようになり、2040年までに、最大企業は世界の計算資源のわずか約5%を保有し、フロンティア企業は約20社になる (最大企業の4x以内の企業として定義される)。

米国中国その他の地域濃色はフロンティア、淡色はその他
2029ハイライト = フロンティア (上位3)
AnthropicOpenAIGDMSpaceXMetaその他の米国その他の中国他の行米国中国その他の地域
企業別・計算資源の最終利用者 - ai-2040.com
企業の計算資源集中のための方法

この方法は比較的単純で、分布の形状について世界規模のランクサイズの法則を1つ設定し、予測と一致するように手動で設定し、その後、§1.3の分割に一致するように企業を所有地域に割り当てる。宇宙を越えてNN世界中のエンドユーザー、ランキングのシェア -ii会社は

si    exp(σΦ1(Ni+0.5N)+τi),i=1,,N,s_i \;\propto\; \exp\left(\sigma\,\Phi^{-1}\left(\frac{N-i+0.5}{N}\right) + \frac{\tau}{i}\right), \qquad i = 1,\dots,N,

シェアの合計が1になるように正規化される (Φ1\Phi^{-1}ランクの標準正規分位数であるii)。これには2つの形状パラメータがある。σ\sigma全体的な広がり (上位3つを駆動する濃度)を設定する。τ\tauとして減衰する頭の傾きである。1/ランク1/\text{rank}1つのリーダーを次の2つのリーダーに対して相対的に移動するが、テールへの影響は少なくなる。

世界の最上位1社と上位3社の最終利用者シェアを各年について直接設定し、次の式を解く。(σ,τ)(\sigma, \tau)これにより分布は二つのシェアをともに再現する。 初期の首位企業の比率は小さいが、2029年の協定時には世界の計算資源の約5分の1、上位3社では半分近くまで上がり、その後はプランAによる分散に伴って低下する(上位1社は2035年に約10%、2040年に5%、上位3社は約25%、その後13%)。 この予測のより確かな根拠付けは今後の課題である。 当初は、協定後に均等化するアルゴリズムIP、データセット、利用者、ブランド・人材の定着などの非アルゴリズムIP・資本、さらに広義の資本を組み合わせて、AI計算資源に対する市場支配力と支払意思額を表し、その推移から計算資源配分を求めるモデルを作ろうとした。 しかし複雑で、時間内に完成できなかった。

その後、各企業はハードキャップの貪欲フィルによって所有権地域 (米国、中国、その他の地域)に割り当てられるため、地域の合計は2029年まで毎年、§1.3の所有権分割と正確に一致し、その後、キャップアンドトレード取引の割り当てに向けて収束するプランAの所有権分割と一致する。リージョンごとのサイズの偏りのみがシフトするどの表すのは地域内企業への配分で、地域全体の持分ではない:米国は中立的な配分ながら最大手を抱え、中国は2030年まで分散した後、2031年に国策中核へ集約して最大手が国内computeの約半分とfrontier developerを得るが、2040年へ向け再び分散し、Rest of Worldはさらに平坦化するため、その総持分が米国を上回った後も、世界最大の単独developerは米国に残る

2030年までの協定期間は、世界の最終利用者上位3社をフロンティア集合とする(米国の主要開発企業名を、年ごとに手作業で設定した順位で示す)。 2031年以降は企業名を外し、世界最大の最終利用者の4x以内にある最終利用者をフロンティアと呼ぶ。

パラメータ役割
世界中のエンドユーザーの世界 (NN)200ランクサイズ法の会社数
トップ1のエンドユーザーシェア (2026 / 2029 / 2035 / 2040)8% / 20% / 10% / 5%ハンドセット。 (σ,τ)(\sigma,\tau) 一致するように解決
トップ3のエンドユーザーシェア (2026 / 2029 / 2035 / 2040)23% / 45% / 25% / 13%トップ1とは独立したハンドセット
§1.3 2040年における所有権の分割 (米国 / CH / RoW)35% / 20% / 45%地域の合計は毎年正確に一致する
中国サイズの偏り横ばい、その後2031年に +5、2039年までに +2に緩和早めに解散、 2031年に統合、 2040年までに平坦化
その他の世界のサイズの偏り−0.6、2039年までに−2.5終わりに向かって横ばいになるため、米国が最大の開発者を維持する
フロンティアルールトップ3 (≤2030) / 4x以内 (≥2031)ディール時代はトップ3を指名、後は最大値の 4x以内

2.4計算の割り当て

このセクションでは、プランAにおけるフロンティアAI計算資源の割り当てを予測する。2025年にOpenAIが支出した費用計算の約半分は推論に基づいているそしてもっと似たような2024年の推論で3分の1残りは学習と実験に使われ、そのうち最終的なフロンティア学習実行に使われるのは約10%にすぎない。この現在の配分を2029年の協定までは単純に延長し、その後はプランAを条件として各配分比率を予測する。

プランAにおけるフロンティアAI計算資源の配分
公共展開内部推論トレーニング実験安全性オフライン/移行
0%25%50%75%100%2029年協定公共の導入実験トレーニング安全性20262028203020322034203620382040

2.5 AIのコピーと速度

この節では、フロンティアモデルを同時に何コピー実行できるか、また毎秒何トークンで動かせるかを予測する。どちらも不完全な指標であり、将来は足場やアーキテクチャが変わって「コピー」の数え方自体が曖昧になりうるが、ここでは提供中のモデル重みの並列インスタンスを一つと数え、コピー数=レプリカ数×バッチ数とする。速度も完全な指標ではなく、本当に重視したいのはタスク完了速度だろうが、ここではデコード時の毎秒トークン数だけを見るため、思考連鎖がneuraleseへ置き換わるなど、将来の方式変更によってトークン数による速度比較が成り立たなくなる可能性もある。

先に断っておくと、以下は具体的な最善推定であり、実際の不確実性は何桁にも及ぶと考える。AIの方式、すなわちアーキテクチャ、スパース性、エージェントの足場、「コピー」という枠組み自体の妥当性も、ハードウェアの方式、すなわちチップのメモリと帯域幅の配分、推論専用シリコンの比率も、2040年までに何度か変わりうる。方法そのものは単純なので率直に記すと、フロンティアモデルの大きさと世界の計算資源のうち推論へ回る比率を推定し、推論用設備の総メモリを各コピーに必要なバイト数で割ってコピー数を求め、メモリ帯域幅が各トークンに必要なバイト列を読み取る速さから実行速度を求める。以下では、それぞれの推定方法を説明する。

モデルのサイズ。前のセクションで得た世界的な計算資源の増加と、大手企業の集中 (§2.3)およびトレーニングの割り当て (§2.4)を組み合わせて、時間の経過とともにフロンティアのトレーニング計算資源を実現する (2029年までに現在の約32x、2040年までに160,000x)。次に、これらの計算数値とスパース性予測を、単純なモデルを使用してモデルサイズ (合計パラメーター)にマッピングする。

P=P2026(CC2026)α(σσ2026)βP \,=\, P_{2026}\left(\tfrac{C}{C_{2026}}\right)^{\alpha}\left(\tfrac{\sigma}{\sigma_{2026}}\right)^{\beta}

どこでPPは合計パラメータ (P202610P_{2026} \approx 10T、今日のレベル)、CCはフロンティアトレーニング計算資源であり、σ\sigma疎性である。指数の計算α\alphaスケールアップを計算するためのモデルサイズのスケールアップの感度であり、単純なチンチラの最適性は ~0.5 を意味するが、不確実性は大きくある。たとえば、データの可用性などにより、増加する可能性がある理由がある(式を次のように当てはめると)ネソフさんの独自の計算資源およびスパース性の数値が与えるα0.8\alpha \approx 0.8)、またはたとえば、ウェイトを盗むのを難しくすることによる意図的なアンダートレーニング。また、サーブのオーバートレーニングなど、減少する可能性がある理由もある (サルダナとフランクル)、強化学習、その他パラダイム変化に関する未知の未知の領域。私たちはただ仮定するだけであるα=0.5\alpha = 0.5そして描くα[0.2,0.8]\alpha \in [0.2, 0.8]妥当な範囲であると考えられる範囲を図上の範囲として示す。スパース性指数β=0.74\beta = 0.74暫定的により適切に固定される (ただし、スパース性MoEパラダイムは変わる可能性がある)。

速度とコピーに大きな影響を与える可能性があるため、スパース性の仮定を含めることは価値があると考えている。

フロンティアモデルの規模、2022〜2040年
報告値本予測(α=0.5)α ∈ [0.2, 0.8]Nesov
1101001k10k100k100万2022202620292032203520382040兆パラメータ2026年のアンカー2029年協定GPT-4 ~1.8Tα=0.8α=0.2~650T (ネソフ)31,000T~158T
A案のモデルサイズ予測

合計 = 10T × (計算量の増加)α × (疎性の増加)β, with α = 0.5およびβ = 0.74

10T × 計算資源α× まばらさβ= 私たちのもの (合計)α ∈ [0.2, 0.8]Nesov
202610T係数1.0×(8x)10T10Tから10T10T
202720T係数1.7×(16x)33T22T~49T30T
202835T係数2.8×(32x)97T46T~205T240T
202957T係数2.8×(32x)158T56T~449T650T
203083Tx3.1 (37x)255T72T~904T
2032229T係数3.8×(48x)862T132T~5,638T
20351,411T係数4.7×(64x)6,576T337T ~ 128,155T
20403,992T係数7.8×(128x)31,063T854T ~ 1,129,715T
ネソフの数字との違い

ネソフが650Tを取得する方法:どちらもネソフのもの予測一方、私たちの推定は学習計算資源量から出発し、主な違いは、Nesovの2029年のフロンティア学習実行が次の値で2x大きいことである。8e28 FLOP仮定して30xのスパース性。 30xのスパーシティ計算資源の最適な比率は次のとおりである。アクティブなパラメータごとに240トークン(ある人からスパースMoEスケーリングペーパー)したがって、8e28 FLOPは必要になる7.4Tアクティブパラメータ~1,800Tトークンで。しかし、彼は一意のデータのトークンが約200Tしか存在しないと想定している。8.5xの不足、彼はこれで分割したデータに制約されたスケーリング結果大まかに取得する 8.50.58.5^{0.5} \approx アクティブなパラメーターが2.9x増加(7.4T→22T)と2.9エポック回の反復に相当する。 Nesovと同じ低データ領域の補正は行わず、強化学習の増加、学習パラダイムの変化、合成データ生成など、逆方向に作用する要因もあると考えるためである。 両方向の要因に大きな不確実性があるため、単純な基準値を用いる。

ネスフ氏のモデルサイズ予測

から「2023~2031年のモデルサイズスケーリング」

事前トレーニング計算 (FLOP)スパーシティアクティブなパラメータ合計パラメータデータ不足Epoch
20261.3e27係数8x1.3T10T1
20276e27係数8x2.9T30T係数1.75x1.3
20282e28係数30x7.9T240T係数4.5x2.1
20298e28係数30x22T650T係数8.5x2.9
20301e29係数30x26T790T10倍3.1
20312.2e29係数30x48T1,400T係数15x3.9

推論計算フリート。私たちは世界の計算資源 (パブリック + 内部)の§2.4推論シェアを取得し、H100eあたりのメモリと帯域幅の比率 (§1.1)を2029年以降も一定に保つ。 この計算資源を通常の汎用チップと推論専用チップに分割し、ハンドセットシナリオについては以下で説明する。

チップタイプ別の推論メモリ
汎用推論に特化した

チップタイプごとにメモリを提供する (エクサバイト、ログ)。専用メモリは需要 (レプリカの重み + コピーあたりのKV)から導き出される: 2040年までに~2.3 ZBに対して、汎用は~10 ZB。

0.11101001k10k202620282030203220342036203820402029年協定10ZB2ZB
フロンティアモデルのコピー
すべてのコピー

同時に提供されたフロンティアコピー (レプリカxバッチ)、2026 ~ 2040 (ログ)。

1,000万1億10億202620282030203220342036203820402029年協定3,030万2,900万1.86億

コピー。推論フリートの合計メモリを各コピーにかかるバイト数で割ることにより、コピーを取得する。各コピーには、モデル重みのシェア (重みの完全なセットは現在4ビットで約5 TB、中央モデルサイズでは2040年までに約15 PBで、同じバッチで提供されるコピー間で共有される)と独自のコンテキストが必要である。本文ではバッチサイズとKVキャッシュをモデル化するのではなく、それらの複合効果についてのみ述べる、コンテキストが今日の汎用推論メモリの約半分を占め、2040年までに約5%に低下すると仮定し、これは、重みが各コピーのコンテキストよりもはるかに速く増加するためである (詳細はメソッドボックスにあり、バッチの仮定はコンテキストの長さの仮定とトレードオフするだけであり、任意である)。これにより、今日では約3,000万部が発行される。スパース性の上昇によってモデルが推論フリートよりも速く成長するため、最初は数がわずかに減少し、最終的には2040年までに非常に大まかに2億に達し、ほとんどのコピーは汎用ハードウェア上にあり、残りは後述する推論専用チップ上のはるかに高速なコピーになる。

重みとコンテキストの仮定
平均コンテキストKV / コピーコンテキスト/レプリカウェイト/レプリカコンテキスト共有
2026200k20GB5.1TB5.0TB51%
2029341k68GB17.4TB79.2TB18%
2032580k220GB56.3TB430.9TB12%
2035988k896GB229.3TB3.3PB7%
2040240万3.3TB856.1TB15.5PB5%
コピー数とスピードモデルの概要

マイルストーンとなる年におけるモデルのサイズ、コピー数、および速度 (プランA)。

モデル (合計/アクティブ)コピー (gen/inf)すべてのコピー速度 (gen/inf)平均速度合計tok/s (gen/inf)
202610T/1.3T30.3M / 8k3,030万~57 / ~1.0k~571.7B / 7.9M
202897T / 3.0T23.4M / 60k2,350万~65 / ~1.3k~681.5B / 78.6M
2029158T / 4.9T28.9M / 123k2,900万~67 / ~1.5k~731.9B / 185M
2032862T/18T63.1M / 1.6M6,460万~89 / ~3.0k~1615.6B / 4.7B
20356,576T / 103T154M / 21.7M1.76億~119 / ~6.0k~84418B / 130B
204031,063T / 243T150M / 36.2M1.86億~192 / ~25.0k~5.0k29B / 904B
フロンティアコピーの速度
推論に特化した汎用平均的な

チップタイプ別のコピーごとのデコード速度 (トークン/秒、ログ)。

101001k10k20262028203020322034203620382040人間の作業ペース (~10 トーク/秒)~25.0k平均〜5.0k~192

スピード。速度については、メモリ帯域幅に注目する。汎用ハードウェアでは、各デコードステップでバッチ内のすべてのコピーの重みとコンテキストを読み取る必要があるため、各コピーが1秒あたりに取得するトークンの数は、ハードウェアが独自のメモリを通じて1秒あたり何回読み取ることができるかに相当する。推論フリートのメモリ帯域幅はメモリ容量の約31xで、約2xの投機的デコード利得と約90%の使用率の後、1秒あたり約31回のフルリードスルー、またはコピーあたり約57トーク/秒を実現する。都合の良いことに、メモリフットプリントが大きくなるとそれに比例してメモリ帯域幅も増えるため、この推測はバッチ、コンテキスト、モデルサイズ、またはスパース性に依存しない。その後、速度は、H100eあたりの帯域幅がH100eあたりのメモリ容量を上回る速度でしか増加しなく、これは、2029年以降は年間約10%で発生し、2040年までに約190 tok/sに達すると想定される。

推論に特化したチップ。最大のワイルドカードは、特定のモデルの提供に特化したチップで、重みはオンチップSRAMに保持される (例:大脳グロク)、Transformerアーキテクチャ自体をシリコンに焼き込む方式(Etched)、重みをダイに直接焼き込む方式(Taalas各段階は推定であり、専用チップの新規computeシェアを2026年0.2%、協定時1%、2040年14%(推論装置群の約半分)と置き、1コピーの速度を現在~1,000 tok/s(CerebrasがLlama-405Bで測定した969 tok/s)から、2035年の停止後にfrontier modelが固定される2040年の~25,000 tok/sまでと仮定する。1コピーを速くするほどコピー数を失う(copies = total token throughput / speed of each copy)ため追加コピーは少ないが、この仮定では2040年にほぼ全tokenを生成し、平均速度を現在の~100 tok/sから約5,000 tok/sへ引き上げ、上図の速度向上の大半を占める。専用チップが普及しなければ、平均速度は汎用チップの~190 tok/s付近にとどまる。下表は推論装置群の各部分が実際に使うcomputeとbandwidthを示す。

チップタイプごとに各リソースの使用状況をデコードする

各チップタイプの帯域幅とデコードが使用する計算資源のシェア、バインディング (上限の下限) リソースはスループットを設定する。

世代: 帯域幅世代: 計算資源Inf-spec: 帯域幅Inf-spec: 計算資源
202690% (結合)9.4%90% (結合)18%
202990% (結合)3.3%90% (結合)21%
203290% (結合)3.2%90% (結合)40%
203590% (結合)3.3%73%90% (結合)
204090% (結合)2.7%23%90% (結合)
AIコピーの手法と速度

フロンティアモデルには、PP合計とPa=P/σP_a = P/\sigmaスパース時のアクティブパラメータσ\sigma、4ビットで提供される (b=0.5b = 0.5 bytes/param)なので、1つのレプリカが保持される。W=bPW = bP重みのバイト数と各トークンのコスト2Pa2P_aFLOP(読み取り値)bPabP_aバイト)。

モデルのサイズ。 P=P2026(C/C2026)α(σ/σ2026)βP = P_{2026}\,(C/C_{2026})^{\alpha}\,(\sigma/\sigma_{2026})^{\beta}P2026=10P_{2026} = 10Tさんα=0.5  [0.2,0.8]\alpha = 0.5\;[0.2, 0.8]β=0.74\beta = 0.74そしてC=s1M世界τC = s_1\,M_\text{world}\,\tau先頭企業の学習計算資源量(top-1 share §2.3 x world stock x training allocation §2.4)。中央値は2029年に~158T、2040年に~31,000T。

コピー。推論フリートは、§2.4推論シェアである。δ\delta推論に特化した部分を含む世界のストック (H100eあたりのメモリと帯域幅は§1.1から、2029年以降は横ばい)ff手作業で設定した新規計算資源の配分から積み上げる(専用チップは推論処理だけを担うため、その保有量すべてがサービスに使われる)。汎用部分はメモリ容量に応じてコピーを稼働させ、1コピーはモデルの重み分を占有する。WWプラスKVキャッシュccそれぞれのBB同時コピー。代わりに、特殊なチップが、選択した速度でトークンスループットがサポートするのと同じ数のコピーを提供する。vスペックv_\text{spec}ここでスループットは使用率であるuu計算資源制限の小さい方の係数 (FスペックF_\text{spec})とその重み読み取り帯域幅制限 (Λスペック\Lambda_\text{spec});メモリは一致するサイズに設定され、バインドされることはない。それで、

コピー=δM(1f)W+BcB  +  umin!(Fスペック/2,  Λスペック/b)Pavスペック.\text{copies} = \frac{\delta M (1-f)}{W + B\,c}\,B \;+\; \frac{u\,\min!\big(F_\text{spec}/2,\; \Lambda_\text{spec}/b\big)}{P_a\, v_\text{spec}} .

スピード。ρ(t)\rho(t)推論フリートの帯域幅:容量比率 (メモリ全体を1秒あたり何回読み取ることができるか)、

速度GP=uρ(t)κ,速度スペック=vスペック(t).\text{speed}_\text{gp} = u\,\rho(t)\,\kappa, \qquad \text{speed}_\text{spec} = v_\text{spec}(t) .

汎用ハードウェアでは、バッチ化されたデコードステップは同じフットプリントを読み取る (W+BcW + Bc)レプリカが所有する帯域幅 (ρ(W+Bc)\rho(W + Bc))、バッチとコンテキストがキャンセルされ、デコードのみが得られる。κ\kappa使用率の係数uuのままであり、推論処理が大規模バッチでスループット最適となる動作点を維持することを前提としている。スパース化はトークン当たりのバイト数とFLOPを減らすが層数は減らさないため、実効速度そのものは変えず、その効果はモデルサイズと専用チップのトークン当たり計算量に反映される。見出しの平均速度はコピー数で加重している。

すべての入力は、それが属する推測順に並べられる (モデルサイズ、推論フリート、コピー、速度)。

パラメータメモ
2026年のアンカー合計パラメータ10T、8xスパース今日のフロンティア
指数を計算する (α\alpha)0.5、バンド[0.2、0.8]データの壁が押し上げる (ネソフの数字は適合する) α0.8\alpha \approx 0.8);オーバートレーニング、RL、蒸留プッシュダウン
スパース性指数 (β\beta)0.74アクティブなパラメータごとの最適なトークンの増加~σ0.53\sigma^{0.53}
スパース性 (σ\sigma)係数8x → 32x@2028 → 128x@2040ハンドセット
推論シェア (δ\delta)~50%協定前、77% @ 2030、25% @ 2040§2.4より (パブリック + 内部)
新しい計算資源の特殊なシェア (ff)0.2% (2026) → 1% (2029) → 14% (2040)ハンドセット、 ~2040年までに推論フリートの計算資源の半分
H100eあたりの帯域幅2029年以降 +10%/年、容量は横ばい読み取り率を与える ρ\rho: ~31/s (2026) → ~107/s (2040)
仕様帯域幅 (Λスペック\Lambda_\text{spec})60x HBM (2026) → ~500x (2040)Groq/Cerebrasを約 60 ~ 80x測定、帯域幅は ~2034 までバインドされ、その後計算される
サービング精度とFLOP/秒4ビット (0.5 B/パラメータ)、H100eあたり4e15 FLOP/秒2026年にはレプリカあたりの重みは約5 TBになる
バッチ (BB)レプリカあたり256の同時コピー平らに保つ、コンテキストの仮定とのトレードオフ
コピーあたりのKV (cc)~20 GB (2026) → ~3.3 TB (2040)~200k → ~240万のコンテキストトークン; 2040年までにメモリの約 5%のコンテキストを残す
デコードゲイン (κ\kappa)~2投機的/マルチトークンのデコード
使用率 (uu)0.9各チップカテゴリの結合制限
スペック速度(vスペックv_\text{spec})1,000 / 1,500 / 3,000 / 6,000 / 15,000 / 25,000トーク/秒(2026/29/32/35/38/40)ハンドセット、オンチップのワイヤ遅延フロアに向けて

付録: 実効H100eモデル

A.1目標

一般的なH100 GPUクラスターと比較して、特定のクラスターがAIワークロードにとってどの程度役立つかを推定する方法が必要である。

生のH100相当の比較は、ピーク計算資源のみを測定するため、適切な代用とは言えなく、また、実際のAIワークロードの場合、クラスターは、他のハードウェア要因、特にメモリ帯域幅、メモリ容量、スケールアップネットワーク、スケールアウトネットワーク、一般的なワークロードにまたがる必要がある物理チップの数に応じて、多かれ少なかれ大幅に役立つ可能性がある。出力は

実効H100e  =  生のH100e×有用性の調整,\text{effective H100e} \;=\; \text{raw H100e} \times \text{usefulness adjustment},

ここで、クラスターが考慮されているH100クラスターアンカーよりも生のH100eあたりの有用性が高い場合、有用性調整は1より大きく、それより悪い場合は1より小さくなる。有用性調整の主な設計目標は次のとおりである。

  1. H100アンカークラスターは、生のH100eと同等の実効H100eを持つ必要がある。

  2. 他のすべてを一定に保ち、より多くのメモリ帯域幅、メモリ容量、スケールアップネットワーク、スケールアウトネットワーク、またはスケールアップワールドサイズが役立つはずである。これは、個々の指標 (他のすべてが等しい)でN係数の改善が必要であることを意味する。\geq有用性調整1x。

  3. 同等の合計ハードウェアパフォーマンスを備えたクラスターでも、より小さなデバイスに分散すると、より悪くなる可能性がある。固定ワークロードサイズでは、より多くのチップに分散する必要があり、通信オーバーヘッドが増加するためであり、これは、数量をN増加加させてチップごとのすべてのメトリクスをN係数削減する (したがってクラスターの合計は同じになる)必要があることを意味する。\leq有用性調整1x。

  4. ボトルネックはハードではなくソフトである必要があり、リソースは相互にトレードオフする必要があり、これは、AIワークロードでは、さまざまなリソースをトレードオフするために並列処理やその他のソフトウェアレベルの選択などを再調整することが可能になる傾向があるためである。

A.2入力

入力はチップとクラスターのプロパティであり、次のように表記される。

  • CC: チップごとの計算 (H100e)。

  • BB: チップごとのメモリ帯域幅。

  • MM: チップあたりのメモリ容量。

  • SUSU: 特定のワールドサイズ (ラック内のNVLinkなど)内のチップごとのスケールアップ帯域幅。

  • SOSO: スケールアップ世界の外側、クラスタ全体の内側のチップごとのスケールアウト帯域幅。

  • WW: スケールアップワールドサイズ、インチチップ(スケールアップドメインのGPU数、例: NVL72 =72= 72).

  • NN: クラスター内のチップの数。

私たちのモデルはワークロードに依存する。つまり、(計算資源フットプリントにおける)ワークロードサイズが考慮され、単一の平均ワークロードを考慮するのではなく、ジョブサイズの広がりを使用し、それぞれを分数にする。LjL_jフロンティアスケール FF、これはフロンティア企業の総計算資源を表すものとされており、ジョブ数の重み付けが行われる。ωj\omega_j(jωj=1\sum_j \omega_j = 1)以下のように、分数で表するLjL_jフロンティアスケールの:

仕事分数 LjL_j /全 FF重量 ωj\omega_j
小さい(推論、実験)1/10,0001/10{,}0000.50
中 (大規模な実験、テストの実行)1/1001/1000.30
大規模(辺境に近い訓練)1/51/50.20

重要なことは、LjL_jの一部である生のH100e計算資源物理的なチップ数ではない。

A.3アンカーシナリオ

raw=Effectiveのアンカーとして2024スタイルのH100-SXMクラスターを使用する。

アンカー (生 = 有効)
チップあたり生のH100e C0C_01
メモリ帯域幅 B0B_03.35TB/秒
メモリ容量 M0M_080 GB
スケールアップ帯域幅 SU0SU_00.9TB/秒
スケールアウト帯域幅 SO0SO_00.05TB/秒
スケールアップした世界 W0W_08チップ(HGX-8)
クラスターサイズ N0N_010万チップ

それとは別に、我々が考えるフロンティアスケールは、FF時間に依存する。私たちはこれを、世界の総計算資源に占める割合の増加としてモデル化している (フロンティアAI企業が世界の計算資源に占める割合の増加を反映している)が、約6% (2025.0)から9 / 13 / 16 / 18% (2026.0 ~ 2029.0)に上昇しているため、ワークロードの絶対サイズは年々増加し、世界規模のロードマップに沿ってスケールアウトの圧力も高まっている。構造上、アンカーは有効なH100eを出力する必要がある。=Ccluster= C_{\rm cluster}つまり有用性の調整=1= 1(§A.9で検証)。

A.4ワークロードのフットプリント

バケットごとにjj、生のワークロードサイズ (必要な計算資源)は次のとおりである。

Cjob,j=LjF.C_{{\rm job},j} = L_j\,F.

ワークロードに必要な物理チップの数は、ハードウェアが許す限り薄く分散することを前提としている。ジョブの計算資源をチップごとの計算資源で割るCCメモリが空いている場合に必要なカウントを与え、次に次の値でインフレートする。(M0/M)δ(M_0/M)^{\delta}ジョブの重みとアクティベーションのより小さなスライスを保持するメモリの少ないチップを考慮するためである。ただし、私たちはメモリを絶対的な制約とは扱わない: 指数δ<1\delta < 1容量は、活性値の再計算、オフロード、細粒度シャーディングによって一部を補えるため、チップのメモリを半減させても、必要なチップ数が必ずしも二倍になるわけではなく、やや増えるにとどまる。

nreq,j=Cjob,jC(M0M)δ,n_{{\rm req},j} = \frac{C_{{\rm job},j}}{C}\left(\frac{M_0}{M}\right)^{\delta},

どこでδ[0,1]\delta \in [0,1]は、上で説明したメモリフットプリントの弾力性である (δ=0\delta = 0: 容量はチップ数を変更しない。δ=1\delta = 1: 設置面積は容量に反比例し、私たちは仮定するδ=0.5\delta = 0.5デフォルトで)。

これを私たちはこう呼んでいる通信フットプリント nj=nreq,jn_j = n_{{\rm req},j}なぜなら、それが以下のペナルティにおけるクロスチップトラフィックを促進するものだからである。ジョブがより多くのチップに塗りつぶされるほど、より多くのチップ間で通信する必要がある (§A.5)、ワークロードが単一のチップに収まるエッジケースでは、それを1つにフロアする。どちらの弱点も重なり、フットプリントが大きくなる、計算資源能力が低いチップは、ジョブを実行するためにより多くのコピーが必要で、メモリが少ないチップは、状態を保持するためにより多くのコピーが必要であり、そのため、どちらかの軸でチップが弱いと、同じワークロードがより多くのチップに分散され、より多くの通信コストがかかりる。

これらすべてを、同じジョブ: 参照フットプリントはn0,j=Cjob,j/C0n_{0,j} = C_{{\rm job},j}/C_0、アンカーは次のとおりであるため、記憶用語はない。M=M0M = M_0

A.5スケールアップトラフィックとスケールアウトトラフィック

ここで、ワークロードの通信の割合を推定する (pSUp_{\rm SU})は、高速スケールアップの世界にとどまることができる。ワークロードのチップフットプリントの比較njn_j(§A.4より)ワールドサイズへWWとする

pSU(n,W)={1,n1min!(1,  W1n1),n>1,pSO=1pSU.p_{\rm SU}(n, W) = \begin{cases} 1, & n \le 1 \\[2pt] \min!\left(1,\; \dfrac{W-1}{n-1}\right), & n > 1, \end{cases} \qquad p_{\rm SO} = 1 - p_{\rm SU}.

フットプリントがスケールアップワールド内に収まる場合 (njWn_j \le W)、その後pSU=1p_{\rm SU} = 1;それが大きい場合でも、全対全スタイルのコミュニケーションのうち、インワールドで行われるのはほんの一部だけである。スケールアップの世界を持たないチップでは (W=1W=1)、1チップを超えるワークロードは純粋なスケールアウトである。これは、AIワークロードのトラフィックの大まかな概算である。

A.6リソースペナルティ

モデルはリソースペナルティを計算し、アンカーが1になるようにそれぞれ正規化する。

6.1メモリ帯域幅ペナルティ。

τB=C/C0B/B0.\tau_B = \frac{C/C_0}{B/B_0}.

チップあたりの計算資源がチップあたりのメモリ帯域幅を上回る場合 (両方ともアンカーに対して)、チップは帯域幅のボトルネックになる (τB>1\tau_B > 1)。帯域幅が計算資源よりも速く増加するとしても、それほどではない (τB<1\tau_B < 1).

6.2ネットワークペナルティ。これは、クラスターと同じジョブのアンカーがどの程度通信に束縛されているかを測定する。チップの計算資源能力が高い場合 (1秒あたりに実行される作業が増えると、供給を維持するためにより多くのデータ交換が必要になる)、およびそのジョブがより多くのチップにまたがる場合、通信のボトルネックは高くなる、これらをネットワークの速度と比較して重み付けする。

各クラスターの実効逆帯域幅から始める。RR(移動するデータ単位あたりの通信時間なので、高いほど悪くなる)。 §A.5より、pSUp_{\rm SU}はスケールアップワールド内のトラフィックの割合であり、1pSU1 - p_{\rm SU}スケールアウト中なので、RRトラフィックの行き先によって2つのファブリックをブレンドする。アンカーの場合:

p0,j=pSU(n0,j,W0),R0,j=p0,jSU0+1p0,jSO0,p_{0,j} = p_{\rm SU}(n_{0,j}, W_0), \qquad R_{0,j} = \frac{p_{0,j}}{SU_0} + \frac{1-p_{0,j}}{SO_0},

独自のフットプリント、ワールド、帯域幅を持つ候補クラスターについても同様である。

Rj=pSU(nj,W)SU+1pSU(nj,W)SO.R_j = \frac{p_{\rm SU}(n_j, W)}{SU} + \frac{1-p_{\rm SU}(n_j, W)}{SO}.

通信ペナルティを3つの要素の積としてモデル化し、それぞれはアンカーに対して測定される: ジョブがどれだけのチップにまたがる必要があるか (njn_j)、各チップが作業を完了する速度 (CC)、およびクラスター上での通信コスト (RjR_j通信時間は移動されるデータ量とその移動コストの積であるため、この速度は増加し、そのため、一度に複数の軸で悪化するとさらに悪化する。弾力性ありγ=0.15\gamma = 0.15スパン上:

τN,j=(njn0,j)γ(CC0)RjR0,j.\tau_{N,j} = \left(\frac{n_j}{n_{0,j}}\right)^{\gamma}\left(\frac{C}{C_0}\right)\frac{R_j}{R_{0,j}}.

計算速度 (C/C0C/C_0)と通信費(Rj/R0,jR_j/R_{0,j})入力すること直線的に: 2xの速さで作業を完了するチップは2xの速さで交換するデータを生成し、バイトあたりのコストが2x高いリンクでは2xの時間がかかるため、通信時間に直線的な圧力をかけるものとしてそれぞれをモデル化する。スパンが入りるサブリニアに(γ<1\gamma < 1)チップ数が2xになっても、各チップが動かすデータ量は2xにはならないためである。たとえばリング型all-reduceでは、ジョブを100基で実行しても100,000基で実行しても、各チップが動かすデータ量は一定で、モデルサイズ二つ分ほどとなり、チップ当たりのチャンクが、ステップ数の増加と同じ速さで縮むからである。ただし、同期ラウンドやツリーホップなどの調整ステップ数はチップ数とともに増えるものの、その増え方は緩やかであり、そこで全体は次の式でモデル化する。0.150.15指数。

A.7ボトルネックの結合

上記の2つのペナルティを計算資源のボトルネックと組み合わせ、重要度の割合で重み付けする。αC+αB+αN=1\alpha_C + \alpha_B + \alpha_N = 1計算資源にはペナルティはない (ペナルティは計算資源対リソースの比率であるため、定義上1であるが、計算資源自体の場合、その比率はちょうど1である)C/C=1C/C = 1)だから、αC\alpha_Cは計算律速としてモデル化する作業の比率であり、αB\alpha_BαN\alpha_Nはそれぞれメモリ帯域幅とネットワークのペナルティに割り当てる比率である。各資源が部分的に相互補完できるよう、厳密な最小値ではなくべき平均を使い、デフォルトはq=1.5q = 1.5:

Dj=(αC+αBτBq+αNτN,jq)1/q,D_j = \left(\alpha_C + \alpha_B\,\tau_B^{\,q} + \alpha_N\,\tau_{N,j}^{\,q}\right)^{1/q},

どこでDjD_jH100アンカーと比較した速度の低下である。 (q=1q = 1は単純なアムダール形式の加重平均である。q=1.5q = 1.5デフォルトでは、大きなボトルネックがより激しく食い込みる。 CES用語でいうと1.51.5置換の弾力性に対応するσ=1/(1+q)=0.4\sigma = 1/(1+q) = 0.4リソース間)。有用性の調整は、ワークロード全体のペナルティの加重平均である。

U=jωj1Dj,実効H100e=CclusterU.U = \sum_j \omega_j \frac{1}{D_j}, \qquad \text{effective H100e} = C_{\rm cluster}\,U.

A.8完全な方程式

実効H100e=CclusterU\text{effective H100e} = C_{\rm cluster}\, U

有用性の調整UUである

  U=jωj(αC+αB[C/C0B/B0]q+αN[(njn0,j)γCC0RjR0,j]q)1/q  \boxed{\;U = \sum_j \omega_j\left(\alpha_C + \alpha_B\left[\frac{C/C_0}{B/B_0}\right]^{q} + \alpha_N\left[\left(\frac{n_j}{n_{0,j}}\right)^{\gamma}\frac{C}{C_0}\frac{R_j}{R_{0,j}}\right]^{q}\right)^{-1/q}\;}

A.9なぜこれが望ましい特性を満たすのか

プロパティ1: アンカーrawは有効と同等である。アンカーでC=C0, B=B0, M=M0, SU=SU0, SO=SO0, W=W0C = C_0,\ B = B_0,\ M = M_0,\ SU = SU_0,\ SO = SO_0,\ W = W_0nj=n0,jn_j = n_{0,j}、それでτB=1\tau_B = 1τN,j=1\tau_{N,j} = 1。したがって、Dj=(αC+αB+αN)1/q=1D_j = (\alpha_C + \alpha_B + \alpha_N)^{1/q} = 1効果的なH100e=Ccluster= C_{\rm cluster}まさに。

特性2: より多くのリソースが役立ちる。増加中BB下げるτB\tau_B。増加中MM設置面積を減らするnjn_jしたがって。τN,j\tau_{N,j}増加中SUSUまたはSOSO下げるRjR_j。増加中WW上げるpSUp_{\rm SU}、トラフィックを低速スケールアウトから高速スケールアップに移行する (これは、SU>SOSU > SO);効果は一度飽和するWCjobW \ge C_{\rm job}つまり、ワークロードがすでにスケールアップの世界に収まった後である。それぞれ実効H100eが上昇する。

特性3: 総計算資源は同じで、チップは小さくなる。アンカークラスターをチップから再構築する。k×k\timesチップごとのすべてのメトリクスでは弱いであるが、k×k\timesより多くの数があるため、クラスターの合計は変わりない。C=C0/k, B=B0/k, M=M0/k, SU=SU0/k, SO=SO0/kC' = C_0/k,\ B' = B_0/k,\ M' = M_0/k,\ SU' = SU_0/k,\ SO' = SO_0/kk×k\timesチップ数と同じワークロードCjob,jC_{{\rm job},j}

H100eのグロス合計は同じだが、各ジョブをより多くのチップにまたがって実行する必要があるため、有効度は1を下回る。チップ単位の2つの低下要因が重なるため、必要な機器規模は線形を超えて増大し、計算性能が低いと、各チップが担えるのはわずか1/k1/k仕事の、必要なk×k\timesチップの数が増え、メモリが小さくなるとさらにその額が膨らみる。kδk^{\delta}(記憶弾性によりδ\delta)、チップ数は によって増加する。k1+δk^{1+\delta}であり、kkを上回るのはδ>0\delta > 0:

njn0,j=C0C(M0M)δ=kkδ=k1+δ\frac{n'_j}{n_{0,j}} = \frac{C_0}{C'}\left(\frac{M_0}{M'}\right)^{\delta} = k \cdot k^{\delta} = k^{1+\delta}

帯域幅のバランスは変化せず、τN,j\tau_{N,j}チップごとの計算と逆ネットワークキャンセル (チップごとの計算が小さくなると、対応して遅いネットワークによって相殺される)となり、フットプリントの項のみが残りる。

\tau'_B = \frac{C'/C_0}{B'/B_0} = \frac{1/k}{1/k} = 1, \qquad \tau'_{N,j} = \left(\frac{n_'j}{n_{0,j}}\right)^{\gamma}\frac{C'}{C_0}\frac{R'_j}{R_{0,j}} \;\gtrsim\; \big(k^{1+\delta}\big)^{\gamma}\cdot\underbrace{\frac{1}{k}\cdot k}_{=\,1} \;=\; k^{(1+\delta)\gamma} > 1.

したがって、

Dj(αC+αB+αNk(1+δ)γq)1/q>1,U=jωjDj<1.D'_j \gtrsim \left(\alpha_C + \alpha_B + \alpha_N\,k^{(1+\delta)\gamma q}\right)^{1/q} > 1, \qquad U = \sum_j \frac{\omega_j}{D'_j} < 1.
  同じ合計計算量でも、 k× それぞれより多くのチップ k× 弱い    有用性<1  \boxed{\;\text{same total compute, } k\times \text{ more chips each } k\times \text{ weaker} \;\Rightarrow\; \text{usefulness} < 1\;}

デフォルトのパラメータでは、有用性の調整は次のようになる。

U=1D(k)(αC+αB+αNk(1+δ)γq)1/q=(0.75+0.25k0.3375)2/3,U = \frac{1}{D(k)} \approx \left(\alpha_C + \alpha_B + \alpha_N\,k^{(1+\delta)\gamma q}\right)^{-1/q} = \left(0.75 + 0.25\,k^{0.3375}\right)^{-2/3},

これらの値に対して次の値が得られる。kk:

kk有用性の調整 UUD(k)=1/UD(k) = 1/U
0.1係数1.10x係数0.91x
0.5係数1.04x係数0.96x
2係数0.96x係数1.04x
10係数0.84x係数1.19x
100係数0.64x係数1.55x
1000係数0.45x係数2.23x

弱いチップの場合 (k>1k > 1)ペナルティは生じるものの程度は中くらいで、γ\gammaαN\alpha_Nqqが大きいほど強まり、δ\delta大規模ジョブがスケールアップからスケールアウトへあふれ出す場合にも強まる。一方、k<1k < 1(数は少ないが強力なチップ、例:k=0.1k = 0.1行)逆も成り立ち。U>1U > 1

A.10デフォルトのパラメータと結果

デフォルトのパラメータ (不確実、厳選):

パラメータ役割
αC\alpha_C0.55削減不可能な計算資源依存のシェア
αB\alpha_B0.20メモリ帯域幅に依存した共有
αN\alpha_N0.25ネットワークに依存する共有
qq1.5ボトルネックの鋭さ (1 = アムダール、→∞ = 最大)
δ\delta0.5容量が少ないと設置面積がどれくらい膨らむか
γ\gamma0.15設置面積のサイズが通信圧力をどの程度高めるか

§1.2のフロンティアワークロードサイズとさまざまな計算資源カテゴリの平均リソースプロパティの予測に基づいて、生の計算資源に対する次の有用性の調整が得られる。

生ごとに有効 (UU)2024202620282029
AI1.161.061.041.02
非AIサーバー1.381.401.411.40
パソコン0.350.080.040.03
電話0.210.110.070.05
ゲーム用GPU0.040.050.060.04
別の0.530.430.340.30

注意することUU測定される未処理の計算資源単位あたりこれが非AIサーバーのスコアが最も高い理由であり、CPUサーバーはチップあたりの計算性能こそ小さいが、豊富なメモリ、帯域幅、データセンター間ネットワークを備えるため、その少数のH100eはいずれも周辺資源に非常に恵まれている。AI向け設置済み機器全体は1をわずかに上回る水準から始まり(基準に比べてH100のメモリが豊富なため)、メモリウォールが制約となるにつれて1に近づくが、単体デバイスは計算性能ではなくネットワークがボトルネックになるため、スコアが1を大きく下回る。

モデルを自分で実行することもでき、以下に任意のチップ/クラスター仕様を入力し (またはプリセットから開始し)、その有用性調整と実効H100eを読み取る。

データセンター:
消費者:
チップごとの仕様
仕事量の年2026
結果
有用性U
0.93×
チップあたりの実効H100e
0.93
= 1.00 生× 0.93 有用性
ワークロードのサイズ別
U = 1 (アンカー)0.93×小さなジョブ (1/10,000)重量 50%0.93×中程度のジョブ (1/100)重量 30%0.93×大きなジョブ (1/5)重量 20%
有用性計算ツール - ai-2040.com

選択した年のフロンティア規模に対し、公開パラメータを使って付録A.8のモデルをそのまま実行する。上部のUはジョブ構成による加重平均で、各バーはジョブ規模ごとの値を示すため、どの仕様でペナルティが生じるか分かり、U=1の基準線より上は斜線、下は赤で示す。計算単位はH100e(=TPP / 15,800)で、実際のスケールアップ接続を持たないチップではW=1とする。データセンターのプリセットは補足資料の定義表に従い、消費者向け機器とRubin Ultraは公開仕様に基づく概算で、ネットワークをポートのピーク値ではなく共有Wi-Fiや家庭用Ethernetなど実運用で持続可能な帯域に設定したため、消費者向け機器のUは付録表の約0.05〜0.2まで下がる。また、このモデル特有の逆転も生じ、同じ細い回線の背後に計算資源を増やすほど遊休部分が増えるため、計算資源1単位当たりでは低価格スマートフォンが最上位GPUを上回る。