テイクオフ予測
Brendan Halstead
この補足資料では、プランAのさまざまな局面でAIの能力をどのように予測したかを説明する。私たちはAI Futures Modelに手を加え、次の四つの状況をシミュレートした。
-
能力の進歩を減速させる協定がなかった場合の既定の軌道
-
プランAのコンソーシアムの軌道。制御された形で人間のトップ専門家を凌駕するAI(TED-AI)までスケールし、その後は停止してアラインメント研究を行う
-
秘密プロジェクトが協定から離反し、密かにAGIを構築しようとする場合
-
協定の崩壊後の軌道。協定後に構築された計算資源の大半が破壊され、先頭のプロジェクトが開発競争を再開する
本資料の構成もこれに沿っている。第1節では、プランAのモデルと2025年12月版のAI Futures Modelとの違いを扱う。具体的には、学習実行のモデル化の大きな変更、更新した計算資源の予測、既定パラメータの変更だ。第2節から第4節では、残る三つの状況をシミュレートするために加えたさまざまな拡張を説明する。AI Futures Modelの解説をまだ読んでいない方は、先にこちらを読むことをお勧めする。
中核モデルへの変更
ここでは、このモデルが2025年12月版のAI Futures Modelと異なる三つの点を説明する。これらの変更は、シミュレートしたすべての軌道に共通して適用される。
フロンティアの学習実行の明示的なモデル化
他の多くのAIテイクオフモデルと同じく、AI Futures Model(2025年12月版)は、ある時点の実効学習計算量 を、フロンティアモデルの累積学習計算量 (単位はFLOP)と、その時点のソフトウェア効率の水準 (単位は1FLOPあたりの現在換算FLOP)の積として定義していた。
実際には学習実行には時間がかかる。上の定式化は、すでに使われているモデルの学習実行に、現在のソフトウェア効率がさかのぼって適用されると仮定していることになる。その結果の一つとして、テイクオフの進む速さをやや過大評価する。しかしプランAにとってより重要なのは、このモデルでは、あるAIプロジェクトの学習システム性能(単位はFLOP/年)が、そのプロジェクトが使える最良のモデルを学習させたシステムに比べて急に非常に小さくなる状況を、うまく扱う方法がないことだ(秘密プロジェクトや、協定崩壊後がまさにそうした状況にあたる)。
そこでプランA版では、実効学習計算量を、一つの長い学習実行の一部として連続的に増えていくものとしてモデル化する。その増加率は、学習システム性能 と、既知の学習手法のソフトウェア効率によって決まる。
この増加率を実効学習システム性能と呼び、ETSPと略す。
すべての入力が指数関数的に増えるなら、ETSPと実効計算量も同じ率で指数関数的に増えるので、このモデルは単純なモデルと同じようにふるまう。その他の式はすべて、2025年12月版のAI Futures Modelから変えていない。
計算資源と労働力の時系列の変更
AI Futures Modelは、外部から与える計算資源と労働力の予測に依存している。プランA版では2組の時系列を使う。一つはプランAが実行されなかった場合の既定の世界を表し、もう一つは協定の発効時点で既定の時系列から分岐する。どちらの背後にあるモデル化も、計算資源に関する補足資料で論じている。要約すると次のとおりだ。
-
2029年より前の既定の時系列は、AI Futures Modelのものに比べてやや強気な方向に更新した
-
プランAの時系列は、2030年から2035年にかけてはロボット工学によって可能になる、制御されてはいるが大規模な計算資源の増強を反映し、2035年から2040年にかけては増加が鈍る
一つの限界として、人間の労働力の予測はあまり現実的ではない。AI研究開発が自動化された後は、人間の労働力がモデルの動態に果たす役割はごく小さいので、この部分にはあまり労力をかけなかった。
既定パラメータの変更
シナリオにおけるタイムラインとテイクオフを左右する既定パラメータは、シナリオの筆頭著者であるトーマス・ラーセン(Thomas Larsen)の見解を反映するように設定した。ただし、能力の予測は『AI 2040』の主眼ではなかったため、AI Futures Modelで使われている値ほど検討を重ねたものではない。また、シナリオの物語とモデル化を並行して書き進めるなかで、その場しのぎで調整したこともある。それでも、2026年4月時点のダニエル・ココタイロ(Daniel Kokotajlo)の中央値からのずれはわずかで、著者全員が既定の軌道を十分にありうるものと考えている。以下の表に、ダニエルの中央値から変更した各パラメータを示す。
パラメータ | 変更後の値 | 理由 |
ギャップ年数 | 2025年時点の実効FLOP成長で1.1年分 | 2030年1月にACのマイルストーンに到達するように設定。 |
ACに必要なタイムホライズン(ギャップ前) | 10作業年 | |
中央値からトップへの研究センスの倍率 | 5.28倍 | ACのおよそ1年後にASIに到達しつつ、ACとTED-AIの間に実効計算量で約3桁(3 OOM)の差を残すように設定。 |
AIの研究センスの傾き | 2025年時点の実効FLOP成長1年分あたり3.5 SD | |
TED-AIに到達するのに必要な、SARを超える「中央値からトップの人間まで」の跳躍の回数 | 1.5 |
コンソーシアムの軌道のモデル化
コンソーシアムは、私たちがモデル化する他のすべての主体と違い、より優れたAIをできるかぎり速く構築しようと競争しているわけではない。具体的な戦略は「能力スケーリング戦略」の補足資料で詳しく論じているが、大まかに言えば、「人間のトップ専門家を凌駕するAI」(TED-AI)まで滑らかにスケールし、その後は一時停止してアラインメント研究を行い、最終的にAIへ制御を引き渡す、という戦略だ。
ここでは、二つの軸に沿って変化する戦略を考える。
-
協定の開始からどれだけ経った時点で、コンソーシアムが「人間のトップ専門家を凌駕するAI」(TED-AI)への到達を目指すか
-
TED-AIに到達した時点で、コンソーシアムがどれだけの安全税を払っていることを目指すか
安全税とは、コンソーシアムの実際のAIの能力水準と、コンソーシアムが学習させることのできた最良のAIの能力水準との差をいう。後者は、学習計算資源をすべて使い、能力向上のための学習に既知の最良のアルゴリズムを用いた場合のAIだ。「安全税を払う」例としては、ニューラリーズ(neuralese)による学習を発見し、それがはるかに効率的だと分かっても、制御を容易にするためにあえて使わないと決める、といったことが挙げられる。現実にはコンソーシアムはある程度の安全税を払いたいと考えるだろう。
コンソーシアムの能力の軌道の大まかな形。短い停止の後に滑らかなスケーリングが続き、その後は権限移譲まで長いほぼ停止状態が続く。
コンソーシアムの軌道は、以下の各段階でそれぞれ少しずつ異なるルールに従ってシミュレートする。
第0段階:AIの学習の一時停止
この段階は、既定の経路であればACが実現していたはずの時点の何年か前に始まる(シナリオでは約9か月前)。実効計算量は横ばいに保たれる(学習は一時停止しているのだから当然だ)。一方、学習システム性能は増加しうる。この期間の終わりには、コンソーシアム内の先頭企業がより多くの計算資源を持つことになるからだ。
AI研究開発も、第0段階の間は実質的に停止している。ただし、コンソーシアム内の先頭の主体のソフトウェア効率は、この期間に一定の桁数だけ伸びるものとしてモデル化する。これは研究の完全な透明性によるものだ。第0段階の終わりにスケーリングが再開される時点で、各企業の知的財産は実質的に公開されている。各企業は協定以前にそれぞれ重複しないソフトウェア上の発見をしているはずなので、知的財産を持ち寄れば最先端のソフトウェア効率が上がると考えられる。
この段階では、実効計算量は通常の に従い、実効学習システム性能とともに増えていく。TSPは外部から与えるプランAの時系列に従って伸び、ソフトウェア効率の伸びは、特定の時点でTED-AIに到達するよう慎重に管理される。TSPが1桁増えるごとに、最低限のソフトウェアの進歩が義務として求められると仮定する。
各時点で払っている安全税を追跡するため、実際には二つの異なる軌道をシミュレートする。
-
一つは、合法なプロジェクトの実現可能な能力を表す。この軌道は、目標時点でTED-AIに加えて望む量の安全税を上乗せした水準に到達するような、(一定の)ソフトウェア進歩率を保つことを目指す。
-
もう一つは、合法なプロジェクトの実現された能力を表す。この軌道は、実現可能な能力がTED-AI+安全税の水準に到達するのと同じ時点でTED-AIに到達するような、(一定の)ソフトウェア進歩率を保つことを目指す。
各タイムステップで、どちらの軌道も研究努力を理論上の最大値から抑え、あらかじめ選んだソフトウェア進歩の経路に最も近づく値を選ぶ。
ソフトウェアの進歩に課す上限と下限
選んだスケーリング期間とテイクオフのパラメータが、ある時点で自然に可能な速さを超えるソフトウェアの進歩を必要とする場合は、研究努力をまったく抑えないこともある。多くの場合、AIの能力水準が十分に上がれば、コンソーシアムは望むソフトウェアの経路に追いつける。ときには、望む時期までにTED-AIに到達できないこともある。たとえば、一時停止時の水準からTED-AIに到達するのに本来なら10年かかる世界で、コンソーシアムがわずか1年での到達を目指す場合がそうだ。
逆に、スケーリング期間が十分に長いか、一時停止時の水準からTED-AIまでの実効計算量の差が十分に小さければ、ハードウェアのスケーリングだけで(義務づけられた最低限のソフトウェアの伸びを加えて)目標の年より前にTED-AIに到達してしまうことがある。この場合、コンソーシアムは単に早めにTED-AIに到達する。
第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する
単純化のため、この段階では、コンソーシアムの実現された能力が文字どおり停止するものとしてモデル化する。現実には、もっと滑らかに減速し、その後も、制御技術が改善して「最大制御可能AI」の閾値が少しずつ上がるにつれて、ごくゆっくりと伸び続けると考えられる。
一方、コンソーシアムの実現可能な能力は伸び続ける。TSPの伸びは鈍るが止まらない。ソフトウェア効率の伸びについては、年あたりの桁数で表す一定のソフトウェア進歩率を指定する。これは、第2段階で行われる膨大なアラインメント研究がもたらす、能力面での外部効果を表すものだ。(たとえば、機械論的解釈可能性の劇的な進歩は、アラインメントにとって有望である一方、はるかに効率的な学習手法を可能にすることも十分に考えられる。)
実現された能力が実質的に止まる一方で実現可能な能力は伸び続けるので、この期間に払う安全税は劇的に増える。
現実には、コンソーシアムはどこかの時点でAIへの権限移譲を選ぶ(シナリオでは、第2段階に入ってからおよそ5年後に起きる)。ただし、現時点では権限移譲を明示的にはモデル化していない。私たちの分析のいずれも、権限移譲後の動態に大きくは依存しないからだ。そのため、エクスプローラーではコンソーシアムの能力の線がいつまでも横ばいのままで、権限移譲後に予想されるような急上昇は描かれない。
秘密プロジェクトのモデル化
AIの学習が一時停止した時点(第0段階)で、秘密プロジェクトは次の資源を持って始まると仮定する。
-
先頭企業の研究開発用計算資源の一定割合に相当する、研究開発用計算資源の総予算。秘密プロジェクトは、学習、実験、社内推論への配分を、先頭企業と同じ比率で行うと仮定する。
-
先頭企業の労働力の同じ割合に相当する、エンジニアリングの労働力
-
協定前の先頭企業と同等のAI能力、ソフトウェア効率、研究ストック
また、秘密プロジェクトの計算資源と労働力の供給は時間がたっても一定だと仮定する。最後に、秘密データセンターを建設している一定期間は、秘密プロジェクトは学習も研究開発も始められないと仮定する。
これらの要因だけを考慮すると、私たちのモデルでは、秘密プロジェクトの進歩はおそらくかなり遅くなる。中央値のケースでは、研究開発用計算資源が(協定開始時の先頭企業と比べて)1桁少なくなるごとに、秘密プロジェクトがTED-AIに到達するまでの時間は、先頭企業の6倍を超える。
ただし、秘密プロジェクトはコンソーシアムのAIの進歩からある程度の後押しを受けるとも仮定する。その主な要因で、かつ明示的にモデル化している唯一の要因は、コンソーシアムから秘密プロジェクトへのソフトウェア改良の漏出だ。これを反映するため、コンソーシアムのソフトウェア進歩率のうち、秘密プロジェクト自前のソフトウェア進歩率に上乗せされる割合を表すパラメータを設けている。秘密プロジェクトはコンソーシアムが発見したアルゴリズムを、危険の可能性があるとされたものも含めてすべて活用すると、保守的に仮定する。そのため、盗む対象の量としては、実現されたソフトウェア効率の伸び率ではなく、実現可能なソフトウェア効率の伸び率を用いる。
ソフトウェアが拡散するため、コンソーシアムのスケーリング戦略は、秘密プロジェクトが追いつけるかどうかを大きく左右する。望む時期にTED-AIに到達するためにコンソーシアムが必要とするソフトウェアの進歩が少ないほど、秘密プロジェクトが受ける後押しは小さくなる。したがって、ソフトウェアの進歩が少なくて済む長めのスケーリング期間を受け入れれば、TED-AI到達時点でのコンソーシアムのETSPのリードは広がり、通常は、コンソーシアムがTED-AIに到達してから秘密プロジェクトが到達するまでの時間も長くなる。
協定の崩壊のモデル化
協定の崩壊のモデル化は比較的単純だ。
-
計算資源の相互確証破壊の有効性は、協定崩壊の時点で新たな先頭プロジェクトが利用できる世界の計算資源の割合で表す。
-
協定崩壊後の研究開発用計算資源の伸び率を表すパラメータも設ける。これは、破壊を免れた、あるいは新たに建設された半導体工場の生産量を表す。
-
秘密プロジェクトの場合と同じく、形式上は、人間の研究開発の労働力が計算資源に比例して変化すると仮定する。これは非現実的かもしれないが、AC以降は人間の労働力の影響は実質的に無視できる。
-
協定崩壊後の先頭プロジェクトは、協定崩壊前のフロンティアモデルの重み(コンソーシアムの実現された軌道のもの)と、発見済みのすべてのソフトウェア改良(コンソーシアムの実現可能な軌道のもの)を持って始まる。
協定崩壊後の先頭プロジェクトは、既定の軌道と同じく全速力で進むと仮定する。
厳密には、「最大制御可能AI」のようなものまでスケールすべきだが、『AI 2040』ではこれをTED-AIとして操作的に定義している。
厳密に言えば、シナリオでは一時停止は2029年3月から2029年9月まで続き、2030年1月に最初の大規模な学習実行が承認されるまでの年の後半には、「試験的な」実験を進められる。
この仮定は、秘密プロジェクトにとって最適な戦略を表していないかもしれない。このモデルの以前のバージョンで、計算資源のさまざまな配分戦略を調べる大まかな実験をしたところ、秘密プロジェクトの軌道の速さへの影響は無視できるほど小さかった(ただし極端な場合は除く。たとえば、学習に計算資源をまったく割り当てなければ、実効計算量の伸びは完全に止まる。同様に、実験に計算資源をまったく割り当てなければ、ソフトウェア効率の伸びは完全に止まる)。
これもやや場当たり的な仮定だ(たとえば、秘密プロジェクトの研究開発の労働力を専用に推定し、それを別のパラメータとして組み込む方法と比べて)。しかし、エンジニアリングがほぼ完全に自動化されている状況では、エンジニアの人数がどれだけ減るかはほとんど問題にならない。この単純化を改善しても結果に大きな影響はないとかなり確信しており、さまざまな時点で実際に確かめてもいる。時間の制約から、詳しい結果はここには載せていない。
これは、私たちのモデルが秘密プロジェクトに有利な設定をしている点の一つだ。秘密プロジェクトを運営する者が、協定締結時点での先頭企業のフロンティアモデルの重み、データセット、アルゴリズムに関する知識のすべてにアクセスできると仮定するのに近い。改善策として、秘密プロジェクトが開始時点で「何か月遅れているか」を表すモデルパラメータを加えることが考えられる。残念ながら、時間の制約から、プランAの公開時点ではこれを含めていない。
これはやや有利な設定だが、全体としてはおそらく正確だろう。この仮定が崩れる最も破滅的な形は、プランAの間に生産された合法な計算資源の一部が秘密プロジェクトへ密輸される(あるいは研究開発用クラスターの内部から違法に使われる)場合だ。プランAの間に世界の計算資源は数桁増えるので、これは破滅的な結果をもたらす。より穏やかな失敗の形としては、協定期間中に増え続ける消費者向けハードウェアを、秘密プロジェクトが(間に合わせのAI研究開発用計算資源として)利用することが考えられる。さらに、秘密プロジェクトが協定期間中に、監視を受けない独自の半導体サプライチェーンを構築・運用しようとする可能性もある。こうした事態をすべて防ぐための私たちの戦略は、検証計画で説明している。
後述するとおり、建設期間中に盗んだソフトウェアを蓄積することは認めている。
「超える」と書いたのは、述べた結果が、分岐点で計算資源の水準が固定された軌道と秘密プロジェクトを比べたものだからだ。現実には、先頭企業はテイクオフの間に増え続ける研究開発用計算資源の恩恵を受ける。
その他の要因には、蒸留や重みの窃取がある。このモデルでは、これらは防げると仮定している。