協定の弱体化

Eli Lifland

はじめに

プランAでより速くスケールアップする方向に働く考慮事項の一つが、協定の弱体化だ。協定が失効するか、実効性が大幅に落ちる(これを協定の機能低下と呼ぶ)可能性のことを指す。

この補足資料では、協定の弱体化がどれくらい起こりやすく、どれくらい深刻かを見積もる。協定の弱体化がプランAの最初の10年以内に起きる確率は少なくとも10%あり、2035年に弱体化が起きれば、2035年に協定のもとで権限移譲を行った場合と比べて、未来の期待値が少なくとも5%下がる。この点には自信がある。協定の弱体化は心配になるほど起こりやすく、しかもプランAの協定のもとで能力をスケールアップするほうが、協定が弱体化した後のAI開発競争よりはるかに安全に見える。だから協定の弱体化は、(たとえば非常に長い一時停止のようなものではなく)AIの能力をより速くスケールアップし、より早くAIに権限を移譲することを支持する重要な考慮事項であり、おそらくその最大のものだと確信している。ただし、以下で見積もる個々の数値に厳密な自信があるわけではない。協定の弱体化について、今より大幅に楽観的にも悲観的にも、容易に考えを改めうる。

弱体化の可能性は小さくないものの、プランAは依然として他のプランよりはるかに価値が高いと考えている。協定の成立から数年以内に弱体化が起きたとしても、結果はおそらく協定がない場合より大幅によい。さらに、自動化された嘘の検出や堅牢な制度設計といった仕組みによって、長続きする実効的な協定を実現できる可能性も十分にあると考えている。

概要

協定の弱体化の種類を分類したうえで、次の分析を行う。

  1. 協定の弱体化の原因: 原因を次の三つに分ける。(a) 指導者の交代によって、実効的な協定の維持が意図的に後回しにされる。(b) 現在の指導者の優先順位が変わることによって、意図的に後回しにされる。(c) 不安定化をもたらす出来事。

  2. 協定の弱体化の起こりやすさ:他の国際合意の基準率と、考えられる原因への分解をもとに、協定の弱体化の年間確率を、協定の最初の2年間で約12%、2〜5年目で約7%、5〜10年目で約4%と見積もる。リスクは失効と機能低下におおむね半々に分かれる。この見積もりでは、5年以内に弱体化する確率は37%、10年以内では48%になる。協定の期間中、そしてある程度はそこに至るまでの時期にも、協定がどれだけ堅牢かについて、社会は今の私よりはるかに多くの情報を持つだろう。そのため、その時点での確率は今の見積もりとかなり違うかもしれない。

  3. 協定の弱体化の深刻さ: 協定が弱体化した後の状況を、そもそも協定がなかった状況と比べる。協定の弱体化後の状況が(協定がない状況に比べて)よくなる最も重要な点は、AIを使って多くの有益なこと(安全性研究など)を行えたことと、暦の上で時間が増えたことで社会の認識と備えが進むことだ。一方で、プランAの計算資源を破壊する仕組みが機能しなければ、協定の弱体化後の世界には計算資源がはるかに多く存在し、テイクオフはより速く危険になる。全体として、協定の弱体化後の状況は、協定がまったくない場合より大幅によいが、協定のもとで権限移譲を行う場合よりはかなり悪いと見られる。協定の弱体化がいつ起きるかは非常に重要で、遅いほどよい。

  4. 協定の弱体化への備え: 協定の弱体化の防止と緩和に多くの資源を投じることを推奨する。緩和策についての主な推奨は、協定が失効した場合に世界の計算資源のほぼすべてが確実に破壊されるようにしておくことだ。この破壊がなければ、より汎用的な能力を持つAIの開発に使われていなかった計算資源がオーバーハングとなり、テイクオフが極めて速くなるおそれがある。

協定の弱体化の種類

協定の弱体化には次の種類がある。

協定の失効。 協定が正式に失効する。

協定の機能低下。 協定は失効していないものの、適切に実施され遵守されていた場合と比べて、実効性が大幅に落ちる。この補足資料では単純化のために二値でモデル化するが、実際にはおそらく徐々に進む。協定の機能が低下する経路には、次のようなものがある。

  1. 協定の執行の緩み。 協定が以前ほど厳格に執行されなくなる。たとえば、あからさまに違反している国が罰せられない。その結果、協定の文言への違反が増える。

  2. 協定の運用の失敗。 協定の文言は守られているが、その運用がまずい。

  3. 協定の改定。 協定が明示的に改定され、内容が悪くなる。単純な弱体化の場合もあれば、不必要に監視を強化するなど、別の形で悪くなる場合もある。

協定は、秘密プロジェクトが乗っ取りの能力を持つAIに到達することや、存亡に関わる破局(AIによる乗っ取り、AIを用いた生物兵器、AIが開発した超兵器など)によって終わることもありうる。こうした終わり方はこの補足資料の対象外で、私たちの用語では協定の弱体化とはみなさない。これらはプランAの能力スケーリング戦略の分析で別途扱っている。

協定の弱体化の原因

協定の弱体化に至る経路の一つは、実効的な協定の維持が意図的に後回しにされることだ。その経路は次のとおり。

  1. 米国と中国の少なくとも一方の指導部が、協定を後回しにすると決める。これにはさまざまな理由がありうる。そのいくつかを以下に挙げる。

  2. これが一方の国の内部だけで起きた場合、もう一方の国は、影響力を使って協定の弱体化を防ごうとして失敗するか、(たとえばエスカレーションを恐れて)協定の弱体化を黙認するかのどちらかになる。他の国々も、協定の弱体化を防ぐ方向で各国に圧力をかける影響力をある程度持っている。

(1) のように米国や中国の指導部の優先順位が変わる経路は、(a) 指導者の交代(米国の選挙など)と、(b) 現在の指導者の優先順位の変化に分けられる。

現在の指導者の優先順位はなぜ変わりうるのか?考えられる最も有力な理由は次のとおり。

  1. 将来の国内の指導者が事態にどう対処するかへの懸念。

  2. 指導者の交代前に超知能を開発して権力を得たいという思惑。

  3. 協定が弱体化した世界でAI開発競争に勝てるという見通しが強まること。

  4. AIによる乗っ取りや極端な権力集中といった、超人的なAIがもたらすリスクへの懸念が薄れること。

  5. 不当に権力を奪取したいと考え、協定がその妨げになると考えること。

  6. 協定がうまく機能するという見通しが弱まること。たとえば、悪用のリスクが高すぎて協定の枠内では緩和が難しいと考えるようになる。これは、協定の改定交渉の決裂につながりうる。

さらに、私たちが思いついていない多くの理由をまとめた「その他」の枠もある。

協定が弱体化するもう一つの理由として考えられるのは、不安定化をもたらす出来事だ。考えられる最も有力なものは次のとおり。

  1. 戦争などの地政学的な衝撃。

  2. ある国の不正が発覚すること。秘密プロジェクトの発覚や、推論専用の検証を損なおうとするといった別の形の不正。

  3. 存亡には至らない破局。

協定の弱体化の起こりやすさ

全体的な見解

以下では、プランAにおける協定の弱体化の起こりやすさを年ごとに見積もる。最初の10年間に焦点を当てるのは、シナリオではその期間に権限移譲が行われるからだ。協定の期間中、そしてある程度はそこに至るまでの時期にも、協定がどれだけ堅牢かについて、社会は今の私よりはるかに多くの情報を持つだろう。そのため、その時点での確率は今の見積もりとかなり違うかもしれない。

二つの方法を用いる。

  1. 基準率 と調整: 国際的な協定が弱体化する基準率に着目した分析では、協定の弱体化の確率を、協定の最初の2年間で年約15%、2〜5年目で年約12%、5〜10年目で年約11%と見積もる。プランAは検証が特に強力で、プランAが実施されること自体が、それを維持する強い政治的意思がある証拠になるので、これらの値を引き下げる。調整後、リスクは失効と機能低下におおむね半々に分かれる。

  2. 原因への分解: 協定の弱体化の考えられる原因に分解し、それぞれの見積もりを組み合わせると、協定の弱体化の確率は最初の5年間で年約10%、5〜10年目で年約6%になる。基準率と調整による方法より少し高めに見積もることになるが、全体として、どちらの方法でもかなり似た結果になる。

以上の二つの方法を総合した私の全体的な見解は次のとおり。

イーライ・リフランド(Eli Lifland)による協定の弱体化の起こりやすさの総合的な見積もり

期間(年)

年間の失効確率

年間の機能低下確率

年間の弱体化確率

この期間の弱体化確率

弱体化の累積確率

0〜2

6%

6%

11.6%

21.9%

21.9%

2〜5

3.5%

3.5%

6.9%

19.2%

37%

5〜10

2.0%

2.0%

4.0%

18.3%

48%

能力スケーリング戦略と、考えうるプランの比較のプランAの部分でモデル化を行う際には、次のハザード率を使い、その間を線形補間している。累積分布関数は上の表とほぼ同じになる。

能力スケーリング戦略と考えうるプランの比較で用いた、イーライによる協定の弱体化の起こりやすさの見積もり

協定開始からの年数

ハザード率(何らかの弱体化)

弱体化の累積確率

0

0.12

0%

3

0.08

25.9%

6

0.06

39.9%

8

0.04

45.7%

11

0.03

51.1%

16

0.02

56.8%

協定の弱体化リスクは2040年の権限移譲までに約50%に達する

0%25%50%75%100%ハザード率(年間の弱体化確率):12%/年8%/年6%/年4%/年3%/年2%/年2040年までに51.1%(権限移譲時)56.8%202920312033203520372039204120432045年協定の弱体化の累積確率
協定は2029年に始まると仮定。ハザード率は私の基準推計の間を線形補間している。リスクは失効と機能低下におおむね半々に分かれる。
累積確率 = 1 − exp(−∫ ハザード率)

基準率と調整

データ収集の方法

基準率と調整の分析はClaudeに行わせ、その出力を人の手で確認・修正した。手法の概要は次のとおり(分析の全文は後掲)。

Claudeは、規模と性質がプランAにおおむね似ている過去の国際合意31件を一覧にまとめる。各合意について、最初に機能が低下するまでの期間と失効までの期間を特定し、その合意がプランAにどれだけ当てはまるかを定性的に順位づける。

基本のハザード率は、各期間(協定開始からの年数)について、適用可能性のスコアで重みづけした平均率として、失効と機能低下で別々に計算する。

  • 機能低下については、最初の機能低下までの年数を重みづけした数を、機能低下にさらされた年数を重みづけした数で割って計算する。

  • 失効については、失効した合意の重みづけした合計を、失効にさらされた年数を重みづけした数で割る。

Claudeは機能低下と失効の理由も特定する。その結果、失効はおおむね5〜10年を中心とした山型になり、機能低下は初期に集中することがわかる。

また、検証が改善されるほど機能低下が遅れる相関があり、失効はたいてい、協定そのものが本質的に破綻したからではなく、政治的な離脱の結果として起きることもわかる。

基準率(と調整)に基づく予測

収集した基準率は次のとおり。

協定の失効と機能低下の基準率

方法

失効のハザード率/年

機能低下のハザード率/年

重みづけした基準率(主要値)

3.4%

7.9%

重みづけなし(すべての条約を同等に扱う)

1.8%

4.8%

次に、ハザード率が時間とともにどう変わるかを論じる。シナリオでの協定の期間が10年なので、最初の10年間に焦点を当てる。10年を超える期間について一言付け加えると、機能低下のハザード率は10〜20年目で下がり続けずに年約6%で横ばいになり、20年を過ぎると年約4%に下がる。協定の発効からの期間別の基準率は次のとおり。

協定の存続期間別に見た、協定の失効と機能低下の基準率

期間(年)

失効のハザード率/年

機能低下のハザード率/年

合計のハザード率/年

失効の累積(期間の終わりまで)

機能低下の累積(期間の終わりまで)

合計の累積(期間の終わりまで)

0〜2

0.0%

15.5%

15.5%

0.0%

28.6%

28.6%

2〜5

3.4%

9.4%

12.5%

9.9%

46.9%

52.1%

5〜10

5.8%

5.9%

11.4%

33.2%

60.9%

73.8%

基準率には次のような調整を加える。

収集した基準率に対するイーライの調整

期間(年)

基準の失効/年

基準の機能低下/年

調整後の失効/年

調整後の機能低下/年

調整後の合計/年

根拠

0〜2

0.0%

15.5%

5.0%

5.0%

9.8%

失効を0%から5%へ:0%はデータセットの規模が限られていることによる見かけの値という面がある。しかも、プランAが早々に失効する経路(秘密プロジェクトの発覚など)は容易に想像できる。

機能低下を15%から5%へ:プランAは検証が特に強力で、開始には非常に強い政治的意思を要するので、ごく早期に機能が低下する可能性は低い。

2〜5

3.4%

9.4%

3%

3%

5.9%

機能低下は基準率とおおむね同じように減衰させるが、AIを活用した検証や認識の改善などを踏まえて、やや急に減らす。失効も同様に減衰させる(単純化のためという面もあり、少し違う扱いにすべきかもしれない)。

5〜10

5.8%

5.9%

1.50%

1.50%

3.0%

上よりやや急なペースで減衰を続ける。

時間がたつにつれて協定の弱体化のリスクを大幅に低く見積もるのは、次の二つの効果による。

  1. 協定が長く続いていれば、それは単位時間あたりの弱体化の確率が低いことの証拠になる。

  2. 協定の期間中にAIの能力が向上し、それを有効活用する時間があれば、協定の安定に役立つ技術を構築できる。たとえば、自動化された嘘の検出や、認識の質を高めるAIや検証への活用などが考えられる。

意外なことに、上の基準率のデータでは失効の確率が時間とともに上がっている。一方、機能低下の確率は、プランAについて私が予想するのに近い形で下がっている。注目すべきは、基準率のデータには上記の効果(2)が含まれていないか、含まれていてもずっと弱い形だという点だ。そのため、協定の弱体化のリスクが下がっていく傾向は、過去の合意のデータよりもはっきり現れると予想している。

原因への分解

協定の弱体化の確率を見積もる別の方法は、考えられる原因ごとに確率を個別に見積もり、それらを集計することだ。この方法では、弱体化の確率は2030年代前半で年10%、2030年代後半で年6%となり、累積の弱体化確率は2035年までに約50%、2040年までに約60%になる。何かが起こりうる経路をたくさん列挙してその確率を集計する手法は、高めの数値を出しがちだと考えている。この手法と基準率と調整による手法を総合する際には、その点を考慮に入れている。

考えられる原因別に見た、イーライによる協定の弱体化の確率

2029〜2034年の年間弱体化確率

2035〜2039年の年間弱体化確率

意図的な後回し

米国の指導者の交代

0.02

0.01

中国の指導者の交代

0.01

0.01

将来の指導者への懸念

0.01

0.01

協定の弱体化後に勝てるという楽観

0.01

0.005

AIの安全性への懸念の低下

0.005

0.003

その他の意図的な後回し

0.01

0.005

不安定化をもたらす出来事

地政学的な衝撃

0.01

0.005

ある国の不正の発覚

0.015

0.015

存亡には至らない破局

0.01

0.005

その他の不安定化をもたらす出来事

0.015

0.01

すべての原因

すべての原因による年間弱体化確率

0.10

0.06

この期間の弱体化確率

0.49

0.27

弱体化の累積確率

0.49

0.62

他の大半の原因とは違い、ある国の不正が発覚するリスクは、2030年代後半になっても前半より下がらないかもしれない。検出の手法が向上するからだ。

協定の弱体化の深刻さ

概要

協定が弱体化した後の状況を、そもそも協定がなかった状況と比べる。協定が弱体化した後の世界が、協定がない世界より有利な最も重要な点は、1) 高い能力を持つAIが安全性研究などの有益なことを行う時間が増えることと、2) 社会の認識と備えを築く時間が増えることだ。

一方で、協定の弱体化後の世界には計算資源がはるかに多く存在し、そのままではテイクオフがより速く危険になる。そのためプランAでは、協定が失効すれば計算資源がおそらく破壊されるように仕組みを整えている。詳しくは後述する。

協定の弱体化がどれほど悪い事態になるかについて、いくつか定量的な見積もりを行った。主な結果は次のとおり。

  • 協定の失効と機能低下は同じくらい悪く、機能低下のほうがやや悪いかもしれない。機能低下には協定が残っているという利点があるが、計算資源の破壊が発動しないという欠点がある。

  • 最大制御可能AIに到達する前については、p(alignment | 協定の弱体化)(協定が弱体化した場合にアラインメントに成功する確率)を、2029年時点のp(alignment; 協定前、無条件)と、p(alignment | 最大制御可能AIの目標日における協定の弱体化)との間で、ロジット空間で線形補間する形でモデル化することを提案する。目標日を2035年とすると、p(alignment | 最大制御可能AIの目標日における協定の弱体化)はおそらく約70%だ。

  • 最大制御可能AIに到達した後については、p(alignment | 時点tでの弱体化)を、おおよそp(alignment | 時点tで協定のもとで権限移譲)の90%としてモデル化することを提案する。

大まかな状況

プランAで協定が弱体化し、特別な準備策を何も講じていなかったとしたら、何が起きるだろうか?まず、協定が完全に失効する場合を考えよう。

ある程度は既定の世界の状況に戻るが、協定がまったく結ばれなかった場合と比べると、いくつか重要な違いがある。

プラス面:

  1. AIの利用とAIの研究による進歩: 協定の開始以降に行われたアラインメントと制御の研究によって、安全性の手法についての知見が進んでいる。コンソーシアムがより高い能力を持つAIを利用し研究する時間が長かったほど、その度合いは大きい。認識の質の向上や検証技術など、AIの利用による利益はほかにもある。

  2. 社会の認識と備えの向上: AIを使って進歩をあげること以外にも、協定が稼いだ暦の上での時間は、社会が適応する時間を増やすことで、さまざまな形で役に立つ。さらに、政策立案者を含む人々は、以前よりも現在と今後のAIの能力をよく把握している。その重要な例として、人間のAI安全性研究者の数は、協定の開始時よりおそらくずっと多くなっている。

  3. 学習計算資源の安全税を支払い済み: 最も高い能力を持つモデルは、より安全な手法を使えるように、その能力水準に達するのに必要な量より多くの計算資源で学習されている。接戦のAI開発競争で起きることとは違う。協定の失効後も、このモデルを使い続けられるかもしれない。ただし、このプラス面は小さいかもしれない。(a) AIが最大制御可能AIに近くなければ、権限移譲できる水準の能力に達するためにAIを学習し直さなければならず、支払った安全税を失うことになる。(b) AIが最大制御可能AIに近かったとしても、各プロジェクトはおそらく後継のAIでは安全税を負担しないことを選び、代わりにより高い能力を目指して競うだろう。

マイナス面:計算資源が増えていれば、そのままではテイクオフが速くなる。ただし、プランAでは協定の失効時に計算資源がおそらく破壊されるように仕組みを整えている。 そのままなら、今や世界には2029年より多くの計算資源があり、既定のテイクオフはより速くなる。プランAのシナリオでは、計算資源の総量は2030年から2033年まで年に約0.7桁(0.7 OOM)、2034年から2040年まで年に0.1〜0.3桁増える。計算資源の総量が10倍になるとテイクオフが5.5倍速くなるという関係を素朴に当てはめると、3桁増えればテイクオフは約150倍速くなる!もっとも、戦争やデータセンターを狙った妨害工作などによって、計算資源がある程度破壊されるかもしれない。世界の産業能力も増えており、産業爆発の後などに、危険な兵器を製造できるようになるおそれもある。この問題があるので、プランAでは協定の失効時に計算資源がおそらく破壊されるように仕組みを整えている。これによって極めて速いテイクオフはおそらく避けられるが、私たちの最善の推測では、残りのテイクオフにはそれでも1〜2年ほどかかる。詳しくは後述する。

どちらとも言えない点:地政学的な状況の違い。 協定がどう失効するかによっては、失効後の地政学的な状況は既定の世界と大きく異なるかもしれない。たとえば戦争が起きているかもしれないし、そうでなくても、協定の失効によって、より低い水準の協調さえ実現しにくくなるかもしれない。一方で、大国は協定を実施することで、AIの安全性を非常に重視していることを示してきた。失効の起き方によっては、それがよりよい結果につながるかもしれない。協定の失効から間もなく、新たな国際協定が結ばれる可能性も十分にある。

協定の機能低下の場合は、協定がまだ効力を持っているので、世界のほぼあらゆる面が失効の場合より少なくともいくらかよい。たとえば、学習計算資源の安全税を支払い済みであるだけでなく、協定が部分的には機能しているので、安全税を払い続けられるかもしれない。失効の場合と比べてどれだけ状況がよいかは、機能低下の状況による。

主な欠点は、余分な計算資源がおそらく破壊されていないことだ。協定の失効時に計算資源を破壊する仕組みに比べて、機能低下時に破壊する仕組みは作りにくいからだ。世界には膨大な計算資源があるが、協定はおそらく今もある程度テイクオフを抑えている。つまり、世界の計算資源の大部分を使ってできるだけ速くテイクオフすることはできないかもしれない。

定量的な見積もり

上記の要因を考慮に入れようとした、大まかな定量的見積もりを行った。さまざまな時点で協定が失効した場合の未来の価値の見積もり(協定の他の終わり方についての見積もりも含む)は、こちらのシートにある。協定の機能低下は、平均すると協定の失効と同じくらい悪いと考えている。前節の最後に述べた利点と欠点がおおむね相殺されるからだ。

全体として、私の見解はおおよそ次のとおりだ。協定の第1段階、つまり最大制御可能AIに到達するまでの期間については、既定の世界と、最大制御可能AIの時点で協定が弱体化する最終状態との間で、価値をロジット空間で補間できる。最大制御可能AI以降の第2段階については、ある年に協定が弱体化した場合の価値は、おそらくその年に協定のもとで権限移譲した場合の約75〜80%だ。

協定の弱体化への備え

協定の弱体化がこれほど大きな脅威であることを踏まえ、プランAではその防止と緩和を最優先事項の一つにすることを推奨する。たとえば、プランAで技術的な安全性研究に注ぐ労力の少なくとも5%に相当する労力を(場合によってははるかに多くを)、協定の弱体化の防止と備えに注ぐべきだと考えている。その含意は能力スケーリング戦略に関する補足資料で論じている。

協定の弱体化のリスクを減らし、その悪影響を緩和する方法の一つは、AIの能力をより速くスケールアップし、より早く権限を移譲することだ。

協定の弱体化の防止

協定の弱体化を防ぐうえで有望だと考える方策を以下に挙げる。

  1. 敵対的な攻撃に極めて強い、自動化された嘘の検出: 協定から離脱しようとする主体に不意を突かれる可能性を大幅に減らせる。

  2. 制度設計: 協定とコンソーシアムは、参加国にとってのインセンティブを最もよく整え、妥当な規制上の決定につながるように設計すべきだ。加えて、国内の制度も、一人の人間の気まぐれな変化に左右されないよう強化すべきだ。たとえば理想的には、協定は米国で正式な条約として批准されるべきだ。

  3. 足並みを揃えた外交的圧力: 協定に参加するすべての国は、協定から離脱する国があれば、それは他のすべての国の安全保障と主権に対する容認できない脅威であり、そのように扱うということを明確にすべきだ。協定からの離脱を検討している国には、厳しい制裁やサイバー攻撃を受け、場合によっては数で大きく劣る戦争を戦わなければならなくなると知らしめるべきだ。

  4. 認識を支えるAI: 社会全体の認識の質を高めることは、堅牢で実効的な協定を築くうえで重要だと考えられる。特に役立つAIの応用例としては、協定が失敗するパターンを予測することや、上記の制度設計を支援することが挙げられる。

インセンティブを揃えるための備蓄

協定失効後の状況を改善し、離反をめぐるインセンティブを改善するために、次のことを推奨する。

米国と中国はそれぞれ、協定前の計算資源の2%を、防護を固めた備蓄として保有する。2%はプランAのシナリオで用いた値で、実際には所在不明の計算資源の量に応じて決めるべきだ。

米国と中国が秘密プロジェクトを作るインセンティブになりうるものの一つは、協定から離脱し、集中管理された計算資源を(爆撃や、オフラインのライセンスキーの提供停止といった他の仕組みによって)破壊できることだ。その場合、一方が秘密プロジェクトを進め、もう一方が進めていなかったら、秘密プロジェクトを持つ側が相手に大きなリードを奪い、知能爆発で先んじるかもしれない。

これへの解決策の一つは、双方に、防護を固めてはいるが電源に接続されておらず、協定が有効なあいだはAI研究に使えないGPUの蓄えを持たせることだ。実際には、この備蓄は各当事国の本国の安全な施設に保管し、協定が失効した場合に相手が破壊できないよう意図的に設計する。それでいて、協定の期間中はこれらのチップが使われていないことを査察官が検証できるようにする。

この蓄えは、双方の協定前の計算資源の2%程度でよいだろう。これはおそらく秘密プロジェクトが持ちうる計算資源より多いが、協定後の計算資源に比べれば比較的小さな割合だ。チップの供給全体の大部分を新しいチップが占めるからだ。

こうしておけば、協定が破綻して検証済みのデータセンターが停止した場合、双方は、協定前に持っていたのと比例した量の計算資源で競い合うという反実仮想の状態に戻る。米国は協定前により多くの計算資源を持っているので、これは米国にも有利に働く。

同じ備蓄の中に、米国と中国はそれぞれ、フロンティアモデルの重みのコピーを、電源を切り厳重に監視した状態で保管する。

こうする理由は次のとおり。

  1. フロンティアの重みを持ち出し、ただちに協定から離脱して大きな優位を得ようとするインセンティブが減る。秘密プロジェクトを行うインセンティブも減る。

  2. フロンティアモデルの重みを作るために支払った学習計算資源の安全税の恩恵を、もう一度支払い直さずに済む。ただし、重みを保存しておくことには欠点もある。たとえば、AIの進歩が速くなる。この理由だけのために重みをコールドストレージに保管しておきたいかどうかは、はっきりしない。

重みの保管方法の一案:

  1. ロック解除に米国と中国の両方の許可を必要とするハードディスクを用意する。コールドストレージはこれだけにする。

  2. その他の記憶装置は揮発性メモリにして、電源を切れば記憶が消えるようにする。

  3. 物理的な持ち出しを防ぐため、自動的に電源を切る物理的な防御を多数設ける。

計算資源の相互確証破壊:計算資源、ファブ、ロボットの破壊

プランAの中心的な問題になりうるのは、協定が失効した場合に、世界にあまりに多くの計算資源があるため、極めて速い知能爆発が起きかねないことだ。たとえば、2035年初めに協定が破綻したとしよう。その時点で世界には1,000億H100eの計算資源がある。これは既定の世界で2030年初めに存在した計算資源(約5億)より約2.3桁多い。そのため、人間のトップ専門家を凌駕するAI(TED-AI)からASIまで1.5か月かかったはずのテイクオフが、約1週間で済んでしまうかもしれない(後述のモデル化による)。これはもちろん極めて危険な状況だ。したがって、プランAの協定が破綻した場合には、世界の計算資源の大部分を破壊することが極めて重要になる。

この節では、計算資源の相互確証破壊を確実にするための政策と、再構築の過程で容認できないほど速いテイクオフが起きないようにするための政策を論じる。これを実現するための優先順位は次のとおり。

  1. 計算資源のほぼすべてを確実に破壊する。

  2. ファブ(半導体工場)のほぼすべてを確実に破壊する。

  3. ロボットの生産能力のほぼすべてを確実に破壊する。

以下、それぞれを順に論じ、そのうえで協定が失効した場合に知能爆発にどれだけ時間がかかるかを分析する。

計算資源

次の表は、プランAのシナリオにおける計算資源の種類ごとの点推定値を示す。

実効H100eの量

計算資源の種類

2030年

2035年

2040年

協定が失効したらどうなるか

AIデータセンターの計算資源(世界)

約5億

約1,000億

約1兆

自壊するか、爆撃される

検証済みの消費者向けハードウェアとエッジの計算資源(世界)

約0

1億

100億

検証または根本的な設計のため、AIの学習には役立たない。

キャップ・アンド・トレードの対象となる消費者向けハードウェアとエッジの計算資源

(世界)

2,500万

3,000万

3,000万

約10%をAIプロジェクトに転用できる。計算資源が各国に分散しているうえ、権威主義的でない国はおそらくこうした計算資源をかき集めないからだ。

備蓄(米国/中国/その他の国々)

該当なし

500万/50万/70万

500万/50万/70万

約100%をAIプロジェクトに転用できる

秘密プロジェクト(米国と中国)

100万

100万

100万

約100%をAIプロジェクトに転用できる

適用除外の軍事用計算資源(米国と中国。他国はより少ない)

1万

1万

1万

約100%をAIプロジェクトに転用できる

これを実現するための政策は次のとおり。

  • AIデータセンター。 米国と中国はどちらも、意図的に攻撃を受けやすい場所にデータセンターを建設する。それによって、協定が破綻した場合にデータセンターを自壊させるインセンティブが生まれる。これについてはシナリオの2034年の節で詳しく論じている。(上の表のとおり)計算資源のほぼすべてがこの区分に入るので、確実に破壊できるようにしておくことが非常に重要だ。

  • 消費者向けハードウェアとエッジの計算資源。 スマートフォンや一般消費者向けのノートパソコンなどで使われるすべての計算資源が含まれる。この計算資源は世界中に分散しており、協定の失効後にAIプロジェクトへ転用されうる。そのため、(i) 学習に振り向けられないよう検証するか、(ii) この区分のチップの総量に上限を設けるか、どちらかが必要だ。この区分の計算資源のうち、検証されていないチップについて、実効H100eで3,000万を上限とするキャップ・アンド・トレード制度を推奨する。協定前の総量は実効H100eで約2,500万と見積もっているので、短期的には通常の生産水準を続けられるが、その後はAIに使えるエッジの計算資源を新たに生産するには、古いハードウェアを下取りに出すか、検証可能な形で破壊しなければならない。追加のチップを稼働させるための極めて堅牢なチップ上の検証を開発できるか、原理的に学習へ転用できないチップの製造方法を開発できれば、そうしたチップは上限の適用除外にできる。これを実現しうる方法の一つは、製造工程でチップに制約的な計算構造を焼き込むことだ(Etchedなど)。

  • 備蓄。 前述を参照。

  • 適用除外の軍事用計算資源。 AIに関係する適用除外の軍事用計算資源は最小限にするか、1万H100eといったごく少数のGPUだけを適用除外にすることを推奨する。

ファブ

プランAでは、世界のAIに関わるファブはすべて、2032年までに破壊可能な経済特区(SEZ)へ移される。これらのファブは、海上か、敵対する超大国の近くに置かれ、自壊の仕組みを備える。こうした性質を持たない協定前のファブ(TSMCのアリゾナ工場など)は廃止される。幸い、2030年代に構築される計算資源に比べればごく一部にすぎないので、廃止のコストは大きくない。

年

2030

2032

2034

2036

2038

2040

年間生産量(H100e)

3億6,300万

135億

430億

930億

2,330億

1兆

1億H100eの生産にかかる時間

100日

3日

20時間

9.4時間

3.8時間

53分

1億H100eは、知能爆発(自動コーディングAIからTED-AIまで)を1年で起こすのにおおよそ必要な計算資源の量だ。プランAでは、2030年代の終わりには産業能力が非常に高くなり、その量の計算資源が53分ごとに生産される。したがって、特に2030年代の終わりに近づくほど、協定が破綻した場合にファブを破壊することが極めて重要になる。幸い、ファブは本質的に極めて壊れやすく、上記のAIデータセンターと同じ仕組み(自壊のインセンティブが生じる場所に置くこと)を使える。

ロボット

ロボットはファブの建設に使え、ファブはGPUを製造でき、GPUは知能爆発に使える。十分な数のロボットがあれば、この過程は極めて速く進みうる。

ロボットについての基本戦略は、GPUやファブと同じだ。ロボットの生産と利用のほぼすべてを、指定された経済特区で行う。

人間換算の数量

ロボットの種類

2030年

2035年

2040年

協定が失効したらどうなるか

経済特区

0

10億

700億

自壊するか、爆撃される

民生用

10万

1,000万

10億

自壊するか、バックドアが仕込まれているか、ファブの建設には役立たない

適用除外の軍事用ロボット

1,000

10万

10万

AIの進歩に使える

ロボットについての政策は次のとおり。

  1. 破壊可能な経済特区で生産されるロボットに、高く、かつ引き上げていく上限を設け、ロボットのほぼすべてがそこで生産されるようにする。

  2. 民生用ロボットには、協定が破綻した場合に動かなくなるよう、十分なオフラインのライセンス管理と自壊の機能を義務づける。あるいは、計算資源のサプライチェーンの再構築作業のどの部分にも使えないような、堅牢なエッジでの検証を義務づける(重みを焼き込んだ自動運転車など)。

  3. オフラインのライセンス管理なしの適用除外の軍事用ロボットは、米国と中国で合計10万台を上限とする。

協定失効後のテイクオフの長さ

協定が失効した場合、協定のもとで生産された計算資源はおそらく破壊される。主にこの場合を考える。

進歩の大きな源泉は二つある。並行して追求できるが、トレードオフがあるかもしれない(たとえば、計算資源を使ってロボットを動かしたり、新たな計算資源を生産するために人間に指示を出したりする場合)。

進歩の第一の源泉:新たな計算資源を生産する。 協定の弱体化後のAIプロジェクトは、ロボットや人間を使って半導体のサプライチェーンを再構築し、計算資源を増やそうとするかもしれない。協定後の状況では、そうした取り組みに対する激しい妨害工作が行われる可能性もあり、再構築はおそらくさらに難しくなる。とはいえ、約10万台の適用除外の軍事用ロボットと、民生用ロボットのごく一部(たとえば0.1%、約100万台)は、自壊後に有用な部品を取り出したり、セキュリティ対策を回避したりできるかもしれない。この作業に使える人間換算で約100万台のロボット群があると仮定しよう。2026年の半導体サプライチェーンでは約200万人が働いており、過去5年間で、2026年時点の技術水準(チップ設計と製造プロセス)で年約1億H100eの総生産能力を築いてきた。つまり、1,000万人年で2026年技術の年1億H100eの生産能力が得られるという大まかな対応関係になる。2026年の技術が2032年までに約1桁、2036年までにさらに1桁向上すると仮定すると(世界の計算資源の総量の伸びのおよそ50%が技術の向上、50%が生産規模の拡大によると仮定する)、対応関係は、2032年の技術では1,000万人年で年10億H100e、2036年の技術では年100億H100eになる。したがって、100万台のロボットで1億H100eを構築するのにかかる時間は、2032年なら1年、2036年なら1か月だ。逐次的なボトルネックがあるので、完全に並行して進めるというこの見積もりはいくらか長めにずれると予想している。立ち上げ時の問題や妨害工作の問題もありうる。

進歩の第二の源泉:既存の計算資源を研究開発に使う。 協定失効後のAIプロジェクトは、協定のもとで透明化されたアルゴリズム、コールドストレージの重み、転用できた消費者向けハードウェアを手にしている。そのプロジェクトが米国で、コールドストレージのGPUを使うか、世界の消費者向けハードウェアの約10%を確保できると仮定すると、2030年1月の既定の先頭プロジェクトと比べて計算資源は約25分の1になる(米国の備蓄の約500万H100eに対し、既定の2030年では約1億3,000万)。つまり−1.3桁だ。計算資源が25分の1しかないので、他の条件が同じなら、同じ能力水準で約10倍遅く進むはずだ(計算資源が10分の1なら約5.5倍遅くなると仮定)。

しかし、他の条件は同じではない。少なくともプランAのシナリオの2040年の権限移譲より前に失効が起きた場合、失効後のプロジェクトのソフトウェアとアルゴリズムは、同じ能力水準にあったときの既定のプロジェクトより効率が低い。プランAでは、既定の場合よりはるかに高い比率で、ソフトウェアより学習計算資源によって意図的に進歩を生み出すからだ。ソフトウェアが劣るので、学習の効率は低い。一方で、有望なソフトウェアのアイデアがまだ多く残っているので、一定の研究の労力でより遠くまで進める。

一方、協定のもとで透明化されたアルゴリズムは、実装済みのものと、学習計算資源の安全税を支払うために採用を見送ったものに分けられる。安全税は、TED-AIまでにおよそ1桁分を支払うことを推奨している。プロジェクトは、見送ったアルゴリズムを使って実際にある程度学習を行う必要があるが、おそらくその利得の多くを素早く取り込めるだろう。

すべてをまとめる。 TED-AIで一時停止した後、たとえば2037年に失効が起きたとする。既定の(減速なしの)プランAの軌道では、TED-AIからASIまでの時間は約1.5か月だ。学習計算資源が少ないことによる10倍の減速を素朴に当てはめると、約15か月になる。失効後のプロジェクトのソフトウェアが劣ることを考慮すると、ASIまでのテイクオフは約2.75年になる(これは失効後の計算資源の増加をゼロとした場合で、既定の軌道に比べてさらに遅くなる)。失効後に計算資源が年1桁増えるようにすると、テイクオフは約1年になる。

一方、計算資源が破壊されなければ、先頭の企業は、2030年に既定のテイクオフが起きる世界で先頭の企業が持っていたはずの計算資源の約500倍を手にする。計算資源が10倍なら約5.5倍速くなると仮定すると、TED-AIからASIまでは既定の100倍速くなり、1日もかからない。ただし、失効後のプロジェクトはソフトウェアが劣る状態から始まるので、私たちのモデルでは約1週間かかると予測される。

計算資源を破壊すれば、失効後のテイクオフは約1週間から約1年に遅くなる

協定下(両方の世界で共通)失効――計算資源を破壊失効――計算資源を破壊せず
1x10x100x1,000x10,000x自動コーディングAI(3x)超人的AI研究者(20x)人間のトップ専門家を凌駕するAI(400x)ASI(1,000x)協定が失効失効から約1週間でASIASIまで約1年(失効後)20292030203120322033203420352036203720382039年AI研究開発の加速(2026年比)
経路: 計算資源を破壊, 計算資源を破壊せず。計算資源を破壊する場合のパラメータ:先頭の企業は(堅牢化した備蓄によって)協定前のフロンティアの約7%を保持し、年1桁のペースで再建する。なお、加速の数値はプランAによる能力の方向づけを考慮していない。能力の方向づけは、同じ能力水準でのAI研究開発の加速を小さくする。

次に、2032年、SAR(超人的AI研究者)の少し手前で失効が起きた場合を考えよう(計算資源は破壊されると仮定する)。既定では、SARからTED-AIまでは約0.3年かかる。学習計算資源が少ないことによる10倍の減速を素朴に当てはめると、3年強になる。ソフトウェアが劣ることを考慮し、失効後に計算資源がたとえば年0.5桁増えるとすると、約2年後にTED-AIに到達するという結果になる。

謝辞

Claudeによる基準率の分析をファクトチェックし、図の作成を手伝ってくれたディロン・グエン(Dillon Nguyen)に感謝する。協定失効後の計算資源の破壊に関する節の草稿を書いてくれたトーマス・ラーセン(Thomas Larsen)とロメオ・ディーン(Romeo Dean)にも感謝する。


付録:Claudeによる基準率の分析

推論の過程を透明にするため、Claudeによる基準率の分析の全文を以下に掲載する。日付と出来事は人の手で確認した。見つかった問題に基づいて、本文にはごく軽微な修正を加えている。

Claudeの分析

このタブには、プランAの米中減速協定が、成立(2029年頃)から権限移譲(2040年頃)まで、年ごとにどれくらいの確率で失効または機能低下するかについて、外部視点に立った基準率による見積もりの全体的な推論をまとめる。条約ごとのデータセットと条約ごとの推論は、関連する協定の弱体化スプレッドシートの「Base rates」タブにある。このタブでは、方法、参照クラスの選び方、中心的な発見、そして生の基準率からプランAに固有の年ごとのハザード率へどう調整したかを説明する。草稿はClaude(Opus 4.8)が2026年6月29日に作成した。歴史上の日付と各合意の顛末はウェブで確認したが、それらを年ごとの数値にまとめたのは一次的な草案であり、判断を伴うものだ。

方法と参照クラスの選び方

用いたのは標準的な「外部視点」の手法だ。プランAの個別の事情から推論するのではなく、プランAに似た過去の国際合意を約31件集め、それぞれが最初に機能低下するまで、また失効するまでにどれだけ続いたかを記録し、そのまとめた経験を年間のハザード率に換算した。結果の区分は補足資料本文と同じ二つを使う。失効(正式な終了、離脱、崩壊)と機能低下(正式には失効していないが、実効性が大幅に落ちている状態。執行の緩み、黙認された違反、停止、弱体化させる改定)だ。そのうえで、分析者がしばしば混同する三つの事柄を分けて追跡する。最初の機能低下までの期間、失効までの期間、そして失敗の形態(誰がなぜ破ったのか)だ。プランAの設計はこの三つにそれぞれまったく異なる形で影響するからだ。各合意には数値の適用可能性の重み(0〜3)を割り当てる。3は対立する大国間の能力に関する協定で、最も近い類例。約1.5〜2は参考になる類例。約1は幅広い多国間条約。約0.25〜0.5は離反のインセンティブが小さいか、実効性のないものだ。そのうえで、基準率を重みづけしたハザード率、すなわちΣ(重み×事象数) / Σ(重み×リスクにさらされた年数)として、失効と機能低下で別々に計算する。重み、条約ごとの入力値、実際に動く数式はすべてスプレッドシート(パート1〜2)にあるので、集計は完全に透明で編集可能だ。重みを変えれば基準率が再計算される。とはいえ、まとめて算出したハザード率はやはり粗い。1922年の海軍条約での不正と2023年の条約の履行停止を、同じ壺から引いたくじとして扱ってしまうからだ。そこで、重みづけしないもの、最も近い類例だけに絞ったもの、そして最も重要なものとして、期間(協定開始からの年数、パート2b)によってハザード率が変わるようにしたものも併せて示し、そのうえでプランAの個別の事情に合わせて調整する。

合意は、プランAとの類似性によって三つの層に分けた。最も適用可能な層は、離反の強いインセンティブがあるなかで、決定的な軍事・戦略技術に上限を設ける対立大国間の協定だ。戦間期の海軍軍縮条約(ワシントン条約とロンドン条約)、米ソ・米ロ間の二国間の戦略兵器管理条約(ABM条約、SALT、INF全廃条約、START、新START、オープンスカイ条約)、そして二つの「対立国間の協定」型の核不拡散取引(JCPOA[イラン核合意]と米朝枠組み合意)が含まれる。これに国際関係論の同盟終了に関する文献を加える。これは、対立国同士の協定がどれだけ続くかについて、定量的な基準率に最も近いものだ(1945年以前の同盟の平均存続期間は約9〜10年。試されたときに約3分の1が破られた)。中程度に適用可能な層は、幅広い多国間の核不拡散・検証条約(NPT、CWC、BWC、CTBT)で、主に検証について何がわかるかという点と、楽観的な側の上限として役に立つ。それに加えて、AIチップの管理に最も近い類例で、構造的に慢性的な抜け穴を抱える軍民両用品の輸出規制体制(ワッセナー・アレンジメント、MTCR、NSG)も含める。最も適用可能性が低いが参考になる層は、インセンティブの小さい長続きする条約(宇宙条約、トラテロルコ条約、PTBT)と、実効性のない気候協定(京都議定書、パリ協定)で、両極端の範囲を示す。誰も離反したがらなければほぼ永続し、拘束力が何もなければほぼ役に立たない。歴史上で最も近い単一の類例は、ワシントン・ロンドン海軍軍縮体制だ。対等な対立国同士が決定的な軍事技術に上限を設け、双方が離反の誘惑にかられ、検証は自己申告だった。この体制は日本が脱退するまで約13〜14年続き、その間ずっと不正が行われていた。

中心的な発見:検証は不正を遅らせるが、協定を終わらせるのは政治だ

データでは二つのパターンが支配的で、それが見積もり全体を左右する。

第一に、協定が不正によって機能低下せずにどれだけ続くかを最も明確に予測するのは、検証の強さだ。検証の強い体制(INF全廃条約、START I、新START、オープンスカイ条約、NPT/IAEA、CWC/OPCW)は、重大な機能低下までにおよそ8〜35年続いたのに対し、検証の弱い体制は0〜4年だった。ただし、この差は実在するものの、一見したほど明確ではない。機能低下の時点を発覚時ではなく違反の開始時とすると、検証のある協定の記録は短くなるからだ(INF全廃条約に違反する試験は、米国が正式に告発する6年前の2008年頃に始まっていた。オープンスカイ条約の制限は2010年に始まった)。検証は最終的には不正を検出したが、意味のある遅れがあり、検出それ自体で違反が是正されることはなかった。データセットの中で明確に是正された唯一の例はモントリオール議定書で、安価な大気観測によって違法なCFC-11の生産が数年以内に発覚し、執行によって遵守が回復した。この協定は実効性が大幅に落ちることがなかったので、機能低下なしとして分類している。検証の弱い体制や検証のない体制(海軍軍縮条約、英独海軍協定、OPECの生産枠、商業捕鯨モラトリアム、そして何よりBWC。BWCには検証がなく、ソ連は発効当初からずっと大規模に違反していた)は、ほぼただちに、0〜4年以内に機能低下した。これが、プランAについて楽観できる最も強い構造的な理由だ。プランAの検証体制は歴史的な基準から見て異例なほど強力で、不正を検出可能にし、自動的に罰せられるように明示的に設計されている。

第二に、そして決定的なことに、強力な検証は、政治的な離脱による協定の終わりを防ぐうえでは実質的に何の役にも立たない。ABM条約(30年)、INF全廃条約(31年)、オープンスカイ条約(約19年)、JCPOA(2.3年)はいずれも、検証が失敗したからではなく、政府が離脱を決めたから終わった。最も鋭い警告はJCPOAだ。これまでに交渉された中で最良の検証体制が、米国の政権交代によって約2年で放棄された。つまり検証は、不正による機能低下という失敗の形態からは守ってくれるが、政権交代・心変わり・地政学的な衝撃による失効という失敗の形態に対してはほとんど守りにならない。同盟に関する文献(Leeds & Savun 2007)は、後者を早期終了の主な要因としている。プランAの検証が優れていても、失効のハザード率をゼロより意味のある程度上に保っているのはこのためだ。

プランAは基準率とどこが違うか(調整)

一般的な注目度の高い条約と比べて、ハザード率を上げる要因:(1) 想像しうる限り最も決定的な単一の技術をめぐる対立国間の協定なので、無害な年約0%の条約の部類ではなく、厳しい年約7〜12%の海軍条約・対立国間協定・同盟の部類に属する。(2) 批准された条約ではなく行政協定だ。シナリオは、米国が批准した最後の重要な条約として新START(2010年)を挙げ、このことを明示している。データセットの中で、一つの政権が一方的に離脱できた協定(ABM条約、INF全廃条約、オープンスカイ条約、JCPOA)はすべて、離脱に批准済みの約束の撤回が必要なかったからこそ離脱できた。(3) 賭け金の大きさも技術変化の速さも前例がない。そのため、歴史的にこうした協定を終わらせてきた「最初の大きな衝撃」が早く訪れやすく、能力が権限移譲に近づくにつれて離反の見返りも大きくなる。(4) 2032年と2036年の米大統領選挙、2033年頃の中国の指導者継承(習近平が80歳になる)は、予定された政権交代のリスクであり、まさにLeeds & Savunが終了のハザード率を急上昇させると指摘する出来事だ。(5) シナリオでは、米国の実行力が異例なほど高いと設定されている。

ハザード率を下げる要因:(1) 異例なほど強力な検証と自動的な執行(オフラインのライセンス管理、離脱時の計算資源の暗号学的な停止)によって、不正による機能低下の要素は、海軍条約並みの高い水準ではなく、INF全廃条約や新START並みの低い水準(年約2〜4%)に押し下げられる。(2) 異例なほど強い共通の利益。純粋な能力開発競争とは違い、双方が制御の喪失と人類の絶滅を本気で恐れている。これは、ゼロサムの軍拡競争よりも、(何十年も維持された)相互確証破壊によって安定した核の抑制に近い。プランAが参照クラスを上回りうる最も有力な構造的理由だが、明確な歴史的前例はない。

差し引き:対立国間協定の部類(失効が年約7%)を基準にしつつ、生存という共通の利益と有能な実行を踏まえて失効率をいくらか割り引く(年によって年約4〜7%)。不正による機能低下の要素は、強力な検証があるので低く抑える(年約2.5〜5%)。ただし、執行の緩み、運用の失敗、弱体化させる改定はどれも検証では防げないので、機能低下はゼロにはしない。

主要な基準率と年ごとの推移

すべての経過年数をまとめて重みづけした基準率は、失効が年3.4%、機能低下が年7.9%だ(重みづけなしでは1.8%/4.8%、最も近い類例だけに絞ると6.6%/8.3%)。しかし、より役に立つのは期間別の基準率(パート2b)だ。歴史的なハザード率は、協定がすでにどれだけ存続したかに強く左右されるからだ。失効は初期に集中するのではなく、山型になる。0〜2年目は0%(データセットの中に2年以内に正式に失効した協定はない)で、5〜10年目に年約5〜6%のピークに上がり、20年を超えて存続した協定では年約2%に下がる。対立国間の協定は、終わるまでに数年かかるのだ。機能低下は強く初期に集中する。0〜2年目は年約15.5%で、年約9%(2〜5年目)、年約6%(5〜10年目)と下がり、後期に小さな盛り返しがある(10〜20年目で年約6%。新STARTの履行停止とシリアとCWCの事例による)。データセット全体では、機能低下は正式な失効より多い。多くの体制は廃止されるのではなく、骨抜きにされるのだ。期間別の曲線を協定のタイムラインに当てはめると、純粋な基準率では、2040年までに何らかの破綻が起きる累積確率は約79%(失効約39%、機能低下約65%)になる。これらがパート3の「基準率」の列だ。私の「調整後」の列は、以下で述べるプランA固有の推論を上乗せしたもので、累積の破綻確率は約62%(失効約43%、機能低下約33%)になる。

調整後の推移は、二つの点で意図的に基準率から離れている。第一に、初期の失効を基準率の0%より引き上げる。0〜2年目の歴史的な0%は、生存者バイアスの面もある(交渉中に崩壊した協定は「発効済み」のデータセットに入らない)。一方で、プランAの立ち上げは本当に脆いので、2029〜2030年には年約5%を使う。第二に、機能低下は全期間を通じて基準率よりはるかに低くする(基準率の15.5%→3%に対し、約2.5〜5%)。歴史的な機能低下の記録で支配的なのは、不正による失敗と、発足時から機能不全だった失敗だが、プランAの強力な検証はまさにそれを抑え込むからだ。そのうえで、予定された政権交代の出来事(2032年と2036年の米大統領選挙、2033年頃の中国の指導者継承)に失効の急上昇を個別に加える。さらに、権限移譲とアラインされた超知能が近づくにつれて離反の見返りが大きくなるので、2030年代後半のハザード率がほぼゼロまで下がらないようにしている。

内部視点との比較、注意点、詳細の所在

私の調整後の見積もり(2040年までに累積の破綻確率約62%、累積の失効確率約43%)は、内部視点による「Overall deal decline probability view」タブ(イーライの累積約48%)より悲観的で、調整前の純粋な基準率はさらに厳しい(破綻約79%)。この差は実在し、示唆に富むと考える。決定的な技術をめぐる対立国間の協定の基準率は厳しく、内部視点は、この参照クラスがどれほど確実に失敗するかを軽視しているかもしれない。要素別に見ると、重みづけした失効の基準率(年3.4%)は、スプレッドシートの注記にある一般的な注目度の高い条約の目安「年0.5〜3%」をわずかに上回るにすぎない。一方、機能低下の基準率(年7.9%)ははるかに高い。最も適用可能な参照クラスが、注目度の高い条約全般ではなく、対立国間の能力に関する協定(海軍軍縮条約、JCPOA、米朝枠組み合意、同盟)だからだ。そして、歴史的に協定を終わらせてきた主な要因である政治的な離脱は、プランAの検証がどれほど強力でも無力化されないからだ。

主な注意点。(1) まとめて算出したハザード率は、非常に大きなばらつきを覆い隠している。「正しい」数値は、生存という共通の利益による安定化の効果をどれだけ重視するかに大きく依存するが、それには明確な前例がない。(2) 件数が少なく、対立国間協定の下位区分は一握りの事例に支配されている。(3) 外部視点と内部視点を単純に平均してはならない。部分的に二重計上になるからだ(政権交代は、ここでは基準率の要因として現れ、分解のタブでは明示的な下位原因としても現れる)。(4) 無害な終わり方(予定どおりの期限切れや、より強力な後継条約による置き換え。SALT I、START I、SORT)は失敗として扱っていない。これらを失効に数えれば、失効率はさらに高くなる。(5) プランAには、歴史上によい類例のない構造的な特徴が二つある。離脱時に計算資源が自動的に破壊されることと、存亡に関わる利益が本当に共有されていることだ。これらが実際に効くと考えるなら、どちらも生の基準率よりかなり低い数値を正当化しうる。

詳細の所在:31件の合意のデータセット(条約ごとの推論はO列)、重みづけしたハザード率の実際の計算(パート2)、国際関係論の文献に基づく目安、年ごとの基準率と調整後の値を並べた完全な表(パート3)は、すべて協定の弱体化のスプレッドシートの「Base rates」タブにある。各条約の行には、署名年と発効年、検証の強さ、数値の適用可能性の重み(G列。基準率の数式への入力)、リスクにさらされた年数、失効・機能低下のフラグ、機能低下せずに続いた年数、失効までの年数、主な失敗の形態、推論、出典を記録している。

滑らかな当てはめ(パラメトリック生存分析)

期間別の階段状の基準率(パート2b)は、合意が31件しかないためノイズが大きい。そこで、条約単位のデータに、重みづけした右打ち切りの最尤法で滑らかなパラメトリック生存曲線も当てはめ(パート2c)、指数分布、ワイブル分布、対数ロジスティック分布、対数正規分布をAICで比較した。どちらの結果についても対数正規分布が最もよく当てはまり(失効のAIC 301.8、機能低下のAIC 275.4)、階段状の率が示す形を再現する。当てはめた失効のハザード率は、経過0.5年での年約0.2%から、8〜11年目までに年約4.4%の横ばいへと上がる。山型であり、失効が初期に集中しないことを裏づける。一方、当てはめた機能低下のハザード率は、経過0.5年での年約17%から、経過11.5年までに年約5.6%へと滑らかに減衰する(初期に集中)。ワイブル分布は、より単純な代替としては妥当だ(機能低下はk=0.71で単調減少のハザード率、失効はk=1.1でほぼ横ばい)が、山型を作れないので、失効については当てはまりが足りない。対数ロジスティック分布はその中間だ。当てはめた年ごとのハザード率は、パート3のL〜M列に、階段状の基準率と並べて置いてある。2029〜2040年では、累積の失効確率は約34%、累積の機能低下確率は約69%になり、階段関数での値(39%/65%)に近いので安心できる。注意点として、N=31で、一握りの対立国間協定に重みが大きく偏っているので、当てはめた曲線は精密な推定値ではなく、小さな標本を滑らかに要約したものとして読むのがよい。パート2cのパラメータは編集できるので、ストレステストをしたければ変えてみてほしい。