考えうるプランの比較
Eli Lifland
はじめに
この補足資料では、各プランがさまざまな中間指標でどの程度の成果をあげ、どのくらいの確率で素晴らしい未来につながるかを見積もる。話を具体的にするために定量的な指標を使うが、個々の数値にはまったく自信がない。一方で、プランAがプランB〜Dより大幅に優れているという結論には自信がある。プランAに匹敵しうるプランについてはこちらの表を参照してほしい。
ここで見積もるのは、政府や主要企業がそのプランの実行を試みたと仮定した場合に、そのプランがどれだけうまくいくかだ。以下の分類は網羅的なものではない。考えうるすべての未来を最も近いプランに振り分けるのではなく、おおむね記述どおりのプランが試みられたら何が起きるかを考えている。軌道をプランに分類する方法の詳細は後述する。
検討するプランは次のとおり。
-
プランA(シナリオで具体的に実行された形):検証された減速+研究の完全な透明性。 検証された国際的な減速協定と、AI研究の完全な透明性を組み合わせる。安全性に高い確信を保ちながらAIの能力をスケールアップしつつ、協定の弱体化や秘密プロジェクトのリスクとのバランスをとる。
-
プランA:検証された減速+相当程度の透明性。 より広い意味でプランAに分類されるには、無期限の停止ではなく、AIのスケーリングを続けながらの大幅な検証された減速を伴わなければならない。透明性についても、少なくとも、外国政府の監査官が常駐して各国政府に報告書を提出し、その一部を伏せた版が公開される、という水準が必要になる。これは私たちのフィルタリング型透明性の提案で説明したものだ。計算資源の相互確証破壊など、プランのその他の要素は必須ではない。
-
プランB-物理攻撃型:中国を物理的に妨害し、リードの一部を費やす。 中国を妨害して、安全性に費やせるリードを広げる。その際、ドローンや通常ミサイルによる攻撃のような大規模な物理攻撃にまでエスカレートすることも辞さない。プランBに分類されるには、米国が中国に対するリードを安全性のために使う意図を持ち、実際にテイクオフを少なくとも3か月遅らせなければならない。
-
プランB-サイバー型:中国を物理攻撃以外の手段で妨害し、リードの一部を費やす。 プランB-物理攻撃型と同じだが、大規模な物理攻撃までエスカレートする意思はない。サイバー攻撃やサプライチェーン攻撃などが含まれうる。
-
プランC+:国内規制を行い、妨害なしで中国を減速させる。 米国は中国を妨害せず、国内規制によって相当の時間を稼ぐ。中国に対しては、輸出規制や中国人の人材へのグリーンカード付与といった妨害以外の手段で減速を図る。少なくとも2か月の減速を要件とする。
-
プランC:先頭のプロジェクトがリードの一部を費やす。 先頭のAIプロジェクトがリードの一部を安全性に費やし、場合によっては他のフロンティアプロジェクトと調整して、国内規制なしにさらに減速する。少なくとも1か月の減速を要件とする。
-
プランD:開発競争。 フロンティアAIの各プロジェクトが、ほぼ最高速度で知能爆発を駆け抜ける。安全性に割く資源はゼロではないが、ごくわずかだ(少なくとも1%。それを下回る場合はプランEとみなす)。
政府が実行を試みうるプランはほかにもある。その一部は後述する。
話を単純にするため、次のように仮定する。
-
自動コーディングAI(AC)から人間のトップ専門家を凌駕するAI(TED-AI)までの最短のテイクオフは1年弱で、2030年初めから2030年末までかかる。 これはプランAにおけるAI Futures Modelの既定の軌道と一致する。最短のテイクオフとは、先頭のAIプロジェクト群が最高速度で進んだ場合に起きるものだ。
-
どのプランも、プランAのシナリオと同じく2029年初めに実行を開始できる。 ただしプランCとDは、テイクオフが始まるまで何もしないプランなので、この仮定は関係しない。それでも、能力の向上に役立つのであれば、ある程度の安全性研究は行われるかもしれない。
これらの前提を外した場合の、他の著者たちの見解は後述する。
プラン評価表
以下の見積もりはどれも大まかな最善の推測にすぎない。プランAを推す私たちの提言は、個々の数値に依拠しているわけではない(ただし、大筋の結論には依拠している)。
表の各評価の根拠を読む(指標・プラン別)
テイクオフの期間(ACから乗っ取りが可能なAIまで)
自動コーディングAI(AC)から乗っ取りが可能なAIまでのテイクオフの期間。乗っ取りが可能なAIは、おおむね人間のトップ専門家を凌駕するAI(TED-AI)の段階で到来すると予測している。乗っ取りが可能なAIに到達したとは、AIが敵対的にミスアラインしていた場合に、人間がAIによる乗っ取りを止められる見込みが現実的にきわめて低くなった状態を指す。最短・最高速度のテイクオフは1年弱と仮定する(2030年初めにAC、2030年末までにTED-AI)。
プランA
シナリオではACへの到達が2031年、TED-AIへの権限移譲が2040年だ。中央値のケースでは、機能低下していない協定の期間内に権限移譲を行わなければ、プランAの協定はおよそ10年間、機能低下せずに続くと見積もっている。この見方の根拠は協定の弱体化に関する補足資料を参照してほしい。その後も協定は機能低下しながらさらに続きうるが、機能低下のあとまもなく権限移譲が行われる可能性が高い。やや上方修正して、中央値のケースを12年としておく。
ただし、これより前に権限移譲するのが最適な場合もある(たとえばアラインメントでブレークスルーがあった場合)。また、最適でなかったとしても、そもそもプランAの協定が拙く実行され、それほど時間を稼げないかもしれない。そこで、稼げる時間の中央値を2分の1に引き下げ、6年とする。
ACへの到達は2031年、TED-AIへの権限移譲は2040年で、シナリオでは約9年になる。安全税をより重視して最適化するなら、9年以内に払える安全税の上限は約6.5桁になる。ただしそれには、計算資源をより大規模な学習実行に集中させ、ハードウェアもより積極的にスケールアップする必要がある。
プランB-物理攻撃型
米国は大規模な通常兵器による攻撃で、中国の計算資源の保有量と供給量のおよそ90%を破壊できると見積もっている。米国は、まずサイバー攻撃などの手段で半導体工場を妨害し、その後に通常兵器による攻撃へエスカレートして、6か月以内に既存の工場の90%を、2年以内に99%を破壊するところまで進むと仮定する。その後の数年間で、中国は先頭プロジェクトの計算資源を元の総量程度まで積み上げ直せる。その方法は、(a) 地下壕などでより堅固に構築すること、(b) 集約することだ。中国の元の計算資源の総量は米国の先頭プロジェクトの約10%なので、中国のテイクオフは既定では米国より約5倍遅く(根拠はこちら)、約5年かかる。米国は「中国追随」戦略をとり、中国に追いつくのに必要な範囲でしかソフトウェアを進歩させないと仮定する。しかし、中国も独自の妨害で応じると仮定する。具体的には、中国は台湾の半導体工場を爆破して、6か月以内に米国のチップ供給の90%を破壊できる。また中国は、通常兵器による攻撃を含まない予測で仮定したのと同じ効果で米国にサイバー攻撃を仕掛けられ、米国も上記のサイバー型の予測と同じ効果で中国にサイバー攻撃を仕掛けられる。そのため、米国の先頭プロジェクトの計算資源はごくゆっくりとしか増えない。つまり米国は中国のペースに合わせるためにある程度ソフトウェアを進歩させる必要があり、米中は互いの進歩をすべて盗み合う。大まかなモデル化によれば、この結果テイクオフの期間はおよそ5年になる。中国が当初失った計算資源による減速と、米国のソフトウェアの進歩を盗むことや限られた追加のチップ供給による加速とが、おおむね相殺し合うからだ。能力の低さと、中国に対するわずかなリードを許容しにくいことを考慮して、2.5年に引き下げる。開始時期を早めることについては、上記のサイバー型の分析と同じく、小幅な上方修正を加える。
プランB-サイバー型
半導体工場はサイバー妨害とサプライチェーン攻撃の標的にでき、中国のチップ供給を2030年1月に50%、2031年6月までに最大90%減らせると考える。米国は当初、激しいサイバー妨害で中国が実際に使える学習計算資源を10分の1に減らせるが、その後の数年で中国の防御が向上し、影響は2分の1まで縮むと見積もっている。中国が米国にサイバー攻撃を仕掛ける場合も同じことが起きると仮定する。並行して中国の実験も妨害でき、使える計算資源を当初は3分の1程度に減らせるかもしれない。その影響は数年以内に2分の1未満まで縮む。中国も米国に同じことをする。これは米国の能力向上の速さには影響しない。米国はすでに、可能な量よりはるかに少ないソフトウェアの進歩しかしていないからだ。ただし、安全性研究も妨害を受けるため、安全性に取り組む能力は下がる。大まかなモデル化によれば、有能に実行し、中国と同じ速さでソフトウェアを進歩させる戦略をとった場合、テイクオフの期間はおよそ3年になる。実際には実行はそれほど有能でなく、中国に対するわずかなリードを許容しにくい可能性もあるので、実際のテイクオフの期間の中央値は1.75年とする。2029年初めに開始する場合は、妨害を強化する時間が増えるので、テイクオフの期間は延びる可能性がありそうだが、どの程度かは分からない。逆に、妨害を早く始めすぎると中国の防御が固まり、AC到達後のテイクオフ期間に響くので、期間が短くなることもありうる。中央値はわずかだけ引き上げ、2年とする。
プランC+
プランC+で費やせる中国に対するリードは、最大の場合でおそらく0.5〜3年だ。現在、中国の能力は約8か月遅れているが、中国の進歩の多くは蒸留やアルゴリズムの漏出によるもので、積極的な対策で抑えられる可能性は十分にある。加えて、プランC+には現在より積極的な輸出規制が含まれる。とはいえ、実際には蒸留やアルゴリズムの漏出を防ぐのは難しいだろう。ソフトウェアをあまり進歩させなければ自国のAIはずっと役に立たなくなり、特に中国のソフトウェアの進歩を盗んでいない場合には、中国に追い抜かれるかもしれない。さらに、モデルの重みの窃取も心配しなければならず、これを防ぐのはかなり難しいかもしれない。米国が中国のソフトウェアの進歩を盗んでいると仮定すれば、私たちの最善の推測ではテイクオフは約1.5〜2年になる。どちらになるかは、米国の先頭プロジェクトがアルゴリズム・ソフトウェアのセキュリティを持たないか持つか、そして輸出規制がチップ供給をどの程度減らすかによる。米国が中国の進歩を盗んでおらず、中国は米国の進歩を盗んでいる場合、中国より先行したまま大幅な遅延を得るのはきわめて厳しいように思える(たとえば、中国がわずかに米国を上回るこの約2年のテイクオフを参照)。能力不足と、中国に対するわずかなリードを許容しにくいことによる割引を考慮して、テイクオフの期間の中央値を1.5年とする。
プランC
プランCには定義上、少なくとも5%の減速、つまり約0.5か月の減速が必要だとする。私たちの推測では、プランCの先頭のAIプロジェクトは最も近い競合に対して0.5〜6か月のリードを持ち、そのリードの10〜90%を費やす意思がある(おそらく下限寄り)。そうすると減速量の中央値は1.5〜2か月となり、合計は約1.15年になる。
リードは0.5〜6か月で、中央値を3.5か月とする。その75%を費やすと約2.5か月、つまり約0.22年になる。
プランD
プランDでは定義上、減速はほとんどない。資源の3%が継続的に安全性に割り当てられると仮定する。そうすると減速はおよそ1.5%で、最短1年のテイクオフに対して0.25か月の減速にあたる。
学習計算資源の安全税(桁)
ある能力水準に到達するのに最低限必要な量を超えて費やす学習計算資源を、桁数で表したもの。たとえば、より安全だが計算効率の低いパラダイムで学習させることや、AIによるスケーラブルな監督に計算資源を使うことが含まれる。
プランA
安全税の数値はテイクオフの補足資料から取っている。そこでは、2040年までに世界の計算資源の5%が世界最大の企業に集まり、2030年代後半の学習計算資源の伸びが意図的に抑えられると仮定している。プランAのもとで払える安全税の上限は、シナリオより約3桁大きい。そのうち1桁は計算資源をより多く最大の学習実行に集約することで、2桁は計算資源のスケーリングを続けることで得られる。プランAの実行の中央値の数値を見積もるにあたり、実行の拙さを反映して、安全税の支払いに使う学習計算資源の量に80%の割引を適用する。
安全税の数値はテイクオフの補足資料から取っている。そこでは、2040年までに世界の計算資源の5%が世界最大の企業に集まり、2030年代後半の学習計算資源の伸びが意図的に抑えられると仮定している。プランAのもとで払える安全税の上限は、シナリオより約3桁大きい。そのうち1桁は計算資源をより多く最大の学習実行に集約することで、2桁は計算資源のスケーリングを続けることで得られる。
プランB-物理攻撃型
スプレッドシートを参照。そこでは、余剰計算資源の値をテイクオフのセルでリンクしたモデル化に基づいて設定し、安全税の支払いに使う学習計算資源と、存亡リスクの低減に役立つ用途とに半分ずつ振り分けると仮定している(ただし、テイクオフが長く続くので、追加の学習に使う計算資源をすべて最後の学習実行に投じることはできない)。実行の拙さを反映して、存亡リスクの低減に役立つ用途の計算資源と、安全税の支払いに使う学習計算資源の量の両方に80%の割引を適用する。そのうえで、プランが2029年初めに始まることを考慮して、わずかに上方修正する。
プランB-サイバー型
スプレッドシートを参照。そこでは、余剰計算資源の値をテイクオフのセルでリンクしたモデル化に基づいて設定し、安全税の支払いに使う学習計算資源と、存亡リスクの低減に役立つ用途とに半分ずつ振り分けると仮定している(ただし、テイクオフが長く続くので、追加の学習に使う計算資源をすべて最後の学習実行に投じることはできない)。実行の拙さを反映して、存亡リスクの低減に役立つ用途の計算資源と、安全税の支払いに使う学習計算資源の量の両方に80%の割引を適用する。そのうえで、プランが2029年初めに始まることを考慮して、わずかに上方修正する。
プランC+
プランC+については、モデル化のシートで太字にした余剰計算資源の合計値をスプレッドシートに入力し、実行の拙さ/存亡リスクの低減に役立たない用途を反映した80%の割引を適用する。
プランC
計算はスプレッドシートを参照。プランDでは0.02年、プランCでは0.25年の一時停止が、TED-AIの時点、つまりテイクオフの終わりに起きると仮定している。これをもとに、安全性の目的に使える余剰計算資源の量を計算する。そのうえで、安全税の支払いに使う学習計算資源と、存亡リスクの低減に役立つ用途に使う計算資源とに半分ずつ振り分けると仮定する。ただしプランCでは、その50%の大部分(全部ではない)が最後の学習実行の安全税に回る。実行の拙さを反映して、プランCでは65%、プランDでは75%の割引を適用する。この割引は、存亡リスクの低減に役立つ用途の計算資源と、安全税の支払いに使う学習計算資源の量の両方にかける。ソフトウェアの進歩によってより大きな安全税を払えるようにするモデル化も試したが(スプレッドシートの非表示の19〜23行目)、指標の上ではそれほど良くならず、その進歩は後続の主体に盗まれうる。
プランD
計算はスプレッドシートを参照。プランDでは0.02年、プランCでは0.25年の一時停止が、TED-AIの時点、つまりテイクオフの終わりに起きると仮定している。これをもとに、安全性の目的に使える余剰計算資源の量を計算する。そのうえで、安全税の支払いに使う学習計算資源と、存亡リスクの低減に役立つ用途に使う計算資源とに半分ずつ振り分けると仮定する。ただしプランCでは、その50%の大部分(全部ではない)が最後の学習実行の安全税に回る。実行の拙さを反映して、プランCでは65%、プランDでは75%の割引を適用する。この割引は、存亡リスクの低減に役立つ用途の計算資源と、安全税の支払いに使う学習計算資源の量の両方にかける。ソフトウェアの進歩によってより大きな安全税を払えるようにするモデル化も試したが(スプレッドシートの非表示の19〜23行目)、指標の上ではそれほど良くならず、その進歩は後続の主体に盗まれうる。
安全性向けの計算資源(H100e年)
テイクオフの間に、存亡リスクの低減に役立つ用途(アラインメント、制御、認識の質の向上など)に費やした計算資源。H100換算で何台を何年動かしたか(H100e年)で測る。
安全性研究者・年
テイクオフの間に、最良の社内AIを使える人間の研究者が、存亡リスクの低減に役立つ用途に費やした延べ年数(研究者の平均人数×年数)。
プランA
プランAのサイドパネルのデータによれば、安全性研究者は平均で約10万人いる。存亡リスクの低減に役立つ用途全体をカバーするためにこれを2倍にし、10年を掛ける。中央値のケースも同程度に思えるが、プランAのあまり良くない変種も含めるために50%引き下げる。なお、人間の研究者の平均的な質は他のプランより低くなる。ただし、平均的には偏りも少ない。
安全性研究者は約10万人(サイドパネルのデータ)。存亡リスクの低減に役立つ用途全体をカバーするために2倍にし、約10年を掛けて約200万。
プランB-物理攻撃型
米国のプロジェクトはアルゴリズムを守ろうとして比較的小規模に保たれるが、実際にはそれでも守りきれない。ただし、安全性が重要だと考えているので、その制約の範囲内でできるだけ多くの研究者を集めようとする。どちらの型でも研究者は平均500人とする。
約3,000人 × 約6年
プランB-サイバー型
米国のプロジェクトはアルゴリズムを守ろうとして比較的小規模に保たれるが、実際にはそれでも守りきれない。ただし、安全性が重要だと考えているので、その制約の範囲内でできるだけ多くの研究者を集めようとする。どちらの型でも研究者は平均500人とする。
約3,000人 × 約3年
プランC+
テイクオフを延長する場合の一部では、フロンティアの能力を利用できる研究者が増え、安全性の手法もある程度は企業間で共有されるだろう。社内と一般公開の能力差がほぼゼロかマイナスになる可能性もあるが、その確率は50%未満に思える。1.5 × 1,000 = 1,500とする。
約2,000人 × 2年(この版のC+はアルゴリズムのセキュリティを備えるため、広く共有するのが難しいかもしれない)
プランC
先頭のプロジェクトが何を望むかによって大きく変わるが、一時停止の間に多くの研究者に利用を認めようとする可能性は十分にある。1.13 × 500 = 約500。
約1,500人 × 約1.2年
プランD
『AI 2027』のような状況を想定している。1.02 × 200 = 200。
約1,000人 × 約1年
認識の文化
先頭のAIプロジェクト内部の認識の文化。迎合、集団思考、希望的観測への抵抗力を含む。
プランA
プランAでは、一般への透明性と認識を支えるAIの奨励によって、先頭のAIプロジェクトの認識の質が大幅に改善する。状況を把握するための時間が十分にあることも大きい。ただし、特にフロンティアプロジェクトの数が多いことから、いくつかの問題は残る。本当に良い認識の文化を実現するのは非常に難しいので、プランAの実行の中央値はシナリオより低く評価している。
一般への透明性、認識を支えるAIの奨励、そして状況を把握するための十分な時間によって大幅に改善する。ただし、フロンティアプロジェクトの数が多いこともあり、いくつかの問題は残る。
プランB(物理攻撃型・サイバー型)
プロジェクトは安全保障が重視され戦時的な空気をまとう世界で進むので、テイクオフの期間が延びることを考慮する前の段階では、認識の質はプランDと同程度か、それより悪くなりそうだ。テイクオフの期間が延びれば文化がずっと良くなる可能性もあるが、それに賭けるつもりはない。
プランC+
減速を選ぶこと自体が、より健全な文化のある程度の証拠になる。しかし、認識の質を下げる方向の強い圧力と選択効果は残る。
プランC
減速を選ぶこと自体が文化についての証拠になるので、プランCはより良い認識の文化と相関する。しかし、認識の質を下げる方向の圧力と選択効果は依然として働く。
プランD
プランDでは一般に、迎合、集団思考、希望的観測などが蔓延する。
一般への透明性
先頭のAIプロジェクトの一般への透明性。社内の能力、AIの学習過程、企業の予測などについて、外部の人々がどれだけ知っているか(たとえば、社内と一般公開の能力差がどれだけ小さいか)。
プランA
完全な透明性のプランを参照。プランAの実行の中央値では、透明性はそこまで徹底しない可能性が十分にある。
完全な透明性のプランを参照。一般への透明性は高い。
プランB(物理攻撃型・サイバー型)
プランBの実行の中央値では、フロンティアAIの能力や学習アルゴリズムの詳細を中国などの国家主体から守ろうとするので、一般への透明性はほとんどない。
安全保障上の懸念があるため、うまく実行されたプランBでも透明性を高く保つのは難しい。
プランC+
プランDより透明にできる可能性はあるが、企業の経営陣が何を望むか次第だ。
望めばかなり透明にできるが、中国に追いつかれたくないという事情で制約を受ける。
プランC
プランCではこの問題を緩和できる可能性があるが、企業の経営陣が何を望むかによっては緩和されないかもしれない。
望めばかなり透明にできるが、リードを保ちたいという事情で制約を受ける。
プランD
プランDでは、『AI 2027』の開発競争エンディングと同じく、一般に社内と一般公開の能力差が大きい。そのため、社内の能力は一般にあまり知られない。
望めばかなり透明にできるが、リードを保ちたいという事情で制約を受ける。
権力の分散
AIをめぐる権力が、単一のプロジェクトや主体に集中せず、どれだけ広く分散しているか。1〜5で採点し、5が最も分散している状態。
プランA
プランAでは、多くの国の多数のフロンティア企業に権力が分散する。この点は、実行が拙くてもかなり揺らぎにくいように思える。ただし、プランAからどこまで逸脱してもプランAの実行とみなすかによる。
多くの国の多数のフロンティア企業に権力が分散する。
プランB(物理攻撃型・サイバー型)
プランBでは一般に、政府が選んだか国有化した単一の米国プロジェクトが、競合をはるかに引き離す。
難しくはあるが、うまく実行されたプランBなら、極端な権力集中の高いリスクを避けられる可能性はある。ただし、一般の人々を意思決定の輪に加えるのは難しいだろう。
プランC+
企業間の差はプランDより多少縮まるが、極端な権力集中が起きやすい条件は依然として整っている。
うまく実行すれば、国内規制は、政府への権力集中に行き過ぎることなく、AI企業への権力集中のリスクを抑えるのに大いに役立ちうる。
プランC
プランCでは、一方的な一時停止によって企業間の差が縮まるが、全体としては依然として極端な権力集中が起きやすい条件が整っている。
減速によって、監督の仕組みを整えるための時間が少し得られる。
プランD
プランDでは、単一の企業が他社を大きく引き離すので、AIがアラインされていれば、その企業の経営陣が自らの権力を無期限の独裁に近いものへと固められる可能性が十分にある。
減速がほぼないため、極端な権力集中の機会を避けるのは難しい。とはいえ、多少なりとも役立つ対策は確かにある。
p(alignment)、つまり 1 − p(misaligned takeover)
このプランのもとで、先頭のAIが十分にアラインされ(つまり人間が意図した目標を追求し)、ミスアラインしたAIによる乗っ取りを避けられる確率。
プランA
スプレッドシートを参照。最終状態を権限移譲と協定の弱体化に分解して計算し、そのうえで、能力が低いことを踏まえて下方修正した。
スプレッドシートを参照。最終状態を権限移譲と協定の弱体化に分解して計算し、そのうえで上方修正した。計算では単純な基準戦略に従うと仮定しているが、有能なプランAの実行なら、はるかに多くの分析に裏打ちされ、特に協定の期間が長くなるにつれてより多くの証拠を得られるからだ。
プランB(物理攻撃型・サイバー型)
プランCを40%としているので、それと比較しながらこの数値を論じる。プランCに対する主な利点は、逐次的な時間がはるかに多いことと、政府による監督がはるかに強いことだ。一方で、プランCのほうが透明性と権力の分散がやや優れ、認識の環境も良い可能性がある。さらにプランBには、中国の妨害を防ぎつつ中国を首尾よく妨害できる可能性があるので、存亡リスクの低減に役立つ用途に大量の計算資源を費やせる見込みも加わる。全体として、プランBはプランCより良いが、大差ではない。
p(great future | alignment)
アラインメントが解決されたという条件のもとで、それでも未来が素晴らしいものになる確率。極端な権力集中(COP)などのリスクや、その他の経路依存性を反映する。
プランA
スプレッドシートを参照。最終状態を権限移譲と協定の弱体化に分解して計算し、そのうえで、能力が低いことを踏まえて下方修正した。
スプレッドシートを参照。最終状態を権限移譲と協定の弱体化に分解して計算し、そのうえで上方修正した。計算では単純な基準戦略に従うと仮定しているが、有能なプランAの実行なら、はるかに多くの分析に裏打ちされ、特に協定の期間が長くなるにつれてより多くの証拠を得られるからだ。
プランB(物理攻撃型・サイバー型)
プランBでは P(extreme COP | alignment) は35%とする(プランDは35%、プランCは25%)。国有化や準国有化は恐ろしいものの、プランDより高くはしていない。未来のその他の側面については確信がないが、逐次的な時間が増えるぶん、プランBはプランCよりわずかに良いかもしれない。とはいえ、一般への透明性やモデルへのアクセスがないことは痛手だ。時間が増えれば、AIを使って認識の質や意思決定理論を改善したり、宇宙のガバナンスを考え出したりするのに役立つ。また大局的に見て、物事を減速させ、素晴らしい未来とはどのようなものか、そこへどう舵を切るかを社会が考える時間を確保するのは、限界的には良いことに思える。その際には、素晴らしくない未来につながりうる経路依存性に注意を払う。
プランC+
プランC+はプランCよりわずかに良い。
プランC
プランCでは P(extreme COP | alignment) は25%で、プランDの35%より低い。プランCでは、機密扱いの政府プロジェクトを伴わずに、各主体が事態に気づいて極端な権力集中を防ぐ機会が多いからだ。ただし、極端な権力集中が起きるかどうかは素晴らしい未来になるかどうかと完全には対応しないので、この差だけでは p(great future | alignment) 全体の差は10%未満にとどまる。とはいえ、追加の時間は他にもさまざまな面で役立つ。たとえば、AIを使って認識の質や意思決定理論を改善したり、宇宙のガバナンスを考え出したりすることだ。詳しくは上記のプランBの理由づけを参照。
プランD
プランDでは P(extreme COP | alignment) は35%で、プランCの25%より高い。プランCでは、機密扱いの政府プロジェクトを伴わずに、各主体が事態に気づいて極端な権力集中を防ぐ機会が多いからだ。ただし、極端な権力集中が起きるかどうかは素晴らしい未来になるかどうかと完全には対応しないので、この差だけでは p(great future | alignment) 全体の差は10%未満にとどまる。とはいえ、追加の時間は他にもさまざまな面で役立つ。たとえば、AIを使って認識の質や意思決定理論を改善したり、宇宙のガバナンスを考え出したりすることだ。詳しくは上記のプランBの理由づけを参照。
客観的な指標では、プランの順位はアルファベット順に並び、プランAとプランBの間には大きな開きがある。ただし、主観的な指標のいくつかでは、プランC+とプランCがプランBを上回る。プランBは安全保障を重視し戦時的な空気をまとうため、社会の認識の質を損なうおそれがある。また、国有化やそれに近い形をとる可能性が高く、そうなれば一般への透明性は下がり、権力も集中する。
プランの実現の見込みと結果についての著者間の比較
以下の見積もりは、能力の既定の推移、プランが実行される時期、プランの実行の巧拙に関する不確実性をまとめて織り込んでいる。数値はこのスプレッドシートにあり、プランの分類は後述のとおりだ。
実現の見込み
結果
ここでは p(alignment)、つまり 1 − p(misaligned takeover)(ミスアラインしたAIによる乗っ取りが起きない確率)に注目する。話を単純にするため、この節では p(great future | alignment)(アラインメントが成功した場合に素晴らしい未来となる確率)は考慮しない。
その他のプラン
政府がとりうるプランはほかにも数多くある。以下では、私たちが最も有望だと考えるもの、あるいは最も起こりそうだと考えるものをいくつか挙げる。
プランAに匹敵しうるプラン
概要 | 利点(プランAと比べて) | 欠点(プランAと比べて) |
プランS: **無期限の停止。**フロンティアAIの能力向上をすべて停止し、少なくとも数年は続けることを目指す。プランSには変種がいくつかあり、AI開発を再開する条件がそれぞれ異なる。たとえば、アラインメント研究の進展、嘘発見器、人間のアップロード、知能増強などが条件になりうる。 | 減速の期間が長くなると見込まれ、急ぎすぎたスケーリングに対する安全の余裕も大きい。プランとしてより単純になる可能性がある。 | 人間の範囲内にあり制御可能なAIまでスケールすることは、アラインメントや制御の研究、社会の認識の質、検証、AI全般の理解を加速するのに役立つ。 |
**国内先行型のプランA。**AIを国内で十分に規制し、AIによる乗っ取りのリスクを許容できる水準まで下げる。そのためには長期の減速が必要になる。他国も国内で規制を行い、プランAのようなものが不要になる可能性もある。そうならなければ、後からプランAに移行する。 | 最初の段階は米国単独で実現でき、タイムラインを大幅に延ばせるので、国際段階が実現しなくても非常に役立つ。中国との信頼を先手を打って築ける。 | プランAの交渉を同時に進める場合に比べて、秘密プロジェクトへの対処や検証体制の構築の面で劣る。開発競争の力学のせいで、政治的に実現できないおそれがある。 |
**GPU軍備管理。**過去の軍備削減協定にならい、各国がGPUの保有量や流通量を制限する国際合意を結ぶ。 | 執行がはるかに容易で、歴史上の前例も多い。相当の減速を実現できる。 | 減速の幅は小さく、安全税を払う余裕も小さい。開発競争の力学が続くため、技術ツリーのより安全な経路へ向けて協調できない。 |
**AI版CERN。フロンティアAIを開発する国際プロジェクト。**他のすべてのプロジェクトは、能力面で大きく後れをとるよう規制される。 | 秘密プロジェクトへのアルゴリズムの漏出や蒸留を防ぎやすい。最先端にいる主体が少ないため、執行しやすいかもしれない。 | 透明性が低く、広く配備されないため、意思決定が悪くなる(技術的な安全性に関する判断も含む)。権力集中のリスクが大きくなる。 |
プランAより明らかに劣ると考えるプラン
-
GPUの転用: GPU軍備管理に似ているが、GPUを破棄する代わりに、存亡リスクの低減に役立つ用途に使うことを義務づける。より具体的な提案としてはこのコメントがある。そこでは、GPUを外部の安全性研究組織に推論能力として提供するか、一般に公開された透明な安全性研究に使うことを義務づけている。理屈の上ではこのプランはGPU軍備管理より優れているはずだが、後戻りしやすく、執行も難しい。
-
減速しないプランB(別名D-戦争型): プランBと同じだが減速しない。つまり、中国を妨害して広げたリードをほぼまったく費やさない。(上記の見積もりでは、現状ではプランDの一変種として分類している。)
-
中国とのより弱い協定。 たとえば米国は次のように持ちかけられる。「そちらの取り組みを完全に透明にしてくれるなら、AI推論用のチップをもっと入手できるようにし、こちらの安全要件について拘束力のない、あるいは過半数に満たない発言権を与えよう」
-
プランE: プランDと同様だが、安全性への投資はさらに少なく、資源の1%未満にとどまる。
軌道をプランに分類する方法
実行ウィンドウを、次の二つの時点の間の期間と定義する。
-
開始:最高速度でスケールした場合に自動コーディングAI (AC)に到達するはずの時点の1年前。 ACとは、AGIプロジェクトのコーディング作業を完全に自動化し、そのプロジェクトのコーディング担当者全員を自律的に置き換えるAIの集団だ。つまり、AIの使用をやめるくらいなら人間を全員解雇するほうがましだという状態を指す。
-
終了:乗っ取りが可能なAI。 乗っ取りが可能なAIに到達したとは、AIが敵対的にミスアラインしていた場合、人間がAIによる乗っ取りを止められる見込みが現実的にきわめて低くなった状態を指す。インターネットを遮断するといった極端な手段をとれば、理論上はまだAIを停止できるかもしれない。しかし、実際にそうする可能性は低い。たとえば、社会がAIに大きく依存していたり、AIが高い説得力を持っていたりするからだ。
この期間を通じて試みられるプランが一貫していれば、その軌道はそのプランに分類される。複数のプランが試みられた場合でも、一つの軌道は最大一つのプランにしか数えない。これは自明な選択ではなく、軌道を複数のプランに数えるのも妥当に思える。
実行ウィンドウの間に複数のプランが試みられた場合、その軌道は、試みられたプランのうち最も強度の高いものに分類する。一般的な分類基準としてはやや曖昧だが、具体的には、プランS/A/B/C+/C/Dの中では、試みられたプランのうちこの並びで最も前にあるものに分類する。その理由は次のとおりだ。協定がすぐに崩壊したとしても、その軌道は主としてプランAまたはSとみなすべきだと直感的に思える。同じく、より強度の低いプランから始まっても、実行ウィンドウ内にA/Sへ移行したなら、やはりプランAまたはSとみなすべきだろう。
この分類からは、次のような選択効果が生じる。強度の高いプランに分類される軌道ほど、有能な人々が担っている傾向がある。さらに、強度の低いプランに分類される軌道は、懸念すべき証拠が現れても人々がより強度の高いプランへ移行しなかったものに偏る。
一方、私が明示的に取り除いている選択効果もある。アラインメントの難しさなどの背景変数が、軌道をどのプランに数えるかに及ぼす影響だ。つまり、プランを評価するにあたっては、どのプランが試みられてもアラインメントの難しさの分布は同じだと仮定している。具体的には、アラインメントの難しさの分布について私が全体として推測しているものを用いる。前述のとおり、人間の能力のように人間が左右できる要素については、このような除去は行わない。
付録
学習計算資源の安全税の定義
学習計算資源の安全税とは、ある能力水準に到達するために学習実行で実際に使った計算資源の量と、その能力に到達するのに最低限必要な計算資源の量との差だ。この余分な計算資源を有効に使う方法としては、たとえば、より安全だが計算効率の低いパラダイムで学習させることや、AIを使ったスケーラブルな監督に大量の計算資源を投じて学習過程のインセンティブを改善することが考えられる。
この方法で安全税を測るのは、本当に関心のある事柄の不完全な代理指標にすぎない。同じだけの能力をもたらす改良であっても、その改良を見送ることが安全性にどれだけ役立つかは、改良ごとに大きくばらつくと考えられる。
どの変種のプランSを実行するかによるが、プランAとのその他の違いとしては、計算資源の増設が遅くなることや、透明性が低くなることが考えられる。
この特殊なケースとして、GPUの一時停止がある。GPUの一定割合について、(i) 電源を切るか、(ii) 暗号資産のマイニングに使う(あるいは、AI研究開発以外の検証可能な用途に使う)ことを義務づける。この提案には、GPUの停止を解除しやすくなるという利点と欠点の両方がある。
ただし、小規模な一般公開や選択的な透明性によって、この問題を緩和できるかもしれない。
プランの実行開始をもっと早い時点まで認めるべきかもしれない。プランの強度が非常に高い場合は特にそうだ。たとえばプランSは、既定のAC到達時期の1.5年前に始まっても、おそらく数に入れるべきだろう。