能力スケーリング戦略

Eli Lifland

概要

プランAとプランDの能力の推移自動コーディングAIAI研究開発の加速倍率 3×超人的AI研究者AI研究開発の加速倍率 20×人間のトップ専門家を凌駕するAIAI研究開発の加速倍率 400×圧倒的な超知能AI研究開発の加速倍率 10,000×プランA — 能力水準に応じた加速倍率自動コーディングAI実現した加速倍率 3×人間のトップ専門家を凌駕するAI実現した加速倍率 約40×最大制御可能AI2040年:権限移譲2029年末2030年半ば2030年半ば2030年末2034年末2031年初めプランD協定なし — 知能爆発プランA減速協定 — 制御されたテイクオフ20262028203020322034203620382040

プランAのシナリオで、コンソーシアムはなぜ、2035年に人間のトップ専門家を凌駕するAI(TED-AI)に到達するまで着実に能力を高め、その後はほぼ一時停止に近い水準まで減速したうえで、2040年にそのAIへ権限を移譲するという道を選ぶのか。この補足資料では、能力をスケールアップしていく大局的な戦略と、その背後にある理由を説明する。

一言でいえば、プランAにおけるスケーリングの大局的な戦略は、スケーリングが安全だという高い確信を保てる範囲で、できるかぎり速くスケールアップすることだ。もう少し詳しく述べよう。

まず、プランAで採用されている能力スケーリングの大局的な戦略と、その背後にある理由を論じる。この戦略は2つの段階に分けられる。

  1. 最大制御可能AIの近くまでスケールアップする。 最大制御可能AIとは、仮にミスアラインしていたとしても破局を引き起こさせないよう防げると確信できる、最も能力の高いAIのことだ。シナリオでは、最大制御可能AIはおおむねTED-AIに当たると予測している。

  2. ほぼ停止するまで減速し、最終的にAIへ権限を移譲する。

次に、能力のスケールアップに時間をかけることのコストを論じる。最も重要なのは協定の弱体化のリスクだ。

最後に、第1段階と第2段階について推奨する戦略を、より詳しく論じる。

実際には、最善の戦略を決めるには、この補足資料で行ったよりもはるかに多くの分析が必要だ。さらに、プランAを実行していく過程で情報が入ってくるたびに、戦略を調整すべきである。ここで述べるのは、現時点での私の最善の推測だ。

スケーリングを遅くする方向に働く最も重要な考慮事項は特定できている、と私は確信している。私たちが示す大局的な戦略が正しいことについては、ある程度は確信しているが、強い確信ではない。精密な定量的推定については、どれにも確信を持っていない。

大局的な戦略

軌道の全体像

無期限に一時停止するのではなく、そもそもスケールアップを選ぶのは、ゆっくり進むことのコストがあるからだ。最も重要なのは協定の弱体化、つまり減速協定が失効したり実効性が落ちたりするリスクである。

私たちが目指すのは、次のような形の軌道だ。

プランAは、一様に減速した知能爆発よりも、高い能力水準で長い時間を過ごす自動コーディングAI実現した加速倍率 3×人間のトップ専門家を凌駕するAI実現した加速倍率 約40×2029年:2通りの減速2040年:権限移譲2035年初め2030年半ば2034年末プランA減速協定 — 制御されたテイクオフ一様な減速一様に減速した、制御されない知能爆発20262028203020322034203620382040

プランAは、大きく2つの段階に分けられる。

  1. 第1段階:最大制御可能AIまでスケールアップする。

  2. 第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する。

こうして得られる曲線は、まず比較的速く上昇し(それでも制御されていない知能爆発よりは遅い)、その後しばらくはほぼ停止に近い水準まで減速する。知能爆発を一様に減速させた場合に得られる曲線とは対照的だ。

この種の曲線を目指すのは、アラインメント、認識、協定の安定化といった重要な用途に非常に役立つAIとともに過ごす時間を、できるだけ長くしたいからだ。また、初期にこれだけ速く進んでも、安全性への高い確信を保ったまま管理できると考えている。

第1段階:最大制御可能AIまでスケールアップする

この段階では、コンソーシアムは最大制御可能AIを少し下回る水準まで能力をスケールアップし、その後はそれ以上のスケーリングをほぼ停止する。 最大制御可能AIとは、AIに対する制御を保てていると確信できる最大の能力水準のことだ。ここでいう制御とは、AIが仮にそう望んだとしても破局的な被害を引き起こせない、という性質を指す。この水準は、おおよそ人間のトップ専門家を凌駕するAI(TED-AI)、つまりあらゆる認知タスクで人間のトップと同等以上の能力を持つAIに当たると考えている。

戦略: 進歩は、ソフトウェアの進歩ではなく、できるかぎり学習計算資源のスケーリングによって実現することを推奨する。ソフトウェアは秘密プロジェクトに利用されうるからだ。

私たちの最善の推測では、コンソーシアムは、所在が把握できていない計算資源の量をもとに、秘密プロジェクトが存在するかどうかをかなり正確に見当づけられるだろう。証明まではできないかもしれないにしてもだ。また、秘密プロジェクトはおそらく存在しないだろうと予測している。コンソーシアムが、秘密プロジェクトが存在する可能性が高いと考えつつも、秘密プロジェクトの探知について私たちの現時点での最善の推測(5年以内に約60%の確率)と同じ見方をしているなら、秘密プロジェクトを理由に本来より遅く進むべきかどうかは際どい判断になる。探知について私たちの現時点での最善の推測よりもかなり悲観的であれば、ソフトウェアの進歩を大量に生まないよう減速すべきであり、その結果、第1段階には少なくとも約5年をかけることになる。 逆により楽観的であれば、速度を制約する要因は、制御への高い確信を保つことと、不安定化を避けることになるはずだ。 速くスケールアップすることの利益は、(a) コンソーシアムが、有用な作業の自動化や実験対象に使える、より能力の高いAIを手にできること、(b) 協定の弱体化のリスクが下がることだ。

第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する

制御が難しくなるほど能力の高いAIを手にしたら、コンソーシアムはしばらくのあいだ減速する(一時停止に近い状態にする)。その後、制御策を緩めてAIへ権限を移譲する。 制御策を緩めるとは、AIが仮にミスアラインしていた場合に世界を乗っ取れる可能性が高まるのと引き換えに、AIが物事を成し遂げる力をより大きく与えることを意味する。この補足資料では、単純化のため、権限移譲を「するかしないか」の二択としてモデル化する。

戦略:おおよそ、AIがアラインされているという高い確信をコンソーシアムが得るまで待ち、それから権限を移譲するという戦略だ。 より正確にいえば、コンソーシアムは、先延ばしによってAIがアラインされている確率を高める利益を、さまざまなリスクが上回るまで待つべきである。そのリスクとは、協定の弱体化、秘密プロジェクトが危険な能力に到達すること、パンデミックなどほかの存亡リスクだ。第2段階では、協定の弱体化がはるかに大きな要因になると考えている。大まかには、次のどちらかが成り立った時点で権限を移譲すべきだ(詳しくは後述)。

  1. アラインメントが解決されたという非常に高い確信(たとえば99.5%)があり、そのため研究を続けることによる追加の上積みが小さい(たとえば年約0.1%)。

  2. アラインメントが解決されたというやや高い確信(たとえば95%)があり、そのため研究を続けることによる追加の上積みがやや大きい(たとえば年約1%)。ただし、プランAの協定がやや不安定に見える。たとえば、協定が弱体化する確率が年5%を超えるなら、権限移譲に傾く。

スケールアップに時間をかけることのコスト

第1段階で能力を高めるのに時間をかけたり、第2段階でAIへの権限移譲に時間をかけたりすることのコストのうち、最も大きいものを以下に挙げる。

第一に、協定が失効したり、悪化したりするおそれがある。これを協定の弱体化と呼ぶ。 協定の弱体化には、次の両方が含まれる。

協定の失効。 協定が正式に失効する。

協定の機能低下。 協定は失効していないものの、適切に実施され遵守されていた場合と比べて、実効性が大幅に落ちる。協定の機能が低下する経路には、次のようなものがある。

  1. 協定の執行の緩み。 協定が以前ほど厳格に執行されなくなる。たとえば、あからさまに違反している国が罰せられない。その結果、協定の文言への違反が増える。

  2. 協定の運用の失敗。 協定の文言は守られているが、その運用がまずい。

  3. 協定の改定。 協定が明示的に改定され、内容が悪くなる。単純な弱体化の場合もあれば、不必要に監視を強化するなど、別の形で悪くなる場合もある。

詳しくは協定の弱体化に関する補足資料を参照。

第二に、国家主体やテロリストが秘密プロジェクトでモデルを違法に利用することによるリスクがある。 ミスアラインしたAIや悪意ある主体の手に渡れば破局的な結果を招くような能力を秘密プロジェクトが持つなら、AIによる乗っ取りや悪用のリスクは高まる。第2段階とは異なり、第1段階では、コンソーシアムは(第1段階の長さとして現実的な範囲内で)秘密プロジェクトに勝つためにより遅く進むべきだ。速く進みすぎると、ソフトウェアの進歩を大量に生む必要があり、それが秘密プロジェクトを利することになる。詳しくは後述する。

最後に、AIへの権限移譲までのあいだに直接生じる、移譲前の存亡リスクがある。 秘密プロジェクトに由来するリスクは含まない。このリスクは次のように分けられる。

  1. 合法的な(つまり秘密ではない)モデルの能力の利用に由来するリスク。

  2. 合法的なモデルの能力に由来しないリスク。たとえば、小惑星のリスクや、合法的な最先端AIを因果的な起点としない核戦争など。

加えて、協定とは無関係に世界に生じる変化があり、それはゆっくり進むことのコストにも利益にもなりうる。 たとえば、力の均衡が変化し、民主主義国に対して権威主義国の力が相対的に強まることも、その逆もありうる。

第1段階:最大制御可能AIへのスケールアップ

ゆっくり進むことの利益とコスト

第1段階での私たちの目標は、最大制御可能AIへ向かう過程で、学習計算資源をどれだけの速さでスケールアップし、ソフトウェアの進歩をどれだけの速さで生むかという方針を決めることだ。つまり、最大制御可能AIに到達する目標終了日を持つ軌道を設定し、各時点での学習計算資源とソフトウェアの進歩の配分を定めたい。単純さと扱いやすさのため、目標終了日をあらかじめ定め、第1段階の全期間を通じてその日に向けてスケールアップしていく戦略だけを検討する。実際には、コンソーシアムは第1段階を通じて情報を得るにつれ、戦略を調整すべきだ。


進歩は、ソフトウェアの進歩ではなく、できるかぎり学習計算資源のスケーリングによって実現することを推奨する。ソフトウェアは秘密プロジェクトに利用されうるからだ。

また、どれだけの学習計算資源の安全税を払うかも決める必要がある。安全税とは、ある能力水準に到達するために学習実行で実際に使った計算資源の量と、その能力に到達するのに最低限必要な計算資源の量との差である。高い安全税を払うことは、より安全な学習アルゴリズムを使えることを意味する。その代わり、使われないまま秘密プロジェクトに漏れるソフトウェアの進歩を余分に生むことになる。

第1段階でゆっくり進むことの主なコストは次のとおり。

  1. 前述のもの。 つまり、時間がかかることによる協定の弱体化のリスク、(非常に長く一時停止した場合の)秘密プロジェクト、直接的な存亡リスクである。

  2. より能力の高いAIとともに過ごす時間を失う。 そうしたAIは、有用な作業(アラインメント、制御、認識など)の自動化や、実験対象として使える。協定の安定化を助け、年あたりの弱体化リスクを下げることもできる。

第1段階でゆっくり進むことの主な利益は次のとおり。

  1. 進歩のうちソフトウェアの改良に由来する割合が小さくなる。ソフトウェアの改良は秘密プロジェクトに模倣されうるので、これは望ましい。 進歩の源泉は、ソフトウェアの進歩と学習計算資源のスケーリングの2つだ。ソフトウェアの進歩はほとんどが公開されるので、秘密プロジェクトにも広まる。そのため、秘密プロジェクトは最終的には超知能までスケールアップすべき理由の一つである一方で、10年を大きく超える時間をかけるのでないかぎり、第1段階でより遅くスケールアップすべき理由にもなる。

  2. AIをどこまで制御できているかを過大評価したことによる、AIによる乗っ取りのリスクが小さくなる。

  3. 不安定化が小さくなる。不安定化は、(ほかの影響とあわせて)年あたりの協定の弱体化の確率を高める可能性がある。 不安定化を招く影響の例として、超人的な説得能力を持つAIまでスケールアップし、それへの防御が十分でなかったために、認識の質が低下する場合が挙げられる。ただし前述のとおり、より優れたAIは安定化にも働き、年あたりの協定の弱体化リスクを下げうる。

コンソーシアムの戦略には、ソフトウェアの改良の発見を避けられないかもしれないという制約もある。理由は2つある。(a) 増えた計算資源を活用するには、何らかのソフトウェアの改良が必要になるかもしれない。(b) 安全性の研究開発を大量に行えば、ソフトウェアの進歩という形で、能力向上の外部性がある程度生じるのはおそらく避けられない。私たちのシミュレーションでは、コンソーシアムが学習FLOP/sを1桁(1 OOM)増やすごとにソフトウェアの進歩を0.2桁生むものとし、第2段階ではコンソーシアムのアラインメント研究が年0.25桁のソフトウェアの進歩という割合で能力向上の外部性を生むものとした。

秘密プロジェクトの存在が考えにくい場合

私たちの最善の推測では、コンソーシアムは、所在が把握できていない計算資源の量をもとに、秘密プロジェクトが存在するかどうかをかなり正確に見当づけられるだろう。証明まではできないかもしれないにしてもだ。また、秘密プロジェクトはおそらく存在しないだろうと予測している。

秘密プロジェクトが存在しそうにないなら、AIを制御できているという高い確信を保ち、社会と協定を不安定にしないかぎりにおいて、できるだけ速くスケールアップすることを推奨する。私たちのシナリオではこのとおりに事が進み、その結果として得られる目標年を2035年と大まかに推測して描いている。 シナリオを書き直すとしたら、目標年はもう少し早くてもよいと、弱い確信ながら推測している。

目標年がリスクの確率に与える影響

秘密プロジェクトが存在しそうな場合は、状況はより複雑になる。速く進む方向に働く協定の弱体化のリスクと、遅く進む方向に働く秘密プロジェクトのリスクとのバランスを取らなければならないからだ。

ここからは、協定の行方をいくらかモデル化してみる。このモデルは、プランAのシナリオと同じく、協定が2029年に始まり、AC(自動コーディングAI)の実現の1年弱前から実施され始めると仮定している。一方で、シナリオのようにACからTED-AI、ACからASIへのテイクオフがそれぞれ約1年かかるとは仮定していない。代わりに、プランAの標準的な軌道のパラメータを中央値とする不確実性を仮定している。2029年の時点でも、意思決定者はテイクオフの速度について大きな不確実性を抱えているだろうと考えるからだ。そのため、コンソーシアムが目標日に到達できない場合もある。実際、検討した中で最も早い目標日である2031年半ばには、到達できないことが多い。この目標日だと、標準的な軌道と同程度の長さのテイクオフになってしまうからだ(標準的な軌道では、協定前の能力からTED-AIまで約1.5年で到達する。一方プランAでは、学習の再開は2030年初めで、コンソーシアムはTED-AIに対して1桁分の安全税を払うことを目指す)。

下のグラフは、第1段階の目標終了日によって、協定の弱体化のリスクと、秘密プロジェクトが最大制御可能AIに到達するリスクがどう変わるかを示している。協定の弱体化と秘密プロジェクトの補足資料で述べた、私たちの最善の推測による予測を前提としている。対象としているのは、第1段階中、または第2段階の最初の5年以内に、協定が弱体化するリスクと、秘密プロジェクトがTED-AIに到達するリスクだ。5年としたのは、シナリオにおける第2段階の長さだからである(詳しくは後述)。検討した最も遅い目標日は2037年だ。私たちのテイクオフのパラメータの中央値では、コンソーシアムがソフトウェアの進歩を最小限にとどめた場合に、TED-AIに到達するのがこの年だからである。

減速のペースによって、協定の弱体化と秘密プロジェクトのリスクはトレードオフになる

秘密プロジェクトの検知協定の弱体化秘密プロジェクトがTED-AIに到達協定が機能を維持秘密プロジェクトが試みられると仮定。どの曲線も、第1段階の終了から5年後の世界の状態を表す。
0%25%50%75%100%協定の機能維持が最大(44.6%)20312032203320342035203620372038第1段階の目標終了時期(TED-AI)世界の割合コンソーシアムのTED-AI到達から5年後

協定の弱体化によるリスクを最小化することと、秘密プロジェクトがTED-AIに到達するリスクを最小化することのあいだに、トレードオフがあるのがわかる。協定の機能を損なわずに第2段階の5年目まで到達する確率を最大化するという点では、2032年から2036年までの目標年はかなり似通っている。探知を考慮しない場合は、2035年から2037年のどれもかなり似た価値になり、2032年、とりわけ2031年はずっと悪く見える。秘密プロジェクトの要因が大きくなるのだから、これは理にかなっている。

リスクの深刻さ

これらのリスクを、互いに同じ深刻さとして扱うのは妥当だろうか。

協定のさまざまな最終状態がどれだけ望ましいかについて、こちらで大まかな推定を行った(要約はこちら)。年ごとに、協定の機能が損なわれずに続くのか、それとも協定が弱体化するか秘密プロジェクトがTED-AIに到達するのかで分けている。これらの推定では、TED-AIに到達した秘密プロジェクト(またはそれが生み出したAI)が、事実上世界を乗っ取る能力と意志を持つと仮定した。

ここからは、結果を第2段階の開始前に起こるか後に起こるかで分類し、協定が第2段階の5年目まで存続した場合と比べてどれだけ悪い結果になるかをもとに、深刻さを計算する。第2段階への移行は、協定の弱体化と秘密プロジェクトのTED-AIのどちらについても、結果の改善に役立つ。TED-AIに到達すれば、より優れたアラインメント手法の発見、認識全般の改善、そのほかの有用な応用が可能になるからだ。

TED-AIに到達した秘密プロジェクトから、人間やAIによる乗っ取りが起こらない可能性もあるので、その分の割引も加える。

失われる価値の割合は、非常に大まかには次のようになりそうだ。

コンソーシアムのTED-AI到達前(第1段階)

コンソーシアムのTED-AI到達後の最初の5年(第2段階)

秘密プロジェクトによる乗っ取りの深刻さ

70%

55%

乗っ取りの確率

55%

45%

秘密プロジェクトのTED-AI到達の深刻さ

39%

25%

協定の弱体化

50%

25%

下のグラフは、協定の弱体化と秘密プロジェクトのリスクが、第1段階と第2段階の最初の5年とにどう分かれるかを示している。

協定の弱体化のリスクは、秘密プロジェクトのリスクよりも第1段階に偏っている

秘密プロジェクトの検知
協定の弱体化(第1段階)協定の弱体化(第2段階の最初の5年)秘密プロジェクトがTED-AIに到達(第1段階)秘密プロジェクトがTED-AIに到達(第2段階の最初の5年)
秘密プロジェクトが試みられると仮定。どの曲線も、第1段階の終了から5年後の世界の状態を表す。
0%25%50%75%100%20312032203320342035203620372038第1段階の目標終了時期(TED-AI)世界の割合コンソーシアムのTED-AI到達から5年後

協定の弱体化のリスクは、秘密プロジェクトのリスクと比べて、第1段階に生じる割合が大きいことがわかる。目標年が2033年以前の場合は特にそうだ。そのため、同じ時点で起きた場合の深刻さだけを比べたときの印象よりも、協定の弱体化は、秘密プロジェクトがTED-AIに到達することより平均して悪い結果になる。では、リスクの水準と、そのリスクが現実化した場合に失われる価値とを組み合わせると何が言えるか、見てみよう。

TED-AIの目標年別:協定の弱体化と秘密プロジェクトのリスクによる期待損失価値

秘密プロジェクトの検知
その事態が起きた場合の損失価値(ドラッグして自分の見積もりに調整できる):
秘密プロジェクトがTED-AIに到達 — 第1段階39%
乗っ取りの場合 70%
秘密プロジェクトがTED-AIに到達 — 第2段階の最初の5年25%
乗っ取りの場合 55%
損失価値の合計協定の弱体化による損失秘密プロジェクトによる損失秘密プロジェクトが試みられると仮定。どの曲線も、第1段階の終了から5年後の世界の状態を表す。
0%10%20%30%損失価値が最小(21.6%)20312032203320342035203620372038第1段階の目標終了時期(TED-AI)期待損失価値

私の単純な方法論には次の2つの問題がある。そのため、上のグラフは、遅い目標日に比べて早い目標日を過度に有利に見せていると解釈すべきだ。

  1. 結果の変数として、失われる価値の割合だけを考えている。しかし、第2段階の5年目に到達することの価値は、目標日が遅いほうが早い場合よりわずかに大きい(ただし、最後の5年間にAIを安全性のために使う効果が、それ以前の年の効果を圧倒するので、この効果の大きさは小さいかもしれない)。

  2. 失われる価値の割合は、早い目標年ほど、特に第1段階では大きいかもしれない。

そのうえで言えば、私の最善の推測によるパラメータ値では、協定の弱体化と秘密プロジェクトのリスクという観点からは、早いほうがよさそうに見える。ただし、その差はそれほど大きくない。失われる価値の割合の期待値は、目標年が2036年の場合、2032年の場合より約2%高いにすぎない。つまり、前述の問題を補正すれば、結論が逆転する可能性もある。

秘密プロジェクトの探知を考慮に入れないと、曲線はより平らになり、失われる価値の水準も高くなる。秘密プロジェクトが存在し、しかもそれを探知できないというのは、何をしても厳しい状況なのだ。どの目標日でも似たような値になるが、前述の問題を考慮に入れると、遅い目標日が有利になる可能性もある。

探知を考慮に入れつつ、秘密プロジェクトまたはそのAIがTED-AIに到達した時点で乗っ取りを行うと仮定した場合も、曲線はかなり平らになる。

まとめ

コンソーシアムが、秘密プロジェクトが存在する可能性が高いと考えつつも、秘密プロジェクトの探知について私たちの現時点での最善の推測(5年以内に約60%の確率)と同じ見方をしているなら、秘密プロジェクトを理由に本来より遅く進むべきかどうかは際どい判断になる。探知について私たちの現時点での最善の推測よりもかなり悲観的であれば、ソフトウェアの進歩を大量に生まないよう減速すべきであり、その結果、第1段階には少なくとも約5年をかけることになる。 逆により楽観的であれば、速度を制約する要因は、制御への高い確信を保つことと、不安定化を避けることになるはずだ。

以上の議論はすべて、第1段階の終わりに、最低限必要な量を1桁上回る学習計算資源という一定の安全税を払うと仮定していた。これが私の推奨であり、シナリオで描いた安全税でもある。この推奨は、単純なモデル化と直感的な判断を組み合わせたものに基づいている。確信はない。安全税を高くすれば、より高い能力水準でも制御への確信を強められる。一方で欠点は、ソフトウェアが秘密プロジェクトに漏れることと、使わずにおいたソフトウェアの改良が蓄積してオーバーハングを生み、協定の弱体化後(特に失効後)のプロジェクトに利用されうることだ。

第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する

最大制御可能AI(プランAのシナリオではTED-AI)に到達したら、AIへ信頼を託して権限を移譲するまで、どれだけのあいだ一時停止するかを決める必要がある。この分析では、この段階を一時停止として扱う。ただし実際には、そしてシナリオでも、完全な一時停止からいくつかの点で外れる。(a) 制御手法の改善や不確実性の幅の縮小によって、制御可能な最大の水準が上がる可能性があるので、ごくゆっくりとスケールアップするのが望ましい場合がある。(b) 安全性研究は少なくとも多少の能力向上の外部性を伴う。つまりソフトウェアの進歩が生じ、それは合法的なAIの改良に使われなくても、秘密プロジェクトに漏れる。

第2段階で権限移譲を先延ばしにすることのコストは、前述のとおり、協定の弱体化、秘密プロジェクト、直接的な存亡リスクによるリスクである。 秘密プロジェクトは、そもそも存在したとしても、この時点ではおそらくすでに探知されているだろう。そのため、協定の弱体化が一般に支配的な考慮事項になると考えている。

第2段階で権限移譲を先延ばしにすることの主な利益は、権限を移譲する相手のAIがアラインされている可能性が高まることだ。 この利益の大部分は、AIをどうアラインし、そのアラインメントをどう評価するかを解明するアラインメント研究と、「安全税」の支払いからもたらされる。安全税とはたとえば、より安全な学習プロセスを使うために、ある能力水準に到達するのに必要な量より多くの計算資源でモデルを学習させることだ。なお、これはあくまで権限を移譲する相手のAIについての話である。アラインされたAIでも、その後継AIのアラインメントに成功するとはかぎらない(特に、権限移譲の後に何らかの形で状況が悪化した場合)。

副次的な利益として、アラインメントが実現した場合に未来が非常にうまくいく確率が高まることもある。これも非常に重要だが、タイミングへの依存度は、アラインメントの確率ほどは大きくないだろう。さらに、待ちすぎると、アラインメントが実現した場合の結果にとって最終的にわずかにマイナスになる可能性もある。アラインされた最大制御可能AIには、遅くよりも早く権限を移譲して、状況を改善するための自由裁量をより多く与えたほうがよいかもしれない。

第2段階でいつ権限を移譲するかを決めるには、権限移譲を先延ばしにすることの限界的な利益とコストを計算し、コストが利益を上回った時点で移譲することを推奨する。最善の戦略は、AIがアラインされているという高い確信を得た時点で権限を移譲する、といったものになると予想している。

どの戦略が最善かを判断する具体的なケーススタディを以下に示す。

2040年の権限移譲判断の具体的なケーススタディ

ここからは、権限を移譲すべきかどうかについてのケーススタディを論じる。話を具体的にするため、最大制御可能AIに到達してからしばらく経った2040年に、権限を移譲するかどうかを判断している状況を想定する。プランAのシナリオで権限移譲が起こるのがこの年である。

単純化のため、権限移譲を先延ばしにするかどうかを左右する要因は次の2つだけだと仮定する。

  1. 利益:アラインメントの確率の上昇。 アラインメントの進歩がどのような軌道をたどるかについては、後述の議論を参照。

  2. コスト:協定の弱体化のリスク。 権限移譲を早める十分な理由になりうる要因としては、秘密プロジェクトのリスクがもう一つの有力候補だ。しかし、このケーススタディでは秘密プロジェクトのリスクはおそらく非常に低いと推測している。(a) 秘密プロジェクトがあったとしても、おそらくこの時点までに探知されているはずであり、(b) 5年間、安全性研究の外部性以外のソフトウェアの進歩を生んでいないので、秘密プロジェクトはあまり助けを得ていないからだ。

以下では、関連する変数をさまざまに設定して、権限移譲を先延ばしにすべきかどうかについてどのような推奨が得られるかを試せる。既定値は、シナリオで権限移譲が行われる時点の値におおむね合わせてある。また、アラインメント、または協定の失効・機能低下のパラメータを設定する、現実的なプリセットも用意した。

注意:この計算機が比べるのは、それぞれの側で最も重要な要因ひとつだけだ。つまり、延期によって得られるアラインメントの確率と、権限移譲によって避けられる協定の弱体化のリスクである。
1年延期する代わりに権限移譲した場合のp(alignment)の変化
+0.50%
推奨: 今すぐ権限移譲 (弱い推奨)
u_handoff_minus_u_delay = d_prob·a_prob·d_loss − a_change
= (3% × 99.5% × 20%) − 0.1%
権限移譲の便益: 0.60%権限移譲のコスト: 0.10%
シナリオ別の推奨
低リスク
d_prob 0.5%/年 · d_loss 10%
中リスク
d_prob 3%/年 · d_loss 20%
高リスク
d_prob 10%/年 · d_loss 35%
確信度の高いアラインメントの解決策
a_prob 99.5% · a_change 0.1%/年
延期
−0.05%
権限移譲
+0.50%
権限移譲
+3.38%
アラインメントはおそらく解決済み
a_prob 95% · a_change 1%/年
延期
−0.95%
延期
−0.43%
権限移譲
+2.33%
アラインメントは解決済みの可能性が高い
a_prob 80% · a_change 3%/年
延期
−2.96%
延期
−2.52%
延期
−0.20%
アラインメントは明らかに未解決
a_prob 10% · a_change 2%/年
延期
−2.00%
延期
−1.94%
延期
−1.65%
権限移譲すべきか、延期すべきか? - ai-2040.com
注意:この計算機が比べるのは、それぞれの側で最も重要な要因ひとつだけだ。つまり、延期によって得られるアラインメントの確率と、権限移譲によって避けられる協定の弱体化のリスクである。
1年延期する代わりに権限移譲した場合のp(alignment)の変化
+0.50%
推奨: 今すぐ権限移譲 (弱い推奨)
u_handoff_minus_u_delay = d_prob·a_prob·d_loss − a_change
= (3% × 99.5% × 20%) − 0.1%
権限移譲の便益: 0.60%権限移譲のコスト: 0.10%
シナリオ別の推奨
低リスク
d_prob 0.5%/年 · d_loss 10%
中リスク
d_prob 3%/年 · d_loss 20%
高リスク
d_prob 10%/年 · d_loss 35%
確信度の高いアラインメントの解決策
a_prob 99.5% · a_change 0.1%/年
延期
−0.05%
権限移譲
+0.50%
権限移譲
+3.38%
アラインメントはおそらく解決済み
a_prob 95% · a_change 1%/年
延期
−0.95%
延期
−0.43%
権限移譲
+2.33%
アラインメントは解決済みの可能性が高い
a_prob 80% · a_change 3%/年
延期
−2.96%
延期
−2.52%
延期
−0.20%
アラインメントは明らかに未解決
a_prob 10% · a_change 2%/年
延期
−2.00%
延期
−1.94%
延期
−1.65%
権限移譲すべきか、延期すべきか? - ai-2040.com

協定の弱体化の確率と深刻さについて中程度の推定値を用いた理由は、協定の弱体化に関する補足資料で説明している。

アラインメント確率の推定値の推移

アラインメントはどれほど着実に進歩するのだろうか。状況をモデル化するうえで、両極端の2つの見方がある。

  1. 全か無か: 最初は、AIがミスアラインしていると強く確信している。その後、ある時点でブレークスルーが起こり、AIがアラインされたと一気に確信できるようになる。

  2. 滑らかで予測可能な進歩: AIがアラインされているかどうかについての推定が、着実かつ予測可能な形で上がっていく。

不確実性は大きいが、私たちの最善の推測では、AIのアラインメントに対する確信の推移は両者の中間になり、おそらく全か無かにやや近い。両者の組み合わせになる可能性もある。つまり、しばらくは滑らかで予測可能な進歩に見えていて、ある時点で突然ブレークスルーが起こるというものだ。たとえば、野心的なメカニスティック解釈可能性の問題が解決され、AIの推論過程をすべて理解できるようになれば、アラインメントについて非常に高い確信が得られるかもしれない。

たとえば、2040年の時点でまだAIのアラインメントに確信を持てていないなら、ブレークスルーが得られるまでの継続的な改善に加えて、確信をもたらすアラインメントのブレークスルーが年約5%の確率で起こるかもしれない。(シナリオのように)すでに確信を持てているなら、アラインメントの確率はすでに100%に近いので、その上昇はおそらく年0.01〜1%程度だろう。