能力スケーリング戦略
Eli Lifland
概要
プランAのシナリオで、コンソーシアムはなぜ、2035年に人間のトップ専門家を凌駕するAI(TED-AI)に到達するまで着実に能力を高め、その後はほぼ一時停止に近い水準まで減速したうえで、2040年にそのAIへ権限を移譲するという道を選ぶのか。この補足資料では、能力をスケールアップしていく大局的な戦略と、その背後にある理由を説明する。
一言でいえば、プランAにおけるスケーリングの大局的な戦略は、スケーリングが安全だという高い確信を保てる範囲で、できるかぎり速くスケールアップすることだ。もう少し詳しく述べよう。
まず、プランAで採用されている能力スケーリングの大局的な戦略と、その背後にある理由を論じる。この戦略は2つの段階に分けられる。
-
最大制御可能AIの近くまでスケールアップする。 最大制御可能AIとは、仮にミスアラインしていたとしても破局を引き起こさせないよう防げると確信できる、最も能力の高いAIのことだ。シナリオでは、最大制御可能AIはおおむねTED-AIに当たると予測している。
-
ほぼ停止するまで減速し、最終的にAIへ権限を移譲する。
次に、能力のスケールアップに時間をかけることのコストを論じる。最も重要なのは協定の弱体化のリスクだ。
最後に、第1段階と第2段階について推奨する戦略を、より詳しく論じる。
実際には、最善の戦略を決めるには、この補足資料で行ったよりもはるかに多くの分析が必要だ。さらに、プランAを実行していく過程で情報が入ってくるたびに、戦略を調整すべきである。ここで述べるのは、現時点での私の最善の推測だ。
スケーリングを遅くする方向に働く最も重要な考慮事項は特定できている、と私は確信している。私たちが示す大局的な戦略が正しいことについては、ある程度は確信しているが、強い確信ではない。精密な定量的推定については、どれにも確信を持っていない。
大局的な戦略
軌道の全体像
無期限に一時停止するのではなく、そもそもスケールアップを選ぶのは、ゆっくり進むことのコストがあるからだ。最も重要なのは協定の弱体化、つまり減速協定が失効したり実効性が落ちたりするリスクである。
私たちが目指すのは、次のような形の軌道だ。
プランAは、大きく2つの段階に分けられる。
-
第1段階:最大制御可能AIまでスケールアップする。
こうして得られる曲線は、まず比較的速く上昇し(それでも制御されていない知能爆発よりは遅い)、その後しばらくはほぼ停止に近い水準まで減速する。知能爆発を一様に減速させた場合に得られる曲線とは対照的だ。
この種の曲線を目指すのは、アラインメント、認識、協定の安定化といった重要な用途に非常に役立つAIとともに過ごす時間を、できるだけ長くしたいからだ。また、初期にこれだけ速く進んでも、安全性への高い確信を保ったまま管理できると考えている。
第1段階:最大制御可能AIまでスケールアップする
この段階では、コンソーシアムは最大制御可能AIを少し下回る水準まで能力をスケールアップし、その後はそれ以上のスケーリングをほぼ停止する。 最大制御可能AIとは、AIに対する制御を保てていると確信できる最大の能力水準のことだ。ここでいう制御とは、AIが仮にそう望んだとしても破局的な被害を引き起こせない、という性質を指す。この水準は、おおよそ人間のトップ専門家を凌駕するAI(TED-AI)、つまりあらゆる認知タスクで人間のトップと同等以上の能力を持つAIに当たると考えている。
戦略: 進歩は、ソフトウェアの進歩ではなく、できるかぎり学習計算資源のスケーリングによって実現することを推奨する。ソフトウェアは秘密プロジェクトに利用されうるからだ。
私たちの最善の推測では、コンソーシアムは、所在が把握できていない計算資源の量をもとに、秘密プロジェクトが存在するかどうかをかなり正確に見当づけられるだろう。証明まではできないかもしれないにしてもだ。また、秘密プロジェクトはおそらく存在しないだろうと予測している。コンソーシアムが、秘密プロジェクトが存在する可能性が高いと考えつつも、秘密プロジェクトの探知について私たちの現時点での最善の推測(5年以内に約60%の確率)と同じ見方をしているなら、秘密プロジェクトを理由に本来より遅く進むべきかどうかは際どい判断になる。探知について私たちの現時点での最善の推測よりもかなり悲観的であれば、ソフトウェアの進歩を大量に生まないよう減速すべきであり、その結果、第1段階には少なくとも約5年をかけることになる。 逆により楽観的であれば、速度を制約する要因は、制御への高い確信を保つことと、不安定化を避けることになるはずだ。 速くスケールアップすることの利益は、(a) コンソーシアムが、有用な作業の自動化や実験対象に使える、より能力の高いAIを手にできること、(b) 協定の弱体化のリスクが下がることだ。
第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する
制御が難しくなるほど能力の高いAIを手にしたら、コンソーシアムはしばらくのあいだ減速する(一時停止に近い状態にする)。その後、制御策を緩めてAIへ権限を移譲する。 制御策を緩めるとは、AIが仮にミスアラインしていた場合に世界を乗っ取れる可能性が高まるのと引き換えに、AIが物事を成し遂げる力をより大きく与えることを意味する。この補足資料では、単純化のため、権限移譲を「するかしないか」の二択としてモデル化する。
戦略:おおよそ、AIがアラインされているという高い確信をコンソーシアムが得るまで待ち、それから権限を移譲するという戦略だ。 より正確にいえば、コンソーシアムは、先延ばしによってAIがアラインされている確率を高める利益を、さまざまなリスクが上回るまで待つべきである。そのリスクとは、協定の弱体化、秘密プロジェクトが危険な能力に到達すること、パンデミックなどほかの存亡リスクだ。第2段階では、協定の弱体化がはるかに大きな要因になると考えている。大まかには、次のどちらかが成り立った時点で権限を移譲すべきだ(詳しくは後述)。
-
アラインメントが解決されたという非常に高い確信(たとえば99.5%)があり、そのため研究を続けることによる追加の上積みが小さい(たとえば年約0.1%)。
-
アラインメントが解決されたというやや高い確信(たとえば95%)があり、そのため研究を続けることによる追加の上積みがやや大きい(たとえば年約1%)。ただし、プランAの協定がやや不安定に見える。たとえば、協定が弱体化する確率が年5%を超えるなら、権限移譲に傾く。
スケールアップに時間をかけることのコスト
第1段階で能力を高めるのに時間をかけたり、第2段階でAIへの権限移譲に時間をかけたりすることのコストのうち、最も大きいものを以下に挙げる。
第一に、協定が失効したり、悪化したりするおそれがある。これを協定の弱体化と呼ぶ。 協定の弱体化には、次の両方が含まれる。
協定の失効。 協定が正式に失効する。
協定の機能低下。 協定は失効していないものの、適切に実施され遵守されていた場合と比べて、実効性が大幅に落ちる。協定の機能が低下する経路には、次のようなものがある。
-
協定の執行の緩み。 協定が以前ほど厳格に執行されなくなる。たとえば、あからさまに違反している国が罰せられない。その結果、協定の文言への違反が増える。
-
協定の運用の失敗。 協定の文言は守られているが、その運用がまずい。
-
協定の改定。 協定が明示的に改定され、内容が悪くなる。単純な弱体化の場合もあれば、不必要に監視を強化するなど、別の形で悪くなる場合もある。
詳しくは協定の弱体化に関する補足資料を参照。
第二に、国家主体やテロリストが秘密プロジェクトでモデルを違法に利用することによるリスクがある。 ミスアラインしたAIや悪意ある主体の手に渡れば破局的な結果を招くような能力を秘密プロジェクトが持つなら、AIによる乗っ取りや悪用のリスクは高まる。第2段階とは異なり、第1段階では、コンソーシアムは(第1段階の長さとして現実的な範囲内で)秘密プロジェクトに勝つためにより遅く進むべきだ。速く進みすぎると、ソフトウェアの進歩を大量に生む必要があり、それが秘密プロジェクトを利することになる。詳しくは後述する。
最後に、AIへの権限移譲までのあいだに直接生じる、移譲前の存亡リスクがある。 秘密プロジェクトに由来するリスクは含まない。このリスクは次のように分けられる。
-
合法的な(つまり秘密ではない)モデルの能力の利用に由来するリスク。
-
合法的なモデルの能力に由来しないリスク。たとえば、小惑星のリスクや、合法的な最先端AIを因果的な起点としない核戦争など。
加えて、協定とは無関係に世界に生じる変化があり、それはゆっくり進むことのコストにも利益にもなりうる。 たとえば、力の均衡が変化し、民主主義国に対して権威主義国の力が相対的に強まることも、その逆もありうる。
第1段階:最大制御可能AIへのスケールアップ
ゆっくり進むことの利益とコスト
第1段階での私たちの目標は、最大制御可能AIへ向かう過程で、学習計算資源をどれだけの速さでスケールアップし、ソフトウェアの進歩をどれだけの速さで生むかという方針を決めることだ。つまり、最大制御可能AIに到達する目標終了日を持つ軌道を設定し、各時点での学習計算資源とソフトウェアの進歩の配分を定めたい。単純さと扱いやすさのため、目標終了日をあらかじめ定め、第1段階の全期間を通じてその日に向けてスケールアップしていく戦略だけを検討する。実際には、コンソーシアムは第1段階を通じて情報を得るにつれ、戦略を調整すべきだ。
進歩は、ソフトウェアの進歩ではなく、できるかぎり学習計算資源のスケーリングによって実現することを推奨する。ソフトウェアは秘密プロジェクトに利用されうるからだ。
また、どれだけの学習計算資源の安全税を払うかも決める必要がある。安全税とは、ある能力水準に到達するために学習実行で実際に使った計算資源の量と、その能力に到達するのに最低限必要な計算資源の量との差である。高い安全税を払うことは、より安全な学習アルゴリズムを使えることを意味する。その代わり、使われないまま秘密プロジェクトに漏れるソフトウェアの進歩を余分に生むことになる。
第1段階でゆっくり進むことの主なコストは次のとおり。
-
前述のもの。 つまり、時間がかかることによる協定の弱体化のリスク、(非常に長く一時停止した場合の)秘密プロジェクト、直接的な存亡リスクである。
-
より能力の高いAIとともに過ごす時間を失う。 そうしたAIは、有用な作業(アラインメント、制御、認識など)の自動化や、実験対象として使える。協定の安定化を助け、年あたりの弱体化リスクを下げることもできる。
第1段階でゆっくり進むことの主な利益は次のとおり。
-
進歩のうちソフトウェアの改良に由来する割合が小さくなる。ソフトウェアの改良は秘密プロジェクトに模倣されうるので、これは望ましい。 進歩の源泉は、ソフトウェアの進歩と学習計算資源のスケーリングの2つだ。ソフトウェアの進歩はほとんどが公開されるので、秘密プロジェクトにも広まる。そのため、秘密プロジェクトは最終的には超知能までスケールアップすべき理由の一つである一方で、10年を大きく超える時間をかけるのでないかぎり、第1段階でより遅くスケールアップすべき理由にもなる。
-
AIをどこまで制御できているかを過大評価したことによる、AIによる乗っ取りのリスクが小さくなる。
-
不安定化が小さくなる。不安定化は、(ほかの影響とあわせて)年あたりの協定の弱体化の確率を高める可能性がある。 不安定化を招く影響の例として、超人的な説得能力を持つAIまでスケールアップし、それへの防御が十分でなかったために、認識の質が低下する場合が挙げられる。ただし前述のとおり、より優れたAIは安定化にも働き、年あたりの協定の弱体化リスクを下げうる。
コンソーシアムの戦略には、ソフトウェアの改良の発見を避けられないかもしれないという制約もある。理由は2つある。(a) 増えた計算資源を活用するには、何らかのソフトウェアの改良が必要になるかもしれない。(b) 安全性の研究開発を大量に行えば、ソフトウェアの進歩という形で、能力向上の外部性がある程度生じるのはおそらく避けられない。私たちのシミュレーションでは、コンソーシアムが学習FLOP/sを1桁(1 OOM)増やすごとにソフトウェアの進歩を0.2桁生むものとし、第2段階ではコンソーシアムのアラインメント研究が年0.25桁のソフトウェアの進歩という割合で能力向上の外部性を生むものとした。
秘密プロジェクトの存在が考えにくい場合
私たちの最善の推測では、コンソーシアムは、所在が把握できていない計算資源の量をもとに、秘密プロジェクトが存在するかどうかをかなり正確に見当づけられるだろう。証明まではできないかもしれないにしてもだ。また、秘密プロジェクトはおそらく存在しないだろうと予測している。
秘密プロジェクトが存在しそうにないなら、AIを制御できているという高い確信を保ち、社会と協定を不安定にしないかぎりにおいて、できるだけ速くスケールアップすることを推奨する。私たちのシナリオではこのとおりに事が進み、その結果として得られる目標年を2035年と大まかに推測して描いている。 シナリオを書き直すとしたら、目標年はもう少し早くてもよいと、弱い確信ながら推測している。
目標年がリスクの確率に与える影響
秘密プロジェクトが存在しそうな場合は、状況はより複雑になる。速く進む方向に働く協定の弱体化のリスクと、遅く進む方向に働く秘密プロジェクトのリスクとのバランスを取らなければならないからだ。
ここからは、協定の行方をいくらかモデル化してみる。このモデルは、プランAのシナリオと同じく、協定が2029年に始まり、AC(自動コーディングAI)の実現の1年弱前から実施され始めると仮定している。一方で、シナリオのようにACからTED-AI、ACからASIへのテイクオフがそれぞれ約1年かかるとは仮定していない。代わりに、プランAの標準的な軌道のパラメータを中央値とする不確実性を仮定している。2029年の時点でも、意思決定者はテイクオフの速度について大きな不確実性を抱えているだろうと考えるからだ。そのため、コンソーシアムが目標日に到達できない場合もある。実際、検討した中で最も早い目標日である2031年半ばには、到達できないことが多い。この目標日だと、標準的な軌道と同程度の長さのテイクオフになってしまうからだ(標準的な軌道では、協定前の能力からTED-AIまで約1.5年で到達する。一方プランAでは、学習の再開は2030年初めで、コンソーシアムはTED-AIに対して1桁分の安全税を払うことを目指す)。
下のグラフは、第1段階の目標終了日によって、協定の弱体化のリスクと、秘密プロジェクトが最大制御可能AIに到達するリスクがどう変わるかを示している。協定の弱体化と秘密プロジェクトの補足資料で述べた、私たちの最善の推測による予測を前提としている。対象としているのは、第1段階中、または第2段階の最初の5年以内に、協定が弱体化するリスクと、秘密プロジェクトがTED-AIに到達するリスクだ。5年としたのは、シナリオにおける第2段階の長さだからである(詳しくは後述)。検討した最も遅い目標日は2037年だ。私たちのテイクオフのパラメータの中央値では、コンソーシアムがソフトウェアの進歩を最小限にとどめた場合に、TED-AIに到達するのがこの年だからである。
協定の弱体化によるリスクを最小化することと、秘密プロジェクトがTED-AIに到達するリスクを最小化することのあいだに、トレードオフがあるのがわかる。協定の機能を損なわずに第2段階の5年目まで到達する確率を最大化するという点では、2032年から2036年までの目標年はかなり似通っている。探知を考慮しない場合は、2035年から2037年のどれもかなり似た価値になり、2032年、とりわけ2031年はずっと悪く見える。秘密プロジェクトの要因が大きくなるのだから、これは理にかなっている。
リスクの深刻さ
これらのリスクを、互いに同じ深刻さとして扱うのは妥当だろうか。
協定のさまざまな最終状態がどれだけ望ましいかについて、こちらで大まかな推定を行った(要約はこちら)。年ごとに、協定の機能が損なわれずに続くのか、それとも協定が弱体化するか秘密プロジェクトがTED-AIに到達するのかで分けている。これらの推定では、TED-AIに到達した秘密プロジェクト(またはそれが生み出したAI)が、事実上世界を乗っ取る能力と意志を持つと仮定した。
ここからは、結果を第2段階の開始前に起こるか後に起こるかで分類し、協定が第2段階の5年目まで存続した場合と比べてどれだけ悪い結果になるかをもとに、深刻さを計算する。第2段階への移行は、協定の弱体化と秘密プロジェクトのTED-AIのどちらについても、結果の改善に役立つ。TED-AIに到達すれば、より優れたアラインメント手法の発見、認識全般の改善、そのほかの有用な応用が可能になるからだ。
TED-AIに到達した秘密プロジェクトから、人間やAIによる乗っ取りが起こらない可能性もあるので、その分の割引も加える。
失われる価値の割合は、非常に大まかには次のようになりそうだ。
コンソーシアムのTED-AI到達前(第1段階) | コンソーシアムのTED-AI到達後の最初の5年(第2段階) | |
秘密プロジェクトによる乗っ取りの深刻さ | 70% | 55% |
乗っ取りの確率 | 55% | 45% |
秘密プロジェクトのTED-AI到達の深刻さ | 39% | 25% |
協定の弱体化 | 50% | 25% |
下のグラフは、協定の弱体化と秘密プロジェクトのリスクが、第1段階と第2段階の最初の5年とにどう分かれるかを示している。
協定の弱体化のリスクは、秘密プロジェクトのリスクと比べて、第1段階に生じる割合が大きいことがわかる。目標年が2033年以前の場合は特にそうだ。そのため、同じ時点で起きた場合の深刻さだけを比べたときの印象よりも、協定の弱体化は、秘密プロジェクトがTED-AIに到達することより平均して悪い結果になる。では、リスクの水準と、そのリスクが現実化した場合に失われる価値とを組み合わせると何が言えるか、見てみよう。
私の単純な方法論には次の2つの問題がある。そのため、上のグラフは、遅い目標日に比べて早い目標日を過度に有利に見せていると解釈すべきだ。
-
結果の変数として、失われる価値の割合だけを考えている。しかし、第2段階の5年目に到達することの価値は、目標日が遅いほうが早い場合よりわずかに大きい(ただし、最後の5年間にAIを安全性のために使う効果が、それ以前の年の効果を圧倒するので、この効果の大きさは小さいかもしれない)。
-
失われる価値の割合は、早い目標年ほど、特に第1段階では大きいかもしれない。
そのうえで言えば、私の最善の推測によるパラメータ値では、協定の弱体化と秘密プロジェクトのリスクという観点からは、早いほうがよさそうに見える。ただし、その差はそれほど大きくない。失われる価値の割合の期待値は、目標年が2036年の場合、2032年の場合より約2%高いにすぎない。つまり、前述の問題を補正すれば、結論が逆転する可能性もある。
秘密プロジェクトの探知を考慮に入れないと、曲線はより平らになり、失われる価値の水準も高くなる。秘密プロジェクトが存在し、しかもそれを探知できないというのは、何をしても厳しい状況なのだ。どの目標日でも似たような値になるが、前述の問題を考慮に入れると、遅い目標日が有利になる可能性もある。
探知を考慮に入れつつ、秘密プロジェクトまたはそのAIがTED-AIに到達した時点で乗っ取りを行うと仮定した場合も、曲線はかなり平らになる。
まとめ
コンソーシアムが、秘密プロジェクトが存在する可能性が高いと考えつつも、秘密プロジェクトの探知について私たちの現時点での最善の推測(5年以内に約60%の確率)と同じ見方をしているなら、秘密プロジェクトを理由に本来より遅く進むべきかどうかは際どい判断になる。探知について私たちの現時点での最善の推測よりもかなり悲観的であれば、ソフトウェアの進歩を大量に生まないよう減速すべきであり、その結果、第1段階には少なくとも約5年をかけることになる。 逆により楽観的であれば、速度を制約する要因は、制御への高い確信を保つことと、不安定化を避けることになるはずだ。
以上の議論はすべて、第1段階の終わりに、最低限必要な量を1桁上回る学習計算資源という一定の安全税を払うと仮定していた。これが私の推奨であり、シナリオで描いた安全税でもある。この推奨は、単純なモデル化と直感的な判断を組み合わせたものに基づいている。確信はない。安全税を高くすれば、より高い能力水準でも制御への確信を強められる。一方で欠点は、ソフトウェアが秘密プロジェクトに漏れることと、使わずにおいたソフトウェアの改良が蓄積してオーバーハングを生み、協定の弱体化後(特に失効後)のプロジェクトに利用されうることだ。
第2段階:ほぼ停止するまで減速し、最終的にAIへ権限を移譲する
最大制御可能AI(プランAのシナリオではTED-AI)に到達したら、AIへ信頼を託して権限を移譲するまで、どれだけのあいだ一時停止するかを決める必要がある。この分析では、この段階を一時停止として扱う。ただし実際には、そしてシナリオでも、完全な一時停止からいくつかの点で外れる。(a) 制御手法の改善や不確実性の幅の縮小によって、制御可能な最大の水準が上がる可能性があるので、ごくゆっくりとスケールアップするのが望ましい場合がある。(b) 安全性研究は少なくとも多少の能力向上の外部性を伴う。つまりソフトウェアの進歩が生じ、それは合法的なAIの改良に使われなくても、秘密プロジェクトに漏れる。
第2段階で権限移譲を先延ばしにすることのコストは、前述のとおり、協定の弱体化、秘密プロジェクト、直接的な存亡リスクによるリスクである。 秘密プロジェクトは、そもそも存在したとしても、この時点ではおそらくすでに探知されているだろう。そのため、協定の弱体化が一般に支配的な考慮事項になると考えている。
第2段階で権限移譲を先延ばしにすることの主な利益は、権限を移譲する相手のAIがアラインされている可能性が高まることだ。 この利益の大部分は、AIをどうアラインし、そのアラインメントをどう評価するかを解明するアラインメント研究と、「安全税」の支払いからもたらされる。安全税とはたとえば、より安全な学習プロセスを使うために、ある能力水準に到達するのに必要な量より多くの計算資源でモデルを学習させることだ。なお、これはあくまで権限を移譲する相手のAIについての話である。アラインされたAIでも、その後継AIのアラインメントに成功するとはかぎらない(特に、権限移譲の後に何らかの形で状況が悪化した場合)。
副次的な利益として、アラインメントが実現した場合に未来が非常にうまくいく確率が高まることもある。これも非常に重要だが、タイミングへの依存度は、アラインメントの確率ほどは大きくないだろう。さらに、待ちすぎると、アラインメントが実現した場合の結果にとって最終的にわずかにマイナスになる可能性もある。アラインされた最大制御可能AIには、遅くよりも早く権限を移譲して、状況を改善するための自由裁量をより多く与えたほうがよいかもしれない。
第2段階でいつ権限を移譲するかを決めるには、権限移譲を先延ばしにすることの限界的な利益とコストを計算し、コストが利益を上回った時点で移譲することを推奨する。最善の戦略は、AIがアラインされているという高い確信を得た時点で権限を移譲する、といったものになると予想している。
どの戦略が最善かを判断する具体的なケーススタディを以下に示す。
2040年の権限移譲判断の具体的なケーススタディ
ここからは、権限を移譲すべきかどうかについてのケーススタディを論じる。話を具体的にするため、最大制御可能AIに到達してからしばらく経った2040年に、権限を移譲するかどうかを判断している状況を想定する。プランAのシナリオで権限移譲が起こるのがこの年である。
単純化のため、権限移譲を先延ばしにするかどうかを左右する要因は次の2つだけだと仮定する。
-
利益:アラインメントの確率の上昇。 アラインメントの進歩がどのような軌道をたどるかについては、後述の議論を参照。
-
コスト:協定の弱体化のリスク。 権限移譲を早める十分な理由になりうる要因としては、秘密プロジェクトのリスクがもう一つの有力候補だ。しかし、このケーススタディでは秘密プロジェクトのリスクはおそらく非常に低いと推測している。(a) 秘密プロジェクトがあったとしても、おそらくこの時点までに探知されているはずであり、(b) 5年間、安全性研究の外部性以外のソフトウェアの進歩を生んでいないので、秘密プロジェクトはあまり助けを得ていないからだ。
以下では、関連する変数をさまざまに設定して、権限移譲を先延ばしにすべきかどうかについてどのような推奨が得られるかを試せる。既定値は、シナリオで権限移譲が行われる時点の値におおむね合わせてある。また、アラインメント、または協定の失効・機能低下のパラメータを設定する、現実的なプリセットも用意した。
協定の弱体化の確率と深刻さについて中程度の推定値を用いた理由は、協定の弱体化に関する補足資料で説明している。
アラインメント確率の推定値の推移
アラインメントはどれほど着実に進歩するのだろうか。状況をモデル化するうえで、両極端の2つの見方がある。
-
全か無か: 最初は、AIがミスアラインしていると強く確信している。その後、ある時点でブレークスルーが起こり、AIがアラインされたと一気に確信できるようになる。
-
滑らかで予測可能な進歩: AIがアラインされているかどうかについての推定が、着実かつ予測可能な形で上がっていく。
不確実性は大きいが、私たちの最善の推測では、AIのアラインメントに対する確信の推移は両者の中間になり、おそらく全か無かにやや近い。両者の組み合わせになる可能性もある。つまり、しばらくは滑らかで予測可能な進歩に見えていて、ある時点で突然ブレークスルーが起こるというものだ。たとえば、野心的なメカニスティック解釈可能性の問題が解決され、AIの推論過程をすべて理解できるようになれば、アラインメントについて非常に高い確信が得られるかもしれない。
たとえば、2040年の時点でまだAIのアラインメントに確信を持てていないなら、ブレークスルーが得られるまでの継続的な改善に加えて、確信をもたらすアラインメントのブレークスルーが年約5%の確率で起こるかもしれない。(シナリオのように)すでに確信を持てているなら、アラインメントの確率はすでに100%に近いので、その上昇はおそらく年0.01〜1%程度だろう。
破局的な被害の例(網羅的ではない)としては、直接世界を乗っ取ること、世界を乗っ取りうる後継AIをミスアラインさせること、(たとえば超人的な説得によって)世界の認識の質を回復困難なほど損なうことなどがある。
探知については私たちの現時点での最善の推測に同意しているものの、秘密プロジェクトがTED-AIに到達した場合の深刻さをずっと高く見積もっている場合も、同じことが言えるだろう。
学習に使う計算資源の構築によって速くスケールアップしすぎると、協定が弱体化したのにその計算資源が破壊されない場合に、状況を悪化させうる。より速いテイクオフを可能にしてしまうからだ。協定が失効した場合はおそらく計算資源は破壊されるだろうが、協定の部分的な機能低下の場合はそうならない。とはいえ、協定の外や機能の低下した協定の下でではなく、協定の内側でより高い能力までスケールアップすることによる利益のほうが、この欠点をおそらく上回ると考えている。
実際には、ある程度段階的に行うことを推奨する。段階的な権限移譲の例:まず、AIがミスアラインしていた場合に乗っ取れるかもしれない程度に少しだけ権限を移譲する(つまり、以前ほどの確信はない状態にする)。次に、AI同士が協調すれば乗っ取れるが協調しなければ乗っ取れない程度まで、さらに権限を移譲する、といった具合だ。
協定が良くなる可能性もあるが、私たちの最善の推測では協定は期待値で見て悪くなるので、ここでは含めていない。協定の失効については定義上そのとおりだが、協定の機能低下については確信がない。もっと楽観的であれば、協定の機能低下の項を除くか、協定が良くなる場合を明示的にモデル化することもできる。
関連する能力から派生するあらゆる経路(たとえば蒸留)を含む。
私の最善の推測では、この種の変化は、未来の期待値に対して平均的にはマイナスに働く。そのため、これはより速くスケールアップする弱い動機になる。ただし、確信はない。
あるいは、第1段階で学習計算資源だけを使ってスケールアップすることを意味する。
ただし、ソフトウェアよりハードウェアでスケールアップすることにも欠点はある。具体的には、協定の弱体化時に計算資源が破壊されなければ、弱体化後の速いテイクオフに使われうる。計算資源の相互確証破壊の体制が整っている場合や、秘密プロジェクトが大きな問題にならないとコンソーシアムが確信している場合は、コンソーシアムは主にハードウェアではなく主にソフトウェアでスケールアップすることを検討すべきだ。
少なくとも、テイクオフがプランAの標準的な想定よりはるかに速くはないと仮定した場合の話である。
ここでの「私たちの」とは、プランAの公式なパラメータの中央値を指す。これは私ではなくトーマスの見解を反映したもので、私のテイクオフの中央値はかなり遅い。
第1段階と第2段階の望ましさという観点から見た、協定の弱体化と秘密プロジェクトによる乗っ取りの違いについて、いくつか考えを述べておく。(a) 秘密プロジェクトは、たとえ第1段階であっても、望めばアラインメントに確信が持てるまで待てる。一方、協定の弱体化後のプロジェクトはそうできないかもしれない。(b) その一方で、第2段階において、秘密プロジェクトはコンソーシアムが払った安全税の恩恵を受けないが、協定の弱体化後のプロジェクトは受ける。
正確には、コンソーシアムがTED-AIに到達してから5年後の時点で、協定が損なわれず機能も低下しておらず、秘密プロジェクトのTED-AIも存在しない場合の期待値と比べた割合である。
秘密プロジェクトの結果を、乗っ取りがある場合とない場合に大雑把に分類し、乗っ取りのない場合は価値を損なわないと仮定している。実際には、乗っ取りがなくても価値が損なわれる場合もあるだろうが、単純化のためにそうでないと仮定している。
あるいは単に、協定の弱体化と比べた秘密プロジェクトについて、私より悲観的な場合も同様である。
探知については私たちの現時点での最善の推測に同意しているものの、秘密プロジェクトがTED-AIに到達した場合の深刻さをずっと高く見積もっている場合も、同じことが言えるだろう。
また、合法的なAIの能力を高めずに安全性の手法を適用するのが難しい場合もあるかもしれない。
厳密には、交差点が複数ある可能性もある。しかし実際には、先延ばしのコストが利益を上回り始める交差点はおそらく1つになると予想している。とはいえ、これは保証されていない。たとえば、協定の失効リスクが、さまざまな時点で予測可能な形で一時的に高まることもありうる。