プランAの前提
Thomas Larsen
概要
プランAはシナリオであり、予測と政策提言を組み合わせたものだ。予測や提言のなかには自信のあるものもあれば、望む程度の具体性を出すために、やむをえず置いた推測にすぎないものもある。
自信あり | 自信なし | |
予測 | 例:「AGIはまもなく到来し、産業革命よりも大きな出来事になる」 | 例:「AGIは2030年に到来する」 |
提言 | 例:「AIのテイクオフの速さを制限する国際協定を結ぶべきだ」 | 例:「モンゴルとカナダに新しいデータセンターを多数建設すべきだ」 |
この補足資料では、シナリオの主な予測と提言を順に取り上げ、どれがどちらに当たるのかを説明する。
シナリオ中の行動のほぼすべてに、いくらかの楽観といくらかの現実主義が混ざっている。ただ大筋としては、実証的な事実については現実的に、米国政府の行動については楽観的に描くよう努めた。『AI 2040』のシナリオは、到来時期、テイクオフの速さ、アラインメントの難しさ、米国以外の政府(中国、EUなど)の行動といった点で、おおむね私の中央値の見方に沿っている。米国政府の行動は、私たちの提言をほぼそのままなぞっているので、定義上楽観的だ。現実には、今でも『AI 2027』で描いたような対応に近いものになると予想している。
この補足資料では主な提言をすべて取り上げるつもりだ。だから、ここで触れていないことはおそらく予測であり、仮に提言だとしても重要なものではない。
特定の信念について述べる文書なので、シナリオの著者の1人(トーマス)の視点で書いている。他の著者も中心的な主張にはおおむね同意しているが、細部については多少違う意見を持っている。
予測のまとめ
以下の各項目については、80%超の確信がある。
-
今後約15年以内に、AI研究開発は完全に自動化される。 ただし、大幅な規制や戦争、社会の崩壊がなければの話だ(詳しくはAI Futures Modelを参照。AIFPのメンバーの見方は少しずつ違うが、2027年と2030年がありうる年であり、それなりに中心的な年だという点では全員が一致している)。
-
AI研究開発が自動化されてから数年以内に、経済的に意味のあるあらゆるタスクで人間を上回るAIが作られる(大幅な政策介入がなければ)。そうしたAIはすぐに人間よりはるかに安くなり、まもなく人間は経済的に不要な存在になる。
-
はるかに人間を超えるAIを作れば、AIが全体としてそれを望んだ場合、乗っ取りを実行できてしまう。 だからこそ、大半のAIがそれを望まないようにすることが決定的に重要だ。
一方、次の点には自信がない。
-
正確な到来時期。 『AI 2027』ではコーディングの自動化が2027年に起きた。プランAでは、ガバナンスがなければ2030年に起きていたはずだが、それが数年遅れる。私の90%信頼区間は2027年半ば〜2050年ごろだ。2030年を選んだのは、具体的な計画が役に立つほど近く、それでいて私たちが提言する準備段階に政府が時間を割けるほどには遠いからだ。到来がもっと早ければ準備の時間がなく、プランAはより慌ただしいものになる。もっと遅ければ細部の誤りは増えるが、大枠の計画は変わらない。(詳しく)
-
テイクオフの速さ。 コーディングの自動化から、あらゆる面で人間のトップを凌駕するAIの登場まで、どれくらいかかるのか。既定では約1年(私の中央値)と仮定しているが、私の80%信頼区間は2か月から5年にわたる。私のテイクオフ観のもとでは、テイクオフの速さが違っても計画は基本的に似たものになる。ただし、速いか遅いかによって優先順位が多少変わる。(詳しく)
-
アラインメントの難しさ。 AIのアラインメント問題を解くのがどれほど難しいかはわからない。大幅な減速をしなくても解けてしまう可能性はあると思う。同じく、AIの支援を大量に受けながら10年以上専念しても足りない可能性もある。プランAは、時間を稼ぎ、この問題の難しさについての証拠を集めようとする設計になっている。AIによる乗っ取りのリスクが小さいという証拠が積み重なれば、もっと速く進めてよい。そうでなければ一時停止を延長する。(詳しく)
-
減速協定の遵守を検証するのがどれほど難しいか。 監視の容易な巨大データセンターを使わずに大規模なAI開発を進めるのは、基本的に不可能かもしれない。反対に、ごくわずかな計算資源でもアルゴリズムの進歩が可能で、ごく小さなクラスターでさえたちまち知能爆発を起こせるのかもしれない。最も悲観的なケースでも、1〜2年なら協定を確実に執行できる可能性がきわめて高いと考えている。(詳しく)
-
その他、戦略上の多くの変数。(詳しく)
プランAのシナリオでは、こうした戦略上の重要な変数のそれぞれについて、私の見方に照らしてそれなりに中心的な値を選んでいる。多くの変数について私の見方はきわめて不確かだ。そして政策上の判断の多くは、これらの変数について今よりも多くの情報を得たうえで下されるべきだ。
政策のまとめ
次の節では、シナリオ中の政策提言のうち、実証面の見通しがさまざまに変わっても揺るがないものはどれかを論じる。
次の政策提言は、どんな場合でも有益だと考えている。
-
政府のAIへの備えを強化する (重要度:中)。透明性の確保、政府内の技術的専門知識の強化、検証技術の研究を加速する施策がこれに当たる。後悔の少ない政策であり、しかも一部のシナリオ(プランAなど)ではきわめて重要になるので、良い政策だと言える。
-
モデル仕様書の透明性と、権力奪取を防ぐための検証 (重要度:中)。モデル仕様書(社内向けモデル・社外向けモデルの両方)では、権力集中(CEOによるものでも、大統領によるものでも、それ以外の誰によるものでも)への加担を明示的に禁じるべきだ。また、AIプロジェクトにはバックドアを防ぐための検証措置の導入を義務づけるべきだ。
-
計算資源のガバナンスにもとづき、能力の爆発的向上を減速させる米中協定 (重要度:高)。これがプランAの核心だ。国際協調によるアプローチ(プランA)が他の選択肢より優れていることには自信がある。他の選択肢はどれも知能爆発のさなかに開発競争を続けることになり、それは莫大なリスクを伴うからだ。一方、プランAのどの変種が最善なのか、また私たちが想定する形のプランA(何年にもわたる相互の減速)がプランS(完全な停止)より優れているのかについては、自信がない。AIの進歩を「減速」させようとするのであれば、計算資源のガバナンスを通じて行うのが、群を抜いて効果的な方法に見える(どの程度うまくいくかは、はっきりしないが)。
-
AIが生み出す富の再分配 (重要度:中)。AIが経済全体を自動化するにつれて、人間が稼げる賃金はほぼゼロまで急落する。何もしなければ(そしてAIによる乗っ取りを避けられたとしても)、AIは歴史上例のない富の格差を生む。何らかの富の再分配策が必要だと確信している。
-
防御的加速 (重要度:中)。政府、AI企業、一般の人々は、社会をより頑健にする技術に投資すべきだ。特に重要なのは、認識を支えるAI、バイオ防衛、サイバーセキュリティといった領域だ。防御的加速に一丸となって取り組まなければ、AIの高い能力がもたらす攻撃能力の増大によって、大きなリスクが生じる。防御的加速には正の外部性もある。ミスアラインしたAIが世界を乗っ取りにくくなり、そのぶんアラインメント研究に使える時間が増えるからだ。
-
ASI後のガバナンスを慎重に考える (重要度:高)。ASI後のガバナンスについては、いくつかの一般原則に手応えを感じている。(1) 多くの聡明な人々が(アラインされた)AIの支援を受けながら、効果的なガバナンスを慎重に考えること、(2) 取り返しのつかない約束は慎重に行うこと、(3) どの行為主体も単独では権力を集中させにくい仕組みにすること、だ。
次の提言は、自信のない特定の前提に依存しているか、よりよい代替案がありうるものだ。
-
協定後にAIの能力をどれだけの速さでスケールさせるか (重要度:高)。速くスケールさせれば、目の前の安全上のリスクが大きくなる。遅くスケールさせれば、より賢いAIがあってこそ進む安全性の研究が遅れ、協定の崩壊や秘密プロジェクトのリスクも生じる。こうした判断は主に、その時点で得られている証拠――個々のAIシステムや配備がどれほど危険に見えるか、リスク低減策がどれほど有効に見えるか――にもとづいて下されるだろうし、そうあるべきだ。(詳しく)
-
データセンターの大規模な建設 (重要度:中)。プランAのシナリオでは、政府がデータセンターの大規模な建設を後押しするよう提言している。この提言は、AIを減速させる実効性のある国際協定が実施されていることが前提であり、その前提のもとでも、良い策だとは言い切れない。賛成する理由は、ハードウェアの拡大はその拡散を防げるので、ソフトウェアの拡大より統制しやすいという点だ。しかし大きなコストもある。(i) 合法プロジェクトの内部で求められる検証の精度が上がる。(ii) 協定が崩壊すれば(そしてフェイルセーフの仕組みも機能しなければ)、その後の知能爆発がはるかに速くなりかねない。(詳しく)
-
私たちの検証計画 (重要度:高)。プランAで描いた検証計画は、米国と中国がともに合意を守っていることを確かめるうえで重要だ。とはいえ、それを実施する最善の方法が何なのかについては、まったく自信がない。私たちの具体的な提案では、まず推論のみに限定し(新しいAIモデルの構築は止める)、そのあいだに学習や実験を検証する方法を全力で開発する。検証には、ほかにも多くのアプローチがある。(詳しく)
-
透明性とセキュリティのトレードオフをどうとるか (重要度:高)。セキュリティにも透明性にも明らかな利点があるが、両者は緊張関係にある。提示されるセーフティケース(安全性の論証)にできるだけ多くの目が届くよう、透明性はできるかぎり高めたい。一方で、モデルの重み、アルゴリズム、推論トークンは守りたい。全体としては、透明性を高めるためなら、セキュリティ面でかなりのコストを払う覚悟を持つべきだと考えている。私たちがより心配しているのは、大手のAIプロジェクトが力を濫用したり判断を誤ったりすることであって、ごくわずかな計算資源しか持たない離反プロジェクト(セキュリティの甘さで主に得をするのはこうしたプロジェクトだ)ではないからだ。そうした小さなプロジェクトはそれほど強力にはならないので、そこで悪質な行為や無謀な行為があっても、そのぶん影響は小さい。(詳しく)
-
ASI後のガバナンス計画 (重要度:高)。私たちの宇宙ガバナンス計画は、何を目指すべきかについての第一案としては妥当だと私は考えている。人類が制御を保つシナリオであれば、おおむねどれにでも当てはまる。とはいえ細部にはまったく自信がない。そうしたシナリオでは、この問題を解く手助けをしてくれる、アラインされた超人的AIがいるはずだ。だから私の主な提言は、膨大なAIの労働力を使って、よりよい計画を考え出すことだ。(詳しく)
-
AIの広範な導入 (重要度:中)。広範な導入は権力を分散させ、社会の認識の質を高めうる。悪い方向に働く主な筋道としては、(i) 社会の認識の質への正味の影響が悪いものになる、(ii) 広範な導入によって、説得や政治権力を通じた乗っ取りが、AI(あるいはAIによる乗っ取りを企てる人間)にとって容易になる、(iii) 攻撃側が優位に立つ能力の拡散につながる、といったものがある。差し引きでは、広範な導入はおそらく良いことだと思うが、確信はない。上に挙げた失敗パターンのそれぞれに対して、どれほど有効な低減策が講じられているかにもよる。(詳しく)
-
シナリオでプランAを実施する際のその他の細部。 海上のデータセンター、アラインメントに関するインセンティブの設計、秘密プロジェクトに関するインセンティブの設計(堅牢化した計算資源の備蓄など)、そして協定崩壊のリスク、秘密プロジェクトによる乗っ取りのリスク、ガバナンスが無能であるリスクをどう比較衡量するか、といったことが含まれる。
ここまでは主に、今後変わりうるプランAの細部だった。これとは別に、構造的に異なるプランでプランAに匹敵しうるものもある。それについてはこちらで論じている。
それでも、幅広いシナリオにわたって、プランAのようなものを目指すべきだと考えている。この文書の残りは2つの部分からなり、どちらも実証的な状況の変化に応じて私たちの計画がどう変わるかを論じる。
-
実証面の変化に応じた見直しでは、「ある実証的な事実が変わったら(たとえば、到来時期がもっと早かったり遅かったりしたら)、私たちの政策はどう変わるか」という問いに答える。
-
政策ごとの見直しでは、「主な政策提言のそれぞれについて、何があればその提言を変えるか」という問いに答える。
実証面の変化に応じた見直し
この部では、シナリオで置いている重要な実証的前提のうち、実際には違う結果になりうるものをいくつか取り上げ、それに応じてプランAがどう変わるかを見ていく。
到来時期
AGIがいつ作られるのかはわからない。今年や来年に作られる可能性もあれば、何十年もかかる可能性もある。
プランAのシナリオでは、AI研究開発の完全な自動化は、何もなければ2030年に起きる流れにあったが、政府の関与によって先送りされた。AIの到来時期については、これまでにずっと多くのことを書いてきた。最新の成果はこちらで見られる。AIFPのメンバーのあいだでは、AIの到来時期についての見方が今も(わずかに)異なる。それでも、2030年がAGI到来の年としてありうる年であり、それなりに中心的な年だという点では全員が一致している。
なぜ2030年の到来を前提にこのシナリオを書いたのか?
ありうるさまざまなシナリオを示すことには意味がある。私たちはすでに、到来時期がごく早いシナリオ(『AI 2027』)を書いていた。だから次のシナリオでは別の到来時期を選ぶのがよいと考えた。2030年は現在の私(トーマス)の中央値だ。つまり、事態がこれより遅く進む確率が50%、速く進む確率が50%だと考えている。今後、時間が残されていれば、イーライ(Eli Lifland)など他の著者の見方にもとづくシナリオも作りたい。
全体として、到来時期がいつであってもほぼ変わらず、プランAは私の中心的な計画であり続ける。 根本にある問題――AIによる乗っ取り、AIを使った権力集中、AGIが引き起こす急激な社会の激変――は到来時期によらず同じであり、プランAはこうした問題への対処法についての私たちの最善の推測だからだ。
到来時期にかかわらず、計算資源の相互申告と透明性を伴う国際協定は、早く始まるほどプランAを効果的にする。知能爆発の始まり(たとえば自動コーディングAIのマイルストーン)に達すると、検証ははるかに難しくなる。離反プロジェクトに関わる人間の数がずっと少なくて済むようになり、発見がずっと難しくなるからだ。
到来時期がずっと遅い場合(たとえば2035年以降)、状況の不確実性はずっと大きくなり始める。私たちのシナリオと比べて、世界はAGI以前の段階でもっと大きく変わっているだろう。AIの経済的影響は大きくなり、AI企業の売上高(と市場全体に占める割合)も(おそらく)高くなり、ロボットも増え、AIの重要性に気づく人も増えているはずだ。具体的な影響としては次のようなものがある。
-
計算資源の備蓄が途方もなく大きくなるので、秘密プロジェクトへの懸念はいくらか小さくなる。検証下のプロジェクトと比べて、秘密プロジェクトが持てる計算資源の相対的な量が小さくなるからだ(一方、絶対量は大きくなる)。ただし、秘密プロジェクトへの懸念を強める理由もある。反対方向に働く効果として、世界中に分散する計算資源が増え、情報機関がそれを突き止めるのが難しくなる。
-
影響を受ける人がより多く、より早く現れるので、プランAの政策パッケージのうち経済的な部分(市民配当など)を前倒しで実施することが、より重要になる。
-
それなりに賢いAIが存在する期間が長くなり、しかも現在のAIがすでに生物兵器開発の能力をかなり底上げしているので、d/acc(防御的加速)を前倒しで進めることが、より重要になる。
-
世界全体の計算資源の量が増えるので、計算効率のはるかに高い新しいパラダイムが発見され、速い知能爆発につながる事態への懸念が強まる。
到来時期がずっと早い場合(たとえば2026年や2027年)、準備段階に充てる時間がないので、準備なしの形でプランAを実施しなければならない。
-
政府の能力をあまり必要としない緊急時の代替プランのどれかに切り替えるべき可能性が高まる。残念ながら、こうした代替プランには別の欠点がある。たとえば、AI関連の計算資源の大部分を停止すれば、既存モデルの推論も止まってしまい、経済的な損失が大きい。
-
AIのテイクオフを減速させる合意を早期に結ぶことが、より急を要するものになる。まもなく知能爆発の奥深くまで進んでしまい、減速が不可能になるからだ。
テイクオフの速さ
このシナリオでは、『AI 2027』と同じく、AC(自動コーディングAI)から人間のトップ専門家を凌駕するAI(TED-AI)までの期間を、既定で1年と仮定した。これはおおむね私の中央値だが、ここでも不確実性は大きい。執筆時点での私の80%信頼区間は、テイクオフにかかる期間でいえば2か月〜5年といったところだ。
なぜ既定のテイクオフを1年としたのか? 1年はプランAを書いた時点での私の中央値であり、計画を立てるうえで代表的なシナリオに思えたからだ。
テイクオフの速さが違うと、計画はどう変わるのか?
テイクオフが1年より速い場合、プランAに限らず、全般に事態は難しくなる。具体的な主な変化は次のとおりだ。
-
テイクオフを減速させる国際協定を結ぶことが、より重要になる。現状維持のリスクが高まるからだ。協定がなければAIによる変化がはるかに速く進み、変化のたびに対応し、次の変化に備える時間が少なくなる。
-
国際協定の執行が難しくなる。テイクオフが速い場合、ハードウェアの増加は通常ずっと少ない。テイクオフが数か月で起きるなら、計算資源を大規模に拡大する時間がないからだ。計算資源を大規模に拡大しなくても知能爆発が起こりうることこそ、秘密プロジェクトを懸念する前提になっている。そうした知能爆発が不可能なら、計算資源の比較的少ない秘密プロジェクトはそれほど心配しなくてよいだろう。知能爆発が速く進むぶん、秘密プロジェクトの進みも速くなり、国際的なコンソーシアムが使える余裕が小さくなる。
-
減速協定をもっと早く始める必要がある。そうすれば執行は容易になる(したがって計画全体が実行しやすくなる)。
-
協定の執行が難しくなるので、執行に役立つ一方で別のさまざまなコストを伴うトレードオフを選ぶ方向に判断が傾く。たとえば、(i) セキュリティと透明性のトレードオフでセキュリティ寄りにする、(ii) アルゴリズムの進歩を抑え、そのぶんスケールアップを遅らせる(さらにスケールアップしても安全だとしても)、(iii) 初期にハードウェアの拡大を多めに行う、といったことだ。(iii) は検証や自壊の計画への依存度を高めるが、ミスアラインメントのリスクを下げる助けになる。
テイクオフが1年より遅い場合、たとえば規制がなくてもコーディングの完全な自動化から最初の人工超知能まで数年かかるなら、上に挙げたトレードオフのすべてで、基本的に逆の方向に判断を改める。
-
全体のリスクは下がる。もともとリスクが生じたときに対処する時間が多いからだ。したがって、計画全体としては引き受けるリスクを小さくしようとし、リスクを減らすために、より思い切ったトレードオフを受け入れるようになる。
-
特に、秘密プロジェクトによる乗っ取りは起きにくくなる。ごくわずかな計算資源だけで、人類の存亡を脅かすほど危険なAIシステムへと自力で到達できる見込みはきわめて低いからだ。そうなると、研究の完全な透明性を採る方向にいっそう傾き(小さなプロジェクトより大きなプロジェクトのほうを相対的に心配するから)、大規模なハードウェア拡大からは遠ざかる。計画としては、既存の計算資源の備蓄だけで知能爆発を減速させた形で進めればよい。アルゴリズムは後れをとっているプロジェクトに漏れてしまうが、そうしたプロジェクトは計算資源がきわめて限られているので、AIをそれ以上大きく進歩させることはできない、という事実に頼るわけだ。
-
AIによる乗っ取りが起きにくくなるので、ほかのリスクへの対処に相対的に多くの労力を割ける。それでもAIの進歩を減速させることは非常に重要だ。既定のテイクオフのあいだにAIのアラインメントが解決されない可能性は依然としてかなりあり、減速は権力集中のような他のリスクを抑えるのにも役立つからだ。とはいえ、この世界では実際にはあまり減速しない可能性が高い。したがって、条約のうち減速の部分の重みは小さくなる。
全体として、テイクオフの速さにかかわらずプランAを進めることを提言する。ただし、テイクオフの速さについての見方が変われば、上で述べたように、プランAの具体的な実施方法はかなり変わる。
アラインメントの難しさ
プランAのシナリオでは、人類が力を結集し、ASIへの権限移譲に向けて、高い保証水準のセーフティケースを作り上げる。しかし、私たちがより強く確信しているのは、時間と労力をかけるほどアラインメント問題を解ける可能性が高まるという大まかな構図のほうであり、ここで語った具体的な筋書きではない。 ASIのアラインメントがどれほど難しいかはわからない。チーム内でも意見はかなり分かれている(チーム外ではさらに分かれている)。この不確実性をふまえ、私たちはポートフォリオ型のアプローチをとるべきだと考えている。つまり、既存の手法の延長にあるAI安全性の研究課題(RLHFの変種など)と、野心的な試み(人間の脳のアップロードなど)の両方に大きく投資する。
私たちが提唱する計画では、世界が協調し、アラインメント問題がどれほど難しいかを見極めるための猶予と資源を科学界に与える。ユドコウスキー(Yudkowsky)の言うとおりAIのアラインメントが難しいのであれば、この期間に証拠が積み上がり、一時停止が延長されるはずだと私たちは考えている。同様に、楽観論者が正しくアラインメントが容易なら、この期間にそれを示す証拠が得られ、もっと速いペースで進められる(ただし、そうすべきかどうかははっきりしない。速く進めることには他のリスク、なかでも権力集中のリスクがあるからだ)。
私の考えでは、アラインメントはおそらく十分に難しく、うまく管理された数年がかりの減速がなければ、AIによる乗っ取りのリスクを大きく抱えることになる。シナリオで描いたように10年間減速しても、アラインメントが難しすぎた、あるいは実現可能だったのに人為的なミスで結局失敗した、という可能性はかなりある。さまざまなプランに従った場合にアラインメントが成功する見込みについてのチームの見方は、こちらで詳しく読める。
アラインメントがずっと難しい場合はどうするか?
次のような方法で、アラインメントの難しさについてできるだけ多くの証拠を集める。
-
AIシステムを配備して観察し、それがどの程度アラインされているように見えるかについて、実証的なフィードバックを得る。
-
モデル生物(意図的にミスアラインするよう学習させたAI)を作り、アラインメントの手法がそのミスアラインメントを見抜き、学習によって取り除けるほど優れているかを確かめる。欺瞞的アラインメント、迎合、報酬ハッキングなどについてこれを行う。
-
集団思考を避けるため、大勢の多様な人々にモデルへのアクセス(理想的にはモデルの内部へのアクセスも)を与える。
-
モデルを信頼できる理由、信頼すべき理由について、証拠と論証を示す明示的なセーフティケースを作り、それを公開して科学界の批判と議論にさらす。
プランAの期間中は、次のような方法で一時停止を延長できる余地を保つ。
-
秘密プロジェクトを監視し、見つけたら停止させる。
-
新しいチップの流れを厳重に守り、無許可のプロジェクトに渡らないようにする。
-
協調と検証の技術を、大規模な投資とAIの活用の両面から改善する。特に、AIを使ってプライバシーを守る監査の仕組みや信頼できる嘘の検出を作ることは、非常に有望に思える。
-
秘密プロジェクトに漏れるソフトウェアの進歩を最小限に抑える。アラインメントがより難しいなら、減速を長く続けられるようなトレードオフを選ぶ方向に判断を改めるべきだ。
-
意思決定者が、アラインメントの難しさについて最良の情報を得られるようにする。たとえば、アラインメントにより悲観的な人々がモデルや現行のセーフティケースにアクセスできるようにし、破局的な事態になる前に問題を見つけられるようにする。
アラインメントが極端に難しい場合、たとえば人類がアラインメントでまったく実質的な進歩を遂げられていない場合は、プランSに切り替え、管理されたテイクオフを試みる代わりに、すべてを停止するのが正しい判断かもしれない。そのうえで、アップロードのように、機械学習よりも本質的に安全な方法で超人的AIを作る別の戦略を追求できる。残念ながら、こうしたアプローチにも大きな欠点がある。特に、アップロードなどの戦略で十分な進歩が得られる前にモラトリアムが崩れ、再び開発競争に戻ってしまうリスクがある。
アラインメントがずっと容易な場合はどうか?
それでも、AIのテイクオフを減速させることは、ほかの多くの理由からおそらく良いことだ。AIによる権力集中を避ける、ASI後の適切なガバナンスを見出す、人間の労働が経済的に意味を持たなくなる体制へ健全な形で移行する、AIがもたらす超兵器に対して世界を堅牢にする、などだ。要するに、ミスアラインしたAIによる乗っ取り以外で、プランAが取り組んだ問題はすべて依然として解決しなければならない。
主な違いは、人類が永続的なロックインに陥ることなく、こうした他のリスクをなんとか切り抜けられる可能性が高くなる点だ。つまり、アラインメントが私の予想よりずっと容易であれば、減速の必要性は確かにかなり下がる。
検証の難しさ
関連資料:秘密プロジェクトの分岐、秘密のAIプロジェクトに関する補足資料、検証計画。
検証がどれほど難しくなるかは、わからない。AIに関する合意の遵守を検証する私たちの主な戦略は、(1) 秘密プロジェクトが利用できる計算資源の量を制限し、(2) 合法プロジェクトが申告どおりのことをしているかを確かめる、というものだ。どちらもある程度の取りこぼしは避けられない。また、「監視されていない計算資源の量」と「違法な知能爆発が、人類の存亡を脅かすほど危険な能力の閾値にどれほど速く達しうるか」の対応関係もよくわかっていない。
それぞれをもう少し詳しく見ていこう。
-
秘密プロジェクトの検証の難しさ。 プランAのシナリオでは、発見されずに済む秘密プロジェクトの規模は、最大でも協定前の計算資源の約1%だと仮定している。シナリオでのこの仮定は、最悪のケースに近い。私の最善の推測では、プランAのシナリオではどちらの側も秘密プロジェクトを作らない。(i) 合法プロジェクトに追い抜かれるので作る動機がなく、(ii) どちらの側もAIによる乗っ取りのリスクを恐れており、秘密プロジェクトを作れば協定を損なうからだ。私が最も不確かに感じている下位の問いは次のとおりだ。
-
協定前の計算資源のうち、どれだけの割合を突き止められるか? 協定前の計算資源についての不確実性は非常に重要だ。中国の当初の計算資源申告がどこまで偽りうるかが、それで決まるからだ。私たちが話を聞いた専門家たちも、中国の既存の計算資源がどれほどの規模なのかについて、きわめて大きな不確実性を抱えている。AIデータセンターが大きくなるにつれて、割合で見れば追跡は容易になるかもしれないが、絶対量で見れば、突き止めにくい計算資源は時間とともに増えていく。ただし、情報機関は現時点ではるかに正確な非公開情報を持っているかもしれないし、近いうちにそうした情報の収集を始めるかもしれない。全体としては、秘密プロジェクトに大量のGPUを渡さないことが、不拡散計画のなかで最も重要な柱の1つになる可能性がある。一方で、HUMINT(人的情報収集)のような他の要因のほうがはるかに重要になる可能性もある。
-
HUMINTは秘密プロジェクトの発見にどれほど有効か? プランAの秘密プロジェクトの分岐で想定した規模(50万H100e、79億ドル)の秘密プロジェクトなら、情報収集によってすぐに発見される可能性が高いと私には思える。秘密裏に試みられた歴史上の巨大プロジェクト(マンハッタン計画など)には、スパイが大勢入り込んでいたようだ。このくらいの規模のものはすぐに発見され、停止させられる、というのを基本的な前提とすべきだ。ただし、知能爆発が進んだ段階では、秘密プロジェクトに関わる人数はずっと少なくて済むかもしれない。AIがAI研究を自動化し、ロボットがデータセンターの建設と保守を自動化できるので、情報が漏れる確率は劇的に下がる。
-
計算資源へのアクセスをどれだけ減らす必要があるか? プランAのシナリオでは、計算資源が10分の1のAIプロジェクトは、知能爆発の速さが5.5分の1になると仮定している。これについては秘密プロジェクトに関する補足資料の付録で詳しく論じている。
-
-
合法プロジェクトの検証の難しさ。 プランAのシナリオでは、推論のみであることはすぐに検証でき、学習実行は6か月の集中的な技術開発を経れば検証できると仮定している。実際にはもっと容易かもしれない(たとえば、ソフトウェアのレベルで実現できる場合)し、もっと難しいかもしれない(特に、政府はこの種の取り組みが遅く、うまくないので)。実行面での高い能力を前提にしているので、ここでの仮定は楽観的な側に寄っている。
-
合法プロジェクトの検証がもっと難しいなら、ハードウェアの拡大を進めることはより恐ろしいものになる。定量的に言えば、ハードウェアの拡大がなければ、合法プロジェクトの計算資源について99%程度の保証が必要になる。計算資源のストックが4桁(4 OOM)増えるなら、99.9999%の保証が必要になる。
-
ほかにも、政策戦略の残りの部分に影響しうる、検証に関わる個別の力学がいろいろある。
-
ソフトウェアのスケーリングはどれほど有利か? 秘密プロジェクトにとって鍵となる力学は、合法プロジェクトからアルゴリズムを盗むことだ。したがって合法プロジェクトは、秘密プロジェクトにとって有利になりにくいアルゴリズムを追求することを検討すべきだ。具体的には、(1) ハードウェアとソフトウェアの協調設計、つまり秘密プロジェクトが入手できない専用設計のチップでしか効果を発揮しないアルゴリズムを研究すること、(2) 規模に強く依存するアルゴリズムを研究すること、だ。この2つの道がどれほど有利になるかはわからない。有利であるほど、秘密プロジェクトを加速させずに能力を進歩させられる。
-
エッジハードウェアはどれほど必要になるか? 一部の用途では、エッジハードウェア(クラウドではなく機器側で動くハードウェア)が強く求められる。特に軍事用途(電波妨害があるため)や自動運転車(ネットワークに問題が起きたときに車が事故を起こしては困るため)だ。これは検証にとって課題になる。エッジの計算資源は機器から取り外されて秘密プロジェクトに流用されたり、バックドアを仕込まれて大規模な分散学習実行の一部として使われたりしかねないからだ。これが大量に必要になるのかどうか、ほかの解決策があるのかどうか、エッジの計算資源が学習実行に使われるのを防ぐ低減策がどれほど有望に見えるのか、いずれもわからない。
-
セキュリティはどれほど難しくなるか? 合法プロジェクトの検証を機能させるには、国家レベルの攻撃者にも耐えるセキュリティが基本的に不可欠だ。アルゴリズムについて国家レベルの攻撃者にも耐えるセキュリティがあれば、秘密プロジェクトの防止に役立つ。セキュリティについての私たちの基本的な前提は、検証の仕組みは十分に安全にできる、ほとんどのアルゴリズムは(非常に小さいので)守りきれない、モデルの重みは(非常に大きいので)守れる、というものだ。以下では、求めるセキュリティ特性のそれぞれについて、現在の前提が誤っていた場合にどう見直すかを見ていく。
-
検証のセキュリティが実現できない場合、理想的な戦略は、(1) セキュリティが実現できるようになるまで、AIのさらなる開発(場合によっては推論も)をモラトリアムで止めるか、(2) 信頼に大きく頼るか、のどちらかになる。
-
アルゴリズムのセキュリティが実現できる場合、秘密プロジェクトに対して、現在プランAでモデル化しているより大きな余裕を持てる。計算資源の拡大の必要性も下がる。計算資源を増やす中心的な動機の1つは、アルゴリズムが秘密プロジェクトに漏れる影響を和らげることだったからだ。
-
モデルの重みのセキュリティが実現できない場合、(1) セキュリティが実現できるようになるまでAIの能力をスケールさせないか、(2) 持ち出されたAIに対する防御にもっと大きく投資する必要がある。能力がきわめて高い段階では、非常に強力なAIから身を守らなければならないので、極端に思い切った措置が必要になるかもしれない。
-
AIのパラダイムシフト
現在のプランAは、巨大なニューラルネットワークに対する勾配降下法が、2030年代後半までAIの支配的なパラダイムであり続けると仮定している。そのパラダイムの内部では大きな進歩があると仮定しており、そこには (i) ニューラリーズ(neuralese)の追加(長期記憶として、また思考の連鎖の代わりとして)や、(ii) 強化学習の劇的なスケールアップ(既存のものよりはるかに大きく多様な環境を大量に用いる)が含まれる。
「巨大なニューラルネットワークに対する勾配降下法」という広いパラダイムの内部であっても、アルゴリズムが大きく変われば、プランAの一部の実施の細部が変わるかもしれない。たとえば次のような場合だ。
-
プランAで開発されるような、全般に人間のトップ専門家並みのAIシステムには、重みのリアルタイム更新によるオンライン学習(文脈内学習や遅延した重み更新ではなく)は必要ない、と私たちは仮定している。もしリアルタイムの重み更新が必要なら、推論用のデータセンターでも何らかの学習基盤を動かさなければならない。そうなると、検証基盤にある参照モデルもリアルタイムで更新する必要が生じ、推論の検証が複雑になる。その結果、セキュリティ上の攻撃面が広がる。さらに、特定のモデルの推論専用にハードウェアで固定されたチップ(たとえばEtched)も使えなくなる。そうしたチップは、推論専用の検証方式の一部になりうるものだ。
-
計算資源へのアクセスを制限することが、秘密プロジェクトを防ぐ有効な手段だと私たちは仮定している。たとえば、計算資源に対するスケーリング特性が現在のアーキテクチャより劇的に(たとえば1,000倍)有利な新しいアーキテクチャが発見されれば、秘密プロジェクトははるかに危険になる。とはいえ、そうしたアーキテクチャ上の発見がいわば目前に迫っているなら、ほかのプランもみな、うまくいく見込みがずっと低くなる。プランAで、計算資源で大きく劣るにもかかわらず秘密プロジェクトが合法プロジェクトを追い越せるような発見は、プランDであれば、それを最初に見つけた最先端のAIプロジェクトの内部で、ASIへの極端に速く不連続な「FOOM」を引き起こすだろう。こうした世界はきわめて恐ろしく、おそらくプランSのようなもので対処するのが最善だ。
言うまでもなく、AIのパラダイムシフトには多くの「未知の未知」もあり、予想もしない形でプランAを変えうる。実際には、今後のパラダイムシフトに応じて、プランAの基本線に多くの見直しが必要になると予想している。
副次的な見直し
-
国家の能力。 プランAは、AIに関する国家の高い能力、特に、存亡に関わるほど危険な学習実行や配備を見分ける能力に依存している。しかし、国家の能力が低すぎて安全なAIと危険なAIを区別できない世界では、別のプランに切り替えることを勧める。目立つ代替案は2つある。(1) 安全性の基準をきわめて保守的にする(たとえば、すべてを停止する)。(2) より大ざっぱな手法(たとえば、GPUの相互破壊)で知能爆発の速さを制限する。
-
最初の協定時点の能力水準。 協定の開始が遅いほど、執行は難しくなる。特に、AI研究がかなり自動化されると、ごく少人数でAIの秘密プロジェクトを運営しやすくなり、情報が漏れる経路が減る。つまり、体制全体に残される時間が短くなり、リスクは高まる。
-
蒸留への対策。 蒸留を抑える私たちの戦略は検証に関する補足資料で論じている。これがどれほど有効かははっきりしない。うまくいかなければ、秘密プロジェクトをより懸念する方向に判断が傾く。能力のスケールアップを遅くするのが最適だという方向にも傾く。さらに、広範な導入を強く制限する方向にも傾く。ただし私は、蒸留を抑えるのが非常に難しいとしても、広範な導入にはなお価値があると考えている。
政策ごとの見直し
減速協定の後、AIの進歩をどれだけの速さでスケールさせるか?
はっきりしたことは言えず、その時点での観察次第になる。主な考慮事項は次のとおりだ。
-
協定はまもなく崩壊しそうか? 協定がまもなく崩壊する可能性が高いなら(たとえば政治的な理由や、秘密プロジェクトによる乗っ取りのために)、より多くのリスクを引き受ける覚悟を持つべきであり、したがって、より速くスケールさせることに前向きになるべきだ。
-
現行のセーフティケースはどれほど有望に見えるか(モデルはどれほどミスアラインしているように見えるか)? スケールを一段進めることでAIによる乗っ取りのリスクが大きくなるほど、能力のスケールアップは遅くすべきだ。
-
より優れたAIから得られる見返りはどれほど大きいか? より優れたAIが有用な労働を提供しないのであれば(たとえば、その出力を信頼できず、制御もうまくスケールしないために)、スケールさせるべきではない。一方で、AIの能力をスケールさせれば、こなせる質の高いアラインメント研究の量が劇的に増えるのであれば、リスクがあってもスケールさせる価値があるかもしれない。
-
重みやアルゴリズムは秘密プロジェクトに漏れるか、漏れた場合の打撃はどれほどか? スケールアップしたAIモデルの重みやアルゴリズム(あるいはその両方)が漏れれば、離反プロジェクトがある程度加速し、体制の余裕が小さくなる。モデルの重みとアルゴリズムを守れるなら、あるいはアルゴリズムを大きく進歩させずに能力をスケールさせられるなら、よりスケールさせる方向に判断を改めるべきだ。プランAのシナリオでは、アルゴリズムの秘密を守れるとは楽観していないので、アルゴリズムを大きく進歩させずに済むよう、主にハードウェアの拡大によってスケールさせている。
-
リスクは現在のAIと将来のAIのどちらからより多く生じるか? 知能爆発の早い段階にいるほど、早めにスケールさせることに前向きになってよい。現時点でのスケールアップの追加的なリスクはずっと小さいからだ。反対に、リスクの大半を背負う能力の段階にいるなら、はるかに慎重になり、より大きく減速する方向に傾くべきだ。(シナリオでコンソーシアムが、2030年代前半にはそれなりに慎重に、ただし慎重一辺倒ではなくAIの能力をスケールアップし、2035年にトップ専門家の水準で一時停止するのはこのためだ。)
-
アルゴリズムを大きく改善せずに能力をスケールアップできるか? プランAでは、アルゴリズムの進歩を強く制限しながら、ハードウェアのスケーリングによってAIの能力をスケールアップしようとする。しかし、AIの能力をスケールアップすれば、本質的に(たとえば蒸留を通じて)アルゴリズムが大きく進歩してしまうのかもしれない。さらに、アルゴリズムのスケールアップに代わる主な選択肢はハードウェアのスケーリングだ。ところが、アルゴリズムの進歩の大半はハードウェアの進歩から派生するものなのかもしれない。その場合、アルゴリズムの進歩を統制する最も効果的な方法は、ハードウェアそのものを制限することかもしれない。
結局、こうした考慮事項を比較衡量するには、秘密プロジェクトのリスク、現在のAIや将来のAIによる乗っ取りのリスクなど、リスクの源それぞれを定量的にモデル化し、配備の速さがそれぞれのリスクにどう影響するかを理解したうえで、最善の道筋について複雑なトレードオフを判断する必要がある。
プランAの軌道は、基本的に次のような見方にもとづいている。協定崩壊のリスクはおそらく高い。初期のAGI(ACやSARなど)のリスクは制御によって抑えられる(つまり、その水準のAIについては、制御に基づくセーフティケースをごく短期間で十分なものにできる)。そして、こうした初期のAGIから膨大な量の有用な労働を引き出せる。さらに、能力のスケールアップの大半は急速なハードウェアの拡大によって行え、アルゴリズムの進歩の総量を強く制限できるとも仮定している。そこには、蒸留を(主に中間の推論過程を隠すことで)うまく抑えることも含まれる。こうした前提のもとでは、減速協定の初期にかなり急速にスケールさせ、制御可能な最大の能力水準に達したところで劇的に減速するのが、最善の軌道に思える。
プランAの具体的な軌道は、こうしたトレードオフを扱う最善の方法についての私たちの最善の推測だ。しかし、これが正しい道だという自信はまったくない。私たちは大まかな推測をせざるをえないが、その時点の意思決定者は、こうした実証的な要因を私たちよりよく理解しているはずだと期待している。
もう1つの十分にありうる軌道がプランSで、どれだけの速さでスケールさせるかについて、基本的に正反対の選択をする。AIの能力のそれ以上のスケールアップを、ただちにモラトリアムで止めるのだ。この政策は、協定崩壊のリスクが小さい場合、より優れたAIが安全性研究にもたらす見返りが小さい場合、どんな能力のスケールアップにも高いリスクが伴う場合(いずれか1つでも、複数でも)に、より有望に見える。
データセンターの大規模な建設
プランAでデータセンターを大規模に建設するのが望ましいのは、急速なスケールアップ、秘密プロジェクトによる乗っ取りのリスクの低減、アラインメント税を払うための余力の確保といった利点が、検証が失敗するリスクや、巨大な計算資源の備蓄を抱えたまま協定が崩れることで上乗せされるリスクを上回る場合(そしてその場合に限る!)だ。
もう少し詳しく言うと、データセンターを大規模に建設する主な利点は、AI開発者が次のことを行えるようになる点だ。
-
アルゴリズムを秘密プロジェクトに漏らさずに、速くスケールさせる。 前の節では、AIの能力を高めるのが良いのはどんな条件のもとか、そして速く進む場合と遅く進む場合のトレードオフを論じた。単純化すれば、AIの能力を高めるには、アルゴリズムを改善するか、計算資源をスケールさせるかのどちらかだ。計算資源に大きく頼れば、そもそもアルゴリズムの進歩を生まずに済む。それが、その進歩を漏らさないための最善の方法だ。
-
アラインメント税を払う。 計算資源を大量に使うアラインメント税は、安全性に非常に役立つかもしれない。たとえば、ニューラリーズは現在のアーキテクチャよりはるかに性能が高い一方で、安全性の面では劇的に劣るかもしれない。計算資源が十分にあって、性能面の不利を受け入れたうえで現在のアーキテクチャを使い続けられるなら、リスクを劇的に下げられるかもしれない。計算資源を大規模に増やさなければ、定義上、計算効率がずっと低いアーキテクチャを追求することはできない。
主な欠点は次のとおりだ。
-
検証と規制の重みが増す。 検証下のプロジェクトがさらに多くの計算資源を持つので、その計算資源が安全に使われること、特に、できるだけ速く知能爆発を起こすために使われないことが、より重要になる。したがって、AIプロジェクトに課される規制が知能爆発を排除できるほど十分に保守的であることが、いっそう重要になる。検証も十分に頑健でなければならない。企業や暴走したAIが検証をかいくぐり、検証下のクラスター内で膨大な計算資源の支配権を違法に握ることがあってはならないからだ。
-
巨大な計算クラスターを抱えたまま協定が崩れ、クラスターが破壊されなければ、知能爆発は極端に速くなりかねない。 素朴な見積もりの1つでは、計算資源が10倍になると知能爆発の速さは5.5倍になる。だとすれば、計算資源が1万倍になると、知能爆発の速さは900倍になるかもしれない。既定なら1年かかるところが、プランAのハードウェア爆発のもとでは1日足らずになるかもしれないのだ。これは明らかにきわめて危険であり、だからこそ私たちは、計算資源の相互確証破壊をこれほど重視している。
以上をまとめると、プランAのもとでハードウェアの大規模な拡大をどこまで進めるべきかの判断について、私の考えは次のとおりだ。
-
秘密プロジェクトが懸念に当たらないなら(たとえば、10万GPUのクラスターでそれなりに速い知能爆発を起こすのは不可能だという理由で)、ハードウェアはまったくスケールさせないか、ゆっくりとだけスケールさせる。
-
協定の崩壊後に計算資源を破壊する信頼できる仕組みがあり、(国によるものであれAIによるものであれ)大規模な不正な社内配備が起きないと高い確信を持てる信頼できる検証の仕組みがあり、協定内の計算資源についても信頼できる検証があるなら、計算資源の拡大の欠点は小さい。したがって、ハードウェアをほぼ可能なかぎり積極的にスケールさせるのが有益だ。
-
それ以外の場合は複雑なトレードオフになり、上に挙げたさまざまなコストと利点の大きさを比べて判断する必要がある。
私たちの具体的な検証計画
プランAのシナリオで使われる検証計画は、次のようにまとめられる。
-
すべての大規模データセンターの所在地を相互に申告する。申告された数を、情報機関の推定と照合する。
-
学習と実験の一時停止に合意する。この一時停止を検証するため、申告されたクラスターに推論専用の検証装置を設置する。
-
検証可能な(そして完全に透明な)学習・実験用クラスターの立ち上げを急ぐ。完成したら、安全性と透明性の制約の範囲内で能力のスケールアップを再開する。
これについてはこちらでより詳しく論じている。
この版の検証計画は、協定の開始時点で (1) 推論を検証でき、(2) AI開発の検証が、すぐには無理でも比較的短期間の集中的な研究で実現できる、と仮定している。このどちらか、あるいは両方が誤っている可能性が最も高い。この2つの前提は、プランAが想定する政治的意志と能力のもとで何ができるかについての私の中心的な推測だが、現実にはおそらく準備はこれほど整わないだろう。
検証の手段が間に合わなかったらどうするか?
検証のアプローチは、大きく3つに分けられる。
-
技術的な検証手法。協定の双方が、相手が危険なことを何もしていないと確信したうえで、AIの利用や開発を続けられるようにする手法だ。その一例がプランAでのやり方で、当初は推論のみに頼りつつ、学習や実験を検証する技術的手法の開発を急ぐ。
-
信頼に頼る。つまり、どちらの側も離反しうることを受け入れたうえで、どちらもそんな愚かな試みはしないだろう、あるいはしてもHUMINTなどで発覚するだろう、と期待する。
-
大ざっぱな検証手法(たとえば計算資源の破壊や、相互の電源停止)。
知能爆発が始まる前に、技術的な検証手法を用意しておくことが強く望まれる。推論の検証装置が用意できていれば、協定の開始時にもAIへのアクセスを続けられる。開発の検証が用意できていれば、協定の開始時に、AIの能力のスケールアップや最先端モデルを使うAI安全性研究を止める必要はない。代わりに、(上で述べた考慮事項に従って)スケールアップしないほうがよいほど危険になるまでスケールさせればよい。
2と3はおそらく一時的な体制にとどまり、技術的な手段を実用化するための集中的な取り組みと組み合わされるだろう。したがって、最終的には十分に優れた技術的手法にたどり着けると期待している。
2の主な欠点は、離反のリスクを伴うことだ。そのため、政治的な困難も増すかもしれない。双方とも相手の離反を心配し、そもそも署名しにくくなるからだ。ただし、信頼を完全に切り捨てるのは正しくない。AIによる乗っ取りのリスクが非常に高くなり、離反すれば存亡に関わる破局を招く可能性がきわめて高いために、どちらの側にも離反する動機がなくなるかもしれないからだ。AIによる乗っ取りのリスクが高いことが共有知識になれば(たとえば、初期のミスアラインしたAIが妨害工作をしている現場を押さえた後などに)、信頼に頼るのが最善の選択肢になるかもしれない。
3の主な欠点は、大規模な推論が一時的に止まる期間が生じることだ。ただし、これは素朴に考えるほど悪くはない。計算資源の90%の電源を切る(あるいは破壊する)合意であっても、10倍安いモデルに戻らざるをえなくなるだけだ。一定の能力水準にかかるコストは歴史的に非常に速く下がってきた(平均で年約40倍)ので、計算資源が10分の1になるのは、おおよそ7.5か月前の最先端(SOTA)モデルを使わざるをえなくなることに相当する。3の欠点ははっきりしている。離反が可能であれば、双方がそもそも離反を選ぶ可能性が高まる。
なお、これはプランSがプランAより優れている点の1つだ。プランAには(1)が必要だが、プランSには(3)だけで足りる。
透明性とセキュリティのトレードオフ
セキュリティと透明性のあいだには、本質的なトレードオフがある。何かを守るには、どうしても誰かにそれを見せないようにする必要があるからだ。
プランAは透明性寄りだ。その大きな理由は、秘密プロジェクトが離反して協定を損なうことに成功するリスクより、合法プロジェクト内部のガバナンスがまずいリスクのほうを私が心配しているからだ。透明性を高めれば、平均的に見てコンソーシアムが下すガバナンス上の判断の質が上がる。一方、セキュリティを高めれば、秘密プロジェクトが成功しにくくなる。さらに、たとえガバナンス上の判断が完璧でも、合法プロジェクトが自力でアラインメントを間に合うように解決できるとは限らない。たとえばセーフティケースに潜む微妙な誤った前提に気づくために、外部の広い世界の助けが必要になるかもしれない。加えて、透明性は検証にも非常に役立つ。
とはいえ、現状はこの2つの次元のパレートフロンティアにはほど遠い。プランAでは、最先端のAIプロジェクトについて、セキュリティと透明性の両方を劇的に高めることを提案している。透明性に関わるトレードオフは、透明性に関する補足資料でずっと詳しく論じている。
ASI後のガバナンス計画
関連資料:宇宙ガバナンスに関する補足資料、『AI 2040』のエピローグ。
私たちは、望ましいASI後のガバナンス計画がどんなものになりうるかについて、具体的な推測を示している。とはいえ、私たちがまだ思いついていない、よりよい案が存在し、その時点で見つけられるはずだと予想している。だから読者には、私たちの計画を、自分が重視する観点から他の計画と比べるための基準線として受け止めてほしい。そのうえで人類が、よりよく機能する体制の設計に、人間とAIの両方の知的労働をはるかに多く注ぎ込むことを願っている。
テイクオフ期におけるAIの広範な導入
プランAのシナリオでは、テイクオフの期間中にAIを経済に広く導入する。これはテイクオフの期間中の世界に甚大な影響を与える。ほぼ全員が職を失い、市民配当に頼り始めるのだ。全体として、AIの大規模な影響は、AIが人間よりはるかに賢くなった最後の段階で一気に現れるより、たとえば10年のテイクオフをかけて徐々に現れるほうが望ましいと考えている。
(AIが経済全体にどう影響するかについては、私たちの経済モデルと、経済に関する補足資料での議論で詳しく見られる)
ただし、これはいくつかの重要な問いにかかっている。
-
社会の認識の質への正味の影響はプラスかマイナスか? 現時点では、まったく確信が持てない。一方では、人間並みのAIを広く導入すれば、インターネットと同じように情報へのアクセスが広がる。他方で、インターネットは一部の人々にとっては間違いなく役に立つが、社会の認識の質に対する平均的な影響が良いのか悪いのかは、はっきりしない。これについてはもっと研究が必要だ。その時点で私たちが実際にどのプランを提言するかは、AIの広範な導入が認識に与える影響についての最善の推測に大きく左右されるだろう。現在の知見のもとでは、これがどちらの方向にも大きな考慮事項だとは感じていない。
-
広範な導入は、AIの制御を意味のある程度に難しくするか? おそらくそうはならないと思う。AIによる乗っ取りの主なリスクは、不正な社内配備と再帰的自己改善を経由するからだ。広範な導入がリスクを高めるという議論は、それによってAIが乗っ取りに役立ちうる手段を得るかもしれない、というものだ。特に、(i) 大規模なロボットの労働力と製造基盤、(ii) ロボット軍の指揮権、(iii) 生物学の研究施設へのアクセス、(iv) 幅広い人々との日常的な接触、だ。私の考えでは、こうしたリスクはおそらく、AIの行動の監視、最も危険な物理インフラ(生物学の研究施設など)へのアクセス制限、どのAIシステムにも物理的資源の大部分を支配させないこと、異なるAIシステム間の共謀の防止を組み合わせれば抑えられる。とはいえ、広範な導入によって制御がずっと難しくなる可能性も十分にあると思う。懸念される特定の領域でのAIの導入を制限することで対処できればよいが、実際には多くの領域にわたって導入が制限されることになるかもしれない。
-
広く導入されたクローズドソースのモデルによる悪用のリスクはどれほど高いか? 私としては、このリスクはそれなりに低いと見ている。理由は、(1) プランAのような体制では、安全性を高めるために大幅に減速しており、大量の監視を行う余力もあるので、敵対的な攻撃への頑健性については楽観しているから、(2) 広く導入されたAIモデルを脱獄できたとしても、講じられた防御策は、悪用による存亡に関わる破局を防ぐのに十分だと思うから、だ。しかし、この2つの前提がどちらも崩れる可能性は十分にある(本質的に難しいためか、実行が無能なためかは問わない)。その場合、広く導入されたモデルから深刻な悪用のリスクを抱えることになる。
AIを社会に広く導入しないなら、主な代替案は、閉じたプロジェクトの内部でAIを開発することだ。これには別のリスクが伴う。外の世界と接触せずに知能爆発を管理する閉じた集団は、それが誰であれ、未来に対して莫大な力を持つことになる。極端なケースでは、閉じたプロジェクトが、Training AGI in Secret would be Unsafe and Unethicalで述べられているように、外の世界に知らせずに文字どおり秘密裏にAIを開発しているかもしれない。秘密の知能爆発は、ミスアラインメントのリスクの面で悪い。何が起きているかを知り、理解し、アラインメントの手法について意見を出せる人がはるかに少なくなるからだ。権力の分配の面でも悪い。権力を求める個人がAGIプロジェクトの支配権を奪い、(広く人類全体の価値観ではなく)自分の価値観にアラインしたASIを作れてしまうかもしれないからだ。
広範な導入を避けるなら、よりよい案は、限定的な導入にとどめつつ透明性を最大化することだ。評価結果を公開する、AIが非常に目覚ましいことをするデモを公開する、AIが生み出した(AI以外の領域の)研究成果を公開する、モデル仕様書を公開する、などだ。これは秘密の知能爆発よりはるかに良い。しかし、そうした状況でも、人類は何が起きているのかを大部分つかめないままになる可能性が高い。AIが日々の暮らしに影響していなければ、普通の人々にとってそれは、話の種にはなってもどこか遠くの科学プロジェクトのように見えるだろう。身近な現実(near mode)ではなく、遠い話(far mode)として受け止められるのだ。したがって、AIの広範な導入は、とりわけAIをめぐる認識の質を高める可能性が高く、これは好ましいことに思える。
付録:主要な政策はどれほど実現しそうで、どれほど望ましいか?
プランAは、純粋な提言でも純粋な予測でもない。あらゆる行為主体が明日から最大限に責任ある行動をとる、という純粋な提言では、あまりに現実味がなかっただろう。そして純粋な予測のシナリオは、すでに書いている。それが『AI 2027』だ。そこでプランAは、実現の見込みと望ましさの折衷として作ることにした。
下のインタラクティブなグラフは、シナリオ中の各政策がこの2つの次元でおおよそどこに位置するかを示している。実現の見込みは、シナリオ中でその政策が採用される時点で、それまでに起きたことすべてを前提として判断している。今日の世界から出発してその政策が実現する確率を表すものではない。たとえば「人間のトップ水準での一時停止」の実現の見込みが高く評価されているのは、2026年の今の立ち位置から見て一時停止が起きる可能性が高いと考えているからではない。協定が何年も維持され、制御に基づくセーフティケースが目に見えて限界に近づいている世界であれば、意思決定者はそれに近いものを選ぶだろうと予想しているからだ。望ましさは、シナリオ中の同じ時点で、最も実現の見込みが高い代替案と比べて、その政策が現時点の予想でどれだけ優れているかを測っている。今日の時点で私たちが最も採用を望んでいる政策の順位ではない。スコアが低い場合、私たちの提言が予測のつかない多くの実証的な見直しにさらされることを意味する場合もあれば、代替となる政策が私たちの提言とほぼ同じくらい良く見えることを意味する場合もある。
政策をクリックすると詳しい説明が読める。
なぜこのシナリオは純粋な予測ではないのか? それはすでにやった。『AI 2027』を読んでほしい。なぜ純粋な提言ではないのか? 現実性を完全に捨ててしまえば、あまりに非現実的で、出来上がるものは役に立たなくなるからだ。
かぎ括弧を付けたのは、私たちのシナリオが示すとおり、AIの進歩のペースを制限する国際協定がしっかり執行されたとしても、AIの全体的な進歩のペースは、大半の人が予想し慣れ親しんでいるものと比べて極端に速いからだ。私たちがそう考える理由について詳しくは、AIの進歩のモデル(AI Futures Model)とAIの経済的影響のモデル(プランAの経済学に関する補足資料)、数多くのブログ記事、そしてもちろん『AI 2027』を参照してほしい。
AGIは汎用人工知能(Artificial General Intelligence)、つまり人間と同程度の汎用的な知能を持つAIのことだ。私たちが実際に考えるときには、より厳密な概念を使っており、それについてはAI Futures Modelで読める。AC、SAR、TED-AIといった概念だ。とはいえ「AGI」は、これらのマイルストーンをあいまいに組み合わせたものを指す便利な略称だと考えている。これらのマイルストーンは互いに数年以内、あるいはそれ以下の間隔で到来すると予想しているからだ。だから私たちが「AGI」と言うときは、上のようなマイルストーンを指し示しつつ、文脈上厳密さが必要ないので意図的にぼかしているのだと理解してほしい。
イーライの到来時期の見方は私と近いが、彼のテイクオフは約2倍遅い。
注:テイクオフの速さという言葉を、TED-AI以後の期間を指すのに使う人もいる。あいまいな用語だが、この文書では、ここで示した定義、つまりACからTED-AIまでの期間という意味で使う。
例を挙げよう。ACからTED-AIまでの期間が1か月だとする。(楽観的に見て)計算資源のガバナンスによって、ACを持つ無許可のプロジェクトを20分の1に減速させられたとしても、そうしたプロジェクトがTED-AIを手にするまでの猶予は2年しかない。これはプランAが想定するより短い期間だ。
この理由づけは、後述のデータセンターの建設の節で説明している。
なお、秘密プロジェクトを懸念する理由は、それが知能爆発を起こすことだけではない。決定的な戦略的優位を直接手にするリスクもある。だから、たとえば秘密プロジェクトがトップ専門家並みのAIを学習させられるなら、それでもなおリスクがある。
速さ以外のテイクオフのさまざまな側面、特に、少量で固定されたハードウェアで速い進歩が起こりうる可能性についての見方も含む。
実証的なフィードバックが非常にあいまいなものになる可能性は十分にある。それでも全体としては、おおむね人間並みのAIを広く実験に使える長い期間があれば、アラインメントの難しさに関わる大量の証拠が表に出てくると楽観している。現在の(貧弱な)認識の環境を考えると、(AIについての根本的な理解が得られるまでは)この証拠が科学界の幅広い合意につながるほどのものになるとは思わない。ただ私個人としては、多くを学び、考えを実質的に改めることになると予想している。
協定前の計算資源が非常に重要なのは、協定後の計算資源は実効的に監視される可能性が高いと思われるからだ。(1) 関連するチップを製造できる、きわめて高価な半導体工場はごくわずかしかなく、そのすべてを監査官が直接監視できる。(2) 違法な工場を建設するのは現実的に不可能だ。
具体的には中国に対するセキュリティだ。秘密プロジェクトを運営するのに最も有利な立場にある行為主体は、おそらく中国だからだ。
たとえば、すべての人間を、ナノテクノロジー(友好的なナノテクで防御する)、鏡像生命(空気を一切入れない)、超説得(外から入る情報はすべて友好的なAIが仲介し、超説得的な内容をふるい落とす)に耐えられるバンカーに移すようなことが必要になるかもしれない。
AI開発が他の企業、多くの政府、一般の人々に対して透明になっているおかげで、政府が安全性の手法について誤った判断を下すことへのフェイルセーフが一部用意されている。
おそらく秘密プロジェクトはある程度懸念すべきものだが、はっきりしたことは言えず、主に減速に向けた国際協調がいつ始まるかにかかっている。協定が遅くなるほど、離反のリスクは高まる。(1) 超知能に近づいているうえ、(2) AIが秘密プロジェクトの運営に関わるタスクのより大きな割合をこなせるようになり、必要な人員の規模が小さくなるからだ。
アルゴリズムの効率が年約40倍のペースで改善するなら、計算資源が10分の1になることで失われる進歩の年数 t は、log_40(10) = 0.624年 = 約7.5か月となる。
この付録はマイルズ・コダマ(Miles Kodama)が執筆した。