プランAは5つの最大の問題をどう解決するか

Thomas Larsen

問題1:超知能AIに対する制御の喪失

減速の合意によって、知能爆発は少なくとも10年かけて進む。企業は競争の圧力に押されて仕事を自動化しAIを信頼するのではなく、揺るぎないセーフティケース(安全性の論証)ができるまで減速を強いられる。プランAのシナリオでは、権限移譲までに人間のトップ専門家並みのAIとともに過ごす期間が約5年あり、現実的にはさらに時間を確保できる可能性もある。アラインメントが10年の減速では足りないほど難しいとわかった場合に備えて、より長い一時停止のための基盤も整えてある。

協定に透明性とアクセスに関する規定があるため、AI開発者に対する監督ははるかに厚くなり、最先端のモデルを使ったアラインメント研究に必要なアクセスを持つ人の総数もずっと多くなる。

(詳しくはこちらを参照)

問題2:AIは、最初の超知能を支配する集団(もしそういう集団が現れればだが)に、途方もない権力を集中させる

AI透明性法の段階で、CEOが自社のモデルにバックドアを仕込むことはある程度防げる。研究の完全な透明性に関する協定が、それをはるかに強固に「確定」させる。最大規模でもっとも広く使われているモデルに隠された意図を植えつけようとすれば、CEOが始めたものであれ大統領が始めたものであれ、複数の国の政府にそれが見えてしまう。さらに、モデル仕様書の透明性、アルゴリズムの進歩の減速、研究の完全な透明性に関する協定が組み合わさることで、同程度のAIを持つ企業や政府が数多く存在するようになる。これは秘密の忠誠心や隠された意図を防ぐという狭い効果にとどまらず、権力をより広く分散させるうえで大いに役立つ。

知能爆発がゆっくりと時間をかけて進み、モデルへのアクセスの格差も防がれて誰もが同じ水準のAI能力を使えるので、力を奪われつつある人は誰でもそれに気づき、よりよい条件を求めて交渉できる。一般の人々も状況をよく理解できるだけ賢いAIを使えるので、倫理的で思慮深い政治家に投票できる。そうした政治家は一般市民の持つ力を維持し、さらに強めるので、好循環が生まれる。その結果、市民配当と宇宙の統治に関する提案が実行され、権力はいつまでも分散した状態に保たれる。

問題3:超知能によって、核保有国を含む多くの国が力を奪われることから生じる第三次世界大戦のリスク

プランAは、超知能をめぐる競争の「勝者総取り」の性質をなくすことで、第三次世界大戦を防ぐ。もはや人工超知能(ASI)への開発競争はない。どちらの側も、相手が先にたどり着いたら何をするかを恐れることはないし、相手を減速させるために攻撃的な手段に出ることを検討することもない。負ける道を進んでいると気づいて、どちらかの側がパニックに陥ることもない。誰が勝っても自分たちは負けると徐々に気づいた中間的な国々が、同じくパニックに陥ることもない。

問題4:AIが人々の仕事を奪う

失業がよくないのは、人々が (a) 収入、(b) 力、(c) 生きがいの源を失うからだ。プランAは、AIによる失業のペースを、失業の悪影響を和らげられる程度にまで遅らせる。

人々が仕事を必要とする主な理由は、収入源を得るためだ。プランAは、収入の喪失に市民配当で対処する。一人ひとりが、きわめて高い生活水準を支えられるだけの所得の分け前を受け取る。

仕事が重要な2つ目の理由は、仕事がそれに就く人に力を与えることだ。CEOや政府には、経済的価値を生み出す人々を大切にする動機がある。ところが、経済的に意味のある作業をすべてAIがこなせるようになると、政府や企業は市民や従業員の生活を支える強い動機を失う。詳しくは「権力集中」の節を参照してほしい。

仕事が重要な最後の理由は、多くの人にとって仕事が生きがいになっていることだ。ここでは、そこまで悪い事態にはならないとだけ述べておく(人は経済的に役立つ仕事だけでなく、さまざまなものから生きがいを得られる! 家族、友人、恋愛、趣味、スポーツ!)。それに、利益はコストを上回る。この意見に賛成できないなら、プランSも用意してある……。人間を時代遅れにするAIの構築と配備を企業に許すかぎり、大量失業を避ける方法は基本的にない。特に、さまざまな職業でのAIの利用を禁止しても、長くはもたない。

問題5:小規模な主体によるAIの悪用

賢いAIが広く使えるようになれば、生物兵器(あるいは、攻撃者がわずかなコストで甚大な被害を与えられる他の技術)をつくるのは造作もなくなる。甚大な被害を与えようとするテロリスト、国家(北朝鮮など)、人間嫌いの者は、AIを利用して、AIがなかった場合よりはるかに大規模な攻撃を仕掛けられるようになる。

プランAでは、秘密プロジェクトへの対策の一環として、オープンウェイトモデルの能力を協定前の水準に制限する。クローズドなモデルは、危険な要求を拒否するように学習させる。アクセスの制限が破られた場合に備えて、プランAでは生物安全保障をはじめ、世界のレジリエンスを高める対策にも大規模に投資する。

プランB、C、Dでは、悪用に対して別のアプローチを取る。知能爆発を全速力で駆け抜け、世界を直接掌握できる超知能をつくることで悪用を防ぐ、というものだ。超知能の登場までに悪用が起きる時間はごくわずかなので、悪用のリスクに限ればこれらのプランのほうがプランAより有利に見える可能性はある。しかしこの戦略は、制御の喪失と権力集中について許容できない水準のリスクを伴うので、全体の費用便益では合格しない。