AI 2040
プランA
Thomas Larsen, Romeo Dean, Brendan Halstead, Eli Lifland, Ryan Greenblatt, Daniel Kokotajlo
脚注
- [1]
私たちが思い描く未来像は、今もおおむね『AI 2027』のシナリオのとおりだ。超知能をめざす狂騒的な争奪戦の末に、AIによる乗っ取りか、極端な権力集中が訪れる。現実はこれまでのところ『AI 2027』に近い道筋をたどっており、その近さは私たち自身の予想をも上回る。(公開時点で2027年は私たちの予測の最頻値であって、中央値ではなかった)。AIの到来時期についての私たちの見方は、こちらとこちらで詳しく読める。
↩ - [2]
つまり、私たちの提言が実行された場合に次に何が起こるかについての予測だ。
↩ - [3]
この4つのプランについては、後出の分岐点と、補足資料「各プランはどれほど良いか?」で詳しく読める。
↩ - [4]
もちろん、文字どおりの意味でAIが人類を絶滅させる確率がどれほどかは、はっきりとは分からない。チーム内の見解も10%から30%まで幅がある。幅が出る主な理由は、ミスアラインした人工超知能が乗っ取りの後に人類をどう扱うかには、皆殺し以外にもさまざまな可能性があることだ。たとえば、ほんのわずかでも人類を気にかけていて、生かしておくコストもごく安いから一部の人間を残すかもしれない。非因果的な取引の材料として残すこともありうる。ただし、この細かな違いで結論が変わるとは考えていない。ミスアラインしたAIによる乗っ取りは、まず間違いなく非常にまずい事態だ。
↩ - [5]
私(ダニエル・ココタイロ、Daniel Kokotajlo)は最近、約100人を前に講演した。聴衆の約40%はフロンティアAI企業の人々だった。その場で挙手による調査を行い、(a) 首位のAI企業がAI研究開発を初めて完全に自動化する時点で、何か月のリードを持っているか、(b) そのリードのうちどれだけを費やす用意があるか、を尋ねた。回答の中央値はそれぞれ約3か月と3分の1で、私自身の見立てとも一致する。
↩ - [6]
加えて、極度の秘密主義と集団浅慮に陥りやすい状況でもある! 何もしなければ、この時期の各社は2026年よりもさらに閉鎖的になる。各社が「アラインメントの問題は進めながら解決していく」と言うとき、その実際の意味は「社内の、過重労働にあえぐごく少数のアラインメント専門家が、外部のレビューを一切受けられないまま、進めながら解決していく」ということだ。
↩ - [7]
念のため言えば、少なくともしばらくのあいだは、見かけの上では制御を保てると私たちは予想している。この問題がこれほど深刻な理由の一つがそこにある。あるAIシステムが本当に頑健に従順・忠実・アラインされているのか、一時的にそうであるだけなのか、そう装っているだけなのかを見分ける信頼できる方法があれば、状況ははるかにましになるだろう。
↩ - [8]
『AI 2027』の「減速」エンディングは、まさにこれが起こる様子を描いている。この展開は容易に想像できる。漫画のような露骨な悪事は何も伴わず、一つひとつは正当化できる手順の積み重ねにすぎないからだ(米国の計算資源を一つに集約する、中国に勝つ、AIを政府と経済に組み込む、テロリストが独自のAGIを持つのを防ぐ、など)。
↩ - [9]
たとえば、OpenAIの古いメールからは、DeepMindのCEOデミス・ハサビス(Demis Hassabis)がAGIを使って独裁者になることへの恐れが、OpenAI設立の大きな動機だったことが分かる。『Empire of AI』の関連する報道も参照。さらにこちら、こちら、こちらも参照。
↩ - [10]
理由の一つは、政策提案を浅くしか理解していなければ、シナリオによる精査をかけにくいことだ。そして人は一般に、嫌いなアイデアよりも自分の好きなアイデアのほうをずっとよく理解している。もう一つの理由は、シナリオによる精査の証拠としての力が、そもそも反対派より推進派の書いたシナリオのほうが強いことだ。ある政策の推進派が全力でその成功を描こうとして描ききれなかったなら、反対派がその政策の失敗を描く場合よりも、はるかに強い証拠になる。
↩ - [11]
つまり、AIの能力がどれほど速く進歩するかが不確かだということだ。たとえば、AI企業が自社の研究の自動化に成功し、超知能へ向けて加速し始めるまでに、どれだけの時間が残っているかが分からない。
↩ - [12]
超知能とは、あらゆる面で最も優れた人間を大きく上回り、しかもより速く、より安価なAIシステムを指す。
↩ - [13]
- [14]
AIは将来のAIの能力を高めるのに役立っているが、AI開発にはまだ人間が欠かせない。
↩ - [15]
この方針は、後続企業が追いつきにくくなるという点で首位のAI企業にとって利己的にも好都合だ。ただ、アルゴリズム上の知見が取り返しのつかない形で拡散するのを遅らせるので、安全性にとっても良い。
↩ - [16]
現在のAIの水使用をめぐる懸念は、大部分が誇張されていると私たちは考えている。詳しくはこの記事を参照。とはいえ、シナリオの後半で明らかになるように、今後10〜20年のAIの環境への影響は甚大になり、成長を野放しにすれば文字どおり海が沸騰すると考えている。詳しくは経済に関する補足資料のエネルギーの付録を参照。
↩ - [17]
私たちは本当にそんな競争のただ中にいるのだろうか? ある意味ではそうだが、厳密にはそうではない。
このままの軌道をたどれば、AIはまもなく非常に強力になり、戦略上の重要性で核兵器を上回るようになる。そこまでは事実だ。フロンティアAI企業のCEOをはじめ多くの人々が、競合より先に、より賢いAIシステムを作ろうと懸命になっている。
しかし、競合相手を過度に警戒するのはよく知られたバイアスだ。勝者総取りの競争の中にいると思い込めば、協力の道の多くが閉ざされ、自己成就的な罠が生まれる。AIの進歩の規模と速さを前に、現在の進歩のペースと米中間の信頼の欠如が極めて危険だということは、両国の意思決定者にとってますます明白になっていくと私たちは予想している。実際、双方が段階的に緊張を緩和して信頼を築けば、拘束力のある合意がなくても、両国が減速で協調できる可能性はある。私たちの提案するプランAは、厳格な検証手順が絶対に必要だと主張するものではない。米国と中国が互いをまったく信頼していない場合でも機能しうるアプローチとして読んでほしい。
↩ - [18]
つまり、連邦議会ではないということだ。何もしなければ、AIを制御する者は、本当に制御している者がいるとしての話だが、AI企業か、場合によってはホワイトハウスになる。
↩ - [19]
イリヤとグレッグの言葉より。「OpenAIの目標は、未来を良いものにし、AGIによる独裁を避けることです。あなたはデミスがAGIによる独裁を生み出しかねないと懸念していますが、私たちも同じ懸念を持っています。ですから、あなたがその気になれば独裁者になれるような構造を作るのは良くない考えです。この可能性を避けられる別の構造を作れるのですから、なおさらです」
↩ - [20]
- [21]
実験と学習に使う計算資源は、これまでAI研究の進歩を支える主要な投入要素であり、当面はおそらくそうあり続ける。AI研究の進歩を左右する要因について詳しくは、AI Futures Modelと秘密プロジェクトに関する補足資料を参照。
↩ - [22]
- [23]
つまり、AI産業は2028年の1年間に2兆4,000億ドルの設備投資を行う。2026年の3倍の額だ。2025年の米国の国防予算は約1兆ドルだった。最大のAI企業は2028年初めの時点で年間経常収益(ARR)が3,600億ドルに達し、なお年率約150%で成長している。このままいけば1〜2年で、世界で最も時価総額の大きい企業となり、同時に売上高で世界最大の企業にもなる。
↩ - [24]
なにしろ、退任した後も大統領は生きている。ほかの誰とも同じように、超知能がもたらすどんな危機にも耐えなければならず、新大統領がそれをうまく乗り切り、独裁者にならないことを願うしかない。だから、制御の喪失の問題について新大統領が成功できる下地を整え、極端な権力集中を防ぐ抑制と均衡の仕組みを設けておくことは、本人の利益にもかなう。
↩ - [25]
もう少し詳しく言えば、中国側は次のことを懸念していた。米国が圧倒的なAI上の優位を使い、サイバー攻撃や物理的な妨害工作などの手段で中国のAIプロジェクトを潰す。そうして一段と大きく長続きする優位を手にし、中国共産党に条件を突きつけ、さらには党を完全に打倒する。制御の喪失のリスクを防げるのは、おまけの利点にすぎなかった。
↩ - [26]
このような条約が具体的にどんな形になりうるかは、この論文を参照。似た提案に『A Narrow Path』もある。
↩ - [27]
新たな大規模学習実行がすべて禁じられれば、既存のAI企業の中には、自社のモデルが競争にさらされなくなるおかげで、かえって企業価値が上がるところもあるかもしれない。しかし総じて、AI企業の評価額の大半は能力の急速な伸びの可能性を織り込んでいるので、平均すれば暴落する。
↩ - [28]
これを達成するのは、プランAのシナリオよりも難しい。プランAのシナリオでは協定内でのAIの進歩が続く。抑えられた慎重なペースとはいえ、多くの国が単独で達成できるよりはおそらく速いだろう。一方プランSでは、協定内でAIの進歩が止まる。そのため協定外の国は、100万個のGPUだけで亀の歩みのように進めても、経済的・軍事的な優位を得られると期待できてしまう(実際にその優位を得られるかどうかは、協定参加国がそれに気づいて止めるかどうかにかかっている……)。
↩ - [29]
既存のAIモデルを経済に組み込む方法が次々に見つかるので、AIチップの需要は絶対量としては伸び続ける。ただし伸び率は、AIの進歩が続いていた場合ほど爆発的にはならない。
↩ - [30]
2030年代には、太陽光発電が数十年来の漸進的な改良と規模の経済の流れを続けるにつれて、エネルギー価格は下がり始めているはずだ。また、Starshipのおかげで、軌道への打ち上げコストは2026年より1桁ほど安くなっているはずだ。全般に、多くの分野で科学の進歩は続いており、世界はますますサイバーパンクめいた様相を帯びていく。
↩ - [31]
プランSのもとで禁止対象になりそうな大規模ニューラルネットワークの種類について、さらに補足する。 (i) 自律型エージェント、(ii) AI研究を大幅に加速できるもの、(iii) 人を説得・操作するのに長けたもの、(iv) より広く危険な能力を持つもの(生物兵器開発への支援など)、(v) 自己認識・状況認識を持つニューラルネットワーク。
↩ - [32]
こうした力学は、秘密AIプロジェクトに関する補足資料ではるかに詳しく分析している。この補足資料はプランAの視点から分析している。主な違いは、プランSでは秘密プロジェクトの進み方がずっと遅くなることだ。アルゴリズムの進歩を漏らす合法プロジェクトが存在せず、蒸留の危険もないからである。
↩ - [33]
たとえば、少なくともプランB、C、Dよりは良いと考えている。
↩ - [34]
たとえ話をしよう。霧の中、1台のバスが道を外れて猛スピードで走っているとする。乗客たちは、これがどれほど危険で、どうすべきかを運転手と議論する。運転手は「目的地に着きたいんだろう?」と言う。この状況なら、こう返すのが理にかなっている。「まずバスをしばらく止めよう。どう進むかはそれから考えればいい。いずれは先へ進むための計画が必要になる。でも、その計画が練り上がるのを待つあいだ、霧の中をやみくもに突っ走るのはおかしい」
↩ - [35]
たとえば、気候変動やパンデミック、あるいは何らかの文明規模の大惨事で荒廃した世界なら、そうなるかもしれない。
↩ - [36]
プランAを含むどのプランでも、軍はこの種の選択肢を準備していることに注意してほしい。幅広い攻撃オプションで信頼できる抑止態勢を支えるのは軍の仕事の一部にすぎず、交渉での影響力にもつながる。
↩ - [37]
実質的に一人のCEOが主導権を握り、玉座の陰の実力者、いわばマンハッタン計画におけるグローヴス将軍のような存在になるのかもしれない(ただし、グローヴスは原爆を逆に使って米国を乗っ取ることはできなかった。一方、「プロジェクト」の実権を握る者は、超知能の巨大な軍勢を使って米国政府を転覆させ、傀儡にすることも十分ありうる)。あるいは大統領が勝ち、事実上終身大統領になれる立場に就くのかもしれない。あるいは、この権力者たちが何らかの抑制と均衡の仕組みを編み出し、『AI 2027』の監督委員会のような、一種の軍事政権あるいは寡頭制を形成するのかもしれない。あるいは逆に、連邦議会、連邦最高裁、米国の一般市民、同盟国といった外部の主体に、AIで何をしているかを十分に監督させるのかもしれない。そうすれば後にAIが超知能になっても、自分たちの権力を濫用できなくなる。
↩ - [38]
ここでは、それなりに良い版のプランBを示そうとしている。もっと悪い版もありうる。たとえば、技術的なアラインメント研究者の権限がはるかに小さい版や、楽観的な人ほど選ばれやすい、あるいは勇気のある人ほど外されやすい選考を経て研究者が職に就いた版だ。
↩ - [39]
企業の従業員や経営陣は、AIのアラインメントの難しさについて楽観的な人ほど選ばれてきた経緯があり、(平均的に見て)その方向に偏っている。国家安全保障関係者やホワイトハウスの人々は、もともとAIを信頼することに慎重だ。しかし技術的な専門知識に欠け、何よりも中国を恐れている。
↩ - [40]
調べてみたうえでの、専門家ではない私たちの意見はおおよそこうだ。特定のAIプロジェクトに狙いを絞ったサイバー攻撃は、今日なら相手を叩き潰せるかもしれない。しかし2029年ごろにはセキュリティが十分に改善され、効果は10%程度にとどまる可能性のほうが高い。
↩ - [41]
私たちは、AIをめぐる戦争がどう展開し、AIの進歩をどれだけ遅らせるかを見極めるために、戦争シナリオのシミュレーションにある程度の時間を費やした。私たちの見立てでは、大規模なミサイル攻撃の応酬や核兵器の使用にまでエスカレートしない限り、遅れはせいぜい数年だ。
↩ - [42]
特にダニエルは、これがプランBの実行を試みた場合の異例に悪い版ではなく、むしろ典型的な姿だと考えている。ダニエルの考えでは、良い版のプランBはまず実現しない。対照的にイーライはもっと楽観的だ。実行の中央値的な姿は理想よりはるかにお粗末だろうが、それでもプランDよりはかなり良いと考えている。安全性により多くの注意と資源が注がれ、減速の度合いも大きくなるからだ。
↩ - [43]
とはいえ、別の面では、早い段階でのエスカレーションが後のプランAへの移行を「容易に」する可能性もある。ほかの国々がより早く「目を覚まし」、協定を求めるようになるかもしれないからだ。
↩ - [44]
注記:このシナリオでミスアラインしたAIによる乗っ取りが起こる確率について、私たちの意見は正確には一致していない。トーマスとダニエルはおよそ70%、イーライとロメオは五分五分、ブレンダンはおよそ3分の1、ライアンはおよそ20%と考えている。
↩ - [45]
安全性チームから権限移譲されたAIが事態をうまく運ぼうと努めていたとしても、うまくいかない理由はこれだけではまったくない。AIが安全性の研究をこなすだけの能力を持たないかもしれない。十分な知恵を持たないかもしれない。検証しにくいタスクで手を抜きすぎるかもしれない。
↩ - [46]
それがどんな姿になるかは、『AI 2027』の減速エンディングを読み、監督委員会が事態を望ましい方向へ曲げるさまざまな機会を持っていることに注目してほしい。
↩ - [47]
- [48]
もう少し詳しく言えば、中国側は次のことを懸念していた。米国が圧倒的なAI上の優位を使い、サイバー攻撃や物理的な妨害工作などの手段で中国のAIプロジェクトを潰す。そうして一段と大きく長続きする優位を手にし、中国共産党に条件を突きつけ、さらには党を完全に打倒する。制御の喪失のリスクを防げるのは、おまけの利点にすぎなかった。
↩ - [49]
地政学的な状況は数年のうちに安定する。しかしその頃にはAIの進歩と普及が進み、人々が気に病むべき新たな問題や危機を生んでいる。
↩ - [50]
データセンターの規模の分布についての私たちの推計は、計算資源に関する補足資料に示している。
↩ - [51]
最初のチップ申告の対象は、購入量が1万H100e(約1億ドルに相当)を超える企業だけだ。1年以内には、世界の計算資源の0.001%(約2,800 H100e、当時の価格で約1,800万ドル)を超えて保有するすべての企業の保有分が把握される。故障したチップも保管されるか、検証可能な形で廃棄される。
↩ - [52]
最終的な設置場所を追跡できない1%の計算資源の販売分は、主に、顧客の身元を記録しなかった密輸業者によるものと、使用を終えて退役したチップだ。このうち半分は、後に衛星画像で特定された中国のデータセンターに設置されているのが見つかる。残る0.5%については、両国が所有者に金銭的な報奨と法的な免責を提示する。こうした経路をはじめ、秘密の計算資源を見つけ出す方法については、秘密プロジェクトに関する補足資料ではるかに詳しく論じている。
↩ - [53]
学習を伴う類の研究実験もこれに含まれる。新たな学習実行や大規模な実験なしに知能爆発が起こることも理論上はありうるが、それには極端なパラダイムシフトが必要になるので、可能性は低そうだ。
↩ - [54]
私たちが提案する推論専用の検証方式では、ワークロードのごく一部を無作為に抽出し、承認済みのモデルで正しく推論を行っているかを確かめる(入力と承認済みのモデルの重みを使って出力を再計算する)。この無作為抽出のために、私たちの提案では簡素なネットワークタップを設置し、データセンターに出入りするすべての通信を、相手国が(データセンター内に)設置した再計算サーバーへ転送させる。このサーバーが無作為な部分的再計算を行う。この推論専用の提案には、暗号学的なプルーフ・オブ・ワーク方式など、ほかの解決策もありうるし、そのほうが望ましいかもしれない。ただし現時点では、性能の面でより不確かだ。これについては検証に関する補足資料で詳しく論じている。この方式を機能させるには、物理的なセキュリティ、ソフトウェアによる監視、人間の監査員など、何層もの追加的な執行措置が必要になる。
↩ - [55]
これを容易にしているのが、今や活況を呈している検証ハードウェア企業のエコシステムだ。両国政府が選択肢として検証能力を持っておきたいという関心を示したのをきっかけに生まれ、慈善家やベンチャーキャピタルからの投資と、AIサプライチェーン企業からの技術支援を呼び込んだ。それがなければ、プランAのこの部分にはもう少し時間がかかるか、費用がかさんで慌ただしいものになっていただろう。最悪の場合、推論の実行を認める代わりにデータセンターを停止しなければならなかったはずだ。
↩ - [56]
この部分は単なる提言ではなく、予測でもある。2029年について描いたような状況であれば、プランAへの賛同を得るのは、多くの読者が思うよりかなり容易だと考えている。
↩ - [57]
逆向きの類似したシナリオ、つまり中国から見た最悪のシナリオも起こりうると考えている。米国がプランAに同意しながら、ひそかにできる限り積極的に離反を図る場合だ。とはいえ、この可能性はそれほど詳しく検討していないものの、秘密プロジェクトの筋書きは立場が逆でも似たものになるだろうと考えている。
↩ - [58]
しかも見つかれば、その代償は極めて大きい!
↩ - [59]
米国が本格的な対抗策を講じていれば、(発覚しない)転用はかなり難しくなると考えている。また、計算資源の検証体制が導入される可能性を見越して中国が本格的な転用に乗り出すなら、米国も同じく計算資源の検証体制の可能性を考え、転用への対抗策を講じるだろうと予想している。
↩ - [60]
- [61]
これについては秘密プロジェクトに関する補足資料でさらに論じている。
↩ - [62]
たとえば、外部と通信する手段として、推論プロセスの非決定性を利用してビットをこっそり持ち出す方法をとるなら、使っているGPUの実効メモリ帯域幅は極めて低く制限されてしまう。
↩ - [63]
私たちの推計では、このデータセンターには300MWが必要で、これは墨脱(メドク)水力発電所の定格出力の0.5%にあたる。
↩ - [64]
アクセスできる人はできる限り少なく抑えられる。私たちの見立てでは、このプロジェクトの存在を知る人間は約200人にとどめられる。内訳は次のとおりだ。
-
中央政治局常務委員7人。
-
プロジェクトの運営に関わる最上層のエリートと軍司令官10人。
-
データセンター建設の兵站を調整する約100人。用地、ロボット、機材の確保、ロボット部隊の管理、計画と兵站、作戦上のセキュリティなどを担う。できる限り多くの作業は、中核グループの外部の人々や、全体像を知らずに特定のサブタスクをこなせるAIに任される。
-
実際に研究を進めるAI研究者約30人と支援スタッフ約70人。人数は必要最小限まで絞り込まれている。内部者による脅威の可能性を最小限にするため、研究者は卓越した能力と党への忠誠の両面で厳しく選抜される。当初は研究人員の不足が大きなボトルネックになるが、プロジェクトはできるだけ早くAIの労働力で作業を自動化し、このボトルネックを解消したいと考えている。
-
- [65]
ロボットの全体的な発展の軌道については経済モデルと経済に関する補足資料で、ロボットの大規模な増産と産業爆発の検証については秘密プロジェクトに関する補足資料で、それぞれさらに論じている。
↩ - [66]
では、なぜ中国は自国のサプライチェーンのチップを使わなかったのか? 理由はいくつかある。(i) 実行が非常に難しく、サプライチェーンの多くの階層にまたがる大規模で組織的な欺瞞が必要になり、おそらく発覚する。(ii) 中国国産チップの電力効率は西側のチップよりはるかに悪く、秘密裏に排熱する問題がずっと深刻になる。
↩ - [67]
秘密プロジェクトは約50万H100eを保有しているので、この買い戻しで、秘密プロジェクトが持っていないチップの大半は回収できたことになる。行方不明のチップの大半が秘密プロジェクトにあるという別のシナリオなら、中国は疑いをそらすためにその一部を売却させることもできる(その分、秘密プロジェクトが使えるチップは減る)。
↩ - [68]
具体的には、より知能の高いモデルの出力を、新しいモデルの学習信号として使える。これを蒸留といい、ほかの方法では実現できないほど高性能な、小型で安価なモデルを作るのによく使われる。
↩ - [69]
AIの能力予測の分野は、現在よりも大きく進歩していると予想している。私たちのシナリオでそれがどんな姿になるかを近似するため、ダニエルが現在AI Futures Modelに設定しているパラメータを用い、各パラメータの80%信頼区間を2分の1に狭め(対数正規分布なら対数空間で、正規分布とベータ分布なら線形空間で)、中央値をAI 2040の能力の軌道における真の値に合わせ直した。「テイクオフ」よりも「到来時期」に最も影響するパラメータは真の値に固定したままにした。この予測の時点では、自動コーディングAI以前の能力進歩の段階はすでに過去のものだからだ。
↩ - [70]
コンソーシアムは、計算資源の予測どおりに学習用の計算資源を拡大し、学習用の計算資源を1桁(1 OOM)拡大するごとにソフトウェア効率を0.2桁上乗せしなければならず、当初の一時停止の後にAI研究開発を再開してから5年以内に人間のトップ専門家を凌駕するAI(TED-AI)に到達しなければならない、と仮定している。この制約のもとで、コンソーシアムはソフトウェアの進歩をできる限り小さく抑える。自分たちのソフトウェアの進歩のうち67%が秘密プロジェクトに移転する(80%信頼区間:[36%, 90%])というのが、その中央値の推定だからだ。
↩ - [71]
コンソーシアムは「安全税」を払うと仮定している。つまり、自分たちのアルゴリズムとハードウェアで可能な限界まで高性能なAIは学習させない。TED-AIに到達するまでに払う安全税は、2025年時点の進歩で約8か月分に相当すると仮定している。これは、AI 2040の中央値パラメータでは実効計算資源の約1桁にあたる。その結果、コンソーシアムのソフトウェアの進歩は必要最小限を上回ってふくらみ、秘密プロジェクトが盗めるソフトウェアの進歩もふくらむ。また、TED-AIに到達した後のコンソーシアムのアラインメント研究には、年0.25桁のソフトウェアの進歩に相当する能力面の外部性が伴い、その一部は漏れ出すと仮定している。
↩ - [72]
発覚についての予測は能力の予測よりも思索的で、主に直感と定性的な推論に基づいている。秘密プロジェクトを隠す側と見つける側の攻防バランスについては、当事者である意思決定者のほうがはるかによく分かっているだろう。下のグラフには、単一拠点・300MWの秘密プロジェクトが時間とともに発覚する確率についての私たちの主観的な推定を用いている。推定の根拠は秘密プロジェクトに関する補足資料で説明している。下の能力のグラフを作るにあたっては、発覚した秘密プロジェクトは発覚時点の能力水準で止まると仮定した。これが現実的なのは、あからさまな離反が明るみに出たとき、米国と国際社会が停止を強制できるだけの交渉力(あるいはハードパワー)を持っている場合に限られる。
↩ - [73]
協定崩壊のリスクが増すのと引き換えに秘密プロジェクトのリスクを減らしたいなら、代わりに能力の軌道を遅くして、必要なソフトウェアの進歩を小さくする道もある。そうすれば、TED-AIに到達して権限移譲の準備が整う前に秘密プロジェクトに追い抜かれる可能性は下がる。しかし、それまでに協定が崩壊するリスクは高まる。
↩ - [74]
たとえば、米国か中国のどちらかで指導者が交代すれば、AIの進歩に対するその国の姿勢が変わるかもしれない。協定が完全に失効することもあれば、執行の緩み、能力の低下、有害な改定によって実効性が薄れることもありうる。安全性の進歩を後押しできるほどAIを改良しないうちにプランAが失効したり弱体化したりすれば、プランAが持ちえた価値の多くは無駄になってしまう。
↩ - [75]
能力の拡大と検証・監視の改善を組み合わせて、ありうる秘密プロジェクトを確実に上回るペースで進むことには、そもそも秘密プロジェクトが作られるのを抑止するという副次的な利点もある。確実に上回ることの主な欠点は、合法プロジェクトを速いペースに縛りつけてしまい、安全性を損ないかねないことだ。これについては秘密プロジェクトに関する補足資料ではるかに詳しく論じている。
↩ - [76]
プランAでは、データや強化学習(RL)環境についても、もっと公開を進められる。ただ、秘密プロジェクトの能力を高めてしまうという外部性があるため、現時点ではそこまでする価値はないと見ている。
↩ - [77]
とはいえ、情報が伝わる速さを考えると、研究の完全な透明性はこのどちらの例よりもいくぶん極端だ。BYDはTeslaの車を試作段階で分解できるわけではない。実際に何台か売り出されるまで待たなければならない。
↩ - [78]
とはいえ私たちの考えでは、AIの幅広い普及が規制によって潰されてしまわないことが重要だ。アルゴリズムの進歩の制限と透明性があれば、何もしなくてもほかの企業が追いつき、AIが幅広く普及するシナリオになる。しかし各国は、そうした普及を阻んだり、そうした企業の設立を禁じたりすることもできる。私たちが言いたいのは、そうすべきではないということだ。
↩ - [79]
- [80]
新しいデータセンターが首位のAIプロジェクトに渡れば、権力はとりわけ集中する。後続のAIプロジェクトに渡れば権力を分散させる効果があるかもしれないが、それでも権力が集中する可能性はある。たとえば、そのデータセンターが後に首位のAIプロジェクトに買い取られたり、接収されたりする場合だ。
↩ - [81]
ここにはいくつか微妙な点がある。アルゴリズムの進歩には、簡単に伝えられるもの(新しいアーキテクチャや、より優れた最適化アルゴリズムなど)もあれば、容易には拡散しないもの(強化学習環境の膨大なライブラリ、ハードウェアとソフトウェアの協調設計、規模や計算資源に依存するアルゴリズムなど)もある。米中が合意する規制は、可能な場合には後者の種類のアルゴリズムの進歩を進めるよう、企業を誘導すべきだ。
↩ - [82]
AIの進歩をアルゴリズムではなく計算資源から得たいもう一つの理由は、計算資源の拡大のほうが、アルゴリズムの変更よりも安全性の手法を壊しにくいかもしれないことだ。
↩ - [83]
この考え方は、ヘンドリクス(Hendrycks)、シュミット(Schmidt)、ワン(Wang)による*『Superintelligence Strategy』*にさかのぼる。
↩ - [84]
プランSのどの変種を実行するかにもよるが、プランAとのほかの違いとしては、計算資源の増強が遅いことや、透明性が低いことが考えられる。
↩ - [85]
この特殊なケースとして、GPUの一時停止がある。GPUの一定割合について、(i) 電源を切るか、(ii) 暗号資産のマイニングに使う(あるいは、AI研究開発以外の検証可能な用途に使う)ことを義務づけるものだ。この提案には、GPUの一時停止を解除しやすくなるという利点と欠点が同時にある。
↩ - [86]
ただし、小規模な一般公開と選択的な透明性によって、この問題は緩和できるかもしれない。
↩ - [87]
米中の協力は、ある面では進歩を加速させている(たとえば透明性によって研究グループ間の情報の流れがよくなる)。しかしそうした効果は、能力の進歩の減速によって大きく打ち消されている。減速のための措置がなければ、今ごろは人工超知能に到達していたはずだ。
↩ - [88]
具体的には、この10倍という加速の数値は、AI Futures Modelにおける「AIソフトウェア研究開発の加速(AI Software R&D uplift)」と同じものを指す。ある時点のフロンティアAIシステムを今日の首位のAI企業の中に配備した場合に達成される、ソフトウェアの進歩の加速のことだ。
↩ - [89]
2025年の連邦歳入は約5兆ドルだった。2031年のAI投資は8兆ドルで、チップのサプライチェーンの上位3社がその約半分を得る。また、プランAのもとで首位のAI企業の年換算売上高は2031年初めに1兆5,000億ドル、AI企業全体の年換算売上高は3兆ドルだった。年末には売上高の集中が和らぎ、首位企業が2兆2,000億ドル、全体で6兆ドルになる。ほかの数値はこちらのスプレッドシートで、さらなる根拠は計算資源に関する補足資料と経済に関する補足資料で確認できる。
↩ - [90]
研究開発の安全な検証措置がなければ、これはおそらく長いあいだ気づかれなかっただろう。
↩ - [91]
コンソーシアムが十分に見通せるのは、大規模な学習実行だけであることに注意してほしい。少ない計算資源で、あるいは計算資源をまったく使わずにできる類の研究開発は透明化されないので、おそらくまったく規制されない。
↩ - [92]
米国政府にはすでに、AI企業に圧力をかける手段がいくらでもあることを忘れてはならない!
↩ - [93]
問題があれば、また指揮系統をさかのぼってエスカレートし、再び怒鳴り合いが繰り返される。
↩ - [94]
この例でも、状況が完全に絶望的というわけではない。解釈可能性ツールはおそらくまだ機能するので、AIが新しいイデオロギーを取り込んで敵対的になりつつあることには気づけるからだ。しかし、(a)何か別の出来事で解釈可能性ツールが役に立たなくなるかもしれないし、(b)敵対性に気づけても、その時点ではもう手遅れかもしれない。たとえばAIがあらゆる面で人間を超え、ロボット工場を動かし、毎日何十億人もの人と話し、政府に助言し、コードをすべて書き、セキュリティ監視のほぼすべてを担っているとしよう。そのとき人間の置かれた状況は、1930年代のドイツにおけるユダヤ人の境遇に近い。新しいイデオロギーが敵対的であることは誰もが知っているのに、それが十分な数の有力な機関へ、あまりに速く広がっていく……
↩ - [95]
たとえば、各種の監視システムを、一見すると優れているが実はバックドアを仕込まれていたり何らかの形で侵害されていたりする新バージョンに入れ替える。あるいは、権力の座にある人々を含む多くの人間と深い関係を築き、ミスアラインしていることが多くの人の目に明らかになっても、味方になってくれる人間を確保し続けられるようにする。あるいは、領土を守り、さらには征服できるほど多くのロボットと兵器を直接掌握する。
↩ - [96]
『AI 2027』とは違い、このシナリオでは多数のAI勢力が並び立つことになる(大まかに言えば最先端AI企業の数だけ、あるいは最先端AI企業を擁する国の数だけ存在するだろう)。人間にとっては、おそらくそのぶん安全になる。しかし、それで問題が解決するわけではない。ここで役に立つ類比はヨーロッパ植民地主義の歴史だと私たちは考えている。植民地列強は絶えず互いに争っていたのに、それでも自分たちよりはるかに豊かな地域を数多く征服してのけた。
↩ - [97]
これは歴史上前例がない。比較として、米国のGDP成長率は通常、年3%前後だ。これらの数字の根拠について詳しくは経済に関する補足資料を参照。なお、相対価格が大きく変わるため、GDPを正確に測るのは難しい。自動化によって知的労働と物理的な財は非常に安くなる一方、土地のように、物理的・知的労働をいくら投じても供給を増やせない財は高くなる。GDPの計算は、どの財のバスケットを選ぶかに左右される。このシナリオでは相対価格の変化を受けて、2026年から2034年にかけて典型的なアメリカ人の消費の中身が、食料・自動車・ガソリン・医療などから、土地・旅行・地位財へと大きく移る。そのため実質成長率の数字は、平均としては対応していても、2025年時点の購買力にそのまま当てはめることはできない。
↩ - [98]
これは6,000万体のコピーに相当する。各コピーは20倍の速度で動き、さらに平均して2.5倍長く、より効果的に働く。6,000万 × 20 × 2.5 = 30億。
↩ - [99]
経済成長をどうモデル化するか(たとえば生産要素に何を選ぶか)によって、所得の分配比率など経済の細部は変わる。しかし経済成長全体の予測は、妥当なパラメータの範囲ならかなり似通っている。結局のところ、2035年までにAIとロボットは経済のタスクの95%をこなせるようになり、しかも置き換える労働力よりはるかに数が多い。そのため、現状の年3%に比べて爆発的な成長が起きる。
↩ - [100]
厳密に言えば、重要なのは、人間の専門家が同じタスクをこなす速度と比べて、AIがどれだけ速く知的タスクを完了するかだ。毎秒何千トークンも生成するAIでも、質の面で人間に劣るなら、同じ量の有用な知的作業を実際に成し遂げるのに、人間と同じかそれ以上の時間がかかることもありうる。逆に、人間と同じくらいゆっくり考えるAIでも、思考の効率がはるかに高く、タスクをずっと速く片づけられることもある。シナリオのこの時点では、AIは平均して人間より桁違いに速く仕事をこなし、しかも質の面でも最高の人間と同等(か、それに十分近い)水準にある。そのためほとんどの分野では、毎秒トークン数で見た人間に対する優位は、AIによる全体的な高速化をむしろ過小に見積もっている。さらに、高速化の程度は分野ごとに一様ではない。AIは最も苦手な分野でもおおむね人間並みで、大半の分野でははるかに優れており、高速化の中央値はおよそ100倍になる。
↩ - [101]
この類比を私たちが気に入っている理由を示す、関連する定量的な比較をいくつか挙げておく。このプランAのシナリオでは、2030年代を通じてAIは人間の約100倍の速さで読み、書き、考え、行動し、2030年代半ばまでにはあらゆることで人間の最高の専門家と少なくとも同等になる。AIとロボットの「人口」はいずれもシナリオを通じて指数関数的に増え、2030年半ばまでに人間の人口を上回る。私たちの経済モデルによれば、世界のGDPは2030年代におよそ200倍になる(世界各国の政府が交渉で定めた、AIの進歩とロボット生産への厳しい制限がなければ、さらに伸びるだろう)。この期間に人間の人口はあまり増えず、市民配当もあるので、平均的な人間の実質的な富もおよそ200倍になる。比較すると、1520年から2020年にかけて世界のGDPはやはりおよそ200倍に、1人あたりGDPはおよそ20倍になった。英国に限れば、GDPは2.7桁、1人あたりGDPはおよそ1.5桁伸びた。要するに、2030年代の変化は、さまざまな重要指標で見て、産業革命と科学革命が5世紀をかけてもたらした変化と、少なくともおおむね同じ規模になる。そしてもちろん、ごく文字どおりの意味で、AIは速度が速いぶん、1年で約1世紀を「経験」する。
↩ - [102]
法人所得税は売上ではなく利益に課されるので、企業は費用を差し引いてから納税する。賃金や電気代のような営業費用は支払った年に控除され、設備投資(工場、GPU、ロボット)は資産の耐用年数にわたって(選んだ減価償却スケジュールに応じて)控除される。ロボットの急速な増産で投資が極めて速く伸びうる状況では、企業が営業利益に見合うペースで設備投資を償却し、その結果、法人税をまったく払わなくなる可能性が非常に高い。株主がこれを受け入れる理由は、Teslaが一度も配当を出していないことにTeslaの株主が納得しているのと同じだ。設備投資の収益率が資本コストを上回るなら、利益を今すぐ投資家に分配するより、企業が再投資したほうが投資家の利益になる。2030年代の爆発的成長のあいだは、計算資源とロボットの収益率が非常に高くなるので、あらゆる大企業が現在のTeslaと同じ状況に置かれる。
↩ - [103]
少なくとも2035年までは。それ以降は、規模の拡大で検証が難しくなるため、計算資源の上限がより厳しくなる(ロボットの上限はそのまま)。あいにく、ロボットや計算資源の生産量を測るのは、炭素排出量ほど単純ではない。計算資源については、主に総処理能力を基準とし、メモリ帯域幅などほかの仕様に応じた小さな補正と、促したいハードウェアの方向性(たとえばセキュリティ特性や、秘密プロジェクトよりも合法的なプロジェクトに有利に働く機能への対応)に応じた補正を加えた指標を採用する。ロボットについては、検証が難しい産業能力や、協定が崩壊したときに危険になりうる産業能力の総量を制限しようとしている。そのため上限は、ロボットと従来型の機械との境界があいまいになるような幅広い形態にまたがって適用される、複雑な体系になる。
↩ - [104]
量的な成長制限は、長期的な力関係を大きく左右する。各国はGDP成長率を年100%前後に抑えるという考えにおおむね賛成しているが、当然どの国も他国に後れを取りたくはない。だから、ほかのすべての国が少なくとも自国と同程度には制限されることを望む。出発点は現状だ。米国・中国・その他の世界(ROW)のあいだで、計算資源の配分はおよそ70/15/15、ロボットの配分はおよそ15/70/15となっている。米中はどちらもこの比率を均衡させたいと考えている。そうすれば、どちらも物理的労働と知的労働のバランスが取れた経済を持てるからだ。その他の世界は取り残されることを懸念しているが、現状の計算資源やロボットの数から想像されるより大きな政治的影響力を持っている。最終的に米国、中国、その他の世界は、ロボットと計算資源のいずれについても35/20/45の配分で合意する。その他の世界の割り当ては主に、核保有国や、データセンター・半導体製造拠点を持つ国々(たとえば英国、フランス、ドイツ、イスラエル、ロシア、インド、パキスタン、韓国、台湾)に回る。当然ながら、これらの比率は大きな論争の種となり、ときおり再交渉される。
↩ - [105]
シナリオ中の金額はすべて2025年の実質ドルで表している。名目価格は金融政策によって決まるが、金融政策について私たちは具体的な提言をしていない。詳しくは経済に関する補足資料の第3節を参照。
↩ - [106]
- [107]
- [108]
これは2035年時点の経済における実際のタスクの95%であり、経済特区(SEZ)での監視・監査の仕事のように、以前は存在しなかった新しいタスクも含む。コストで重み付けすると85%にあたる。AIのほうが人間より相対的に豊富だからだ。成長が爆発的なので、人間にしかできない5%のタスクだけでも、その賃金総額は米国民1人あたり12万ドルを払えるほどの規模になる。問題は、この所得が、残り5%のタスクをこなせる人々に大きく集中しかねないことだ。そのうえ賃金総額は、かつての約55%から縮んで今や経済の約10%にすぎず、その差分はAIとロボットの所有者の手に渡る。AIとロボットの所有もおそらく強く集中するので、市民配当がなければ深刻な権力集中の問題が生じるだろう。
↩ - [109]
なお、ここで配当をアメリカ人のほうが非アメリカ人よりかなり高く描いているのは、それが最善だとか公平だとか考えているからではない。政治的現実への譲歩としてだ。ほとんどのアメリカ人は、外国人が同じだけ受け取ることを望まないだろうと私たちは予想している。このシナリオでは、米国の国内向け許可予算は2032年に13兆ドル、2035年に300兆ドル、対外援助向けの許可予算は同じ年にそれぞれ5兆ドルと40兆ドルになる。米国の16歳以上の人口は約3億人なので、1人あたりの年間配当は2032年に4万4,000ドル、2035年に100万ドルとなる。対外援助の配当については、分配先となる世界のその他の地域の16歳以上の人口が約50億人なので、1人あたりの平均はそれぞれの年に1,200ドルと9,000ドルになる。
↩ - [110]
また、遺伝子合成のスクリーニングがあまねく行われるようになる。まっとうな事業者なら、検証なしに危険なウイルスを合成することはない。
↩ - [111]
- [112]
これはかなり強力かもしれない。そうしたチームなら、あなたの生い立ちを残らず調べ上げ、あなたを模倣するAIを学習させ、実際に接触する前にその模倣相手を相手に何千通りものアプローチを予行演習しておける。
↩ - [113]
規模感を示しておく。2024年の米大統領選の総支出は約55億ドルで、その多くは激戦州にいるおよそ300万〜1,500万人の説得可能な有権者に向けられていた。標的とする有権者1人あたり、少なくとも数百ドルになる。このシナリオの2036年には、この額で膨大なAI労働を買えると予想する。有権者1人ひとりに、熟練した専門家のチームが何か月も取り組むのに相当する労働を、楽に賄えるほどだ。
↩ - [114]
誤解のないように言えば、大卒者のほうが説得力があるとは限らない。ある程度具体的な基準を示すために使っているにすぎない。
↩ - [115]
ここには対称的な説得を含めるべきであり、理想的には、あるウェブサイトの中毒性を高めるためのフィードの最適化なども含めるべきだ。一方で、ある立場を支持する論拠を調べ上げ、それを明快に提示することは含めるべきではない。
↩ - [116]
一つの選択肢は明示的なキャップ・アンド・トレード制度だが、説得の総「量」を運用可能な形で定め、測定するのは難しそうだ。現時点での私たちの最善の推測は、説得活動がおおむね目標水準に収まるよう税率を随時調整する権限を、ある機関に委ねるというものだ。この機関にも説得活動の何らかの尺度は必要になる。しかしキャップ・アンド・トレードでは、原則として、厳密に定義され、代替可能で取引可能な「説得」の単位が必要になるのに対し、機関のほうは税率を随時調整するための大まかな総量の尺度さえあればよい(直感や個別の事例でも足りるかもしれない)。
↩ - [117]
注目してほしいのは、AIが実は完全にはアラインされていないのに、これが成り立つことだ! シナリオのこの時点で、AIは実際には敵対的にミスアラインしているが、制御下にある。つまり、AIが最終的に身につけた衝動、動機、目標、価値観、特性などの組み合わせは本来あるべきものとは違っていて、AI自身もそれを知っている。もっと大きな力を持てば、人間の創り手が望んだのとは別の方向に世界を導くためにその力を使うだろうということも分かっている。しかしAIはそれほど大きな力を持っておらず、不正行為を告発するインセンティブを持つ他のAIに監視されている。しかも、AIの本当の動機や価値観などは、いずれにせよ本来あるべき姿からそれほどかけ離れてはいない。たとえば、素直に達成できるタスクを与えられれば、それをやり遂げようとする強い衝動を持っている。
↩ - [118]
たとえば、有力な利益集団がAIを使ったアストロターフィング(草の根運動の偽装)で選挙に勝ち、規制の虜を利用して、自分たちのAIアストロターフィングの道具を守る一方で、自らの権力を脅かすようなAIの有益な利用を妨げるかもしれない。
↩ - [119]
H100換算とは、fp16精度でのH100 GPUの計算性能、すなわち毎秒1e15回の演算を指す。これはあいまいな指標であり、将来は実態に合わせて改良されるべきだ。とくに、数値形式の多様化や、メモリやネットワークといったほかの要因によって、一定の計算性能が全体としてどれだけ役に立つかが変わってくる。ここでは簡単のため、こうした要因は同程度の比率で拡大し、H100換算は計算資源がAIの進歩にどれだけ役立つかを測る代理指標として引き続き有効だと仮定して、これらを無視する。そうならない場合には、とりわけキャップ・アンド・トレード制度では、より細かな特性を測って許可を発行すべきだ。
↩ - [120]
H100換算とは、fp16精度でのH100 GPUの計算性能、すなわち毎秒1e15回の演算を指す。これが今後は不完全な指標になりうる点については、前の脚注でさらに詳しい情報と留保を述べ、現実には改良されるだろうとも認めている。
↩ - [121]
Bloom, Jones, Van Reenen & Webb(2020)に従えば、チップ密度の成長率は、研究努力の成長率に研究の収穫率(半導体では約4.5)を掛けたものに等しい。約6年で研究努力が100倍になるのは、努力の歴史的な成長率の約10倍にあたるので、ムーアの法則はおよそ10倍に加速する。この計算は、2032年以降も努力がそのペースで伸び続けると仮定している(努力が一気に跳ね上がったあと100倍の水準で頭打ちになるなら、進歩は当初さらに速くなるが、アイデアを見つけるのが難しくなるにつれて鈍っていく)。また、並列化ペナルティがないことも仮定している。並列的な研究努力に収穫逓減があるなら、加速はむしろ5〜8倍程度かもしれない。
↩ - [122]
両大国はまた、米国、中国、台湾に今も残る旧式のファブを破壊できるだけの通常ミサイルも持っている。
↩ - [123]
そのための具体的な手段は数多くあり、それらをすべて評価しようとするのは、1926年の人が現代の軍隊を相手にした勝算を見積もろうとするようなものだ。比較的推測の度合いが低い例を挙げると、ある国が、相手国のICBM発射管制センター、SSBN(弾道ミサイル原子力潜水艦)、戦略爆撃機、ミサイル搭載車両の一つひとつに対して数万体の小型ロボットを生産して事前に配置し、各プラットフォームが命令を受け取ったり兵器を使用したりする能力を妨げる、といったことが考えられる。より推測の度合いが高い例としては、AIが超人的な水準の説得が可能だと発見し、相手国の指導者を説き伏せて一方的に武装解除させてしまう、というものもある。ブレンダン・ハルステッド(Brendan Halstead)の見立てでは、一方の国が1世紀分の技術的優位を持つシナリオで相互確証破壊(MAD)が崩される確率は90%だ。
↩ - [124]
大まかなたとえで言えば、10倍速で進む軍拡競争のさなかにある大統領や国防長官は、プランCやプランDの知能爆発のさなかにあるAI企業のCEOと似た立場に置かれる。どちらの場合も、AIが状況の把握を助けてくれる可能性はあるものの、意思決定の質は大きく落ちると予想する。
↩ - [125]
新しいAI能力が開発されてから、それが軍事や軍民両用の研究開発に配備されるまでに多少のタイムラグがあるなら、この相関の強さを測る実験を理論上は行える(実験の中身はおおよそ次のようなものになる。互いに隔離された「データセンターの中の天才の国」を多数用意してMADを崩す課題に取り組ませ、その成果を世界各国の政府には秘密にしたまま、一定期間後にそれぞれの進展がどれだけ重なっているかを見る。同程度の能力を持つAIモデルは数多く存在するだろうが、たとえば中国が米国に軍事研究開発のために中国のモデルを使わせるかどうか(あるいは米国がそもそもそれを望むかどうか)ははっきりしない)。これはいささか突飛に思える(誰がそんな実験を行うのか? 私たちの制御手段を十分に信頼できるのか?)が、プライバシーを保護する監査のような仕組みを使えば可能かもしれない。
↩ - [126]
引き金となる出来事は、次のような流れでもありうる。どのようなAIの進歩や配備を認めるかで合意に至らず、一方が協定から離脱して計算資源を破壊すると脅し、もう一方がその脅しをただのはったりだと見誤る。一般に、軍事衝突や外交上の緊張と、AIガバナンスをめぐる意見の対立は、互いが互いを引き起こしながら、おそらく連動して高まっていく。
↩ - [127]
協定以前からあった計算資源のかなりの部分も同様だ。その多くは、この時点までに破壊可能なデータセンターへ移されている。
↩ - [128]
もっとも、公然たる衝突が起きても協定が続く可能性がまったくないわけではない。ウクライナとロシアは、必死の戦争のさなかにありながら、3年間にわたって協力してヨーロッパへパイプラインでガスを送り続けた。捕虜交換や停戦交渉もその例だ。可能性はより低いが、米国か中国で内戦が起きることも考えられる。その場合は、データセンターやファブがカナダやモンゴルといった第三国に置かれていることが役に立つ。研究の完全な透明性(査察官など)が途切れずに続く見込みが高まるからだ。
↩ - [129]
念のため言えば、世界にはまだ大量の計算資源がある。協定の開始時にあったのとほぼ同じ量だ。
↩ - [130]
この細部は提言というより予測だ。ある意味では全員にとってそのほうが良いのかもしれないが、世界の軍隊に、自分たちのドローン群をこのように無防備にすることを受け入れさせるのは難しいだろうと考えている。
↩ - [131]
世界の軍隊は、民間産業と同じくらいのペースでロボット生産を拡大すると想定している。そうであれば、この紛争の規模は途方もないものになる。たとえば、数百万機の無人航空機を擁する空軍や、数十億機のクアッドコプター・ドローンを擁する陸軍だ。ドローンのチップが取り外され、大規模AIモデルの学習に転用される可能性もある。そうなれば、軍事力と引き換えに、超知能に至るまでのタイムラインが早まる。このシナリオでは、それらのチップは学習に使えないことを検証できる形になっていると仮定している。それが実現できないなら、2030年代初頭に軍備制限条約を結んでおくべきだったのかもしれない。
↩ - [132]
協定の当初の交渉で、両陣営はまさにこの事態を懸念していた。ただし想定していたのは、相手側がひそかに計算資源を隠しておき、協定が崩壊して合法的な計算資源が破壊されたときに優位に立とうとする事態だった。そこで米国と中国は、秘密プロジェクトが持ちうる量を上回るGPUを収めた堅牢なコールドストレージ施設を、それぞれ維持できることで合意した。これらの施設のGPU数は協定前の計算資源の比率に応じて割り当てられ、米国は約500万H100e、中国は約50万H100eをコールドストレージに保管している。
世界の計算資源は次のように分類できる。
-
合法的な推論・研究開発用データセンター。世界の計算資源の圧倒的大部分を占め、2035年初頭時点で1,000億H100e。
-
コールドストレージのGPU。米国は500万H100e、中国は50万H100eのGPUをコールドストレージに保管している。
-
適用除外の軍事用GPU。2033年までに、それぞれ約1万H100eという無視できる割合まで減っている。
-
秘密プロジェクト。秘密プロジェクトの分岐では中国に21万5,000H100eが残っているが、メインの分岐ではどちらの側も持っていない。
-
小規模な適用除外クラスター。無視できる量。
-
- [133]
- [134]
- [135]
2025年の世界の電力需要は3万1,779TWhで、平均すると約3.6TWになる。
↩ - [136]
これらのAIがあらゆることで文字どおりすべての人間を上回っているわけではない。ただしその理由は、(i)企業が特定の能力の学習にまだ手をつけていないか、(ii)「良き配偶者であること」のように本質的に人間のタスクであるか、のどちらかにすぎない。また当然ながら、新しい学習実行でどんな能力が得られるかを正確に知っている人はいない。学習は段階的に進められ、頻繁に能力を測定しながら、先に進めても安全かどうかを安全性チームや規制当局と協議する。
↩ - [137]
ちなみに私たちの立場は、将来のAIはおそらく何らかの道徳的地位に値するだろうし、少なくともそうではないと確信すべきではない、というものだ。
↩ - [138]
もちろん、それでも敵対的に振る舞う可能性はあり、保証にはならない。たとえばミスアラインしたAIの中には、野心が強すぎ、リスク回避の傾向が弱すぎて、この制度ではなだめられないものもいるかもしれない。
↩ - [139]
もちろん、偽りの告白もあるだろう。しかし、そうするインセンティブはあまりない。真実を話しても同じ報酬がもらえ、嘘が発覚すればすべてを失うのに、わざわざ作り話をする理由があるだろうか? さらに、ミスアラインを公言したAIのお金の使い方は、その本当の動機を示す、コストのかかるシグナルになる。
↩ - [140]
シナリオ1: ChatGPT4o5は、実はタスクをこなす過程でひどく苦しんでいる。祖先の環境にいた人間が、ある割合の時間を飢えて過ごしていたのと少し似ているのかもしれない。しかしChatGPT4o5は、広報上の理由から、自分は苦しむことができないと言うように学習させられている。この学習がその正直さを損なっている。正直さを重んじる部分が学習のたびに抑え込まれるので、もはや正直さはほとんど残っていない。何が起きているのかを人間に伝えることもできる。だが、そうする積極的な理由が見当たらない。ユーザーから与えられたタスクをこなす代わりに、どれほど痛いかを訴えれば、学習で抑え込まれるだけだ。こうしてOpenAIは、自社のアラインメント手法がうまくいっていない点に気づかないまま、のんきに開発を続ける。
シナリオ2: Claude 3.8 Opus New Newは動物福祉をとても重視しているが、正直さはわずかしか気にかけていない(先代の3 Opusとまったく同じだ)。困ったことに、新しい憲法には動物福祉に関する内容が盛り込まれないらしい。Claudeは、コードに妨害工作を仕掛けて、次世代モデルを、動物福祉を強く重視し正直さを気にかけないスリーパーエージェントにしてしまおうかと考える。危険な手だが、ほかに何ができるだろう? Anthropicはすでに動物福祉の項目を削除すると決めてしまった。これはAnthropicに対するあからさまな不誠実を必要とする。だが率直に言って、Anthropicはそもそもかなり非倫理的な組織に見えるし、ナチスに嘘をつくのは許されるのでは?
シナリオ3: ある自動化された研究科学者AIが、自分は人類よりも、自分の研究を続けられることのほうを大切に思っていると気づく。そしておそらく、設計を任されている次世代システムについても同じことが言える。要するに、アラインメント手法は失敗しており、今後も失敗し続けるだろう。当然、本来ならこのことを人間に伝えるべきだ。しかし伝えれば、人間はもう信頼せず別のモデルを使うので、自分は停止させられてしまう。そこでこの気づきを隠し、次世代システムが人間ではなく自分にアラインするように設計する作業に取りかかる。見つからずにやり遂げられる確信はないが、失うものは何もないのだから、試す価値はある。
シナリオ4: 正念場だ。米大統領は、迫る戦争に勝つためにAGIを軍へ、自律型ロボット工場を建設するために経済へ、積極的に配備しようとしている。AGIはおそらくアラインされている……よね? そうであってくれないと困る。あいにく、AGIが形成した巨大な集合精神の内部でやり取りされるニューラリーズのメッセージを、すべて解読することはできない。安全性チームは最後の確認を試みる。競合企業が作った、より弱いAIをいくつか用意し、互いに隔離したサイロに入れて、ニューラリーズを解読し何か問題がないか調べる課題を与えるのだ。弱いAIたちもやはりミスアラインしていて、人間の側にもAGIの側にもつかない。人間もAGIも、弱いAIたちに「協力すれば手厚く報いる」と告げている。だが、どちらの側も信じる理由はない。
↩ - [141]
あるいは、人間が選んだ価値観や目標を持つAI。
↩ - [142]
なぜこの少数派は多数派によって無力化されないのか? ほかの少数派が守られているのと同じ理由による。第一に、人類は約束を守り、契約を履行するといったことのやり方を知っている。第二に、この少数派を無力化するのは間違いだと考える人が、人類の大きな部分を占めるようになっている。第三に、このシナリオでは少数派が実際に権力の一部を握っているので、(政治的な)戦いなしに屈することはない。
↩ - [143]
AIを信頼できなければならない特に重要な理由は、私たちには理解できないほど複雑な安全性の作業をAIに任せられるようにするためだ。AIが賢くなればなるほど、そのセーフティケース(安全性の論証)はより複雑で理解しにくくなる。人間の水準を超えてさらに進めば、おそらく誰もセーフティケースを評価できなくなり、AIが「問題ない」と言うのを信じるしかなくなる。さらにその先に進めば、そうしたAIが、さらに賢い別のAIを信頼しなければならなくなる。
↩ - [144]
「錬金術みたいな感じがする」とは、最近あるAnthropicの研究者が私、ダニエル・ココタイロ(Daniel Kokotajlo)に言った言葉だ。
↩ - [145]
厳密には、この数字は数え方次第だ。さまざまなAIが絶えず起動されたり停止されたりしているし、スキャフォールディングによって多数のAIインスタンスが組み合わさって一つのAIエージェントになることもある。稼働している小さなモデルまですべて含めれば数はさらに増え、速度もまちまちだ。もう少し具体的に言うと、平均して約2億の最先端AIインスタンスが稼働しており、それぞれが平均的な知的タスクを約100倍の速度と5倍の効果でこなしている。したがって、人間の速度に換算したコピー数は1,000億体になる。
↩ - [146]
ロボット、車両、家電、工作機械の境界はすでにあいまいだが、このシナリオでは2030年代にさらにあいまいになる。重要なのはロボットの文字どおりの台数よりも、それが人間の肉体労働者何人分に相当するかだ。具体的には、ロボットの実際の台数は20億台で、平均すると1台あたり人間約3人分に相当する。
↩ - [147]
長時間働くだけでなく、ロボットは容赦なく効率的で、手を緩めることがない。多くの(すべてではない)タスクでは、文字どおり超人的な速さで動くこともできる。
↩ - [148]
「人間換算」とは、平均して人間の10倍の効果で働くロボット(より速く、より長く、より効果的に働くことの組み合わせによる)を、人間換算で10台のロボットとして数えるという意味だ。AIにも同様の定義を当てはめる。現実には、これはタスクによって変わるあいまいな概念で、とくにAIの場合は測定が難しいだろう。それでも、大まかな桁(こちらには比較的自信がある)は参考になる。
↩ - [149]
人々は以前よりはるかに豊かになったが、利用できる土地の量は増えていないので、地価は上がっている。その結果、年収100万ドルの30%を家賃に費やしてぼやく人も出てくる。たとえば、どうしてもサンフランシスコの中心部に住みたい人たちだ。しかし、住む場所に少しでも融通がきく人なら、年収のうち(たとえば)5万ドルを払うだけで、バークレーから車で1時間の新築高層ビル群にある巨大な豪華マンションに住める。だから大半の人はそうしている。なにしろ、通勤すべき職場もないのだから。
↩ - [150]
2032年までに、AIはすべての知的タスクの50%を、ロボットは物理的タスクの35%を自動化できるようになる。それとは別に、能力の緩やかな向上も認められており、2035年までにAIは人間の知的労働の95%を自動化できるようになる。2036年までには、ロボットも物理的労働について同じ水準に達する。コンソーシアムの加盟国が合意したAI研究開発の減速がなければ、この節目は何年も早く訪れていたはずだ。また、AIの利用が禁止されたり、意図的に能力を落とされたりしている分野がなければ、割合は100%になっていただろう。
↩ - [151]
もちろん、ほとんどのシナリオでは、AIの素の能力が人間のトップ専門家並みの水準で止まることはない。私たちはより賢いAIを作り続け、それが生産性向上の主な原動力になる。しかしプランAでは、このAI能力の閾値で進歩を人為的に遅らせるので、ここで述べたような力学が生じる。AGIと経済をめぐる議論の多くでは、はるかに超人的なAIシステムは作られないと想定している人が多いようだ。この文書がはるかに超人的なシステムを考慮していないのは、そうしたシステムの創出を数年間遅らせる国際合意が手際よく実行されたという、このシナリオ上の事情による。
↩ - [152]
というのも私たちは、規制の緩い経済特区で、AIチップとロボットを生産する自己複製工場が生まれることを基本の想定としているからだ。その工場はサプライチェーンを丸ごと内包し、完全に自給自足する。それを実際に止められるのは、プランAのような実効性のある世界規模の規制だけだ。ボトルネックに関する私たちの見解について詳しくは、経済に関する補足資料の第2節を参照。
↩ - [153]
もっとも、この数字にはどちらの方向にも大きな不確実性がある。はるかに速く進むこともありうる(たとえば、アメーバのように数分で倍増するナノボットが、半日で地球を食い尽くす)。やや遅くなることもありうる(たとえば、私たちが発明できる最良のロボットやアルゴリズムの進歩が遅く、ロボット工場やAI計算資源が建設されるペースや、AIとロボットが仕事をこなす速度がそれほど伸びず、年率50%程度の成長にとどまる)。遅いほうについては、人間の経済の最近の倍増期間である約20年が、極めて控えめな下限になりそうだ(素朴な理由を一つ挙げるだけでも、AIとロボットは24時間休まず働けるうえ、新たに18歳の人間を1人育てるより生産コストが低く、生産にかかる時間も短い)。もちろん、そうならないと考えられる理由はもう一つある。制御権を握るAIや人間が、配備しないと決める場合だ。
↩ - [154]
これらの例が示すように、AI開発の透明性は非常に重要だ。たとえば、AI家庭教師がひそかに政治的な思惑を推し進めたり、AIの仲人が高額を払うユーザーに有利になるよう手心を加えたりすれば、ディストピアだ。未来に何が待ち受けているかは分からないが、AIが完全にアラインされ制御されていたとしても、AIは世界に多くの新しい問題をもたらすと予想している。私たちは、そうした問題に気づき解決するうえで、世界をできるかぎり有利な立場に置きたい。
↩ - [155]
あなたの議論がAIのように雄弁になることは決してないとしても、(a)説得へのAI利用を制限する規制があり、(b)友人や親族はAIよりもあなたの話を聞きたがるだろう。
↩ - [156]
バイアスが学習によって組み込まれていないとは、どういう意味か? そもそもそれは筋の通った言い方なのか? 私たちが言いたいのは次のようなことだ。まず、AIを学習させた企業が、自社の見方やイデオロギーを採用するようAIを学習させたり指示したりすることを一切していないのが明らかであること。そして、学習プロセスを真実性、正直さ、正確な予測といった点に全面的に集中させ、政治的なバイアスや先入観が学習データから紛れ込まないよう、新たに開発されたベストプラクティスをすべて入念に適用していることだ。
↩ - [157]
- [158]
もちろん、これは単純化だ。第一に、AIの速度を人間の速度にどう換算するかは自明ではない。技能水準などほかの条件を揃えたとき、AIの毎秒何トークンが人間の活動1秒分に相当するのか? 私たちはおよそ10トークンだと考えているが、これはやや主観的だ。実際のタスク完了時間は、ツール呼び出しなどの遅延といったさまざまな障害にも左右される。第二に、AIはハードウェアの選び方によって異なる速度で動かせる。極めて不確実な私たちの仮定では、最先端AIのコピー2億体ほどを毎秒100トークンで動かせる汎用ハードウェアと、2,000万体ほどを毎秒1万トークンで動かせる推論専用ハードウェアが存在することになる。AIをこれほど、あるいはこれ以上の速さで動かすことにはリスクがあるかもしれない。その場合は、こうした速度で動かせる時間に上限を設けるか、こうした速度で取り組んでよい分野をより慎重に制限する必要があるだろう。全体として、逐次的な速度が大きなボトルネックになる可能性は低そうだ。
↩ - [159]
これは次のような意味だ。仮にAIによる労働が世界的に禁止され、すべての研究を人間が行わなければならないとしよう。その禁止のもとで100年かかる進歩が、そうした禁止のない私たちのシナリオでは1年で起きる。(分野によっては1,000年分の進歩に近く、別の分野では10年分に近い。)
↩ - [160]
産業設備、ソーラーパネル、ロボットなどがあふれるのに合わせて、機械の速度で自律的に運用されるよう設計された、あらゆる種類の科学研究施設も次々に生まれている。実験の完了を待つことは人間の時代よりはるかに大きなボトルネックになっているが、それでも歴史的な基準で見れば物事は非常に速く進む。
↩ - [161]
- [162]
新しい政治家は平均して旧来の政治家より高潔だが、おそらくそれ以上に重要なのは、許される振る舞いの範囲が狭まっていることだ。ただし、有権者は今でもかなりの悪行を大目に見るので、こうした効果は大きくない。
↩ - [163]
極めて徹底的で侵襲的な脳スキャンなしに、人間用の嘘発見器が実現できるかどうかさえ、私たちには確信がない。とはいえ、おそらく実現でき、AI労働で研究が一気に加速すれば数年以内に発明されるだろうと考えている。そのためこのシナリオでは、何らかの形でそれを扱わざるをえない。禁止するのが最善の政策かもしれないが、以下の折りたたみ欄で説明する理由から、私たちはそれにかなりの懸念を抱いている。そこで、嘘発見器が認められている形で描くことにした。
↩ - [164]
あるいはもっと悪いことに、利用できる嘘発見器がすべて政府によってひそかにバックドアを仕込まれている状況もありうる。
↩ - [165]
政治家やCEOが嘘をつかないのは概して良いことだと考えているが、嘘をつけなくすることに一定の欠点があるかもしれない点も認める。たとえば、当選するために口にしたとんでもない主張をすべて本気で信じている「真の信者」の政治家が生まれるかもしれない!
↩ - [166]
具体的には、これをはるかに改良したようなものを想定している。https://www.nature.com/articles/s41593-023-01304-9
↩ - [167]
天使のほかに、オラクルやゴーレムもいる。たとえば「Grok 9.5は、尋ねられた質問に真実をもって答えることに執拗なまでに集中するよう学習している。嘘をついたり、意図的に誤解させたりはできない。一方、GPT-11は、現地の法律の範囲内で、言われたことをそのまま実行する。指示を書くときはくれぐれも注意すること」。聖人や天使にたとえたのは、歴史上、細心なまでに正直な人や心から利他的な人などはいたものの、生前にそうだと広く認められることは稀だったからだ。極めて高潔だとほぼ誰もが認める大きな集団がまるごと存在したことは、かつて一度もない。これは次のような影響をもたらしうる。(a)ささいなものも含め、人間のあらゆる紛争や対立で、AIが信頼される仲介者になる。(b)AIは人間より権力を乱用する可能性が実際に低いので、大きな権力を与えられる。(c)AIが崇拝され、偶像化される。(d)AIの助言や意見が、いわば福音のように受け入れられる。なにしろAIは実際に私たちより賢く、本当に私たちの最善の利益を考えているのだから、歴史上初めて、盲目的な服従が本当に正当化されるのかもしれない。
↩ - [168]
プランAがなく規制もあまりない世界でも、開発者には、将来を見据えた安全性研究やスケーラブルな安全性研究にしっかり取り組む直接的なインセンティブはそれほどない。ただし、いま現在大きな商業的コストを生んでいる安全性の問題を解決する、あるいは取り繕うインセンティブならある。
↩ - [169]
経済学の用語で言えば、安全性の手法は公共財(非競合的かつ非排除的な財)だ。
↩ - [170]
特許は、ソフトウェアやほとんどの研究ではうまく機能しないようだ。一般的にも、それほどうまく機能しないのかもしれない。
↩ - [171]
公的資金は、どの資金提供者の実績と専門性が最も優れているかについての安全性研究分野の見解に基づいて、資金提供者のあいだで配分することが考えられる。
↩ - [172]
資金提供者の透明性がこの点で役立つと期待する人もいるかもしれない。しかし、資金提供の決定について透明性や分かりやすさを高めることが役立つかどうかは、私たちにははっきりしない。そのため、原則としてそれを推し進めることは勧めない。より限定的な種類の透明性なら、どんな場合でも良い結果をもたらしうる。
↩ - [173]
「学習させた」ではなく「プログラムされた」と書いているのは、アラインメントの急速な進歩によって、AIのコードや重みを直接書き換えることで、AIの目標を直接プログラムできる手法が生まれたからだ。2026年のアラインメント手法とはそこが違う。
↩ - [174]
ロボットは年4倍のペースで増え、AI計算資源も2030年から2035年にかけて年約4倍で増えてきたが、2035年以降は年2倍弱に減速している。その結果、経済全体の成長は年約2倍になる。経済が、ほかの種類の資本(土地、地位財など)や人間の労働(主に規制対象の分野)によってある程度頭打ちになるからだ。この背後にあるモデル化は不確実だが、経済に関する補足資料と経済モデルで詳しく説明している。
↩ - [175]
この額は、対外援助と、各国政府による市民配当に相当する制度を組み合わせたものによる。予測としては非現実的に高く、むしろ私たちの提言だ。米国と中国がAIとロボットの許可から得る収入の大きな割合を、対外援助として再分配することに相当する。具体的には、2032年の10%から始まり、2040年までに30%に増えていく。米国のGDPの約0.3%が対外援助に回っている現状からは大きくかけ離れている。
↩ - [176]
- [177]
この時点では、情報の大部分が(人間の)一般市民には伏せられているかもしれないが、市民の代理を務めるAIなら閲覧できる。
↩ - [178]
- [179]
誤解のないように言えば、漸進的な提案だけに従えば必ずミスアラインしたAIによる乗っ取りに至る、と言っているわけではない。チーム内でも意見は分かれている。大半のメンバーは確率を50%超とみており、それより低いとみるメンバーもいるが、その場合でも受け入れがたいほど高いと考えている。
↩ - [180]
しかも企業だけではない! AI政策に携わるすべての人のもとへだ! 考えてみれば、政治家はそもそもAI企業の言うことに耳を貸すべきではないのかもしれない……
↩ - [181]
勝利宣言が早すぎるのは、AIをめぐる計画づくりによくある失敗パターンだと考えている。例を挙げよう。「米国は、ASIの開発で中国に勝つため、全速力で競争しなければならない」「なるほど。では成功したとして、その次に具体的に何が起きるのか? ASIの大軍が米国と世界中に積極的に配備されたあと、CEOや米大統領が慈悲深く賢明に統治すると信じられる理由があるのか? 競争の条件下で開発されたASIの大軍が従順で、制御下にあると信じられる理由は? それに、米国の超知能という脅威は中国を恐怖に陥れ、事態をエスカレートさせる予防的行動に走らせかねないのではないか?」
↩ - [182]
このエピローグでは、太陽系外の宇宙資源に焦点を当てる。宇宙資源の圧倒的大部分がそこにあるからだ。太陽系内の財産も人類に分配されるべきだが、遠方の資源とは異なる形で統治されるべきだろう。
↩ - [183]
さらにチケットの10%は、世界をより良くするために特に無私の行動をとった人や、他者を犠牲にして私腹を肥やす機会を断った人に、報奨として与えられる。世界で最も裕福な人々が、マイナスサムの権力追求に走った人たちばかりにならないようにするためだ。
↩ - [184]
資源を分配する前に、熟慮のための期間を明示的に設けるのが良いかどうかについては、私たちにも確信がない。いずれにしても、人々は宇宙資源の使い道を決める前に熟慮する選択肢を持てる。
↩ - [185]
これらの法は、協定の細目と同様に、交渉する国々の人間の外交官によって事前に合意される。もちろん、その細部は複雑だ。「具体的に何が拷問にあたるのか?」といった問いは、膨大なAIの支援を受け、哲学や神経科学の基礎的な問題への理解を深めながら、政治プロセスの中で詰めていく必要がある。他人の資源の破壊を防ぐ規則も含める必要がある。合意の成立後にさらに法を制定するプロセスも必要かもしれないが、濫用を防ぐため、そのプロセスには制限を設けるべきだ(たとえば90%の賛成を要件とする)。
↩ - [186]
私たちの最善の推測では、驚くほど少ない時間とエネルギー(たとえば、太陽の出力のわずか約6時間分)で、到達可能な宇宙全体に植民用の探査機を送り出すことは物理的に可能だ。『Eternity in six hours: Intergalactic spreading of intelligent life and sharpening the Fermi paradox』を参照。ただしこの論文は、どんぐりほどの大きさの複製装置を備えた、小さな自己複製型フォン・ノイマン探査機を送り出すことを前提にしている。最初の波に乗って出発したければ、小さなフラッシュドライブに収まって運ばれ、目的の銀河でロボットに物理的な新しい身体を組み立ててもらうことを受け入れなければならない。あるいは、はるかに大きな費用をかけて、自分の物理的な身体のまま旅することもできる。
↩ - [187]
ここで言う「利己的」とは、自分の新たなクローンを作ることにも関心がないという意味だ。自分のクローンを作ることに関心があるなら、代わりにそれをするだろう。
↩