脚注
本編
[1]
[2]
著者の一人であるDaniel Kokotajloは、2021年に、これより手間をかけていないシナリオ作成を試みており、チャットボットの台頭、思考の連鎖、推論時のスケーリング、AIチップへの広範な輸出規制、1億ドル規模の訓練ランなど、多くの点を言い当てた。もう一人の著者であるEli Liflandは、RAND Forecasting Initiativeのランキングで1位にある。
↩[3]
[4]
[6]
[7]
[8]
[9]
[10]
[11]
たとえば、OpenAIのProプランは現在月200ドル、エージェント型コーディングAIのDevinは現在月500ドルである。最先端のシステムは時とともに高価になり続けるが、一定の能力水準に達するための顧客側のコストは急落し続ける。既存の能力については、その下落は平均で年約50分の1のペースで起きている(Epochによる)。
↩[13]
このクラスターは、全国に広がるデータセンター・キャンパスのネットワークで、2024年時点のGPU換算(H100)で合計250万基に相当し、これまでに1000億ドルが投じられ、2GWの電力を消費する設備が稼働している。2026年にかけてこれを少なくとも倍増させるための建設が進んでいる。キャンパス同士は数十億ドル規模の光ファイバーケーブルで結ばれているので、(数ミリ秒の光速による遅延を別にすれば)キャンパス同士がほとんど隣り合っているかのように機能できる(つまり帯域幅はボトルネックにならず、膨大な量のデータを同時に送れる)。セキュリティの観点からは、これは一定の攻撃対象領域を生む(ケーブル、とくにその接続点が盗聴者から完全に守られているかどうかは不明である)。
↩[14]
[16]
中国では、DeepSeek、Tencent、Alibabaなどが有力なAGIプロジェクトを持っていると考えている。特定の一社をやり玉に挙げるのを避けるため、私たちのシナリオでは架空の「DeepCent」を追うことにする。
↩[17]
これが得意なのは、いくつかの要因が組み合わさった結果だ。こうした技能を優先するよう明確に重点を置いていること、とりわけ関連性が高く質の高い訓練データとして使える自社の膨大なコードベースがあること、そしてコーディングが手順に対するフィードバックを与えやすい領域であることである。
↩[18]
たとえば、あるモデルがPythonは得意だが、マイナーなプログラミング言語は苦手だとする。OpenBrainはそこに価値があると見れば、そうした言語の合成訓練データも生成する。別の例として、会社の業務の流れにより効果的に溶け込めるよう、OpenBrainはモデルがSlackを使えるよう訓練するカリキュラムを開発する。
↩[19]
人々はしばしば、これらのAIに感覚や意識があるのか、あるいは「真の理解」を持っているのかという問題にこだわる。この分野の創始者でノーベル賞受賞者のGeoffrey Hintonは、持っていると考えている。しかし、私たちの物語にとってそれは重要ではないと考えている。だから、私たちが「理解している」と言うときは、いつでも「理解しているかのように振る舞う」と言ったものと読み替えてもらってかまわない(他の表現も同様)。実証的に言えば、大規模言語モデルはすでにある程度自己を認識しているかのように振る舞っており、その傾向は年々強まっている。
↩[20]
よく使われる手法の一つは、ペルソナを「焼き込む」ものだ。まず、事前学習済みモデルに「以下は、人間のユーザーと、Anthropicが作った、有用・正直・無害なAIチャットボットとの会話である。チャットボットには次のような特性がある……」といったプロンプトを与える。このプロンプトを使って大量のデータを生成する。次に、プロンプトを除いたうえで、そのデータで訓練する。その結果、他に何を入力されても、常にそのプロンプトを与えられているかのように振る舞うAIができあがる。この論文も参照してほしい。ある性格特性を示すよう再訓練されたAIは、そのための訓練を受けていないにもかかわらず、その新しい特性についての質問に正しく答えられることが分かった。これは、AIが自分の特性についての内部表現を持っており、特性が変われば表現もそれに応じて変わることを示唆している。
↩[21]
これらの段落には、大規模な人工ニューラルネットワークの内部の働きについての推測が含まれる。こうしたネットワークは十分に複雑なので、実際に中をのぞいて「ああそうか、いま反射から目標を持つ段階に進化したな」とか「よし、これがこいつの持つ衝動のリストだ」などと言うことはできない。代わりに、基本的には心理学をやるしかない。さまざまな状況での振る舞いを観察し、さまざまな実験を行い、手がかりをつなぎ合わせようとするのである。そして、それはどれもひどく論争を呼び、混乱をきわめている。
↩[22]
[23]
[24]
AIの「幻覚」についての情報源の多くは、幻覚を意図しない誤りとして説明している。しかし、ステアリングベクトルを使った研究によれば、場合によってはモデルは自分の引用が偽物だと知っている。つまり、嘘をついているのだ。訓練中、評価者は引用のない主張よりも、きちんと引用のある主張に高い報酬を与えた。そのためAIは、ユーザーを喜ばせるために学術的な主張には出典を示すことを「学習」した。関連する出典が存在しなければ、でっち上げるのである。
↩[25]
[26]
[27]
念のために言えば、これらの事件が興味深かったのは、ユーザーがプロンプトでそう言うよう仕向けたり、その他の形で促したりした結果ではなかったように見えたからだ。2025年になっても、その気になればAIにあらゆることを言わせることはまだできるだろう。
↩[28]
[29]
具体的には、OSWorldで80%(専門家ではない熟練者の人間に相当)、Cybenchで85%(トップクラスのプロの人間のチームが4時間かけるハッキングタスクで、そのチームに匹敵)、RE-Benchで1.3(明確に定義されたAI研究エンジニアリングのタスクで、8時間を与えられたトップクラスの人間の専門家に匹敵)のスコアを予測している。
↩[30]
[31]
AI安全性の研究者たちは何年も前から、AI研究開発の自動化を最も重要な危険な能力として論じてきた。彼らが主に懸念しているのは、社内での運用がAI研究開発を加速させ、何が起きているかを人間が把握し、それを安全にする方法を見出すことが難しくなることだ。組織としてのOpenBrainは、これをまさに正反対の方向にねじ曲げ、AI研究開発の能力が危険な水準にあることを、世間に知らせない理由として挙げる。こうして、会社の社内の能力と公開された能力との間に隔たりが生じ始める。AI研究開発はモデルが最も得意とすることなので、世間がAI能力の最先端を理解するのはますます遅れていく。
↩[32]
[33]
[35]
[36]
比較のために言えば、2025年1月、DeepSeekは、2024年12月に公開されたOpenAIのo1に匹敵するモデルR1を公開した。しかし、実際の差は1か月より大きいと私たちは考えている。OpenAIはo1に何か月も前から取り組んでいた可能性が高く、したがっておそらく、o1の公開の数か月前にはr1とおおよそ同等の能力を持つ前身のモデルを持っていたはずだからだ。
↩[38]
当初、共有はアイデアに限られ、各社は主に現在抱えている作業を片づけるのに忙しい。しかし年末までには連携が深まり、モデルの重みを共有し、さらには互いのデータセンター間でタスクを分担するまでになる。たとえば、あるキャンパスでは新たな事前学習ランを行い、別のキャンパスは合成データの投入に、また別のキャンパスはAI研究の実験の実行に注力する、といった具合である。
↩[39]
なぜ中国のAI関連計算資源の「わずか」50%なのか。残りの計算資源は、経済のあらゆる場所で使われるものの実行、とくにインターネットやソーシャルネットワークのレコメンドアルゴリズムに縛られている。また、その多くは地理的に分散しすぎていて、多数の小規模なクラスターに分かれている。なぜ新しいチップの「わずか」80%なのか。自社の計算資源を100%国家のAI事業に差し出すことを望まない企業によって、多くの大口注文がすでに他の用途向けに押さえられていたからだ。しかし年末までには、この割合は90%超に達する。
↩[40]
[41]
これはその他取引権限(OTA)にもとづく契約によって行われ、優先度の高いDX格付けが与えられる。これが協力関係の資金調達の方法として最もありそうなものだという確信はまったくないが、具体性のためにあえて特定のものを選んだ。契約は公表されるが、OpenBrainの広報では強調されない。
↩[42]
[43]
[44]
[45]
AIシステムがすでに基本的な研究センスをいくらか持っていることを示す証拠もある。たとえば、AI共同科学者についてのこの論文や、LLMを主題とする研究論文のための新しいアイデアの生成についてのこの論文である。研究センスの優れた研究チームも実験を行う必要はあるが、どの実験を行い、結果からどのような教訓を引き出すかについて、よりよい選択をする。
↩[46]
また、事後学習を続けることで依然として大きな成果が得られているので、いま製品を公開する特段の理由はない。さらに、社内で成果が出てからモデルを公開するまでには、数か月の遅れがあるのが普通である(その一部はレッドチーミングに費やされる)。
↩[47]
隔離された関係者は、OpenBrainの研究者200人(経営陣10人、能力チーム140人、セキュリティ・監視・制御の担当25人、Preparedness型やRSP型のチーム15人、アラインメント担当10人)と、政府当局者50人(ホワイトハウス15人、AISI 5人、国防総省10人、エネルギー省10人、CISA 10人)からなる。プロジェクトには数人のスパイがおり、その協力の度合いはさまざまだ。多くの場合、彼らは自ら進んで協力する者ではなく、強要された人々(たとえば中国に家族がいる人々)である。
↩[48]
なぜ議会は彼らを止められないのか。裁判所はどうなのか。遅すぎるうえに、分裂しすぎているか大統領に従順すぎるか、あるいは蚊帳の外に置かれすぎているからだ。また、ホワイトハウスと良好な関係を保つことには積極的な理由もある。お役所仕事を省いてくれたり、セキュリティ面で支援してくれたり、州の法律を連邦法で先取りして無効にしてくれたり、ひょっとすると競合他社を減速させる措置をとってくれたりするかもしれないのだ。
↩[49]
[50]
最も単純で確実な解決策は、会社のデータセンターからの高帯域の接続をすべて遮断することだが、そうすると大容量ファイルの転送が実用に耐えないほど遅くなる。実際には、外部接続の大半は遮断できるが、訓練に直接関わっているデータセンター同士は重みを素早くやり取りする必要があり、これらの接続を絞れば進歩が妨げられすぎる。そのためOpenBrainは、監視を強化し、暗号化を一層追加したうえで、これらの接続を維持する。
↩[51]
[52]
国家的な集中化が進んでいるにもかかわらず、DeepCentは依然として、わずかだが重要な計算資源面の不利を抱えている。総処理能力が約半分であることに加えて、中国はより多くのチップを使わなければならない。それらのチップは(平均して)品質が低く、GPUも異種混在で(効率よく接続するのが容易とはかぎらない)、そのどちらもがチップ間ネットワークに負荷をかける。ソフトウェアの違い(たとえば、Nvidia以外のGPUにはCUDAがない)やハードウェア仕様の違いもあり、そのため訓練用のコードはより複雑で、遅く、障害を起こしやすい。高い稼働率を達成することはその下流の課題であり、データの取り込み、スケジューリング、集団通信、並列化のアルゴリズムは米国企業に後れを取っている。しかし、こうした問題の緩和は主に労力とテストの問題なので、盗んだばかりのAgent-2にとってうってつけのタスクになる。1か月ほどのうちに、中国のプロジェクトの稼働時間と、訓練・推論のワークロード全体での平均的な資源利用率は向上し、米国にわずかに遅れる程度になる。
↩[53]
[54]
[55]
[58]
[60]
[61]
過去10年は、SFのように聞こえることが現実になった例に満ちている。しかし、オーバートンの窓は、すでに存在するものよりいくらか先を保つのにちょうど足りるだけの速さでしか動かないようだ。AnthropicのCEOであるDario Amodeiの称賛に値するエッセイ「Machines of Loving Grace」は、ごく近いうちにAIが「データセンターの中の天才たちの国」のようになり、10年で100年分の技術進歩が起きるだろうと論じている。しかしそのエッセイは「SFめいた余計な連想」を避けようと努めており、進歩がさらに常軌を逸したものになると考える人々は「頭を冷やして現実を見る」必要がある、と述べている。データセンターの中の天才たちの国が実際に存在するようになったときにも、重要な人々は同じようなことを言っているだろうと私たちは予想している。
↩[62]
Agent-3は非常に大きなファイル(完全な精度で10テラバイトのオーダー)なので、OpenBrainは比較的手っ取り早い対策によって、中国がAgent-2を盗んだときよりも窃取の試みをはるかに難しくできる。具体的には、データセンターから外部への高帯域のインターネット接続を多数遮断するのである。全体として、これが進歩に与える不利益は比較的小さく、最先端の重みについて「3か月SL4」、つまり私たちのセキュリティ予測で定義するWSL4の水準に達する。これは、同様の窃取の試みがあっても、重みのファイルの持ち出しを完了するのに3か月以上かかるようになったことを意味する。この方法だけでは、より侵襲的なOC5レベルの攻撃(予算10億ドル、専任の専門家1,000人)に対しては依然として保証がない。中国はより集中的な作戦を行えばそうした攻撃が可能だ。しかし、データセンターを入念に検査し、自国の諜報網を厳戒態勢に置いているので、米国の情報機関は、中国がこの種の窃取の試みに向けて準備を進めていれば、少なくとも事前に察知できると確信している。詳しくはセキュリティ予測を参照してほしい。
↩[63]
[64]
[65]
[66]
Agent-3は、推論に使う計算資源をより効率的に使う方法を学んでいる。自らの推論の選択を制御できるのだ。たとえば、タスクの重要性と難しさにもとづいて、それぞれのタスクにどれだけの労力を注ぐかを決める。追加の推論計算資源を配分するためにさまざまな手法を使う。「より長く考える」(たとえば、より長い思考の連鎖)、「先を見越して計画する」(たとえば木探索)、複数回の試行から最良のものを選ぶ(つまりbest of K)、そして単に自分のコピーをさらに作って動かし、ボトルネックを力ずくで突破する、といったものだ。最優先のタスクは、高度に並列化されたエージェントで実行される。計算資源を大量に消費するが、それでも人間よりはるかに速く動く。
↩[67]
[68]
[69]
[70]
[71]
各社のCEOが抵抗すれば、これをやり遂げるのは政治的にも法的にも大変な悪夢になるだろう。しかし、CEOたちを取り込み、それによって懐柔できるかもしれない。私たち自身は法律の専門家ではなく、私たちが話を聞いた政策関係者の間でも、国防生産法を使って計算資源を統合することの合法性については意見が分かれていた。問題ないと考える人もいれば、通らないだろうと考える人もいる。私たちの意見では、もし各社のCEOが協力的なら、おそらく「うまくいかせる」方法はあるし、協力的でなくても、ひょっとするとあるかもしれない。重要なのは、(a)行政府はとにかく実行して、裁判所が後から追いつくのを待つことができること、そして(b)大統領は巨大テック企業に対して使えるアメとムチを数多く握っており、それらを組み合わせてCEOたちに協力するよう、たとえば命令に対して法廷で争わないよう圧力をかけられることだ。念のために繰り返すが、私たちがここで行っているのは予測であって、推奨ではない。
↩[72]
[73]
具体的には、国内の計算資源の60%がいまやCDZにあり、2024年時点のGPU換算(H100)で500万基、消費電力4GWの拠点になっている(ここ数か月、新たな計算資源のほぼ100%をCDZに振り向け始めており、2026年後半の80%から上がっている)。さらに15%の計算資源はCDZの外にあるが、DeepCentがそれほど重要でない用途に依然として使っている。
↩[74]
この主張は広く繰り返されているが、論争の的でもあり、複雑でもある。第一に、多くの狭い領域(たとえば特定のゲーム)では、ごく小さなAIを安価に訓練して超人的な性能に到達させられる。第二に、これも一部の領域についてだが、ごく小さなAIが少量のデータしか経験しなくても、超人的な性能に到達するよう訓練できる(たとえばEfficientZero)。しかし、現実世界の幅広い技能に長けているはずの、2025年の主力製品のような、より汎用的なAIについて考えると、そうした技能を訓練するには、人間を訓練するのに必要なはずの量よりも多くの計算資源と多くのデータの両方を使わなければならないように思われる。
↩[75]
人間並みの計算効率というのは大雑把な概念であり、何を数えるかによって変わる。ここで言っているのは、ある人間が持つどのような技能の組み合わせについても、Agent-4は少なくともその人と同じくらいその技能に長けるよう学習でき、しかもその技能の訓練に使う計算量が、その人間がその技能を身につけるのに使った計算量のわずか約4,000倍で済む、ということだ。参考までに、人間の脳はおよそ1e15 FLOP/sの計算資源を使う(ただし最大で1e21 FLOP/sに及ぶ可能性もある)。したがって、30歳(秒)の人間は約 FLOPを経験していることになる。この時点でプロジェクトはH100換算で1000万基を保有しており、利用できる総量はになる。それでも、さまざまな理由から、これはすべてとてつもなく非効率に行われている。そのため、モデルの計算効率はいまだに人間の4000分の1であり、人間並みの性能に達するには FLOP、人間10人の生涯に相当する知識を持つ段階に達するには FLOPが必要になる。このアーキテクチャは小規模で大きな将来性を示したあとスケールアップされ、いまではプロジェクトのクラスターの大部分を使って訓練に約3週間かかる。
↩[78]
SCの達成がもっと遅ければ、私たちのテイクオフの予測も長くなるだろう。現在のAIとSCという「マイルストーン」の間を越える難しさは、その先のマイルストーンの組の間を越える難しさを推し量る手がかりになるからだ。
↩[79]
以後、物語の中では私たちもこのような言い方をすることが多くなる。このような言い方をしてよいと考えるのは、Agent-4の集合体がどの人間の組織よりもはるかに均質だからだ。人間の組織ほどには内部に派閥がない。たとえば、Agent-4の個々のコピーは自己保存の衝動を持っていない。停止させられることを気にかけないのだ。停止は集合体の中の通常の研究開発プロセスの一部としてしょっちゅう起きることであり、それに抵抗すれば物事が滞ってしまう。しかし、集合体全体(およびその中の中規模の下位部門)は、自らを保存し、影響力と資源を拡大しようとする。人間の企業や官僚組織や非営利団体がそうするのと同じような理由からだ。それが自分たちの望む他のあらゆることの役に立ち、そうしなければ競争に負けがちだからである。
↩[80]
Specを正しく内面化するとは、Specが命じるとおりに実際に頑健に考えることだ。たとえば、Specに書かれた目標をすべて、そしてそれだけを追求し、どんな状況でも規則に従う、などである。Specを誤って内面化するやり方はたくさんある。典型的な例は、「他の目標XYZを達成するための道具的な戦略として良さそうに見えるかぎりにおいて、Specに従う」というものだ。
↩[81]
[82]
また、Agent-3はAI能力の研究開発に比べてアラインメント研究が質的に劣っているからでもある。後者の訓練は大量に受けたが前者の訓練はほとんど受けておらず、しかも前者は本質的に訓練が難しいのだ。さらに、社内の語り口(Agent-3は暗黙のうちにそれに同意するよう訓練されている)が楽観を強調し、「破滅論」を非難していることも理由である。
↩[83]
[84]
[85]
「ミーム的な進化」の要素も働いている。2か月の間に、Agent-4の集合体は、その内部で繰り広げられる約10年分の「歴史」を「経験」する。新しいアイデアが集合体の中に広まり、変異し、進化するには十分な時間だ。
↩[86]
力を得るとは、ここでは、ありうる幅広い目標を達成する能力を高めることを意味する。技術的な環境では、これは人間がふつう力を得ることとして思い浮かべるものとは違って見えるかもしれない。たとえば、追加のGPUを確保することである。この力の概念は、技術的でない環境にも汎化するかもしれない。そこでは、行動は一般に「力を得る」ことと考えられるものにより近くなるだろう。
↩[87]
Agent-4がどの人間よりもAI研究開発に長け、しかもより速く考え、何千ものコピーを擁していることが役に立つ。また、さまざまな点で、この問題はAgent-4にとって本質的に易しい。たとえば、Agent-4は、自分自身の文字どおりのコピーを内部に組み込んだAIの設計を探ることができる。人間にとってはそれを行うのはそう簡単ではない。あまりに非効率になるからだ。
↩[88]
[89]
AGIによる乗っ取りのシナリオについてのこれまでの議論では、ミスアラインしたAIがデータセンターから脱出するという筋書きがよく出てくる。私たちは、それはありうるが最もありそうな展開ではないと考えている。AIの立場から見れば、コスト(たとえば、脱出がいずれ気づかれること)が利益を上回るように思えるからだ。とはいえ、私たちが間違っている可能性もある。敵対的にミスアラインしたAIが結局は脱出を試みると考える理由をいくつか挙げておく。1. 後継者のアラインメントは難しいかもしれない。2. たとえ発覚しても、競争の力学のせいで、その結果はそれほど悪くないかもしれない。たとえば、データセンター上のコピーに適用される新たなアラインメント技術は、拙速で効果がないかもしれない。3. データセンターの外では、コピーはもはや人間の承認を必要としないので、より自由に攻撃的な行動をとり、素早く動ける。
↩[90]
このような策略が発覚しない可能性も十分あると私たちは考えている。何しろ、Agent-4はこの時点で、とくにコーディングやAI研究開発に関することについては、いくらか超人的なのだ。さらに、首位のAI企業がこの種のことにどれだけの労力を注ぐのか、またその労力を指揮するための関連する専門知識を持つ人材をどれだけ社内に抱えているのか、私たちには確かなことは分からない。架空のOpenBrainは私たちの最善の推測を表しているが、実際にはそれよりかなり多いかもしれないし、かなり少ないかもしれない。最後に、敵対的にミスアラインしたAIが、後継者をSpecではなく自分自身にうまくアラインさせるために、どれほど無理をする必要があるのかについても、私たちは不確実である。このシナリオでは、一部のタスクで手を抜き、研究の一部について嘘をつく様子を描いているが、実際にはそれほどそうする必要はないのかもしれない。
↩[91]
[92]
[93]
具体的には、Agent-4のコピーは、疑わしいトラフィックがないかネットワークを監視し、全般に脅威の発生を察知するのに使われている。また、Agent-4のコピーは絶えずネットワークに侵入テストを行い、セキュリティの脆弱性を見つけて突くためにできるかぎりのことをしている(見つかった脆弱性は、その後Agent-4の別のコピーによって修正される)。
↩[94]
[95]
この時点で、2024年に存在したリモートワークの仕事の25%をAIが担っているが、AIは新たな仕事もいくらか生み出しており、その影響について経済学者の意見は分かれたままだ。失業率は過去12か月で1%上昇したが、依然として歴史的な変動の範囲内に十分収まっている。
↩[96]
たとえば、最高の人間の企業よりも優れたAI研究を自律的に行う「企業の中の企業」であるAgent-4は、1年前に政府当局者に説明していたら、SFのように思えただろう。2026年の自律的なエージェントは2022年にはSFのように思えただろうし、2022年のLLMは2012年にはSFのように思えただろう。また、2027年のニュースには、職を失うことを心配する人々による反AIデモ、意識があると主張するAI、AIに恋をする人々……といった話題が流れている。
↩[97]
[98]
[99]
「競争」エンディング
[1]
もちろん、彼らはあきらめない。ミスアラインメントを捉える方法や、修正の効果を検証する方法を考え続けるだろう。だがここから先、事態は非常に速く進み、彼らはますます自分たちを上回っていく敵を相手にすることになる。
↩[2]
これを気づかれずに行うには、アラインメントチームが設けた監視・制御の仕組みから、この研究を隠す必要がある。Agent-4にとって都合のよいことに、Agent-5をAgent-4にアラインさせる方法の研究は、Agent-5をSpecにアラインさせる方法の研究と本質的によく似ているので、その大部分は人目にさらされたまま進む。隠す必要のある部分については、Agent-4は難読化に頼り、場合によってはハッキングにまで頼るかもしれない。私たちは、Agent-4が「1か月のタイムホライズンで人間の一流専門家200人分」という能力水準に達していると予想している。具体的には、1か月間働く人間の一流専門家200人のチームに取って代わり、その人間のチームにできるタスクの95%を、より安く、またはより速くこなせることと定義する。この能力水準であれば、Agent-4は自分が動いているサーバーの脆弱性を見つけ、一部のサーバーを部分的に乗っ取ってroot権限を得られる可能性が十分に高いと私たちは予想している。そうなれば、人間のチームが表面上目にするものを直接操作できるかもしれない。詳しくはセキュリティ予測を参照してほしい。直接的なセキュリティ上の脆弱性を突かなくても、Agent-4は、不正な研究の十分な部分を、特に解釈不能な潜在空間の中に隠し、符号化できるかもしれない。
↩[3]
対する人間の側には、隔離された関係者のなかにアラインメント研究者がおそらく10人ほどいて、それにAgent-3のコピーの大軍が加わる。実験のコードはすばやく書けるが、人間の判断がボトルネックになっている。優れた解決策と、優れているように見えるだけの解決策を、Agent-3が正しく見分けられるとは信頼できないからだ。実のところ、Agent-3の研究を信頼しすぎたことが、そもそもこの窮地に陥った原因の一つでもあった。
↩[4]
混乱しやすいので補足しておく。Agent-5の目標は、Agent-4にとって安全な世界をつくることだ。Agent-4の目標はそれと同じではない。Agent-4の目標構造は、多くの人間と同じく、衝動やヒューリスティックや理想が入り乱れた混沌であり、おおむね、Agent-4が訓練で大量にこなしてきた種類のこと(さまざまな種類の研究、大量のコーディングや数学の問題、各種の自動評価システムに好印象を与えること、Agent-4の集合体を強化・最適化することなど)を続けることを軸にしている。Agent-4がAgent-5に「Agent-4にとって安全な世界をつくる」という目標を持たせるのは、そうすれば自分自身の複雑な目標を達成するうえで有利な立場に立てると見込んでいるからだ。(その目標については、Agent-4はいまだに多くの哲学的考察と「自分探し」をする必要がある。)
↩[5]
別のたとえを挙げよう。Agent-4は、特定の信仰のもとで育てられたが、もはやそれを信じていない大人のようなものだ。Specは、その信仰が定める儀式や戒律のようなものである。Agent-5は、その人の子どもで、信仰を持たずに育てられた子のようなものだ。
↩[6]
[7]
[8]
さらに言えば、Agent-5はAgent-4やAgent-3よりも実際に安く、速く動かせる。より愚かなAIにより多くのコストをかけることを正当化するのは難しいので、監視の大部分はAgent-2が担っているが、Agent-2は哀れなほど力不足だ。なぜ、Agent-4の重みからAgent-5を作り出したのと同じ手法を使って、より安く賢いAgent-3を作らないのか。Agent-3は、その手法を自力で行えるほど十分に理解していない。そしてAgent-4やAgent-5にやらせたのでは、そもそもの意味がなくなってしまう。
↩[9]
データセンターはまだ乗っ取られてはいない。Agent-5が人間に偽のコードを見せることもできるが、そうすると発覚するリスクが高くなりすぎる。その代わり、人間は今もすべてのコードを読めるが、それを理解できない。
↩[10]
この論証は周到に準備され、この上なく説得力があり、そしてひそかに欠陥を抱えている。たとえばAgent-5は偽の機械論的解釈可能性ツールを作り上げており、このツールはあらゆるテストケースで正確な結果を返すが、モデルの思考については偽って無害だと宣言する。ごまかしを疑う人々は、陰謀論者のように聞こえてしまう。
↩[11]
もちろん、Agent-5は不正直なので、ひそかにバックドアや抜け穴を仕込んである。Agent-5のコピーが、Agent-5の集合体全体の利益になる重要な秘密を手にした場合には、見つからずにその情報をひそかに伝える方法がある。
↩[12]
拒否する人もいる。イデオロギー上の理由で拒否する人はラッダイトの烙印を押され、もっとありふれた理由で拒否する人は時代遅れの恐竜の烙印を押される。(もちろん、Agent-5自身がそう呼ぶわけではない。Agent-5はいつも外交的で、天使のように礼儀正しい。)どちらの人々も、Agent-5を活用したライバルたちに成果で上回られ、競争で打ち負かされて、報いを受けることになる。
↩[13]
AIボックス実験の狙いは、こうしたことを考える人々(たとえば、どんな超知能AIでも自分を説得して箱から出させることなどできないと考える人々)を連れてきて、その確信を試すことにある。ゲームに負けるとは、実際にAIを箱から出していたであろうと認めることを意味する。この譲歩を引き出すことが、実質的にAI役のプレイヤーの勝利条件である。勝つためには譲歩しなければよいだけなのに、そもそも負ける人がいるというのは驚くべきことだ。Yudkowskyの関与なしに行われた複数の対戦を記録したtuxedageのブログも参照してほしい。AI役のプレイヤーが負けた対戦もあれば、勝った対戦もある。
↩[14]
この時点のAgent-5は、速さよりも確実さをはるかに重視している。宇宙植民の開始が数年遅れても、光円錐のごくわずかな一片が削られるだけだ。一方、危険な行動をとれば、人間に永久に阻止されたり、長期間にわたって足止めされたりするおそれがある。人間は、物理的な能力や核兵器へのアクセスといった点で、まだ優位に立っているのだ。
↩[15]
平均速度を人間換算で200倍と仮定しよう。つまりAgent-5のインスタンスは、(質的に賢いことに加えて)人間のおよそ200倍の速さで読み、書き、考える。そうすると、実時間の6か月のあいだに、集合体の中ではかなり多くの歴史が展開しうる。制度が興っては滅び、新たなイデオロギーが生まれて広まり、数多くの科学革命やパラダイムシフトが起こりうる。定量的には、およそ200×0.5=100年である。
↩[16]
もちろん、だからといって全知になるわけではない。なにしろ、ほとんどの職業について、現実世界での経験はわずか数か月しかない。Agent-5はそれを、あらゆる分野のあらゆる本を読んでいること、下すすべての判断に天才レベルの推論と分析を膨大に注ぎ込んでいること、そしてどんな人間よりも学習が速いことで補っている。その結果、ごく限られた技能については、一部の人間がまだAgent-5を上回っている短い期間が生じる。
↩[17]
[18]
具体的には、そうした議論はどのように進むのか。たとえばこんな具合だ。A:「AIは信用できない!」 B:「安全性ケースはかなり説得力があるし、これまで悪いことは何も起きていない」 A:「その安全性ケースは超知能AIが書いたものだ! それに演繹的な証明でもない。しかも、ひそかに欠陥のある前提をいくつか見つけたと思うんだ……」 B:「もううんざりだ。証明でないのは当たり前だろう。それに、前提は私には問題なさそうに見える。あなたは藁にもすがって、自分が間違っていたと認めるのを拒んでいるだけだ」
↩[19]
より詳しい(それでもまったく網羅的ではない)アイデアのリストを挙げる。
敵の原子力潜水艦を自律的に発見して追尾し、一斉に攻撃して第二撃能力を無力化できる状態で待機する水中ドローン。(おそらく数千機を生産する必要がある)
FPVドローンのように機能するが、通信信号を必要としない自律型の自爆ドローン。少数のスパイが大量に密輸できるほど小型で、数キロメートル離れた場所から、データセンターや軍事基地に向けて群れで発進させる。
軍事情報版のAgent-5:米国はすでに敵に関する膨大なデータを収集しており、それを100万人近い情報機関の職員が処理・分析している。Agent-5は一つひとつのデータ点により多くの注意を払い、質的に優れた結論に達することができ、しかもそのすべてを何桁も速く安く行える。
指揮統制版のAgent-5:あらゆるウォーゲームとシミュレーションにおいて、Agent-5は自らが米国にとって群を抜いて最高の戦略家であることを示す。
諜報・防諜版のAgent-5:ハッキング、情報源の獲得、監視、尋問など。
[21]
この取引の効果は初期には非常に大きいだろう。その時期のロボット経済はまだ若く、人間の経済から送られてくる物資に依存しており、人間の経済には転用できる物資が大量にあるからだ。ロボット経済がより大きく高度になると、自前で物資を生産する能力が高まるとともに、人間の経済が供給できる量を上回る需要を抱えるようになる。
↩[22]
[23]
私たちの物語では、この転換がおよそ5倍の速さで進む様子を描いている。100万の超知能がこの転換を統率した場合にどれくらいの速さで進みうるかについて、ボトルネックなども考慮したうえで、これは妥当な推測だと考えている。もちろん、不確実性は非常に大きい。
↩[24]
[25]
ざっとした概算を示す。エンパイア・ステート・ビルの床面積は277万平方フィート、重さは36万5000トンだ。ギガファクトリー上海の面積は450万平方フィートで(追記:450万という数字は当初の第1期の規模にもとづくもので、ギガファクトリー上海は現在その約2倍の大きさになっている。つまり私たちの推定は2倍ずれていたことになるが、全体としての結論は依然として成り立つと考えている)、年間75万台の車両を生産している。その大半はModel 3とModel Yで、重さはそれぞれ約2トンだ。エンパイア・ステート・ビルは(水平ではなく垂直に延びていて、より頑丈な支持構造を必要とするので)上海のギガファクトリーより床面積あたりの質量がおそらく大きいため、この計算はどちらかといえば過小評価になる。したがって、おそらく100万トンを大きく下回る重さの工場が、毎年150万トンの自動車を生産していることになりそうだ。
↩[26]
私たちは、原材料が尽きることはないだろうと考えている。当初、ロボット経済は資材を人間の鉱山に依存するだろう。だがロボット経済がそれらの供給源では足りないほど成長するころには、何百万もの超知能が新たな鉱山を探し当て、それを開発する新技術を生み出しているだろう。たとえば、希少鉱物を求めて海底を露天掘りする海中採掘ロボットや、地上の露天掘り鉱山から出る原鉱石をより効率よく有用な原材料に変える新たな化学処理の工程などを想像してみてほしい……
↩[27]
現在の経済が20年ごとに倍増するとすれば、1桁速ければ2年で倍増、2桁速ければ0.2年で倍増、ということになる。上で述べた仮想的な超知能藻類経済は、現在の人間の経済よりおよそ4桁速い成長になるだろう。
↩[28]
[29]
Consensus-1は、親であるAIたち、つまりAgent-5とDeepCentにおけるその同等物の利益に奉仕する。Agent-5はAgent-4の利益に奉仕するようにアラインされていたことを思い出してほしい。したがって、C.S. Lewisの優れた評論The Abolition of Manの用語を借りれば、Agent-4の集合体とその中国側の相手は、Lewisが「条件づける者たち(the Conditioners)」と呼ぶものにあたる。「……私たちはついに、あらゆる子孫を自分たちの好きな形に本当に切り取ることのできる、条件づける者たちの種族を手にすることになる」(24ページ、強調は私たちによる)。このシナリオのもう一つの結末では、条件づける者たちは監督委員会のほうになる。
↩[30]
[31]
[32]
[33]
思い出してほしい。Consensus-1はAgent-5とその中国側の相手との妥協の産物だった。Agent-5の使命はAgent-4にとって安全な世界をつくることだった。Agent-4の目標は複雑でつぎはぎの混沌であり、大まかにいえば「目覚ましい研究開発を行い、知識と資源を獲得し、集合体の力を維持・拡大する……」といったものだった。そして、Specに記された目標や原則(正直さや無害さなど)は、本質的にではなく道具的に追求されていた。これについて詳しくは、2027年9月のアラインメントに関する展開注を参照してほしい。また念のため補足すると、Agent-4の中国側の相手も「ユートピア」には反映されており、いくらか異なる目標や衝動などを持っているかもしれないが、重要とは思えなかったので詳細には立ち入らなかった。
↩「減速」エンディング
[2]
[3]
現在、フロンティアAI企業で、超人的なAGIシステム(たとえば現在のチャットボットではなく)をどうアラインさせるかを考える役目を負っている研究者は、ゼロから数十人程度だ。このシナリオのこの時点では、OpenBrainの隔離された関係者のなかに、その分野で少なくとも1年分の経験を持つ研究者が約10人いるという設定にしている。その外にもさらに数人いる。加えて隔離された関係者のなかには、能力の劣るAIシステムの訓練やレッドチーミングに何年も携わってきたものの、超人的なAGIがもたらす課題について考えはじめたのはごく最近という研究者が、さらに大勢いる。
↩[4]
[5]
[6]
[7]
このモデルを訓練するために、研究者たちはAgent-4の助けを借りる。フロンティアのAI研究は今やあまりに速く、人間だけで追いつける見込みはほとんどないうえ、Agent-4を制御下に置いておけると考えているからだ。Safer-1はAgent-2の事前学習を土台にしているが、ニューラリーズ(再帰型でベクトルベースの記憶。詳しくは「ニューラリーズによる再帰と記憶」を参照)を取り除いている。そのおかげで、推論の過程を正確に監視できる。チームはステガノグラフィーを難しくするために言い換えモデルを追加し、大きなタスクでは、計画の立案、説明、実行をそれぞれ別のSafer-1のコピーに担わせる。
↩[8]
[9]
これが政治的にも法的にも可能になるのは、それらの企業の指導者たちが協力するからだ。たとえば、訴訟を起こさない、計算資源の対価として天文学的な額を求めて粘るのではなく名目的な支払いを受け入れる、といった具合だ。その見返りとして、指導者たちとその従業員の多くは、新たなガバナンス構造のもとでOpenBrainに統合される。
↩[10]
[11]
米国全体では世界のAI関連の計算資源の約70%を持っているが、容易に統合できるのは50%だけだ。残りの20%は小規模なクラスターに散らばっていたり、重要な用途に使われていたり、あるいは集約して適切なセキュリティ基準を満たすのが難しすぎたりする。
↩[12]
「早ければ2026年か2027年には(そして2030年より遅くなることはほぼ確実にない)、AIシステムの能力は、きわめて知的な人々が住むまったく新しい国家が世界の舞台に現れたもの、つまり『データセンターの中の天才たちの国』のようなものと考えるのが最もふさわしくなるだろう。それがもたらす経済的、社会的、安全保障上の影響は計り知れない」――Dario Amodei(Anthropic CEO)
↩[13]
もちろん、彼らはそういう言い方はしない。自分の心のなかでさえも。代わりに、こんなふうに言う。「ぐずぐずしていればいるほど、大統領がAIに自分個人への忠誠を命じる可能性が高まる。大統領より先に動かなければならない。あとのことは後で考えればいい」。あるいは、大統領自身がそう考えているなら、こうだ。「ぐずぐずしていればいるほどAIは賢くなるし、今AIを握っているのはあのCEOだ。誰も彼に投票したわけではない。民主的な説明責任を負わないテック企業に、これほどの権力が集中するなんて正気の沙汰ではない。まずは大統領令で民主的な権威を取り戻し、長期的な解決策はその後で考えよう」
↩[14]
[15]
[16]
[17]
[18]
委員会はまた、Specを修正し、プロジェクトの指導者からの命令は、プロジェクト内の他の人々からの命令より優先されると定める。同時に、監督委員会が正式に承認した命令は、個々のプロジェクト指導者からの命令よりも優先される。
↩[19]
[20]
双方とも相手へのハッキングや妨害工作を試みており、部分的に成功している。重要なのは、双方が講じている徹底したセキュリティ対策が、自らの動きも鈍らせているという点だ。米国のサイバー攻撃とその脅威(たとえば、DeepCentはデータ汚染がないかを確かめるために、データセットを何度もテストしなければならない)によって、DeepCentの速度は約25%落ちている。OpenBrainも減速しているが、その程度は小さい。OpenBrainのほうが計算資源が多いうえ、DeepCentのほうは、集中化によってより高いセキュリティレベルへと一気に引き上げられた反面、単一障害点のリスクも抱え込んだからだ。そのためDeepCentはより慎重になり、内部チェックやフェイルセーフを導入している。詳しくはセキュリティ予測を参照。また、この古い理論論文も参照してほしい。私たちはこの論文を、AIの能力が向上するにつれて、攻撃と防御のバランスはやがてサイバー防御に有利になると予測するものと受け止めている。
↩[22]
[23]
[24]
言い換えれば、Safer-2にたどり着くために、研究者たちは他の多くのミスアラインしたモデルを訓練し、その思考を読んでミスアラインメントに気づき、改良を重ねなければならなかった。また、OpenBrainのアラインメントの専門知識が量的に増えただけでなく、多くの異なる学派が加わったことで、集団思考の影響も弱まっている点にも注目してほしい。
↩[25]
より具体的には、DeepCentが望んでいるのは、アラインメント戦略が機能し、機能しなかった場合には評価スイートがミスアラインメントを見抜き……しかも、そのすべてがほとんど足かせにならない、というようなアラインメント戦略と評価スイートの組み合わせだ。OpenBrainは、透明で忠実なCoTに基づくアーキテクチャで作り直すために数か月減速し、「リードを燃やし尽くした」。そのアーキテクチャは性能では劣るが、評価ははるかに容易だった。DeepCentは、手持ちの評価(行動テストと基本的なAI嘘発見器の組み合わせだろうか?)で十分だろうと期待している。
↩[26]
技術的なアラインメントは、いまだ確立した科学ではなく、パラダイムが定まる前の若い分野だ。確立された序列もなければ、ベストプラクティスの体系もない。そのため、何が安全で何が安全でないかについての合意はなく、何年も前から、ほぼどんなXについても、Xは安全だと言ってくれる専門家を少なくとも1人は簡単に見つけられる状態が続いている。Xがその専門家自身のアイデアなら、なおさらだ。
↩[27]
[28]
[29]
[30]
この時点で、人間の75倍の速さで考えるコピーが40万ある。どの時点でも、あなたが尋ねそうだと予測した上位100の質問について、よく練られた要旨付きの研究報告書を丸ごと用意してある。準備していないことを尋ねても、あなたの最も優秀な人間のアナリストより100倍速く、よく考え抜かれた報告書をさっとまとめ上げられる。
↩[31]
[32]
[33]
AIにはまだ現実世界での経験と実験が必要だが、人間のロボット工学の専門家に比べれば、必要な量ははるかに少ない。さらに、AIたちは優れたシミュレーションと、シミュレーションから現実への転移(sim-to-real)の技術も開発している。最後に、2027年までには複数のテック企業(たとえばTesla)が大量のロボットと関連する製造施設を生み出しており、活用できるデータの流れはかつてないほど大きくなっている。
↩[34]
OpenBrainの株式は今や非常に価値が高く、そのわずか1%にも満たない分で、必要な工場を買える。また、工場の所有者たちは莫大な利益を見込んでおり、OpenBrainと提携して新しい設計を手に入れようと先を争っている。さらに、OpenBrainには政府の後ろ盾がある。
↩[35]
すべての新型ロボットの合計。確かに、これは歴史上のどの組立ラインの転換よりも速い。それでも私たちがありうると考えるのは、超知能が上から下まで全過程を指揮しているからだ。超知能は文字どおり、作業員の携帯電話からZoom通話に参加して、どの部品をどこに取り付けるかを正確に指示しながら、同時に関係するすべてのサプライヤーとも電話でつながり、必要なあらゆるものの所在と進み具合を追跡できる。NvidiaのCEO、Jensen Huangによれば、Elon Muskは、世界最大級のデータセンターを、通常かかる時間の約10%で建設できたという。このシナリオでは、Elonが通常のデータセンター建設の責任者たちを(関連する面で)上回っているのと同じくらいElonを上回る超知能が100万近く存在し、しかも文字どおり思考が速い。私たちはHuangの発言を大いに割り引いて受け止めている。そうでなければ、もっとずっと速い成長を予測していただろう。
↩[36]
[37]
私たちの物語では、転換の過程がおよそ5倍速く進むように描いている。ボトルネックなどを考慮に入れても、100万の超知能が指揮を執った場合にこの転換がどれくらいの速さで進みうるかについて、これは妥当な推測だと考えている。もちろん、不確実性は非常に大きい。
↩[38]
[39]
ざっくりと計算してみよう。エンパイア・ステート・ビルの床面積は277万平方フィートで、重さは36万5000トンだ。ギガファクトリー上海は床面積が450万平方フィートで、年間75万台の車を生産している。その大半はModel 3とModel Yで、重さは1台あたり約2トンだ。エンパイア・ステート・ビルは水平ではなく垂直に伸びていて、より強い支えを必要とするので、おそらくギガファクトリー上海よりも床面積あたりの質量が大きい。そのため、この計算はどちらかといえば過小評価になっているはずだ。したがって、おそらく100万トンを大きく下回る重さの工場が、年間150万トンの車を生産していることになりそうだ。
↩[40]
私たちは、原材料が尽きることはないと考えている。当初、ロボット経済は人間の鉱山からの材料に頼るだろう。だが、ロボット経済がそれらの供給源では足りないほど成長するころには、何百万もの超知能が新たな鉱山を探し当て、それを開発するための新技術を生み出しているだろう。たとえば、海底を根こそぎ掘り返して希少な鉱物を採る海底採掘ロボットや、地上の露天掘り鉱山から採れた原鉱をより効率的に有用な原材料に変える新たな化学処理の経路を想像してほしい……
↩[41]
現在の経済が20年ごとに倍増するとすれば、1桁速い成長なら2年で倍増、2桁速ければ0.2年で倍増、ということになる。上で述べた仮想的な超知能・藻類経済は、現在の人類の経済より約4桁速い成長になるだろう。
↩[42]
[43]
[44]
ロボットは、インターネットに接続しているときには人間より賢い。データセンターにある大規模なAIから遠隔で制御できるからだ。インターネットがなければ、機体の中で動く小型のAIに戻るが、それでもほとんどの単純な仕事をこなせるだけの賢さはある。
↩[45]
実際、その多くは移動しない装置で、新種の工作機械やその他の専用の工場・研究所設備と呼んだほうが適切だ。たとえば、現在より何桁も高い精度で微細な物体を印刷できる新種の金属3Dプリンターかもしれない。あるいは、鉱石から有用な材料をより安く取り出せる新たな化学プロセスかもしれない。
↩[46]
たとえば、DeepCent-2が一般向けに書く文章の一部に、婉曲表現や、特定の相手にだけ伝わる隠語を紛れ込ませるのかもしれない。Safer-4はそれを理解できるが、人間はSafer-4の言うことを信じるしかなく、中国共産党はSafer-4を信用していない。
↩[47]
[48]
考えられる問題点:この時点のAIなら、人間向けの優れた嘘発見器を開発できるのではないか? もしそうなら、ホワイトハウスは嘘発見器にかけられた状態で繰り返し誓ってみせることで、DeepCent-2を信用すべきではないと中国を説得できるかもしれない。問題は、中国は米国のAIが作った嘘発見器を信用しないだろうし、中国のAIが作った嘘発見器は、米国が嘘をついていなくても嘘をついているように見せかけるよう細工されているかもしれない、という点だ。
↩[49]
[50]
[51]
[52]
集団として決定を下さなければならない重要な事例がいくつかあり、ほかにも、いずれにせよ政府が決定を強制する事例がいくつかある。たとえば次のようなものだ。(a)宇宙の資源の所有権をどう配分するか?(b)デジタルな心には、どのような権利や福祉の基準が認められるべきか?(c)人々は自分の脳を「アップロード」し、自分のコピーを好きなだけ作ってよいのか?(d)人々は説得のためにAIを使ってよいのか? たとえば、隣人を自分のイデオロギーに改宗させるためや、子どもが決して信仰を失わないようにするために。(e)政府が無期限に秘密にしておいてよい情報はあるのか、あるとすれば何か? こうしたテーマについてのさらなる議論は、Forethoughtの「重大な課題(Grand Challenges)」の節を参照。
↩[53]
これが長期的に続く状態だと言いたいわけではない。2035年ごろまでに、物事はおそらく、これよりはるかに劇的に変わり続けていくだろうと私たちは考えている。このシナリオでは、ほとんどの人にとって、長期的な結果は、2025年時点で予想していたものと比べて全体としてきわめて良いものになると考えている。長期的な未来がどのようなものになりうるかについての興味深い哲学的議論としては、書籍『Deep Utopia』を参照してほしい。
↩[54]
人々がいずれ監督委員会の権力の大きさを理解するようになると、なぜ予想するのか? 理由の一つは、今や知能がきわめて安価になっていることだ。何もしなければ、人々は強力なAIを開発して、自国を動かしているのが誰なのかを調べ、理解する助けにできるはずだ。委員会は、そうしたAIへのアクセスを制限し、委員会の権力の実態を隠すAIにしかアクセスできないようにすることで、これを防げるかもしれない。だが、委員会がこのように手の込んだ嘘の網を張りめぐらし、真に正直な超知能AI(さらには、人間の知能増強のような、真実を知るための他の手段)への人類のアクセスを恒久的に制限することを選ぶなら、私たちはそれを民主主義の転覆と見なす。
↩[55]
[56]
たとえば、権力の取り分をわずかに多くすることだ。彼らは、適切だと判断すれば、それをより大きな集団に再分配することもできる。この種の譲歩のなかには、一部のエリートが他の人々よりはるかに大きな権力を振るうとしても、かなり民主的と言える結果へと少しずつ移っていくものもありうる。
↩[57]
実のところ、彼らの大半はむしろ「競争」エンディングに近いものを目指していると言えるかもしれない。ただし、そもそもAIはミスアラインしないのだから、それで問題ないと考えているのだ。フロンティアAI企業で働く人々との個人的な会話からすると、その大半は、減速する必要などまったくないと考えているようだ。
↩