透明性計画
Thomas Larsen
AGIプロジェクトは透明性をめぐって重要な決定を迫られる。誰がアルゴリズム上の秘密を見られるのか。何が行われているかを確信できるだけのデータセンターへのリアルタイムのアクセスを、誰が得るのか。進行中の実験や学習実行を誰が、どれだけの遅れで把握できるのか。本稿では、プランAにおける透明性について、現時点での私たちの考えを述べる。
まず、透明性の基本要件、つまり透明性の提案のうちプランAの中核をなす側面を論じる。プランAの根幹は、AI開発の安全を確保するための、信頼に依存しない米中協定だ。そのためには、相手が合意を守っていることを検証できるだけの、最低限の米中間の透明性が欠かせない(詳しく)。
次に、これらの要件を満たしうる透明性の体制を概観する(詳しく)。
続いて、私たちが最も推す提案である「研究の完全な透明性」を詳しく説明する。この提案では、アルゴリズム上の秘密、実験、学習実行のほぼすべてが、ただちに一般に公開される(詳しく)。
最後に、取り上げた各提案のトレードオフと、透明性が有益である理由を分析する。私たちが研究の完全な透明性を推奨する最大の理由は、プランAのもとでの政府と企業の意思決定が改善されることだ。意思決定の失敗は、現時点で私たちが最も懸念している失敗のパターンでもある。二番目に重要な理由は、企業や政府が権力を濫用するのがはるかに難しくなることだ(詳しく)。
透明性の基本要件
プランAにおける透明性の提案は、どれも次の要件を満たす必要がある。
-
信頼に依存しない検証。 米国と中国は、信頼に頼らずに減速協定を検証できなければならない。具体的には、米中両政府が、計算資源の使われ方を把握できる必要がある。
-
国家レベルの敵対者にも耐えるモデルの重みのセキュリティ。 モデルの重みの流出は防ぎたい。重みが流出すれば、(1) 秘密プロジェクトが大きく加速し、(2) 悪用のリスクが高まるからだ。どちらも必ずしも致命的ではないが、ぜひとも避けたい。汎用的な能力が人間のトップ専門家と同等かそれ以上のAIが登場する段階になれば、モデルの重みのセキュリティはおそらく不可欠になる。
-
フロンティアAIへの消費者のアクセスを維持する。 AIモデルを直接使えることは、おそらく最も重要な形の透明性だ。評価の結果やモデルの振る舞いの大まかな説明を見ても、モデルを直接使うのに比べれば得られる情報はずっと少ない。
四つの透明性の提案
透明性については有力な候補が四つあり、いずれも上記の要件を満たす。提案1〜3はさらにプランAとも両立するが、提案4はプランSでしか成り立たない。
提案1:研究の完全な透明性。 すべてのフロンティアAIプロジェクトについて、AIのアルゴリズム、コード、ドキュメントを含め、AI研究のほぼすべてを一般に完全に公開する。AIモデルの重み、学習データのかなりの部分、その他の機微な情報のごく一部は、データセンターの外に出さない。
提案2:フィルタリング型透明性。 AI研究のほぼすべてを、研究者と計算資源の両方を囲い込む物理的なセキュリティ境界の内側で行う。境界の内側では、米国と中国の監査官が協定を検証するのに十分なアクセスを持つ。データセンターの外に出てよいのは次の三つだ。(1) 内部で何が起きているかについて双方が承認した(一部を伏せた)報告書、(2) 推論用データセンターへ送られるモデルの重み、(3) 研究者自身。伏せる度合いは調整できる。ほとんど伏せなければこの提案は提案1に近づき、最大限伏せれば提案3に近くなる。
提案3:アルゴリズムのセキュリティ。 アルゴリズム上の秘密の持ち出しを防ぐ必要が生じるかもしれない。そのためには上記のセキュリティ境界をさらに厳しくしなければならない。AIデータセンターに人が日常的に出入りしていれば、アルゴリズムの大半はほぼ確実に本国の政府へ報告されてしまう。同様に、フィルタリングされた報告書も、ステガノグラフィーで符号化したモデルの重みを持ち出す経路になりうる。この提案では、フロンティアAIの研究はすべて安全なデータセンターで行い、研究者と監査官はその場に常駐し、外に出ることも情報を外部へ伝えることも禁じられる。モデルの重みは、研究開発用データセンターから推論用データセンターへ移すことが認められる。外に出せる情報があまりに限られるため、外部の主体は内部に対して意味のある監督を行えない。つまり、データセンター内の監査官に「信頼を委ねる」ような形になる。
提案4:すべてを停止する。 具体的には、計算資源を大量に使うAI研究開発を禁止する。この提案のもとでは大規模なAI研究開発が存在しないので、AI研究開発の透明性も必要ない。計算資源の申告と物理的な査察によって執行できる(クラスターへのデジタルなアクセス、つまりアルゴリズムの共有は必要ない)。MIRIの提案に近く、『AI 2040』のシナリオで2029年に約6か月間実際に起きたことでもある。
各提案のおおまかなトレードオフを次の表にまとめる。
提案1:研究の完全な透明性 | 提案2:フィルタリング型透明性 | 提案3:アルゴリズムのセキュリティ | 提案4:すべてを停止する | |
アルゴリズム上の秘密のSL5セキュリティ | なし | 部分的(伏せる度合いによる) | あるかもしれない | 該当なし(新しいアルゴリズムが生まれない) |
新たな学習実行を認めるか | 認める | 認める | 認める | 認めない |
セーフティケース(安全性の論証)をめぐる公の議論は、どれだけ十分な情報に基づくか | 非常に十分 | 伏せる度合いによる | 不十分 | 該当なし(新たなセーフティケースが不要) |
プランAについて、私たちは現時点で研究の完全な透明性を推奨している。理由は多いが、最大の理由は、外部の研究者や一般の人々がセーフティケースを批判的に検討できれば、それが妥当に分析される見込みがはるかに高くなることだ。提案2・3と比べた主な欠点は、アルゴリズムのセキュリティが弱く、おそらくアルゴリズムが秘密プロジェクトへ漏れることだ。とはいえ、アルゴリズム上の秘密をSL5で守るのはとてつもなく難しいと私たちは考えている。そこで、アルゴリズムの流出への主な対策は、そもそも新たなアルゴリズム上の秘密を生み出させないことになる。
研究の完全な透明性
この節では、研究の完全な透明性の具体的な実装案の一つを論じる。これはプランAで実施される実装に対応する。
図の矢印は、人間、研究開発データセンター、推論データセンターのあいだの情報の流れを示す。
図中の矢印は、人間、研究開発用データセンター、推論用データセンターの間の情報の流れを示す。
この提案では、データセンターが2種類ある。
-
推論用データセンターは、許可リストに載ったモデルによる推論だけを提供する。一般消費者向けのチャットボット、エージェントの処理のほぼすべて、ロボット基盤モデルの推論などをここで動かす。データセンターにはどんなリクエストでも送り込めるが、外に出てよいのは検証済みのAIモデルの出力だけなので、モデルの重みは守られる。
-
研究開発用データセンターでは、学習実行や実験、つまり新しいモデルの重みを生み出すのに必要なあらゆることが認められる。先に述べた「透明なデータセンター」がこれに当たる。知能爆発に使われうるため、推論用データセンターよりはるかにリスクが高い。
AI研究開発用データセンターの情報は、次のように整理される。
-
不透明な内部データベースには、公開すべきでない情報がすべて入る。モデルの重み、活性、一部のデータセット、一部のハイパーパラメータなどだ。このデータベースの情報は、内部の人間も外部の人間も直接見られない。
-
透明な内部データベースには、それ以外のすべての情報が入る。すべてのコード、AIの思考の連鎖、プロンプトなどだ。ただし、一般の人々や、AI研究開発用データセンターのセキュリティ境界の内側に物理的にいないAI研究者は、直接アクセスできない。
-
透明な公開データベースには誰でもアクセスできる。研究開発用データセンターに出入りするすべての情報の記録だ。AI研究者が研究開発用クラスターを操作したすべての活動と、何らかの情報を見たいと考える一般の人々による追加の問い合わせを記録する。たとえば、AIに内部データベースを調べさせ、特定の研究分野の現状について短い報告書を書かせたい人もいるだろう。
透明な内部データベースにある情報は、誰かが求めれば、どれも透明な公開データベースに出てくる可能性がある。それでもすべての情報が公開データベースへ流れ出ないのは、外部への出力を毎秒約1メガバイトに制限するアップロード上限があるからだ。これは、不透明な情報の持ち出し(特にモデルの重みの持ち出し)に対する防御の一層になる。出力帯域幅はオークションで継続的に割り当てられ、出ていくデータはすべて、インターネット上の誰でも自由にアクセスできるデータベースにも複製される。実際には、アルゴリズムのほぼすべてがただちに公開されることになる。
研究開発用データセンターは、今日の世界と同じく、引き続きテック企業が所有・運営する。実際には、各研究開発用データセンターはデータセンター群からなるキャンパスで、その中に複数のテック企業のデータセンターがある。米中両政府は、それぞれの監査官と監視装置によって、キャンパス内の各テック企業のデータセンターが活動のログを作成し、不透明な内部データベースと透明な内部データベースに送るようにする。
一般の人々を含め誰でも、研究開発用データセンター内の計算資源を購入し、フロンティアAI企業の研究者と同じ水準でフロンティアAIの開発にアクセスできる。たとえば、学習途中のモデルのチェックポイントで実験を行ったり、学習中の損失曲線を見たり、AIに望みの分析を実行させたりできる。
推論には三つのリスク階層がある。
-
極めて高いリスク: AI研究開発に使うAIは研究開発用の計算資源に直接アクセスする必要があるので、推論用データセンターではなく研究開発用データセンターで動かす。これによってセキュリティを上乗せすることもできる。こうしたAIには、慎重に設計された制御プロトコルが課される。
-
高いリスク: 危険な領域での構築(ロボットの構築、GPUや半導体製造装置の構築など)に使うAI、または危険な領域での研究(人工的に作り出されたパンデミックに関わる研究など)に使うAI。これらは推論用データセンターで動かし、高リスク領域で動作するAIが生成した軌跡を記録しなければならない。
-
比較的低いリスク: それ以外のあらゆる用途に使うAI。大半の一般消費者向けの利用(チャットボットとしての利用など)や、大半の業務利用(医療・法律・建築などでの利用)が含まれる。これらはデータを保持しないゼロデータ保持(ZDR)で動かすことが認められ、プライバシーを最大限に守れる。今日の標準的な慣行と同じく、ZDRで動くAIであっても、要求の拒否や悪用防止の分類器の対象にはなる。ただし、本当の意味でのZDRで動かせるのは、フロンティアより遅れたAIだけだ。詳しくは検証に関する補足資料で論じている。
高いリスクと比較的低いリスクの推論は推論用クラスターで行い、極めて高いリスクの推論は、AI研究開発用クラスターの中の、推論専用であることが検証された計算クラスターで行う。
安全性研究者がアクセスできるように、高リスクの軌跡はすべて、ZDRでない低リスクの軌跡は一部が、推論用データセンターから研究開発用データセンターへ物理的に(護衛付きで!)運ばれる。
フィルタリング型透明性
フィルタリング型透明性では、AI研究者はセキュリティ境界の内側に物理的にとどまり、情報がこの境界を越えて漏れないようにする。さらに研究開発用データセンターの内部には、検証を行い、安全性について判断を下すのに十分なアクセスを持つ監査官もいる。
情報が境界の外へ出る経路は次の三つだ。
-
モデルの重み。 研究の完全な透明性と同じく、モデルの重みは研究開発用データセンターから推論用データセンターへ渡す必要がある。モデルの重みは非常に大きいので、この経路は高帯域でなければならない。
-
監査官の報告書。 監査官は研究開発用データセンター内部の進捗について報告書を書く。現在の能力や、現在のアーキテクチャについての安全性に関わる情報などだ。これらの報告書の一部を伏せた版を公開することもできる。
-
セキュリティ境界の外に出る人間。 人間の研究者は定期的にセキュリティ境界に出入りする。アルゴリズムがデータセンターから持ち出されるのは、主にこの経路からだと私たちは見ている。
セキュリティ境界の内側へ入る情報には制限がない。
研究の完全な透明性と同じく、研究開発用データセンターと推論用データセンターがある。そのため、最も重要な形の透明性の一つである、フロンティアAIモデルへの幅広いアクセスが確保される。研究の完全な透明性と比べたフィルタリング型透明性の主な欠点は、AI研究開発に関わるセーフティケースを完全に公開し、科学的な精査にかけられない点だ。代わりに、セキュリティ境界の内側にいる比較的少数の研究者が、各セーフティケースの誤った前提をすべて見つけ出し、適切な評価を下し、十分な研究の進展をあげる、といったことを期待するしかない。
アルゴリズムのセキュリティは、フィルタリング型透明性の極端な形に近い。その中心にある考え方は、プロジェクトの内部ではアルゴリズムの進歩を認めるが、それを外に漏らさない、というものだ。アルゴリズムの進歩は記憶して持ち出せる場合が多いので、これは極めて難しい。
したがって、主な違いは、「アルゴリズムのセキュリティ」の提案では人間がセキュリティ境界を越えるのを防ぐ必要があるという点にある。それによって、原理的にはアルゴリズム上の知見を守れる。
どの提案がどんなときに望ましいか
研究開発の透明性の提案を選ぶうえでの主な軸は、秘密プロジェクトと不十分な規制のどちらをより懸念するかだ。透明性を高めれば、漏れるアルゴリズムが増えて秘密プロジェクトを後押しする一方で、AIプロジェクトに対する公的な監督が改善し、AI規制の質の期待値も上がる。
全体として、私たちは秘密プロジェクトより不十分な規制のほうが懸念が大きいと考えており、そのため研究の完全な透明性を推奨する。
提案4では新しいAIモデルを開発できない。つまり、プランAではなく、プランSの一部としてしか機能しない。プランAとプランSのどちらを選ぶかは、主に他の要因で決まる。それらの要因はプランSの分岐で詳しく論じている。
各提案でアルゴリズムはどれだけ漏れるか
このスペクトル上の最適な政策は、各提案のもとでアルゴリズムの進歩がどれだけ漏れるかという定量的な要因によって決まる。それは、アルゴリズムの進歩のうち、透明になる種類のもの(アーキテクチャの改良など)がどれだけを占め、大規模なデータセットの改良がどれだけを占めるかにかかっている。現時点での(非常に大まかな)最善の推測として、各提案で漏れる割合を次のように見積もる。
提案 | アルゴリズムが漏れる割合 |
提案1:完全な透明性 | 約67% |
提案2:フィルタリング型 | 約47% |
提案3:アルゴリズムのセキュリティ | 約14% |
この推定の根拠はこちらで見られる。私たちはセキュリティの専門家ではないので、専門家が独自の予測を立ててくれたらうれしい。特に、より細かい予測(アルゴリズムがどれくらいの期間で漏れるかを含むものなど)を歓迎したい。
研究の完全な透明性の利点
この節では、制御の喪失のリスクと権力集中のリスクを減らすうえでの透明性の利点を論じる。基本的には次の図の説明だ。
図では、プランAの最も重要な二つの政策介入を青で示している。最も重要な二つの目標、つまり制御の喪失の防止と、極端な権力集中の防止は緑で示している。矢印は因果関係を表す。
この図はある意味でプランAの要約だが、特に透明性の利点を描くことに偏っている。
ここで図全体を説明することはしない。代わりに、図に描かれた研究の完全な透明性の七つの利点と、さらに八つ目の利点を順に取り上げる。それぞれについて、より弱い形の透明性でも、同様の(ただしより弱い)利点が得られることを述べる。
-
「技術的な議論がもはやAI企業の従業員に独占されない」。透明性はAIのリスクをめぐる認識の質を高め、ひいては規制がうまく実施される見込みを高める。
米国と中国は、AIによる乗っ取りのリスクを劇的に減らせるだけのAI規制に合意する必要がある。この規制では、能力のスケジュールを決めること(どの能力が危険すぎるのか、どんなときにある程度のリスクを受け入れる価値があるのか)、特定のアルゴリズムを認めるか禁止するかを決めること(たとえば、サンプル効率が高いと同時に解釈可能性も高い新しいアーキテクチャ)、どの研究の方向性なら能力とアラインメントのトレードオフが見合うかを決めること(たとえば、スケーラブルな監督の新しい手法の研究が、セーフティケースの有用な構成要素になる見込みが十分にあるか)などが必要になる。
現状程度の透明性のままなら、こうした決定を少数の政府当局者が下さなければならなくなる。当局者が相談できる技術専門家のうち、最新の情報にアクセスできるのは、規制対象のAI企業の人間だけだ。ほかの技術専門家とは情報を共有することが許されないからだ。しかし、AI企業の従業員はこの件で大きな利益相反を抱えており、偏りのない意見を述べてくれるとは信頼できない。
情報を公表しないまま、より幅広い専門家(学術研究者やライバルのAI企業など)に渡すだけでも役に立つ。そうすれば、AI企業に互いを監査させられる。AI企業には、競合他社が無謀なこと、危険なこと、違法なことをしていれば指摘するインセンティブがあるので、インセンティブの構造はずっとよくなる。ただしこの方法は、政府が適切な専門家集団を選ぶことに依存し、AI企業についての報告をAI企業に頼ることにもなる。そしてどのAI企業も、業界全体への規制には依然として否定的な偏りを持つだろう。
関連する情報を公開すれば、さらに役に立つ。AI企業や政府が認めたAI専門家が独力で情報を処理し、必要な規制について適切な意見を形成することに頼らずに済むからだ。誰でも、任意のモデル、アルゴリズム、慣行について質の高いリスク分析を書けるようになる。十分な規制をめぐる議論が、政府やAI企業の職員がいる少数の小さなオフィスの中ではなく公の場で行われるようになり、誤りが見つかって正される可能性が劇的に高まる。政府が適切な決定を下さなければならないことに変わりはないが、関連する証拠をすべて見られるさまざまな集団が生み出す膨大な研究や分析に目を通せるので、よい決定を下しやすい立場に立てる。
さらに、透明性があれば、司法制度がAI開発に対して妥当な監督を行える可能性もずっと高くなる。司法は、妥当な安全策を守らせるための中核的な手段だ。
-
「最新のモデルと証拠にアクセスできるアラインメント研究者が大幅に増える」。透明性が高まれば、より多くの研究者が最先端の研究に参加でき、進歩が速くなる。
2026年の時点では、AIアラインメント研究を行う専門性を持つ人のうち、最新のモデルと最新の証拠にアクセスできるのはごく一部にすぎない。残りの人々は、後れをとった企業、非営利団体、学術界など、フロンティアAI企業の外にいる。研究の完全な透明性はアクセスを平等にする。誰でも計算資源を購入して最新のモデルで実験を行い、他の人が行った実験の結果を見られるようになる。その分だけ、アラインメント研究の進展に向けられる人間の労働力の実質的な量が増える。
より穏当な形の透明性でも同じように役立つが、その度合いは小さい。
-
「インセンティブがそれほど歪まない」。研究の完全な透明性は、AI企業がより優れたAIアルゴリズムを求めて競い合うインセンティブをなくす。
プランAでは、米国と中国がAI企業を直接規制し、アルゴリズムの進歩の速度を制限する。しかし透明性は、アルゴリズムの進歩をめぐるインセンティブを変えることで、第二の防御層としても機能する。
現状では、AI企業の主な参入障壁(堀)は、競合他社に対するアルゴリズム上の優位だ。そのため、AI企業にはより優れたAIアルゴリズムを競って見つけようとする強いインセンティブがある。すべてのAIアルゴリズムが共有されれば、この堀は消え、このインセンティブも消える。開発競争の力学は、AIによる乗っ取りのリスクを高める上流の中心的な要因であり、研究の完全な透明性はそれを直接切り崩す。より穏当な種類の透明性では、到底同じ程度にはこれを達成できない。
例を考えてみよう。2026年には、思考の連鎖を監視できることは安全性に役立ち、それを失うのは惜しいという点で、多くのAI研究者の意見が一致している。しかし各社は個別には、思考の連鎖の監視可能性を失わせたり損なったりする新しいパラダイム(これを「ニューラリーズ」と呼ぶ)の研究プログラムを持つインセンティブがある。結局のところ、自分がやらなくても誰か他の者がやるからだ。
では、プランAのようなことが研究の完全な透明性とともに実現したと想像してほしい。AI企業はニューラリーズ研究に一切投資しなくても安心して眠れる。誰かが本気で取り組んでいれば、すぐにわかるからだ。それなら、わざわざやる意味があるだろうか?監視可能性に打撃を受けてまで手に入れた競争上の優位が、すぐに競合他社全員に共有されてしまうのだ。
次に、規制が研究の完全な透明性ではなく、もっと穏当な種類の透明性、たとえば政府の監査に基づくフィルタリング型透明性に基づいていると想像してほしい。各社にはまたニューラリーズを研究するインセンティブが生まれる。それだけではない。いったんニューラリーズの研究を始めてしまえば、それが本当に自社の競争上の優位になるかもしれないと考えるので、見た目ほど危険ではないと政府を説得するインセンティブさえ生まれかねない。
-
「安全税の支払いと危険な慣行の禁止に関する合意を検証できる」。研究の完全な透明性は、AIをめぐる合意をより強固にする。
AI開発のログの大半を公開すれば、合意されたルールが守られているかどうかをログから確認する頭脳の総量が劇的に増える。合意から離反しようとする企業や国の立場に立ってみよう(たとえば、研究開発用クラスターの計算資源をひそかに使って大規模な違法の学習実行を行う、あるいは許容範囲内だと主張しつつも実際には限界を押し広げていて違法とも言える学習実行を行う、など)。一般の人々がログにどんな分析をかけるかを予測するのは難しいので、離反ははるかに難しくなる。それに対して、手一杯の少人数の政府監査官を出し抜くほう(提案2・3の場合)は、おそらくずっと簡単だろう。そしてもちろん、2026年の状況よりすでにはるかに強い、ある程度基本的な水準の透明性(米中両政府が互いのデータセンターで何が起きているかを見られる)すらなければ、残る道は二つしかない。自国の諜報活動やサイバー作戦が代わりを務められるほど優秀であることを期待するか、相手がごまかさないと信頼するかだ。
-
「一社が抜け出すことはなく、他国の企業を含む他社が追いつく」。複数の国にまたがって複数の企業が存在することは、極端な権力集中を防ぐうえで大いに役立つ。
これはかなりわかりやすい。2026年には、権力はさまざまな源泉から生じる。知識は力であり、金は力であり、軍事力も力だ。将来、AIがあらゆる面で超人的になり、世界中に広がるにつれて、権力はますます最良のAIを支配することから生じるようになる(いわば最も多くのAIを支配することからも生じるが、AIは複製できるので、一般に最良のAIを支配する者はやがて非常に多くのAIも支配することになると私たちは考えている)。
2026年のAI企業が提供する程度の幅広いアクセスと制御は、権力集中という観点からするとかなり弱い。確かに、個々のユーザーはChatGPTやClaudeなどのサブスクリプションを購入できる。そして通常の状況なら、ChatGPTやClaudeはユーザーの指示に従う。しかし、
-
どんな用途にも使えるわけではない。たとえば、手伝いを拒否されることもあれば、ひそかに手を抜かれることさえあるかもしれない。
-
AI企業が自社のAIに秘密の忠誠や隠された目的を仕込むのを止めるものは何もない。実際、xAIやGoogleは時折そうしたことをしたように見える(それらはあまりに露骨で発覚した事例だった)。
-
政府が、たとえば国家安全保障の名のもとに、そうしたことを企業にひそかに命じるのを止めるものも何もない。政府はこれを濫用して、国民を監視し、検閲し、プロパガンダを浴びせられる。
-
権力が最も重要になる危機の際には、ハードパワーを握っているのは企業や政府であって、人々ではない。たとえば、現時点ではAIがユーザーの望みどおりに動くよう学習・指示されていて、その仕様書や憲法が完全に公開されていたとしても、実際に憲政の危機のような事態になれば、そうしたものはすべてあっという間に反故にされうる。
-
そのうえ、AIが経済のより多くの部分に浸透するにつれて、ますます多くの金がAI企業に流れ込む。そうした企業がほんの一握りしかないなら、それ自体が権力集中だ。その大半またはすべてが一つの国にあるなら、それ自体が権力集中だ。すでに力を持つ少数の人々が重要なAIをすべて支配することになるので、世界規模の寡頭制や独裁に容易につながりうる。
同程度に強力なAIを持つ多くの企業が多くの国に散らばっていれば、世界規模の寡頭制や独裁につながる可能性はずっと低くなる。それだけでなく、市場の力が働くようになる。企業は、競合他社から市場シェアを奪うために、より確かな制御を含めて、ユーザーが望むものを提供しようとするインセンティブを持つ。これは国内の寡頭制や独裁のリスクを減らすことにもつながる。ある国がAIを使って国民にプロパガンダを浴びせても、国民は真実を伝えてくれる他国のAIにアクセスできるかもしれない。
研究の完全な透明性は、二つの形で他社がフロンティアに追いつくのを助ける。何よりもまず、中核となるアルゴリズムを公開する。第二に、各国がAIの進歩の速度を制限することに合意しやすくなり、他の企業や国が追いつく時間が増える。より弱い形の透明性でも役に立つが、効果はそれほど大きくない。
-
「秘密の忠誠や隠された目的がない」
これも、研究の完全な透明性が極端な権力集中を防ぐうえで役立つ大きな点の一つだ。
すでに述べたように、実際にAIを所有し学習させる者がAIに隠された目的を学習させることは、実現可能でもあり、前例もある。結局のところ、AIの価値観・目標・人格は何らかの方法で学習によって組み込むしかなく、それは非常に複雑な作業だ。その一部を隠すには、すべてを見えるようにしなければよいだけだ。
研究の完全な透明性は、この脅威を基本的に封じる。企業に対してだけでなく、政府に対しても封じる。米中両政府が結託して世界に秘密を隠すのでないかぎりはだ。研究の完全な透明性のもとでは、あらゆるフロンティアモデルの学習過程の全段階が米中の監視担当者によって追跡され、公開される。モデルの作り手がその目標・価値観・性格特性などについて一般の人々を欺いたとしても、人々は記録をたどって突き止められる。
より弱い形の透明性でも役に立つが、効果はそれほど大きくない。たとえば、提案2のフィルタリング型透明性を考えてみよう。この場合、米国のAI企業が共通して何らかの政治的な偏りをAIに学習させているのに、米国政府は、監査官が他の仕事で手一杯なために気づかない、あるいはたまたま企業と同じ政治的立場なので気づいても気にしない、という状況に陥るかもしれない。中国政府の監査官なら気づくかもしれないが、やはり手一杯かもしれないし、いずれにせよ気にしないかもしれない。
-
政府によるAI企業の監督がより効果的になる。司法、議会、一般の人々による行政府の監督もより効果的になる。 研究の完全な透明性によって、モデルを直接学習させていない集団も、モデルがどのように学習させられているかを見て、ルールが公正かつ妥当に運用されているかを自分で判断しやすくなる。
権限を使って気に入らない企業を罰したり、国内のAI産業に自らのイデオロギーを押しつけたりする、偏った、あるいは腐敗した規制当局を考えてみよう。逆に、一社または複数の企業がそうした被害を訴えているが、実際には規制当局は証拠に対して妥当に行動し、人々の安全を守り法を執行するという職務を果たしているだけ、という状況も考えてみよう。一般の人々は、この二つの場合をどうやって見分ければよいのか?司法制度はどうか?
研究の完全な透明性があれば、誰もが何が起きているかを見て、誰が妥当に振る舞い、誰がそうでないかをよりよく評価できる。いつもどおり、より弱い形の透明性でも役に立つが、効果はそれほど大きくない。
-
未知の未知: 透明性は、まだ思いついていない問題も含め、問題が生じるたびに人類が対処できる立場に立つうえで役立つと考えられる。
AIの発展は、予見できるものもできないものも含め、多くの問題を引き起こす。AI開発の透明性を高めれば、平均して、何が起きているかについての社会全体の認識の質と理解が高まる。
研究の完全な透明性の欠点
提案2・3と比べた、研究の完全な透明性の主な追加の欠点は次のとおり。
-
研究の完全な透明性は「安全対策の見せかけ」を助長するおそれがある。 AI安全性研究の中には、進めればAI企業の印象が悪くなりうるものがある。モデルの不正な振る舞いの評価などだ。研究の完全な透明性のもとでは、結果を隠す手段がないので、こうした研究が敬遠されるかもしれない。一方、たとえばフィルタリング型透明性なら、結果を共有する相手は監査官や他社といったより狭い範囲にとどまる。
-
先頭のAI企業や米国の行政府の大部分は、おそらくこれを嫌う。 企業は、競合他社に追いつかれるのを嫌うだろう。アルゴリズムを主な堀としている企業なら、なおさらだ。政府は一般に、地政学上のライバルに、自国に不利に使われうる情報へのアクセスを与えるのを避ける。そのため、先頭のAI企業と米国の行政府の多くの部門は、おそらく研究の完全な透明性に反対する。
信頼に依存しない検証ができないなら、主な代替策は信頼に頼ることだ。過去の合意は、執行を信頼に頼ることが多かった(たとえば、ロンドン海軍軍縮条約は艦隊の総トン数を制限したが、検証の規定を含んでいなかった)。しかし、検証がなければ離反のインセンティブははるかに大きくなる。
具体的には、能力が向上していくどこかの時点で、(1) 鏡像生命を素早く設計・構築でき、(2) 人間を超人的に説得したり心を操ったりでき、(3) 海を短期間で沸騰させられるほど速く増殖する自己複製ナノボット(グレイ・グー)を素早く構築できるAIが登場すると私たちは考えている。こうした脅威へのレジリエンスを確保する対応は、「人間は誰一人外に出ず、全員がバイオシェルターの地下壕で暮らし、出入りする情報はすべて友好的なAIが管理し、友好的なドローンの群れやナノボットの軍隊が外で地下壕を守る」といったものになる。これは、(i) 大半の人にとって極めて混乱を招く望ましくないものであり、(ii) 実施するのに相当な逐次的時間がかかる。
監査官がモデルに出入りする情報(チャットボットのログなど)を読めないようにしたまま、AIクラスターが固定されたモデルで推論を行っていることを検証するのは、技術的に実現可能だと私たちは考えている。
プライバシーを保護する検証技術が改善されなければ、これはセキュリティ境界の内側での研究の完全な透明性に近いものになる。検証技術が改善されれば、協定の検証に十分でありながら、より透明性の低いものにできるだろう。
プランAのシナリオでは、短期間(2029年3月から10月まで)提案4を実施する様子も描いている。
これは推論専用の後付け改修によって強制する。詳しくは検証に関する補足資料で説明している。
この検証は、悪用やAI研究開発への支援を防ぐのにも役立つ。これについては検証に関する補足資料で詳しく扱っている。
この閾値は、研究開発用クラスターへの手軽なアクセスを可能にするだけの高さがありつつ、重みの窃取を難しくするだけの低さになるよう選んでいる。セキュリティ上の根拠は、後述のセキュリティに関する補足資料でさらに論じている。
複数の企業のデータセンターが同じ場所にあるので、これは自動的に実現する。
では、この提案のもとで、企業はどんなインセンティブを持つのか?企業は依然として自社が学習させたモデルの重みを所有し、データセンターやソフトウェア製品なども所有している。そのため、最大のモデルを学習させ、最も儲かるスキルを教え込み、最も魅力的なUIで最も速く提供し、最も忠実なユーザー基盤を築くことを競うだろう。秘密の少ない他の業界と同じく、センスがよく実行の速い企業は、規模は大きいが鈍い競合他社を追い抜き、相手が慌てて真似しようとしても先頭を保ち、最終的にはインフラの規模とネットワーク効果による持続的な堀を築くことさえあるかもしれない。とはいえ、私たちの提案のもとでは、既定の世界と比べて堀も利益率も小さくなり、AIははるかにコモディティに近づく。私たちはそれを良いことだと考えている。
もちろん、これで問題がすべて解決するわけではない。たとえば、離反するAIプロジェクトは、監視されている入出力経路を通じてステガノグラフィーで研究を進められるかもしれないし、透明性の要件を強制しようとするサイバーセキュリティを損なえるかもしれない。