検証計画
Romeo Dean
プランAは、相互の信頼に頼らず、AIの進歩を減速させる国際協定を執行できることを前提とする。検証措置によって実現できると確信している。米中の双方に対し、相手側の協定違反は発見されるか、発見されなくても影響を無視できる規模にとどまるという十分な確証を与えることによって
現時点で最善の検証手段にも、費用と信頼性の幅があり、これを検証フロンティアと考えられる。現在、そのフロンティアはまだ成熟していない。米中間のAI開発停止を極めて高い確度で検証するには、現状ではおそらくデータセンターの電源を落とす必要がある。そして、これよりもコストが低いものは、違反される重大なリスクがある可能性がある。そうは言っても、検証の問題は本質的に防衛が優勢であると私たちは信じている。AIの検証も非常に新しく、これまでのところまだごく小規模な研究分野したがって、今後数年間で大幅な進歩を遂げることは非常に容易であるはずである。
本補足では、プランAを実行可能にするために採用すべき検証計画を概説し、続いてプランAの具体的なシナリオで検証体制がどう展開するかを詳しくたどる。
これの構築を構築への協力者を募集する?詳しくは、参加するタブ: 何をする必要があるか、フィールドが誰を必要としているか、関心表明フォーム、検証分野全体で機会が開かれる。
計画の概要
米国と中国が主導し、超知能をめぐる破局的な開発競争を避けるための国際協定を推奨する。この協定は相互の信頼に頼らず執行できなければならず、米中が検証不能な協定を結ぶ可能性は低いうえ、違反が発覚する可能性が高ければ協定を破る誘因も大幅に弱まるからである。
検証の問題は2つの主要な要素に分けることができる。
問題1。 既知の計算資源が規則に従っていることを検証する。
相互の信頼を前提としない協定を可能にする検証措置は実現できると確信している。ただし、明日にも協定を結ぶ必要があるとすれば、低コストで執行する準備はまだ整っていない。AIサービスを稼働し続ける経済的誘因が急速に高まるなか、短時間で有効化できる即応型の検証手段は、協定の成立に極めて重要になり得る。
問題2。 未知の計算資源が重要ではないことを確認する。
本稿の秘密プロジェクト補足資料の推定では、巧妙に実行された秘密転用であっても、協定開始時に「ダーク計算資源」として確保できるのは、世界のAI関連計算資源の中央値で約0.5%(80%信頼区間:0.1%〜1.4%)である。フロンティア能力の進展が計算資源に依存する可能性を踏まえれば、これによって協定のための時間を大きく稼ぎ、安定性を高められる。探知活動の成果が蓄積し、検証対象となる計算資源が増えるにつれて、この上限はさらに厳しくなるはずである。
私たちが推奨する手段は3つのフェーズから構成される。
フェーズ1。 協定のオプションを準備する。米国と中国は、推論専用であることを検証する能力を整え、AI向け計算資源の総量と所有者を厳密に追跡することで、協定を執行可能かつ持続的なものにする。
フェーズ2。 協定を実施する。米中は計算資源を相互申告し、その対象を第三国へ広げて、理想的には世界の計算資源の>99%を把握し、世界のAIデータセンター計算資源の~99%へ推論専用検証を後付けし、その後、協定後に生産される新たな計算資源を使う安全な研究開発検証体制の構築を急ぐ。
これは、私たちのシナリオでは2029年にこの協定を実施すると次のようになると考えられる。 すべての中大規模AIデータセンター (10,000 H100e以上、または約1億ドル以上)の推論専用の改修が行われ、これは世界のAI関連の計算資源の約99%をカバーするのに十分である。 次に、残りの小規模なクラスターを監視し、それらが秘密プロジェクトで使用される可能性を回避するための措置を講じる。 このモデリングには自信がないデータセンターのサイズの集中したがって、正確なカットオフと介入は異なる必要があるかもしれない。
フェーズ3。 堅牢性を向上させる。米国と中国は時間をかけて、とりわけハードウェア・セキュリティや検証の堅牢性などを強化し、検証体制の安定性と持続性を高める。
フェーズ1。 協定の準備のオプション
協定前の作業は、世界のAI向け計算資源の99%を安全に改修して推論専用と検証できるようにし、同時に少なくとも99%の存在量を低い不確実性で――少なくとも情報機関が――把握して、将来の計算資源申告と検証体制からもっともらしい否認によって隠せなくする、最小限の検証パッケージを短期間で完成させることに集中すべきである。
これを推奨する理由は何か?
2029年になっても検証技術が現在から進歩していなければ、高速なフロンティアAI開発が続いていないと双方が高い確度で確認するためには、協定成立後、フロンティアAIサービスの大半(たとえば90%)を6〜12か月停止する必要があるとみる。 最低限実用的な推論専用の改修手段を準備できていれば、この期間は2〜5か月程度に短縮できる。 両者の経済的影響の差は、2029年には数兆ドル規模に達する可能性がある。 承認済みの学習や実験も継続できる汎用的な検証手段を用意できればさらに望ましいが、その実現はより難しく、推論専用検証に上乗せされる便益も限定的だと考えるのは、減速協定では学習と実験がいずれにせよ意図的に制限され、とりわけ当初はAI開発の進め方を交渉する間も制限が続くため、推論さえオンラインに保てば経済的便益の大半を維持できるからである。
このような検証手段が準備されていても、協定の最大検証範囲は、協定に適用できる世界の計算資源の割合によって制限される。 米国、中国、またはその他の関係者が、保有する計算資源の量についてもっともらしい否認を持っている場合、そのもっともらしい否認を利用して計算資源を協定から隠し、秘密プロジェクトで未検証の計算資源として使用することができる。 しかし、未知の計算資源の合計が世界の計算資源の1%未満である場合、そのような秘密の取り組みはおそらく重要ではないと考えられる。秘密プロジェクト補足資料ではこれを直接モデル化し、私たちが提言する能力拡張戦略のもとで、周到に進められた秘密プロジェクトが発見または権限移譲より前に協定を揺るがすAIへ到達する確率を約13%と推定する。 この推定は協定開始時点のものであり、協定が続くにつれ、追跡と監査が収束し、発見の取り組みが蓄積するため、不確実性の幅と存在しうる秘密備蓄量は縮小するはずである(次を参照)。検出推定値秘密プロジェクトの補足で)、より多くの計算資源が検証対象になる。 もちろん、未知の計算資源は低いほど良いのだが、世界の計算資源の約1%は達成可能な目標であり、安定した協定には十分であると考えられる。
最優先の推奨事項:
検証R&Dに投資し、その総労力の約80%を、安全な推論専用改修計画の開発に集中させる。
また、検証研究開発の取り組みの約20%が、ソフトウェアのみの手段、プライバシー保護の検証対策、より一般的な検証手段 (トレーニングや実験のコンプライアンスも検証する)などの有望な追加対策を追求することで、補足的な研究開発の取り組みを支援する。
世界にAI関連計算資源がどれだけ存在し、どの主体が保有しているかを把握するため、情報機関などによる計算資源の集計と追跡に投資する。
特に、この初期のチップ追跡に関する推奨事項では、この計算資源がどこにあるか、または何に使用されているかを把握することが優先されていなく、私たちは、協定を実行可能にするという点での利点の大部分は、単に存在量を把握し、いつでもどの主体がそれを所有しているかを追跡できることにあると信じている。なぜなら、もっともらしい否認が存在しないことで、協定交渉の際にこの計算を宣言させるのに十分なはずだからである(協定に参加することに大きなインセンティブがあることを考慮すると)。そうは言っても、その場所を知ることは、もっともらしい否認のケース(販売中やチップの死亡記録の偽造など)や、(何らかの理由で)米国政府と中国政府が所有主体に対してほとんど影響力を持たない(したがって、保有していることがわかっている計算資源(ロシアの計算資源など)の場所を宣言するよう圧力をかけることができない)ケースを回避するのに役立つ。
フェーズ2。 協定を実行する
安定した協定を築くには、相互の計算資源申告とサプライチェーン記録の監査を直ちに実施し、協定の対象となる計算資源を最大化すべきである。次に、利用可能な最善の推論専用検証を適用し、学習と実験を短期間停止する。並行して、学習と実験を再開するための検証体制を集中的に整備する。
これを推奨する理由は何か?
未知の計算資源を協定の検証対象にできないことを考慮すると、最優先事項は未知の計算資源の量を最小限に抑えることである。 このために必要な緊急のアクションは、既存の計算資源と、現在転送中または運用中の計算資源の宣言を直ちに実行することである。 そうすれば、米国と中国の両国は、互いの申告書の監査と検査を実施し、それを(適切に準備した範囲で)民間諜報活動と比較して、お互いがどれだけの計算能力を持っているかについての不確実性を解決できるはずだ。
世界の計算資源の約85%は米国または中国の企業が所有する必要があるため、この協定に基づく計算資源の99%を目指すには、残りのギャップを埋める可能性が高い他の5 ~ 10か国にもそのような宣言協定を展開する必要がある。 これを他国に拡大する緊急度のレベルは、これら他国がどれだけの計算能力を持っているか、またこれらの国が検出されずに大量の情報を隠すことに成功する可能性がどの程度あるかについて、諜報機関が持つ不確実性によって決まる。
この申告の後、既存の計算資源を推論専用へ切り替え、新たな学習実行と実験を短期間停止することを提言する。 先述のとおり、これはAIサービスと製品を稼働させたまま経済的利益の大半を保ち、比較的検証しやすい形で、AIの進歩を減速させるという協定の目的を達成する。 準備できている中で最も優れた推論専用検証策を使うべきである。 現時点ではネットワークタップと再計算に基づく方式を目標として提言するが、他の方式が優れるかを判断するには追加の研究開発が必要である。 初期には劣った方式しか間に合わない可能性もあるが、より良い方式が完成するまで協定を立ち上げる用途には十分かもしれない。
最後に、協定の開始後に行われる別の取り組みとして、トレーニングと実験を再開するための検証体制を設定することを推奨し、これは、協定の設定後に決定すべき研究開発の検証には重要な特性があり、また、今後の安定した協定を可能にするために研究開発の検証には非常に高度なセキュリティ要件が必要であると考えているためである。特に、どのレベルの透明性を目指すべきかについて決定を下す必要がある (私たちは「研究の完全な透明性」体制を推奨するが、どちらを選択するかについては、詳細を参照)。透明性に関する補足資料)、いずれにしても高度なセキュリティ要件があるため、検証済みのデータセンターを最初から構築する必要があると考えられる。 新規建設に許容できないほど長い時間がかかると判断される場合、または研究開発検証のための十分に安全な改修手段がある場合は、既存のデータセンターを研究開発に使用する暫定期間が設けられる可能性がある。 そうは言っても、約2年後に検証とセキュリティの要件が高まり、いずれにしても世界の計算資源の90%程度が協定発効後の新しい計算資源になると考えられるため、協定発効後の安全性の高い新しいデータセンターを構築することをより強く推奨する。
最優先の推奨事項:
既存の計算資源と新規生産の双方について二国間の計算資源申告とサプライチェーン監査を実施し、計算資源を大量に保有または生産する第三国にも対象を広げる。
すべての主要なデータセンター所有者とサプライチェーンで主要な役割を持つ企業は、購入と販売に関する記録を公に宣言し、監査人や検査官が互いの国や企業の記録と最終チップの数を確認できるようにしている。 これには、転送中の計算資源とアクティブな計算資源実稼働も含める必要がある。 この時点から、既存の計算資源と新しい計算資源の生産は綿密に追跡され、保護されるため、検出されずに秘密プロジェクトにリダイレクトされることはない。 この宣言を、重要な計算資源所有権または生産能力を持つ他の国にも拡大する。 この計算資源の移動を検出できる確実なインテリジェンスが導入されていない限り、早急に実行する。
既存の計算資源と、新たに稼働するすべての計算資源に推論専用検証を導入する。
推論専用検証を既存の計算資源に展開して、AI研究開発の一時停止を強制しながら、AIサービスをオンラインに維持できるようにする。 理想的には、高度に安全な手段をすぐに使用できるようにする必要がある。 そうでない場合は、利用可能な最適な手段を実装する。 手段の準備がまったく整っていない場合は、より良い手段への移行を急ぐ間、計算資源をシャットダウンするか、非技術的な手段 (例: お互いの会社に組み込まれた監査人が誰も実験や学習実行を実施していないことを確認するなど)のみに頼る。
短期集中作業は、選択した透明性制度に従って研究開発検証を設定する。
プランAでは研究の完全な透明性と呼ぶ特定の体制を推奨するが、別稿で説明するとおり、透明性に関する補足資料、条件によっては、別の方式の方が良い場合があり、体制に関係なく、高度に安全な研究開発クラスターと高度に安全な協定発効後の推論クラスターを何らかの組み合わせで構築する必要がある。なぜなら、ほとんどの透明性体制では、少なくともAIモデル重み付けと検証の正しさが要求されると考えられるからである。SL5(国家主体による攻撃にも耐える)水準のセキュリティである。このため、これらのクラスターは新規に構築すべきだと考える。
実際に検証すべきAI研究開発協定は何か?
協定の主目的は、アラインメント研究を能力研究より優先するなど安全性へ資源を配分し、また安全性が低いおそれのある研究方針や高効率アルゴリズムを避けるなど開発方針を制約することで、安全性を高めるためにAI開発を減速できる条件を作ることである。 本稿では、この安全性を重視したAI研究の減速を「AI研究の段階的調整」と呼ぶ。 その方法は、当初は実験用計算資源への厳しい上限のように粗いものでも、時間とともに、能力面の外部性に関する科学的理解に基づく個別判断などへ高度化できる。
さらに協定では、ハードウェア研究とハードウェア生産が不安定化を招くほど拡大する可能性にも対処する必要がある。 プランAでは、こうしたリスクへ対処するため、ハードウェア研究の段階的調整と、ロボット・計算資源生産に対するキャップ・アンド・トレード政策を提言する。 詳細は次の資料で扱う。プランAの検証ストーリー。
フェーズ3。 堅牢性の向上
協定成立後には、その堅牢性をさらに高める余地が数多くあると見込む。具体的には、ハードウェアセキュリティへの大規模投資、検証体制の改善、検証の容易化や各種セキュリティ特性の向上、秘密プロジェクトより協定参加者を有利にする設計など、協定の堅牢性を高めるハードウェア設計上の選択、そして相互確証による計算資源破壊や当事者間で協定失効時の帰結を均衡させる措置など、協定離脱の動機を弱める取り組みを推奨する。
これを推奨する理由は何か?
協定の堅牢性には、実現可能な改善策が数多くあると見込む。別稿で検討したように、協定の決裂はプランAの成功を脅かす最大級の要因であるため、協定弱体化に関する補足協定から離脱する誘因を減らすことが、安定性を高めるうえで中核となる。協定への秘密裏の違反も、別稿で検討する中核的な脅威である。秘密プロジェクト補足資料)したがって、協定の堅牢性を高めるもう一つの柱は、既知の計算資源に対する保証水準を高めつつ未知の計算資源を減らすこと、モデル重みのセキュリティなど他の特性も改善すること、そして潜在的な離反者が進歩を生み出したり盗んだりしにくくすることである。
協定の堅牢性のための具体的なアイデア
プランAシナリオでの協定の検証
プランAのシナリオでは、前節で概説した高水準の検証計画に従う。 検証補足資料の本節では、その実施と検証の過程をより具体的に説明する。 継続的に研究開発が進む若い分野の将来シナリオであるため、細部についての確信は低い。 それでも、先に示した検証計画を実施する際の具体的で有用な基準を提示したい。
2026~2028年:協定のオプション性を準備中
2026: チップ追跡開始
米国の諜報機関は、中国へのAI計算資源の密輸とその国内生産レベルを内部で監視し始めており、年末までに中国企業が合計でどれだけのAI計算資源を所有するかについては10%の不確実性に達しており、彼らはこの情報についてはまだ何もしていない(つまり、密輸情報をBISと共有していない)。中国は米国の諜報機関がこれを行っていることを知り、主に台湾のTSMCの既存資産を活用して総生産量の正確な数と記録を取得することで同様のことを始めている。米国全体のAI計算資源の不確実性は10%に達する。これは主に、台湾以外 (韓国や米国など)の既存の計算資源と生産に関する不確実性によるものである。新しい計算資源の生産に関する不確実性ははるかに低くなる (1%程度)。
2027: 検証研究開発に資金提供
米国行政府は、協定の任意性とこれを可能にする検証手段に関心を示し始めている。 一連の作業の後、情報提供依頼彼らは、推論専用の改修 手段として、ネットワークタップと再計算を中心とした方式に取り組みを集中することを選択した。 互いのデータセンターにデバイスを設置するという見通しを聞くと、最初は警戒を招くが、これは取り組むべき扱いやすいセキュリティ問題である。 最終的には、考えられるネットワークタップの設計 (本質的には光信号を分割するガラス)の一部が非常に単純であること、およびさまざまな物理的セキュリティアジェンダへの並行投資により、これらのタップが実際に必要になった場合に備えて大量に生産する価値がある可能性が明らかになる可能性がある。 一方的に信頼される再計算サーバー (ネットワークがトラフィックをリダイレクトし、実際に検証を実行する役割を担うサーバー)はより複雑であるため、標準では信頼することが困難だが、ここには多額の投資が行われている。 研究開発プログラムは、信頼を築くために意図的に透明性があり、オープンソース化されている。 中国も同様に透明性の高い方法で独自の対称手段を開発、構築する動機があると考えている。 今年の後半には、機密ではない重要な検証関連情報、特に互換性のあるネットワークタップと再計算サーバーを構築するために必要な互いのネットワーキングと計算資源パラダイムに関する相互情報共有に合意する。さまざまな資金源や世界中のさまざまな場所からいくつかのパイロットが年間を通じて実施され、設計の改良が繰り返され、生産規模を拡大するための準備が行われる。 最終的に、米国と中国は、以下のボックスで提案するより野心的な設計や、別の設計ではなく、脆弱性が入り込む余地が最小限に抑えられた、極めてシンプルな光分割設計を備えたネットワークタップ手段を選択することになる。暗号ベースの方式、より不確実だが、(十分に低コストで)機能する場合は、さらに優れており、信頼しやすくなる可能性がある。
具体的な推論専用の改修提案。
現時点では、米国と中国はネットワークタップと再計算サーバーを用いる推論専用検証を目指すべきだと考える。 この方式なら、初期の減速協定を高度な確度で検証しつつ経済的コストを抑えるという利点の大半を、実現可能で構築しやすい形で得られるとみている。 ただし、実現可能性と構築容易性には前半ほど確信がないため、RFIを出し、できるだけ早く試験運用と方式の改善に着手することを強く推奨する。

提案の概要:
バックエンドネットワーク (East-Westネットワークとも呼ばれる)を (かなりの量)削除することで、データセンターを分離された推論ユニットのグループに変換する。
現在、データセンター内のAIサーバー間では大量の高帯域幅通信が行われているが、これは (ほとんど)トレーニングにのみ必要であり、比較的小さなオーバーヘッド (ユーザーメモリストレージの再編成など)があれば、大規模な推論では大幅に少ないスケールアウト相互接続を使用できるはずである。 これを削除することは、大規模な学習実行にクラスターを使用することを困難にするための重要な多層防御手段である。
シンプルに追加すると、パッシブネットワークタップフロントエンドネットワーク (ノースサウスネットワークとも呼ばれる)上で、すべての入出力トラフィックのコピーを再計算サーバーにリダイレクトする。
フロントエンドネットワーク上のこれらのネットワークタップには、複数の実装が可能であり、私たちは現在、おそらく完全にパッシブにして光信号を2つに分割する必要があると考えている。これがおそらく最も信頼しやすいからである。これとは別に、ストレージバンクから推論ユニットに戻るパスが必要である。
すべてのAIワークロード (推論、エージェントツールの使用など)を強制的に個別の再現可能なパケットに編成し、パケットは再計算サーバーに対して透過的である (ネットワークタップを通過するため)。
再計算サーバー上で部分的な再計算 (パケットのランダムなサンプル)を実行して、パケットの正確さをチェックする。
再計算サーバーの完全性はこの段階できわめて重要だが、その計算と出力を信頼できるなら、ランダムサンプリングによる部分再計算は、元の計算資源のごく一部だけを使いながら、全出力の正しさをきわめて高い確率で検証できるよう、非常に有利にスケールする。 計算については次を参照。付録。
改ざん攻撃などから検証手段の完全性を確保するのに役立つ強力な物理的セキュリティ特性を備えている。
検証プロセスの完全性を実現するには、改ざんや検証プロセスを破壊する可能性のあるその他の攻撃を回避するための十分な物理的セキュリティ対策が必要である。
完全性を検証する方法サイドチャネル通信の最大値を制限する、そして定期的なメモリワイプを使用する(おそらく強制記憶を通じて)。
この検証提案の完全性、つまりクラスターからの出力のみが検証された推論トークンであるためには、説明したようにサイドチャネルの軽減とメモリの消去が必要である。 予備の計算資源が未承認のワークロードに使用されていないことは検証しないが (これは非常に難しいと思われるため)、出力の形式で永続化される結果が検証された推論出力のみであることを確認するように努めている。 これには、強力なサイドチャネルの軽減と推論ユニットの定期的なメモリ消去が必要である (これは強制記憶によって実行できると考えられる)。
この提案を強化する一案は、ネットワークタップより多機能な「安全なネットワークゲートウェイ」を構築し、複製パケットのログを整理したうえでランダムに抽出し、再計算サーバーへ堅牢な方法で送ることである。

これらの安全なネットワークゲートウェイがどのようなものかを示す大まかなスケッチ、各パスにはネットワークスプリッターを備えたデータパス方向 (入力と出力)があり、ログデータフローがパケットに編成されてランダムにサンプリングされ、安全な再計算サーバーに送信される。ブートフェーズでは、これらのゲートウェイはさらに、ホワイトリストに登録されたモデル重みだけが推論ユニットにアップロードされていることを確認できる。これらのゲートウェイに必要なハードウェアセキュリティ特性の一部は優先される。たとえば、次を参照。iPhoneの安全な領域とPUF。
これらは、以前と同様の構築でネットワークタップの代わりに使用できる。

ネットワークタップと再計算を中心とする方式を構築する中核的な取り組みに加え、ソフトウェアのみの方式や暗号技術を中心とする方式など、別方式のR&Dにも$100M規模の資金が投入される、たとえば、ZKP)方式、および推論専用の改修 手段を補う物理セキュリティの研究開発用の同様のプール (1億ドル規模)。
その他の有望な検証方向。
私たちがスケッチした部分的な再計算方式の代わりに、次のような他の方法で推論専用を検証できる可能性がある。
AIワークロード用のゼロ知識証明 (ZKP)などの純粋な暗号化プロトコル
これには、プライバシーが保護され、ハードウェアの改修の必要性が少なくなる可能性が期待されているが、これを行うための十分な計算効率のアルゴリズムが発見されていないため、現時点ではいくぶん推測の域を出ない。
メモリチャレンジベースの検証
これにより、ハードウェアの改修も必要なくなる可能性が期待できるが、完全性を検証する際にいくつかの困難に直面する可能性がある。 それにもかかわらず、初期の協定の実装には実行可能である可能性がある。
ハードウェアの粗雑な変更。
主要なスケールアウト相互接続を削除し、たとえばいくつかの単純なセンサーやその他の物理的なセキュリティメカニズムをインストールすることでも、大量の計算資源とより高いステークスのワークロードに対してより高度な保証手段が準備できるまで、協定の初期段階 (たとえば1年)で推論専用を検証するのに十分な場合がある。
2028年: チップ追跡が成熟
諜報機関は新たな計算資源生産を綿密に追跡しており、追跡活動よりも前にAI計算資源がどの程度存在していたのかについての不確実性を狭めることに部分的には成功している。 年末までに、中国は米国の総計算量に対して約2%の不確実性を抱え、米国は中国の総計算量に対して約4%の不確実性を抱えている。 これは、中国の観点からすると、米国がH100相当の2億2,200万機から2億2,600万機を所有していると80%の自信を持っていることを意味する。 米国の観点からすると、中国が2,500万から2,700万のH100相当品を保有していると80%確信している。
2029 ~ 2030年: 協定の実施
2029年1月: チップの相互申告と検査
プランAの交渉開始から1週間以内に、米国と中国は計算申告とサプライチェーン記録監査を実施し、記録の検査と監査のために相互に数百人を互いの国に派遣することを許可し、これにより、互いの計算資源に対するすでに比較的小さい不確実性を軽減できる。現在、双方の最善の推測は、相手方が宣言から最大で約150万H100eを隠していた可能性があるということである (80% CIは約400万に達する)。これは、大手AI企業の研究開発計算資源の約4%、世界の総計算資源の約0.5%に相当する。秘密プロジェクトによってどのくらいの計算資源が隠蔽される可能性があるかについての推定と推論については、以下を参照。秘密プロジェクト補足資料。
クラスター規模の区分ごとに推奨する介入の詳細は、以下のとおりである。
中規模および大規模のデータセンター (>10,000 H100e、~1億ドル)
推論専用の改修
99%
小規模データセンターと分散型AI計算資源
AI性能がA100を上回る機器には報告義務を課す。 抜き打ち検査も行う。
1%
AIの有用性が不明確な非AI計算資源 (iPhoneなど)
大量の消費者向け計算資源を収集する取り組みを探すためのインテリジェンス。
0.1-10%か、AIでの有用性をどう補正するかという不確実性に左右される。
クラスターサイズ | 即時介入 | 2029年1月のこのカテゴリの推定計算資源 (世界のAIデータセンター計算資源の割合) |
中規模および大規模のデータセンター (>10,000 H100e、~1億ドル) | 推論専用の改修 | 99% |
小規模データセンターと分散型AI計算資源 | AI性能がA100を上回る機器には報告義務を課す。 抜き打ち検査も行う。 | 1% |
AIの有用性が不明確な非AI計算資源 (iPhoneなど) | 大量の消費者向け計算資源を収集する取り組みを探すためのインテリジェンス。 | 0.1-10%か、AIでの有用性をどう補正するかという不確実性に左右される。 |
チップの宣言には、すべての新しい計算資源生産を非常に厳重に監視することも含まれており、AI関連の特定のパフォーマンス指標を超えるチップは、検証措置の対象となる既知の場所に送られる必要がある。 一方で、消費電力の低い消費者向け計算資源の生産は制限されないままになる可能性がある。
チップ流通規制。
米国と中国は、将来生産される計算資源が違法プロジェクトへ流れる可能性を最小限に抑える必要がある。 そのため、製造を監視し、輸送を警備しなければならない。 幸い、AI向け計算資源の製造は世界の少数の施設に集中しており、2029年までこの状態が続くとみられる。 新規に生産されるAI向け計算資源と、高性能AIメモリやネットワーク機器などの重要部品を100%把握することは十分可能だと考えており、本稿の秘密プロジェクト補足資料推定では、協定発効後の生産分からの転用はほぼゼロに抑えられ、その総量が100K H100e未満に収まることにも極めて高い確信がある。 企業が新たに購入した計算資源を、次の二つの場所のいずれかへ振り向けられるようにすることを推奨する。
既存のデータセンター / 進行中のデータセンター構築: ここに向けられた計算資源は、推論専用の改修が完了した場合にのみ推論を行うことが許可される。
一時的な相互コールドストレージ保持施設: ここに送られる計算資源は、安全で相互に検証された新しいR&Dクラスターが構築されたら、R&D (トレーニングと実験)用に構築できるようになるまで保護される。
まず、相互接続、計算資源、メモリ、帯域幅が十分に低いチップは無制限に製造できることを提案する。 その後、2032年までに、計算資源のしきい値をわずかに緩和し (より高度なエッジ計算資源を必要とする可能性のあるコンシューマーアプリケーションに余地を与えるため)、相互接続のしきい値を厳しくする (転用された場合に秘密プロジェクトでの潜在的な有用性を下げることが期待される)という上限を暫定的に提案する。 詳細については、2032年セクション。
2029年2月: 推論専用の改修が開始される
米国と中国は計算資源の宣言と検査を実施し、互いの計算資源の大部分を把握していると比較的自信を持った後、短期間のAI研究開発の一時停止について握手し、それを世界に発表し、AI企業は当面、進行中の学習実行の一時停止を含め、研究開発を直ちに中止することになっている。両社は推論専用検証手段を互いの最大規模のデータセンターに展開する一方で、小規模クラスター (10,000 H100e未満のもの。これらの改修には時間がかかるため)を100%電源オフにし、すべてのAI製品とサービスを適切に実行し続けるためにはわずかに速度を低下させただけで十分な計算資源の約20%だけで十分な計算資源の80%をすべてオフにすることに同意する。これにより、協定が成立し、その後、以前よりも有利な位置から開発競争に戻る間に、誰でも裏切って差額利益を得ることができる範囲が制限される。
米国は計算資源の約95%を合計約200,000のAIサーバーラック (サーバーラックあたり平均1,000 H100e強)に保有しており、中国は計算資源の約95%を100,000のAIサーバーラック (サーバーラックあたり平均約250 H100e)に保有している。
幸いなことに、米国には約10,000のネットワークタップと100台の (一方的に)信頼できる再計算サーバーの在庫がある。 中国には約20,000台のタップと200台のサーバーの在庫があり、さまざまなサードパーティからそれぞれ毎月さらに10,000台を購入できる。 中国の計算資源能力が低いため、米国は中国の計算資源をより迅速に改修できるが、中国の達成可能なペースによって決定される比例改修スケジュールに同意し、1か月で米国の計算資源の40%を既存のネットワークタップの在庫を備えた4つのサーバーラック (または4K H100e)の推論ユニットに改修することになる。 したがって、どちらもこのペースに従い、3か月のマークまでに80%まで増加し、それ以降は95%を超えるか、より小さい推論単位に増加する。

2029年3月:研究開発クラスター建設開始
推論専用の改修が実行されている間、米国と中国は、目指す高レベルの規制計画と透明性体制について合意する(選択肢の一部は、私たちの記事で強調されている)透明性に関する補足資料違法プロジェクトによるリスクが比較的小さいことやその他のさまざまな考慮事項を考慮して、彼らは研究の完全な透明性方式を目指すことを決定した。 これには、SL5モデル重みセキュリティとSL5検証の整合性を備えた研究開発データセンターの構築が含まれる。 彼らは、これらを擁護できないようにして、協定から離脱してこれらの新しい研究開発クラスターを使って再び開発競争を始めようとすることが困難になることを望んでおり、そのため、米国の研究開発クラスターをモンゴルに、中国の研究開発クラスターをカナダに置くことで相互抑止を狙っている。 米国はモンゴルクラスターに警備員を配置し、中国や他の誰かが計算資源を奪取しようとした場合にその計算資源を破壊する堅牢な「焦土」メカニズムを備えており、カナダでは中国の計算資源に対して対称的な対策が講じられている。 彼らはこれらのインフラストラクチャプロジェクトを3月に緊急性を持って直ちに開始し、検証済みの研究開発パイロットを開始できるように、6か月以内に少量の容量をオンラインに確保することを目指している。 彼らが従う予定の検証方式は推論検証方式に似ており、証拠収集としてネットワークタップが使用され、ワークロードを構成するパケットの正確性を検証するために部分的な再計算が使用される。
2029年4月から5月: 第三国が協定に参加し始める
4月から2029年の残りの期間まで、ドイツ、日本、英国、インド、フランス、ブラジル、カナダ、メキシコ、イタリア、オーストラリア、韓国、スペイン、UAE、サウジアラビア、台湾、オランダ、スイスを含む、世界で最も裕福な20カ国のほとんどと重要な半導体サプライチェーン諸国が計算資源宣言を行い、データセンターへの推論専用の改修を許可することでこの協定に参加する。
2029年6月から7月: 新しい高セキュリティ (SL5)推論専用クラスターの構築が開始される。
透明性体制の一環として、承認されたフロンティアモデルを広く一般に展開する計画だが、SL5モデルでは、SL5の出力検証と蒸留の緩和を通じて達成されるセキュリティが重視される。 を組み合わせて提供する予定である。データ保持ゼロ消費者向けの (ZDR)推論と、よりリスクの高い展開向けの透過的な推論。 詳細については、透明性に関する補足資料SL5モデル重みのセキュリティと検証の整合性を達成するには、おそらくこれらのクラスターを最初から構築する必要があると考えられる。
ゼロデータ保持 (ZDR)推論
ZDRの利点(AI利用者に強いプライバシー保証を与える)とリスク(AIが存亡に関わる危険な用途に使われる)を両立させるため、協定期間中の推論には3段階のプライバシー区分を設けることを提案する。
合計ZDR
100%
非常に積極的な分類子、拒否、脱獄防止、および高リスク領域 (AI研究開発など)では使用できないモデルがある。
なし
100K H100e
確率的ZDR
99.9%
(ランダムサンプリング、分類子によって高リスクとしてフラグが付けられた場合、透明な公開データベースに移動する)
高リスクとしてフラグが立てられた場合、分類器と透明な公開データベースに送られるランダムサンプリング
あり
100M H100e
ZDRなし
分類子に基づく変数 (ランダムサンプリング、分類子によって高リスクとしてフラグが付けられた場合、透明な公開データベースに送られる)
通常の分類子、拒否、未学習などの軽減、および圧縮/蒸留の軽減。
あり
100B H100e
データ削除の確率 | 緩和策 | APIの微調整? | 推論フリートの上限 (グローバル) | |
合計ZDR | 100% | 非常に積極的な分類子、拒否、脱獄防止、および高リスク領域 (AI研究開発など)では使用できないモデルがある。 | なし | 100K H100e |
確率的ZDR | 99.9% (ランダムサンプリング、分類子によって高リスクとしてフラグが付けられた場合、透明な公開データベースに移動する) | 高リスクとしてフラグが立てられた場合、分類器と透明な公開データベースに送られるランダムサンプリング | あり | 100M H100e |
ZDRなし | 分類子に基づく変数 (ランダムサンプリング、分類子によって高リスクとしてフラグが付けられた場合、透明な公開データベースに送られる) | 通常の分類子、拒否、未学習などの軽減、および圧縮/蒸留の軽減。 | あり | 100B H100e |
2029年8月から9月: 世界の計算資源の95%で推論専用の準備が完了
夏の間に大手の計算資源所有者数社が協定に参加したことにより、世界の計算資源の95%が推論専用検証を受けており、より高い粒度 (推論単位の縮小)と物理セキュリティの向上 (サイドチャネルの削減、労力のかかる物理的な保護と監視)にスケールアップされた。
2029年後半: パイロットR&D検証がオンラインで開始される
カナダとモンゴルでは、相互に構築されたデータセンターが、9月までにカナダで約1GW、モンゴルで2GW規模(世界の計算資源の約2%)でオンラインになり、年末までに世界の計算資源の約15%に拡大する予定である。 企業はこれらのクラスターで計算資源のホスティングを開始し、オンラインになるとスペースを入札することができる。 最初は非常に小規模な実験のみが承認され、その有効性をテストして改善するために、検証とセキュリティ対策についてレッドチームと反復が行われる。
考えられる検証方式の概要。
AI検証に関する既存の取り組み(ベイカーら。 アル。シャーら。 アル。Harack et. al.による研究。関連資料、カンカヤなど。 アル。)では、研究開発の検証を実行するために活用または開発できる多くの概念と提案が紹介されている。
私たちが提案する検証問題についての考え方の1つは、(1)証拠の収集と (2)証拠に基づいて何かを証明するという2つの部分に分けることである。 これは、非常に単純なもの (例: 既知のすべての計算設備の電源がオフになっているため、AI研究開発が行われていない)から、高度なもの (例: 暗号化された証拠に基づいており、学習実行で承認されたトレーニングデータとメソッドが正しく使用された可能性が非常に高い)まで多岐にわたる。
以下は、現時点で使用できる証拠の収集および検証方法の一部を示したものだが、すべてを網羅しているわけではない。

私たちが重視する5つの主要な検証指標は次のとおりである。
保証曲線。保証曲線は、次のレベルに関する情報を取得する。カバレッジ(検証手段が主張の対象とするAI計算資源の割合)と信頼度(検証手段が、対象となる資源に対して行う主張について正しい確率はどの程度か)。 保証曲線を関連する (カバレッジ、信頼性)値のセットとして定義する。 権限移譲と秘密プロジェクトのリスクがどこで交差するかを知ることが重要であるため、私たちは2D曲線全体に注目する。
実行の難易度。検証手段を正しく実装するのはどの程度難しいか? たとえば、検証ソフトウェアの構築、デバイスの製造と設置、物理的セキュリティの実施と監視などのために、大量の専門家による人的労働を必要とする検証手段の負荷のかかる部分がある場合である。
準備が必要である。検証手段を実装するために必要な調査時間。 既存のインテリジェンス能力で実装できる手段の場合、準備は非常に少なくて済むが、逆に、高度なオンチップメカニズムを必要とする手段の場合、準備の要件は非常に高くなる。
プライバシーレベル。これは、検証提案が証明者と検証者の間でどの程度の個人情報の開示を要求するかを示し、私たちは透明性の向上を独自に推奨しているため、これについてはあまり心配していない。また、セキュリティを軽減できる可能性もあると考えている (特にモデル重みなど、拡散したくない情報の場合)。それにもかかわらず、検証には低レベルのアクセス (トークン、モデル重み、アルゴなど)を必要としないことが依然として理想的である。
経済的コスト。最後に、これは、検証手段の実装によって全体的な経済的価値がどれだけ失われるかを示す指標であり、介入により、経済的に大きなマイナス面を伴うリスクが回避された可能性があるという事実(AIの大惨事、人類の絶滅など)を無視しているため、AI開発の継続による「良い世界」を前提としており、その反事実と比較してどれだけの経済的価値が失われるかを確認している。検証手段を実際に開発、製造、実装するコストは、AI推論をどの程度継続できるか、そしてその結果として定量化するのが難しい下流の経済的利益を考慮することによって支配される可能性が非常に高くなる。
範囲。たとえば、検証手段は推論専用を確認するだけか、それとも大規模な学習実行や実験を含む任意のAIワークロードを確認するか。
どの検証手段を選択するかには、これらの指標間に複雑なトレードオフがある可能性があり、現時点での最良の推測は、主にパス上の情報収集 (つまり、ネットワークタップ)に依存し、その後部分的な再計算を検証アルゴリズムとして使用することである。これは、非常に高いカバレッジと信頼性まで堅牢に拡張できる可能性が最も高いと考えられるためである。
私たちが追求すると仮定するあらゆる検証方式の重要な要素。
以前のAI検証作業を活用 (ベイカーら。 アル。シャーら。 アル。Harack et. al.による研究。関連資料、カンカヤなど。 アル。)どのような検証方式においても、多くの防御層が必要であると考えている。 この補足の他の部分では、通常、最も困難な作業を実行できると考えられる検証方式に焦点を当てるが、次のような他の多くの対策も必要であるか、少なくとも役立つと考えている。
物理的なセキュリティ。どの検証方式も、AI計算資源インフラストラクチャの物理的状態に関するいくつかの不変条件に依存する可能性がある。 有望な将来の方向性と既存の方法には、不正開封防止エンクロージャ、セキュリティカメラ、境界制御、エアギャップなどがある。 推論専用の適用では、特に検証に物理的な改造が含まれる場合、ハードウェアが大幅に改ざんされていないという確信が必要になる可能性が非常に高くなる (現在、これが最も有望な方法であると考えられているが、ソフトウェアのみの方式も除外されない)。 良いニュースは、検証のための物理的なセキュリティ要件が、データセンターに独自に求めているセキュリティ体制と大きく重複していることである。
人間ベースの方法。内部告発プログラム、職員へのインタビュー、および組み込まれた監査人は、大規模な違反を特に早期に発見するのに大いに役立つ可能性がある。 私たちは、どの提案でもこれらを耐荷重として依存していないが、特により堅牢な技術メカニズムが稼働する準備が整う前の初期段階では、これらが非常に役立つ補足であると考えている。
相互に信頼できる製造およびサプライチェーンのセキュリティ対策。多くの検証メカニズムは、ネットワークタップ、再計算サーバー、改ざん防止筐体などのハードウェアに依存しており、実際に説明どおりの機器であることが前提となる。 このため、検証用ハードウェア自体の製造工程とサプライチェーンも相互に検証する必要が生じる。 Harack et al.は、この問題を検討している。 特にオフチップ機構は、非侵襲的な出荷後試験や、旧世代プロセスのファブでの共同生産を通じて相互検証できる可能性がある。 さらに、一部の領域では、同期した一方的検査によって相互信頼の問題を回避するという有望な案もある。チャンカヤは、パッシブ光ファイバースプリッター (デジタルロジックなし、溶融ガラスのみ)を使用することを提案しており、これにより、双方が相手のハードウェアを信頼する必要なく、ネットワークトラフィックを独立して監視でき、一方的に信頼されたデバイスと組み合わせて、独自の検証を独立して実装できる。
2030年初頭: 完全な研究開発検証が進行中
現在、カナダまたはモンゴルの検証済みの研究開発クラスターには、約1億のH100相当のものが存在する (これは当時の世界の計算資源の約20%であり、協定開始時に存在していた計算資源の35%に相当する)。 これらのクラスターには、透明性対策これにより、企業はアルゴリズムを組み合わせて最初の主要な協定発効後のトレーニングを実行することが承認された。 数か月以内にこれらの学習実行は完了し、いくつかのモデルは自動コーダーマイルストーン (AC)に近づく。 モデルは、この目的のために研究開発クラスター内の少量の計算資源をレンタルする多くのサードパーティグループや監査人を含め、広範にテストされ、レッドチーム化される。
現在、研究開発の進行速度をどのように制御して(急ぎすぎることによる)リスクと(能力向上による)利益のバランスを取るかという大きな規制上の課題が存在している。これは間違いなく、この協定を適切に実行するのが最も難しい部分となるだろう。 一連の複雑な依存関係があり、あまりにも速く進むとAI乗っ取りのリスクが生じたり、進歩の原因となったりする。潜在的な秘密プロジェクトに拡散する(合法的なプロジェクトが持つ余裕を減らす)一方で、遅すぎると、協定が決裂する前に調整の進展が遅れたり、実際に協定の範囲外で運営されている違法なプロジェクトに負けたりするリスクが生じる。
推奨する能力進展の大枠は、制御に基づく安全性ケースを確実に構築できる最大能力まで、理想的には主としてハードウェアの増強によって拡張し、その後、アラインメントに基づく安全性ケースの限界的な進展、すなわち権限移譲リスクの低下分が、協定によって負うリスクを下回るまで停止するというものである。
望ましい能力進展スケジュールを定めても、その水準を実際に執行するのは難しい可能性があり、特に、能力の進展を計算資源などの投入量から予測しにくい、測定しにくい、または何もしなくても速く進む場合には難しい。現時点では、後述するように、厳格な計算資源上限と質の高い個別ルールを組み合わせれば十分だと考えている。
研究の滴定: 研究開発の進行速度を制御するにはどうすればよいか?
計画のこの部分は、研究をどの程度の速度に制限するのが適切かを決定するという、厄介で複雑で予測不可能な問題となる可能性が高い規制当局の能力に最終的に依存しているため、これは私たちが懸念している計画の弱い部分であり、将来の作業でそれをうまく進める方法のアイデアが改善されることを期待している。結局のところ、これが私たちが研究の完全な透明性を推奨する主な理由の1つである。これは、これがより正確で効果的な規制上の決定に役立つと考えているからである。私たちは、規制上の能力をあまり必要としないことと、試みられている研究の段階的調整目標をより正確に代用することとの間でトレードオフとなる有望な方式がいくつかあると考えている。これら2つの概念を次のように呼ぶ。
実装の容易さ。正しく実装し、強制することがいかに簡単であるか。
規制の精度。規制が実際に目標を達成する可能性はどの程度あるのか、つまり、適切な実装と施行の下では、ソフトウェア研究が高い確率で安全な速度で進む可能性がある。
以下にいくつかの方式を取り上げ、それらがこのトレードオフのどこに該当すると考えられるかを大まかに示する。
セーフティケースの立証責任。すべての研究開発には、承認前に安全性に関する強力な議論が必要であり、この方式は、規制の正確性の観点からほぼ明確に私たちが望んでいることだが、安全性の良いケースと悪いケースを区別するのは非常に困難である可能性がある。また、特にAIの支援がなければ、最初から適切な安全性を主張することは非常に困難である可能性があり、これが、この方式が協定が進むにつれてより現実的になる可能性がある理由の1つである。ただし、協定が進行し、AIがより高い機能に達するにつれて、規制の正確さの重要性もより重要になる。そのため、これは、高機能 (TED-AIなど)が開発されているか、開発に近づいている協定の中期から後期の段階で使用される制度であることを推奨する。
高品質のアドホックルール。許可される研究の方向性と速度についてはケースバイケースで決定する。 この方式は、安全性ケースを正確に診断するよりも実行が若干簡単であるように思えるが、安全性ケースは非常に複雑 (または、生成することさえ困難すぎる)である可能性があり、その代わりに、追求するパラダイムまたは放棄するパラダイム、および資源割り当ての観点から引くべきレバーについて大まかな判断を下すことができる。 一方で、高レベルのアドホックルールには安全でない開発を可能にする微妙な余地や抜け穴がある可能性があるため、この方式では精度がある程度失われる可能性がある。
人間が解釈可能な要件。承認されたすべての技術は、あるグループの人間によってエンドツーエンドで理解される必要があり、研究の進歩のボトルネックとなる人間の理解を強制することは、安全性の非常に優れた代替手段となる可能性があり、実装も非常に簡単である(人間にランダムなサンプルを見てもらう)。そうは言っても、何かが安全でなく、人間によって解釈可能である可能性は非常に高いと思われるため、この方法に長期間依存するのは不安定になる可能性がある。ただし、これでは実際に処理が遅くなりすぎる可能性もあり、緩和バージョンか別の方法を使用する必要がある。この方法は、ハードウェア研究の段階的調整に非常に適している可能性がある。これについては以下で詳しく説明する。
計算資源と資源の上限。研究開発の計算資源には単純な上限があり、これは実装と検証が非常に簡単だが、非常に不正確である可能性がある。特定の計算資源およびその他の資源 (人間の研究者など)のしきい値によってどの程度の進歩が生じるかを知ることは、モデリングの問題としては不確実であり、誤差範囲が広い可能性がある。ただし、協定の初期段階では、これらを非常に低く設定することが、導入しやすい良いスタート手段のように思える。その後、キャパシティーを向上させる時間を考慮して、より正確な方式に移行できる。
研究に関する特定のルールが定められている場合、これらのルールを実際に遵守させるという別の問題が発生する。 研究開発ルールの施行の問題は2つの部分に分けることができる。
ワークロードの承認。企業が宣言したワークロードは、その実装がどのようなものであれ、実際には規制ルールを満たしている。
ワークロードの検証。企業が宣言しているワークロードは、実際に実行されているものと一致する。
私たちの見解では、ワークロード検証は、先に述べたネットワークタップによる証拠収集と、無作為に選んだ再現可能なパケットの部分再計算によって解決できる一方、ワークロード承認は適用されるAI研究開発ルールの内容に密接に結びつくが、そのルールは実験用計算資源の上限だけなのか? 特定の技法を禁止するのか、あるいは義務づけるのか? 基本案では、R&Dクラスターの監査チームが手作業で承認する。
ワークロードの承認。
ここでの主な問題点は、特にルールがアドホックであるため、ワークロードがルールに従っているかどうかが不明確になる可能性があることである。 また、AI企業は、表面的には準拠しているように見えるワークロードの内部で非準拠のワークロードをエンコードしようとするなど、敵対的な攻撃を行う可能性がある。 体制が進み、相互検証の下で計算資源がますます増えていくと、規則に反する目的で総計算資源のごく一部を悪用するこのような攻撃が重大になる可能性がある。
考えられる緩和策は次のとおりである。
宣言されたワークロードとデータに対するステガノグラフィー対策
理想的には、ますます堅牢で安全なプログラミング言語を使用して、監査プログラムをGPU命令にコンパイルする。
AI支援によるデータのフィルタリングとチェック
使用する可能性のある全体的な体制は、使用が精査され承認されたコードとデータの「ホワイト」リスト、禁止されているコード/データの「ブラック」リスト、および/または特定の種類のワークロードごとに必要な技術の「ゴールド」リストを維持することである。 そうすれば、ワークロードの承認の問題は、単にワークロードを承認または拒否するためにこれらのリストと照合することに単純化できる。 ホワイトリストに登録されたコードのみを使用して秘密裏に不正なワークロードを実装することは大幅に困難になる可能性があるが、これらのリストにデータを入力するためのプロセスが何であれ、問題を引き起こすだけになる可能性もある。 少なくともこれは、ワークロードの承認を、企業やさらには広範な一般の人々が貢献できる透明性の高いプロセスにするのに役立つかもしれない(少なくとも、公開されているすべてのものについては、協定の後半で、私たちの透明性提案で説明した禁輸メカニズムを通じて安全を保とうとしている内部で発見された一部のアルゴリズムが除外される可能性がある)。

ワークロードの検証。
また、使用される可能性のある複数の異なる種類の証拠収集または検証についても言及した。 私たちの推測では、プランA(これについては後で詳しく説明する)でますます必要になる、非常に高いレベルの保証に達するためには、完全な (そしてますます詳細な)パス上の証拠収集と部分的な再計算ベースの検証アルゴリズムを組み合わせた再現性の義務が実行可能な方式となるだろう。 そうは言っても、別の方式 (例: 低レイテンシのチャレンジや妥当性チェックの使用)が、より低いコストで同じレベルの保証を達成できないか、または同等のコストでより高いレベルの保証を達成できないかどうかはわからない。 検証問題が実行可能であることを証明する目的で、部分的な再計算ベースの検証アルゴリズムを使用した完全な (そしてますます詳細な)オンパス証拠収集について説明する。
検証の問題を考える際に役立つもう1つの概念は、AIワークロードを個別の一連のステップとして考えることである。
標準では、これらの計算ステップはランダムに実行されるが、強制的に再現可能にすることができる場合(たとえば、シードされたランダム性でも問題ない)、証拠収集の粒度と検証アルゴリズムの保証レベルの間に予測可能な関係を持たせることができる。 これは、ワークロードのごく一部を再計算するランダムサンプリングによる部分再計算では、正確性をチェックする個々のワークロードパケットのサイズを小さくするため、検出確率が有利にスケーリングされるためである。 詳細については、付録。
協定の最初の数年間で私たちが想像する具体的な体制は、証拠収集のためにネットワークタップを引き続き使用し、ランダムに選択された再現可能なパケットの部分的な再計算によって正確さを検証することである。 推論専用と同じ高レベルの方式で、ネットワークタップをバックエンドネットワークの下位レベルに移動することで、時間の経過とともにパケットサイズがどんどん小さくなる。

宣言: AI企業は、コードやアルゴリズムなどについて完全な透明性を持って、実行したいワークロードを宣言する。
承認:監査人は以下に従ってチェックを実行する。ワークロードの承認実装し、合格した場合は承認を送り返し、必要なランダムシードを提供する(偽のランダム性をゲームとするAI企業からの潜在的な攻撃ベクトルを除去する)。
証拠収集:監査人はワークロードから証拠を収集する (ネットワークタップを介した完全なログフローなど)。 この図では、証拠の収集は低い粒度として示されているが、実際には、個々のサーバーまたはGPUのレベル、あるいはその後のさらに低いレベルで行われる可能性がある。
検証:監査人はランダムにサンプリングし、部分的な再計算やその他のチェックを実行して、ワークロードの正確性の違反を発見する。
評価とリリース:最終的な学習実行で構成されるワークロードの場合、評価の実行を含む追加のステップが存在する可能性があり、その評価の正確性も検証され、最終的なモデルのリリース承認により、モデル重みが不透明な内部データベースからダウンロードされ、推論専用クラスターに転送される。 このプロセスは、モデル重みの盗難の観点から非常に危険なため、慎重に設計して実行する必要がある。
2030年後半: 協定発効後モデル展開用の安全な推論専用クラスターがオンラインになる
最初のSL5推論専用クラスターが稼働し、広範な一般提供に向けてR&Dクラスターで承認された最初の協定発効後モデルを提供し始める。これらのクラスターは、改修済みクラスターと同じ基本的な検証方式(ネットワークタップと部分再計算)を採りつつ、セキュリティ特性を強化している。年末までに、世界の計算資源の約40%(世界全体の~930M H100eのうち~370M)が、新設された協定発効後のSL5推論専用クラスターに入る。
さらに2030年末までに、米国と中国は強化されたコールドストレージ施設を設け、互いのAIチップ備蓄を検査官が検証できるようにし、その規模は、別稿の推定に従い、現実的にあり得るどの秘密プロジェクトよりも大きくする(米国は5M H100e、中国は500K H100eの計算資源バンク)。協定弱体化に関する補足)、相対的な規模は協定前の現状と同様である。 これらはどちらの側も簡単に防御できる場所にある。 これらの場所には、検証済みのモデル重みが保管されている場所もあり、そのため、米国と中国が合意したモデルは、協定失効の場合に使用を承認するプラスの合計となる(安全性研究に非常に役立ち、強力な安全性ケースがあるモデルなど)。 2033年頃には、自動コーダー機能のマイルストーンに近いモデルがウェイトスタッシュとして承認され、2037年にはニアフロンティア (トップエキスパートAI)モデルがコールドウェイトストレージとして承認される。
2031-2036+ 協定の改善
2031年: ハードウェアの研究開発およびその他の高リスク領域に対する制限
米中合意が対処しようとしている核心問題は、知能爆発だ。しかし、対処すべき脅威は知能爆発だけではない。 もう1つの核心的な懸念は、AIによって産業の爆発、AIハードウェアの過度の進歩、またはその他の危険な科学の進歩が実現する可能性があるということである。
AIソフトウェアの進歩を懸念するケースは、AI 2027で例証された、超人的なAI研究者は、私たちが制御できない可能性があり、その目標を調整する方法がまだわかっていない超知能をブートストラップする可能性がある。ハードウェアの進歩が早すぎることを心配する根拠は、急速なテイクオフの下ではこれに優先度が下がるが、プランA協定の下では、ソフトウェアの進歩を遅らせるだけであれば、個別の緩和策がなければ、実際にはハードウェア主導の乗っ取りが乗っ取りリスクの大部分になる可能性がある。
制約のないハードウェアの進歩を懸念する3つの主な理由:
同様に、生物学などリスクの高い科学分野でも研究開発を制限したい。標準案では、一般公開されるAIの大半に推論時の拒否と監視を課したうえで、重大なハードウェア研究その他の科学研究を相互検証下で行える専用研究所を設けることも考える、そこでは安全保障と透明性のトレードオフを選び、企業がハードウェア研究開発の進展速度を調整する規則に従うことを相互に検証し、その規則には安全性ケース、個別ルール、人間による解釈可能性の要件、資源上限などを組み合わせられる。
推論制限、監視、高リスクドメインの拒否。
高機能モデルを公的に展開することの欠点の1つは、危険な研究が可能になったり、違法プロジェクトがそれらのモデルを使用してAI研究を支援したり、これらのモデルの出力を直接抽出してモデルのトレーニングに役立てたりする可能性があることである。 広範な推論の展開が蒸留、違法なプロジェクトの持ち上げ、その他の危険な研究につながらないようにするには、正しい出力の検証だけでなく、拒否、監視、圧縮の十分な組み合わせも必要である。
拒否または能力形成。
コンソーシアムが公開するAIはAI研究が苦手なはずだ。 不正なプロジェクトによる使用を困難にするために、他のタスクよりもMLエンジニアリングが苦手になるように設計される可能性がある。 これには、安全性研究の普及を促進するにはさらに悪くなるという欠点がある。 能力の欠如ではなく、断固として拒否することも、この目標を達成するための別の方法である可能性がある。
モニタリング。
推論の正しさの検証に加えて、モデル上で実行されるモニター (おそらくアクティブではなくパッシブでも問題ない)があり、モデルがAI研究、大規模トレーニング、またはその他の危険な研究に関与していないかどうかを確認する必要があり、これらのケースを非常に確実に検出することは容易な場合がある。たとえば、多数のGPUでトレーニングするためのコードを含むコードベースで動作している場合、これが違法な使用であることは明らかである。
圧縮。
標準では、推論の中間部分をユーザーに決して表示せず、出力を小さなクォータまでの要約に最大限に圧縮する。
可能な限り複数のレベルで垂直統合し、出力を生成するだけである。
現在のところ、これらは広範囲に展開できる対処可能な緩和策であると考えているが、不確実である。 蒸留のテストを継続し、危険な研究を検出する必要がある。
ハードウェア研究の制限。
ハードウェア研究に関するルールの設定
ルールの特定のサブセットの1つは、従来のようなロボット設計や従来のようなチップ設計の研究のみを許可することかもしれなく、ハードウェア研究によるリスクの多くは、ナノテクノロジーやはるかに製造しやすいAI計算資源などにつながる可能性のあるパラダイムシフトする科学的ブレークスルーを不安定にすることにあるからである。そして、従来のような設計は、この協定に基づくハードウェアとロボットの構築の利点を実現するのに十分な改善の余地があるかもしれない。そうは言っても、十分に改善できない場合は、ハードウェアの研究制限をより緩和することが賢明かもしれない。
計算資源とソフトウェアの進行状況の関係についても非常に不確実であるのと同様に、ハードウェアでも、入力と進行状況の関係について不明確な考えがあるかもしれない。 それにもかかわらず、投入量(エネルギーの上限、材料の上限、研究労働の上限など)を桁違いに削減することで、損失はあるが実装が簡単な方法で、ハードウェアの進歩のペースを安全だと思われるレベルまで繰り返し減速できるかもしれないという同じ希望を抱くことができる。
ハードウェア研究に関するルールの強制。
ハードウェア研究の段階的調整ルールを定めた後は、遵守を検証する手段が必要になる。 一案はソフトウェア規制と同様に、研究案件を個別に、または自動化した許可・禁止リストで承認し、作業を小工程へ分割して証拠を収集し、無作為標本で遵守を確認することである。 ただしハードウェア研究では、現実の二つの研究室はAIチップほど均質でないため、化学実験などで高い再現性を得るのがはるかに難しい。 そのため、違反してももっともらしく否認できる余地が生じる。 したがって、すべてを再現性に基づいて検証する方式は採るべきでない。 もっとも、ハードウェア研究の中にも再現可能な工程は多数ありうる。
もう1つの可能性は、多くのことがマクロスケールである可能性があるため、信頼できる監視スキームを使用してすべてを直接監視できることである。 ただし、信頼できるモニターを構築するのは難しいかもしれないので、代わりに人間にすべての録音のランダムなサンプルを検査させ、ランダムなサンプリングによる有利な検出確率のスケーリングの恩恵を受けることができるかもしれない。
全体として、ハードウェアの研究ルールを検証する方法については非常に不確実であり、ソフトウェアよりも難しいのではないかという現在の感覚を持っている(しかし、それがおそらく簡単であるとも考えている)。 そうは言っても、標準の速度とリスクレベル、したがって必要な全体的な速度の低下は、より低い可能性が高いと考えられる。
2032: ロボットと計算資源のキャップ・アンド・トレード
前述したように、私たちは地球上のロボットとAIチップの数の爆発的な増加が協定の安定を脅かすのを阻止したいと考えている。 標準では、現在の単純なモデリングは、現在のハードウェア設計であっても、プランAシナリオ中に到達すると予測されるAIとロボットの機能は、より多くのAIチップとロボットを生産するための直接コストと、それらの経済的価値との間に大きな乖離をもたらすと予測している。 標準では、これにより再投資スパイラルが発生し、倍増時間が非常に早くなると考えられる。
プランAでは、キャップ&トレード規制を通じて、地球上のロボットとAIチップの数を約6か月で2倍に制限する2032年からの上限を提案しており、民間企業は一定期間内に有限のロボットとAIチップの生産許可に入札する必要がある。 この上限は、工業生産におけるロボットの有用性と、AIワークロードにおけるAI計算資源の単位で設定される必要があるが、これらの両方を測定すること、特にロボットの場合、タスクやフォームファクター全体にわたって測定することは、困難で曖昧になる可能性がある (例: ロボットとより従来の機械の間の境界があいまい)。 それでもなお、さまざまなロボットやハードウェアの設計に対してこれらのことを適切に測定し、それに応じてキャップ・アンド・トレードの制限を割り当てることは実現可能であると考えている。
ロボットやAI計算資源の生産が世界中で行われている場合、実際にキャップ・アンド・トレード許可ルールを施行することは非常に困難になる可能性があるため、キャップ・アンド・トレードルールの施行を容易にするために、新たに構築された産業能力とロボットを特別経済区 (SEZ)に集中させることを提案する。
キャップ&トレードルールを適用する方法。
これに対する私たちの提案は、構築されたすべての産業能力とロボットを経済特区(SEZ)に集中させ、これらの制限区域での執行とそれに伴う監視を集中させ、経済の残りの部分はハードウェア検証チェックを受けないようにすることである。
SEZは、ハードウェア研究や推論専用のソフトウェア研究開発方式と同様の高レベルの検証方式を持つことができ、この方式では、生産が個別のステップに分割され、人間による (および/または信頼できるAI監視支援による)手動監査がランダムに行われる。
経済の残りの部分は検証されないままにしておくことができるが、ロボット、電力、およびハードウェア生産へのその他の潜在的な投入量にはおそらく上限があるはずである。 これらの境界が低い場合は、SEZの外側での監視は最小限で済む。 そうは言っても、人々は分散配置されたロボットを本当に求めているため、この限界を十分に低く保つにはコストが高すぎるのではないかと考えている。 したがって、分散配置されたロボットに信頼できる地理位置情報を持たせたり、ランダムな検査を行ったりするのは良いことかもしれない。 また、計算資源の拡散が多すぎることを避けるために、ロボットには未検証のエッジ計算資源がほとんどなく、代わりに、堅牢なエッジ計算資源の検証が行われるまで、監視対象 (理想的にはプライバシー保護のためにAIによって自動化されている)と検証済みの推論専用クラスター上のクラウド経由で主にサービスを提供することも提案する。
同じキャップ・アンド・トレードの原則は、無制限の量では不安定になるが、少量であれば安全である他の製品やサービスにも適用される。 2つの主な例は、エッジ計算資源と監視されていない推論を備えた製品である。 特にエッジ計算資源に依存する可能性があるものには、自動運転車や消費者向け計算資源が含まれるが、監視されていない推論は軍事作戦において政府にとって特に価値がある可能性がある。 キャップアンドトレードの下では、政権は、協定の安定性を維持する安全な社会規模の上限の下で、合法であるこれらの活動に対応することができる。 そうすれば、人々、企業、政府が相互に入札して権利を得ることができる許可の市場が生まれる可能性がある。
未検証のエッジ計算資源の上限。
私たちは、世界で存在できる未検証のエッジ計算資源の上限を3,000万の有効H100eとし、推定では2,500万を提案する。実効H100eは協定より前にリリースされており、新しい未検証の製品に利用できるクレジットは500万クレジットのみである。 十分なエッジ検証手段があれば、計算資源を免除できる。
消費者向けデバイス、自動運転車、ロボットの無制限のエッジ計算資源により、違法プロジェクトで使用される可能性のある大量の計算資源ストックが発生する可能性がある。 協定前には、コンシューマーおよびエッジ計算資源にはAI関連の計算資源が含まれる可能性が高く、(単一GPUを持つ愛好家や自動運転車用チップなど)と、主としてAI非関連の計算資源(AIワークロードでの効率が低いチップ)からなるが、その台数は極めて多い、携帯電話だけでも数百億台あり、AIワークロードに対する1台当たりの有用性はH100の約0.1 - 1%にすぎないものの、合計すれば数千万H100相当、すなわち世界のAI関連計算資源の~10%となる。別稿では計算資源補足資料、これは約2500万になると推定される実効H100e。
これは、フロンティアAIワークロードにおける有用性のより優れたモデルを使用して、その時点でより正確に推定される必要がある。 消費者向け計算資源の有用性が私たちの推定よりも高いことが判明した場合、大量の消費者向け計算資源が集められて秘密プロジェクトに使用される可能性を回避することがより重要になり、そのため、たとえば、優先度の高い計算資源の買い取り努力が保証される可能性がある。
私たちは、許可コストを回避するために、私たちが提案する上限が「エッジ検証」(つまり、本質的に堅牢なハードウェアメカニズム)の急速な革新につながることを期待しており、私たちは、ローカルAI能力が低い安価な携帯電話が数多く存在する一方、ローカルまたは「エッジ」AI計算資源を大量に搭載した携帯電話やその他の消費者向けデバイスは、最初は非常に高価になるが、禁止する必要はないと予測している。その後、数年後には、ハードコードされたコードと重みを使用するなど、強力なエッジ計算資源を安価に (許可を必要とせずに)実現できる堅牢なエッジ検証が登場するだろう。この上限は、秘密プロジェクトを著しく加速する (または悪者に過剰な武器を与える)ために、消費者向け計算資源のわずかに目立つシェアを転用する必要があるように設定されている。少なくともプランAの開始時点では、代わりにAIにも使用できる豪華なゲーム用GPUが必要な場合は、割増料金を支払う必要があるということは、残念だが潜在的に必要な現実である (誰もが1つを所有できるようにすることはできない。そうしないと、不正な計算クラスターに貢献するためにこれらのGPUを大量に集めることは簡単になってしまう)。経済学者の言葉で言えば、未検証のエッジ計算資源には大きな負の外部性 (秘密プロジェクトに使用されるリスク)が伴う。
未検証の消費者向け計算資源の上限に加えて、消費者向け計算資源については、単一ユニットでの販売が許可される一定の実効H100eカットオフ (特定の計算資源、帯域幅、メモリ容量、ネットワーク速度のしきい値など)を設定することが望ましい場合がある (秘密プロジェクトまたは検出にチップを収集する難しさは、計算資源よりもチップの絶対数に密接に関係する)。 (秘密プロジェクトによる使用を検出しやすくするために)位置追跡対策が必要な計算資源層もあるかもしれない。
研究開発の段階的調整と生産上限を合わせると、全体像は次のようになる。

2033: セキュリティの向上
2033年までに、ハードウェアセキュリティが大幅に向上し、データセンターのより一般的なセキュリティ特性、検証体制および機能が大幅に向上すると予想される、2033年末までに、世界の計算資源の約99.9%が協定発効後の計算資源になる。つまり、すべての協定前のクラスターと計算資源の電源をオフにするだけで、計算資源の大部分を、ゼロから構築された新しいより安全な場所に置くことは簡単である。さらに、2034年末までに、存在する計算資源の約90%が2033年か2034年の間に生産されることになる。これは、それまでに行われたセキュリティの改善が、わずか1 ~ 2年以内にすでに広範囲に導入される可能性があることを意味する。同様のダイナミクスが製造施設にも当てはまる。
何が可能になるかについては不確実性が非常に高いだが、私たちが考えている主なアイデアには次のようなものがある。
非常に優れたサイドチャネルとエアギャップ特性を備えた、ゼロから構築されたデータセンター。
より一般的な推論および研究開発ワークロードのためのソフトウェアスタックの標準化 (再現性のため)とセキュリティの向上において大きな進歩があった。
新しい計算資源生産施設 (ファブ)は、相互監視対策を講じてゼロから構築され、サプライチェーンと同じ場所に配置され、攻撃対象領域を最小限に抑えるために最終的な集中データセンターと併置される可能性もある。
特にアーキテクチャの変更や数値形式に伴う一部のハードウェアとソフトウェアの相互依存関係の始まりにより、これらのパラダイムの最適化と進歩が協定前の計算資源に適用されにくくなる。
検証体制、特に研究開発データセンターのロギング/証拠収集の粒度が向上し、バックエンドネットワーキング上の非常に高帯域幅のデータパスと互換性のあるロギングテクノロジーによりオーバーヘッドが削減される。
再計算サーバーにとって特に重要な、より堅牢な信頼できる実行、セキュアブート、暗号化、再現性などにより、ハードウェアセキュリティ特性が全般的に向上した。 ハードウェアにおけるある程度の標準化も、再現性の向上に役立つ場合がある。
特定のワークロードをデバイス上で自動検証するための特別なハードウェア設計、特に、推論専用であることを検証するために一部のチップにハードコーディングされた重み。これは、秘密プロジェクトで使用されるリスクを冒さずに消費者製品でより多くのAI計算資源を可能にする「エッジ検証」に特に役立つ可能性がある。
2034: 検証の改善
2030年代を通じて、世界のAI計算資源総量は爆発的に増える。 重要なのは、検証対象の計算資源が増えるほど、より高い網羅率が必要になり、検証負担も増えることである。 プランAでは、協定の安定性とのトレードオフを考慮して、キャップ・アンド・トレード制度により検証可能な範囲へ抑えながら、ハードウェアを大幅に増強することを予測するとともに提言し、ハードウェアは違法プロジェクトへ流出しにくいため、合法プロジェクトが利用できる能力を相対的に増やせる。
検証の保証曲線を改善し、無視できない規模の不正な内部展開を高い確率で検出できるようにしなければならない。 2034年までに、各フロンティアGPU(各~100 H100e)から1時間に1パケット(~100 H100e-hour)を収集し、再計算予算を1%とすれば、付録の計算では、未承認作業が~46,000 H100e-hoursに達した時点で不正な内部展開を99%の信頼度で捕捉できるため、10K H100eを継続運用すれば~4.6 hours以内、1Kなら~46 hours以内に検出される。
これは野心的な検証規模であり、検証体制における非常に優れた完全性セキュリティにも依存している。 特にAI支援を利用すれば、ここまで拡張することは可能だと考えているが、自信はなく、検証の負担をこれほど増やさないようにするには、計算資源の上限を低く設定する必要があると考えられる。
2035年: データセンターを海洋に移転
現在進行中の最大のリスクの1つは、協定が破棄され、当事者が開発競争に戻ることであり、計算資源規模の大幅な増加が(安全規制のため)能力の進展に反映されていないため、これまでの調整の進歩にもかかわらず、開発競争への復帰は当初の現状よりもさらに危険になる可能性がある。これは、物事がより速く進むようになるためである。これにより、協定が決裂した場合に、協定前の計算資源水準、またはさらに小さな計算資源水準に戻るための対策を講じる動機になる。
私たちは、公海で海上に新しいデータセンター容量を構築するのに関連する相対的なエンジニアリングコストと物流コストは、ロボットとAIの労働力によって十分に低くなり、2035年頃にはその価値があるものになると考えており、なぜなら、協定が決裂した場合に特定の関係者が防御するのははるかに困難になり、破壊のエスカレーションははるかに少なくなるからである。これは、協定の安定性を高めるための相互確証による計算資源破壊のための意図的な措置である。
2036+ 高度な堅牢性の向上
プランAの後半では、セキュリティ、検証、協定の安定性の観点から、どのような堅牢性の向上が可能になるかがますます不確実になり、非常に野心的なことが実現する可能性がある。検討案には次のものが含まれる。
ソフトウェアスタックを完全に書き換えて、大幅または完全に正式に検証する。
潜在的な秘密攻撃者を支配する資源を使用した、検証スキームやセキュリティ対策に関する大規模なレッドチームの取り組み。
AIとロボット労働力を使用して、相互に合意された対称的な方法で潜在的な秘密プロジェクトを追跡し、例:秘密プロジェクト補足資料: 信頼できる嘘発見器、プライバシーを保護するAI検証、および極端な産業検証。
付録: パケットベースの検証
この付録では、部分再計算に用いるランダムサンプリングの数理を示し、不正なワークロードの検出についてなぜ有利にスケールするかを説明する。 分析では、ワークロードのパケットが完全に再現可能であると単純化して仮定する。
A.1構築
この分析では、検証をパケットストリームのサンプリング問題として扱う、パケットは、検証者が再計算できる再現可能な計算単位である。パケットの入力、命令、出力はすべて証拠収集ポイント (ネットワークタップなど)で収集される。実際の計算内容 (1つのフォワードパス、1つの学習バッチ)は、以下の計算には影響しない。さらに単純化した仮定は次のとおりである。
均一なサイズ。すべてのパケットは、同じ量の基礎となる計算資源を表する。 定性的な結果を変えない加重サンプリング引数を使用すれば、不均一なパケットも機能する。
独立したランダムサンプリング。検証者は各パケットを同じ確率で独立して監査する。 実際には、置換せずにサンプリングすることになる。
検証者のプールをパケットのコレクションとし、それは、単一の学習実行、特定の月の協定に基づいて実行されているすべてのワークロードからのすべてのパケット、または 1 つのクラスターのトラフィックである可能性がある。するそのプール内のパケットの総数になる。パケットサイズ (各パケットが表すプールの割合)、再計算予算 (検証者が再計算できるプールの割合)、および実際に監査されたパケットの数。
A.2ランダムサンプリングによる検出
このセクションの検出計算は独自に導出されたものだが、次の分析と一致する。Rinberg et al. (2025)攻撃者が交代したと仮定するパケットを作成し、それぞれで宣言された計算を独自の無許可の計算に置き換える。 する
偽のパケットの一部になる。 検証者が各パケットを確率で個別に監査する場合、どれも当てはまらない正確な確率偽物は監査される
小型用そして適度に大きい、これは、捕捉された偽物の数のポアソン分布によってよく近似される。:
したがって、攻撃をキャッチする確率(検出の信頼性攻撃サイズで)は
ポアソン形式はスケーリングの最もきれいな表現であるため、全体を通してポアソン形式を使用する。 こんなときだけ壊れる1に近づくか、は1桁であり、これは、ランダムサンプリングによって何も得られなくなる時期でもある (本書の最後にある議論を参照)。§A.3).
A.3保証曲線
保証曲線は次のように決定される。カバレッジと信頼度これは次のように表すことができる、検出されずに許容される偽パケットの最大部分:
適用範囲 、私たちが主張しているワークロードの一部は正当なものである。
自信 、そのしきい値以上で実際の違反を検出する確率。
信頼度の式は次のとおりである。§A.2:、閾値で評価される再計算のバジェットは次のように表示される。したがって、監査されるパケットが増えると、曲線が外側に押し出される。
いくつかの検証予算(つまり、異なる値)のカバレッジに対する信頼度をプロットする):
これらの曲線は、さまざまな値における信頼性とカバレッジの関係を示している。より高いより高い保証が得られる (曲線を右にシフトする)。 以来、曲線は、(1)再計算の予算を増やすことによって、より高い位置にシフトできる。または (2)パケットサイズを縮小する。
ポアソン近似が崩れるとき。
製品(再計算予算と偽のパケットの数の積)は、99%の捕捉確率を決定する単一の量であり、約4.6を超える必要があるだけである。
これにより、限定的なケースが明らかになる。 サーバー時間ごとに1つのパケットをサンプリングすると想定する。サーバー時間に相当し、攻撃も単一の偽パケットである (1つの不正サーバー時間は、はるかに長い、たとえば1年間のワークロードに埋め込まれる)。 と、ポアソン近似では、次のことが必要になる。意味がない:は小数であり、上限は1 (100%を超えるパケットを再計算することはできない)。
これは、ポアソン近似が崩れる領域であり、正しい式は、置換なしでサンプリングするための正確な式である。
のためにこれは与える単一の偽パケットを99%の信頼度で捕捉するには、すべてのパケットの99%を再計算する必要がある、つまり、実質的にサンプリングを放棄し、完全な検証を行うことになる。周囲のワークロードのサイズは関係ない。
ポアソンの公式はいつでも正確である少なくとも数十個あり、小さい(たとえば10%未満)。 のために、99%の捕獲に必要な正確な予算は4.5%だが、ポアソンの4.6%と非常に近い値である。 のために正確な答えは0.459%だが、ポアソンの0.46%である。 両者の意見はよく一致しており、成長する。 物事は小さな点でのみ分岐する-このコーナーは、まさにランダムサンプリングが役に立たなくなり、すべてを再計算する必要があるコーナーでもある。
つまり、実際的なポイントは、少なくとも数十のパケットにまたがる攻撃を捕捉できれば、ランダムサンプリングによって大きな利益が得られるということである。 それ以下の攻撃をキャッチするには、パケットを縮小する (パケット量を減らす)。)そのため、同じ偽の計算作業がより多くのパケットにまたがる。
A.4実用的な例
A.4.1 100Tトークンの学習実行における100Kトークンのバックドア
の学習実行を検討する。分散データ並列処理を使用したトークン (100T)。 サーバーラック間のネットワークタップは、すべての勾配ステップ (入力バッチ、勾配更新、および結果のチェックポイント更新)をログに記録するため、各勾配ステップは1つのパケットになる。 攻撃者は、サイレントトレーニングによってバックドアを挿入したいと考えている。オフスペックトークン (100K)。
| 数量 | シンボル | 値 |
|---|---|---|
| トレーニングトークン | ||
| 攻撃サイズ (バックドア) | ||
| バッチサイズ | デザインの選択 | |
| パケット数 | ||
| パケットサイズ | ||
| 偽の分数 |
99.9%の検出信頼性を得るには、次のことが必要である。つまり学習実行の一部としての再計算コストは次のようになる。
| バッチサイズ | 再計算コスト | |
|---|---|---|
| 10,000 | 70% | |
| 1,000 | 7% | |
| 100 | 0.7% | |
| 10 | 0.07% |
バッチの作成小さいほど必要な再計算コストが削減される同じ信頼度の場合 (置換なしでサンプリングすることにより、1に近いCの値でこれよりも優れた結果が得られるという事実は無視する)、パケットサイズに関する2つの実際的な手段は、(1)より小さいバッチ (学習実行あたりの勾配ステップが多い)、および (2)バッチ内の中間計算を追跡するサブバッチロギング (個々の前方/後方パスなど)である。これには、サーバーラック内またはGPU自体内に証拠収集デバイスが必要になる場合がある。
A.4.2検証済みR&Dの100B H100eにおける境界不正計算資源の使用
その2034: 検証の改善セクションでは何を検討する不正な内部展開検証者が検証対象の研究開発用計算資源100B H100e全体に対して1%の再計算資源予算しか持たない場合、検出確率は低い。 不正な内部展開は、フロンティアモデルや研究開発クラスターの残りの部分へ内部からアクセスできるため、外部の違法プロジェクトより危険になりうる。 検出できるかどうかは、検証システムが偽造パケットを捕捉できるかにかかっている。 以下の計算では、次の資料の保証曲線を変換する。§A.3具体的な価値観に。
から始まるそして置き換えると, theがキャンセルされ、検出確率は次のようになる。
この形式では、検出確率は再計算予算の関数である。偽パケットの絶対数攻撃者が生成する。
99%の信頼を得るには必要なものなので、攻撃者は蓄積された瞬間に99%の確率で捕らえられる。
偽のパケット。 とこれは、プールサイズやワークロード間での作業の分散方法には関係なく、461パケットになる。 パケットサイズを掛けるこれを累積不正計算資源作業の制限に変換する。
2034年の節で想定する運用を考えると、検証者は各フロンティアGPU(2034年には1基あたり約100 H100e)から1時間に1パケットを収集する。すると、H100e時間、および、
検証者は、ペースや分布に関係なく、検証されたプール内に約46,000 H100e時間を超える未承認の計算資源作業を蓄積する不正な内部デプロイメントを99%の信頼度で捕捉する。 累積的な不正行為の制限は、次のように直線的に増加する。;いくつかの代表的な動作点:
| パケットサイズ | 予算 | 検出されない不正行為の最大数 |
|---|---|---|
| 100H100e時間 | 1% | 46,000 H100e時間 |
| 100H100e時間 | 0.1% | 460,000 H100e時間 |
| 10 H100e-hours | 1% | 4,600 H100e時間 |
| 1 H100e-hour | 1% | 460 H100e-時間 |
変動する経済コストやその他のトレードオフについては、これについて説明する。 ベースラインとして、非常にコストのかかる検証手段が推論とトレーニングの両方で可能であることを90%以上確信している (例: 検証R&D短期集中作業と安全な再構築を伴う複数年にわたる検証済み計算資源のシャットダウン)。
本稿の秘密プロジェクト補足資料秘密プロジェクトが協定に脅威を与えたり、AI競争に勝利したりする可能性がどの程度あるのかについて論じている。
少なくとも一方が、他方に大規模な秘密のデータセンターがあり、そのデータセンターが宣言されておらず、電源がオフであることを確認することを許可していない場合には、これを実行するのは困難になる可能性がある。
現在すぐに実行できるもう1つの現実的な選択肢は、(ほとんどの)バックエンドネットワークをデータセンターから切り離すことである。 これにより、多くの推論を継続できる (コストが少なくなる)可能性があるが、AI開発を大幅に遅らせない可能性もある (推論は、他の場所で実行されるフェデレーテッドラーニングトレーニングで使用されるデータのロールアウトとして使用される)。
私たちがこれを考える主な理由は、検証者は1つの違反を捕捉するだけでよいのに対し、証明者はすべての秘密計算をうまく隠す必要があるからである。 これが、たとえば、ランダムサンプリングによる部分的な再計算の有利なスケーリングの背後にある理由である。付録。
つまり、計算資源を長時間シャットダウンする必要はない。
プランAシナリオどおり、2029年に相互チップ申告と検査が実施され、本稿が推奨するチップ追跡も適切に行われると仮定した場合、本稿の秘密プロジェクト補足資料推定では、周到に実行された中華人民共和国の転用で確保できる計算資源の中央値は世界全体の0.51%(80% CI:0.11%〜1.4%)であり、「ダーク計算資源」の総量が世界のAI関連計算資源の1%未満に収まる確率は約80%となる。
テイクオフ期(自動コーダーから超知能まで)における進歩が計算資源の量にどれほど左右されるかは不確かである。 単純化のため、計算資源が10分の1なら進歩がどれほど遅くなるかで表すと、最も可能性が高いのは2倍から6倍の範囲だと考える(「計算資源が10分の1になると、テイクオフはどれほど遅くなるか?そしてマッチングモデル秘密プロジェクトの補足にある)。 プランAのシナリオで仮想の秘密プロジェクトがたどると予想される具体的な軌跡 (法的なプロジェクトから漏洩するアルゴリズムの進捗の影響を含む)は、以下の文書でより注意深くモデル化され、説明されている。秘密プロジェクト補足資料。
ここで「存在が既知」とは、諜報機関が少なくとも計算資源の存在と保有者を高い確度で把握している状態を指し、正確な所在地まで必須とはしない(把握できれば有用ではある)が、前二者が分かれば、もっともらしい否認を使って将来の相互チップ申告から除外することはできないはずである。
言い換えれば、この手段が講じられていない場合、攻撃者が追求する戦略の1つは、回避できる最大の秘密プロジェクトを構築し、その秘密プロジェクトで勝利できると確信できるほど調整が十分に進むまで待つことである。 この時点で、彼らは協定を撤回し、協定発効後の計算資源を破壊することができ、今や彼らの秘密プロジェクトは世界をリードするプロジェクトとなり、成功する可能性が高くなる。 敵があなたの秘密プロジェクトを支配するコールドストレージ計算資源バンクを持っている場合、この戦略はもはや実行可能ではない。
携帯電話は数百億台あり、AIワークロードに対する1台当たりの有用性はH100の約0.1 - 1%にすぎなく、それでも合計すれば数千万H100相当、すなわち世界のAI関連計算資源の~10%になる。
これは、ローカルAI能力が低い安価な携帯電話が多数存在する一方、ローカルまたは「エッジ」AI計算資源を大量に搭載した携帯電話やその他の消費者向けデバイスは、堅牢なエッジ検証が確立されるまでは最初は非常に高価になることを意味する。
たとえば、ネットワークに関する技術的な詳細 (光速度、帯域幅、周波数など)。
たとえば、権限移譲のリスクが10%未満になったと考えられるため、一定期間内に検証済みの計算資源の1%を使用する違反が致命的となるリスクが10%を超える場合には、権限移譲によって協定を終了したいと考える (つまり、曲線が90%の信頼度、99%のカバレッジポイントを下回っている場合)。
たとえば、エアギャップ内で開示が行われる場合、関連するケースのほとんどで許容できるはずである。
AI研究開発の再開の見通しも、AIへの投資を継続するために重要である。
これについては、次の記事で詳しく説明する。能力拡張戦略の補足ここには、透明性に関する補足で説明したように、どのような透明性体制が整備されているかなど、状況を複雑にするさらに深いニュアンスの層もいくつかある。
AI研究における研究開発効率のスパイラルでは、より賢いAI → より優れた研究 → より賢いAIというフィードバックループが、制御や調整ができないAIにまで引き継がれており、制御や調整への投資の遅れは競争力を失い、企業や国を多極化の罠に閉じ込めてしまう。 調整が検証されることが出口となる。
私たちでは、AI関連の計算資源を、総処理パフォーマンス (TPP)が少なくとも4,000、パフォーマンス密度 (PD = TPP / ダイサイズ)が少なくとも4を達成できるあらゆる計算ユニットと定義している。 この定義は、A100 SXM GPU, 2021年のNVIDIAの最先端チップ。
これらの量はいずれも、作業が個々のワークロードに分割される方法には依存しないことに注意する。 重要なのは、検証者がサンプルを採取するプールである。 100個の異なる学習実行が同時に進行しており、検証者がすべてのパケットにわたって均一にランダムにサンプリングした場合、以下の計算の「ワークロード」は100個すべての和集合になる。 作業例のワークロードごとのフレーム構成は (§A.4.1)は、1つの具体的な攻撃について話すのに便利である。