プランAにおけるセキュリティ
Romeo Dean, Thomas Larsen
セキュリティは、根拠のある意見を持つうえで専門知識と機密情報へのアクセスが特に重要になる分野だ。それでもこの補足資料では、私たちの理解の及ぶかぎりで、プランAに必要なセキュリティの全体像を示し、それが実現可能だと考える理由を説明する。
セキュリティは三つの種類に分けて考えると役に立つ。私たちの見立てでは、以下の順に難しくなる。
-
モデルの重みのセキュリティ: モデルの重みや、その他の大規模なデータセットの持ち出しを防ぐ。
-
重視する指標:持ち出しの帯域幅。つまり、攻撃者が一定の時間でどれだけの量を盗めるか。
-
-
検証の完全性のセキュリティ: 検証措置の結果を信頼できるか。
-
重視する指標:保証水準(検証に関する補足資料で説明した、信頼度とカバレッジの関係を表す曲線)。つまり、検証されていない計算資源の使用量が最大でもX%未満だったと、どれだけ確信できるか(Xは0から100%の間の値)。
-
-
アルゴリズムの機密性: コード、アルゴリズム上の秘密、その他「大規模なデータセット」に当たらないあらゆるものの持ち出しを防ぐ。
-
重視する指標:確信が持てない。アルゴリズムのセキュリティも持ち出しの帯域幅で考えることはできる。しかし、アルゴリズム上の秘密はごく小さいかもしれず、データの大きさと有用性の関係も予測しにくい。したがって、アルゴリズム効率のうち何%が持ち出され、攻撃者に利用可能になるかで考えるのがおそらく最善だろう。
-
この補足資料では全体を通じて、RANDの定義によるOC5の攻撃者を想定する。プランAでは、米国と中国が互いを潜在的な攻撃者として警戒することになるからだ。
プランAのセキュリティの概要
このシナリオでは、モデルの重みについてのSL5セキュリティと、検証の改ざんを検知するためのSL5セキュリティは、極めて大きな努力を払えば実現可能だと仮定している。これは確信度の低い最善の推測であり、実現不可能だと判明する可能性もある。 その場合はプランAを修正する必要がある。その点はこちらで論じている。
プランAで望ましいセキュリティ水準は次のとおりだ。
モデルの重み | アルゴリズム上の秘密 | 検証 | |
推論用データセンター | SL5-100TB-5y (5年間で最大100TBの持ち出しまで) | 該当なし | SL5 (計算資源の規模拡大に合わせて、保証水準を徐々に引き上げる) |
研究開発用データセンター | SL5-100TB-5y | 透明性の体制による。研究の完全な透明性のもとでは、大半は意図的に公開され、SL5で守るのはごく一部。 | SL5 (計算資源の規模拡大に合わせて、保証水準を徐々に引き上げる) |
モデルの重みのセキュリティ
目標:プランAにおけるモデルの重みのセキュリティの目標は、フロンティアモデルの重み(および同程度に大きい重要なデータセット)を、敵対しうる勢力や秘密プロジェクトが持ち出して利用できないようにすることだと考える。
具体的には、5年間で約100TBの持ち出しを防ぐことを目標とすべきだと考える。これを「100TB・5年に対する重みのセキュリティレベル5」、略してSL5-100TB-5yと定義する。容易ではないだろうが、十分に実現可能だと考えている。
次の図は、プランAにおけるフロンティアモデルの規模の見通しを示している(他のデータセットも同程度の規模になると見込む。計算最適なスケーリングでは、データとパラメータが引き続き互いに代替し合う関係にあるはずだからだ)。
プランAでの実装
推論用データセンターは、次のような防御によってモデルの重みについてSL5のセキュリティを備える。
-
データセンターは情報の境界で囲まれている。境界とはデータセンターの壁のことで、信号の出入りを防ぐ銅の箱(ファラデーケージ)も含む。例外は、データセンターに出入りするケーブル1本と、境界を越える必要があるその他のもののための安全な受け渡し室だけだ。
-
出力用のケーブル(外部とやりとりするためには欠かせない)については、そこから出ていく情報が、許可リストに載ったモデルが生成した検証済みのトークンだけになるようにする。詳しくは検証に関する補足資料を参照してほしい。この論文の提案もこれに近い。
-
境界を越える必要があるその他のもの、つまり入ってくる電力、出ていく熱、人の出入りについては、さらにサイドチャネル対策と総帯域幅の上限を設ける。
研究開発用データセンターには、情報がデータセンターの外に出る経路が意図的に二つ設けられている。(1) モデルの重みを推論用データセンターへ物理的に送る経路と、(2) 研究者の利用や問い合わせに使う、完全に透明な出力経路だ。
-
推論用データセンターへのモデルの重みの輸送。 あるモデルの一般公開が承認されると、重みのファイルと承認済みの推論コード(制御用のスキャフォールドなど)一式が、米国と中国の双方によって(順番に)暗号化されたデバイスにダウンロードされる。デバイスは両国の護衛のもとで推論クラスターへ物理的に運ばれる。推論クラスターに着くと、モデルは推論の許可リストに追加され、一般公開時の推論を検証できるようになる。
-
透明な出力経路は、データセンターから出ていく総帯域幅を毎秒1MBに制限する。5年間では157TBがデータセンターから出ていく計算になる。これは、5万人が毎秒約10トークンの速さで出力を読み続けられる量だ(その裏では、出力する必要のない内部の思考の連鎖やスキャフォールドのトークンが数千個生成されているかもしれない)。現在のフロンティアモデルの重みはおよそ1兆パラメータ(1TBに相当)の規模なので、この経路でモデルの重みを持ち出すには、(完全に透明な)出力経路の0.6%を5年間ずっと乗っ取り続ける必要がある(期間を短くするなら、より大きな割合を乗っ取る必要がある)。そうなればまず間違いなく気づかれる。プランAではアルゴリズムの進歩より計算資源のスケーリングが優先されるため、フロンティアモデルの重みは100兆パラメータに近づくと見込まれる。そうなると、重みをすべて持ち出すには、出力帯域幅の60%を5年間占有し続ける必要がある。ここでは圧縮を考慮していないが、圧縮はそれほど大きな要因にはならないはずだ。データセンター内部にも、モデルの重みの持ち出しに対する防御の層がさらにある。特に、モデルの重みは不透明な内部データベースに保管するようにする。
残る脅威モデルはサイドチャネル攻撃(職員が小型のフラッシュドライブを持ち出す、など)だ。これについて妙案があるわけではない。すべてのデータセンターへの立ち入りを厳しく管理し、資金が潤沢で創意に富むセキュリティチームが施設に対して絶えずレッドチーミングを行い、防御を固めていく。プランAのデータセンターが、背景の無線周波数(RF)ノイズの少ない地域に、セキュリティを最優先に据えて一から建設されることも助けになる。
最後に、モデルの重みは、研究開発用データセンター(学習が行われる場所)と推論用データセンターとの間で定期的に輸送する必要もある。この輸送は、複数の物理的な記憶装置にモデルの重みを入れ、輸送の全期間を通じて米中双方の代表者が施錠したうえで絶えず監視する、という形で行えると考えている。
検証の完全性
目標:検証の完全性の目標は、望ましい保証曲線を達成することであるべきだ。保証曲線は、カバレッジ(AIの計算資源のうち、検証の仕組みが何らかの主張を行う対象となる割合)と信頼度(カバーされた資源について検証の仕組みが行う主張が正しい確率)の水準についての情報を表す。保証曲線は、関連する(カバレッジ、信頼度)の値の組の集合として定義する。
たとえば真ん中の曲線では、計算資源の99.9%が正しく使われたと検証されたことについて、99.99%の信頼度がある。もちろん、こうした曲線は理論上のものであり、測定は難しいだろう。それでも概念としては、検証の完全性の目標をこの曲線で考えると役に立つと考えている。
検証の完全性の目標は、検証の完全性が破られること(つまり、内部での不正な計算資源の使用)によって生じるリスクを、外部の不正な計算資源の使用源、すなわち秘密プロジェクトから継続的に生じるリスクと比較して設定すべきだ。そのうえで、内部での不正使用がもたらしうる追加のリスクが、外部での使用に比べて無視できるほど小さくなることを目指すべきだと考える。内部での不正な計算は、不透明な内部情報(フロンティアモデルの重み、データセット、透明性の体制によっては防御されたアルゴリズムやコードの一部)にアクセスできる可能性がある。そのため、同じ量の計算資源を外部の秘密プロジェクトが使う場合よりはるかに危険になりうる。「どれだけ危険か」は、研究開発用データセンターの内部で利用できるアルゴリズム効率と、秘密プロジェクトで利用できるアルゴリズム効率の差を考えれば、よい近似になるだろう。
具体的には、秘密プロジェクトの実効計算量の90パーセンタイル推定値のようなものをとるべきだと考える(フロンティアプロジェクトの現在のソフトウェア水準で換算し、内部での計算資源の使用と比較できるようにする)。そのうえで、内部の計算資源の使用のカバレッジが水準X(たとえば内部の計算資源のX=99.999%)に達していると90%の信頼度で言えるように、検証の完全性の目標を設定する。Xは、内部での不正な計算資源になりうる残り(1-X)が、秘密プロジェクトの実効計算量の10分の1になるように選ぶ。要するにこれは、「内部での不正な配備は、存在しうると考える秘密プロジェクトより10倍小さい秘密プロジェクトとほぼ同等だと、90%の信頼度で言える」と述べるのに近い。
プランAでの実装
研究開発用と推論用の両方のデータセンターで、検証は米中双方から信頼されている必要がある。そうすれば、承認された学習実行、実験、推論処理だけが動いていることを両国が確信できる。私たちの具体的な提案では、推論と研究開発の検証はどちらも、証拠の収集には主にネットワークタップを、検証には信頼された再計算サーバーを用いる。この検証の仕組みへの信頼を持続させるには、これらのデバイスが双方から信頼されている必要がある(あるいは、信頼された光スプリッターと、一方の国だけが信頼するデバイスを使う方法もある)。さらに、これらのデバイスが改ざんや改変を受けていないことを確認する物理的なセキュリティと、デバイス上に構築するソフトウェアスタックへの信頼も必要だ(そのためには、ソフトウェアスタックを極めて単純にし、場合によっては形式検証まで行うべきだろう)。
検証用デバイスそのもの以外にも、検証はクラスター全体のより広いセキュリティ特性に依存する。その特性は、モデルの重みのセキュリティと重なる部分がある。たとえば、攻撃者が内部での不正な計算の結果を密かに持ち出せるようなサイドチャネルが存在しないことだ。
時間がたつにつれて、検証の保証水準は計算資源の規模に合わせて大幅に高めていく必要がある。これについては検証に関する補足資料で詳しく論じている。
アルゴリズムのセキュリティ
目標:これは目指す透明性の体制によって決まる。透明性の体制については透明性に関する補足資料で論じている。
プランA:研究の完全な透明性
大まかに言えば、研究の完全な透明性を採用したプランAのもとでは、AIにおけるアルゴリズム上の秘密はもはや存在しなくなる。ただし、いくつか例外がある。
-
大規模な(合成データの可能性もある)データセットは、モデルの重みと似た性質を持つ(特に、非常に大きい)。そのため、研究開発用データセンターからのアップロード上限によって、外部への出力を制限できる。これで特定のデータの持ち出しを完全に防げるわけではないが、大半のデータの持ち出しは防げるだろう。データの進歩はアルゴリズムの進歩全体の相当部分を占めるので、データを守ることは実現可能であり、かつ重要でもあるかもしれない。
-
計算負荷の高い手順で見つけたハイパーパラメータ。ハイパーパラメータの中には、とりうる値を総当たりで探索し、学習実行に向けて試験するといった高コストの手順によって、効率のよい設定を見つけるものがある。こうした値はデータとしては小さいが、どの人間も知っている必要はない。ハイパーパラメータを選ぶコードは公開してかまわないが、コードを実行して得られた値は誰にも知られないようにできる。値を割り出すには多大な計算コストがかかるからだ。
当初、これは単に「モデルを所有する企業が一般公開を決めたとき」を指す。後にはさらに規制が加わり、それが正式な配備前の承認手続きという形をとるかもしれないし、とらないかもしれない。
重みのファイルをダウンロードする手順は厳重に管理される。米国と中国の監査官がともに安全な囲いの鍵を開けると、中には、不透明な内部データベースにダウンロード要求を送り、ファイルを暗号化できる安全なデバイスがある。クラスター全体の中で、ダウンロードのために物理デバイスを挿入できるUSB(または同様の)ポートを備えているのは、このデバイスだけだ。
1 MB/s × 60 × 60 × 24 × 365.25 × 5 = 157 TB。
これは、パラメータがFP8、つまり1パラメータあたり1バイトだと仮定している。
プランAでは、モデルの重みのサイズを意図的に大きくすることも推奨する。重みのファイルが大きくなるほど持ち出しにくくなるという、セキュリティ上の利点を得るためだ。そうすると、モデルのサイズを計算最適な曲線上に選ばなくなるので、追加の学習計算資源が必要になる。
ごくわずかな計算資源しか必要とせず、そのため検証措置に検知されないかもしれない安価な圧縮では、2〜4倍を超える圧縮はできないはずだ。たとえばハフマン符号化(可逆)や、学習後の安価な量子化手法(GPTQ、AWQ、SmoothQuant、QuIP#、AQLMなど)がそうで、これらは通常、学習計算量の0.0001〜0.01%を使い、品質をほとんど損なわずに重みを2〜4倍に圧縮する。より踏み込んだ圧縮攻撃、たとえばより積極的な量子化やLoRA型の分解(LoRA、QLoRA、VeRA、DoRA、AdaLoRAなど)では、1000倍を超える圧縮が可能かもしれない。その場合、帯域幅の上限そのものより、この圧縮を行うための無許可の計算を検知できることのほうが、セキュリティの要となる。それでも、100TBの重みを1万分の1の10GBに圧縮したとしても、出力経路の0.1%を116日間、検知されずに使い続ける必要がある(1 KB * 60 * 60 * 24 * 116 = 10GB)。そのためには、ステガノグラフィーによって大きな効率の低下を受け入れる必要があるかもしれない。規制当局は常に圧縮のリスクを念頭に置き、レッドチーミングによって圧縮がどこまで実行可能かを見極め、それに応じて学習実行のルールや出力帯域幅の上限を調整できる。