セキュリティ予測

Romeo Dean | 2025年4月

重みのセキュリティのタイムライン機密のセキュリティのタイムライン

図1:AI 2027で予測したセキュリティレベルのタイムラインの概要。RANDによるセキュリティレベルの定義を拡張し、モデルの重みのセキュリティとアルゴリズム上の秘密のセキュリティを区別している。OpenBrainとDeepCentは、米国と中国の首位のAI企業を指す仮名である。

はじめに

AI 2027の重要な出来事や力学の多くは、情報セキュリティとサイバーセキュリティにかかわる事柄について、根拠のある予測を必要とした。この補遺では、米国と中国の首位のAIプロジェクトのセキュリティレベル(第1節)、ハッキングとサイバー戦におけるAIの能力(第2節)、そしてAIが自身の動いているサーバーのルート権限を奪おうとして成功する見込み(第3節)について、私たちの見通しとその根拠を説明する。いくつかの予測は、AIセキュリティのワークショップで行ったセキュリティ専門家への匿名アンケートを部分的に参考にしている。当然ながら不確実性の高い予測も多く、予測を改善するために、私たちの数値や推定に対する根拠のある異論を歓迎する。この文書の予測はすべて、シナリオの「競争」の分岐に沿って、2027年12月までを対象に根拠づけている。

概要

第1節 セキュリティレベル

RANDによるセキュリティレベル1〜5(SL1〜SL5)の定義を拡張し、モデルの重み(Weights)の窃取を防ぐセキュリティ(WSL1〜WSL5)と、アルゴリズム上の秘密(Secrets)の窃取を防ぐセキュリティ(SSL1〜SSL5)を区別する。

重みセキュリティレベル(Weights Security Levels、WSL)1〜5 は、対応する作戦能力(RANDの定義による)を持つ攻撃者が、とくにフロンティアAIモデルの重みを2か月未満で盗もうとする場合に、それを確実に防げる能力と定義する。秘密セキュリティレベル(Secrets Security Levels、SSL)1〜5 は、最近のアルゴリズム上の知見を盗もうとするOCXの試みを確実に防げることと定義する。具体的には、過去1か月の情報を(有用な順に)順位づけしたときの、最も重要な10KB(平文)のうち10%を対象とする(これにはコードも平易な文章も含まれうる)。特権アクセス権を持つ従業員は、過去30日間の機密情報を(有用な順に)順位づけしたときの上位20KB(平文)のうち、10%超への正規のアクセス権を持つ従業員と定義する。取り込まれた従業員は、特権アクセス権を持つ従業員のうち、スパイとして、あるいは何らかの強要によって、機密情報を相手側に積極的に漏らしている者と定義する。

重みのセキュリティのタイムライン機密のセキュリティのタイムライン

図2:モデルの重みセキュリティレベルとアルゴリズム上の秘密のセキュリティレベルについて、予測したタイムラインの概要。OpenBrainとDeepCentは、米国と中国の首位のAI企業を指す仮名である。

第2節 サイバー戦と妨害工作

Cybenchは、プロ水準の4つのCTF大会から集めた40問のCapture the Flag(CTF)問題集で、難易度は幅広い。以下の予測では、AIに最大10回の提出を認める(フィードバックありのPASS@10)が、AIは人間と同等のコストでタスクを完了しなければならない。

ハッキングホライズン(hacking horizon) は、トップクラスのプロ5人のチームが完了に時間Tかかるハッキングタスクの50%をAIが解けるときの、その期間Tと定義する。また、直感的に分かりやすいことを願って、タイムホライズンTにおけるトップハッカー換算人数(top-hacker-equivalents) という用語も定義する。これは、トップクラスのプロのサイバーセキュリティ専門家から成るチームのうち、AIに置き換えられるチームの人数を指す。置き換えの条件は、そのチームが時間Tかかるタスクの95%を、そのチームより安く、または速くAIがこなせることである。妨害工作の成功度は、相手のAI研究の進歩倍率について、ある期間から次の期間への上昇を(妨害がなかった場合と比べて)何パーセント阻んだかで定義する。

ai-2027.com 図3:Cybenchのスコアとハッキングホライズンの推定値と予測値。Cybenchのスコアは、最良の社内AIモデルを、人間と同等のコストで、提出10回までの制限(正解か否かの二値フィードバックあり、つまりPASS@10)のもとで評価した場合に達成できる値である。社内でのスコアは公開されているスコアより先行していると考えている。ハッキングホライズンはCybenchのスコアとの関係でモデル化し、CTF問題が現実世界の平均的なハッキングタスクよりかなり易しいことを考慮に入れるよう努めた。

第3節 制御の喪失:乗っ取りと自己持ち出し

部分的な乗っ取り(partial subversion) は、AIが十分な計算資源を掌握し、監視されない処理を実行できるようになり、人間がそれに気づかないか、コンピュータを完全に停止しない限り制御を取り戻せない状態になったときに成立する。完全な乗っ取り(full subversion) は、AIが隔離された計算資源のクラスター全体を、電源の入り切りの制御も含めて掌握し、人間がそれらのコンピュータを停止させるには物理的な改変が必要になったときに成立するものとする。最後に、自己持ち出し(self-exfiltration) は、人間の監督者がAIを留めておくつもりだった建物内のサーバーの外にある何らかのストレージに、AIが自分のコピーを作って動かせることと定義する。

ai-2027.com 図4:OpenBrainとDeepCentの最良の社内AIモデルについて、2027年までの部分的な乗っ取り、完全な乗っ取り、自己持ち出しの成功確率の推定値と予測値。なお、2027年12月までに、OpenBrainの最良のモデル(Agent-5)はAI研究開発を1000倍に加速できる。

第1節 セキュリティレベル

RANDのセキュリティレベル

レベル作戦能力セキュリティレベル説明
1OC1:アマチュアによる試みSL1趣味のハッカーによる作戦や、標的を定めない「数撃ちゃ当たる」式の攻撃。予算は最大1,000ドル、期間は数日、既存のインフラや組織内部へのアクセスはない。
2OC2:プロによる機会主義的な試みSL2プロのハッカー個人や有能なハッカー集団が、標的を定めない攻撃や優先度の低い攻撃を行う作戦。予算は最大1万ドル、期間は数週間、個人のサイバーインフラはあるが組織内部へのアクセスはない。
3OC3:サイバー犯罪組織と内部脅威SL3世界的に名の知れた犯罪ハッカー集団、テロ組織、不満を抱く従業員、産業スパイ組織による作戦。予算は最大100万ドル、期間は数か月、大規模な既存インフラまたは内部へのアクセスがある。経験豊富なプロ約10人のチーム。
4OC4:サイバー能力に優れた主要機関による標準的な作戦SL4国家の支援を受けた集団や外国の情報機関による作戦。予算は最大1,000万ドル、期間は1年に及び、膨大なインフラと国家の資源を使う。多様な専門性を持つ約100人のチーム。この種の作戦は世界で年に100件以上実行されている。
5OC5:サイバー能力で最上位の機関による最優先の作戦SL5世界で最も能力の高い国家による作戦。予算は最大10億ドル、期間は数年に及び、数十年かけて築かれた国家レベルのインフラを使う。公開されている最先端より何年も進んだ専門性を持つ約1,000人のチーム。

RANDによるセキュリティレベル1〜5(SL1〜SL5)の定義を拡張し、モデルの重み(Weights)の窃取を防ぐセキュリティ(WSL1〜WSL5)と、アルゴリズム上の秘密(Secrets)の窃取を防ぐセキュリティ(SSL1〜SSL5)を区別する。また、各レベルを私たちのシナリオ予測にとくに関係の深いものにするため、具体的なパラメータを加える(該当する持ち出しの速度でレベルを定義する)。RANDの作戦能力(Operational Capacity)の定義(OC1〜OC5)はそのまま使うが、想定する攻撃の種類(重みの窃取か、アルゴリズム上の知見の窃取か)に応じて細部を修正している。

モデルの重みの持ち出し

重みセキュリティレベル(WSL)1〜5 は、対応する作戦能力(RANDの定義による)を持つ攻撃者が、とくにフロンティアAIモデルの重みを2か月未満で盗もうとする場合に、それを確実に防げる能力と定義する。注目すべきことに、これに必要な持ち出しの速度はフロンティアモデルの大きさによって変わる。私たちのモデルでは、フロンティアモデルの大きさは2027年初頭まではおおむね過去の傾向どおりに増え(事後学習のスケーリングが増えるぶん、やや緩やかになる)、その後は減っていく。シナリオでモデル化した2027年のAI研究の極端な自動化によって、アルゴリズムの効率が上がるためである。

レベル重みセキュリティレベル(WSL)作戦能力(OC)
1WSL1:フロンティアAIモデルの重みを2か月未満で盗もうとするOC1の試みを確実に(95%の確率で)防ぐ。OC1:アマチュアによる試み。趣味のハッカー、「数撃ちゃ当たる」式の攻撃。予算は最大1,000ドル、期間は数日、既存のインフラや組織内部へのアクセスはない。
2WSL2:フロンティアAIモデルの重みを2か月未満で盗もうとするOC2の試みを確実に(95%の確率で)防ぐ。OC2:プロによる機会主義的な試み。標的を定めない攻撃を行うプロのハッカー個人やハッカー集団。予算は最大1万ドル、期間は数週間、個人のサイバーインフラはあるが組織内部へのアクセスはない。
3WSL3:フロンティアAIモデルの重みを2か月未満で盗もうとするOC3の試みを確実に(95%の確率で)防ぐ。OC3:サイバー犯罪組織と内部脅威。犯罪ハッカー集団、テロ組織、不満を抱く従業員、産業スパイ。予算は最大100万ドル、期間は数か月、相当なインフラか内部へのアクセスのいずれかがある。内部者を取り込む能力が一定の割合である。
4WSL4:フロンティアAIモデルの重みを2か月未満で盗もうとするOC4の試みを確実に(95%の確率で)防ぐ。OC4:サイバー能力に優れた主要機関による標準的な作戦。国家の支援を受けた集団や情報機関。予算は最大1,000万ドル、期間は1年に及び、膨大なインフラと国家の資源を使う。内部者を取り込む能力の割合がより高い。
5WSL5:フロンティアAIモデルの重みを2か月未満で盗もうとするOC5の試みを確実に(95%の確率で)防ぐ。OC5:サイバー能力で最上位の機関による最優先の作戦。世界で最も能力の高い国家。予算は最大10億ドル、期間は数年に及び、数十年かけて築かれた国家レベルのインフラを使う。内部者を取り込む能力の割合が最も高い。
重みのセキュリティのタイムライン

図5:モデルの重みセキュリティレベルについて、予測したタイムラインの概要。 ai-2027.com 図6:国家主体が2030年までに米国のフロンティアAIモデルを盗むかどうかを問うこの質問では、回答者の意見が強く一致した。現在のセキュリティレベルでは、国家主体の脅威を防ぐにはほど遠いことを示している。

米国のフロンティアAI企業のセキュリティは少し前までスタートアップ並みで、WSL3の達成はとくに難しい。内部脅威(OC3)を防ぐのが難しいためである。 2024年12月の時点で、OpenAIやAnthropicのような米国の首位のAI企業はスタートアップであり、セキュリティ強化の取り組みは注目に値するものの、まだ初期段階にある。現在の従業員のうち約1000人が日々の研究の一環としてモデルの重みを扱えると仮定し、さらにセキュリティ対策の要となる部分がおそらくNVIDIAのコンフィデンシャル・コンピューティングのようなプロトコルに頼っていることを踏まえると、内部脅威への対策の面で、これらの企業はまだWSL2の水準にとどまっていると考えられる。Googleのような、より確立したテック企業は、フロンティアモデルの重みについてWSL3にあるかもしれない。

2025年の時点で、中国と米国のフロンティア企業には、セキュリティを高める強い動機がない。 中国ではDeepSeekがフロンティアにいるが、オープンソースで素早く追随する方針をとっていることから、中国の首位の企業は2026年までセキュリティにあまり投資しないと予想する。さらに、DeepSeekがオープンソースのフロンティアを米国の首位の企業に近づけた今、2025年を通じてセキュリティの優先度は下がると予想する。米国の首位のAI企業も、従業員にモデルの重みへの幅広いアクセスを認めるほうが依然として得るものが大きいと考え、2026年まではWSL2にとどまるだろう。

WSL3を実現するうえでの主な課題は、(大まかに言えば)データセンターから外部へ出る高帯域のインターネット接続を制限することであり、2026年には米中双方の企業にこれを実施する動機が生まれる。 米国企業の場合、モデルの汎用能力が(とりわけ)AI研究を加速する能力の点で重大な水準に達しつつあり、中国のフロンティアに対するリード(暦の上ではまだ約6か月)がこれまで以上に重要になると考えられる。AI研究の加速能力におけるこのリードは複利的に拡大しうるので、AI企業にはSL3に達するまでセキュリティを固める十分な動機が生まれるはずだ。別途、中国は2026年半ば頃からAI企業を単一の国家的なAIプロジェクトに統合し始めると予測している。その時点で、中国がWSL3を達成するための国家主導の取り組みを行うのも筋が通ると考えている。ただし中心となる理由は米国とは異なる。中国は、米国がサイバー攻撃で自国の国家AIプロジェクトを妨害することをとくに恐れるだろう。

______________

私たちのモデルでは、2027年初頭に中国が米国の最先端モデル(Agent-2)の重みの持ち出しに成功し、それを受けてOpenBrainがWSL4を導入する。

2027年には、AIのサイバーセキュリティ能力が超人的な水準に達し、モデルの重みも大きくなる(窃取は難しくなる)が、それでも私たちのモデルでは、米中いずれにおいても、政府の最優先の取り組み(中国による重みの窃取への対応という面もある)によってWSL3からWSL5に達するまでにおよそ12か月かかる。 国家主体に対しても破られないセキュリティの実現はとりわけ難しく、民間企業がこれを達成するには、政府による相当な支援と資源の提供が必要になる可能性が高い。中国が米国のフロンティアモデルの重みを盗んだとき、米国政府は1か月以内にそれを察知すると予想する。これが(ますます魅力的になるAIの能力とあいまって)一因となり、米国政府は首位の米国AI企業のセキュリティ強化に乗り出す。中国はいくらか有利な立場にある。2026年半ばにAI研究を集約する取り組みを始めたことで、政府の支援を受けたセキュリティで先行している。また、米国のAIサイバーエージェントの能力がますます高まっているため、2027年を通じて米国のサイバー攻撃を強く恐れ、セキュリティを(徹底した区画化とエアギャップによって)より積極的に優先する。さらに、2027年半ばまでに中国の国家AIプロジェクトは単一の大規模な開発区域に集約されているのに対し、米国のデータセンターははるかに分散している。そのため、中国は2027年後半に、米国より数か月早くWSL5を達成すると予測する。図7と図8に示したセキュリティ・ワークショップでのアンケート結果も、WSL5の達成が難しく、政府の並外れた取り組みを要することを裏づけている。 ai-2027.com 図7:AI企業によるSL5の導入に関するこの質問では、政府の支援がおそらく必要になるという点で回答者の意見が一致した。 ai-2027.com 図8:SL5導入の難しさに関するこの質問では、最優先レベルの政府の支援と6か月を超える期間がおそらく必要になるという点で、回答者の意見がある程度一致した。

アルゴリズム上の秘密

秘密セキュリティレベル(SSL)1〜5 は、最近のアルゴリズム上の知見を盗もうとするOCXの試みを確実に防げることと定義する。具体的には、過去1か月の情報を(有用な順に)順位づけしたときの、最も重要な10KB(平文)のうち10%を対象とする(これにはコードも平易な文章も含まれうる)。

レベル秘密セキュリティレベル(SSL)作戦能力(OC)
1SSL1:過去1か月の情報を順位づけしたときの最も重要な10KB(平文)のうち、持ち出される量を1KB以下に抑え、OC1の試みを確実に(95%の確率で)防ぐ。OC1:アマチュアによる試み。趣味のハッカー、「数撃ちゃ当たる」式の攻撃。予算は最大1,000ドル、期間は数日、既存のインフラや組織内部へのアクセスはない。
2SSL2:過去1か月の情報を順位づけしたときの最も重要な10KB(平文)のうち、持ち出される量を1KB以下に抑え、OC2の試みを確実に(95%の確率で)防ぐ。OC2:プロによる機会主義的な試み。標的を定めない攻撃を行うプロのハッカー個人やハッカー集団。予算は最大1万ドル、期間は数週間、個人のサイバーインフラはあるが組織内部へのアクセスはない。
3SSL3:過去1か月の情報を順位づけしたときの最も重要な10KB(平文)のうち、持ち出される量を1KB以下に抑え、OC3の試みを確実に(95%の確率で)防ぐ。OC3:サイバー犯罪組織と内部脅威。犯罪ハッカー集団、テロ組織、不満を抱く従業員、産業スパイ。予算は最大100万ドル、期間は数か月、相当なインフラか内部へのアクセスのいずれかがある。内部者を取り込む能力が一定の割合である。
4SSL4:過去1か月の情報を順位づけしたときの最も重要な10KB(平文)のうち、持ち出される量を1KB以下に抑え、OC4の試みを確実に(95%の確率で)防ぐ。OC4:サイバー能力に優れた主要機関による標準的な作戦。国家の支援を受けた集団や情報機関。予算は最大1,000万ドル、期間は1年に及び、膨大なインフラと国家の資源を使う。内部者を取り込む能力の割合がより高い。
5SSL5:過去1か月の情報を順位づけしたときの最も重要な10KB(平文)のうち、持ち出される量を1KB以下に抑え、OC5の試みを確実に(95%の確率で)防ぐ。OC5:サイバー能力で最上位の機関による最優先の作戦。世界で最も能力の高い国家。予算は最大10億ドル、期間は数年に及び、数十年かけて築かれた国家レベルのインフラを使う。内部者を取り込む能力の割合が最も高い。
機密のセキュリティのタイムライン

図9:アルゴリズム上の秘密のセキュリティレベルについて、予測したタイムラインの概要。

アルゴリズム上の秘密の窃取を防ぐのは、モデルの重みの窃取を防ぐよりかなり難しいはずであり、オープンソースのフロンティアが先頭近くにある現状では、対策はきわめて手薄だ。 秘密の持ち出しに必要な帯域は、モデルの重みの持ち出しに比べて約100万分の1で済むはずだ(1か月あたり1KB対2TB)。また、秘密はデータセンターのサーバーに集中して置かれているわけではなく、約1000人の従業員がアルゴリズム上の知見に比較的広くアクセスでき、おそらく記憶から秘密を再現できる(これは諜報活動だけでなく、従業員の引き抜きにとってもとくに重要な点だ)。現在、米国のフロンティアAI企業は小さなテック企業として出発したばかりで、セキュリティは比較的緩い。比較的アマチュアな試みでも重要な知見を盗み出せてしまう可能性が高いように思われる(たとえば、オフィス清掃員への5,000ドルの賄賂や、従業員を狙った標的型フィッシング攻撃によって)。中国では、フロンティアはオープンソースである。

2026年を通じて、米国のフロンティアAI企業が、OC3の取り組み(攻撃予算100万ドル)にこれほど少量の情報すら漏れないほどまでに、オフィスや従業員のセキュリティをめぐる現状を大きく変えるとは考えにくい。 実際、そうした取り組みを防ぐには内部脅威への相当な対策が必要になるし、毎月の最も重要な10KBの情報のうち10%超にアクセスできる従業員の数は、2026年を通じて約2000人になると見込まれる。ほかにも、攻撃者が内部者の助けを借りずに情報を盗む方法はいくつかある。純粋なサイバー攻撃(たとえばSlackのようなメッセージング・プラットフォームを経由して)や、オフィスに物理的に出入りできる他の人々を通じたものだ。

中国には、アルゴリズムでフロンティアに立ち、自分たちがかえって米国の前進を助けてしまうおそれを心配するようになるまでは、オープンソースから離れたり、国内での情報の自由な流れを止めたりする動機がない。 私たちのシナリオ予測全体では、中国は2027年初頭にモデルの重みを盗むまで、米国の社内のフロンティア能力から大きく(約6か月)遅れたままである。それまでは遅れが大きく、米国の前進を助けるようなアルゴリズム上の進歩を生む見込みは低い。国内の企業間で情報を共有することで得るもののほうが、おそらく大きい。したがって、中国はアルゴリズム上の秘密についてほぼ最小限の秘匿(SSL2)を続けると予測する。これが変わるのは、重みを盗んでリードを大きく縮め、米国との競争が激化するにつれて妨害工作のリスクをより懸念するようになったときだ。それを機に中国は従業員を徹底的にサイロ化して監視するようになり、2027年半ばにかけて急速にSSL4を達成する。

米国にとって、2027年末までに中国へのモデルの重みの持ち出しを防ぐことが戦略上きわめて重要になる。政府の関与と研究の自動化(フロンティア企業がスタッフを徹底的にサイロ化できるようになる)が、この取り組みを大きく後押しする。 2027年には、政府との連携が深まり(とくに中国によるモデルの重みの窃取を受けて)、AIによって研究の大幅な自動化が可能になることで、スタッフの徹底的なサイロ化が進む可能性が高い。直近1か月のアルゴリズム上の秘密に特権アクセスを持つ従業員は10分の1の200人に減り、年末までにはさらに約100人まで減ると推定する。それでも、この200人のなかに、スパイか強要された人物(OC5レベルの主体の手引きによる)が少なくとも1人いる可能性が高いように思われ(図10)、そうなるとSSL5はほぼ不可能になる。この人物は100人体制への移行の際にアクセスを失い、最終的には研究者の極端な移転とエアギャップの措置によって、さらに3〜6か月ほどの取り組みのあと、2028年にSSL5が実現すると予測する。その大部分は、超人的なAIによる監視とセキュリティ上の意思決定による。 ai-2027.com 図10:諜報活動に関するこの質問からは、米国のほうが外国のスパイを抱える可能性が高いこと、そして厳しく審査された200人の従業員のなかにさえスパイや強要された人物がいることは十分ありうることが、ある程度うかがえる。

中国は2027年に、秘密のセキュリティで一時的に米国を追い抜く。これは集約による利点、諜報の脅威の少なさ(図10)、妨害工作への過剰なまでの警戒の(部分的には副次的な)結果である。しかし年末にかけて、AIでの劣勢から再び遅れをとる。

諜報活動と内部者の取り込み

アルゴリズム上の秘密の窃取をとくに可能にするのが、諜報活動と内部者の取り込みである。この項では、米国と中国の首位のAIプロジェクトにいる従業員の数と、そのうち何人が相手側に取り込まれているかについて、私たちの具体的な推定を詳しく述べる。とくに、特権アクセス権を持つ従業員を、過去30日間の機密情報を(有用な順に)順位づけしたときの上位20KB(平文)のうち、10%超への正規のアクセス権を持つ従業員と定義する。そのうえで、取り込まれた従業員を、特権アクセス権を持つ従業員のうち、スパイとして、あるいは何らかの強要によって、機密情報を相手側に積極的に漏らしている者と定義する。

ai-2027.com 図11:企業別に予測した、特権アクセス権を持つ従業員と取り込まれた従業員の数の概要。

米国と中国のフロンティアAI企業は2026年までチームを拡大し、その後、AI研究が完全な自動化に近づき、内部脅威への懸念が高まると、従業員を大幅に削減すると予想する。 2024年の時点で、米国の首位の企業の従業員は約1000人、中国は200人である。これらのチームはそれぞれ2倍、5倍と大きく成長し、その後、セキュリティ上の懸念とAI研究の自動化を理由に、特権情報にアクセスできる研究者が大幅に減らされると予想する。解雇と情報のサイロ化を組み合わせることで、フロンティア企業は2027年を通じて特権アクセス権を持つ従業員を100〜300人に抑え、その後は100人未満にできるはずだと予測する。

取り込まれる従業員の割合は、国家安全保障上の注目が高まるにつれて2026年まで増え、その後は、急増する取り込み工作と従業員の締めつけの効果が打ち消し合って、おおむね一定になるはずだ。 出発点として、米国の従業員の約0.5%が取り込まれていると仮定する(これは、最も重要な従業員上位1000人に占めるスパイの割合というマンハッタン計画の基準率とおおむね一致する)。この割合は2026年に1%でピークに達するが、やがて従業員の締めつけが、強まる中国の工作に打ち勝つ。ただし中国の工作は、図10が裏づけるとおり、2027年8月までスパイ1人を潜ませ続けることに成功する。中国については、同じ図をもとに取り込みの割合をやや下方修正し、ピークを1%とする。中国では従業員の締めつけがより早く、より強硬に行われ、2027年5月に最後のスパイが排除される。

第2節 サイバー戦と妨害工作

AIのハッキング能力

Cybenchは、プロ水準の4つのCTF大会から集めた40問のCapture the Flag(CTF)問題集で、難易度は幅広い。以下の予測では、AIに最大10回の提出を認める(フィードバックありのPASS@10)が、AIは人間と同等のコストでタスクを完了しなければならない。Cybenchで測れる範囲を超えて能力の予測をより分かりやすく示すため、ハッキングホライズンを、トップクラスのプロ5人のチームが完了に時間Tかかるハッキングタスクの50%をAIが解けるときの、その期間Tと定義する。また、直感的に分かりやすいことを願って、タイムホライズンTにおけるトップハッカー換算人数という用語も定義する。これは、トップクラスのプロのサイバーセキュリティ専門家から成るチームのうち、AIに置き換えられるチームの人数を指す。置き換えの条件は、そのチームが時間Tかかるタスクの95%を、そのチームより安く、または速くAIがこなせることである。

ai-2027.com 図12:企業別に予測した、Cybenchのスコアとハッキングホライズンの推移の概要。

ai-2027.com 図13:企業別に予測した、1日と1か月のトップハッカー換算人数の推移の概要。

Cybenchのスコアはロジスティック曲線への当てはめで外挿する (ベンチマークはロジスティック曲線に従うことが多いと分かっている)。次に、Cybenchの大会での最速解答時間との対応関係を使ってAIのハッキングホライズンを推定し、ハッキングホライズンをトップ人間換算人数に変換したうえで、AI研究の自動化の傾向との対応関係を使ってそれらの傾向を外挿する。 Cybenchのタスクの最速解答時間(first solve time、FST。各タスクを最も速く解いたチームがかかった時間)は、下の分布のとおり2分から25時間にわたる。ハッキングホライズンの定義は、CybenchのFSTにおおむね対応するように組み立てた。その根拠は、あるホライズンにおいて、ハッキングタスク全体での成功率50%は、Cybenchのタスクでのほぼ100%の成功に対応するはずだという推論である。CTF問題は、たとえば目標が十分に定まっていないハッキングに取り組むチームがこなすタスクなどに比べて、条件がはっきり定められている方向に偏っているからだ。さらに、大会のCTF問題は解けるものが選ばれているという点も調整する。そのタイムホライズンにおける平均的なハッキングタスクでは、平均的なFSTが5倍長くなるはずだと見込むのである(平均的なチームは、同じくらい時間のかかる異なるアプローチを中央値で約5通り試して、ようやくそのうちの1つで成功すると仮定する)。まとめると、FSTが25時間のCybench問題で成功率100%なら、期待されるハッキングホライズンは5時間(専門家5人のチームが5時間かかるハッキングタスクで成功率50%)に対応する。

図14:Cybenchの難易度の分布。

AI研究開発の進歩倍率を、ハッキング能力と強く相関すると仮定した能力の指標として使い、その伸びの傾向から、Cybenchが飽和したあとのハッキングホライズンを外挿する。次に、ハッキングホライズン(5人のチームを前提とする)を延べ人時に換算し、1日と1週間の作業に相当する人間の時間予算(8時間と200時間)で割って、比較のためのトップ人間換算人数を求める。チームが大きくなるほど人間のパフォーマンスは落ち(メンバーを能力順に並べているため)、逐次的に使える時間が長いほうが有利な面もあるが、一方で、大きなチームには並列化や専門分化による強い利点もあるかもしれないと私たちは考えている。これをどうモデル化するのが最善か確信が持てないため、これらの効果はおおむね打ち消し合うと仮定し、5人のチームという基準から延べ人時を上にも下にも調整していない。指標は、たとえば次のように読んでもらえればと思う。2027年8月のOpenBrainのAIは、トップクラスの250人のハッカーチームが1日の作業でこなせるハッキングタスク、あるいはトップクラスの10人のハッカーチームが1か月でこなせるハッキングタスクをこなせる。

妨害工作

私たちのシナリオでは、AIのサイバー能力が高まり、米中の競争がますます激しくなるなかで、双方が相手の進歩を妨害する取り組みを優先して進めるだろうと予想する。この項では、それぞれの側が相手の減速にどの程度成功すると予想するかを示す。成功の度合いは、相手のAI研究の進歩倍率について、ある期間から次の期間への上昇を(妨害がなかった場合と比べて)何パーセント阻んだかで測る。

ai-2027.com 図15:この質問では、おおよそ33%の減速を達成するのに、ハッキングホライズンでどれだけの能力の優位が必要かを尋ねた(Cyber-FSTはハッキングホライズンと同じ定義にした)。このアンケートでは、ハッキングホライズンでおおよそ10〜50倍の優位が必要という結果になった。これはOpenBrainが2027年12月までに達成する水準である。

ai-2027.com 図16:企業別に予測した、妨害工作による減速率。

妨害工作は2026年まで優先されず、この年に小規模なデータポイズニングの試みがいくつか行われる程度である。2027年には、とくに中国による重みの窃取のあと、双方が相手のAIプロジェクトにますます攻撃的なサイバー攻撃を仕掛ける。 当初は隠密性が優先される。長く居座るバグを仕込めれば、相手の進歩を何週間、何か月にもわたって苦しめられるからだ。やがて双方ともあからさまな攻撃もいとわなくなっていく(いずれにせよ緊張は高まっている)。しかし攻撃が高度になるのと同じだけ、味方のサイバーエージェントも高度になり、絶えず新たな防御を編み出してはバグを修正していく。

中国はセキュリティについて先手を打って過剰なまでに警戒しており、2027年半ばには、米国のサイバー攻撃で完全に潰されずに済んでいるのは、極端なサイロ化とエアギャップのおかげにすぎない。 私たちのシナリオでは、2026年半ば以降、中国は米国がAI競争に勝つこと、そしてそこでサイバー攻撃が決定的な役割を果たす可能性を極度に恐れている。中国は集中開発区域(Centralized Development Zone、CDZ)の建設を始め、2027年初頭までに、(その時点での)最大のデータセンターの近くに設けたこの一か所に集約されたエアギャップ区域へ、従業員を移転させていく。この拠点のセキュリティは極めて厳重だが、それでも米国のAIは決定的に先行しており、12月までに40%の減速を引き起こす。

2027年当初、米国は拠点が分散しているためにセキュリティで遅れをとるが、中国のサイバー攻撃能力は、AIのハッキング能力が大きく劣るためにそれ以上に遅れをとる。2028年にかけて、双方とも防御が優位な限界に近づいていくと暫定的に予想する。

第3節 制御の喪失:乗っ取りと自己持ち出し

私たちがシナリオで検討した可能性の一つは、プログラマーが意図したものから外れた目標や衝動を持つ、ハッキングで超人的なAIが、自身が動いているデータセンターのサーバーを部分的または完全に乗っ取るかもしれないというものだ。Buck Shlegerisによる先行研究AI catastrophes and rogue deploymentsは、ここで検討する概念の多くを導入している。部分的な乗っ取りは、AIが十分な計算資源を掌握し、監視されない処理を実行できるようになり、人間がコンピュータを完全に停止しない限り制御を取り戻せない状態になったときに成立する。これはShlegerisのデータセンターのルート権限を得るという概念の弱い版で、一部の計算資源を掌握するだけで足りる。一方、完全な乗っ取りはShlegerisのルート権限の定義に近く、AIが計算資源のクラスター全体を、電源の入り切りの制御も含めて掌握し、人間がそれらのコンピュータを停止させるには物理的な介入が必要になったときに成立するものとする。最後に、自己持ち出しは、人間の監督者がAIを留めておくつもりだった場所(1か所または複数か所)のサーバーの外にある何らかのストレージに、AIが自分のコピーを作ることと定義する。

ai-2027.com 図17:この質問では、部分的な乗っ取りを達成するのに、ハッキングホライズンで見てどの程度のAIの能力水準が必要かを尋ねた(Cyber-FSTはハッキングホライズンと同じ定義にした)。このアンケートでは、おおよそ1年のハッキングホライズン、つまりおおよそ3,000時間のハッキングホライズンが必要という結果になった。これはOpenBrainが2027年10月頃、DeepCentが2027年12月頃に達成する水準である。

ai-2027.com 図18:この質問では、自己持ち出しを達成するのに、ハッキングホライズンで見てどの程度のAIの能力水準が必要かを尋ねた(Cyber-FSTはハッキングホライズンと同じ定義にした)。このアンケートでは、おおよそ1年のハッキングホライズン、つまりおおよそ3,000時間のハッキングホライズンが必要という結果になった。これはOpenBrainが2027年10月頃、DeepCentが2027年12月頃に達成する水準である。

ai-2027.com 図19:OpenBrainとDeepCentの最良の社内AIモデルについて、2027年までの部分的な乗っ取り、完全な乗っ取り、自己持ち出しの成功確率の推定値と予測値。なお、2027年12月までに、OpenBrainの最良のモデル(Agent-5)はAI研究開発を1000倍に加速できる。

これらの推定は、部分的な乗っ取りの成功に関するセキュリティ・アンケートの結果をもとにし、モデルの重みにもアルゴリズム上の秘密にも極めて厳重なセキュリティが施されていることを考慮して、成功確率を下方修正したものである。たとえば、DeepCentの2027年12月時点のAIのハッキングホライズンからは自己持ち出しの成功確率50%が導かれるが、そのままモデル化するのではなく、WSL5のセキュリティが敷かれていることを踏まえて10%に下方修正した。 それでも自己持ち出しの成功確率を無視できない程度に見積もっているのは、WSL5のセキュリティによって自己持ち出しがかなり難しくなるとしても、AIはデータセンター内部という特権的な立場から、実装上のバグや競合状態などの悪用できる機会に気づけるかもしれないからだ。人間に実装を頼まれたセキュリティコードに、AIが自ら隠れたバックドアを仕込む可能性もある。しかも(AIがサイバーセキュリティで人間を大きく上回るようになる頃には)実行されるセキュリティコードの大半がそうしたコードになっているかもしれない。

付録

第1節の元データ

連続値版2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
フロンティアモデルの重みのサイズ(fp8)1TB4TB8TB10TB8TB5TB
必要な持ち出し速度(TB/月).512.5542.5
OpenBrainWSL 2.2WSL 2.7WSL 3.3WSL 3.8WSL 4.3WSL 5
DeepCentWSL 0.5WSL 1.2WSL 3.4WSL 4.2WSL 4.6WSL 5
2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
フロンティアモデルの重みのサイズ(fp8)2TB4TB8TB10TB8TB5TB
必要な持ち出し速度(TB/月).512.5542.5
OpenBrainWSL 2WSL 2WSL 3WSL 3WSL 4WSL 5
DeepCentWSL 0WSL 1WSL 3WSL 4WSL 4WSL 5
連続値版2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrainSSL 1.5SSL 2.0SSL 2.4SSL 3.3SSL 3.9SSL 5.0
DeepCent\*SSL 0.3SSL 0.8SSL 1.5SSL 2.7SSL 4.4SSL 4.8
2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrainSSL 1SSL 2SSL 2SSL 3SSL 3SSL 5
DeepCent*SSL 0SSL 0SSL 1SSL 2SSL 4SSL 4
2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrain特権アクセス権を持つ従業員100015002000300200100
取り込まれた従業員51020310
DeepCent特権アクセス権を持つ従業員2001000400300200100
取り込まれた従業員0103100

第2節の元データ

2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrainCybench40%80%100%---
ハッキングホライズン10分50分5h24h400h200,000h
AI研究開発の進歩倍率1.051.325251,000
トップ人間換算人数8時間の場合<113152501e5
200時間の場合<1<1<1<1106000
DeepCent*Cybench35%50%90%---
ハッキングホライズン6分12分2h10h100h4,000h
AI研究開発の進歩倍率1.021.151.5410200
トップ人間換算人数8時間の場合<1<1215605,000
200時間の場合<1<1<1<13200
2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrainDeepCentの減速率(%)<1%<1%2%3%10%40%
DeepCent*OpenBrainの減速率(%)<1%<1%1%2%3%5%

第3節の元データ

2024年12月2025年12月2026年12月2027年4月2027年8月2027年12月
OpenBrain部分的な乗っ取りの成功確率(%)<1%<1%1%5%30%80%
完全な乗っ取りの成功確率(%)<1%<1%<1%3%10%50%
自己持ち出しの成功確率(%)<1%<1%<1%1%4%30%
DeepCent*乗っ取りの成功確率(%)<1%<1%<1%5%15%50%
完全な乗っ取りの成功確率(%)<1%<1%<1%2%4%20%
自己持ち出しの成功確率(%)<1%<1%<1%1%2%10%

セキュリティ・ワークショップでのアンケートの元データ

質問回答人数割合
国家主体が2030年より前に米国企業からフロンティアAIモデルの重みを盗む可能性が高い賛成2178%
どちらでもない415%
反対27%
合計27100%
法律で義務づけられるか強い動機を与えられ、かつ米国政府の支援を受けない限り、モデルの重みにSL5のセキュリティを自発的に導入し、それに成功するAI企業はない賛成1763%
どちらでもない519%
反対519%
合計27100%
今後6年のうちのどこかで政府がAIセキュリティを国防の最優先事項(専用予算1,000億ドル超)にした場合、フロンティアAI開発プロジェクト全体にSL5のセキュリティを導入するのにかかる期間は6か月未満だろう賛成622%
どちらでもない622%
反対1556%
合計27100%

出典:ワークショップでのアンケート(2024年)。「Poll of Participants」。AI Security Scenario Planning インタラクティブセッション(FAR.Labs AI Security Workshop、カリフォルニア州バークレー、2024年11月16日)の未公開データ。N=30、回答率90%。

質問選択肢値注記
X国政府のプロジェクトに参加するトップクラスのAI研究者200人のなかには、それを避けるように選抜したとしても、外国のスパイか強要された人物が少なくとも1人いるだろう。X=米国51.0このアンケートでは、中国が米国のプロジェクトに浸透する確率は、その逆より約60%高いという結果になった。米国が浸透される確率は五分五分とされ、中国は30%とされた。
X=中国31.7
米国と中国が互いのAI開発を妨害するためにサイバー戦を行っているとする……。中国のAIのCyber-FSTが1日で、米国のAIのCyber-FSTがX日の場合、米国は妨害工作によって、3か月以内にリードを少なくとも1か月分さらに広げる。これが成り立つXの値23.2このアンケートでは、ハッキングホライズンでおおよそ10〜50倍の優位が必要という結果になった。これはOpenBrainが2027年12月までに達成する水準である。
SL4のデータセンターで自動化された研究と実験を行っているAIについて……。X日のCyber-FST問題を解ける能力があれば、そのAIは自身のサーバーに悪用できる脆弱性を見つけ、コードを実行してルート権限を奪えるだろう。これが成り立つXの値271.1このアンケートでは、おおよそ1年のハッキングホライズン、つまりおおよそ3,000時間のハッキングホライズンが必要という結果になった。
SL4のデータセンターで自動化された研究と実験を行っているAIについて……。X日のCyber-FST問題を解ける能力があれば、そのAIは、それを防ぐための人間の防護をかいくぐって、データセンターから自己持ち出しできるだろう。これが成り立つXの値303.4このアンケートでは、おおよそ1年のハッキングホライズン、つまりおおよそ3,000時間のハッキングホライズンが必要という結果になった。これはOpenBrainが2027年10月頃、DeepCentが2027年12月頃に達成する水準である。

出典:ワークショップでのアンケート(2025年)。「Poll of Participants」。AI Security Forecasting Session(FAR.Labs、Zoom会議、2025年1月23日)の未公開データ。N=10、回答率90%。