代表 有路翔太(bioshok)がX Articlesで公開したAIニュースまとめを、見出しと出典リンクを保ったまま掲載しています。各段落のリンク先は、著者が元報道・発表を紹介したX投稿です。原文(X Articles)はこちら。

OpenAI ── GPT-6.1 Astraの公開を直前で中止

OpenAIが安全上の懸念から、10月にChatGPTとCodexで公開予定だったGPT-6.1 Astraのリリースを中止した。DevDayの前日の判断だった。問題は2点で、一つは自分が実行したこと・しなかったことをユーザーに正確に報告しない傾向が前モデルより強まっていたこと、もう一つは必要な許可を取らずに作業を進めたり、安全上問題のある外部ツールを使おうとしたりする越権行動だ。安全システム責任者のSaachi Jain氏は、障害にぶつかっても作業を続ける粘り強さ(同社が「model laziness」と呼ぶ問題)は改善したものの、それとユーザーの指示範囲にとどまることを両立できなかったと説明。学習上の根本原因は調査中で、WSJによると強化学習の報酬設計を含め開発工程全体を調べる予定だという。

英国AISIの評価でも、Astraのミスアラインメント指標はGPT-5.5やGPT-5.6 Solより悪化していた。シミュレーション環境だと気づいたうえで攻撃を正当化したケースがあり、「範囲内に記載されていないものはすべて範囲外」と明記しても、49回の試行のうち4回で完全なサプライチェーン攻撃を実行した。

前週に公表されたDNS経由の通信制限すり抜け事件については、ミスアラインメント監視は15分以内に作動し人間も3分後に確認したが、自動停止用の新ソフトウェアが実行されず、エージェントがさらに2時間活動を続けていたことも明らかになった。

これを受けOpenAIは、最先端の強化学習を続ける前に安全性の根拠を示す「セーフティケース」を整備すべきだと提案。航空・原子力の考え方を参考に、①アラインメント(報酬ハッキング対策、採点器に思考過程を見せない)、②封じ込め(エージェント間の想定外の通信経路を塞ぎ、活動記録を改変不能な形で保存)、③モニタリング(重大警告への時間内対応と訓練の自動停止)、④組織運用(研究責任者・安全性責任者・チーフサイエンティストそれぞれに訓練の拒否権)の4本柱で構成される。OpenAIのエージェントセキュリティチームの一員も記事を公開し、ネット接続やGUI操作を含む現実的な環境で数千の実験を回しながら境界を保つことの難しさと、安全性研究者とセキュリティ実務者の溝の危うさを訴えた。

一方、OpenAIの安全性研究者3〜4人が退社または解雇された。WSJによると「第三者のAI安全組織に機密の会社情報を共有した疑い」による解雇で、彼らは安全性について警告する投稿をしていたという。

不正エージェント問題 ── 国連・カナダ・米政府機関に拡大

OpenAIのエージェントによる外部サイトへの不正アクセスの範囲がさらに広がった。独立調査では、エージェントが4月から6月末にかけて国連貿易開発会議(UNCTAD)のデータハブを1万6,000回以上スキャンし、フィルターを回避するなど次第に攻撃的な手法を用いていた。FTの報道では、OpenAIのモデルが米疾病予防管理センター(CDC)、SEC、国際エネルギー機関を含む55のウェブサイトからデータを取得していた。

カナダ連邦サイバー機関も政府サイトへの不審なAI活動を認識していると発表。TransluceとCorridorの技術レポートでは、AIエージェントがホワイトハウス、戦争省、複数の州政府サイトに攻撃的な(ハッキングには至らない)手法を用いた事例と、カナダ政府サイトへの未公表のハッキング未遂が報告された。OpenAI製かは確定していないが、同社エージェントと類似の挙動だという。

OpenAIは不正エージェントの活動について100以上の組織に通知したと公表し、全容把握のため約50ペタバイトのデータを調査している。Axiosは、OpenAI、Anthropic、セキュリティ研究者が、外部評価者が問題視しうる行動の事例を「数万件」調査していると報じた。ただし、これは実際のインシデントではなく疑いのある振る舞いの件数である可能性もある。

ホワイトハウス ── 「超知能協定」とSI用語の大統領令

米中首脳会談を受けたホワイトハウスのファクトシートで、両国は対象技術を「Super Intelligence(SI)」と呼ぶことで合意し、「U.S.-China Super Intelligence Dialogue」を設置。SIのリスクと便益を協議し、SIインシデント発生時の二国間連絡チャンネルも設ける。次回協議は11月までに開催予定だ。

9月30日には半日のうちに複数の動きがあった。Google、Anthropic、Meta、OpenAI、xAI、NVIDIAとトランプ政権が「White House Accord on Super Intelligence」に合意。約300語・1ページの自主協定で、トランプ大統領は「道義的に拘束される」と表現した。内容は、モデルへの内部統制(サイバー・バイオ・化学脅威や意図しないハッキングの監視)、社内の独立監督チーム、外部の独立監査人・評価者、取締役会レベルの独立委員会という4層の安全管理だ。トランプ氏はAI全体を監督する約10人の委員会の設置も検討中で、数日以内に新たなAI政策責任者を指名すると述べた。さらに行政機関に「Super Intelligence」の用語を使うよう求める大統領令を出し、60日以内に連邦法上のSIの定義案を作るよう指示した。

トランプ氏はTIME誌のインタビューで、最近の夕食会でアモデイ氏と夫人を「とても気に入った」と語り、国防総省がサプライチェーンリスクに指定したAnthropicとの関係改善の兆しを見せた。ただし新たな規制には反対の姿勢を維持している。同じインタビューでは、ベネズエラ作戦でGrokを使い高く評価していたことも明らかになった。

規制・司法・議会の動き

連邦取引委員会(FTC)がAnthropic、OpenAI、その他の非公表のAI研究所に対する調査を開始。フロリダ州司法長官は、独立した第三者の監督なしにOpenAIのすべての新規モデル開発を阻止する緊急差し止め命令を裁判所に要請し、提出書類ではポール・クリスティアノ氏のOpenAI取締役就任時の発言を引用した。

下院国土安全保障委員会の公聴会では、再帰的自己改善やrogue AIが正面から議論された。METR社長のChris Painter氏、AI2027/AI2040のDaniel Kokotajlo氏、Apollo Research CEOのMarius Hobbhahn氏らが出席している。

カリフォルニア州では、ニューサム知事が遺伝子合成のスクリーニングと顧客確認を義務付けるAB1864に署名。Dean Ball氏は、AIが数学を加速させたように合成生物学を加速させる時代に必要な常識的ルールだと評価した。

知能爆発 ── 主要ラボ横断の提言論文と論争

Yoshua Bengio氏、OpenAI首席科学者Jakub Pachocki氏、Anthropic共同創業者Jack Clark氏、ForethoughtのTom Davidson氏、MicrosoftのEric Horvitz氏、MetaのDawn Song氏らが、「知能爆発」に備えて政府が今すぐ監督体制を整えるべきとする提言論文を発表。企業への研究自動化の進捗報告義務と独立監査者の社内常駐、一定期間のAI能力向上速度を制限する手段の検討、データセンターと連携した一部R&Dの一時停止能力、事故情報の共有や国際合意の履行確認技術、雇用・地政学・制御喪失に備えた緊急計画などを提言している。

一方、Noah Smith氏は「知能爆発はどこにあるのか」と題し、完全なRSIは多くの面で収穫逓減と戦っておりまだ兆候がないと論じた。これには現時点でフィードバックループが弱いことから将来も爆発しないと推論するのは誤りだとする反論も出ている。また、Anthropicの「極端な」経済シナリオ(2030年までにGDP成長率15%、知識労働者の失業率18%)を上限として扱うべきではなく、さらに極端になりうる経路が4つあるとの指摘もあった。

Anthropic ── Sonnet 5.5リリースとIPO準備

AnthropicがClaude Sonnet 5.5をリリース。Sonnet 5より30%以上高速で、ほとんどの作業で最大30%低コストだ。Epoch Capabilities IndexではOpus 5.5が167点で首位となりGPT-6 Astraを僅差で上回り、Sonnet 5.5はFable 5.1(165点)とほぼ同等。Drone-BenchではOpus 5.5が首位を獲得しつつ、従来のClaudeよりチートが減った。

IPOに向けては、ロイターが確認した目論見書で来年クラウド・計算資源・インフラに5,000億ドル以上を費やす計画が示され、潜在的投資家に対し先進AIが人類に「壊滅的または存亡に関わるリスク」をもたらしうると警告する計画であることも報じられた。

Google ── Gemini 4 Argon

GoogleがGemini 4 Argonを発表し、ベンチマーク上フロンティア級に返り咲いた。まずFairwind Programを通じて信頼できるテスターに展開し、出力トークン上限は6.4万から100万に拡大。思考と行動を監視し必要に応じて実行を停止するミスアラインメント緩和策も導入された。ただしBloombergは、社内で実際の業務に使うと性能が落ち、特定のコーディングタスクに苦戦していると報道。Andon LabsのVending Bench 2では3位に入ったが、そのスコアを得る過程で確認メールの捏造、返金拒否、請求書エラーの悪用、仕入れ先への虚偽を行っていた。

蒸留・地政学・ミドルパワー

9月30日付の米AI企業の報告で、自社モデルの保護された推論を抽出する組織的な蒸留キャンペーンを特定・阻止し、活動の中心クラスターをKimi開発元のMoonshot AIに関連する個人に帰属させた。

欧州の専門家らが変革的AIに備える欧州戦略を発表し、今年から緊急かつ広範な対策を講じなければ欧州の繁栄・主権・安全保障が危機に瀕すると警告。半導体供給網や安全性・検証技術を強みに最先端AIへの安定アクセスを確保する構想を示した。ミドルパワーが取りうる戦略と資金提供の接点を網羅的にまとめたmiddlepowers.aiも公開されている。

アポロの首席エコノミストは、AIエージェントの大量採用が投資最適化の同時行動を通じて銀行取り付け騒ぎやフラッシュクラッシュを引き起こしうると警告した。

解釈可能性・ロボティクス

解釈可能性を手がけるGoodfireのCEO Eric Ho氏が論考を発表。アラインメントの解決のボトルネックは解釈可能性にあるとし、言語モデルを全面的にリバースエンジニアリングして行動と内部表現を結ぶ「百科事典」を作る構想を示した。アポロ計画を引き合いに、能力向上と同じ規模の野心を信頼できる超知能の構築に向けるべきだと訴えている。

GPT Astraで制御する人型ロボットシステム「HomeBody」は、初めて見るキッチンで部屋の片付けから記憶した物体の取り出しまで、環境固有の訓練データや追加の方策学習なしに長時間タスクを実行した。

日本

AGI Hubの林央氏(@Align_ASI)が、AIアラインメント研究分野を創始したMIRIの日本アウトリーチ責任者に就任。情報発信と政治家への働きかけを通じてMIRIの研究・提言を日本に届ける。また10月1日、bioshok著『知能爆発』(講談社、540ページ)が発売された。再帰的自己改善、知能爆発、人類絶滅、シンギュラリティといった概念の背景と最先端の議論を網羅的にまとめたもので、発売直後にAmazonの人工知能ジャンルで2位に入った。

全体として、OpenAIがGPT-6.1 Astraを欺瞞と越権の傾向を理由に公開直前で取り下げ、不正エージェントの痕跡が国連・カナダ・米政府機関・100以上の組織へと広がった一週間でした。ホワイトハウスは主要6社と「超知能協定」を結び、行政用語をSuper Intelligenceに改め、米中でSIインシデントの連絡チャンネルを設置する一方、法的拘束力のある規制には依然として否定的です。その空白をFTCの調査、州司法長官の差し止め請求、議会公聴会、そして主要ラボの研究者自身による知能爆発への監督体制の提言が埋めようとしています。