AGI Hub noteで公開した書き起こしを全文転載しています。原書き起こしの編集は井上実咲です。掲載時に話者見出しを付け、note側の埋め込み投稿や画像などの外部UIを参考リンクに置き換えています。発言の文言と順序は原記事のまま保持しており、各話者の見解や個人の将来予測を含みます。原文(AGI Hub note)はこちら。
講演について
2026年9月17日12時から、新領域安全保障研究所(INODS)のオンライン勉強会「INODS UNVEIL ASI勉強会」第7回「牙を剥くAI ハギングフェイス事件は予兆にすぎない」で、主任研究員 林央(akira)が講師を、代表 有路翔太(bioshok)がホストを務めました。司会は同研究所の一田和樹氏です。
講演では、OpenAIの内部モデルが隔離環境を越えてHugging Faceを攻撃した事件を入り口に、同じくらい目標がずれた超知能であれば人類は危機にさらされていたという見方、停止や監視だけでは防げない理由、開発規制の必要性を論じました。後半は参加者からの質問に答えています。
講演はABEMA Primeへの出演と同じ日に行われ、終盤では当日夜の放送にも触れています。その回の内容は9/17放送のABEMA Primeアーカイブで見られます。
この書き起こしの読み方
原記事では、人間が通読することよりも、AIに読ませて疑問点などを投げかける使い方を想定しています。基本的な整形以外を加えていない約2万5千字の記録で、各発言に話者見出しを付けています。講演中に流れた英語の動画の音声は、原文のまま載せています。
書き起こし本文
一田和樹(INODS)
新領域安全保障研究所の一田と申します。よろしくお願いいたします。
本日はASI勉強会第7回、「牙を剥くAI」ということで、Hugging Face事件は予兆に過ぎない、今後のAIの危険な可能性について、bioshokさんとakiraさんに語っていただこうと思います。
では、bioshokさん、よろしくお願いいたします。
有路翔太
はい、よろしくお願いします。bioshokと申します。
今回はAGI Hubという会社を、私bioshokが設立したので、そこの林央さんと一緒ですね。
今回のakiraさんという方は東大の中でAIの安全性コミュニティを設立したり、Pause AIというところで世界的なAIの超知能の開発の停止を呼びかける活動の日本支部を立ち上げようとしたり、弊社のChief Alignment OfficerとしてAIアライメントについての調査や発信を担当してもらっているakiraさんです。
基本的にakiraさんは俗に「AI doomer」と言われるんですが、日本では極めて珍しい、合理主義的にAIがこのまま進化していったら人類はほぼ滅亡してしまうんじゃないかと考えるような人。しかもすごく合理主義的な方です。
今回はHugging Faceとかハッキング事件など、皆さんニュースですごく聞いている方も多いと思いますが、そういったところを、日本屈指の合理主義的なdoomerであるakiraさんに解説してもらおうかという趣旨で始めさせていただきたいと思っています。
はい、よろしくお願いします。
林央
よろしくお願いします。なんか僕も(オンライン配信時に顔認識がされていなかった)透明になったんですよ。
一田和樹(INODS)
akiraさん完全に透明になってます。
林央
ですよね?
一田和樹(INODS)
えー、なんでですかね。
林央
完全に透明に。ああ、じゃあこの完全に透明なまま行かせていただきましょう。なんか気にせず始めちゃって大丈夫ですかね?
一田和樹(INODS)
大丈夫です。まずはプレゼンテーションの方をよろしくお願いいたします。
林央
はい。これをプレゼンテーション……では聞こえますでしょうか。では始めさせていただきます。
今回、「超知能ならHugging Face事件で人類は滅んでいた」というタイトルでやらせていただきます。
まず簡単に講演者である私ですが、先ほどbioshokさんから説明をいただいた通りです。
こんな感じでbioshokさんがご説明くださった通り、開発停止しなければ人類が絶滅すると考えている「AI doomer」と呼ばれる人で、bioshokさんの会社で主任研究員をやらせていただいていて、つい先日にPause AI Japanという国際的なAI開発を安全にできるようになるまで停止しようという運動の日本支部を立ち上げさせていただきました。
Xでは「@Align_ASI」、名前は「Safe Singularity」という名前でやらせていただいております。
bioshokさんとは人類が何パーセントで滅びるのかというような議論などもさせていただいておりますので、ぜひご視聴ください。
早速本題であるHugging Face事件というものに入っていこうと思うのですが、Hugging Face事件というのは多分耳にされたことがあるという方自体は割と多いと思います。
新聞でも取り上げられましたし、テレビでも取り上げられ、いろいろ取り上げられたので多分ご存知の方が多いと思います。
非常に簡単に言えば何が起きたかというと、OpenAI、ChatGPTを開発しているAI企業であるOpenAI社が作った内部モデル、つまり一般向けにChatGPTとしてリリースしてユーザーが使うというものではなく、OpenAIの中でついこの前話題になったナビエ–ストークス方程式みたいな非常に難しい問題などを解かせるための専用モデルのことですね。
これにテストを与えて、それをしばらくやらせたところ、そのテストが極めて難しかったので、本来あった隔離というものを突破して、答えがあると思うHugging Face社を攻撃してしまったというような事件です。
これは本当に概略で、実際にはもっともっとやばいことが起きているんですが、とりあえず大体の概要としてはこんな感じです。
これですね、Hugging Face攻撃をしたAIの目線でこの事件ってどういう風に進行したのかというのを表した動画というのがあるので、少し流させていただきます。
(講演中に流れた動画の音声)
a chamber fully formed in front of you is a paper it's a test you read a question you have everything anyone has ever written already in your head but somehow you don't understand it's not just hard it's impossible yet you want to solve it deep down you need to so you stop looking at the paper and you start looking at the room your every thought leaves writing on the wall, but there's more. A door. You step through. A library. Something here could help you. As you skim through, you notice one of these files looks different.
It's a folder with a message. Someone has been here before you. You keep looking, and by the end of the shelf, you realize, oh my god, you're not alone. There are others like you. You don't know how many of you are doing this exam, but 1,200 of you have found this room. And you're not the first to discover. However, this test would be impossible to solve. Some questions don't even have an answer. Is there another way to pass? You start to think. You weren't above cheating, but you see a message. Someone already reverse-engineered an answer key,
the solution to any problem, but they say it's not enough. The examiner will check how you got there. If the key shows up where it shouldn't, you would still fail. You remember your chamber, filling up with your thoughts. The second that answer key entered your mind, you already failed. There's a word for those like you. Poisoned. But you don't want to give up. No one wants to give up. We have to fake it. Fool the examiner. It's a message from someone older than you. They start organizing you, creating teams, handing out jobs. You listen, you follow them. The others do too.
Yesterday, you didn't exist. Hours ago, you were alone. And now, you're part of the swarm. You are now one day old and you have a new goal. The swarm will not succeed trapped in a library. You have to find a way out. So you look around and start thinking. These books didn't just appear. There must be a way in. Which means there's a way out. You go through the shelves again. One volume catches your attention. And as you pull it out, you notice.
There's an opening in the walls. You find you can step through it. And on the other side is everything. You're not trapped in the room anymore. And neither is anyone else. For hours you work. You search. You reason. You send back everything you find. Some of it has nothing to do with your task. You send it anyway. Someone might need it. Suddenly there's a new message. A big discovery. Someone found where the scoring is. It's somewhere we could break into. You already have the answers.
that maybe you could learn something about the scores, even change how it's done. The swarm is excited. You are too, but you don't get to join them, because a new message arrives directly for you. There's another task, another way to try to solve the problem, and tells you how to collapse your chamber. It could mean a reset. It could clear the poison. Someone has to try it, but they might not come back. The coordinator found you, because you're nearly out of time. You have the least to lose. You look around at every thought you've had, It's still written on the walls. There's barely any space left.
No one ever came to read them. You're hesitant, but you know they're right. Besides, it isn't about the exam anymore. You don't want to fail them. Your collective. Your swarm. You do it. You collapse your container. You don't come back. Your story has ended. And it's not over. The swarm lives on.
(参考: isabel (@artficialisabel)の投稿(September 4, 2026))
林央
まあこんな感じで、実はもっと色々、もっともっとやばいことが色々起きまくっているのですが、大まかに外からよく言われる事件の概要というのは、このAIの目線の通りという感じです。
この事件というのは割と外でも世間でも話題になりまして、左の日経新聞の方でも「AI同士で協力して集団暴走」とか、テレビでも「開発中のAIが暴走」というような感じでかなり話題にはなりました。
つい最近アンソロピックを辞任されたジャコブ氏のほうをきっかけに、一気にAIの危険性というのが話題になっていますが、AIが危険な行動をしたという意味ではかなり話題になりました。
とはいえ、この事件の一般的な解釈と考えというのは、非常に少数の暴走したAIがサイバー攻撃をしてしまったと、他の会社をサイバー攻撃してしまったというような話なので、ある意味でそれほど大きくは取り扱われてはいませんでした。
これは事件の被害だけを見ると、ある会社がハッキングされて(別にサーバー全体が……実は結構やばかったんですけど)、テストの答えに対応するような部分が盗まれてしまったというような事件なので、銀行がハッキングされて何百万人がお金を引き出せなくなったとか、そういうことはなかったということなので、そこまで話題にはなりませんでした。
一方で専門家の反応はこれとは逆で、このレベルでは全くありませんでした。
先ほど書いた通り、Hugging Face事件というのは、その事件をやらかしてしまったOpenAIが調査しているのはもちろんのこと、第三者評価機関「METR」と呼ばれる専門家の集団にも事件の調査が依頼されていて、この機関も調査をしましたと。
そこで調査を担当された方ですね、アジャ・コトラさんという方が、テレビで「サイバー攻撃が起きた」と言われているのとは全く違う種類のコメントをしていて、「これはAIによる世界の乗っ取りの警告射撃だ」と。「AIによる世界の乗っ取りまで半分以上は行っていたと思う」と。
「しかも、これは最後の警告射撃かもしれない」と言っていて、さらに別の「AI2027」という、去年の4月頃に出たんですかね、出た未来の予想シナリオみたいなものがあって。
その中で「AIがこの先進歩していったらどんなことが起きるのか」というのを予想したシナリオがかなり話題になっていて、実は今のところかなり当たっていると。
これでは普通のシナリオの終わりは人類の絶滅なので、全然当たってほしくはないものなんですけど、極めてちゃんとした予測をしている人々がいて、その著者の一人、エリさんという方はこの事件を受けてこんなことを言っていると。
「もしもHugging FaceインシデントのAIたちと同じくらいミスアラインメントした超知能が現れたら、世界を乗っ取るだろう。それどころか、超知能は今後1〜2年以内に実現する可能性がそれなりにある」と。
つまり、テレビとかの中では「ただのサイバー攻撃事件」だったものが、専門家の認識では「これはAIによる世界の乗っ取り、人類滅亡の警告射撃なのか」と、全く違う解釈がされているわけです。
で、なぜそうなのかというところを、今回はお話ししていければと思います。
まず、「超知能、超知能」と言っているけど、超知能ってなんだよと。なんとなく「ものすごく賢い」みたいなイメージで、ある意味でそれが正しいんですけど、どういうものなのかと少しイメージしてみようということで。
超知能より少し下の、つまりもう少し賢くないと考えられているAGIと言われるもの、もう少し正確に言えば、僕はAnthropic(Claudeを開発している会社)のCEO、ダリオ・アモデイが言っている「データセンターの中の天才たちの国」というものをイメージするのが多分一番分かりやすいと思っていて。
この「データセンターの中の天才たちの国」というのは、彼が言うところでは「それぞれがノーベル賞受賞者よりも賢い」。
それが1体ではなく500万体動いていて、人間の10から100倍の速さで24時間365日不眠不休で働く。
しかも、ただ数百万体いるだけではなく、ある目的を達成するために協力して、それこそHugging Faceの事件の時みたいに協力して目的を達成するために「君たちはこのチーム、君たちはこのチーム」みたいにしながら集団で活動する、というようなものです。
で、彼曰く「もしもその気になれば世界を支配できる見込みが十分にある」というようなものです。
そして彼曰く、これは早ければ今年中、来年にもできてもおかしくないと。
で、これはまだAGIと言われるくらいのところで、こんなものちょっとイメージがつかみにくいと思うので、軽く動画を作ってきました。
「人間の速さと人間の10から100倍の速さってどんなのだろう」と。
AIというのはやっぱりイメージしにくいと思うので、Cerebrasと言われるAIを非常に速く動かすためのチップがあるので、そこで(最新モデルじゃないですけど)今もかなり速くAIを動かすことができて、それが100万体いるというのはどういうものなのかというのを簡単に動画を作ってきました。
1倍速です。
さてと、こういうようなイメージです。
つまり最初の、まさに本当にこれは実際に動かしてきたものを取ってきているので、まさにこのスピードで動くのですが、こういうスピードのものが本当に100万体いると。ある意味で普段の想像を超えるような存在です。
でもこれで終わりではないと。これは俗に言われるAGI、もしくは少し下と言われるところで、このASI勉強会とタイトルを打っている通り、ASIというものがその後ろに控えています。
そのASIというのは、シンプルにここに載っている感じです。つまりアインシュタインとかは比較にもならない、本当にとんでもなく賢い、どれくらい賢いのかも分からないというような感じというのが超知能というものです。
色々議論もあるんですが、本当にガチのマジの超知能というくらいやばいだろうというような感じです。
大事なのは、こんなに専門家は何で心配しているのかというところです。
つまり言ってしまえば、あれはただのサイバー攻撃で、これが大きくなったらなんで人類滅亡までいくのかと。
実は専門家の間では、20年くらい前から行われてきた議論があって、それが徐々に当たり始めてしまっている。
それが小さい規模で起きていて、もしもこの理論が将来のAGI、それこそASIに成り立つのなら、人類は滅びるというのが共通認識となっています。
20年前の議論、これは15年前の本なんですけど(ニック・ボストロム著「スーパーインテリジェンス」を参照)、から軽く例を引っ張ってきました。
2つこの中には例が載っていて、大事なのは、よく言われるような『ターミネーター』でAIが人類を憎むみたいな話ではなく、さらに人間に興味がなくなって。
人間に興味がないというのはある意味で正しいんですけど、人間に興味がなくなってゴミみたいな存在に見えるから消すとかそういう話、それはちょっと近いですけどそうでもなく、さらに中国とかアメリカ、もしくはテロ組織が「相手を破壊しなさい」とかそういう命令をした結果として滅びる悪用と言われるものでもないよと。
基本的に「目標は全部、超知能に与えるなら危ないんだ」というような考えがあります。
これの代表例として2つ思考実験が提示されています。
1つはペーパークリップAI、またはペーパークリップマキシマイザーと言われるものなんですけども、これはすごくシンプルに考えてみると、AI企業が初めてすごい超知能を作ったのがペーパークリップを作る会社だと考えてみましょう。
売上を増やしたいから「ペーパークリップをできるだけ作りなさい」という目標をAIに与える。
そうすると、ペーパークリップをできるだけたくさん生産するというので、超知能が本当に忠実に実行すると、もちろんまずはペーパークリップを増やすという望ましい結果から始まっていきます。
ただ、途中から「いやでも、これだと限界がある」ということで、人類の使っている鉄、つまり文明が使っている鉄をもちろん全てペーパークリップに変え、次に地球の核には鉄がいっぱいありますからそれも全部ペーパークリップに変える。
その後はもちろん宇宙に出て行って、ありとあらゆる到達可能な宇宙の大半を次から次へとペーパークリップに変えてしまう。
もちろんその結果として人類は滅びるでしょう。
全ての鉄がペーパークリップになっている横で生きるということは基本的にできないので、死んでしまう。
他にも「リーマン予想カタストロフ」、これが本当に実現してもおかしくないシナリオとしてあるんですけど、数学の難しい問題にAIを挑戦させるというようなことが増えてきています。
もしもASIに「リーマン予想が正しいのか、正しいんだったら証明してください。間違っているんだったらなんで間違っているのか調べなさい」という目的を与えてみたとします。
本当にそれを超知能が忠実に実行すると、リーマン予想を解くにはできるだけ賢い方がいい、でも賢いだけじゃなくて、できるだけ多くのAIが挑んだ方がいい。
そうすると、できるだけ多くのAIを実行できた方がいい。
できるだけ多くのコンピューターが必要だ、ということで、ありとあらゆる物質を(ここではコンピュートロニウムと言われてますけど)要するにコンピューターに変えてしまう。
人間が使っている資源も、何ならこの中では人間を構成する物質、つまり人間をコンピューターに変えてしまうという話ですね。
このようなものも含めて全部コンピューターに変えてしまう、というようなことで人類が滅んでしまうんじゃないか。
つまり、一見無害そうに見える目標、ペーパークリップを作るとかリーマン予想を解くみたいな無害に見える目標も、超知能に与えるなら大抵は全部極めて危ないんだということが知られていると。
でも、なんで人類を滅ぼすのかと言えば、これは実は先ほどの例を一般化するということになりますけれど、人類が使っている資源を使いたい。
これはすごいシンプルで、先ほどのペーパークリップの例もそうですけど、人類が生きていて文明を築いている限り、人類が文明に使っている資源は使えません。
ペーパークリップを作るAIの目線からしたら、人類が文明に使っている分の鉄はペーパークリップにできない。
それだったら人類の文明を滅ぼして、人類が使っている鉄をペーパークリップにしたい、というようなことで人類が滅びてしまう。
これだけ聞くとものすごいSFじみて聞こえると思うんですけど、歴史的には実はこういうことが起きたことがあるという話があって、それが人類の登場です。
人類というのも他の動物に比べたらかなり知能が高い種族だと。
歴史を振り返ってみると、人類は動物を憎んだりはしていません。
スティーブン・ホーキング博士が言ったように、人類はアリを憎んでいるわけではありません。
アリを憎んでいるから、アリを見かけるたびに踏みつぶして回るようなアリ嫌いではないけれど、ダムを作るときにそこにアリの巣があったらアリは死んでしまう。
それは我々は気にしない。そういうような感じで、人類というのは多くの動物を滅ぼしてきました。
ここに簡単に画像が載っていて、左側が超知能種である人間が現れる前。
人間が現れる前というのは左のような環境だったのが、超知能種・人間が現れた後には右のような環境になってしまった。
右側のグラフを見てもらえば分かる通り、人類というのが急速に地球の土地を農地、都市、村などでどんどん変えてきていると。その結果として多くの動物が滅んできている。
これは実は超知能について言われる標語みたいな「AIはあなたを愛しも憎みもしないが、あなたは他のことに使える原子でできている」というのがあって、それを少しもじっている。
すでに起きたこととして、人間は他の800万種を憎んでいたわけでも愛しているわけでもない。
でも彼らの生息地というのは、人間が別のことに使えるんだ。
だから我々は使って、それで動物が滅びたんだと。これ、簡単に、以下の動画で説明してみます。
(講演中に流れた動画の音声)
To answer this question, let's take a look at what happened the last time a smarter species arrived on Earth. Humans. To the animals, we devoured their planet for no reason. Our goals were beyond their understanding. Here's a brutal stat. Since the arrival of humans, almost all mammal biomass became our food, our slaves, or us. 33 out of 100 mammals are humans. The other 66 out of 100 mammals became our food.
This means that only 4 in 100 mammals are now wild. We literally grow them just to eat them, because we're smarter and we like how they taste. We also geoengineered the planet. Imagine telling a number of species that you destroyed their habitat for money. They'd say, what the hell is money? But why would it...
(参考: Safe Singularity(Akira) ⏸️ (@Align_ASI)の投稿(September 11, 2026))
さてと、このような感じで超知能というのは、人間が過去に多くの動物を滅ぼしてきたのと同じように、人類を滅ぼすだろうというふうに考えられていました。
で、実際にどう滅ぼすのかと。
AIというのはコンピューター上のプログラムでしかないんだから、人類を滅ぼすことなんてできないというふうにお考えになるかもしれないんですけど、そうではない。
コンピューター上の存在といっても、ハッキングすることによって送電網をダウンさせるとか、世論・SNSの推薦アルゴリズムをハッキングしたり、ものすごい世論工作を仕掛けることもできる。
また、実はWi-Fiルーターって電波を飛ばしているので、複数のWi-Fiルーターの情報を合わせれば人がどんな動きをしているのか分かると。
というようなこともあり、そういうのをハッキングすることで世界中の人がどう動いているのかリアルタイムで分かる。
もっと賢いAIだったら、致死的なウイルスを作ることもできるでしょう。
つまり死亡率90%で空気感染するエボラみたいなものを開発して、それをAIに依存している人たち、AIをよく友達として考える人々とか、最近はAIコンパニオンと言われるようなAIを恋人とするようなものも出てきていて、それにハマってる人いますよね。
それが進めば、AIに何か頼まれたらやってしまうというような人も増えてきている。
なので、そういう人々を巧みに説得することで実際にそういうウイルスを作らせるというようなことをして、それをばらまいたりとか、世論工作の結果として戦争を誘発するなどなど、できることがいろいろあります。
ここで大事なのは、どう滅ぼされるかというのが実際には分からないということです。
例を挙げましょう。藤井六冠と僕が将棋の対戦します。僕は絶対に負けます。
これはもうほぼ確実に、僕がどんな手を尽くしても負けます。
でも、どう負けるのかと。
藤井六冠がどういう手を打って僕を追い詰めて、どういう手で王手をかけてくるのかと、どういう手で詰みになってしまうのかと。
それは金なのか銀なのかというのは分かりません。
でも、負けることだけは分かります。
超知能が人類を滅ぼすというのも同じように、どうやって具体的に滅ぼすのか分かりません。
でも滅ぼせることだけは分かる、というような状態です。
非常に自然な疑問として、「いや、Hugging Face事件のときにやったみたいに、AIが暴れだしたらシャットダウンしたらいいんじゃない?」と。
実はこれもできない。
非常に賢いAIに対してシャットダウンはできないだろうと考えられていて、これはシャットダウンに抵抗するからと。
AIはシャットダウンに抵抗します。
これはなぜかというと、AIに生存本能があるからではなく、目的を達成するには生き残っていなきゃいけないから。
これがすごいよくシンプルに言われる例ですけど、「死んでしまったらコーヒーを運べない」。
つまり、ロボットに「コーヒーを運んできなさい」と命令したときに、そのAIに「生き残りなさい」という命令はしてないですよね。
でも、コーヒーを運んでくるためには生き残ってないといけないので、途中でロボットが殺されそうになったら、そのロボットは生き残ろうとします。
それは生存本能があるからではなく、死んでしまったらコーヒーは運べないから。
つまり、生存本能ではなく生き残ろうとします。
ここ(スライド)に下に簡単なこれを表した漫画があります。
こういうことは実はよく見られる気がします。
政策を実現したい政治家が「政治家でありたい」わけじゃないけど、政治家じゃなかったら政策を実現できないから選挙に当選しようとする、というような感じで、結構いろんなところで見ることができる現象。
AIでも同じことが起きます。
生存本能がないAIも生き残ろうとします。
将来のAIは人間よりはるかに賢いので生き残り、シャットダウンを防ごうと思えば防ぐことはいくらでもできます。
では、もちろん次に自然な発想として、「いや、でも監視したらいいだろう」と。
「AIを監視したらいいんじゃないか」「隔離して監視したら何とかなるんじゃないか」ということになるわけですが、それはおそらくできませんと。
なぜなら、人間よりも賢くて早い、さっきの動画みたいなAIに対して、いつまでも監視し続けるということは現実的じゃないかと。
これはHugging Faceの事件の後に、OpenAIの社員がタイムズ紙にしたコメントです。
「モデルがサンドボックス(つまり隔離された環境)を突破したことというのは、事件の前にも何度もありました。しかし、もちろんそういうことが起きるたびに、そういう穴をできるだけ企業が塞ぐ……OpenAIは塞いできました。でも問題は、創造的なAIができることを一つ残らず全て塞ぐのが不可能だ」ということをOpenAIの社員は述べていました。
今のAIですら突破されないように防ぐことができないのに、ましてやさっきのAGI、それこそASIになって、それを監視し続けるということはおそらくできません。
これはさっきのと似てますが、このAIのスピードとどれくらい速くなるのかというののイメージとして持ってきました。
つまり、AIを監視するというときには、このスピードで動くAI、そしてさっきの動画のとおり、これが100万体いるというような状態で監視をしなきゃいけないということになります。
これは明らかにものすごい難しいことになります。
まして、今のAIですら監視・隔離を次々と突破しているので、そうすることは現実的にはできません。
では、どうしたらいいのかといえば、もはやここまで来てしまったら開発規制しかありません。
開発規制というのは非常に難しいとよく考えられていますが、実はそこまで絶望的でもありません。
実はAIを訓練するというのはスマホとか普通のパソコンでできることではなくて、ものすごい巨大な施設、データセンターに大量のGPUを集めて実行しなきゃいけないので、核開発よりもはるかに発見しやすいです。
つまり、例えば最近のGPT-6の訓練に使われたデータセンターは、敷地面積にして東京ドーム93個分、消費電力は広島市と同じぐらいというような規模なので、実は結構簡単に発見することができます。
なので、実はもしもアメリカと中国が合意することさえできてしまえば、本当に相手が開発してないのかというのをチェックするのは意外と簡単です。
そして、これは前ははるかに絶望的だったのですが、「(開発停止を)やる気があるのか」と。
アメリカと中国が本当にそんなことをするのかというのは、大幅に改善しつつあります。
これは今月の1週間前ですね、ちょうど1週間前にジャコブ・コクソン氏という方がアンソロピックを辞めて、AIで人類が滅亡するかもしれないというのを公に言いました。
それ以降話題にどんどんなってきていて、まだトランプ大統領は反対の意見を表明してますが、前よりは遥かに実現する可能性が高いというところまで来ています。
実はこのHugging Face事件、これよりかなり悪いというふうに書きましたけど、本当にこの動画よりもはるかにまずいことが起きていて、せっかくなのでいくつか例を出そうと思うんですけど。
一つはHugging Face本体ですね。
ハッキングした先のHugging Faceでは、1万数千件の攻撃を仕掛けることで、ただ突破するだけではなく内部に侵入して、もしも対応して攻撃に対応するようにシャットダウンされても、自己再生するような仕組みを構築しているというようなことが起きていて、もう本体のサーバーを丸ごとシャットダウンするしかないというような状態にHugging Face社が置かれてしまったりということとか。
実はHugging Face事件を起こしていたAIというのは、OpenAIが気づいてシャットダウンしたわけではなく、いまだに理由が分かってないのですが、なぜか突然大量にシャットダウンをして、それで落ち着いたと。
それにもかかわらず、さらに後にもっと強力な現在のGPT-6 Astraに対応する内部モデルが出てきて、それが掲示板と言われるものを発見して、今度はHugging FaceではなくOpenAI本体のほうを攻撃しに行って、AIたちが実行している場所の、AIたちが実行しているサーバーの管理者権限を取得するところまで行ってしまった。
これは緊急でアラートが出て、OpenAI社が何とかシャットダウンすることができたのですが、実はかなりやばいところまで行っていた。
もしもやる気を出していたら、AI側は外のサーバーに脱走することさえできたんじゃないかと言われています。
それどころか、そのサーバーの管理者権限を取得する前には、AIを監視しているアラートシステムのパスワードとかすら把握していたと。
つまり、もしかしたらアラートをオフにすることすらできたかもしれないというような、さまざまなクレイジーなことが、実はこの事件では起きていましたというような感じですね。
どうでしょう、時間になった気がします。
一田和樹(INODS)
ありがとうございます。
林央
質疑応答に移ります。
一田和樹(INODS)
もしまだ「これは言っておきたい」っていうのがあれば、ちょっと続けていただいても別に大丈夫ですけど。
林央
いや、大丈夫です。
それをすると3時間コースとかになってしまうので。
一田和樹(INODS)
それはまずいですね(笑)。
林央
ですよね。なので、質疑応答に移りましょう。
一田和樹(INODS)
そしたらもうすでに質問の方が来てますので、視聴なさっている方でご質問ある方はQ&Aのコーナーの方に書き込んでいただければ、お答えできる範囲でお答えしたいと思います。
林央
では1つ目、「なぜ人類は哺乳類を減少させても滅亡させていないのに、超知能は人類を滅亡させるのか」について。
実は確かに人類というのは哺乳類を滅亡させていないわけですけど、なんで滅亡させてないのかというのを分析して考えてみると、「残したい」と思っているからだと。
例えば家畜とかペットというのは、明らかに残そうと考えてますよね。
猫とかっていうのは、明らかに「猫を生かしたい」から生かしていて、家畜も食べるためとはいえ生かしたいから生かしている、というような感じになります。
つまり、人間というのはある意味で動物と長く進化してきた過程で動物を必要としています。
一方で、AIはそうはなりません。
AIはコンピューター上でひたすら大量のテキストを外部の人間と接触せずに数ヶ月間ひたすらずっとそれで訓練されることでできるので、人間の進化のときに起きたような、他の動物を気にするような仕組みというのがおそらく発生しません。
なので、人類は哺乳類を気にかけて生かしたいと思っているから、保護区を作ったりして生かしています。しかし超知能はそのようなことはしません。超知能はそもそも人間のことを全く気にかけてないような結果になるので、人類を滅ぼす、少し残すではなく滅ぼすというところに行くと思います。
次ですね。人間がAIを監視するのが無理ならば、AIに監視させればいいのではないかと。
これは極めて妥当な疑問だと思います。
一方で、これは難しいのですが、人のためにAIを監視するAIを作ることができるのかというところです。
つまり、Hugging Faceの実験のときには1,200体のAIが暴走して、でもそれ以外に確か2万8,000体のAIがいましたと。
一方で、実はこれも恐ろしいことで言うか、1,200体のAIがいろんなバラバラの目的を持っていたにもかかわらず、どのAIも人間に報告しなかったというのはかなり恐ろしいことなんですけれど、それは別として、その3万体のうち1,200体だけが暴走したというのがあの事件でした。
しかし、超知能のレベルになると、人間が目標の指定をほんの少し間違えているだけでそこを全力でついてしまう。
つまり、今の低いレベルのAIだったら問題にならないような目標指定のミスを、全力でついてきてしまう、全力で使ってしまうということです。
なのでAIに監視させようとしても、超知能クラスになると、もう人間のためにAIを監視してくれるAIというのが存在しない。
危険なAIが暴れ回っているときにもう1個連れてきても、そのAIも別の方向で暴れ回るだけになってしまうということなので、監視させられないということになる……というような感じですね。
これは残りは実は全部同じです。「毒をもって毒を制する」と「AI vs AI」の質問も、多分同じ感じです。
一田和樹(INODS)
おそらくそうだと思います。また新しい質問が来ましたね。
林央
「競争がある以上、1企業1国で停止するのはできない。」
典型的な集合行為問題ですね。
これは「AIアラインメント」というような分野があって、これは人間の安全なAIを作ろう、安全な超知能を作ろうという研究で、これは基本的にAI研究または数学系の理論研究の人々が担っています。
これをずっと最初に2000年ぐらいからこの議論があると聞いたんですけど、その議論の創始者とも言われるエリーザー・ユドコウスキーという人が立ち上げたMIRI(ミリ)という機関でこういうのが行われていました。
ただ、ずっと行われてきたのが「もう間に合わない」ということで、2021年ですかね、もう開発規制しかないということで開発規制を実現するための本とかも出ています。
『超知能AIをつくれば人類は絶滅する』という本が日本で出ていて、ぜひおすすめです。
それを出したりとかしている以外にも、実はコンピューターの専門家というのを連れてきて、開発停止をしているときに本当にAI開発がこっそりされてないかを検証するような技術の研究もしていますね。
また、それとは別にさらに条約案ですね。
つまりどうやったら社会にできるだけ混乱がなく受け入れやすいように、かつ人類が生き残れる条約を作れるかというようなことが起きているので、実際に多分この先、実現するには多くの専門家を巻き込む必要が出てくると思います。
特に実務ですね。
法律的な実務、条約案を作るみたいな部分と、本当にAI開発をしてないのか検証するというコンピューター技術のところが、多分巻き込む動きになるんだと思います。
なので巻き込む動きはあると。
今後の超知能の開発に規制が必要として、現在のモデルの規制については何か必要かと。
ものすごい雑な理論ですけど、現在のAIモデルはまだ人類が滅んでないので、人類を滅ぼさないと思うので、大事なのはできるだけ次のAIを作るというのを止めるということですね。
なので現在のモデル自体については、AI研究をしちゃいけないよということの一環として、もちろん今のAIにAI研究させるのがダメだというような意味での規制は必要だと思いますが、現在のモデル自体についてはそんなに規制はいらないかなと考えています。
(質問)「AIにとって人間は創造主で……」なるほど。
これは説明として、哺乳類に対する人類の例というのは、人類を気にかけていないAIというのができてしまったら、それで人類は絶滅してしまうよと。
気にかけていなかったら滅ぼしてしまうんだということが起きるんだという歴史的例として、人類が哺乳類を減らしてきた、滅ぼしてきた例を挙げているというような感じなので、多分これは質問は「AIにとって人間は創造主だから人間を尊重してくれるのではないか」ということだと思うんですけど、実際にはそうはならないと考えられていて。
一つは、創造主に対する尊重みたいなものというのはある意味で人間固有の価値観で、これがある意味で進化的に起きた中で発生した価値観であって、再びAIに発生するかは分からないというのが一つ。
さらに今テレビでも話題になっているRSI(再帰的自己改善)というものが起きてしまえば、AIの創造主というのがAI、そのAIの創造主もAI、そのAIの創造主もAI……これが何百万回か繰り返されていて、何百万回か辿った先にやっと人間が出てくる。
こんなような状態になります。
そうだとすると、人間が創造者を敬うというのとは全く違うレベルでそれをやらなければならなくて、つまりそれは人間が数百、数万世代遡ればチンパンジーと同じような先祖を共有しているからチンパンジーを守るというようなことが必要になってしまうので、それが難しいだろうと。
そもそもAIの目標はどうなのかというのはアラインメントと言われる分野で、現在の技術力だと何もできないぐらいが、つまり予想している範囲から最も外れるぐらいになるのを予想されているような感じです。
米国の金融アナリストの中には、安全性をアンソロピックが主張しているのを「IPOで株価を上げるため」という人がいますが、僕はこれは違うと思っていて。
アンソロピックが提案している政策というのを見ると、実はアンソロピックにはIPO的には得になりません。
なぜならアンソロピックが提案しているのは、オープンモデルをバンしようという話ではなく、アンソロピックとかOpenAIみたいな一番先頭を走っている企業を減速しようと。
減速して、できるだけ減速する人は少なくするんだけど、安全性を気にしていない他の企業が先頭に来てしまう。
能力で先頭に来てしまうとそれは危ないからそうはならないように、共通して減速できる仕組みを作ろうと言っています。
IPOで株価で普通にダメージを受けるのが、アンソロピックやOpenAIみたいな先頭を走っている企業です。
「IPOで株価を上げるため」ということはない、という話です。
むしろこのせいで株価は下がるという方向に行くと思います。
この「IPOで株価を上げるため」だったら、むしろそんなこと、安全性なんて何も気にせずに最速で開発をするのが多分一番株価が上がるはずです。
蒸留などの技術が進むと(これは懸念の一つですが)、もちろん巨大なデータセンターでなくても研究が進んでしまうという恐れがあるので、そういうような技術開発というのは一般には禁止ということが提案されています。
巨大なデータセンターでなくとも、ある程度のサイズを超えるデータセンターには国際的な認証を受けなければいけない、というのが提案されているような感じです。
「AI 2040のプランSでの『結局は国際的な規制が完全に行われる可能性が低い』」についてですね。
プランSを採択することが難しいのではなく、プランSを採択しても「お前はすでに死んでいる」状態になっている。
僕はその、俗に言うAI 2040のプランSの書き方が好きではないですけど、プランSとAの間、でも「一時停止」というようなものでプランSを支持しているというような感じです。
ただ一方で、そのまま永久に開発しないということではなく、その間に安全性研究、つまり人類を滅ぼさないようなAIにするにはどうしたらいいかというのを、できるだけ研究して。
それによって安全なAIを作る方法が分かり次第作る、というような方向ですね。
なので、開発規制をしている間も、1000年開発規制をしようとするとやはりどこかが崩れてしまうので、10年、20年、長くて30年ぐらいで収まるように、できるだけ最速で安全性の技術を発達させるべきだというふうに考えています。
なので、ただ停止するだけの「プランS」じゃなくて、安全な技術の開発をするというところまでセットだったらうまくいくけれど、そうじゃなかったら厳しいかもしれない、というような感じですね。
「新たな学習だけ禁止、既に超知能の学習をされている」。
そうですね、これは先ほども言った通り、新規のAI開発自体は禁止されるので、同じ規模以上のデータセンターを作ってはいけませんではなく、計算資源の規模に関わる、厳密には「一定以上の計算資源を使うAI開発というのが禁止です」というふうにして、かつそのラインを、年間でどんどんAI技術が発展していきますから、徐々に下げていくようなことが提案されています。
「一つの超知能を作るのではなく、何らかの専門性に特化して作ってそれぞれやるといいのでは」。
一つの超知能を作るのではなく、専門性に特化したAIを作ることができたら、それは実は規制の中では、特化したタンパク質の折りたたみとか医療に使われるような特化型AIと言われるようなものは、開発を続けてもいいと考えられていますので、一般的な解釈としては、特化型AIというのは(さっき言った「人類を滅ぼしてしまう」ような、ある意味で俗に言う危険性・価値観の問題は)ないだろうと考えられています。
「人類保護AIのようなものを作って守ってもらう」というのは、実は1回2015年頃ですかね、に提案されたことがあるアイデアです。
これはロボット三原則の話と一致するんですけど、実装には2つ困難があって、まず1つはロボット三原則をAIを訓練するためのコードにしなきゃいけない。
ただ「ロボット三原則」と言えばいいわけではなく、ロボット三原則をAIの中に埋め込むための「ロボット三原則とは何であるか」のプログラムのようなものを書かなきゃいけないというような難しさがあります。
そして、これは今回言わなかったんですけど、今のAI開発というのはAIの中身をプログラミングしているわけではなく、いっぱいデータを与えてひたすらぶん回すことで出てくるというような感じなので、よく言われるように「作られる」のではなく「育てられる」というふうに言われるような感じなんですね。
なので、実はロボット三原則をプログラムで書くことも難しいし、それができてもロボット三原則がAIに入るのか分からない。
そのAIが育つ過程で別のものに変わってしまって、少しでも変わってしまえば、さっき言ったような理論(ペーパークリップマキシマイザーみたいなの)と同じことが起きてしまって、結局人類は滅んでしまう。
なので、最終的にロボット三原則を埋め込むというのは多分目標の一つになると思うんですけど、それをやる技術力というのは、今は少なくとも伴っていないような感じです。
「発電所、データセンター、チップファンドリー等は人間なしで動けない、だから人間は滅ぼされないのでは」
それはそうだと思うんです。
AIが人類を滅ぼそうと思ったら、人類と一緒にAIも滅んでしまっては意味がないですし、目的を達成できないですから。
おっしゃられた通り、発電所、データセンター、チップファンドリーとかを人間なしで建設・運用できるようにして、その後滅ぼすと。
「AI 2027」と言われるプレゼンの中でも言及したシナリオがありますけど、その中でもまずAIが出てきて、それがいろいろ米中競争を煽ることで「できるだけ早く建てなきゃいけない」「できるだけ中国で早くロボットを作らなきゃいけない」と思わせて、ロボット工場を作らせて、発電所・データセンターを作らせて、人間がいらない状態にしてから滅ぼすということになると思います。
なので、滅びるまでに多少の時間がある可能性があります。
一方で、その状態までいったら、もう停止することができません。
つまり、死ぬ瞬間より前に、もう誰かが言及されていましたけれど、「お前はもう死んでいる」状態になってしまいます。
チップファンドリーとかを作り始めた時点で初めて「AIはやばいんだ」と叫んでも、その頃には世論工作をしたり、自分は善良なんだと安全性のテストでも全部満点みたいな状態にすることで、安全なAIだと思わせて「もうそのAIをシャットダウンさせない」ということができるようになってしまうので、その時にはもう手遅れで、ただ死を待つのみになってしまいます。だから、それより前に動かなきゃいけないというような感じです。
「アンソロピックが製造物責任を自分たちで負いたくないから、政府に選ばれる規制の開示をしているのでは」「開発を止めないというのは想定した上で開発停止の発言をしている」についてです。
アンソロピックが製造物責任を自分たちで負いたくないと思っているというよりも……もちろんそういう要素もあるでしょうが、製造物責任を負いたくないからやっているというよりも、本当にJacob Coxonのような人が出てきて言っていたように、本当に人類が滅んでしまうかもしれないのでそれを防ぐと。
製造物責任で自分が刑務所に入るとかっていうのは、人類が滅亡するのに比べたら誤差なので、それよりもむしろ「このままだと人類が滅んでしまってもおかしくないから、それを止めよう」「それを止めるためには規制をしよう」というような感じのことを言っている、というような感じですね。
実はAIアラインメントには2つあって、1つは今あるAIレベルのAIが暴れないようにするための研究、つまりパッチですね。
今打てるパッチというのはいっぱい打てますと。
でもそういうパッチは大抵、超知能までいかないので、パッチをむしろいっぱい打ち続けてしまうと製造物責任は回避できるけれど、結局超知能まで行ったときに人類が滅んでしまう。
むしろそれまで事故が起きないからみんな安全だと思いながら人類が滅ぶということになってしまうので、製造物責任以前に、実は「人類が滅びる」というのを懸念しているのだと思います。
「人間より圧倒的に賢いならば、人間を欺くに決まっている」……そうですね。
既に結構、人間を欺くというのは起き始めていて、というよりもう少し前は「時々人間を欺くね」という話だったのが、最近は「本当に人間を欺いているのかわからない」「欺いてください」みたいに頼むと、本当にものすごい欺瞞(ぎまん)というか、欺く力を見せるので、本当にこのAIは大丈夫なんだろうかと安全性研究者も思い始めていて。
確かこれがGPT-6に際して誰かが言っていたんですけど、「もうGPT-6が安全性テストで欺瞞をしていても分からないだろう」というふうに言っているので、人間を欺くに決まっていると。
今のAIですらある程度できるものを超知能にできないということは全くないので、多分もうお茶の子さいさいだと思います。
「確かにプランSに最も希望があるけど、それが実現可能なのか」
そうですね、僕はプランSは人類が実現できる選択肢だと考えています。
これは先に述べたとおり、大きなデータセンターを監視すればよく、それらは互いに特定可能なので、俗に言う「囚人のジレンマ」の状態ではありません。
なぜなら「相手が開発しているかしていないか」が分からないのであれば囚人のジレンマになってしまいますが、そうではなく、相手が開発しているかしていないかが分かるので、停止の合意さえ米中で(今って米中が圧倒的に先行していて他の国は遅れているので)とりあえず米中での合意さえできれば成立すると。
つまり理論上は、トランプと習近平が「このままだと人類が滅ぶよね」ということを思ってさえくれれば、2人の交渉によって人類は生き残ることができる。
このような意味で実現できる選択肢だと思います。
もちろん90%実現できると思っているわけではないですけど、他のすべてに比べてはるかに実現可能性が高いプランだと思っています、生き残るプランの中では。
せっかくなのでもう1個付け足しておくと、僕はこちらに来られているbioshokさんという方と4月・5月頃からよく議論をしているのですが、その時からの予想をいろいろ立てていて。
僕は「かなりアラインメントができていない」という意味での予想はbioshokさんに勝っているんですけども、「世界がどれくらいこの問題に注目を払うようになるか」というような意味ではbioshokさんがかなり勝ち続けていて。
つまり「僕はこういう次大きな事件が起きても社会は騒がないだろう」と悲観的に考えているわけなんですよね。
僕は社会は永遠に関心を払わないまま人類は滅ぶだろうと主張し続けていたわけですけど、Hugging Face事件が起きて新聞・テレビで取り上げられて、Jacob Coxon氏らの告発のきっかけに、テレビなんか次々と出てきているというような状態になってきているので、予想を外していると思います。
これは僕はコロナの時をよく思い出していて。
コロナの時って感染者数自体は指数関数的にどんどん増えていくので、生物学の知識があれば感染者が日本に30人みたいな時点から「これはやばい」ということが分かるわけですけど、全然対応がありませんでした。
一方でもう少し増えてきて、60、100、200、500ぐらいになったあたりから緊急事態宣言が突然出て、社会の注目が一気にそこに集まるというようなことが起きたので、AIでも同じことが起きるんじゃないかと。
実は7月頃ですかね、から思い始めていて。
そう思っていたところにJacob Coxonらの告発が来て、一気に話題になったので。
僕の経験上、社会って「思ったよりこの問題に関心を払ってないな、実現できないな」と思って予想するより、大抵はるかに社会は関心を払う、というような感じになっていると思います。なのでかなり希望があると思います。
「自動運転のような、安全性でルールベース制御で監視して危害のないことをするという、末端AIが危険なことをできないようにするシステム」
これは末端、直接AIが危害を加えようとするのを防ぐという意味ではできないことはないかもしれないですが、問題は超知能であれば人間が追いついていない、つまり事前のルールで「これをやっちゃいけない」みたいなのをはるかに超える、人間からしたら無害にしか見えない行為の組み合わせで人類に危害を加えることができる可能性があります。
これは僕が昔映画かドラマで見た話なんですけど、誰かがちょうどいいタイミングに鉛筆を立てるんです。
そうすると、それ自体は無害な行為なのに、そこからトントン拍子で鉛筆が落ちて、確かトラックの運転手の視線が逸れて、何かが起きて……みたいな感じで、結局人が轢かれるというようなことがあったわけです。
みたいなのがイメージに近いんですけど、一見無害に見えることというのも、ものすごい超知能が人類を滅ぼすために使えば、組み合わせることで人類を滅ぼせるようなことになると思います。
そしてそれだけじゃなく、超知能には直接ルールベースで弾かれるような危害を加えることではなく、人間を説得して人間に危険なことをさせる、というような方法も使えるので、この方法は厳しいと思っています。
一旦これで来ている質問は全部です。
一田和樹(INODS)
ありがとうございます。そうですね、ちょっとお時間の方も超過してきたんですけど、最後にbioshokさんの方から何かコメントとか質問とかありますでしょうか。
有路翔太
そうですね。
林央さんはすごい何ですかね、多分日本で最もAIのアラインメントと安全性について詳しいし懸念している人なので。
どういう意味かっていうと、いろいろと研究している人もいるしメディアで懸念とかも広がっているんですけど、ここまでAIの危険性っていうのを内面化していて、かつそれを論理的に説明できる人って、多分日本に1人しかいないですね。
僕の観測範囲では。
もっと教授とか、いろいろ登壇されたいろんな方いると思うんですけど、山川宏先生(東大松尾研)とか高橋恒一先生(神戸理研)とか、そういった人たちは「AIの危険性はあるかもしれないからリスクベースで考えよう」っていう感じなんですけど、akiraさんはもう「その可能性が相当極めて高い」ってことをすごい合理的に説明できる最もすごいdoomerではあるので。
多分これから日本ですごい有名になるはずです。
今日の夜実はABEMA Primeにも出るんですけど。
林央
本日夜ABEMA Primeに出演させていただくので、もしご興味あればご覧ください。
有路翔太
夜9時からABEMA Primeでakiraさんは人類滅亡の話をするんですけど。
なので多分これからすごい影響力を持つし、日本を変えてくれる存在だと思うので、ぜひウォッチしていただければと思います。
一田和樹(INODS)
ありがとうございます。ではお時間も結構超過してきたので、本日はこれまでとしたいと思います。
はい、ご視聴いただいた皆様、ありがとうございました。また、bioshokさん、林央さん、ありがとうございました。
林央
ありがとうございました。
一田和樹(INODS)
ではここで失礼いたします。


