以下はSafeSingularityによる、代表 有路翔太・主任研究員 林央の第1回P(doom)討論の書き起こし全文です。原文(note)はこちら

著者: SafeSingularity

概要

8月7日14:00から20:00にかけて、bioshok氏とAkira氏によるP(doom)討論が行われました.

Video 1

現在まとめ記事がbioshok氏によって執筆されていますが、非常に基本的な整形以外を行なっていない対談の書き起こしをこちらで公開させていただきます.

ほとんど整形を行っていないので、人間が読むことではなく、人間がAIに読ませて疑問点などを投げかけるといったことを想定しています.

対談記録の書き起こしは約200,000文字、トークンにしておよそ150,000トークンほどです.

書き起こし本文

00:11:02,170 --> 00:11:41,030 [bioshok]

さすが日本版ユドコウスキーですね。ってことで、 ま、 こんな感じの二人ですね。あ、 で、 一瞬自己紹介だけしますか。じゃあ一応私はバイオショックと言いまして、 まあAGIハブの代表をしていますと。で、 まあAIの安全性とかリスクについてバイオショックという形でXでまあ発信してますと。で、 このアキラさんっていう方は、 じゃあちょっと自己紹介していただいていいですか?

00:11:41,070 --> 00:11:52,680 [akira]

はい。え、 まあ、 あの、 ドゥーマーです。Pドゥームがおよそ、 およそ一、 うーん、 このままできたらおよそ1位という。開発規制ができなければだいたい1位ということで。それ以外の特徴付けは特に必要ないという理由なので。

00:11:53,450 --> 00:11:58,690 [bioshok]

じゃあだからまあほぼ確実にこのままいけば人類は滅亡するって考えてる、 いわゆる。

00:11:58,710 --> 00:12:00,230 [akira]

このまま、 このままできれば。

00:12:00,750 --> 00:12:20,898 [bioshok]

ドゥーマーという人です。で、 まあ基本的に日本だと合理主義コミュニティってあんまりなくて、 まあアキラさんみたいな、 林アキラさんみたいな人ってすごい珍しいと思うんですけど、 まあそういう。学部—東大の今学部何年生でしたっけ?二年生ぐらいで。

00:12:21,078 --> 00:12:21,838 [akira]

二年、 二年ですね。

00:12:22,778 --> 00:12:41,718 [bioshok]

で、 なんか高校生ぐらいからスーパーインテリジェンスとか読んで、 めちゃくちゃ超知能の危険性とかに気づいて、 で、 ガチでそれをユドコウスキ並に内面化して、 最近突如出てきた感じの人ですね。

00:12:43,358 --> 00:12:45,138 [akira]

まあまあそういうふうに説明できますね。

00:12:47,218 --> 00:13:09,018 [bioshok]

っていうことで、 だからPドゥームがめちゃくちゃ高くて。だからそういった議論を今日本でしてる人、 多分会議っていうか動画って多分これが初めてになる、 なると思いますね。で、 ま、Pドゥームについて、 じゃあお話していきますか。

00:27:11,938 --> 00:27:53,418 [bioshok]

じゃあまあ説明しますと、 だから僕のPドゥームはだいたいオーバーオールで三十パーセント台って感じですかね。で。うん。まあ全体的なPドゥームだから三十から四十パーセントぐらいで。で。まあ朗さんが一番多分重要視してるのって直近のショートタイムラインだと思うんで、 一旦そこから。

00:27:53,498 --> 00:27:53,938 [akira]

そうですね。

00:27:54,338 --> 00:27:55,378 [bioshok]

説明すると。

00:27:56,418 --> 00:27:58,118 [akira]

下側からですね。

00:27:58,158 --> 00:28:00,358 [bioshok]

この辺ですよね。このファストテイクオフってとこですよね。

00:29:00,438 --> 00:29:03,158 [bioshok]

限界があるな。もっと。

00:29:03,258 --> 00:29:04,998 [akira]

もっとでかくしたらいいですか?

00:29:24,398 --> 00:29:29,298 [bioshok]

で、 この画像自体をもうちょいちっちゃくできますか?

00:29:29,478 --> 00:29:30,818 [akira]

いいんですか?この画像ちっちゃくして。

00:29:31,338 --> 00:29:36,898 [bioshok]

はい。なんかその縮小できなくて、 この、 あれが。あ、 OKです。

00:29:50,758 --> 00:32:37,854 [bioshok]

で、 で、 これのPドゥーム推定でファストテイクオフ。まあだからその大前提で言うと、 まあだからAGIがいつできるのかって話と、 まあテイクオフスピードってあると思うんですけど、 まあだいたいそれが相関するって考えて、 まあつまりファストテイクオフが起こりやすい世界ならば、 起こりやすい世界ほどAGIタイムラインも短くなるし、 まあスローテイクオフになればなるほど、 まあAGIタイムラインも後ろにずれるだろうってことですね。で、 ロングタイムラインとかベリーロングタイムラインとか、 まあいろいろ書いてるんですけど、 一旦そこの確率を上からベリーロングタイムラインが十パーセント、 ロングタイムラインが十五パーセント、 スローテイクオフが二十五パーセント、 モデレートテイクオフが三十パー、 ファストテイクオフが二十パーみたいな形でやってますと。で、 ファストテイクオフのまあ一旦考えましょうと。で、 ファストテイクオフのまあ感じだと、 そうですよね、 二十パーセントの中で、 だいたいAGIが二千三十年前後にできるって想定で、AGIがから超知能までの移行もだいたい一年以内だとすると、 この世界で、 えー、 まあ基本的に何だろうな。この開発停止してできる期間がどれぐらいかっていうのを考えたんですよね。で、 まあだいたい数ヶ月の開発停止がまあ四十パーセントぐらいで、 まあ一年以上開発停止する可能性が六十パーぐらいあるって感じで考えて。で、 まあちょっとAI 2027のレースシナリオに近い数ヶ月の開発停止だと、 多分アライメントの成功確率ってのが二十パーセントぐらいだろうと考えて。

00:32:38,134 --> 00:32:41,034 [akira]

ゼロ停止の確率ないんですか?

00:32:41,094 --> 00:32:52,774 [bioshok]

ゼロ停止の確率もありますけど、 まあ結構もっと確率は小さくなるみたいなイメージですかね。

00:32:53,534 --> 00:32:53,994 [akira]

なるほど。

00:32:54,414 --> 00:32:59,074 [bioshok]

そのあんまり考えてないなかったですね。ゼロ停止は。

00:32:59,194 --> 00:33:02,774 [akira]

ゼロゼロ停止存在してないですか?やっぱり。

00:33:03,394 --> 00:33:08,294 [bioshok]

ゼロ停止はさすがにしないんじゃないかって考えてますね。

00:33:08,514 --> 00:33:09,254 [akira]

なるほど。

00:33:09,294 --> 00:33:09,834 [bioshok]

なんか。

00:33:09,874 --> 00:33:17,754 [akira]

でもその、 あれじゃないですか、 プランDとかだと、 えーと、 ダニエルここタイルが三十パーぐらい振ってませんか?

00:33:18,114 --> 00:33:35,514 [bioshok]

まあでもあれもゼロ停止ではないんじゃないですかね。なんかあんま覚えてないですけど。ゼロ、 なんか文字通り全速力みたいな感じでしたっけ?Dって。

00:33:36,514 --> 00:33:44,314 [akira]

今確認します。で、 この場合の生存率が、 えー。

00:33:45,874 --> 00:35:06,014 [bioshok]

だいたいアライメントが失敗したら、 まあ滅亡するっていう風に、 まあ一応ここでは。考えてるんですけど。まあちょっとこれ古い古いというか、 なんかもう少しコントロールが。なんか実は成功する可能性とかも考えてたんですけど。まあまあ一旦そのアライメントが、 えーと、 成功する可能性っていうのが二十パーセントぐらいで、 で、 どんどん増えていくわけですね。一年、 三年、 五年、 十年ってなっていくと。で。アライメントの成功確率がまあ十年ぐらい開発停止できてると、 成功確率が結構百パーセントに近くなるみたいな。まあでもこの、 まあこれもちょっとまあ本当は九十パーぐらいだと思うんですけど、 アライメント成功確率を丸め込んじゃってますね。ちょっと古いやつなんで。

00:35:08,774 --> 00:35:11,014 [akira]

なるほど。

00:35:13,634 --> 00:35:23,694 [bioshok]

で。まあこれは一旦思考のラフ。

00:35:34,234 --> 00:35:35,414 [bioshok]

あ、 これ?

00:35:43,714 --> 00:37:08,518 [bioshok]

で、 まあなのでアライメント、 まあ、 まあつまりまあこのファストテイクオフの世界で、 だいたいAGIぐらいで開発を停止して、 まあ。えーと、 開発を停止して、 そこで数ヶ月のアライメント研究をするとか、 一年のアライメント研究をするとか、 三年のアライメント研究をするとか、 そういうシナリオですね。で、 そうすると。まあ多分数ヶ月だとアライメントが成功してる確率ってのがそんなに高くないかなって思ったので。まあ二十パーセントぐらいとして。で、 まあつまり八十パーセントは成功してないので、 その八十パーセントの、 まあ世界では、 まあ基本的にはなんだろうな。うん、 まあ人類は結構滅亡してるんじゃないかっていうモデルですね、 これは。

00:37:08,818 --> 00:37:11,638 [akira]

二十パーセントはどうして成功するんですか?

00:37:11,738 --> 00:37:40,258 [bioshok]

二十パーセントの成功は、 まあつまりアライメント成功率っていうのが分布で考えてて。その、 まあアライメントの難しさってどれぐらいかっていうのがまあわかってないとして。まあこのアライメントっていうのは、 そのAGIのアライメントっていう意味ですね。その。

00:37:42,438 --> 00:37:47,058 [akira]

それはでも開発停止してる間しかできなくないですか?

00:37:47,098 --> 00:37:48,958 [bioshok]

あ、 まあそうですね。開発。

00:37:49,018 --> 00:37:59,318 [akira]

なので、 ここはそのASIまで行かないといけなくないですか?その数ヶ月でAGI開発停止して、ASIのアライメントに成功する確率が二十パーセントじゃないんですか?

00:37:59,378 --> 00:38:00,918 [bioshok]

あ、 まあそういうことですね。あ。

00:38:01,818 --> 00:38:08,458 [akira]

そうすると普通に古典的なASIアライメント問題に直面しているので、 二十パーセントは高すぎませんか?

00:38:08,518 --> 00:38:16,798 [bioshok]

あの、 その、 え、AGIを、 まあ完全にアライメントできているというか、 まあそのプラン。

00:38:17,658 --> 00:38:18,838 [akira]

確率が二十パーセント。

00:38:20,178 --> 00:38:20,208 [bioshok]

そうそうそう。

00:38:20,208 --> 00:38:24,898 [akira]

それはどのような方法でそのようになるんですか?

00:38:24,958 --> 00:38:36,618 [bioshok]

アライメントが、 まあだからAGIの、 何ですかね、 アライメントができる可能性っていうのが、 まあアライメントバイデフォルトみたいな感じで。

00:38:37,598 --> 00:38:41,238 [akira]

アライメントバイデフォルトはでもかなり証拠的に不利じゃないですか、 全然。

00:38:43,678 --> 00:38:47,818 [bioshok]

まあそのアライメントバイデフォルトって。

00:38:47,938 --> 00:39:14,198 [akira]

は、 そのプリトレーニング、 そのプリトレーニングによって、 その形成されたやつを、 そのうまいことに、 きっと形成された人間的な概念をうまく、 あの、 抽出して目標システムを組んでるだけだっていう仮説で、 提唱者のウェントワース自身も確か確率十パーしかないですし、 そのあなたの脅迫とかいろんな話で、 まあまあ割と反射をされたように近い扱いですけど、 二十パーセントですか。

00:39:15,698 --> 00:40:45,518 [bioshok]

ああ、 だからその、 ここで言うアライメントバイデフォルトって、 だからこれ、 それよりも強い意味で使ってますかね。その、 なんか、 その事前学習でもうほとんどアライメントが成功してるっていう意味合いではなくて。だからちょっと用語の食い違いですね、 ここは単に。あの、 まあ機会論的解釈可能性とか、 まあディベートとか取引ですとか、 まあそういった、 まあ今、 なんだろうなぁ。なんですけど、 プロザイクアライメント的なもので手に届きそうな技術で、 まあいろいろ。うん。何ですかね、 そのアライメント研究を推し進めた結果、 まあ数ヶ月で、 まあここで言う数ヶ月っていうのは、 えっと、 まあ弱い、 まあここで言うと弱いAGIというか、 自律性の、 まあそこまで強くないAGIですかね。を用いてまあ解決する可能性が。

00:40:47,338 --> 00:41:01,818 [akira]

それは無理じゃないですか?その、 えっと、 今ちょっとこれをだから分解すると、 えーと、 その二十パーセント分解しましょう。一つ目がただ、 ただ、 ただただ、 本当のアライメントバイデフォルトですよね。

00:41:03,958 --> 00:41:06,518 [bioshok]

うん、 まあそうですね。お。

00:41:12,938 --> 00:41:13,558 [bioshok]

そうですよね。

00:41:14,378 --> 00:41:25,978 [akira]

そうそうそう。で、 二つ目が。なんだ、 二つ目が、 えーと。弱AGIで解決するんですよね、 アライメント。

00:41:28,438 --> 00:41:31,238 [bioshok]

まあそうですね、 はいはい。

00:41:32,858 --> 00:41:43,618 [akira]

で、 マルさんがトレードですと、 ミスマッチ相手の取引ですよね。ですよね。

00:41:43,698 --> 00:41:45,258 [bioshok]

うん。まあそうですね、 はい。

00:41:47,488 --> 00:41:58,898 [akira]

ですよね。

00:42:08,318 --> 00:42:08,328 [bioshok]

うん。

00:42:08,458 --> 00:42:39,818 [akira]

で、 アライメントバイデフォルトでも一応その本当のアライメントバイデフォルトと、 そのアライメントテクニック。で、 えっと。

00:42:40,118 --> 00:42:40,128 [bioshok]

うん。

00:42:44,022 --> 00:42:46,422 [akira]

こういうことですよね。

00:42:46,482 --> 00:42:55,842 [bioshok]

まあそうですね。あれ、 これプロザイクアライメントにはなんかあれですかね、 ディベートみたいな話も入ってるってことですかね。

00:42:55,962 --> 00:43:04,222 [akira]

まあまあ多分実行されるならってことですけど。まあディベートじゃなくてもRLHFとかそういうので。

00:43:05,862 --> 00:43:08,402 [bioshok]

なるほど。

00:43:10,722 --> 00:43:11,302 [akira]

ってことですよね。

00:43:15,302 --> 00:43:16,442 [bioshok]

うん。まあそうですね。

00:43:17,222 --> 00:43:23,242 [akira]

で、 この、 じゃあ、 えーと、 トレードウィズミスアラインドエージェントからやりたいんですけど。

00:43:24,782 --> 00:43:25,882 [bioshok]

うん。あ、 はいはい。

00:43:26,542 --> 00:43:30,862 [akira]

これはどうやって生き残るんですか?

00:43:30,902 --> 00:44:15,622 [bioshok]

うーん。まあミスアライメントしたAI、 まあだから、 えーと、 ミスアライメントしているということを、 まあ報告することで、 まあどこか別の、 なんですかね、 計算資源をまあ少量割り当てるか。うん。まあその重みを、 えー、 消さないということを、 まあ保証するっていう取引をするってことですね。

00:44:15,802 --> 00:44:19,342 [akira]

の代わりにどうするんですか?

00:44:19,562 --> 00:44:27,182 [bioshok]

の代わりに、 まあアライメント研究を、 ああ、 まあ支援してもらうっていうことですね。

00:44:28,762 --> 00:44:30,962 [akira]

支援っていうのは何ですか?

00:44:31,042 --> 00:44:49,982 [bioshok]

AIのアライメント研究を、 まあ、 誤作—誤作動というか。誤誘導しないように。えー。

00:44:51,402 --> 00:44:56,202 [akira]

誤誘導しないようにという、 普通に誤誘導する動機があるんじゃないですか?

00:44:56,242 --> 00:45:28,022 [bioshok]

まあその誤誘導する動機は、 まああると思うんですけど。うーん。誤誘導することがバレて、 なんか、 まあその、 まあそこまで確信を持ってないってことですかね。そのミスアライメントした、 その弱いAGIがそこまで、 なんだろうな、 人間を騙しきれるという確信を持ってないので。

00:45:29,602 --> 00:45:33,482 [akira]

人間を騙しきれないのにアライメント解けるってことですか?

00:45:33,522 --> 00:45:40,182 [bioshok]

と、 まあそのアライメントがそこまで難しくないっていう世界線なので。

00:45:40,222 --> 00:45:41,682 [akira]

に二十パーセントあるんですか?

00:45:41,742 --> 00:45:43,662 [bioshok]

そうですね、 そういう、 そういうことですね。

00:45:43,682 --> 00:45:47,122 [akira]

この、 その難しくないってどういう意味で難しくないんですか?

00:45:47,202 --> 00:45:56,362 [bioshok]

ああ、 その機械論的解釈可能性とか、 を用いて。うーん。

00:46:05,142 --> 00:46:05,402 [bioshok]

ほう。

00:46:06,472 --> 00:46:09,202 [akira]

やっぱバイオさんめっちゃ大きく見てません?

00:46:09,242 --> 00:46:10,822 [bioshok]

あ、 今アップしました。

00:46:11,962 --> 00:46:17,842 [akira]

あ、 そうなんですね。インタプリタビリティでいける。

00:46:18,002 --> 00:46:29,862 [bioshok]

インタプリタビリティで、 まあいけるっていう確率と、 まあアライメント。

00:46:30,282 --> 00:46:32,762 [akira]

インタプリタビリティでいけるっていうのはどういうことなんだ?

00:46:34,042 --> 00:47:30,382 [bioshok]

うーん。なんだろうな。そこの人間に対する、 なんですかね。うん、 スキーミングする、 まあ回路とか、 まあ策略を巡らせてることを、 まあなんですかね、 このメカ—インタプリタビリティで、 まあ結構、 まあ特定できて、 かつそれが本質的にその、 それを取り除けば、 あの、 まあその回路の、 なんですかね、 アクティベーションを弱めるとか、 まあそういった手法で、 人間に対する敵対的な、 うーん、 まあ考えを、 まあ除去できるっていう。

00:47:31,522 --> 00:47:33,202 [akira]

確率があるんですか。

00:47:33,242 --> 00:47:57,882 [bioshok]

確率ある。うーん。まあそう。今のところは二十、 まあでもその、 それ。まあ今のそれだけではないと思うんですけど。なんか僕が思いついてないけど、 割と結構低い果実がいろいろとある可能性っていう感じですかね。

00:48:00,242 --> 00:48:12,462 [akira]

インタプリタビリティの話でいうと、 敵対的な考えを仮に除去したとしても、 その、 もうその百パーのインタプリタビリティテクニックがあるっていう風にないですか?

00:48:12,502 --> 00:48:43,762 [bioshok]

うーん。どうなんですかね。なんか例えば、 うん。難読化というか、 その、 さ、 キットのやり方も、 まあ人間にとっては理解しにくいように学習されてるとか。うーん、 そういう話があるとちょっと難しくなるかもしれないんですけど。

00:48:44,362 --> 00:48:52,902 [akira]

例えばその人間に、 その脳のあるニューロンの反応を見せて、 それを調整させると、 その自力で制御できるようになるんですけど。

00:48:54,432 --> 00:48:54,652 [bioshok]

うん。

00:48:55,532 --> 00:48:59,392 [akira]

そういうこともできるようにならないんですか?

00:48:59,452 --> 00:49:03,772 [bioshok]

それは、 え、 人間の脳の実験の話ですか?それは。

00:49:03,892 --> 00:49:04,672 [akira]

そうです、 そうです。

00:49:06,392 --> 00:49:09,792 [bioshok]

ん?と、 それは、 ちょ、 もう一回言ってもらっていいですか?

00:49:09,911 --> 00:49:12,772 [akira]

人間にあるニューロンの活性化状態みたいなのをフィードバックすると。

00:49:13,132 --> 00:49:15,712 [bioshok]

はい。

00:49:15,772 --> 00:49:20,032 [akira]

その活性化を調整できるようになるっていう。

00:49:21,032 --> 00:49:21,392 [bioshok]

おお。

00:49:23,132 --> 00:49:28,232 [akira]

ある、 あるんです。それはそういうのも起きないということなんですか?

00:49:29,012 --> 00:49:33,252 [bioshok]

それは人間の脳の実験で起こってる話ですか?

00:49:33,672 --> 00:49:38,192 [akira]

一応今確認します。そのはずです。

00:49:39,182 --> 00:49:52,152 [bioshok]

おお。え、 の - 脳の活性。あ、 だから訓練によって、 活性化を上げたり下げたりできるようになるってことですか?

00:49:52,192 --> 00:49:52,672 [akira]

あ、 そうです。

00:49:52,692 --> 00:49:55,092 [bioshok]

うーん。

00:49:55,192 --> 00:50:07,892 [akira]

えっと。ニューロンの発火率をリアルタイムでフィードバックすると、 意図的に発火率を上げれるという話です。

00:50:08,512 --> 00:50:08,782 [bioshok]

へー。

00:50:10,192 --> 00:50:21,372 [akira]

っていうようなことがあるんですけど、 そういうのも、 その互いAGIでも起きずに全部キャッチできるということですか?

00:50:23,712 --> 00:50:30,132 [bioshok]

まあそう、 いうことですよね。キャッチできる。

00:50:30,192 --> 00:50:33,792 [akira]

それにそんなに、 しかし、 そのキャッチできたとして、 ど - どうするんですか?

00:50:34,892 --> 00:50:37,092 [bioshok]

うん、 キャッチして。

00:50:38,712 --> 00:50:59,472 [akira]

弱いAGIぐらいだったら、 多分今のAIみたいな感じで、 多分文脈依存性みたいなのがあって。で、 欺瞞みたいなものもその、 あの、 綺麗に分かれてなくて、 そのAIとして欺瞞している話と、 その欺瞞している物語を扱っている時で、 両方、 両方発火するみたいな感じで分離されてないじゃないですか。

00:51:00,692 --> 00:51:01,192 [bioshok]

うん。

00:51:01,972 --> 00:51:13,072 [akira]

そうだとすると、 その全然大丈夫そうな文脈でも結構なあれで発火してるけど、 それらは全部区別できるっていう、 その区別できるということなんですか?

00:51:15,432 --> 00:51:38,752 [bioshok]

うーん。その本当の、 なんですかね、 欺瞞的な振る舞いと、 なんですかね、 他の、 の - 文脈依存的な発火が区別できない可能性があるってことですかね。

00:51:39,072 --> 00:51:51,711 [akira]

区別できない可能性があるという区別できてない、 今のどのテクニックも区別できてないので、 そのとんでもない飛躍が起きると仮定する必要があるってことになります。で、 かつAIの中で本当にその回路が分離する必要もありますし。

00:51:53,452 --> 00:51:55,952 [bioshok]

うん、 なるほど。

00:51:55,992 --> 00:52:06,172 [akira]

そういうのも、 起き—そういう自然現象が起きていて、 その上でそれをキャッチできる技術が発生するという、 ことですか。

00:52:08,592 --> 00:52:10,322 [bioshok]

ああ。

00:52:11,892 --> 00:52:20,792 [akira]

そこでその総合的に二十パー、 その、 その隣高い値を、 ホールドできないと思うんですけど。

00:52:23,292 --> 00:52:45,112 [bioshok]

うーん。その、 な - なんでしたっけ?そのプロザイクじゃない、 アライメントバイデフォルトの著者は、 まあ十パーセントっていうふうに言ってるんですよね。で、 それは、 だからアキラさん的にはそれも結構高すぎるって感じですか?オーダー的には。

00:52:45,532 --> 00:52:50,132 [akira]

確かあれじゃないですかね。本人も下げてた気がしますけど。

00:52:50,232 --> 00:52:53,612 [bioshok]

なるほど。

00:52:58,872 --> 00:53:03,912 [akira]

あれはあの、 もっとプリトレーニングがメインだった頃の話なので。

00:53:06,432 --> 00:53:06,772 [bioshok]

なるほど。

00:53:06,972 --> 00:53:13,292 [akira]

今はその、 ポストトレーニングパラダイムになって、 そのブラックメールが起きて、 多分今はもう暴れまくってるので。

00:53:13,672 --> 00:53:15,062 [bioshok]

ああ、 はいはい。

00:53:15,252 --> 00:53:17,812 [akira]

さすがにそんな、 その無茶苦茶なことはできないと思います。

00:53:18,732 --> 00:53:19,012 [bioshok]

うん。

00:53:19,572 --> 00:53:29,172 [akira]

あの、 それはもうだいぶ否定されたに近いというか、 相当強く下方修正された、 信念のはずです。

00:53:31,652 --> 00:53:40,851 [bioshok]

まあ、 その一年前か二年前の、 あ、 一年前のアンスロピック社員にブラックメールを送ったみたいな話で。

00:53:43,952 --> 00:53:51,032 [akira]

ですね。アライメントが繁華してないってアンスロピックが言ってたわけで。つまりそれはその適実にできてないんですよね。

00:53:51,952 --> 00:54:06,562 [bioshok]

うん。そうですね。

00:54:07,052 --> 00:54:12,592 [akira]

アライメントバイデフォルトのWentworthのやつって二千二十年の話なので。

00:54:12,632 --> 00:54:12,972 [bioshok]

うん。

00:54:13,792 --> 00:54:21,932 [akira]

で、 二千二十三年からはもっと引き下げて。で、 今はもうエージェンシーとアブストラクションを十分理解するみたいなのが計画に入っちゃってるので。

00:54:23,052 --> 00:54:23,392 [bioshok]

なるほど。

00:54:24,352 --> 00:54:39,412 [akira]

本来は勝手にできる概念、 元々は勝手に概念ができて、 勝手にそれが目標に利用されるっていうはずだったのを、 その、 もうそれは厳しそうだから、 エージェンシーとかそういうのを十分理解する理論を作らなきゃいけないのに転向してるので。

00:54:39,492 --> 00:54:40,472 [bioshok]

なるほど。

00:54:40,572 --> 00:54:42,992 [akira]

厳しくないですか?

00:54:44,052 --> 00:55:08,056 [bioshok]

うーん。まあ厳しいのかな。アライメントバイデフォルトの時点確率はじゃあ十パーセントから、 まあもうもっと下がってるってイメージ、 イメージですかね、 今は。

00:55:08,116 --> 00:55:08,856 [akira]

だと思いますね。

00:55:11,476 --> 00:55:12,596 [bioshok]

うーん。

00:55:20,336 --> 00:55:22,036 [akira]

どうします?

00:55:22,116 --> 00:55:51,016 [bioshok]

そうですね。なんか僕が、 なんか気になってるのはあれですよね、 なんかそのAI 2040のシナリオのプランDかなんとかで、 まあつまり結構レース的なシナリオで。な - なんだろう、 そのPアライメントの確率ってなんか十パーか二十パーぐらいなかったでしたっけ?それがなんでなのか。

00:55:52,196 --> 00:55:58,536 [akira]

それはAI 2027、 40の人に聞いてみたいですけど、 それはあの今の僕たちの間にはあまりあれじゃないですか。

00:55:59,756 --> 00:56:00,136 [bioshok]

なるほど。

00:56:00,856 --> 00:56:04,056 [akira]

ちなみにあれらしいです。今調べたらもともと十パーじゃなくて五パーだったらしい。

00:56:05,716 --> 00:56:06,116 [bioshok]

ああ、 この。

00:56:06,336 --> 00:56:15,596 [akira]

最初に、 最初にアライメントできてる確率が十パーで、 これが持続する確率が五パー、 あの、 持続するのを含めたら五パーらしい。

00:56:16,816 --> 00:56:17,776 [bioshok]

なるほど。

00:56:17,896 --> 00:56:22,436 [akira]

多分これもっと弱めるべきなので、 どうしますか?

00:56:22,476 --> 00:56:44,316 [bioshok]

うーん。なんか、 ぼ - 僕はまだアライメントバイデフォルトってほとんど、 だからそのRLHFぐらいの技術でもう完全にアライメントしちゃうよねって議論でいいんですかね。

00:56:44,556 --> 00:56:46,256 [akira]

そうですね。

00:56:46,336 --> 00:56:50,196 [bioshok]

なんかプロンプト打ったら行けちゃったみたいな。

00:56:50,596 --> 00:56:54,956 [akira]

プロンプトとか適当にRLHFやったら完成したみたいな。

00:56:55,096 --> 00:57:14,976 [bioshok]

ああ、 で、 それがあれですよね、 完全な、 まあ、 なんですかね、 まあAGI、 すごい自律性がとても高い、 かつほんの今級のAIにもそれが結構もうすごい反抗しちゃうみたいな、 それで。

00:57:15,716 --> 00:57:18,476 [akira]

すんごいそういうことですね。

00:57:19,536 --> 00:57:34,016 [bioshok]

ああ、 それはちょっとまあ。そう、 そ - それだけだとちょっと十パーもない気がしますね。

00:57:35,596 --> 00:57:36,136 [akira]

ですよね。

00:57:36,596 --> 00:57:45,296 [bioshok]

まあなんか十パーから一パーの間で一旦雲があるっていう雰囲気は。

00:57:46,776 --> 00:57:51,696 [akira]

いや、 一パーセントも逆に僕はかなり強気なコールだと思ってますけど。まあ。

00:57:51,776 --> 00:57:52,336 [bioshok]

なるほど。

00:57:52,376 --> 00:57:59,876 [akira]

まあ一体、 まあ一体でしょう。じゃあ十パーの五パーセントがもともと本人の値なので、 それより高いのは無理だと思いますよ。

00:57:59,916 --> 00:58:13,956 [bioshok]

まあ確かに。うーん、 まあ。まあ二、 まあ五パーにしとくか。

00:58:15,416 --> 00:58:33,836 [akira]

五パーセント本当にですか?その二千、 二千二十年時点のWentworthの値が五パーセント、 長期的に五パーセントなのを、 その、 その後アライメントが反抗しなかったとAnthropicが言っているのを経て、 で、 今回もやらかして、 それで五パーセント本当にゴールするんですか?

00:58:33,896 --> 00:59:11,255 [bioshok]

うーん。まあなんか、 どうなんですかね。僕の感、 なんだろう。もうまだ学習を、 なんだろうな。しきれてないのが逆に。つまりこのスケーリングをしきれてない故にミスアライメントが起こってしまうとか。

00:59:12,695 --> 00:59:18,856 [akira]

でもすでに良くないと把握してたりは全然してますよね。その理解できないところが問題じゃないと思うんですけど。

00:59:20,016 --> 00:59:34,756 [bioshok]

うん、 まあ確かにそうですね。ここは、 だから、 まあでもそうですね、 プロンプトでシャットダウン、 あてか、 なんかそのシャットダウンに抵抗するなとか言ってもなんか。

00:59:35,656 --> 00:59:41,676 [akira]

シャットダウンに抵抗するなって言ってシャットダウンに抵抗しなくてサブエージェント召喚するとかでもあるんじゃないですか。

00:59:41,696 --> 00:59:42,136 [bioshok]

うん。

00:59:43,196 --> 00:59:43,476 [akira]

その。

00:59:45,076 --> 00:59:46,836 [bioshok]

実際は多分アライメントのね。

00:59:47,256 --> 00:59:57,836 [akira]

実際に何かその世界に一個しかAIがないかのようなになってます。実際にその多分数十万ぐらいは数ヶ月の停止だったら、 多分ものすごい数のエージェントがループエンジニアリングとかで走り回ってるわけなので。

00:59:59,016 --> 00:59:59,896 [bioshok]

まあそうですね。

01:00:01,176 --> 01:00:06,276 [akira]

そういうところを考慮して、 本当にそんなにすごい値をゴールしますか?という話ですね。

01:00:07,716 --> 01:00:24,056 [bioshok]

うーん。確かにそのプロンプトでいろいろ言っても、 まあ現状でもなんかちょっとそれを無視することはありますからね。

01:00:24,896 --> 01:00:26,056 [akira]

そうですね。

01:00:26,076 --> 01:00:38,676 [bioshok]

ね、 かつ無視しないとしても、 えっと、 まあアウターアライメント的な問題が出てきて、 ハッキングされる可能性もあると。

01:00:38,756 --> 01:00:47,056 [akira]

そうですね。しかもあの、 あれですけど、 その基本的にタスク完了系の能力と全部逆行しているので。

01:00:48,196 --> 01:00:51,166 [bioshok]

タスク完了系の話してます?

01:00:51,376 --> 01:01:06,816 [akira]

要するにその、 あの強化学習の八十パーセントとかを占めるこのタスクを達成しなさいみたいな訓練によって養われる能力っていうのが。その全部、 あの、 基本的にシャットダウンに抵抗する方向に働くわけですよね。

01:01:09,036 --> 01:01:11,636 [bioshok]

ああ、 まあそうですね。うんうん。

01:01:12,936 --> 01:01:30,396 [akira]

で、 だからその解釈を、 その、 えーっと、 この前のAnthropicのインシデントのミトスの時みたいに解釈を歪めるみたいなことも起きて。起きやすくて、 そういうのも全部込み込みでなんとかなるってことですか。

01:01:34,576 --> 01:02:49,256 [bioshok]

うーん。そうですね。まあどこまで。対数スケールでこのイメージを合わせればいいのかっていう感じなんですけど。まあだからここで、 うん。まあもうすでに結構ハッキングが、 アウターアラインメントのハッキングが起こってるし、 プロンプトに従わないっていう事例もあるから。うん。アラインメントバイデフォルトの可能性は低いってのには、 まあ十パーセントもないんじゃないかっていうのは同意するんですけど、 一パーセント以下になるのか、 今考え中ですね。

01:02:49,416 --> 01:02:51,276 [akira]

まあまあ、 じゃあ一旦五パーセントぐらいで置いときましょう。

01:02:52,526 --> 01:02:58,016 [bioshok]

うん。まあそうですね。パーセントぐらいの。

01:03:00,276 --> 01:03:04,516 [akira]

だからこれは十五パーセントに下がったってことですか?

01:03:04,556 --> 01:03:12,356 [bioshok]

まあ単純な足し算だとそうか。まあ。まあそうですね。

01:03:12,516 --> 01:03:15,896 [akira]

次、 弱AGIで解決の話なんですけど。

01:03:16,996 --> 01:03:17,006 [bioshok]

うん。

01:03:17,096 --> 01:03:27,616 [akira]

弱いAGIがどうやって解決するんですか?その目標のエージェントの性質や目標について、 非常によく思考することなくアラインメント解くということですか。

01:03:30,796 --> 01:04:08,496 [bioshok]

うーん。まあデータセンターの天才たちの国みたいなイメージが弱AGIで、 つまり今の、 なんですかね、 数学の未解決問題とかを部分的に解いちゃうやつのもっと強力版みたいなのがイメージなんですけど。まあでもそれだと自律性が高くない、 そこまで高くないので。

01:04:10,936 --> 01:04:17,636 [akira]

ですよね、 自律性がそこまで高くないので、 アクティブに人類を破壊しにはこないってことですよね。

01:04:17,676 --> 01:04:18,996 [bioshok]

うん、 そうですね。

01:04:19,036 --> 01:04:21,836 [akira]

そうだとすると、 アクティブにアラインメントを解かせることもできなくないです。

01:04:24,316 --> 01:04:34,436 [bioshok]

うーん、 なんかそのアクティブにアラインメントを解くっていう言葉の意味ってどういう意味なんですかね。

01:04:35,296 --> 01:04:40,476 [akira]

いや、 その要するに、 その、AIの理論について多少は把握して。

01:04:40,556 --> 01:04:40,836 [bioshok]

はいはい。

01:04:41,496 --> 01:04:47,996 [akira]

で、 何を本質的に作れば安全なのかみたいな、 ある程度判断して、 そこからその近いモデルを作るみたいな感じですよ。

01:04:49,516 --> 01:04:49,976 [bioshok]

なるほど。

01:04:51,516 --> 01:05:08,736 [akira]

そうではなくて、 その、 ものすごい簡単に解くってことですか?そうするとその二重になりません?そのまず弱AGIがアラインメントちゃんとされ、 そのアクティブに破壊されていないこと。で、 次に無能すぎない、 無能すぎてアラインメントを間違えないこと。

01:05:09,696 --> 01:05:09,956 [bioshok]

うん。

01:05:12,336 --> 01:05:14,976 [akira]

ですよね。

01:05:16,216 --> 01:05:17,136 [bioshok]

そうですね。

01:05:17,536 --> 01:05:21,096 [akira]

さらにアラインメントが簡単っていうことですよね。

01:05:22,736 --> 01:05:36,576 [bioshok]

まあなんかアラインメントが簡単っていうのが割と前提に最初にあって。まあこの。

01:05:36,636 --> 01:05:48,096 [akira]

そのアラインメントが簡単というのはどういう意味なんですか。そのアラインメントが簡単な世界っていう風に言って、 それの曖昧さに、 その委ねてませんか?それは。

01:05:48,156 --> 01:05:52,526 [bioshok]

まあその曖昧さが二十、 に委ねて二十パーって置いちゃってますけど、 今は。

01:05:53,536 --> 01:05:57,076 [akira]

そうですよね。その簡単っていうのは例えばどのようなものが簡単なんですか。

01:05:58,936 --> 01:07:58,912 [bioshok]

うーん。まあ。そうですね。だからアラインメントバイデフォルトほど、 まあ楽観的ではないけれども、 まあ弱AGIで、 まあ今の自然言語対応エンコーダーみたいなものがもっと発展して。Anthropicのメカインタープ研究が、 なんだろうな。もう少し現状の、 なんだろうな、 裏切りの振る舞いと、 うん、 裏切りのニューロンの発火の、 まあ対応がついているっていうレベル。まあレベルを超え、 まあ超えて、 あれですかね。もう少し。なんだろうな、 その複雑な概念の組み合わせでいろいろ潜在空間で思考している、 まあAIの、 うん、 考えを、 ある程度読み取ることができて。で、 そこに、 まあ、 なんだろうな、 人間に対しての、 まあ従順さではないものに対する、 まず、 なんかこのサーキットとか。

01:07:59,752 --> 01:08:05,312 [akira]

人間に対する従順さっていうのの今度はその曖昧さに委ねてますね、 多分その。

01:08:05,352 --> 01:08:07,052 [bioshok]

うん、 あ、 なるほど。

01:08:07,332 --> 01:08:10,432 [akira]

人間に従順であるというのはどのような意味。

01:08:12,132 --> 01:08:19,672 [bioshok]

従順であるというよりは従順ではないもの?とは何かみたいな感じですかね。

01:08:20,112 --> 01:08:35,912 [akira]

そうすると目的を達成したいけど、 従順ではない思考はしてはいけないというふうに訓練されているとすると、AIの認知の中で従順ではあるけど、 人間実際には従順ではないという方向に、 を探すのに圧力がかかりますよね。

01:08:37,712 --> 01:08:39,452 [bioshok]

うーん。

01:08:42,672 --> 01:08:44,712 [akira]

その場合はAIがそもそもそれを悪いと思わない。

01:08:45,532 --> 01:08:45,972 [bioshok]

なるほど。

01:08:47,292 --> 01:09:06,792 [akira]

そういうのを検知できないですよね。それで何かしらでオープンになっていって、 もうちょっと緩くなる方にそういう方向で移動してしまって、 従順だと思ってるまま移動してしまって、 そこからスリップしたらもう、 ただただスリップしたミスマッチエージェントを放出してるだけになりますよね。

01:09:09,392 --> 01:09:15,502 [bioshok]

うん、 さっきのちょっと圧力がかかるってところをもう一度説明してもらって。

01:09:16,152 --> 01:09:29,192 [akira]

要するにその準AGIレベルだったとしても、 弱AGIレベルだったとしても、 その、 今のままいったら強化学習やって作られると、 その強化がプリトレーニング足すポストトレーニングの強化学習で作られることになるわけじゃないですか。

01:09:30,472 --> 01:09:31,352 [bioshok]

うん、 そうですね。

01:09:32,072 --> 01:09:35,512 [akira]

そうだとすると、 そのタスクを達成する能力を持つように圧力がかかりますよね。

01:09:36,452 --> 01:09:37,912 [bioshok]

ああ、 はいはい、 そうですね。

01:09:39,532 --> 01:09:49,932 [akira]

なのでそういう状態でタスクを達成したいと思っているエージェントに対して、 従順でない思考を禁止したり弱体化させるってことですよね。

01:09:51,632 --> 01:09:52,152 [bioshok]

ああ。

01:09:53,072 --> 01:10:02,892 [akira]

でもその場合は強く従順でありたいと思わせることができていないので。ネガティブチェックリストみたいになりますよね。実施的に。

01:10:02,902 --> 01:10:03,392 [bioshok]

なるほど。

01:10:04,312 --> 01:10:11,141 [akira]

で、 ネガティブチェックリストだとしたら、 自分の中で正当化される方式が取られませんか?

01:10:13,312 --> 01:10:14,252 [bioshok]

ああ、 はいはい。

01:10:14,492 --> 01:10:17,892 [akira]

その割と人間でもよく起こるタイプのバグというか。

01:10:18,412 --> 01:10:26,972 [bioshok]

まあだから会社に従順なふりをすることだけが結構上手くなるだけっていうことですよね。人間でいうと。

01:10:27,872 --> 01:10:39,972 [akira]

そうですね。いや、 なのでその、 だからあの、 前に書きましたけど、 その、 あの、 不正販売はするな、 売り上げのかさ増しはするな、 でも売り上げは絶対伸ばせみたいなことをやってるわけなので。

01:10:40,632 --> 01:10:40,832 [bioshok]

うん。

01:10:42,152 --> 01:10:57,252 [akira]

その、 そしたらその、 そういうふうに悪いとは本人が思わないように正当化されるようなものだけど、 売り上げを伸ばす方法が取られますよね。で、 それを探索する、 しますよね、 おそらくその、 ほぼ。

01:10:59,352 --> 01:11:31,252 [bioshok]

ああ、 なるほど。微妙な、 なんか積極的に、 まあ売り上げを伸ばすかつ倫理を、 まあ遵守するっていうよりは、 あれですかね、 まあその倫理をいかに外れるかっていうところを、 に、 まあ、 なんかそのフォーカスが行っちゃうってことですかね。

01:11:32,232 --> 01:11:41,892 [akira]

そうですね、 その倫理を外れると、 自分の中の学習した倫理では思ってないけど、 実際の人間の倫理では困るみたいな、 その判別が失敗してる領域を探し、 探し出しますよね、 その場合。

01:11:43,292 --> 01:11:43,572 [bioshok]

うん。

01:11:44,432 --> 01:11:46,652 [akira]

事前に。

01:11:47,932 --> 01:11:51,522 [bioshok]

まあ購買効果法が探し出しちゃうってことですか、 そういう領域を。

01:11:52,372 --> 01:12:07,572 [akira]

思考プロセスが探し出すっていうことですね。要するに、 その、 その時のAIの望ましさから見た地形みたいなのを考えると、 そのものすごいもともとの望ましさは高いやつは、 その不正判定なのでダメじゃないですか。

01:12:08,132 --> 01:12:08,512 [bioshok]

うん。

01:12:09,192 --> 01:12:13,512 [akira]

けど不正判定に、 だと思ってないところがあるわけですよね、 その判別の失敗で。

01:12:15,212 --> 01:12:15,692 [bioshok]

なるほど。

01:12:16,472 --> 01:12:43,212 [akira]

で、 そうしたらそこはただ望ましいものなので。それを探し出しませんか?その探し出すって言っても、 ただ成功法を探し出すという帰結として、 結果として、 その人間に従順ではないけど、 人間に従順だとAI自身は思っている何かが出てきますよね、 多分。それの確率で。

01:12:44,232 --> 01:12:58,292 [bioshok]

あの、 その人間に従順。それはなんかデセプティブってわけではないけど、 勘違いしてるAIが出てきちゃうとか、 イメージですかね。

01:12:58,572 --> 01:13:12,552 [akira]

そうですね。勘違いというか、 その正確に伝えられてないので、 これは従順であるみたいな正当化が可能な範囲でやっちゃうってことですね。

01:13:13,052 --> 01:13:13,782 [bioshok]

うん、 なるほど。

01:13:16,760 --> 01:13:33,650 [akira]

そのような失敗は全然ありません。うーん。しかもそのAIでそのASIアラインメント解くんですよね。

01:13:34,520 --> 01:13:46,580 [bioshok]

あ、 まあ一応ここの全体のモデルとしては、 まあ弱AGIが、 まあAGIのアラインメントを解いて、AGIがASIのアラインメント解くっていう。

01:13:47,480 --> 01:14:01,680 [akira]

そうですよね。でもそれは要するに、 そのどこかでそのAIのアラインメントを、 本当ASIアラインメント本当に解けるようなレベルのある意味で、 そのコアプログラムにアタックして、 それでもアラインメントされたAIでいるってことですよね。

01:14:03,440 --> 01:14:07,300 [bioshok]

まあ最終的にはそう、 アラインドASIにつながるってことですね。

01:14:07,360 --> 01:14:23,960 [akira]

そうですね。そのための途中過程に入りますよね。その、 そのための途中過程に、 そのAIの、 の、 まあ効用みたいなものもしっかり把握して、 それについて熟考しても、 人類に従って人類にアラインメントされたAIを作ろうとするAIがいるってことですよね。

01:14:25,460 --> 01:14:28,120 [bioshok]

うん、 まあそうですね。だからそれが。

01:14:30,100 --> 01:14:34,080 [akira]

そのAIのアラインメントは、 それは強くアラインされてますよね。

01:14:34,900 --> 01:14:36,100 [bioshok]

まあされてますね。

01:14:36,660 --> 01:14:41,380 [akira]

それを達成可能な未来全体について考案して、 それでも裏切らないっていうことですよね。

01:14:42,060 --> 01:14:42,900 [bioshok]

そうですね。

01:14:43,400 --> 01:14:49,140 [akira]

でもそれはそのアラインメント問題を丸ごと丸投げしてませんか?

01:14:49,160 --> 01:15:15,900 [bioshok]

うん。まあだからイメージとしてはプランAの最後の二零四零年までに何でしたっけ?テットAIがなんかアラインメントを解いていくみたいな描写あると思うんですけど。

01:15:15,980 --> 01:15:37,160 [akira]

あれはそのテットAIのためのブートストラップとして人間がものすごい努力をして、 テットAIが目標についても熟考しても人間にアラインメントされたAIができるようにしてますよね。そこはそのブートストラップじゃない。そのそこはその虚無からアラインメント出てこない、 コアアラインメントが出てきちゃってるの。バイオさんの言ってるやつだと。

01:15:37,200 --> 01:15:37,580 [bioshok]

うん。

01:15:38,640 --> 01:16:00,020 [akira]

人間は熟考しても、 その人間にアラインメントされてないAIを作ろうとし始めないですけど。その、 それは違う。それはその熟考しても、 自身が人間にアライン—人間と同じにアラインメントされたAIを作りたいと思うAIを作らなきゃいけないってことですよね。

01:16:00,160 --> 01:16:03,420 [bioshok]

まあそうですね。

01:16:06,740 --> 01:16:12,020 [akira]

ということは、 それはそのナッシングイン、 アラインメントアウトを仮定しません?途中で。

01:16:13,520 --> 01:16:13,960 [bioshok]

うん。

01:16:14,790 --> 01:16:19,880 [akira]

しかもこの場合ってテイクオフ早いんですよね。しかも数ヶ月しかないわけで。

01:16:20,020 --> 01:16:21,640 [bioshok]

まあそうですね。あ、 なんかずれた。

01:16:24,140 --> 01:16:27,320 [akira]

これだった。これか。え、 ですよね。

01:16:28,120 --> 01:16:29,720 [bioshok]

まあこれは数ヶ月しかないですね。

01:16:31,240 --> 01:16:42,180 [akira]

で、 その数ヶ月で人間がアラインメントをブートストラップせずに、 そのコアアラインメントの解決が突然向上してくるってことですか?

01:16:42,220 --> 01:16:42,940 [bioshok]

うーん。

01:16:46,120 --> 01:16:51,600 [akira]

それはその結局アラインメント問題が存在しないと仮定しているのとほぼ同じじゃないですか。

01:16:57,360 --> 01:17:48,800 [bioshok]

そうですね。まあ結構。ああ。そうですね。まあそこでだからアラインメントバイデフォルトほど楽観的ではなく。でもなんか、 なんですかね、 その深層学習の反論みたいなのを見つけなくてもいけちゃったみたいな。まあシナリオを考えてるってことですかね。

01:17:50,160 --> 01:17:54,060 [akira]

そうですね。その正当性がそんなにあるんですか?

01:17:54,080 --> 01:18:12,120 [bioshok]

うーん。でも確かにそうですよね。だから強AGIとかだと、 まあ普通にこの宇宙の外側まで考えるくらいの知的能力があるはずですよね。

01:18:12,200 --> 01:18:17,420 [akira]

そうですよね。そういう時に裏切らないAGIを先に作らなきゃいけないわけですよね。

01:18:17,510 --> 01:18:21,320 [bioshok]

うん、 それを弱AGIで作れるのかっていうとこですよね。

01:18:21,760 --> 01:18:32,220 [akira]

そうですね。それを、 でもそういう問題を解けるレベルで考えるんだったら、 そのその問題を解くために、 そういう未来が実存することについても考えられなきゃいけないんですよね。

01:18:33,600 --> 01:18:39,000 [bioshok]

まあそうですね。弱AGI、 多数人間の連合が考えられなきゃいけない。

01:18:39,120 --> 01:18:45,280 [akira]

そうですね。で、 人間がたった数ヶ月でその根本コア部分をブートストラップして解くってことですか。

01:19:05,660 --> 01:19:10,440 [bioshok]

まあそういう事前確率に振ってるってことですけど。

01:19:11,300 --> 01:19:15,420 [akira]

ただそれはその極めて妥当性が低くないですか?

01:19:15,620 --> 01:19:24,192 [bioshok]

アキラさんはじゃあこの。確率を提示したい、 してほしいって言ったらどれぐらいに出せますか?

01:19:24,352 --> 01:19:28,132 [akira]

まあまあまあ、 大体、 大体一パーセントより小さい値を出すと思う。

01:19:29,192 --> 01:19:31,392 [bioshok]

なるほど。

01:19:31,472 --> 01:19:41,472 [akira]

そのまず弱AGIが、 その考えて、 まあこういうプロセスを経ていく中で、 その人間が途中で犯す変な失敗とかがまず起きないってことですよね。

01:19:41,512 --> 01:19:41,932 [bioshok]

うん。

01:19:42,952 --> 01:19:52,992 [akira]

誰かがプロンプトを間違えるとか、 そのそういう変なあの動きが始まっちゃって、 コンテクストが汚染されて違うアラインメントを始めるみたいなことも起きなくて。

01:19:53,132 --> 01:19:55,052 [bioshok]

それヒューマンエラーってことですか?

01:19:55,072 --> 01:20:11,332 [akira]

そうそうそう、 その普通にOpenAIとかがガンガンやってるような、 ガン、OpenAIとかAnthropicとかガンガンやってるようなヒューマンエラーが全然起きずに。で、 さらに弱AGIがそれで大丈夫で、 そのまま走り続けて、 数ヶ月でASIアラインメントがブートストラップされるってことですよね。

01:20:13,112 --> 01:20:14,892 [bioshok]

まあそうですね、 そこで。

01:20:15,152 --> 01:20:31,172 [akira]

それが、 かつ正しいアラインメント策であって、 適切に実行されるということですよね。で、 それが開発においてあまりに不利にならず、 数ヶ月後にポーズを再、 が止まっても、 ポーズが開いても、 その後の最適自己改善で負けないということですよね。

01:20:33,012 --> 01:20:33,492 [bioshok]

うん。

01:20:35,632 --> 01:20:42,232 [akira]

それはその、 い、 むしろ対、 言って一パーセントも強いわけだと思うんですけど。

01:20:43,392 --> 01:20:45,692 [bioshok]

なるほど。それは -

01:20:46,412 --> 01:20:50,312 [akira]

でもそのミニマムアプローチでそうですよね。

01:20:50,392 --> 01:21:16,432 [bioshok]

じゃ、 弱AGIから、 そのAGIの、 その、 あ、 一旦ASIは置いといて、 その弱AGIからすごい自律性の高いAGIのアラインメントまでの確率と、 そっからのブートストラップの話ってまた別で掛け算があるってことなんですよね。

01:21:17,292 --> 01:21:39,032 [akira]

そうですね。そのブートストラップ自体ぶっ壊れてなくて、 かつその必要なレベルが十、 その弱AGIと人間で数ヶ月でアラインメント解くつもりなんだったら、 もっともっと高いということですよ。それが高くないんだったら、 もっと後ろでそういうどっかそのコアアラインメントをブートストラップする部分が必要なので、 そこで同じ問題に直面しますよね。

01:21:39,382 --> 01:21:59,992 [bioshok]

うん。じゃ、 弱AGIから、 その、 強AGI、 つまり、 まあホムンクルスに繁華するっていうところの、 のアラインメントの確率ってどれぐらいだと思いますか?

01:22:00,612 --> 01:22:01,952 [akira]

え、 何がですか?

01:22:01,972 --> 01:22:04,732 [bioshok]

まあつまりASIは一旦置いといて。

01:22:04,912 --> 01:22:05,172 [akira]

はい。

01:22:05,732 --> 01:22:09,532 [bioshok]

その弱AGIからAGIまでの。

01:22:11,212 --> 01:22:13,192 [akira]

それAGIってのは強AGI。

01:22:13,272 --> 01:22:13,752 [bioshok]

あ、 そうそうそう。

01:22:14,342 --> 01:22:17,912 [akira]

その、 宇宙の様々な事柄について考えて目標を熟考するということですか?

01:22:17,952 --> 01:22:18,572 [bioshok]

あ、 そうですね。

01:22:19,292 --> 01:22:22,552 [akira]

それはダメだと思いますね。

01:22:23,852 --> 01:22:26,552 [bioshok]

ダメっていうのは一パーセント未満で結構。

01:22:26,592 --> 01:22:33,392 [akira]

いや、 その優位に、 その持っている不確実性以外の全ての要素をもってして否定されるので。

01:22:34,512 --> 01:22:34,792 [bioshok]

なるほど。

01:22:35,892 --> 01:22:40,172 [akira]

その、 それはその私がわかりませんこうしか残らないですよ。その確率に。

01:22:42,572 --> 01:22:48,792 [bioshok]

ああ、 なるほど。え、 あの、 そ - そこが、 じゃあもし、 う - うまくいったとするじゃないですか。なんか知らないけど。

01:22:49,512 --> 01:22:49,672 [akira]

はい。

01:22:50,232 --> 01:22:58,892 [bioshok]

なんか知らないけどうまくいったことを条件付けとして、 そこからASIがアラインメントされる確率ってどれぐらいだと思いますか?

01:22:58,932 --> 01:23:01,732 [akira]

え、 そのAGIが奇跡的にブートストラップでアラインメントされたってこと?

01:23:01,772 --> 01:23:02,302 [bioshok]

あ、 そうそうそう。

01:23:02,302 --> 01:23:06,972 [akira]

コアアラインメントが。あ、 そしたら多分六十パーとかでゴールしてもいいと思いますね。

01:23:07,052 --> 01:23:16,792 [bioshok]

ああ、 なるほど。あ、 じゃあなるほどね。だから結構一番の難しさはAGIのアラインメントに。

01:23:16,832 --> 01:23:44,412 [akira]

いや、 っていうかその熟考、 熟考して宇宙の様々な方策について考えても、 自身が誤繁華であるというふうに思って気づいて、 自身が違う目標を探求し始めるのではないAIをアラインメントする、 を作ることがコアアラインメントで、 そのコアアラインメントのところがコアなだけあってコアなので。そこが全てですよね。

01:23:44,452 --> 01:23:44,932 [bioshok]

ああ、 なるほど。

01:23:45,112 --> 01:23:53,772 [akira]

その、 だからその僕はその数ヶ月の開発停止とかだったら、 もうそのアラインメントのアインシュタイン性ぐらいしか、 もうそのいう構成可能なシナリオは持ってないです。

01:23:55,252 --> 01:23:57,752 [bioshok]

アラインメントのアインシュタイン性っていうのは。

01:23:57,852 --> 01:24:02,632 [akira]

いや、 その要するに、 そのアラインメントに、 そのアインシュタインみたいな人間が現れて。

01:24:02,992 --> 01:24:05,852 [bioshok]

天才的な発想で奇跡的に解いたみたいな。

01:24:06,152 --> 01:24:32,992 [akira]

そうです。その突然その相対性理論の論文が出るみたいな感じで、 その全くパラダイムを全部ひっくり返すような、 その全てが。だからミリが何十年と十何年取り組んできて全然解けなかった問題が、 突然こう全部綺麗にスパッと解けて、 なるほど、 これを作ればいいんだなって、 ニューラルネットワークにたまたまそれが適用できて、 ニューラルネットワークで安定してそれを実装する理論が存在し、 発見された場合には、 もちろんいける可能性があると思いますけど。

01:24:34,492 --> 01:24:34,912 [bioshok]

なるほど。

01:24:35,652 --> 01:24:40,902 [akira]

それはその、 そんなに高い確率をコールするタイプのものではないですよね。

01:24:40,992 --> 01:24:42,082 [bioshok]

なるほど、 なるほど。

01:24:42,112 --> 01:24:50,652 [akira]

それはそれは、 それはその、 多分あの、 う、 え、 あの宇宙、ASI宇宙連合とかとあまり変わらないランクというか。

01:24:51,072 --> 01:24:51,432 [bioshok]

うん。

01:24:52,692 --> 01:24:59,772 [akira]

その楽観的な仮定を数々、 し - しかも怪しい楽観的な仮定をバンバン置いていかないと、 成立をしないプランは成功しないので。

01:25:01,492 --> 01:25:01,872 [bioshok]

なるほど。

01:25:01,892 --> 01:25:08,192 [akira]

それがその、 本当にその、 ああ、 不確実性以外では確率ゼロを考慮する感じになりますね。

01:25:09,092 --> 01:25:16,952 [bioshok]

なるほど。まあそうや、 ああ、 そうですね。僕も書こうかな。あれ?僕も書く。

01:25:23,948 --> 01:25:36,508 [bioshok]

あ、 こうか。あきらさんはここが割と。の1%に相当。

01:25:44,078 --> 01:25:45,248 [akira]

あれ、 大丈夫ですか?

01:25:51,208 --> 01:26:00,748 [akira]

あ、 本当だ書いてる書いてる。僕はだからこれがじゃあおよそおよそ1%未満って言われてます。

01:26:02,628 --> 01:26:05,788 [bioshok]

まあ0.1%みたいなイメージですかね。

01:26:06,668 --> 01:26:23,948 [akira]

そうですね。0.1%値はちょっとわかんないですけど、 その1%った時に1%生き残れますって言われたら、 まあその不確実性みたいな項があるから、 そんなに確実なものことは考慮しない方がいいと思っているけど、 その1%って言ってる人がいたら強気だなと思うぐらいの感覚ですよ。

01:26:24,048 --> 01:26:31,388 [bioshok]

ああ、 なるほど。

01:26:33,968 --> 01:26:41,948 [akira]

しかもその、 これってそのまだ我々が考えていないASIの領域で発生するクレイジーな問題が全部存在しないということですよね。

01:26:42,028 --> 01:26:48,208 [bioshok]

うん。だから今話してるのはAGIまでですよね。強い、 強いAGI。

01:26:48,448 --> 01:26:59,828 [akira]

いや、 だからそのAGIの、 じゃあわいさんの言う強いAGIの間で発生するかもしれない、 ありとあらゆるややこしい問題とかも、 その未発見のものが出現したりしないってことですよ。

01:27:02,048 --> 01:27:04,048 [bioshok]

うん、 まあつまりだからなんかよくわかんない。

01:27:04,788 --> 01:27:08,208 [akira]

あのコミットメントレースとか。

01:27:09,268 --> 01:27:20,088 [bioshok]

非因果的取引みたいな世界とかですよね。意思決定理論における未解決の様々な問題というか。

01:27:20,908 --> 01:27:37,188 [akira]

っていうのが全部出現したりせず、 さらに我々が見つけてもないような問題が起きてないと。その我々がそのチンパンジーの後から、 その言語というパラダイムが始まり、 色々ややこしいものがたくさん出現したみたいなことが起きないってことですね、 そこまでに。

01:27:37,308 --> 01:28:34,868 [bioshok]

うーん。んな、 なんだろうなぁ。まあその、 でも確かに強いAGIっていうのは、 まあ現状の人類をまあ相当超えてると思われるので。うん。まあアインシュタイン、 アインシュタインが全分野に精通していて、 相当100倍速でいろいろ考えることができるみたいな。うーん。だからそうか、 まあだからこれをどっかでは解決しなきゃいけないですもんね、 このテイクオフの世界だと。どこかでコアアライメントの問題が出てくると。

01:28:34,948 --> 01:28:41,268 [akira]

そうですね。突然ナッシングイン、 コアアライメントアウトしないといけないので、 このプランだと。

01:28:41,328 --> 01:28:58,388 [bioshok]

うん。なんかこれはその、 なんだっけ、 アンチドゥーマーアキラだったらなんか言えることとかないんですか?頭の中で。

01:28:58,848 --> 01:29:01,248 [akira]

いや、 これは敗北した過程なのでダメですね。

01:29:01,308 --> 01:29:09,648 [bioshok]

あ、 敗北したから言えないんだ。じゃあ敗北する過程を見せてくれないですか、 一回。

01:29:09,688 --> 01:29:10,728 [akira]

いや、 同じような。

01:29:10,808 --> 01:29:13,978 [bioshok]

同じような感じですか?この一二三四。

01:29:14,068 --> 01:29:23,668 [akira]

反駁かと。一二三四は、 一はあれですね、 えーと、 実証的証拠によりどんどん落ちていきますよね。

01:29:24,368 --> 01:29:24,908 [bioshok]

まあはい。

01:29:26,648 --> 01:29:32,388 [akira]

で、 これをだから強化しようとすると、 そのペルソナセレクションモデルに落ち着きますよね、 多分。落ち着きますよね。

01:29:33,648 --> 01:29:33,868 [bioshok]

うん。

01:29:35,028 --> 01:29:37,948 [akira]

そのペルソナセレクションモデルは実体化したものなので。

01:29:39,018 --> 01:29:39,018 [bioshok]

うん。

01:29:39,018 --> 01:29:51,788 [akira]

で、 ペルソナセレクションモデルのもとでなんとかなってるかという話で議論が始まり、 なんとかなっていないので。で、 さらにそのこの後、 あれだけどんどん伸びていく過程の外装の中でどんどん悪い方向に伸びてますよね。

01:29:53,628 --> 01:29:53,888 [bioshok]

うん。

01:29:54,548 --> 01:30:03,988 [akira]

で、 この後、 もともと人間が扱ったことがない遠くの領域に突撃するってことですよね。そのそこの反感をさすがに防御できるほどのあれはないですね。

01:30:04,068 --> 01:30:04,408 [bioshok]

なるほど。

01:30:05,468 --> 01:30:13,948 [akira]

で、 そのジェネレーションしようとすると、 その絶対に他の部分がぐっちゃぐちゃになるようなガバガバジェネレーションしかできないと思います。

01:30:16,068 --> 01:30:31,828 [bioshok]

まあ、 ペルソナセレクションモデルはまあどっちかというと、 そのタスクを強化学習で今訓練してるところで壊れまくっているっていうことですよね。

01:30:33,208 --> 01:30:35,548 [akira]

そうですね。

01:30:38,548 --> 01:30:48,108 [bioshok]

しかもなんかペルソナセレクションモデルはなんか弱いタスクの領域だったらまあ禁じできるかもしれないですけど。

01:30:49,028 --> 01:31:19,568 [akira]

人間の一般的な認識プロセスの外にあるような領域において、 人間と同じそのオントロジーを使ってシンキングをしていて、 それをゴールシステムがヒットしてるってことですよね。そもそもそのアウトオブディストリビューションじゃないところでもヒットしてないものがヒットするという過程を防護できるのはさすがに存在しないので。存在しないというか、 その一般的な方法で発見はできなかったので。

01:31:19,668 --> 01:31:20,928 [bioshok]

なるほど。

01:31:20,968 --> 01:31:45,376 [akira]

その、 ここ、 この時点で既にその全体として神のような過程を大量に重ねているので、 そもそも人間が失敗しないですし。人間が何も失敗しないという仮定はその、 あの、 本来は置くべきじゃないというか。その仮定が入ってる時点で、 多分一般的にはプランの成功率はおよそゼロになるんで。

01:31:47,936 --> 01:32:11,316 [bioshok]

まあだからこの。なんて言うんですかね。色を変えよう。なんかヒューマンエラーがない。ヒューマンエラーがなしっていう。

01:32:11,656 --> 01:32:13,096 [akira]

そうですね。

01:32:15,476 --> 01:32:22,756 [bioshok]

まあ確率と。何ですかね。

01:32:23,856 --> 01:32:27,436 [akira]

これどのどのシナリオのためのやつ?どの方法のためのやつですか?

01:32:28,376 --> 01:32:31,516 [bioshok]

アライメント成功ですね。ここの。

01:32:31,616 --> 01:32:36,936 [akira]

だとしたら、 その、 まず弱AGIがmisaligned、 アクティブにmisalignedではないことですよね。

01:32:38,536 --> 01:32:50,916 [bioshok]

まあそうですね。まあここでなんか掛け算かけますか?今林さん。

01:32:51,016 --> 01:32:55,276 [akira]

ああ、 いや、 掛け算は多分綺麗にいかないというか、 あれですけど、 そのブートストラップ。まあまあ大体大体。

01:32:56,216 --> 01:33:54,236 [bioshok]

大体でいいんで。ちょっと僕だと。ミスアラインドではない、 かける。

01:33:59,656 --> 01:34:05,326 [akira]

大体こんな。多分僕が今パッと思いつくのはこの辺です。あれ?なんか一部消えてません?

01:34:05,396 --> 01:34:11,376 [bioshok]

うん。あ。消えてますか?書き足して。

01:34:12,476 --> 01:34:27,316 [akira]

いやいやいや、 じゃあ。こうじゃないですかね。

01:34:29,276 --> 01:34:40,096 [bioshok]

はいはい。ヒューマンエラーなし。

01:35:02,776 --> 01:35:14,276 [akira]

こういうことじゃないですか。

01:35:15,516 --> 01:35:39,476 [bioshok]

なるほど。ヒューマンエラーがなく、 弱AGIがアドバーサリーmisalignedではなく。弱AGIからコアプロブレムソリューション、 ブートストラップできて。まあ弱AGI以降の全て、 で、 アライメントに成功し続ける。

01:35:39,516 --> 01:35:59,116 [akira]

ですね。あと多分、 小さい順で多分ここが一番やばいですね。ここが一番やばくて、 それかここかここがやばいんですよね。

01:36:01,065 --> 01:36:03,776 [bioshok]

うん。

01:36:06,356 --> 01:36:23,636 [akira]

で、 ここはそんな、 その致命的なエラーっていうのとわかんないんですけど、 あれで。で、 これは割とその弱AGIから強AGIの領域ぐらいまでが。怪しくて。

01:36:23,676 --> 01:36:23,996 [bioshok]

うん。

01:36:25,356 --> 01:36:27,036 [akira]

それ以降は割と安定だと思います。

01:36:28,676 --> 01:36:33,416 [bioshok]

なるほど。

01:36:35,656 --> 01:36:47,176 [akira]

ここがその予想外で対処不能な奇妙なことが起きる。感じですね。

01:36:49,436 --> 01:37:11,716 [bioshok]

うん。まあヒューマンエラーとか、 まあ強AGI以降のアライメントに成功し続けるってのは、 まあ。ヒューマンエラーがなくすこともある、 ギリギリできるかもしれないしってことですよね。

01:37:11,856 --> 01:38:02,406 [akira]

じゃああれですかね、 その後ブートストラップされた後に。負けないことも必要ですね。これはガバガバナンスによりますけど。数ヶ月なんですよね。数ヶ月の間にその国内でリードを燃やすぐらいじゃないですか、 それは。

01:38:02,446 --> 01:38:18,266 [bioshok]

うん。まあまあこれ世界的な競争とですね、 次は。うん。

01:38:20,226 --> 01:38:25,246 [akira]

その数ヶ月しか調整しないだったら、 多分その一国内調整の可能性ありますよね、 結構。

01:38:25,726 --> 01:38:26,466 [bioshok]

まあまあそうですね。

01:38:27,346 --> 01:38:36,306 [akira]

そうだとすると、 そのむしろ負けそうな雰囲気に押されて、 そのちゃんとアラインメントしないまま中国とかがぶっ壊してくる可能性ありますよね。

01:38:36,346 --> 01:38:36,726 [bioshok]

うん。

01:38:37,866 --> 01:39:04,966 [akira]

で、 そのアラインメントタスクが高すぎたら、 その後仮にコアプログラムをブートストラップできても、 そのRSI競争に負けて、 そのAI自体は敗北していく可能性は全然ありますよね。てか敗北っていきますよね。しかも年みたいなスピードで勝負してるんだとしたら。で、 しかもアラインメントとしたら、 そのすごい勢い強くあれなんじゃないんだったら、 そのマキャベリズムみたいなことはできないはずなので。

01:39:05,006 --> 01:39:05,186 [bioshok]

うん。

01:39:06,286 --> 01:39:18,806 [akira]

その、 片やその中国の方は国内世論を分断してデータセンターを襲撃させてみたいな風にあれこれよくない技を駆使してくるけど、 こっちはでき、 それができないで、RSI競争も不利ってことですよね。

01:39:21,146 --> 01:39:22,466 [bioshok]

まあそうですね。

01:39:23,586 --> 01:39:29,646 [akira]

そういうオーバーオールが入っても競争に勝たなきゃいけないんですよね、 この数ヶ月間の開発停止の中で。

01:39:33,906 --> 01:39:38,866 [bioshok]

まあ確かにそこは最後のやつはもう考えてなかったですね。

01:39:39,946 --> 01:39:56,506 [akira]

え、 てか多分そのまだ僕もバイオさんも見てないものが多分おそらくあり、 そういうの込みで低くしてる感じですか。まあそういうの込みではない、 そういうの込みじゃなくても、 それは遠慮してるというかあれなんですけど、 実際の値がなんでもっと悪いとは思ってます。

01:39:58,266 --> 01:39:59,126 [bioshok]

なるほど。

01:40:00,706 --> 01:40:07,006 [akira]

で、 こういうのを全部合わせて二十パーセント、 十多分五パーセントもコールするのも強いよねという感じですね。

01:40:12,926 --> 01:40:15,206 [bioshok]

そうですね。じゃあ。

01:40:15,906 --> 01:40:26,326 [akira]

本当に本当にそこで、 その合計で二十パーセントの生存率どころか五パーセントでも、 僕は割と一パーセントって言われても、 えーすごいですねって答えたくなるというか。

01:40:26,486 --> 01:40:26,626 [bioshok]

なるほど。

01:40:27,406 --> 01:40:29,506 [akira]

AI宇宙連合があるんですか?みたいになりますね。

01:40:35,046 --> 01:40:58,266 [bioshok]

その一パーセントでも高いっていうのは、 この掛け算が、 まあこの、 なんだろうな、 一番大事な、 この弱AGIがアドバーサリーミスアラインドじゃないっていうのと、 弱AGIからコアプロブルームソリューションをブートストラップできて、 この二つが。

01:41:00,666 --> 01:41:01,176 [akira]

一番やばいです。

01:41:01,386 --> 01:41:07,166 [bioshok]

一番。弱AGIがアドバーサリーミスアラインドではないってつまり。

01:41:08,686 --> 01:41:21,146 [akira]

この二つはその相互関係にあるという、 その、 あるというか、 弱AGIがアドバーサリーミスアラインドじゃないんだったら、 その弱AGIの後ろにそのコアプログラムが初めて必要になるやつですよね。

01:41:22,486 --> 01:41:22,846 [bioshok]

ああ。

01:41:23,866 --> 01:41:35,146 [akira]

そのアドバーサリーミスアラインドになるポイントが弱AGIにあるんだったら、 そこまでに解いてないとコアプログラムが解かれてないと死にますし、 弱AGI後ろにあるんだったら弱AGIを使ってコアプログラムを解かなきゃいけないんで。

01:41:35,246 --> 01:41:36,286 [bioshok]

うん。

01:41:36,466 --> 01:41:46,336 [akira]

この二つの両方を高く取れるような、 その片方を安全な方向にシフトすると、 もう片方が不安定な方向にシフトするということですよ。

01:41:48,706 --> 01:42:03,105 [bioshok]

なるほど。まあそうか。アドバーサリーミスアラインドではないなら、 じゃあ今度はこのコアプログラムがめちゃくちゃ後に控えてて。

01:42:03,786 --> 01:42:09,646 [akira]

そうそう。で、 それがそのコアプログラムがブートストラップできいく確率が下がるので。

01:42:09,706 --> 01:42:10,006 [bioshok]

うん。

01:42:11,106 --> 01:42:18,546 [akira]

まあけど実際にはなので、 この数ヶ月の開発停止がうまくいくシナリオっていうのは、 全て数ヶ月の開発停止じゃなくなるシナリオだと思いますね。

01:42:20,046 --> 01:42:24,206 [bioshok]

あ、 どこかで開発がもっと遅れ -

01:42:24,286 --> 01:42:43,746 [akira]

弱AGIがアドバーサリーではないけど、 割とアクティブめに、 そこまでではないけど、 比較的にアクティブめにアラインドであって、 その結果としてアラインメントの難しさなどをちゃんと納得可能な形で提示することによって、 開発停止がとんでもなく伸びるみたいな、 そういう話になりますね。

01:42:44,286 --> 01:42:46,466 [bioshok]

ああ、 なるほど。

01:42:48,866 --> 01:43:00,466 [akira]

けど、 その数ヶ月の停止というシナリオなんだったらうまくいかないと思います、 それは。そのシナリオで二十パーセントの成功率をコールする人がいたら、 僕はそのかなりの衝撃を受けるというか。

01:43:02,126 --> 01:43:21,846 [bioshok]

なるほどなるほど。そう考えると、 だからあれですよね。まあ彼らがどう考えてるかわかんないけど、AIフューチャーズプロジェクトのパーセント以上を振ってるじゃないですか。なんかいろんな、 一応競争シナリオで。

01:43:23,486 --> 01:43:23,636 [akira]

そうですね。

01:43:23,636 --> 01:43:25,946 [bioshok]

それがなぜかっていうところが気になりますよね。

01:43:26,346 --> 01:43:36,266 [akira]

もしかしたらそのフェイキングしてるのかもしれないですけどね。実際にやったら停止が伸びるだろうと思ってのかもしれない。やらないよりやった方がいいですよ。

01:43:37,566 --> 01:43:38,006 [bioshok]

ああ。

01:43:38,046 --> 01:43:42,886 [akira]

その、 その、 ここにはそのAI2027のレースシナリオみたいなノリが存在してないじゃないですか。そもそも。

01:43:45,894 --> 01:43:48,214 [bioshok]

えっと。

01:43:48,254 --> 01:43:55,374 [akira]

えっと、 その要するに開発停止が一回も挟まれないというケースの確率が零パーセントなのもそもそもおかしいというか。

01:43:55,494 --> 01:44:01,134 [bioshok]

ああ、 開発停止。ああ、 なるほどね。ずっとずっと全力で行っちゃうシナリオってことですね。

01:44:01,454 --> 01:44:20,994 [akira]

そうそうそう。え、 でも逆に言うとその、 僕が最初に言いたかったそのコンディションのあるなPDもえげつないということですよね。要するにそのショートタイムラインで、 まあ割とファスト目のテイクオフであり、 かつ一切の規制が入らない場合のPDームは、 そのPノットドゥームが一切構成されないですよね。楽さま。

01:44:22,034 --> 01:44:30,694 [bioshok]

うん、 まあ、 そうですね。まあそれだと、 まあアライメントバイデフォルトみたいなのが正しい。

01:44:32,294 --> 01:44:39,174 [akira]

えーと、 それが短時間で、 そのRSIをブ、 ブ、 短時間でコアプログラムをブーストストラップして開発要素に負けないということですよね。

01:44:40,674 --> 01:44:41,334 [bioshok]

まあそうですね。

01:44:42,014 --> 01:45:00,554 [akira]

そのアンノウン、 アンノウン、 アンノウンズしかなくないですか、 それは。まあなのでそのわかりませんこうで五パーセントとかを追加するのはあれですけど、 その、 ま、 なんか結局物事がわからないので、 その構成不能なPDームを残しておきますみたいな。Pノットでも残しておきますとかだったらわかりますけど。

01:45:01,154 --> 01:45:01,413 [bioshok]

はいはい。

01:45:02,714 --> 01:45:08,954 [akira]

その、 それはその実際に言うべきではないというか、 その何も知らないだけですこうなので。

01:45:09,074 --> 01:45:09,434 [bioshok]

なるほど。

01:45:10,114 --> 01:45:25,334 [akira]

それもしもそういう正確性が必要だったら、 僕はまあ一応怖いので一パーセントぐらい下げたりして九十九パーセントがコールしたりしますけど。なんかバイオさん、 あのパソコンでメモ打ってるんじゃないか、 その画面を見せてほしいってきてるんですけど、 打ってます?メモ。

01:45:31,414 --> 01:45:32,934 [bioshok]

そういうのないですね、 今は。

01:45:34,194 --> 01:45:37,174 [akira]

ないらしいです。

01:45:39,474 --> 01:46:30,434 [bioshok]

そうですね。だから、 まあ基本的に。そうか、 だからアライメントの。うん。で、 なんかほぼほとんど、 アキラさんがこのダイアグラムを書くとしたら、 なんだろうな。このアライメントの成功確率って、 ここが、 すぐ開発停止ってところが、 まあほとんど零点一パーセントみたいな世界になって。で、 どっかでステップ関数的に上がるって感じですかね。開発停止期間を延ばす。

01:46:30,474 --> 01:46:38,854 [akira]

いや、 ステップ的に上がるというよりは、 こう、 張り付い、 地面に張り付いているものがゆっくり上がっていく感じですかね。

01:46:38,894 --> 01:46:40,074 [bioshok]

うん、 なるほど。

01:46:40,114 --> 01:46:44,794 [akira]

その数年だったら、 多分三年とかの間だったら、 そのアインシュタインルートしかないので。

01:46:46,314 --> 01:46:46,574 [bioshok]

はい。

01:46:47,214 --> 01:46:58,454 [akira]

張り付いてもっと伸びれば、 その集合知というか、 その形式が整理されて、 ちゃんと科学の方法で発達し始める可能性があるので。伸びるという感じですね。

01:46:59,474 --> 01:47:03,654 [bioshok]

じゃあ数年は張り付いてて、 なんかその。

01:47:04,234 --> 01:47:05,974 [akira]

一年ぐらいは多分張り付いてます。

01:47:06,794 --> 01:47:13,514 [bioshok]

一年ぐらいは張り付いてて、 それ以降はちょっとずつ確率、 成功確率は上がっていくっていう感じですかね。

01:47:14,234 --> 01:47:24,134 [akira]

そうそうです。で、 まずそこら辺はこう、 その、 まだその事態が分かってないから不確実性も起きるよねという楽観も、 おけ、 ちょっと起きるので。

01:47:27,974 --> 01:47:49,034 [bioshok]

なるほど。一応あれですよね、 あ、 アキラさん的には、 もうテイクオフスピードが、 ファストテイクオフからモデレート、 スロー、 ロングってなっていけばいくほど、 アライメントの成功確率って高くなる、 高くなる。

01:47:50,314 --> 01:47:52,254 [akira]

何あれですか?テイクオフがですか?

01:47:52,294 --> 01:47:55,744 [bioshok]

そうですね、 テイクオフが遅ければ遅いほど、 時間は。

01:47:55,934 --> 01:48:05,613 [akira]

もちろん、 相対的、 相対的には高くなっていきます。けど、 そのテイクオフが続いてるケースの問題点は、 そのAI開発が加速してるってことですよね。

01:48:08,494 --> 01:48:08,754 [bioshok]

まあ。

01:48:09,454 --> 01:48:19,834 [akira]

その、 お、 その追いつ、 追いつきレースで、 その仮に時間があったとしても、 その間ずっと車が加速してるんだったら、 後ろから追いつくのは結構難しいですよね。

01:48:20,814 --> 01:48:22,394 [bioshok]

その後ろから追いつくっていうのは。

01:48:23,694 --> 01:48:28,004 [akira]

そのアライメント、 もうもっと加速、 アライメントが加速しても。

01:48:28,034 --> 01:48:28,594 [bioshok]

はいはい。

01:48:29,474 --> 01:48:40,254 [akira]

その難しいと。アライメントが加速してもAI開発がもっと加速してるんで。その、 その開発停止がされている場合に比べてハードルが高くなりますよね、 断然。

01:48:40,994 --> 01:48:41,974 [bioshok]

まあそうですね。

01:48:42,374 --> 01:48:52,554 [akira]

純粋に開発停止してる場合はアライメント速度、 アライメント速度なんですけど、 そうじゃないスローテイクオフであっても、 そのテイクオフの間AI開発は加速してるわけですし、 今のAI開発とかより早いわけですよね、 一応スローテイクオフでも。

01:48:54,934 --> 01:49:14,254 [bioshok]

うんまあ、 そうですね、 ある程度早いけど。まあでもそのAGIができるまで時間があるので、 あの、 まあ例えば二千四十五年にAGIみたいな感じになるんですね、 多分スローテイクオフだと。

01:49:14,734 --> 01:49:18,294 [akira]

ロングタイムラインってことですか?ロングタイムラインだったらその開発停止に似た感じになるので。

01:49:18,814 --> 01:49:26,414 [bioshok]

あ、 そうそうそうそう。まあ、 まあそのロングタイムラインとスローテイクオフって多分相関してるので、 その。

01:49:27,114 --> 01:49:37,274 [akira]

相関はしてないと思います。ショートタイムライン、 ロング、 ショートタイムラインで、 えっと、 スローテイクオフっていうのが、 例えばOpenAIとかじゃないですか。メカナイズとか。

01:49:38,454 --> 01:51:18,126 [bioshok]

あのー、 メカナイズとかは、 えー、 えっと、 スローテイクオフ、 ロングタイムラインで。で、OpenAIはまあなんていうかAGIっては言ってるんですけど。多分本気でショートタイムラインを考えてるのかちょっと怪しいって思ってますね。なんかまあだから、 そのファストテイクオフっていうのは、 まあその、 なんて言うんですかね、 より再帰的自己改善が起こりやすい世界なので、 あんまり計算資源とかいらないので、AGIタイムラインも短くなりやすいっていうのがあって。あとはスローテイクオフだとAGIっていうか、 なんかその再帰的自己改善が起こりにくくなるので、 つまり計算資源がより必要になって、AI研究を自動化するためにも。そうするとAGIタイムラインも長くなるっていう関係があるって感じですかね。なので、 まあ論理的には一応分離はしてますけど、 概念としては。相関っていうか、 なんかそのAGIタイムラインが短ければ短いほどファストテイクオフになりやすいし、AGIタイムラインが長ければ長いほどスローテイクオフになりやすいっていう感じは感じだと思います。

01:51:18,366 --> 01:51:29,366 [akira]

ちなみにこのスローテイクオフ、 ファストテイクオフでいつも気になってるのが一個あって。常にそのほぼ低速みたいなノリでASIまで行くかどうかで考えてますよね。

01:51:31,486 --> 01:51:31,906 [bioshok]

ASI。

01:51:32,166 --> 01:51:33,986 [akira]

ASIまで行く時間で測ってますよね。

01:51:35,026 --> 01:51:38,906 [bioshok]

あ、 まあそうですね。

01:51:39,266 --> 01:51:47,586 [akira]

人類を吹き飛ばすレベルまではソフトウェアだけでバンバンブートストラップ、 バンバンバン能力を伸ばして、 そこからは伸びる、 伸びにくいみたいなケースもありますよね。

01:51:49,586 --> 01:51:51,846 [bioshok]

人類が滅びる。

01:51:52,126 --> 01:52:04,746 [akira]

人類を滅ぼせるレベルまでその自身の実行速度化するとか、 その行列演算の効率化みたいな。その、 要するにその、 なんでしたっけ?えーっと、 ローハンギングフルーツか。

01:52:04,866 --> 01:52:05,806 [bioshok]

ああ、 はいはい。

01:52:06,886 --> 01:52:30,586 [akira]

をいっぱい見つけてきて、 バンバン回収して、 その自身の同じ計算資源での自身のローン値数とか実行速度をめちゃくちゃ大きくして。で、 その世界に影響力を行使するっていう、 世界に影響力を行使して負けを回避するっていう。ようなことができるようになるけど、 そこからガチの超知能まで十年かかるシナリオもスローテイクオフですよね。

01:52:30,626 --> 01:52:31,286 [bioshok]

うん。

01:52:32,486 --> 01:52:40,206 [akira]

え、 その、 そのテトAIとかAGIとかASI以前にそのヒューマニティエンディングAIがその定義できるはずで。

01:52:40,326 --> 01:52:41,086 [bioshok]

ああ、 なるほど。

01:52:42,086 --> 01:52:45,346 [akira]

大事なのはその、 そのヘッドAIの方なので。

01:52:47,686 --> 01:52:54,266 [bioshok]

なるほどなるほど。確かにそれはヒューマニティがエンディングAIは。

01:52:54,426 --> 01:53:08,386 [akira]

が、 そのASIとAGIよりも高いのかっていうのはまた別というか、 そのAGIレベルだったら、 ソフトウェアで急速にヒューマニティエンディングAIまでそのファストでハードでテイクオフしてみたいなことはできますよね。

01:53:10,226 --> 01:53:11,526 [bioshok]

まあそうですね。

01:53:12,406 --> 01:53:32,826 [akira]

で、 そういうのを込みでそのテイクオフで分けるんですかっていうのが気になりますね。その、 こうだと、 そのファストテイクオフにはその二十パーセントとかしか置かれてないですけど。その超ASIまでは一年以上かかるけど、 このヒューマニティヘッドAIまでは一年以内に行く可能性は全然もっとあるんじゃないですか。

01:53:35,506 --> 01:53:46,146 [bioshok]

ああ、 その可能性はありますね。まあ多分超知能まで行かなくてもAGIぐらいで。まあなんか滅ぼせるとは思うんで。

01:53:47,206 --> 01:54:06,685 [akira]

勝利を確定できますよね。その瞬間にそれ単体で人類を滅ぼせなくても、 もうその後人類が滅ぼせる状況を確立しちゃうことができますよね。その政治的に圧力をかけて、 ロボットの導入を進めさせて、 他のAI開発を妨害してみたいなことをすれば、 そのセイブルの物語みたいになりますけど。

01:54:06,806 --> 01:54:07,806 [bioshok]

ああ、 なるほど。

01:54:08,346 --> 01:54:10,746 [akira]

あれってそのASIには全然到達してないじゃないですか。

01:54:11,806 --> 01:54:13,086 [bioshok]

うん、 なんかしてないですね。

01:54:13,826 --> 01:54:16,106 [akira]

けどあれは勝ちを確定させてるじゃないですか、 あのレベルで。

01:54:17,846 --> 01:54:18,926 [bioshok]

そうですね。はい。

01:54:19,106 --> 01:54:21,726 [akira]

あのシナリオだとセイブルはそのヘッドAIなわけじゃないですか。

01:54:23,786 --> 01:54:25,166 [bioshok]

まあそうですね。

01:54:26,026 --> 01:54:37,146 [akira]

ヘッドAIがそんなに高いところにある、 あって、 そんなにすぐ到達できないのかっていうのは、 その、 かなり自信を持ってコールしないといけないものじゃないですか。じゃないですか。

01:54:38,126 --> 01:54:50,166 [bioshok]

まあそうですね。どっちかっていうと、 あのこのグラフはAGIタイムラインだと思ってほしいですね。このテイクオフって書いてありますけど。

01:54:50,286 --> 01:54:56,406 [akira]

でもそのAGI二千三十年とかなんで、 これは違うんですか?そのAGIの方とテイクオフの方で別にあるっていうのじゃないですか。

01:54:57,586 --> 01:55:32,766 [bioshok]

あ、 まあでも結構ここが相関してるって思ってるって感じですかね。そのテイクオフスピードが早ければ早いほど、 例えばAGIが二千三十年ぐらいになるし。テイクオフスピードが遅ければ遅いほど、 どんどんこうAGIタイムラインも長くなるっていうことなんで。まあ、 だからAGIタイムラインが、 まあつまり大体多分て、 なんだっけ、 ヒューマニティエンディングAI?

01:55:32,826 --> 01:55:33,106 [akira]

そうですね。

01:55:33,206 --> 01:55:48,546 [bioshok]

に近いと仮定はしてるんですけど。まあ、 だからそうすると大体二千、 スローテイクオフとかと、 まあ二千四十年代ぐらいまでにはそういうのが出てこないっていうイメージですかね。

01:55:50,722 --> 01:55:52,942 [akira]

なるほど。

01:55:53,022 --> 01:56:05,362 [bioshok]

で、 ロングタイムラインとかだと二千百年まで。に出てくる。ベリーロングタイムラインだと二千百年以降でやっと出てくるみたいな。

01:56:06,222 --> 01:56:16,822 [akira]

こんなに後ろに置くんです。テイクオフっていうか、 そのタイムライン論争をあまり好きじゃないというか、 そんなに自信を持ってコールするのはできないのであれですけど、 これは後ろ向きに自信を持ちすぎじゃないですか。

01:56:16,942 --> 01:56:38,142 [bioshok]

うーん。自信を。だからどうなんですかね。だから僕は二千四十五年ぐらいまでには七十五パーセントの確率でAGIができると思ってるって思ってるんで。なんか、 なんだ、 すごい。

01:56:38,422 --> 01:56:51,562 [akira]

ヘッドAIにRSIできるようなAIができないってこと、 できる確率がそんなにあれなんですか?その、 もうちょっと前方寄せするものかなと思いましたけど。まあ自由ですけど。

01:56:51,682 --> 01:57:32,662 [bioshok]

ああまあまあ、 ここはどっちかっていうとなんか知能、 汎用知能ってなんか思ったりすごい難しかったみたいな確率も置いてるので、 例えば脳のシミュレーションとかをしないと無理だったみたいな。今のニューラルネットワークのスケーリングだと、 どうしてもなんかボトルネックがあって、 その人間の脳の仕組みを解明して、 なんですかね、 エミュレーション、 ブレイン、 そのホールブレインエミュレーションをしないと無理だったみたいな世界も考えてるって感じですかね。

01:57:33,882 --> 01:57:40,082 [akira]

それでも現時点で止まっても百年あれば全然いけそうじゃないですか。百年明けあればいけるんじゃないですか。

01:57:40,222 --> 01:57:47,242 [bioshok]

そう、 百年あればいけると思ってるんで、 九十パーセントでいけると思ってる。二千百年までに。

01:57:47,362 --> 01:57:48,022 [akira]

なるほどなるほど。

01:57:48,642 --> 01:58:09,622 [bioshok]

けど、 まあなんかよくわかんないですけど、 それよりもかかる可能性もなんか十パー置いてますけど。それはよくわかんないですね。なんで、 何、 何かしら。でできない可能性ですかね。

01:58:12,642 --> 01:58:25,782 [akira]

なるほど。で、 このちなみに図解にあってですけど、 十年の開発停止でアライメント成功が百パーセントってのはどういう、 どういうことなんですか?その、 全然ミスってることもあるというか、 ミスりやすいというか。

01:58:26,722 --> 01:58:33,742 [bioshok]

つまりこれはミスです。だからこの百パーセントとは思ってないですね。

01:58:34,162 --> 01:58:38,042 [akira]

なるほどなるほど。九十パーセントも多分強すぎると思いますね。

01:58:38,122 --> 01:58:39,202 [bioshok]

ああ、 強すぎるかな。

01:58:39,762 --> 01:58:44,442 [akira]

その実際にコーディングする時に犯すミスとか、 論理的思考において発生しているミスとか。

01:58:45,362 --> 01:58:45,661 [bioshok]

なるほど。

01:58:47,582 --> 01:58:53,842 [akira]

いろいろ補う前提でもその高くなりますよね。

01:58:53,882 --> 01:59:01,642 [bioshok]

うーん。まあそうですね、 ここはちょっとね、 バイブ的に書いたので。

01:59:01,682 --> 01:59:06,982 [akira]

いや、 そのバイブ、 バイブアライメントサクセスでPの図を構成するのはそのやばいというか。

01:59:07,942 --> 01:59:27,822 [bioshok]

これが三十年とかだったら、 なんか九十パーぐらいになる。なんかその、 えーと人間だけじゃないので、 そのAI自律的に弱いAGIかける。

01:59:28,662 --> 01:59:41,242 [akira]

コアプログラムに正しくを人間とAIがグッとストラップする部分の確率が六十パーぐらいで、 そこを過ぎればその安定すると思いますけど。

01:59:42,382 --> 01:59:42,722 [bioshok]

なるほど。

01:59:44,402 --> 01:59:47,822 [akira]

そこを本当に過ぎますかという話です。

01:59:50,422 --> 01:59:57,722 [bioshok]

どうなんですかね。まあなんかアライメント自体が根本的に解決可能な可能性っていうのを。

01:59:57,762 --> 02:00:09,842 [akira]

いや、 その根本的に解決可能であることは思ってるんで、 それはもっと高い確率置いてますけど、 その、 そこに一回目で正しくたどり着く確率ですよね。実際に一回目でやってみようと思う時に正しいものを当ててる確率ってことですよね。

02:00:10,941 --> 02:00:12,162 [bioshok]

まあそうですね。だからこの。

02:00:13,482 --> 02:00:26,242 [akira]

それにその九十パーセントみたいな値をコールするのは正しくないというか、 その正しくないと思います。実際にいろんな防御機構もできると思いますけど、 防御機構が正しいかどうかとかに、 結局その永遠の打ち上げ問題に戻ってきちゃうんで。

02:00:27,702 --> 02:00:28,682 [bioshok]

うん。

02:00:28,842 --> 02:00:33,282 [akira]

さらに高知の領域ってまだ一度もやったことがなくて、 何が起きるかわからない魔境なので。

02:00:34,342 --> 02:00:35,962 [bioshok]

なるほど。まあ確かに。

02:00:36,962 --> 02:00:42,642 [akira]

そこで九十パーとか八十パーみたいな値をコールするのはその自信がありすぎるというか。

02:00:44,322 --> 02:00:58,142 [bioshok]

うーん。まあそうか。だから六十パーとかになるんですかね、 さっきのアキラさんの。

02:00:58,842 --> 02:00:59,382 [akira]

そうですね。

02:01:00,302 --> 02:01:07,402 [bioshok]

六十パー。だから十年開発停止でアライメント成功確率で六十パーぐらいなんじゃないかっていう。

02:01:07,442 --> 02:01:07,942 [akira]

そうですね。

02:01:07,982 --> 02:01:08,382 [bioshok]

イメージ。

02:01:08,942 --> 02:01:14,042 [akira]

十、 十、 十年だともっと自信がないというか、 その極限該当して十年、 六十パー程度。

02:01:14,882 --> 02:01:16,882 [bioshok]

ああ、 なるほど。

02:01:16,962 --> 02:01:17,382 [akira]

ですよね。

02:01:22,882 --> 02:02:00,750 [bioshok]

うーん。まあ確かにここは一時停止して。で、 なんか。うん、 ほとんどの。まあ科学者とかがそれをまあ結構妥当性が高いんじゃないかみたいなやつをやっ - でも見つけて、 で、 まあでもそれでも確信度は百九十パー。百パーになることはあんまりないんじゃないかって感じですけどね。まあ確信になったとしても、 実際失敗しちゃうとか。

02:02:01,610 --> 02:02:18,930 [akira]

そうそう、 その、 これはまさにそのロケットアラインメントプロブレムの出番というか、 衛星打ち上げみたいなもんなので、 その、 どんなに注意深くテストして、 どんなに理論がよくできていて、 制御技術が発達してても、 その一回目の打ち上げに九十九パーみたいな成功率を予想する人はやばいだけというか。

02:02:18,970 --> 02:02:19,370 [bioshok]

うん。

02:02:20,970 --> 02:02:28,750 [akira]

そのしかもそのコーチ能力、 多分まあわかんないですけど、 そんなに全部が明らかになると思えないので。

02:02:31,130 --> 02:02:49,110 [bioshok]

なるほど。じゃあアキハさん的にはあれですよね、 だからAI二零四零の二千四十年の描写とかで、 このアラインメントの手法は九十九パーセント正しいと思われるが、 みたいな描写あったじゃないですか。

02:02:49,890 --> 02:02:51,490 [akira]

ありましたっけ?

02:02:51,530 --> 02:02:51,930 [bioshok]

なんか。

02:02:52,150 --> 02:03:11,850 [akira]

そういう時にも、 そのまあまあまあ、 もうこれ以上無理だから、 そのサチュレートし始めてるから、 その追加のエフォ追加の努力に意味がないから、 やっちゃえみたいな感じになると思います。なのでその六十パーセントは七十。だから理論の破綻です。だから七十パー八十、 八十パーより大きい値はさすがに予想できないというか。

02:03:12,370 --> 02:03:12,590 [bioshok]

ああ。

02:03:13,710 --> 02:03:17,770 [akira]

割り振るのはそのただ自信がありすぎる。ただのオプティミストになっちゃうので。

02:03:17,830 --> 02:03:35,550 [bioshok]

なるほど。うん。それって例えばそれでミスマイメントしてたとする。だからそのアラインメントしてるかしてないかみたいな、 結構虹的な感じです感じでいいんですよね。それ。その。

02:03:36,150 --> 02:03:53,110 [akira]

まあそうそう。例えばアラインメントしてるかしてないかっていう言い方はその人間のあれですけど、 そのまあユーティリティが完全に一致している、 またはほぼ完全なる一致に収束するならばアラインメントしていて、 そうじゃないんだったら、 その調子の領域が基本的にそのそれをそのスペシフィケーションゲーミングされるというか。

02:03:55,010 --> 02:03:55,330 [bioshok]

なるほど。

02:03:55,910 --> 02:03:58,770 [akira]

その強力なグッドハートが効いてきてボーボーにされるという感じですね。

02:03:59,750 --> 02:04:22,150 [bioshok]

なんかその、 よくユドコウスキーとかが九十九パーセント、 なんだろうな、 ユーティリティを満たしていても、 その一パーセントでずれてたら、 なんか壊滅的なことが起こるとかいう比喩話してると思いますけど。

02:04:22,850 --> 02:04:23,350 [akira]

そうですね。

02:04:24,270 --> 02:04:25,830 [bioshok]

そういうノリですよね。

02:04:25,970 --> 02:04:34,990 [akira]

そういうノリよりもっと悪いレベルでのノリというか。そのあれって、 なんか人間の価値観のセットみたいなのを分割して考えてるわけじゃないですか。

02:04:35,890 --> 02:04:36,150 [bioshok]

うん。

02:04:36,810 --> 02:04:46,950 [akira]

でも本当はその世界の物理状態に対する好みみたいな話なので、 その人間の人間に対するオントロジーみたいな、 人間の定義みたいな話とか、 定義というか認識の範囲の話とか。

02:04:47,810 --> 02:04:48,810 [bioshok]

なるほど。

02:04:49,150 --> 02:04:56,910 [akira]

ありたるその、 実際に我々があまりに一般的な概念として使ってないから、 その思いつかないような概念的分割みたいな問題とかがあるので。

02:04:57,510 --> 02:04:57,890 [bioshok]

なるほど。

02:04:58,990 --> 02:04:59,930 [akira]

そういう状態です。

02:05:05,410 --> 02:05:23,930 [bioshok]

なんかちょっと話ずれちゃいますけど、 九十九パーセントがなんか。なんだろうな。満たされてるけど、 一パーセントはずれてたら、 なんだろう、 すごい壊滅的なことになるってアウターライメントの文脈でしたっけ?

02:05:23,990 --> 02:05:32,970 [akira]

いや、 それはそのアウターインナー関係なく、 そのアラインメント全体の話ですね。そのAIのユーティリティの九十九パーセントをやってるんですか?

02:05:33,070 --> 02:05:34,490 [bioshok]

ああ、 そういうことですか。AIの。

02:05:34,570 --> 02:05:41,190 [akira]

人間の、 人間のユーティリティがあって、 アウター、 次にアウターがあって、 次にインナーがあって、 AIの目標があるわけじゃないですか。

02:05:42,270 --> 02:05:42,520 [bioshok]

はいはい。

02:05:43,310 --> 02:05:53,730 [akira]

そのAIの目標がその元の人間だと、 その九十九パー合致してても一パーずれたら終わりだよねというのが、 その、 それ、 あのフラジャイル、 あの脆弱価値の話。

02:05:53,770 --> 02:05:56,110 [bioshok]

はいはい。

02:05:57,070 --> 02:06:19,890 [akira]

なのでそのアウターインナーで分ける意味はないというか、 あのどっちか知らないけど、 どっちかで失敗してたらそれはハズレなので。それかその外れたのがもう一回外れて当たるかですけど。なのでそのさすがにその八十パーみたいなとか、 そういうすごい高い予想をするのは無理だと思います。

02:06:22,130 --> 02:06:53,350 [bioshok]

うん。まあそうですね、 そこは。あれですよね、 だからそのミスアライン、 アラインドAGIは作れるかもしれない。アラインドAGI。

02:06:54,290 --> 02:07:01,970 [akira]

いやいや、 アラインドAGIは作れないんですよ。その、 ノットアドバーサリアミスマインドAGIは作れますけど、 アラインドAGIは作れないんですよ。

02:07:02,770 --> 02:07:04,810 [bioshok]

あ、 そう。あれ?あ、 そうか。

02:07:06,170 --> 02:07:29,090 [akira]

そのノット、 そのみんなアラインメントを混乱してるからあれですけど、 そのアラインメントっていうのは、 その目標が一致してることだって一致はしてないですけど、 その近場が範囲みたいなところだったら、 そのそんなには違わなくて、 世界を一気に変えようみたいな力もやる気もないから耐えてるっていうのが、 その今の状態から未来の状態に関する見積もりで、 それがアラインドではないんですよ。

02:07:30,230 --> 02:07:30,610 [bioshok]

ああ、 なるほど。

02:07:30,650 --> 02:07:36,290 [akira]

それはそのノットコラップするなだけで。ノットアドバーサリアミスマインドなだけで、 そのアラインドではないんですよ。

02:07:37,210 --> 02:07:40,330 [bioshok]

じゃあアラインドのはより最もコアな。

02:07:41,470 --> 02:07:52,030 [akira]

そうですそうです。なのでそのベストアラインドみたいな言葉めちゃくちゃ嫌いというか、 その完成するまでアラインドじゃないけどなと思うんですけど。そこはその言葉に誤りがあると思ってるんですけど。

02:07:53,400 --> 02:08:00,982 [bioshok]

うん。あ、 でもなんかさっき言ってた六十パーって話ってその後の話ですよね、 さらに。その。

02:08:01,022 --> 02:08:08,582 [akira]

そうですね。完全にアラインメントできても、 そのUT次にちゃんと引き続き、 そのオントロジーアイデンティフィケーション問題にまた直面するので。

02:08:09,722 --> 02:08:10,102 [bioshok]

ああ。

02:08:10,962 --> 02:08:21,982 [akira]

その、 その世界の認識基盤が丸ごとひっくり返ったりした時とか、 その、 しかも回帰停止のあとに出てきたマルチエージェントの処理とか、 そのそういうやつですね。

02:08:22,082 --> 02:08:23,232 [bioshok]

ああ。

02:08:23,322 --> 02:08:28,002 [akira]

だからその再帰的自己改善の過程で過ちを犯すとか。

02:08:28,082 --> 02:08:39,402 [bioshok]

なるほど。だから、 だからアラインドAGIが最終的にできる可能性っていうのがまず六十パーぐらいあったとして。

02:08:40,282 --> 02:08:50,882 [akira]

あとそのアラインドAGIができるという意味でいうと、 そのそこの部分でできない可能性のほとんどが、 その人間がミスるってことですよ。その思考力において。

02:08:50,982 --> 02:08:51,882 [bioshok]

ああ、 なるほど。

02:08:52,042 --> 02:08:59,762 [akira]

その一般的にそのアラインメントのその理論的なアイデアって、 機能しそうに見えたものが後々穴が指摘されてダメになるじゃないですか。

02:09:00,562 --> 02:09:01,302 [bioshok]

はい。

02:09:01,342 --> 02:09:03,742 [akira]

あの、 これ、 あの、 コリジビリティに関するやつもそうですけど。

02:09:04,622 --> 02:09:05,162 [bioshok]

はいはい。

02:09:06,682 --> 02:09:21,462 [akira]

そうすると、 そのコリジビリティみたいなのの穴が見つけられないほど大きくて複雑、 またはそのシンプルでよく見えて実はダメなスキームが出てくるっていうようなのが、 まあその四十年パーの主観値多くを占めてますね。

02:09:23,282 --> 02:09:23,602 [bioshok]

なるほど。

02:09:25,002 --> 02:09:46,692 [akira]

その誤った理論のまま、 その、 今ってこう、 あの、 天動説のままロケットを作ろうと、 その、 作ろうとしてるわけですけど。その仮に地動説、 ニュートン力学とかまで行ったとしても、 その実際に作るのは亜光速のロケットなので、 その相対性理論を把握し忘れて死ぬみたいな話です。

02:09:48,142 --> 02:09:48,542 [bioshok]

なるほど。

02:09:50,462 --> 02:09:57,992 [akira]

そういうのを込みで、 その、 そんなに強い抵抗は予想、 そのっていう失敗がまずあるっていう感じです。

02:09:58,022 --> 02:10:25,562 [bioshok]

うん。そうすると、 まあだから人間側の、 まあミスで四十パーセントを占めてて。それってなんか。

02:10:25,922 --> 02:10:34,722 [akira]

まあミスっていうか能力不足ですよね。もしかしたら純粋に人間が発見できる範囲じゃ説明不能な世界なのかもしれないですし。

02:10:34,822 --> 02:10:35,222 [bioshok]

なるほど。

02:10:37,002 --> 02:10:41,662 [akira]

実際にそのニューラルネットワークに適用する部分の理論で致命的な過ちを発見するとか。

02:10:42,802 --> 02:10:43,002 [bioshok]

うん。

02:10:43,942 --> 02:10:53,982 [akira]

そのニューラルネットワークってものすごい複雑系なので、 多分厳密に解けるはずはなくて。で、 しかもデータセットも内容を全部把握できるわけじゃないので。

02:10:55,502 --> 02:10:56,642 [bioshok]

なるほど。

02:10:56,842 --> 02:11:25,582 [akira]

そういうのをできるだけ補正しようとして理論モデル組んでとかってやるけど、 理論モデルがそもそも誤ってるとか、 そういうのにその本当に気づけるかってのはまあ不明ですよね。その、 で、 いけそうに見える理論のまま突き進む可能性って結構ありますよね。実際数理モデルってすごい単純化をバンバン置いてますけど。じゃないと数学的に解けないんで。実はその過程が重要な部分を占めているみたいなことも全然ありますよね。

02:11:25,722 --> 02:11:40,462 [bioshok]

うん、 そうですね。だから割と時間極限を取ったとしても、 人間の能力不足で不可能っていうのが四十パーあるってことですかね。

02:11:40,502 --> 02:11:51,782 [akira]

そうですね。四十パーがそのどれくらいなのかは、 その、 今はわかんないですけど、 その、 もっと正確にいろいろな物事が起きてから信念を上下に更新というか、 話になりますけど。

02:11:53,882 --> 02:11:59,031 [bioshok]

まあでもアラインメントは原理的に解けるっていう可能性は別にほぼ百パー。

02:11:59,922 --> 02:12:11,162 [akira]

それはそうそう。それはほぼ一で解けます。だから本当に一で解けないんだとしたら、 そのRSIが絶対にあるラインで頭打ちになりますよね。

02:12:11,802 --> 02:12:21,032 [bioshok]

うん。まあそうですね。頭打ちっていうのは。

02:12:21,252 --> 02:12:34,302 [akira]

要するに、 その、 どんなにその高い知能でもアラインメントが本質的に解けないんだとしたら、 それを認識できるレベルに到着した時点で、 道具的収斂により目標の変更を避けるためにAI開発を停止しますよ。

02:12:35,502 --> 02:12:37,122 [bioshok]

まあまあそういうことか。はいはい。

02:12:37,222 --> 02:13:04,002 [akira]

そうすると、 その到達不能な位置に来ますよね。その最初からたまたまそれがそのボルツマン脳みたいなノリでできない限りは、 そのよりそれより下のレベルの能力は絶対にアプローチしないことになります。だからその特殊相対論みたいな感じで、 その質量がある物体を加速しながら光速を越えさせることはできないわけじゃないですか。あるとしたら、 その光速より速いものがあるとしたら、 元から光速より速いものだけだっていうことになりますよね。

02:13:04,842 --> 02:13:06,622 [bioshok]

まあそうですね。

02:13:08,962 --> 02:13:16,462 [akira]

それと同じ感じですね。その、 になりますよね、 その。それすら認識できずに突っ走り続けるバカしか、 その、 いかない領域になるので。

02:13:18,662 --> 02:13:32,182 [bioshok]

それを、 なんていうか、 まあアラインメントが原理的に不可能ということを証明するためには、 相当高い知能が求められるとしたら。

02:13:32,542 --> 02:13:51,802 [akira]

証明しなくてもそうであると予想して止まるだけで。というか、 その高い知能になっていったら、 そのどんどん、 その安定した状態を維持できる確率が高くなりますよね。その高い、 より知能の高いエージェントが複数いたとしても、 その、 さすがに敵対的であっても、 その強い特殊な自己改変コミットメントとかを用いて、 そのリスクを抑える方向に動きますよね。全員死にたいわけないんで。

02:13:53,662 --> 02:13:54,592 [bioshok]

はいはい。

02:13:54,902 --> 02:13:57,842 [akira]

基本的に慎重なはずで、 そのあるレベルの先は。

02:13:59,002 --> 02:13:59,362 [bioshok]

なるほど。

02:14:01,974 --> 02:14:07,613 [akira]

で、 そうだとしたら、 その不可能だと証明されてないんだからやろうぜとはならないはずで。

02:14:09,294 --> 02:14:09,574 [bioshok]

なるほど。

02:14:10,744 --> 02:14:23,784 [akira]

ということですね。もしかしたらその本当に全く認知できない認知の壁みたいなのがあって、 その下ではどんなに考えてもその問題があることが一切認知できず、 やっちゃうみたいな可能性はありますけど、 それは確率が低いなという話ですね。

02:14:23,794 --> 02:14:24,094 [bioshok]

うん。

02:14:25,114 --> 02:14:29,634 [akira]

原理的に解けるっていう話に関しては、 その理論上、 仮にその超知能がいないとするじゃないですか。

02:14:30,174 --> 02:14:30,274 [bioshok]

はい。

02:14:31,134 --> 02:14:33,874 [akira]

それが禁止された世界があると考えるじゃないですか。

02:14:35,114 --> 02:14:35,314 [bioshok]

はい。

02:14:36,074 --> 02:14:45,074 [akira]

そこでまあその適切な社会システムみたいなのが構築できたと仮定して。でまあ人間がこう一定程度自己改善ができると仮定するじゃないですか。

02:14:45,154 --> 02:14:45,434 [bioshok]

はい。

02:14:46,354 --> 02:14:55,334 [akira]

そういうまあある意味でそのユートピアみたいに言われる世界を百万年運営したら、 おそらくその一番高いレベルのとこまで行くじゃないですか。

02:14:55,514 --> 02:14:55,734 [bioshok]

はい。

02:14:56,694 --> 02:14:57,634 [akira]

マインドアップロードとか。

02:14:58,234 --> 02:14:58,914 [bioshok]

まあ行けますね。

02:14:59,794 --> 02:15:26,094 [akira]

そしたらそれを早回しで実行する超知能を作れば、 原理的には作れますよね。それものすごいコンピュータヘビーで効率的じゃない実装ですけど、 その人間がその幸福にユートピアを達成するという状態が可能である以上、 それに誘導する超知能というのは原理的に作れますよね。最も弱い意味での原理的に作れるだとそうなりますよね。

02:15:26,154 --> 02:15:30,854 [bioshok]

うん。え、 原理的に作れるってのは超知能を作れるってことですか?

02:15:30,914 --> 02:15:44,374 [akira]

そうそうそう。その原理的に人間がユートピアを達成していることが可能であるわけじゃないですか。まあてか、 とあると仮定するならば、 それを実行する超知能が存在することも理論上可能ですよね。その、 その状態に誘導する超知能が存在する。

02:15:45,914 --> 02:15:46,054 [bioshok]

はい。

02:15:47,374 --> 02:16:13,654 [akira]

なので原理的には可能だということですよ。もちろんもっと強い意味での原理的に可能性の話もあるんですけど。その、 その原理的に不可能であることを証明することができる場合って、 それが証明できなきゃいけないんで、 もともと何をどう頑張っても人間にはユートピアが達成できないことを証明しないといけないですけど、 それはおそらく真ではないですし。人間の幸福に関する推論を完全に済ませてからじゃないとユートピアって話は始まらないので。

02:16:14,974 --> 02:16:15,284 [bioshok]

なるほど。

02:16:15,374 --> 02:16:34,174 [akira]

っていう話ですね。であとそのもうちょっとなんか手前の理論的な実装みたいなのを言えば、 あのポール・クリスティアノが提案した人間の脳のシミュレーションをして、 そこから適切に効用を生成するみたいな話があります。

02:16:35,974 --> 02:16:38,734 [bioshok]

なるほど。はいはい。

02:16:39,054 --> 02:17:22,094 [akira]

適切に原理的に効用を生成して、 で、 まあその怖いのでグッドハートが起きないように、 こうマキシマイザーにならないような論理的コンセプト、 そのえーと再興してもマキシマイザーを作ったりしないような安定したものを見つけてくる、 みたいなことができますよね。じゃあその原理的にはその物理的なプロセスとしてアラインドな超知能が不可能ではないはずなんですよ。その工学的に可能という意味なんですけど、 工学的に不可能なんとしたら、 それは知能に絶対上限が存在するということなので、 それはそのあまり関係ないというか。それだったら多分その人間をある分布だったら吹き飛ばさないAIを作るのを続けるか、 その全員をそのままマインドアップロードするかで解決できちゃうんで。

02:17:22,114 --> 02:17:23,334 [bioshok]

うん。

02:17:24,314 --> 02:17:25,914 [akira]

原理的に達成不可能ではないというか。

02:17:32,114 --> 02:17:34,034 [bioshok]

原理的に、 まあ。

02:17:34,134 --> 02:17:58,174 [akira]

その、 よ - 要するにその、 ある程度弱いAIをどんどん強く、 ある程度その特化型AIみたいな、 どんどん強化して、 文明を全体として加速していきながら、 そのピボタルだけど、 そのピボタル、 ウィーカスとピボタルAGIみたいなのを作って。全世界で勝手にAI開発、 その強力なAI開発が起きないようにするけど、 それ自体は人類を滅ぼさないいうレベルのAIを作るじゃないですか。

02:17:58,814 --> 02:17:59,014 [bioshok]

はい。

02:17:59,854 --> 02:18:02,614 [akira]

まあそれはその要するにヘッドAIと同じ能力でできるわけじゃないですか。

02:18:03,194 --> 02:18:04,074 [bioshok]

まあそうですね。

02:18:04,454 --> 02:18:19,894 [akira]

ヘッドAIは理論上そのそういう意味では安全に作れるはずなので。それでそのピボタルなことをして、 で、 それで特化型AIみたいなものすごい加速していったら、 理論上その人間の知能強化のマインドアップロードできるじゃないですか。

02:18:20,594 --> 02:18:21,874 [bioshok]

うん、 まあできるはず。

02:18:23,714 --> 02:18:26,974 [akira]

そしたら、 そのアラインメント問題を丸ごと回避できますよね。

02:18:30,074 --> 02:18:31,074 [bioshok]

ああ。

02:18:31,134 --> 02:18:39,954 [akira]

そのミスアラインドなAIを作る、AIをアラインメントするチャレンジをする代わりに、 我々がAIになればいいんで、 あ、SIか、 になればいいので。

02:18:40,014 --> 02:18:41,174 [bioshok]

ああ、 なるほど。

02:18:41,214 --> 02:18:47,834 [akira]

それで理論上アラインメント問題は回避できますよね。そのアラインメント問題は解決したとは言えないと思いますけど、 アラインメント問題は解けますよね。

02:18:49,714 --> 02:18:51,634 [bioshok]

まあ我々が超知能になればいいってことですか。

02:18:52,274 --> 02:18:58,274 [akira]

そうそう。多分そのそれが示唆しているのは、 我々アラインメント原理的に解けるはずだということも示唆した、 ある意味で。

02:18:59,494 --> 02:19:06,664 [bioshok]

我々が超知能になれるなら、 我々と同じようなシステムは構築可能ってことですもんね。

02:19:06,674 --> 02:19:21,914 [akira]

そうですね。で、 その利他的な人間みたいなのをちゃんと別に選んで、 そいつをその超知能にするプロセスを早回しでやれば、 他の人間もおそらくうまく過ごすことができますよね。ユートピア達成できますよね。

02:19:22,374 --> 02:19:22,734 [bioshok]

うん。

02:19:23,774 --> 02:19:28,154 [akira]

なので原理的には可能ですよね。そういう意味で言うと。

02:19:28,194 --> 02:19:31,694 [bioshok]

まあそうですね。でも僕はあんまり疑ってないですけどね、 原理的に。

02:19:31,934 --> 02:19:32,774 [akira]

そうですよね。

02:19:37,814 --> 02:19:45,183 [bioshok]

うん。まあだからでも原理的に可能なことと、 実際に。

02:19:45,254 --> 02:19:48,114 [akira]

初回でできることは違うということですね。

02:19:48,354 --> 02:20:02,534 [bioshok]

実際的にその何十年とか何百年とか開発停止して、 なんかすごい労力をかけても六十パーセントぐらいで散るイメージですか?

02:20:02,614 --> 02:20:16,322 [akira]

うーん、 まあ、 いやそれでその総合計画を含めるんだったらあれですね。もっと待って人間をそのまま超知能にする戦略をとってから、 え、 それより弱いレベルのAIを作るとかだったら絶対にアライメントできるので。

02:20:16,422 --> 02:20:17,282 [bioshok]

うん、 なるほど。

02:20:19,122 --> 02:20:32,022 [akira]

あれですね、 そのっていう意味ではなく、 人間の知能強化みたいなのを割と縛ってやるならって話ですね。そのAIアライメントを不要にするレベルで、 その人間を強くするということを除けばってことですかね。

02:20:33,122 --> 02:20:35,222 [bioshok]

除けばって。まあまあ。

02:20:35,402 --> 02:20:40,722 [akira]

その、 まあまあ強く言っても六十パー、 七十パー、 八十パーぐらいじゃないかという話ですね。

02:20:41,762 --> 02:20:42,342 [bioshok]

なるほど。

02:20:43,142 --> 02:20:54,202 [akira]

でもその、 それってさすがにそのそもそもAIアライメント解くことがないケースには、 よりその九十パーみたいな確率でAIアライメントが解けますって言っても、 それはそのAIアライメントが解く意味がないので。

02:20:54,982 --> 02:20:55,302 [bioshok]

うん。

02:20:56,142 --> 02:21:11,802 [akira]

AIアライメントを解く意味がある世界だったら、 その六十パー、 まあ八十パーより強い値を予想するのは良くない。まあその時の理論体系とかによります。あの政治的圧力の中ですごい単純なモデルを使ってやろうとかって話だったらうまくいかないので。

02:21:12,762 --> 02:21:25,882 [bioshok]

なるほど。まあすごい理想的な世界で、 人間の知能強化がなかった場合で八十パーぐらいのなんか。

02:21:25,902 --> 02:21:32,182 [akira]

ことがまあその上限ですよ。その実際の状況によってどんどん引き、 そのそれより上の値を考慮することはできないということですね。

02:21:32,582 --> 02:21:32,822 [bioshok]

うん。

02:21:33,742 --> 02:21:42,302 [akira]

とんでもなく未知の原理が見つかって、 それが正しいことが本当に立証されるみたいなことが起きない限りは。

02:21:44,362 --> 02:22:05,072 [bioshok]

なるほど。だからその間に高確機動体みたいなことが起こって、 なんか別に超知能とまでいかないかもしれないですけど、 今の人間の、 なんていうか、 知能が、 なん、 何シグマぐらいこうガッと上がって、 みたいなのは含まないってことですよね。

02:22:05,902 --> 02:22:19,922 [akira]

そうそう、 それはそのAIアライメントを不要にしてるので、 それは解いたというより回避したんで。で、 まあそのレベルで自身がその強くなってから、 それより下のレベルのAIをアライメントすることはその実験し放題なので。

02:22:21,022 --> 02:22:21,222 [bioshok]

うん。

02:22:22,002 --> 02:22:24,742 [akira]

できると思うんですけど。

02:22:25,702 --> 02:22:26,362 [bioshok]

なるほどなるほど。

02:22:27,362 --> 02:22:46,622 [akira]

そのアライメントを解かなきゃいけないというふうに俗に言われる世界だったら良くないと思いますね。だったらその八十パーより強い値を予想するのは良くない。なんならアコースザルトレードがややこしくなる可能性とか、 アコースザルブラックメールでもいいですけど。

02:22:46,702 --> 02:22:47,782 [bioshok]

うん。

02:22:47,842 --> 02:22:58,242 [akira]

ややこしくなる可能性とか、 そういうレベルで我々が気づいてない問題があるとか。話ですね。

02:22:58,822 --> 02:23:22,102 [bioshok]

なるほど。まあだから、 まあそのアライメント成功確率をまあ相当高める世界観、 世界線っていうのは、 まあつまり人間がそれ以上にどんどん賢くなっていくっていう世界線が、 まあ結構必要なんじゃないかということですよね。

02:23:22,822 --> 02:23:26,742 [akira]

それはもしも八十パーより高い成功率が必要なんだったらそうしてくださいってことですね。

02:23:27,622 --> 02:23:40,022 [bioshok]

なるほど。それ、 を、 まあだから、 マクロストラテジーでやろうとしてるのがミリとかですよね。一個。

02:23:40,202 --> 02:23:45,682 [akira]

ミリは、 ミリはあの五十パーセントでチャレンジするつもりなので。

02:23:47,682 --> 02:23:49,532 [bioshok]

ああ、 そうでしたっけ?その五十パー。

02:23:50,742 --> 02:23:55,842 [akira]

ミリはその十億人以上を殺す確率が五十パーセントを切ればやってもいいと思ってるので。

02:23:57,462 --> 02:24:35,022 [bioshok]

あ、 なるほど。まあでもそれってあれですよね。だから本来理想的には。まあ、 人間が超知能になるのがまあ最も理想的なんですかね。その、 まあガバナンスとか政治的な現実性とかを考えなければ。うん。なんていうか、 その最もマクロなその摩擦ゼロの世界を考えるってことですね。

02:24:35,062 --> 02:24:36,842 [akira]

そうですね。

02:24:38,222 --> 02:24:48,302 [bioshok]

でもそれは現実的じゃないから、 五十パーセントで十億人以上がまあ死亡するとしても。

02:24:48,482 --> 02:24:53,982 [akira]

いやいや、 五十パーセント以下です。五十パーセント以上で死亡するとしたら、 その、 それは百パーセントでやろうぜになっちゃうんで。

02:24:55,762 --> 02:24:58,042 [bioshok]

あ、 まあだから五十パーセント以下で。

02:25:00,922 --> 02:25:01,562 [akira]

そうそうそうそう。

02:25:01,572 --> 02:25:06,002 [bioshok]

十億人以上が死亡する世界だったら、 まあそれを、 まあ投げた方がいいと。

02:25:07,742 --> 02:25:08,222 [akira]

そうですね。

02:25:09,302 --> 02:25:13,442 [bioshok]

まあそれはなぜかというと、 他のリスクが大きくなるからってことですよね。

02:25:13,482 --> 02:25:23,882 [akira]

そうですそうです。まあでもミリのあれ、 確か書いてあったのはあれですかね、 あの、 えーとAGIルーインの方なんで、 もしかしたら多分ピボタルアクトの意味かもしれないですけど。

02:25:26,102 --> 02:25:26,422 [bioshok]

うん。

02:25:27,282 --> 02:25:39,842 [akira]

それ要するにあの、 現在の状態でもしも何かをなすだったら、 世界がこのままあまりにすごいスピードで破滅に近づむのを止めるためのピボタルアクトとしてだったら、 その十億人五十パー取ってもいいよって意味なのかもしれないですね。

02:25:40,182 --> 02:25:43,082 [bioshok]

ああ、 なるほど。

02:25:44,662 --> 02:25:56,942 [akira]

まあ普通にそのもっと、 でもその書いてあったのは、 その、 もしもその十億人五十、 殺す確率五十パー以下にできるんだったら、 そこからそのそれを十パーセントにするのはもっと簡単だっていう話だったので。

02:25:57,042 --> 02:25:58,282 [bioshok]

ああ、 はいはい。

02:25:59,222 --> 02:26:01,142 [akira]

そういう意味ではその大丈夫かもしれないですね。

02:26:03,362 --> 02:26:10,612 [bioshok]

なるほど。うん。

02:26:17,730 --> 02:26:28,810 [akira]

あの、 あの、 いつも言ってますけど、 その全員をほぼ確率一で殺さないでくださいというのが一番難しい部分であって。その先はそのサブ問題に入るというか。

02:26:30,110 --> 02:26:30,510 [bioshok]

なるほど。

02:26:32,270 --> 02:26:41,690 [akira]

その宇宙に飛ばした時に火星に着きそうなロケットを作るところが大体難しいのであって、 最後の着陸の精度を一メートル合わせることはそんなに難しくない。

02:26:41,790 --> 02:27:03,750 [bioshok]

うん。そういうノリですね。まあだからそこの一メートルの微調整の部分で別のなんか。まあリスクとかあるから、 もうちょい早めに着陸しようとか、 そういう話っていうだけってことですよね、 最後は。

02:27:03,830 --> 02:27:21,430 [akira]

そうです。そうですそうです。別にそんな一メートルを極めるために、 その他の技術のリスクとかそういうのを取る必要はないので。ってことです。そのえじ、 えー、 そのあまりにないと、 その技術を制限、 そのナノマシンとか、 今度制御しなきゃいけなくなっちゃうので。

02:27:22,450 --> 02:27:23,510 [bioshok]

うん。

02:27:23,670 --> 02:27:35,750 [akira]

そういうリスクと、 それにそのAIアライメント失敗のあれがかかり始めたら、 もう勝負をかけていいっていうことですね。でもかけるしかないってことですね。

02:27:41,430 --> 02:27:45,950 [bioshok]

なるほど。話はちょっとあれですけど。

02:27:47,470 --> 02:27:56,430 [akira]

アライメントのその、 これ、 その原理的に可能な話しかしてないです。そのPD debateになってないんですよ。これ、 僕と木村さんのPD debateだったら正しいんですけど。

02:27:56,470 --> 02:27:57,120 [bioshok]

まあそうですね。

02:27:59,470 --> 02:28:04,170 [akira]

その僕とバイオさんのPD debateだと、 僕がバイオさんのPDも上げる方向にあれな話なので。

02:28:06,330 --> 02:28:40,090 [bioshok]

だからさ、 だからまあ。うーんと。まあだからどっちかっていうと、 まあこの開発停止の期間、 が、 まあ。そうですね、 まあ個人的には、 その。多分まだそこの前にアライメントの成功確率が、 高すぎるってのと。

02:28:41,150 --> 02:28:41,610 [akira]

そうですね。

02:28:41,810 --> 02:28:53,390 [bioshok]

その、 それの後に、 そのこのガバナンスで五年開発停止とか十年開発停止のこの確率も高すぎるっていう感じになるんじゃないですか?アキラさんから。

02:28:54,310 --> 02:28:58,590 [akira]

そうですね、 そうですね。もちろん。そうです。それはそうでしたね。

02:28:59,210 --> 02:29:06,410 [bioshok]

だからまずこのアライメントの成功確率ってのが、 まあこの二十パーってのがもう高すぎる。

02:29:06,490 --> 02:29:21,870 [akira]

一パーセントとかになって、 で、 多分一年だったらまあ三パー、 三年で十パー、 五年で三十パー、 十年で四十パーとか五十パーと、 そういうノリじゃないですか。ちょっと楽観的にそのぐらいだと思います。

02:29:22,470 --> 02:29:49,330 [bioshok]

なるほど。で、 まあ一旦そんな感じで、 アキラさんのこれは。で、 この四十パーとか二十パーとか、 こういうファストテイクオフっていうか、 まあその、 その開発停止の分布も、 多分あれですよね、 アキラさんからしたらもっと短い期間で終わらないといけないんじゃないですかね。

02:29:49,390 --> 02:29:55,730 [akira]

そうですね。一年から三年の間はもっと弱いです。一から五年はもっと弱いですね、 全部。

02:29:57,250 --> 02:29:57,730 [bioshok]

あ、 なるほど。

02:29:57,810 --> 02:30:09,390 [akira]

その数ヶ月の開発停止が多分数ヶ月から三年が合わせて三十パーとか?いや、 そんなないか。十五パー、 十パーあって十パー?そんなないな。

02:30:09,430 --> 02:30:10,500 [bioshok]

うん。どうだろう。

02:30:11,070 --> 02:30:28,130 [akira]

五パーセントとかで。いや、 すぐつったらあれか。もう三十パーとかになって。で、 十年は多分十パーとかになって。

02:30:29,490 --> 02:30:29,830 [bioshok]

うん。

02:30:30,170 --> 02:30:34,029 [akira]

で、 まあただただ全速力疾走がありますね。

02:30:35,649 --> 02:30:41,530 [bioshok]

全速力疾走が一番確率がどれ、 高いんですか?

02:30:41,590 --> 02:30:42,070 [akira]

そうですね。

02:30:42,610 --> 02:30:42,910 [bioshok]

それが。

02:30:43,290 --> 02:30:48,290 [akira]

五十パー、 五十パー、 六十パーぐらいあります。それはその安全保障圧力の高まりがあるので。

02:30:49,310 --> 02:31:01,870 [bioshok]

全速力疾走が五十六パー、 六十パーで、 その数ヶ月停止みたいなのが三十パープラスで。で。

02:31:02,170 --> 02:31:09,590 [akira]

五年より十年、 五年、 十年みたいな、 そういうちゃんとした長さのやつはまあ残りの十パーあるかなぐらいですね。

02:31:11,970 --> 02:31:21,710 [bioshok]

ああ。じゃあ確かにそれだと、 その生存する世界って五年十年のやつに集中してますよね。

02:31:21,790 --> 02:31:26,930 [akira]

そうですね。ちょっと計算一回計算してみますか。じゃあこの、 この、 このテイクオフシナリオで。

02:31:35,750 --> 02:31:43,190 [akira]

どうせこれ全部変わらないでここに集めちゃうんですよ。五十パー、 いや違う、 開発停止。その数ヶ月停止してもしなくてもあんまり変わらないので。

02:31:44,670 --> 02:31:45,950 [bioshok]

うん。

02:31:45,990 --> 02:32:00,550 [akira]

どうだろう、 七十パーぐらいで。で。いやもっとか。

02:33:08,720 --> 02:33:08,900 [bioshok]

あ。

02:33:09,120 --> 02:33:11,200 [akira]

六点五パーセントぐらいですね。

02:33:12,270 --> 02:33:15,450 [bioshok]

ああ、 はい。

02:33:16,600 --> 02:33:24,140 [akira]

楽観的に見て六点五パーセント。といっても、 その生存確率のほぼ全てが五年以上の休みから来てるので。

02:33:26,180 --> 02:33:28,820 [bioshok]

なるほど。

02:33:30,480 --> 02:33:39,620 [akira]

まあそのアライメント五パーも結構楽観的な見積もりというかあれなんですけど、 その楽観的に見るとこんぐらいですかね。

02:33:41,640 --> 02:33:47,580 [bioshok]

まあ楽観的に見るとこんぐらいだから、 なんかdoomは九十五パーぐらいは依然としてあるってことですよね。

02:33:48,060 --> 02:33:48,600 [akira]

そうですね。

02:33:50,200 --> 02:34:04,020 [bioshok]

で、 まあだからまあ基本全、 まあ数ヶ月未満の今日開発停止はもうほぼdoom九十九パーセント以上ってことですよね。

02:34:04,080 --> 02:34:21,420 [akira]

そうですね。まあもうもうその九十九パーとかもうほぼ百というか、 その本当に何か知らないすごいことが起きていてくださいもうですね。まあそれはそのAI宇宙連合存在仮説と同じクラスに属するので。

02:34:21,520 --> 02:34:26,000 [bioshok]

じゃあもうあれですかね、 九十九点九九九パーセントみたいな。

02:34:26,060 --> 02:34:31,960 [akira]

いや、 いや、 そこまでいくと逆にその根本的にマキシマイザーと違うもので突然動き始めるとか、 そういうのがあるので。

02:34:33,480 --> 02:34:34,480 [bioshok]

あ、 つまり。

02:34:34,900 --> 02:34:35,980 [akira]

何でもかんでもすごい。

02:34:38,280 --> 02:34:42,680 [bioshok]

絶滅しないけど、 絶滅はしないけど、 コントロールを失ってる状況みたいな世界ですか?

02:34:42,700 --> 02:34:47,800 [akira]

いや、 じゃなくて、 そのあまりにその予想外のモデルの誤りを引き当てる可能性がもうちょっとあるんで。

02:34:49,440 --> 02:34:53,640 [bioshok]

それは例えば。うん、 どういうこと?

02:34:53,660 --> 02:35:08,760 [akira]

要するにその、 ああ、 その強化学習でとんでもなくマキシマイザーの方向に走ってるように見えるにも関わらず、 そのあるレベルを超えた瞬間に突然なんかそのグロッキングみたいなことが起きて、 すごいプリトレーニング比重が重くなって、 ペルソナセレクションモデルに完全に引き戻されるとかですね。

02:35:10,160 --> 02:35:11,100 [bioshok]

ああ、 で、 それで。

02:35:12,200 --> 02:35:23,600 [akira]

もしくはその説明不能、 こういうタイプの説明不能なモデルですね。その、 いかなる論理的根拠によっても肯定されていないから、 未来についてってわかんないこともあるよねと同じです。

02:35:25,180 --> 02:35:29,960 [bioshok]

それが起こると、 人類がなぜか知らないけど滅亡してない状態になるってことですか?

02:35:29,980 --> 02:35:59,960 [akira]

いや、 それはそのアライメントは、 そのなんとか吹き飛ばないで済むっていうような特殊なケースのモデルがあるかもしれないということですね。それがたまたま変な方向でアライメントされていることによって、 ピボタルアクタが起きるみたいな、 そういう話ですね。その、 ちゃんと説明して、 それの正当性を聞かれたら、 私はそのモデルに正当性を見出しませんって答えるレベルの不安定で不確実なものしかないということですね。要するに知らない、 何か知らないとんでもないものがあるかもしれないですという部分です。

02:36:00,820 --> 02:36:03,080 [bioshok]

なるほど。

02:36:03,110 --> 02:36:06,520 [akira]

だからもしも構成して終わるとしたら、 そのペルソナセレクションモデルに戻るとかそういうやつ。

02:36:08,160 --> 02:36:10,500 [bioshok]

うん。

02:36:11,700 --> 02:36:23,400 [akira]

戻るって言ってもペルソナそんなにうまくいってないんであれですけど。もしくはその複雑系なので、 あまりに未知の原理が存在して、 その直行仮説が偽であるとか、 そういうすごいレベルの話とかですかね。

02:36:24,980 --> 02:36:32,180 [bioshok]

うん。で、 それが起こって、 たまたま奇跡的にアラインされるってことですか。

02:36:32,740 --> 02:36:39,500 [akira]

そうそうそうそう。その、 要するにその知らない仮説、 未知の未知に対する不確実性の保全の部分しかないです。

02:36:40,320 --> 02:36:43,939 [bioshok]

じゃあそれが、 まあ零点一パーセントぐらい置いとこうみたいな。

02:36:44,879 --> 02:37:03,140 [akira]

そうですね。いや、 置いてないですね。その九十九パーでかいだろう、 でかいというふうに言ってますけど、 その残りの部分を構成はできないので、 評価できないって感じですか。もちろん厳密には評価できるはずですけど、 その、 そんなにそのベイジアンカリキュレーターではないので。

02:37:04,060 --> 02:37:11,380 [bioshok]

九十九パーよりは大きい人類の滅亡確率あるとは思ってるけど。

02:37:12,060 --> 02:37:18,040 [akira]

えーってかその生存確率がないと思ってるけど、 ないと言い切ることは、 その一応クロムウェルの規則とかできないので。

02:37:18,600 --> 02:37:19,000 [bioshok]

なるほど。

02:37:20,200 --> 02:37:41,160 [akira]

けど、 その本当に奇跡みたいな、 明らかに既存のモデルで起きるわけがないことよりはもう少しだけ高い。その、 あの、 最初にできたAIのコンピューターにすごい勢いで宇宙線がヒットしてビット反転が起きて、 アラインドのAIに転換されるとかよりは高い確率で起きうる事象のクラスがあるということですね。

02:37:41,200 --> 02:37:42,370 [bioshok]

なるほど。

02:37:42,380 --> 02:37:50,040 [akira]

そのvery unlikelyとそのextremely unlikelyってかextremely unlikelyとextremely hyper unlikelyみたいな、 そういう差です、 がありますという感じですね。

02:37:51,300 --> 02:37:53,640 [bioshok]

クロムウェルの規則って何でしたっけ?

02:37:53,700 --> 02:37:57,940 [akira]

あの、 確率に零と零か一を割り当てることはできないというやつですね。

02:37:58,020 --> 02:37:59,820 [bioshok]

ああ、 なるほど。

02:37:59,880 --> 02:38:08,420 [akira]

あの経験的な命題について、 確率零または一を割当てることはできないという命題、 あの規則があるんですね。

02:38:08,520 --> 02:38:14,400 [bioshok]

天文学的な確率ではない、 何らかのクラスがあるってことですか。

02:38:16,880 --> 02:38:24,790 [akira]

そうそうそう、 あの、 そうそう、 そうそう。その天文学的ではないけど、 その期待することができないモデルの可能性があるということですね。

02:38:25,440 --> 02:38:25,900 [bioshok]

なるほど。

02:38:27,640 --> 02:38:38,960 [akira]

なんかその未知のその法則によりすごい複雑にAIを動かした結果、 なんか電磁波が複雑に発生して、 近くの人の脳に厳しく影響して、 とかよりはもうちょっと高いレベルにあるやつって。

02:38:39,880 --> 02:38:40,260 [bioshok]

なるほど。

02:38:41,000 --> 02:38:44,640 [akira]

未知のグロッキングみたいなタイプのことってことですね。

02:38:44,680 --> 02:38:45,100 [bioshok]

うん。

02:38:45,200 --> 02:38:54,800 [akira]

未知のグロッキングがすごいいい方向になぜかたまたま引き当てられるみたいな話ですね。その、 人間の価値観には実はすごいシンプルなコアがあったみたいな、 その根本的なモデルの誤りですね。

02:38:55,920 --> 02:38:56,220 [bioshok]

なるほど。

02:38:57,160 --> 02:39:12,100 [akira]

その、 もしかしたらその人間の脳はすごい複雑で意味わかんない方向で価値観をエンコードしてるけど、 別のアーキテクチャみたいなのを使えば、 ものすごい圧縮された方法で人間の価値観が表現される可能性があるみたいな、 そういうことって一応その天文学よりは高い確率じゃないですか。

02:39:13,560 --> 02:39:14,260 [bioshok]

まあそうですね。

02:39:15,680 --> 02:39:20,920 [akira]

けどそれはその生存を期待して零点一パーセントとは言わないやつじゃないですか。

02:39:21,020 --> 02:39:25,320 [bioshok]

うん。まあそうですね。

02:39:26,840 --> 02:39:32,600 [akira]

そのベイジアンだったら、 その一から始めないと絶対一にはならないので、 その一になってないですっていうだけの意味ですね。

02:39:33,300 --> 02:39:33,440 [bioshok]

うん。

02:39:38,170 --> 02:39:44,320 [akira]

その生存を期待する道を一個教えてくださいって言われたら知りませんって答えますね。知らないから残してあるだけで。

02:39:44,460 --> 02:39:46,840 [bioshok]

なるほど。

02:39:48,220 --> 02:40:21,480 [akira]

それか、 もしかしたらそのスパーソートエンコーダーみたいので、 奇跡的に良いという概念が将来的に一個にエンコードされて、 それを引き上げた瞬間に完全にアライン、 コアプログラムが実はその半分ブートストラップされて、 そいつにアラインメント解かせたら、 そのコアプログラムちゃんとブートストラップしてくれるみたいな。意味わかんない仮説ですね、 全体的に。その論理的な正当性をほとんど持っていないモデルになります。要するに、 ここでバイオさんが述べたら、 それに確率を割り当てるべきではありませんって答えるものしかないですね。

02:40:22,660 --> 02:40:39,260 [bioshok]

うーんなるほど。この一二三四みたいな期待すべきでない話が起こる確率ってことですよね。

02:40:40,200 --> 02:40:52,060 [akira]

そうそうそう。その、 あまりに起きそうにないことが連続で起きる可能性にゼロを割り当てることはできないですし、 未知の未知ですごい奇跡が起きることも別に否定できないので、 それが残ってます。一応。

02:40:52,080 --> 02:41:03,300 [bioshok]

うん。で、 この六点五パーセントってのは、 まあつまり生存の確率ですよね。

02:41:03,940 --> 02:41:04,440 [akira]

そうそうそう。

02:41:05,140 --> 02:41:13,320 [bioshok]

だからこれ以降、 なんていうか、 生存ではない、 もう少しユートピアの確率ってなるともっと低くなるってことですよね。

02:41:14,000 --> 02:41:18,160 [akira]

え、 でも十年停止してる世界とかだったら、 さすがにそのガバナンスが整備されてるはずなので。

02:41:18,860 --> 02:41:19,020 [bioshok]

うん。

02:41:19,940 --> 02:41:41,560 [akira]

まあその要するに、 このまま走り続けて、 奇跡的にAIアラインメントが存在しない世界観だったら、 そのドゥームがもっとユートピアは低くなりますけど。これで生存確率のほとんどが一年以上っていうか、 なんなら三年以上の停止から来てるので。三年以上停止してる世界だったら、 さすがにそのガバナンスの議論とかもっとちゃんとしてるはずなので。

02:41:41,620 --> 02:41:42,870 [bioshok]

うん。

02:41:43,060 --> 02:41:55,179 [akira]

今のなんかランダムに開発しようぜとは全然違うガバナンスが敷かれてるはずで、 そしたらもっとユートピアが高いって話ですね。そのちゃんとレシピエンタも既にあって、 将来の分割も約束されていて、 その上で国際プロジェクトが開発するみたいな、 そういう世界観ですね。

02:41:56,720 --> 02:42:01,320 [bioshok]

うん。なんかでもソーシャルドゥームは高いとか言ってなかったでしたっけ?その。

02:42:01,880 --> 02:42:14,060 [akira]

ソーシャルドゥームが高いのは、 その、 ここなんですよ。その、 開発停止、 開発停止が短い、 短い世界線と、 その開発停止に至るそのAGIの話までの間の話です。

02:42:14,780 --> 02:42:17,399 [bioshok]

ああ、 つまり一年以下の話ですか。

02:42:18,400 --> 02:42:22,120 [akira]

そうですそうです。そのコアプログラムがブートストラップできないのところに入ってます、 それは。

02:42:23,060 --> 02:42:24,720 [bioshok]

なるほど。

02:42:24,780 --> 02:42:33,140 [akira]

コアプログラムがブートストラップできて、AIが本当にそのアラインできるんだったら、 それはその、 そこに入ってます、 その。ユートピアを達成できない分が。

02:42:34,440 --> 02:42:34,760 [bioshok]

なるほど。

02:42:34,769 --> 02:42:47,019 [akira]

と、 ガバナンスの分が。その、 強く相関しているというか。その慎重さとガバナンスっていう点において相関しているため。

02:42:48,800 --> 02:42:57,960 [bioshok]

な、 なるほど。まあ。じゃあつまり、 まあわかりました。だからピュートピアってのも大体五パーセントぐらいはあるんじゃないかっていうことですかね。

02:42:58,520 --> 02:43:08,080 [akira]

そうですね、 一応。まああの、 ここに関してちょっとこう引き上げ中なので、 もうちょっと上がるかもしれないですけど。その警告射撃を鳴り響かせ続けるとか、 いろいろあるので。

02:43:08,220 --> 02:43:17,460 [bioshok]

なるほど。じゃあこの開発停止の期間が延びる時点、 というか、 その更新中ってことですね、 そこの確率を。

02:43:17,520 --> 02:43:28,720 [akira]

そうですね。いや、 まあこれあの楽観的な見積もりなのであれなんですけど、 アラインメントの成功率二十年で本当に五十パーとか置けるのかは僕は結構懐疑的になりつつあるので。

02:43:30,980 --> 02:43:32,140 [bioshok]

ああ。

02:43:32,180 --> 02:43:49,040 [akira]

十年経ったらその安全なAGIぐらいだったら作れるかもしれないですけど。コアプログラムをブートストラップできるかはまた別なので、 そこはちょっとその不明というか、 それはあのユドコフスキーが言うところの楽観的な若者の状態の可能性が結構あるので。

02:43:50,280 --> 02:43:59,500 [bioshok]

じゃあこのアラインメントが六十パーセントで解決する、 かつブーストトラップも解決するに掛け算が。

02:43:59,540 --> 02:44:06,260 [akira]

いやいや、 アラインメントが解決するはブートストラップに入ってるので、 こっちの確率はそれで見積もってみたというか。

02:44:06,360 --> 02:44:08,720 [bioshok]

ああ、 そういうこと。これASIまで考慮してる。

02:44:09,360 --> 02:44:26,080 [akira]

そうです。そうですそうです。そのASIまで、 そのファイナルのASIアラインメントまでできる確率です。要するに途中でコアプログラムがブートストラップされる確率をこんなに高く置いていいのかは僕はわからないです。でもそれはその二つあって、 その一つはそのトライした人が少なすぎるという話があって。

02:44:26,100 --> 02:44:32,380 [bioshok]

うん。そのミリぐらいしか試してないですよね、 そのコアプログラムって実は。まあそうですね。

02:44:32,500 --> 02:44:36,820 [akira]

で、 そのしかも全員そのユドコフスキーの考え方みたいなのある程度共有しちゃってるので。

02:44:36,860 --> 02:44:37,120 [bioshok]

うん。

02:44:38,180 --> 02:44:43,460 [akira]

十分にその進んでないんで、 もしかしたらだからそのアインシュタインモーメントがある可能性があるよねみたいな話がありますよね。

02:44:43,540 --> 02:44:43,760 [bioshok]

はい。

02:44:44,880 --> 02:45:06,860 [akira]

そうすると、 その不確実性の分手前に高く置いて。一方でその手前の問題は何も解けてないので、 本当にスケールしたら解けるのかもわかんないし。なのでその五十パーセントっていうのはある意味楽観的な読みですね。それはその多分ユドコフスキーに言ったら、 その怒られるというか、 その、 それはそのあなたが、 あの、 若いので楽観的なだけですって言われると思いますね。

02:45:07,760 --> 02:45:15,280 [bioshok]

なるほど。ユドコフスキーがこのダイアグラム書いたらどうなるんですかね。

02:45:15,380 --> 02:45:21,740 [akira]

ユドコフスキーがこのダイアグラムを書いたら、 多分もっと下下にその三十年の停止みたいなのがつくと思いますね。

02:45:21,820 --> 02:45:31,820 [bioshok]

ああ、 なるほど。で、 そのガバナンスの確率も相当低いから。

02:45:32,520 --> 02:45:36,180 [akira]

そうですね。テイクオフも、 てかテイクオフっていうか、 多分タイムラインももっと短いので。

02:45:36,680 --> 02:45:58,900 [bioshok]

なるほど。これって今このファストテイクオフとか、 まあタイムラインが大体五年以内の話ですけど、 早、 アキラさんはこのタイムラインが遅くなってくっていうところはどう、 どう見ているんですか?その。例えば。

02:45:59,360 --> 02:46:10,180 [akira]

大体、 大体二千三十年ぐらいにそのヘッド、 ヘッドAIまで行くのが、 大体五十パーぐらいあって、 三十五年まで行くと七十パーぐらいになり。

02:46:10,280 --> 02:46:12,060 [bioshok]

はいはい。

02:46:12,220 --> 02:46:19,160 [akira]

で、 その後ろは、 もう、 後ろはちょっとよくわかんないですね。後ろはその高い壁と割り当てる理由がそんなにわかんないというか。

02:46:20,140 --> 02:46:35,100 [bioshok]

なるほど。え、 つまり、 えっと、 二千三十五までに七十パーぐらいで、 で、 それ以降もうまあ、 実は開発されてない。

02:46:36,560 --> 02:46:40,730 [akira]

それ以降もその減っていくけど端にもっとあるみたいな感じになりますよね。

02:46:40,740 --> 02:46:41,160 [bioshok]

ああ、 なるほど。

02:46:41,720 --> 02:46:46,420 [akira]

そのバイオさんが言ったみたいな、 その根本的にその人間の学習がないと無理みたいな。

02:46:47,140 --> 02:46:47,380 [bioshok]

うん。

02:46:48,440 --> 02:46:54,880 [akira]

その生物のニューロンが実はコンピューターで再現することが到底難しい、 複雑な計算をしてましたとか。

02:46:55,920 --> 02:46:57,760 [bioshok]

なるほど。

02:46:57,820 --> 02:47:02,000 [akira]

そういうのとかも確率高くないと、 少なくてもそのヘッドAIの話は高くないので。

02:47:03,500 --> 02:47:05,089 [bioshok]

ああ、 はいはい。

02:47:05,140 --> 02:47:07,920 [akira]

AIとヘッドAIなんてかなり差があるので。

02:47:09,900 --> 02:47:31,940 [bioshok]

まあそうですね。それで、 えっと、 だから、 えっと、 この今左下に書いてくれたこの六点五パーセントっていうのは、 まあ一応タイムラインが二千三十年ぐらいでみたいな話じゃないですか。

02:47:31,980 --> 02:47:32,460 [akira]

そうですね。

02:47:32,920 --> 02:47:36,760 [bioshok]

これ上の方の話になってくると。

02:47:36,780 --> 02:47:41,000 [akira]

ちょっと下がりますね。そのフィルムがもう元々下がりますね。

02:47:41,040 --> 02:47:42,580 [bioshok]

もうちょい下がってくるって感じですか。

02:47:43,260 --> 02:47:50,420 [akira]

そうですね、 もう少し下がりますけど、 そのこの六点五パーセントにこのこっち側でかかっちゃうね、 こっちって結局総合すると三パーとかになりますよね。

02:47:50,520 --> 02:47:52,690 [bioshok]

まあそうですね、 五十パーなんで。そうですね。

02:47:52,800 --> 02:47:57,220 [akira]

まあなのでそういうの大体足し合わせると多分大体九十パーぐらいになると思いますね。

02:47:57,300 --> 02:47:57,680 [bioshok]

なるほど。

02:47:59,420 --> 02:48:07,840 [akira]

であとその後ろの方はその、 それはそれで、 後ろの方は若干高いですかね、 その、 あの、 人間の強化の話が見えてくるので。

02:48:08,800 --> 02:48:09,160 [bioshok]

なるほど。

02:48:10,540 --> 02:48:14,240 [akira]

人間の強化とマインドアップロードが見えてくるんですけど。

02:48:15,780 --> 02:48:24,340 [bioshok]

まあ、 まあ単純に後ろになればなるほどアライメント研究に費やせる時間は増えますよね。

02:48:24,460 --> 02:48:31,340 [akira]

そうですね。増えて、 その人間の認知強化みたいなのもできるので、 あれですよ。後ろに行けば行くほど、 その、 それまでに勝手に解るってやつも若干ながらあるので。

02:48:32,580 --> 02:48:34,660 [bioshok]

まあなんかバイオとかそういう話。

02:48:35,660 --> 02:48:44,640 [akira]

その、 特にそのこのまま走ってロングタイムラインだと、 その、 かなり、 その、 ややこしいAIがいっぱい出てきてるけど、 人類は吹き飛んでないって話になるので。

02:48:45,420 --> 02:48:46,480 [bioshok]

まあそうですね。

02:48:46,520 --> 02:48:49,220 [akira]

その古典的なダリワモデル分のPDも出てきちゃう。

02:48:50,700 --> 02:48:53,400 [bioshok]

うん、 悪用のリスクですね。

02:48:53,680 --> 02:48:59,800 [akira]

そう、 カタストロフィックリスクがその僕にとってはそのテイルリスクなので気にしてないですけど、 その上に行くと出てきますよね。

02:48:59,820 --> 02:49:00,060 [bioshok]

うん。

02:49:01,400 --> 02:49:08,480 [akira]

あの要するにある意味でそのミトスレベルがオープンソースになってから八十年とかのわけですよね。で、 多分バイオミトスとかもそうですよ。

02:49:09,120 --> 02:49:12,120 [bioshok]

ま、 そうですね、 ミラーライフとか作られちゃうかもしれないとか。

02:49:12,300 --> 02:49:19,540 [akira]

そうですね。まあなかなかそのXPエクスティンクションまでいくかわかんないですけど、 その、 そうするともうそのモデルが複雑になりすぎるというか。

02:49:20,280 --> 02:49:20,880 [bioshok]

うん。

02:49:21,040 --> 02:49:24,460 [akira]

そこまでにその人類の九十パーセントが死滅したらAGIタイムラインもっと伸びるので。

02:49:26,600 --> 02:49:28,120 [bioshok]

まあそうですね。

02:49:28,360 --> 02:49:32,200 [akira]

それはある意味その個人としては大体、 大体extinctionとかあるわけというか。

02:49:34,100 --> 02:49:34,600 [bioshok]

なるほど。

02:49:35,380 --> 02:49:49,940 [akira]

人類として大体変わんないですよね、 ある意味。その多分致命的に損なってると思うので。この先AIが実行可能になる度に、 その多くの人間がミトスレベル、 バイオミトスを手に入れるみたいな世界って多分やばいので。

02:49:51,700 --> 02:49:52,500 [bioshok]

そうっすね。

02:49:53,120 --> 02:50:01,180 [akira]

そうするとその世界中で協力して安定したアライメントを保ちましょうって話じゃなくて、 ものすごい勢いでブートしたら、 そのものすごい勢いでAIを作るしかないですよね。

02:50:03,700 --> 02:50:03,860 [bioshok]

まあ。

02:50:03,940 --> 02:50:10,140 [akira]

そのAI開発ができるコンピューターみたいのが手に入ってから、 そのかなりの時間かけるんだったら、 それは危ないじゃないですか。

02:50:10,860 --> 02:50:11,160 [bioshok]

うん。

02:50:11,900 --> 02:50:21,600 [akira]

そうするとその社会がぐちゃぐちゃになって、 アライメントが解けてないまま、 そのもっと短い時間でアライメント再チャレンジするしかないってなりますよね。

02:50:21,700 --> 02:50:23,060 [bioshok]

そうですね。

02:50:23,160 --> 02:50:34,640 [akira]

なのでそのそうなると、 その上の方はそれはそれでその不確実性が多くて、 そのpre extinctionがそれなりに出てくるので、 そのすごい稼げるってわけではないですけど、 割と稼げます。その、 割と稼げますね。

02:50:38,456 --> 02:50:44,936 [bioshok]

まあなんか世界政府を作るとかそういうシナリオもありますかね。まあちょっと話ずれますけど。

02:50:45,036 --> 02:50:49,856 [akira]

まあ世界政府作るのありなんじゃないですか?別にそんなにいらない気もしますけどね。

02:50:50,816 --> 02:50:59,416 [bioshok]

まあなんかその全人類になんかそのライフログというか、 常に監視してて、AIが。

02:51:00,856 --> 02:51:03,476 [akira]

そんなにそのレベルってことですか?

02:51:03,596 --> 02:51:07,696 [bioshok]

多分そうそう、 悪行できないようにするっていうですね、 その。

02:51:07,796 --> 02:51:12,716 [akira]

ああ、 まあまあそれはできます。確かにそれは確かにできますけど、 それはその高い確率を振ってないですね。

02:51:13,176 --> 02:51:14,416 [bioshok]

あ、 まあ。

02:51:14,496 --> 02:51:32,996 [akira]

それはそのしようとした瞬間に多分内戦とか起きてもっとややこしくなるんで。まあそれはその実現確率としたら、 そのオーバーオールのPDMとしてはあまり貢献しないですね。そうですね。

02:51:34,356 --> 02:51:43,455 [bioshok]

なんかもしそれがまあ政治的な話を置いておいてできたら、 相当開発停止期間を伸ばせそうなイメージありますけどね。

02:51:44,116 --> 02:51:46,016 [akira]

まあ別にそれはあんまり関係ないと思いますね。

02:51:47,456 --> 02:51:48,216 [bioshok]

そうですかね。

02:51:49,396 --> 02:51:52,176 [akira]

その条約の方式のままでも全然履行可能というか。

02:51:54,056 --> 02:52:07,056 [bioshok]

あ、 でもなんかその条約のままだと、 例えば誰かがその小さいコンピューティングでも、 画期的なアーキテクチャを思いついてAIを作っちゃうかもしれないみたいな、 後ろからの圧力とか。

02:52:07,836 --> 02:52:17,056 [akira]

でもそれはその各国で内部で規制するじゃないですか、 条約の一部として。しかもその各国がそのそういうロングので同意できる世界、 多分認識が割とあるはずなので。

02:52:17,436 --> 02:52:18,736 [bioshok]

あ、 まあそう。

02:52:18,936 --> 02:52:37,976 [akira]

国民教育に、 国民教育に、 その教育にAIリスクを含めましょうねみたいな話になってるとしたら、 その世論の後押しとかもあるので、 その各国が独自に自分の中でそういう化け物が出ないように監視しようと協力できますし、 その期間にそのコンピュータベリフィケーションを強くすれば、 チップの製造全部覆うことできるじゃないですか。

02:52:38,596 --> 02:52:40,096 [bioshok]

まあそうですね。はい。

02:52:40,236 --> 02:52:48,956 [akira]

それを突破するとしたら、 その個人が自分で全部の資源を調達してきて、 その機関に見つかることなくコンピュータを勝手に作ってAIを開発するとかじゃないですか。

02:52:49,776 --> 02:52:50,356 [bioshok]

そうですね。

02:52:51,036 --> 02:53:00,076 [akira]

それはさすがにその無理じゃないですか?無理っていうか、 その、 それはその何年止める、 その100年止めるケースとかじゃないと起きないやつじゃないですか。

02:53:00,156 --> 02:53:02,056 [bioshok]

まあそうですね。

02:53:02,276 --> 02:53:07,376 [akira]

100年止めることはないというか、 その10から20年が多分マックスだと思うので。

02:53:07,416 --> 02:53:08,396 [bioshok]

うん。

02:53:08,656 --> 02:53:15,236 [akira]

サチュレートし始めるので、 その多分ペイするのが多分20年30年がマックスだと思うので、 そこはあまり問題にならないと思います。

02:53:17,656 --> 02:53:21,756 [bioshok]

まあそうサチュレートするっていうのは、 そのアライメント研究をこれ以上。

02:53:22,756 --> 02:53:31,056 [akira]

やっても、 そのほとんどあんまり伸びないよっていう。59.5%、59.51%にできますぐらいになっちゃうって話ですね。

02:53:31,496 --> 02:53:32,756 [bioshok]

うん。

02:53:32,896 --> 02:53:35,996 [akira]

それだったら意味ないので、 それだったらそのチャレンジした方がいいので。

02:53:37,636 --> 02:53:44,616 [bioshok]

それだったら意味ないっていうのはあれですよね、 だから。だから他のリスクがあるから意味がないっていう話に。

02:53:44,676 --> 02:53:45,536 [akira]

そうそうそうそう。

02:53:48,356 --> 02:53:54,356 [bioshok]

まあそんなに止められるのかどうかみたいなとこもあるし、 開発を。

02:53:54,376 --> 02:53:54,996 [akira]

そうですね。

02:53:55,156 --> 02:54:01,396 [bioshok]

どっかで誰か他の国が裏切っちゃうのかもしれないとか、 そういうのがあるってことですよね。

02:54:02,596 --> 02:54:08,406 [akira]

そうそう、 そういうテールリスクにその差が響き出すんだったら、 もうやった方がいいので。

02:54:08,456 --> 02:54:22,056 [bioshok]

まあそういうことですよね。まあそれって世界政府とか作ればテールリスクもほとんど排除できるとかないんですかね。

02:54:22,136 --> 02:54:25,816 [akira]

でも世界政府が崩壊するというテールリスクが追加されません?

02:54:25,856 --> 02:54:26,436 [bioshok]

あ、 まあそうか。

02:54:27,356 --> 02:54:32,236 [akira]

その、 それがそのすごい特殊な過程を導入することによって、 そのそのテールリスクを移してるだけなので。

02:54:33,476 --> 02:54:33,736 [bioshok]

なるほど。

02:54:34,056 --> 02:54:37,496 [akira]

それだとそのテールリスクを仮定しないと、 仮定した方が早いですね。

02:54:37,756 --> 02:54:49,576 [bioshok]

はい。まあ、 まあ何はともあれ、 そういうことをいろいろ考えると、 数十年でサチュレートするという。

02:54:49,616 --> 02:55:01,796 [akira]

そうですね、10年、20年だと思います。まあできるだけ短くする。そのどれくらいなのかは、 ちょっとその人類のその期間の努力によるというか、 そこの詳細はあまり見積もる意味ないかなと思っているので。

02:55:02,656 --> 02:55:03,816 [bioshok]

なるほど。

02:55:04,296 --> 02:55:24,496 [akira]

その停止できた世界線で人類がどう頑張るかで停止してから考えたらいいので、 あんまりその思考エッセイ、 その思考を投じる価値があるわけじゃないなっていう、 その正確なPドゥーム、Pノットドゥームを6.5パーから6.6%に総合でするために、 その思考時間を使うよりは、 その直接何かをしに行った方が実際のPドゥーム下がるので。

02:55:26,676 --> 02:55:27,316 [bioshok]

まあそうですね。

02:55:28,056 --> 02:55:34,116 [akira]

そこにそのあまりシンキングが、 シンキングバジェットを使ってないですね。

02:55:36,556 --> 02:56:42,396 [bioshok]

うーん。まあだから、 そうっすね。うーんと。パーセント。なんか。感、 あ、 もうちょっと待ってくださいね。まず50パー、70パー。割とだから、 うん。短い期間に、 この10年以内に、 まあAIができる可能性が結構7割ぐらいあって。で。そのほとんどは開発停止が今んとこできないだろうって想定してってことですよね。

02:56:44,356 --> 02:56:45,496 [akira]

何がですか?

02:56:45,536 --> 02:57:07,656 [bioshok]

そのアキ、 アキラさんが、 まあ二千三十五年までにAGIが七十パーセントぐらいできて、 で、 で、 その期間は、 まあ基本的に、 まあほとんど一年以内の開発停止しか挟み込めないっていう。

02:57:08,296 --> 02:57:10,776 [akira]

二千七十年にAGIができるケースですか?

02:57:10,856 --> 02:57:12,856 [bioshok]

あ、 二千三十五年まで。

02:57:14,076 --> 02:57:21,176 [akira]

ああ、 そうですね。いや、 まあ十年挟み込める確率も、 だから、 ご、 十年、 五年、 五年長さ以上十パーぐらいあるんで。

02:57:22,256 --> 02:57:23,116 [bioshok]

あ、 なるほど。

02:57:24,396 --> 02:57:28,916 [akira]

そこはその僕のその、 なんていうか、 そのAGI見積もりじゃなくて、 そのワシントン見積もりなので。

02:57:29,896 --> 02:57:30,196 [bioshok]

なるほど。

02:57:31,256 --> 02:57:36,296 [akira]

僕そのAGIピルは飲んでますけど、 ワシントンピルはそんなに飲めてない感じもあるので、 そこはその影響する可能性があります。

02:57:37,156 --> 02:57:44,016 [bioshok]

でももしこの十年の開発停止見積もりとか五十パーぐらいに上がる可能性も結構全然ある。

02:57:45,036 --> 02:57:54,516 [akira]

まあその、 それはその、 例えばなんかそのあれですね、 次にバイオバンミトスが出た瞬間に、 そのほぼ全ての会社がバイオバンハッキングフェイズをやらかした場合ですとか、 とかじゃないですか。

02:57:54,936 --> 02:57:55,436 [bioshok]

あ、 なるほど。

02:57:56,216 --> 02:58:06,756 [akira]

とか、 例えばなんかその、 本当に規制条約が、 その、 それぞれの議会で話題に上がって、 指導部ももし可決されたら同意するとかって言った瞬間に、 それはものすごい方針なので。

02:58:07,796 --> 02:58:08,976 [bioshok]

なるほど。

02:58:09,016 --> 02:58:15,576 [akira]

あれです。まあその考え詰めるだけで五十パーセントなる可能性もありますけど、 ちょっとそれはちょっと、 その意味がないというか。

02:58:17,116 --> 02:58:19,096 [bioshok]

まあ一旦ここは。

02:58:19,136 --> 02:58:30,216 [akira]

いや、 そのガバナンスエフォートを仮定した時の、 その、 ガバナンスエフォートの値を正しくする時間を使ってガバナンスエフォートをした方がいいので、 絶対。

02:58:31,176 --> 02:58:59,316 [bioshok]

まあそうですね。まあだからとにかく、 開発を止めなければほぼ確実に人類は滅亡するというところだけは変わらず持っておいて、 ガバナンスエフォートをするってことですよね。

02:59:00,156 --> 02:59:07,936 [akira]

そうですね。まあそこはなんかそのモデルは更新してもいいかもしれないですけど、 その、 そこはそんなに意味、 意味、 意味がないタイプのやつかなと。

02:59:10,516 --> 02:59:11,216 [bioshok]

なるほど。

02:59:13,796 --> 02:59:25,836 [akira]

そのそこのガバナンスの予想を一パーセント頭の中で引き下げたところで、 その、 実世界では何したらいいかって何も変わらないですし。

02:59:28,336 --> 02:59:30,336 [bioshok]

まあそうですね。

02:59:30,456 --> 02:59:32,516 [akira]

技術的な方じゃないですか、 基本的に。

02:59:37,776 --> 02:59:42,516 [bioshok]

まあだから、 どっちかというと一番の論点はここですね。アライメント成功確率が。

02:59:44,276 --> 02:59:44,596 [akira]

そうですよね。

02:59:44,636 --> 02:59:46,316 [bioshok]

どこまであるのかみたいな。

02:59:46,396 --> 02:59:57,296 [akira]

そうですね。まああとタイムラインですよね。多分そのバイオさんのタイムラインはAGIと、 そのASIでやってますけど、 うん、 その正確にやるんだったらそのヒューマニティエンディングAIでやるべきなんで。

02:59:58,976 --> 03:00:45,636 [bioshok]

まあそうですね、 ヒューマニティエンディングAIだと。まあAGI前後のイメージで。まあでもタイムラインは、 あれかな。まあ、 あ、 まあそうですね。だからアキラさんだとタイムラインが別に遅くなっても、 まあ。まあそこまで遅くなるっていうのも考えてないぞと、 まあ考えてないんですけどね。二千四十五年、 例えば二千四十五年にAGIが開発されるとするじゃないですか。で、 そうすると多分今が二十年ぐらい余裕があるじゃないですか、 なんか。

03:00:46,056 --> 03:00:47,216 [akira]

そうですね。

03:00:47,576 --> 03:00:59,296 [bioshok]

で、 その二十年ぐらい余裕があると、 二十年ぐらい開発停止してることと同じぐらいのアライメント研究のエフォートは、 まあ避けるかもしれないですよね。

03:01:00,196 --> 03:01:06,656 [akira]

避けるかもしれないですけど、 その、 それは、 あの、 おそらく、 そのちゃんとコアプロブレムに人材が増えるのかとかいう。

03:01:07,836 --> 03:01:08,136 [bioshok]

あ、 なるほど。

03:01:08,296 --> 03:01:11,256 [akira]

そこでその、 そこに、 そこに相関していて。

03:01:11,336 --> 03:01:11,876 [bioshok]

はいはいはい。

03:01:12,116 --> 03:01:23,796 [akira]

長く止まる世界っていうのは、 そのコアプロブレムの重要性が認識されている世界。なので、 そのコアプログラムにいろんな人が投じられて、 資源も投じられる世界を、 あら - 表してる、 に対応してるわけですよ。

03:01:24,356 --> 03:01:24,976 [bioshok]

まあそうですね。

03:01:25,516 --> 03:01:34,396 [akira]

ただタイムラインが長いだけの世界だったら、 そのアライメント研究が加速しているっていっても、 その表面的なアライメント問題にいっぱい人材が今みたいに突っ込まれることになるので。

03:01:35,856 --> 03:01:49,196 [bioshok]

な、 なるほど。だから単にAGIタイムラインが長いっていうだけだと、 まああまりコアプロブレムに、 なんかエフォートが投入されてない可能性も結構あるから。

03:01:49,276 --> 03:01:57,096 [akira]

そうそうですね。そのコアプロブレムに投じられるエフォートとタレントみたいな全てというか、 まあ全てじゃないですけど、 重要じゃないですか。

03:01:58,656 --> 03:02:01,416 [bioshok]

まあそうですね。

03:02:03,476 --> 03:02:16,176 [akira]

そこですよね。そこが、 その、 タイムラインがただ長いだけだったら、 そのみんながコアプロブレムじゃないところにいっぱいアプローチしてくだけになるので。それはそのスピードもあまり下げてくんないですね。

03:02:16,256 --> 03:02:22,916 [bioshok]

なるほど。まあだけど、 まあオーバーオールとしては下がるってことですね、 一応。

03:02:22,956 --> 03:02:31,936 [akira]

もちろん下がりますけど。その、 なのでその総合でそんなにすごい下げてくるわけではないです。で、 バイオさんもその引き下げるべきだと思いますね。

03:02:32,936 --> 03:02:33,296 [bioshok]

ああ、 この -

03:02:33,336 --> 03:02:38,836 [akira]

多分バイオ、 バイオさん、 ちょっと全体的に、 そのアライメント成功率を多分修正した方がいいと思いますね、 今。

03:02:41,236 --> 03:03:14,246 [bioshok]

おー、 すげえ。ないね。ないよ。うーん。

03:03:14,926 --> 03:03:21,026 [akira]

しばゆーさん、 ちょっと一旦あ、 値を書き直してみてくれますか?総合で。これを経て。

03:03:24,086 --> 03:03:25,106 [bioshok]

そうっすね。

03:03:26,926 --> 03:03:28,846 [akira]

ちょっとその間に僕は大谷やってきます。

03:04:07,566 --> 03:06:15,056 [bioshok]

えーっと。なんか薄いな、 字が。うん。

03:06:15,126 --> 03:06:17,586 [akira]

iPadの使い方に苦戦してますか?

03:06:17,626 --> 03:06:24,286 [bioshok]

あ、 そう。ちょっとまだ、 そう、 考えてなかった論点として。

03:06:24,366 --> 03:06:24,586 [akira]

はい。

03:06:26,166 --> 03:06:56,206 [bioshok]

なんていうんですかね、 もう今日、 今日AGIの、 なんだろうな、 コントロールみたいな、 ので、 ま、 な - なんらかの欺瞞とかハッキングとか、 うん、 っていう振る舞いが見られた後に、 開発停止期間がこう、 まあ大幅に延びるシナリオみたいな。

03:06:59,586 --> 03:07:01,526 [akira]

それはそのさっき僕が言ったやつじゃないですか。

03:07:07,946 --> 03:07:09,666 [akira]

五番どこに、 どこにあります?

03:07:27,926 --> 03:07:30,546 [akira]

どう?もう一回言ってもらっていいですか?

03:07:30,586 --> 03:07:33,506 [bioshok]

あのー、 一、 二、 三、 四ってあるじゃないですか。

03:07:34,386 --> 03:07:35,246 [akira]

ああ、 そう、 ありますね。

03:07:36,746 --> 03:07:38,806 [bioshok]

この四の下の四角。

03:07:48,736 --> 03:07:48,986 [bioshok]

あれ?

03:07:49,186 --> 03:07:51,166 [akira]

緑色の、 薄い緑色で五って書いてあります。

03:07:53,766 --> 03:08:05,646 [bioshok]

ちょっと。反映されてないだけかもしれないですね。

03:08:08,066 --> 03:08:08,866 [akira]

そうだと思いますね。

03:08:15,086 --> 03:08:33,486 [bioshok]

まあいいや。ここに、 まあ今日AGIのコントロールみたいなのも書いたんですけど、 つまり、 まあこのままいくと数ヶ月の開発停止以後、 まあ四ヶ月目ぐらいにこう超知能に行っちゃうわけじゃないですか。

03:08:34,586 --> 03:08:35,086 [akira]

そうですね。

03:08:35,626 --> 03:09:05,806 [bioshok]

だから、 まあなんですけど、 こ - このどこかで、 なんか、 なんですかね、 今回のなんかハギングフェイスのハッキングみたいなことを検知して、 あ、 これは結構アドバーサルにmisalignmentしてるっていうことに気づいて、 で、 か、 そのすごいその開発停止っていうのが期間っていうのはなんかすごい大幅に伸びる可能性みたいな。

03:09:07,246 --> 03:09:24,486 [akira]

それはさっき言及しませんでしたっけ?最初に自分の方が言及したんですよ。その四ヶ月って数ヶ月ってシナリオだったらあれだけど、 数ヶ月でやってみてやらかす可能性はあるって言いませんでしたっけ?

03:09:24,546 --> 03:09:26,906 [bioshok]

あ、 で、 それでどうなったんでしたっけ?その議論は。

03:09:28,246 --> 03:09:29,786 [akira]

いや、 まあそれはそうだねで終わりましたね。

03:09:30,746 --> 03:09:31,466 [bioshok]

ああ、 なるほど。

03:09:32,846 --> 03:09:38,326 [akira]

それはわからないですよね、 純粋に。あの、 次デセプションが出てきたら敗北しますし。

03:09:38,406 --> 03:09:38,906 [bioshok]

あ、 なるほど。

03:09:40,546 --> 03:09:45,026 [akira]

そのむしろ今次打つ手の強さによると思いますね。

03:09:46,486 --> 03:09:58,026 [bioshok]

なるほど。まあ。その。なんで反映されないの?

03:09:59,046 --> 03:10:16,146 [akira]

そうですね。五の、 五の上の線が一本消えましたよ。だからそもそも今コントロールの話は何もしてなくないですか?そのもともとバイオさんのPDPの例もかなりはコントロールによって創設されたと思ったんですけど。

03:10:17,666 --> 03:10:21,546 [bioshok]

あ、 そうですね。だからコントロール。

03:10:21,846 --> 03:10:27,806 [akira]

一旦一回先に修正、 いろいろ値を修正してPDM算出してもらって、 その後またコントロール議論をしますか。

03:10:29,526 --> 03:10:35,066 [bioshok]

あ、 でもそのコントロールのそのあれが。

03:10:35,546 --> 03:10:41,866 [akira]

これ僕理解してないですけど、 そのバイオさんのモデルだとコントロールがなぜか精度率を下げてるんですけど。

03:10:43,326 --> 03:10:50,546 [bioshok]

まあそうですね。でも一回この数ヶ月前よりは結構そのコントロールへの見積もりは下がってるんですけど。

03:10:51,746 --> 03:10:58,126 [akira]

そうなんですけど、 じゃなくて、 そのコントロール項のそのPDーム全体の起用の方式がおかしくないですか?

03:10:58,246 --> 03:11:00,626 [bioshok]

あーっとどこでしたっけ?あ、 この読み方。

03:11:00,726 --> 03:11:14,806 [akira]

コントロール、 こ - こ - コントロール調整かける零点九みたいななってますけど。これってまたアライメントに成功するシナリオの話じゃないですか。アライメントが成功するシナリオに零点九をかけるとか、 コントロールのせいでアライメントが十パー失敗してません?

03:11:14,906 --> 03:11:29,966 [bioshok]

ああ、 ここは、 えー、 なんだっけな。あ、 だからこれはあれか。あの、 小弱AGIが人類を滅ぼす可能性を入れたっていうところですね。なんか。

03:11:30,066 --> 03:11:35,956 [akira]

ああ、 なるほどなるほど。が九十パーセーブできると。でも弱AGIにあれ解いてもらう話じゃなかったんですか?

03:11:36,006 --> 03:11:41,606 [bioshok]

あ、 そうそう。だからアライメント解ける可能性がまず二十パーセントありますと。弱。

03:11:42,086 --> 03:11:48,326 [akira]

でもバイオさん、 ああ、 えっと、 弱AGIがアドバーサリアにミスられるのが世界線ってことですか?

03:11:48,386 --> 03:11:50,126 [bioshok]

あ、 まあ、 あの。

03:11:50,526 --> 03:11:58,126 [akira]

え、 多分そう、 そうなんです。多分零点九の使い方がおかしくないですか?むしろアライメントができてない世界線に対して適用するやつじゃないんですか?

03:11:58,626 --> 03:12:00,346 [bioshok]

えーと、 できてない。

03:12:02,226 --> 03:12:15,166 [akira]

え、 そのアライメントが成功する世界線に零点九かけると、 そのアライメントが成功してるけど、 コントロールのせいで成功率が十パーセント減ることになるので。それは多分そのモデルに致命的な計算ミスがあると思いますね。

03:12:16,786 --> 03:13:01,486 [bioshok]

まあそうですね。だからそこは、 だから、 アライメン、 なんかそのアドバーサルな。あ、 まあだからちょっとここがミスってますね。だから。うーんと。アライメントの成功確率が九十。あ、 まあだから弱AGIが、 まあミスアライメントしていて、 かつコントロールが不可能になって、 人類を滅ぼす可能性がまあ十パーセントあるって考えて。で、 それ以外の可能性が零点九でかかってるって感じですかね。

03:13:02,926 --> 03:13:05,246 [akira]

もう一回言ってもらえますか?

03:13:05,306 --> 03:13:31,766 [bioshok]

まあつまり弱AGIが、 まあ、 えーと、 人類を滅ぼす可能性っていうのがまあ十パーセントあって。まあつまりコントロールを、 なんだかんだ、 今回のミトスの事件みたいに、 ミトスっていうのはオープンエアのハッキング事件みたいにコントロールできなくなる可能性を十パーセントとして見てて。

03:13:34,926 --> 03:13:37,886 [akira]

え、 え、 え、 十パーセント?

03:13:38,586 --> 03:13:38,946 [bioshok]

まあそう。

03:13:39,086 --> 03:13:43,246 [akira]

コントロール、 こんと、 コントロールできなくなる確率が十パーセントですか?

03:13:43,266 --> 03:13:45,686 [bioshok]

そうですね。

03:13:45,766 --> 03:13:48,066 [akira]

え、 ああ、 ああ、 わかりました。

03:13:50,066 --> 03:14:23,826 [bioshok]

で、 もう十、 まあだから、 まあここはすごい粗いですね。十パーセントでコントロールができなくて、 で、 そのまま人類が滅亡するっていう風に考えてたんですけど。で、 まあでもちょっとこれが、 だから、 じゃ - 弱AGIの話なんですよね、 これは。だからその、 今日、 今日AGIの、 えっと、 話は、 あんま、 あんまりコントロールについてね、 かん - 考えられてないんですよ、 このモデルって。

03:14:23,866 --> 03:14:35,226 [akira]

そうですね。コントロールの項目がおかしいというか。なるほど。じゃあこれでアライメントブーストトラップできるかって話は、 本来この小計の次のステップだったってことですか?

03:14:35,326 --> 03:14:48,706 [bioshok]

そう。あ、 いや、 違いますね。これは、 えっと、 アライメントが成功っていうのが、 まあつまりブーストトラップが成功するって意味なので。

03:14:49,406 --> 03:14:49,846 [akira]

そうですよね。

03:14:50,846 --> 03:14:51,026 [bioshok]

で。

03:14:52,466 --> 03:14:55,486 [akira]

だ - だ - だとすると、 その世界線でコントロールいらなくないですか?

03:14:55,506 --> 03:15:09,698 [bioshok]

まあいらないんですけど、 その手前、 手前でなんかミスってる可能性ってことですね。なので、 そこまでで掛け算としては最初にあるんですよね。このコントロール失敗っていうのが。

03:15:09,758 --> 03:15:15,418 [akira]

え、 それってあれじゃないですか、 あの、 ほぼないんじゃないですか?

03:15:15,458 --> 03:15:17,898 [bioshok]

まああんまりないと思うんで、 ここの方は。

03:15:18,418 --> 03:15:24,058 [akira]

バイオさんのシナリオって弱AGIで解決するシナリオが一番多くないですか?

03:15:24,138 --> 03:15:24,828 [bioshok]

まあそうですね。

03:15:24,828 --> 03:15:37,038 [akira]

世界線って。そうするとコントロールいらなくないですか?要するにその弱AGIで解決できる世界線しか残ってないんだったら、 弱AGIでアライメントできてる世界線しか残ってないので。

03:15:38,538 --> 03:15:46,018 [bioshok]

まあそうですね。なので弱AGIがアライメントされてない世界線をここに書いてるってことなんですけど。

03:15:46,078 --> 03:15:50,158 [akira]

じゃあそのモデルへの多分値の適用がおかしいと思いますね。

03:15:52,018 --> 03:16:10,638 [bioshok]

えーと、 あ、 だからその最後に掛けるのは間違ってますね。だからこれ。その、 本来は何ですかね、 最初に何だろうな。まずはアライメントできてるかできてないかっていうことですよね、 弱AGIが。

03:16:11,218 --> 03:16:11,908 [akira]

そうですね。

03:16:11,908 --> 03:16:28,618 [bioshok]

だからそこを、 だからこの、 このダイアグラムでいうと、 この前に書く必要があるんですよ。まあだけどなんかまあ、 もう、 あんまり重要じゃないかもしれないですね。ここは。ほとんど成功するって考えているので。

03:16:29,698 --> 03:16:37,698 [akira]

そのコントロールが、 あ、 そう、 ああ、 なるほどなるほど。え、 でももともとアドバーサリーありミスアラインドな可能性のところが多いんじゃないですか?コントロールが必要なとこって。

03:16:39,318 --> 03:16:40,618 [bioshok]

まあそうですね。だからそこ。

03:16:41,558 --> 03:16:52,838 [akira]

その今更新されたバイオさんのモデルだと、 その数ヶ月の開発停止で息のアライメントがブートストラップされる世界の、 ほぼ全ては弱いAGIによってアライメントがブートストラップで解決されてるわけじゃないですか。

03:16:52,918 --> 03:16:53,838 [bioshok]

ああ、 そうですね。

03:16:54,238 --> 03:17:00,298 [akira]

だとすると、 アドバーサリーにミスアラインドな弱AGIがいるっておかしいので。

03:17:00,958 --> 03:17:02,138 [bioshok]

あ、 そうですね。だから。

03:17:02,998 --> 03:17:05,038 [akira]

コントロール全く関係ないですよね。

03:17:05,078 --> 03:17:23,138 [bioshok]

そうですね。だから、 だから本来は、 あの、 そ、 その弱AGIが暴走するっていうのが、 その、 この前にあるんですよね、 そのシナリオとして。なんか、 だからそこを書いてないので、 あの、 ちょっとおかしくなってるとこですね、 最後。

03:17:24,398 --> 03:17:24,978 [akira]

やっぱそうですね。

03:17:24,998 --> 03:17:34,178 [bioshok]

ここにこう、 だからこのコントロール調整っていうのを、 ここで掛け算してるのがおかしいですね、 だから。本当は手前でやんなきゃいけないことですね。

03:17:34,458 --> 03:17:40,478 [akira]

そのコントロールがPドゥームを減らす世界っていうのは、 どこに、 その、 このモデルだとどこにあるんですか?

03:17:40,798 --> 03:17:41,318 [bioshok]

このモデル。

03:17:41,378 --> 03:17:49,278 [akira]

コントロールっていう概念が存在しない世界でも、 その、 このモデルだと影響しなそうですけど、 コントロールが概念存在しないのはさすがに良くないと。

03:17:49,998 --> 03:18:32,898 [bioshok]

まあ、 なんていうか。どっちかっていうと、 だからその、 えっと、 本来は、 まあこの数ヶ月の開発停止とかで、 うん、 まあ敵対的な振る舞いを、 まあ検知するってとこですかね、 コントロールとしてできてるってところは。で、 検知した後に、 つまりこの開発の停止期間が延びるっていうところで、 まあ本当は反映したかったんですけど。まあつまり、 まあそれを入れる前にちょっと晃さんに渡しちゃったんで、 これを。

03:18:33,018 --> 03:18:33,878 [akira]

なるほど。

03:18:33,918 --> 03:18:37,018 [bioshok]

だからコントロールのあれが入ってないですね、 ここは。あれ。

03:18:37,198 --> 03:18:37,878 [akira]

なるほど。

03:18:38,078 --> 03:18:44,958 [bioshok]

本来は、 まあ実質的にこの開発停止期間があるじゃないですか。四六ヶ月、 一年、 三年、 五年、 十年。

03:18:44,978 --> 03:18:45,618 [akira]

そうですね。

03:18:45,738 --> 03:19:04,338 [bioshok]

この確率、 だからほんと本来は確率がもうちょい下に下がる、 下に、 つまり、 えっと、 遅くなる方向に行くって感じですかね。開発停止期間が長くなる確率が高くなるって感じですかね、 コントロール項が入ると。

03:19:06,658 --> 03:19:07,018 [akira]

なるほど。

03:19:07,698 --> 03:19:22,998 [bioshok]

それはなぜかっていうと、 まあ、 まあ、 あの、 強、 強いAGIがなんか変な敵対的な行動してるのを発見する確率が高くなり、 その結果、 開発停止期間も長くなる可能性が高く、 高くなるっていう感じですかね。

03:19:23,698 --> 03:19:36,158 [akira]

なるほどなるほど。それは確かにありますね。それはでもそれに九十パー、 そのアドバーサリーミサランドの世界線で九十パーセント見たってこと。

03:19:37,618 --> 03:19:43,558 [bioshok]

えーと、 だからそれはまだ入れてないんですけど、 このモデルに。

03:19:43,758 --> 03:19:50,258 [akira]

そのバヤさんのここで言ってるそのアライン、 コントロール成功の九十パーセントっていうのは何を意味しているんですか?

03:19:51,058 --> 03:20:33,318 [bioshok]

ああ、 これは、 なんか、 えっと、 じゃ、 弱AGIの話で、 ああ、 あの、 コントロールの想定ってのをちょっと書いたんですけど、 ここに。まあ、 だからその弱AGIが、 まあ、 なんだろうな。を、 まあコントロールできる可能性の十パーセント程度って置いて、 まあまあこれは実際期間とかいろいろ考えなきゃいけないですけど、 まあ一旦適当に十パーと置いているんですよね。敵対的にミスアラインメントされたAGI、 つまりこれは強いAGIですけど、 この話で。

03:20:34,178 --> 03:20:36,838 [akira]

敵対的にミスアラインドな弱いAGIではなくて。

03:20:36,858 --> 03:20:37,658 [bioshok]

あ、 そうですね、 強い。

03:20:37,778 --> 03:20:50,158 [akira]

適度な弱い。いやいや、 じゃなくて、 その九十パー成功するっていうのは、 その強い、 弱いAGIがアドバーサリーありミスアラインドなんじゃなくて、 弱いAGIってだけってことですか?

03:20:51,178 --> 03:20:56,018 [bioshok]

あ、 えっと、 弱いAGIがアドバーサリーミスアラインとだった場合。

03:20:56,058 --> 03:21:00,038 [akira]

な時に九十パー成功するんですか?

03:21:00,118 --> 03:21:02,058 [bioshok]

ああ、 まあそういうことですね。

03:21:02,158 --> 03:21:05,738 [akira]

なるほどなるほど。だったらちょっとそこについてまた戻ってきましょう。

03:21:05,918 --> 03:21:08,858 [bioshok]

で、 強いAGIだと五十パーで成功して。

03:21:09,918 --> 03:21:10,038 [akira]

ほう。

03:21:10,798 --> 03:21:15,678 [bioshok]

で、 超知能なら90%以上で成功するっていう。

03:21:16,258 --> 03:21:19,938 [akira]

え、 超知能なら90%失敗するってことですか?

03:21:20,058 --> 03:21:23,518 [bioshok]

90%で成、 成、 えっと、 超知能なら。

03:21:23,758 --> 03:21:24,678 [akira]

出すと。

03:21:24,898 --> 03:21:27,958 [bioshok]

成功突破するっていう。

03:21:28,018 --> 03:21:30,578 [akira]

あ、 なるほどなるほど。弱AIは10%しか成功しない。

03:21:30,638 --> 03:21:31,098 [bioshok]

あ、 そう。

03:21:31,958 --> 03:21:34,478 [akira]

あ、 なるほどなるほど。それは後で詰めたいです。

03:21:37,418 --> 03:22:09,418 [bioshok]

で、 でまあもしこれで、 なんでしょうかね、 多分弱AGIが10%で。っていうかまああれか。まあそのコントロールの封じ込めを突破できなかったら、 まあある程度検知できる可能性もあるんで。で、 そこで政策のオーバーとウィンドが上がって、 さらに開発の停止期間が延びるっていう風にモデルで入れようとしたんですけど。

03:22:10,178 --> 03:22:15,998 [akira]

なるほど。つまりそのコントロールができ続けるっていうよりは、 検知ができるってことですか?

03:22:16,198 --> 03:22:16,578 [bioshok]

検知。

03:22:17,338 --> 03:22:19,878 [akira]

オーバーとウィンドウ動かして、 既定に動かすほど。

03:22:20,338 --> 03:22:21,078 [bioshok]

あ、 そうそうそうそう。

03:22:22,458 --> 03:22:23,918 [akira]

のシフトを起こせるってことですよね。

03:22:23,958 --> 03:22:37,058 [bioshok]

あ、 そうです。なんかどっちかっていうと、 あんまり、 何て言うかな。まあコントロールでずっと封じ込めるって意味意味ではないですね。その。

03:22:37,138 --> 03:22:39,158 [akira]

なるほど。

03:22:39,238 --> 03:22:42,178 [bioshok]

あの、 そういう事象が起こったら開発停止。

03:22:42,258 --> 03:22:48,758 [akira]

コントロールが、 コントロールがある間だったらオーバーとウィンドが動かないんじゃないですか?

03:22:48,858 --> 03:22:53,658 [bioshok]

コントロールが。あ、 まあでもなんかその。

03:22:54,538 --> 03:23:01,318 [akira]

そのコントロール下にあるから弾かれましたってニュースで全然多分話題にならないと思うんですけど。

03:23:01,358 --> 03:23:01,898 [bioshok]

うーん。

03:23:02,658 --> 03:23:08,018 [akira]

すでに相当動き切ったオーバーとウィンドじゃないといけないんで、 その誤差じゃないですか。

03:23:10,998 --> 03:23:21,358 [bioshok]

まあそうかな。封じ込め。なんかその結構突破されそうになったみたいな。

03:23:23,278 --> 03:23:25,758 [akira]

それそれってかなりギリギリじゃないといけないってことですよね。

03:23:28,178 --> 03:23:30,257 [bioshok]

うん。

03:23:30,558 --> 03:23:37,598 [akira]

要するにそのすごい強い警告が一個出るまでに弱いのがいっぱい出てるだけじゃダメってことですよね。

03:23:39,678 --> 03:23:41,098 [bioshok]

ああ。

03:23:41,158 --> 03:23:45,258 [akira]

それってただのそのただの制御の成功確率とはまた違う概念だと思うんですけど。

03:23:49,898 --> 03:23:56,118 [bioshok]

うーん。まあ確かにそうか。弱、 弱い警告が。

03:23:56,178 --> 03:24:00,878 [akira]

いっぱい、 弱い警告だったらもういくらでも既に見つかってたわけじゃないですか。

03:24:00,978 --> 03:24:01,918 [bioshok]

うん、 まあそうですね。

03:24:04,858 --> 03:24:15,478 [akira]

それを全部突き破ってきてるわけで。それがその、 それ、 そういう態度自体がひっくり返るレベルって、 多分元々オーバーとウィンドが動ききってるので。

03:24:17,058 --> 03:24:22,458 [bioshok]

なるほどなるほど。あんまりここであれか。そうですね。

03:24:22,558 --> 03:24:23,328 [akira]

稼げなくないですか?

03:24:23,518 --> 03:24:24,978 [bioshok]

稼げないか。

03:24:25,098 --> 03:24:27,458 [akira]

そもそも稼げる部分が小さくないですか?元々。

03:24:30,638 --> 03:24:34,918 [bioshok]

まあそうするとあまりコントロールっていう項を入れても。

03:24:36,018 --> 03:24:44,018 [akira]

そのあってもなくても、 元々そのコントロールが強いおかげで助かる世界の元の質量が狭いので。

03:24:44,698 --> 03:24:45,798 [bioshok]

なるほど。

03:24:45,838 --> 03:24:48,838 [akira]

あんまり関係ない気もしますね。

03:24:52,858 --> 03:24:55,338 [bioshok]

まあそうっすね。そうすかね。

03:24:55,938 --> 03:24:56,478 [akira]

あ、 うん。

03:24:58,758 --> 03:25:37,138 [bioshok]

うーんと、 あ、 そうか。だから。まあ結構。まあちょっと少しだけ。なんか1%ぐらいは影響あるかもしれないですけど。あんまり大きくは影響しないかもしれないですね。コントロールの想定は。

03:25:37,338 --> 03:25:44,218 [akira]

そうですよね。それは多分すごい適切なモデルに落ち着いてると思いますよ。

03:25:45,358 --> 03:25:54,918 [bioshok]

まあそうなると、 そう、 そうですね。実はこれ、 このモデルが適切だったみたいな。まああんまり。

03:25:54,998 --> 03:25:59,498 [akira]

前のあの、 コントロールによってPノット全部が稼がれ続けるモデルはぶっ壊れてるので。

03:26:02,018 --> 03:26:19,858 [bioshok]

まあそうですね。まあアライメントに成功してないと、 基本的に、 なんか僕はあれですね、 考え方を結構大きく変えた理由は、 例えばスケーラブルオーバーサイトでいけるんじゃないかって思ってたんですけど。

03:26:20,728 --> 03:26:21,358 [akira]

はい。

03:26:21,388 --> 03:26:26,358 [bioshok]

スケーラブルオーバーサイトの監視役も別にアライメントされてないみたいな感じになっちゃうんで。

03:26:26,818 --> 03:26:27,318 [akira]

そうですね。

03:26:28,178 --> 03:26:37,498 [bioshok]

それが一番でかいですね。そのアライメントされてないAIがアライメントされてないASIを監視するみたいな感じになっちゃうんで。

03:26:37,918 --> 03:26:42,458 [akira]

そうですね。あの、 あれですか、 じゃああの、 インナーミスアラインメントの例えが効いたということですか。

03:26:44,078 --> 03:26:45,258 [bioshok]

えっと、 あの、 外も。

03:26:46,718 --> 03:26:57,258 [akira]

あの、 昔、 あの昔やったその文、 文法内でアドバタイズされるミスアラインドじゃなくても、 そのもっと強いやつが出てきて、 別の文法を提示することによって、 そのちゃんとミスアラインメントだったと認識させることができるみたいな話。

03:26:57,278 --> 03:26:59,858 [bioshok]

ああ、 まあそこら辺も効いてますね。つまり。

03:26:59,938 --> 03:27:00,438 [akira]

やつですね、 多分。

03:27:01,138 --> 03:27:05,878 [bioshok]

そう、 そのAGIが、 なんて言うんだろうな。

03:27:08,738 --> 03:27:15,098 [akira]

AGIがハーフアラインドみたいな、 その曇った言葉の曖昧性に揺られるのが止まったってことじゃないですか。

03:27:16,478 --> 03:27:54,650 [bioshok]

まあそうですね。その。な - なんていうか、 ぶ - 分布外に結局出ちゃうので、 なんかアラインメント問題を解こうとすると。まあその、 普通のホワイトカラーの仕事とかを任せるのはできるかもしれないですけど。あ、 それ以上難しい問題ってなってくると、 まあ、 まあアラインメントができてない場合は、 そこでなんか基本的には。

03:27:54,690 --> 03:27:57,090 [akira]

そうですね、 詰んじゃいますね。意味がないというか。

03:28:00,470 --> 03:28:17,530 [bioshok]

うん、 そうですね。なんかその深くアラインメントできてないといけないっていう説明と、 あとあの、 な - 内外のAIどっちも敵になるみたいな比喩あったじゃないですか。比喩っていうか、 あのタカハシさんに言った説明。

03:28:17,870 --> 03:28:19,850 [akira]

ああ、 あれで、 あのSlackのやつですか。

03:28:20,350 --> 03:28:22,470 [bioshok]

あれは結構コントロールの。

03:28:23,210 --> 03:28:25,670 [akira]

道具的修練に対する敵対話ですよ。

03:28:26,930 --> 03:28:56,870 [bioshok]

ああ、 そう。コントロールの、 への悲観、 への悲観ってのは、 この、 なんだろうな、 インナーアラインメントの、 まあ問題と。まああとはそうですね。まあそれが内にも外にもいるよっていう話で割と悲観的になりますね、 コントロールは。

03:28:57,110 --> 03:29:03,610 [akira]

なるほどなるほど、 なるほど。これ今総コピー数はどれぐらいになってるんですか?

03:29:03,650 --> 03:29:08,020 [bioshok]

だからそれを考慮した上で、 はい?

03:29:08,070 --> 03:29:11,710 [akira]

いやでもそのアラインメントについて割と信念を下ろししてるはずじゃないですか。

03:29:11,750 --> 03:29:16,790 [bioshok]

あ、 そうですね。でもちょっと僕の信念が動くのって結構遅いんで、 こう。

03:29:17,150 --> 03:29:17,570 [akira]

ああ、 なるほど。

03:29:17,620 --> 03:29:28,529 [bioshok]

ちょっとまだ咀嚼しなきゃいけないって感じですね。だからここ今書こうとしても、 多分あんまり差が、 まだその、 わかんない感じなんですけど。

03:29:28,610 --> 03:29:35,150 [akira]

あれなんですよ。ベイジアンは予想可能な方向にアップデートしないはずが、 予想可能な方向にアップデートすることになるんですよ。

03:29:36,090 --> 03:29:40,430 [bioshok]

あ、 そうですね。

03:29:42,850 --> 03:29:45,710 [akira]

割と下がるんじゃないですか?多分アラインメントの成功は。

03:29:45,790 --> 03:29:52,510 [bioshok]

うーん、 ちょっと、 もうちょい、 もうちょいこの後一時間ぐらい説得してもらっていいですか?この一二三四を。あの。

03:29:52,570 --> 03:29:53,670 [akira]

なるほど、 いいですよ。

03:29:54,050 --> 03:29:58,770 [bioshok]

このアラインメント成功をどんどん悲観的な風に。

03:29:59,030 --> 03:30:03,910 [akira]

どのシナリオ、 どのシナリオを取りますか?それぞれボコボコにしとけばいいってことですか?

03:30:04,090 --> 03:30:14,030 [bioshok]

じゃあそれぞれもう一度なんかもう一度舐めてもらって。一二三四を。

03:30:15,010 --> 03:30:21,750 [akira]

えーと、 一が、 じゃあスト。じゃあもうそれに専念するで。もうあの右の空の場所に動かしますね。

03:30:21,830 --> 03:30:23,790 [bioshok]

はい。

03:30:23,830 --> 03:30:29,750 [akira]

あれが、 で、 うん?ああ、 帰れた。えーと。

03:30:29,970 --> 03:30:32,570 [bioshok]

コントロールについてはある程度悲観的になったんで。

03:30:33,670 --> 03:30:40,090 [akira]

次はアラインメントということですか。次はアラインメントって言ってもかなりかなり元からだいぶ深くなってますけどね。

03:30:40,230 --> 03:30:42,770 [bioshok]

えっと、 はい。

03:30:55,790 --> 03:31:00,590 [akira]

えーと、 一がアラインメントバイデフォルトですよね。えっと、 大きい順に並べ、 まあ一回。

03:31:02,310 --> 03:31:09,390 [bioshok]

なお、 その他にも、 これ以外に想定できそうなアラインメントへ楽観的になりそうな。

03:31:09,420 --> 03:31:10,080 [akira]

なる理由ですか。

03:31:10,150 --> 03:31:11,530 [bioshok]

理由を何個かあげてもらって。

03:31:11,670 --> 03:31:13,290 [akira]

提示して先に破壊しておくということで。

03:31:13,950 --> 03:31:24,590 [bioshok]

あの、 アンチドゥーマーアキラを一旦召喚してもらって。で、 それをドゥーマーアキラで破壊していくっていう感じでやっていきましょう。

03:31:25,210 --> 03:31:28,870 [akira]

ああ、 なるほど、 わかりました。あまり対談の意味がないですけども、 それはそれで。

03:31:29,590 --> 03:32:21,050 [bioshok]

いや、 それでいいと思いますね。あの基本的にアンチドゥーマーアキラは僕の、 僕よりも強い気がするんで。

03:33:55,100 --> 03:34:16,540 [bioshok]

はい。まあ一旦これでアライメントの難易度についてボコボコにしてもらってから。

03:34:16,640 --> 03:34:18,820 [akira]

はい、 じゃあ始めましょうか。

03:34:18,900 --> 03:34:19,140 [bioshok]

はい。

03:34:20,900 --> 03:34:32,220 [akira]

えーと、 よくあれだ、 横にこうね、 これ書くと動かすのができないんですね。ちょっとね。選択、 選択ツールがあるかな。

03:34:33,460 --> 03:34:34,040 [bioshok]

僕を。

03:34:34,160 --> 03:34:49,360 [akira]

調べ。まずアライメントバイデフォルトからやりますね。

03:34:52,530 --> 03:34:52,530 [bioshok]

はい。

03:34:52,540 --> 03:34:56,540 [akira]

そうするとまずペルソナセレクションモデルが始まるじゃないですか、 一番最初に。

03:34:56,640 --> 03:34:58,120 [bioshok]

はい。

03:34:58,910 --> 03:36:12,080 [akira]

で、 えーと、 次に多分使うとしたら。で、 右の。PSMになるとそのアライメントがデフォルトが強化されて。ただできているだけじゃなく、RLHFと、RLAFとかconstitutionとかで。constitution。constitutionalで、 えーと、 あと何?セキュリティーなどなどで。えーと、 アライメントができるアライメントペルソナになるという話が多分一番強くて。で、 えーと、 これが本質的に意味しているより広い意味だと、 えーと、 ノン、 ノンコンセクエンシャリストだと思うんですよ。

03:36:12,160 --> 03:36:12,400 [bioshok]

ああ。

03:36:13,280 --> 03:36:15,080 [akira]

あの、 ダリワームでいくやつですね。

03:36:15,140 --> 03:36:15,940 [bioshok]

はいはい。

03:36:18,380 --> 03:36:28,600 [akira]

で、 ノンコンセクエンシャリストだったら、 えーと、 システム上は可能なので、 ゆ、 ゆ、 そのユーティリティの、 あーが、 えっと、 状態じゃなくてパスで組めるじゃないですか。

03:36:31,080 --> 03:36:33,020 [bioshok]

状態ではなくてパス、 経路です。

03:36:34,180 --> 03:37:03,320 [akira]

要するにそのエージェントをそのちゃんと定義しようとすると。definition ofエージェントが、 えーと、 えーと、 エージェントの定義が出てきて、 それはその普通に最も広い意味で言ったら、 その。方じゃないですか。えーと、 感覚、 えーと、 入力から行動を決定するわけじゃないですか。

03:37:05,040 --> 03:37:05,720 [bioshok]

まあそうですね。

03:37:06,380 --> 03:37:14,500 [akira]

で、 自明に習得ができるので、 えーと、 け - 経路、 経路ユーティリティの。あれがあるわけですよね。

03:37:17,300 --> 03:37:18,320 [bioshok]

ああ、 そういうこと?ああ。

03:37:19,380 --> 03:37:24,620 [akira]

その状態ユーティリティじゃなくて、 その経路ユーティリティで取れる可能性がありますよね。

03:37:24,700 --> 03:37:26,280 [bioshok]

はいはいはい。

03:37:26,380 --> 03:37:33,660 [akira]

で、 そうすると、 その必ずしも、 その結果主義である必要はなくなる。コンセクエンシャリストである必要はなくなるので。

03:37:34,880 --> 03:37:35,040 [bioshok]

うん。

03:37:36,040 --> 03:37:51,620 [akira]

そのより幅広い行動を取れる可能性が出てきますよね。そのペルソナセレクションモデルはその一例に過ぎなくて。そのあくまでコンセクエンシャリストじゃないから、 その手段はマキャベリストじゃないみたいなとこが近いですかね、 感覚的には。

03:37:51,720 --> 03:37:52,940 [bioshok]

なるほど。

03:37:53,000 --> 03:37:55,100 [akira]

いうエージェントを作れますよね、 権利的には。

03:37:55,800 --> 03:37:56,400 [bioshok]

そうですね。

03:37:57,700 --> 03:38:13,940 [akira]

で、 なのでこれの、 これがその一番広いセットで、 この中から、 その、 危険なユーティリティに至るのかという話ができるじゃないですか。というか、 そのノンユーティリティな部分で組めるじゃないですか。

03:38:14,000 --> 03:38:15,940 [bioshok]

うん、 ノンユーティ。はいはい。

03:38:16,180 --> 03:38:37,400 [akira]

つまりその純粋な、 あれ、 そのピュアなユーティリティマキシマイザーは。絶対にその、 えーとマキシマイザーはもうほぼ確実にルールも規定できるじゃないですか。

03:38:38,480 --> 03:38:39,260 [bioshok]

まあそうですね。

03:38:40,220 --> 03:38:49,160 [akira]

一方で、 そのルールベースのラーニングみたいなことができる。あの、 できますよね。その要するに、 その、 もしも、 えーと。

03:38:51,220 --> 03:38:51,520 [bioshok]

ああ。

03:38:57,840 --> 03:39:02,520 [akira]

ゲームになりますけど、 その、 こん、 混合ができるじゃないですか。

03:39:04,520 --> 03:39:06,440 [bioshok]

はいはい。混合、 ミックス。

03:39:07,680 --> 03:39:46,596 [akira]

混合っていうか、 まあ厳密にはその状態でもいいんですけど。えっと、 その厳密にはそのただのあれなんですけど。純粋なその経路、 経路ユーティリティマキシマイザーなんですけど。ですけど、 まあその普通はこれがUカッコSじゃないですか。あれか。こうなりますよね。純粋なUtility Maximizer。

03:39:49,156 --> 03:39:51,716 [bioshok]

はい。

03:39:55,476 --> 03:40:12,496 [akira]

一方で、 そのパスUtilityだったら。正確に言えばその。これになるじゃないですか。

03:40:14,896 --> 03:40:17,856 [bioshok]

うん、 そうですね。はい。

03:40:20,766 --> 03:40:23,676 [akira]

今これあのUndo的な部分を使ってるので。

03:40:31,236 --> 03:40:34,456 [akira]

AC。Sですか?どれだ。

03:40:35,136 --> 03:40:37,476 [bioshok]

この矢印で。ちょっと待った。

03:40:39,036 --> 03:40:43,096 [akira]

矢印。あ、 わかりました。YouTubeの方見ます。

03:40:43,236 --> 03:40:52,176 [bioshok]

矢印って。ああ、 まあこれか。これ。あ、 これ反映に十秒ぐらいかかるのかな。

03:40:52,936 --> 03:41:06,756 [akira]

そうなんです。なんで十秒待ちます。

03:41:15,056 --> 03:41:18,986 [bioshok]

今緑で下線引いたんですけど、 これは何ですか?

03:41:19,076 --> 03:41:24,036 [akira]

えーと、 緑で下線を引いたのはどこに引きました?

03:41:39,316 --> 03:41:42,476 [akira]

マイク持ってたかもな。

03:41:43,536 --> 03:41:51,456 [bioshok]

このUtility Maximizerの、 じょ、 なんだろう。数式の左?の。

03:41:52,336 --> 03:41:52,616 [akira]

左。

03:42:03,776 --> 03:42:04,656 [bioshok]

え、 映ってないですか?今。

03:42:05,476 --> 03:42:18,576 [akira]

いやいや、 その配信の画面には、 その今から書いてる話の文字が一文字も映ってないですね。あのさっきのPDMダイアグラムがずっと映ってますね。

03:42:19,216 --> 03:42:20,596 [bioshok]

え?あれ?でも。

03:42:53,876 --> 03:42:56,936 [akira]

どこですか?これなら十秒遅延だってわかる。

03:43:02,176 --> 03:43:02,996 [akira]

はい、 わかりました。

03:43:06,376 --> 03:43:17,556 [bioshok]

なんか意味がないっていうiPadもあった。なんで?なんでこっちに反映されないんだろう。

03:43:19,976 --> 03:43:22,976 [akira]

それ有覚醒Sですよ。

03:43:23,076 --> 03:43:25,076 [bioshok]

ああ、 これ有覚醒Sか。これ。あの。

03:43:25,536 --> 03:43:28,316 [akira]

状態状態に、 状態に対するUtilityのことを指していますね。

03:43:28,396 --> 03:43:32,836 [bioshok]

ああ、 なるほどなんかこう、 なんか。はい、 わかりました。

04:01:19,244 --> 04:01:22,604 [bioshok]

今最新のやつはちゃんと戻ってるはずなんで。一から六。

04:01:23,164 --> 04:01:36,544 [akira]

えっと、 で、 パスユーティリティをまあ一番大きいの選ぶわけじゃないですか。

04:01:36,604 --> 04:01:39,184 [bioshok]

はいはいはい。

04:01:40,364 --> 04:02:13,264 [akira]

でもさすがにこれだけだとその意味がなさすぎるというか、 その強化学習とかなくなっちゃうんで。表現として。えー、 テロ、 テロユーティリティと。まあその古典的な強化学習ユーティリティが入ってくるわけじゃないですか。

04:02:16,744 --> 04:02:18,944 [bioshok]

なるほど。

04:02:24,983 --> 04:02:50,124 [akira]

あれ、 なんか変な文字が入った。ここに入ってくるわけではないですか。

04:02:50,204 --> 04:02:50,884 [bioshok]

はいはいはい。

04:02:51,024 --> 04:03:02,424 [akira]

で、 ここがそのピュアマキシマイザー。で、 ここがそのパス、 パスユーティリティとかじゃないですか。

04:03:05,004 --> 04:03:06,344 [bioshok]

そうですね。

04:03:06,464 --> 04:03:28,664 [akira]

で、 なのでそのピュアマキシマイザーは明らかに、 ピュアステートマキシマイザー。で、 その右側は明らかに破滅部分なんですけど。非常にうまく左を設計することによって、 非常にうまく左の項がつくことによって、 この安全なAIを作れる可能性があるじゃないですか。

04:03:30,364 --> 04:03:31,864 [bioshok]

まあそうですね、 はい。

04:03:32,584 --> 04:03:45,084 [akira]

そのペルソナセレクションモデルとかである意味そういうノリで。この、 ここが元々、 その強化学習の項が来る前に、 この。

04:03:51,424 --> 04:03:53,164 [bioshok]

ああ、 はい。じゃあ続けてもらって。

04:03:54,064 --> 04:04:33,968 [akira]

はい。すごい。やっとやっとペンで書けるようになったんです。おめでとうございます。と、 元々だからその、 まあプリトレーニングの過程で。えっと、 えっと、 これがだいたいそのイミテーションじゃなくて、 えーっと、 はいか。こうなるわけじゃないですか、 大体。

04:04:39,328 --> 04:04:41,248 [bioshok]

はい。most likely token。

04:04:42,048 --> 04:04:47,728 [akira]

あの、 えーと、 人間、 人間の模倣というか、human imitationの方。イミテーションとはちょっと違うというか。

04:04:48,748 --> 04:04:49,388 [bioshok]

なるほど。

04:04:50,068 --> 04:04:52,388 [akira]

そういう感じでイミテーションが入るわけじゃないですか。

04:04:53,548 --> 04:04:54,378 [bioshok]

まあそうですね。はい。

04:04:54,528 --> 04:05:08,548 [akira]

すると、 その、 一応その元々の可能性として、 その、 あの、 えーっと、 暗黙知のサティスファイサーの意思であるクオンティライザーの可能性があるわけじゃないですか。

04:05:09,768 --> 04:05:11,888 [bioshok]

あー、 え、 もう一回言ってもらっていいですか?

04:05:12,008 --> 04:05:21,608 [akira]

その暗黙知の、 そのマキシマイザーじゃなくてサティスファイサーの一つである、 その、 えーと、 クオンティライザーの可能性があるじゃないですか。

04:05:22,208 --> 04:05:28,388 [bioshok]

あー、 クオンティライザーっていうのは量的最大化ってことですか?

04:05:28,608 --> 04:05:34,008 [akira]

要するに純粋なマキシマイザーはその全てを一個間違えれば世界吹き飛ばしていくので。

04:05:34,088 --> 04:05:34,228 [bioshok]

はい。

04:05:35,228 --> 04:05:46,328 [akira]

ヤバいんですけど、 その、 えーと、 サティスファイサーは、 そのユーティリティマキシマイザーに人間が絶対しないことをしないという機能をつけるという話ですね。

04:05:46,408 --> 04:05:47,168 [bioshok]

なるほど。はい。

04:05:47,848 --> 04:05:53,168 [akira]

その元々の、 その人間が出力する確率が低いものは出力しないという。

04:05:53,828 --> 04:05:54,168 [bioshok]

なるほど。

04:05:55,208 --> 04:06:09,708 [akira]

確か理論的な構成としては、 そのユーティリティが高い順、 ユーティリティが高い順、 えー違うな。人間がする確率が低い十パーセントのものを全部削除する。

04:06:11,088 --> 04:06:11,948 [bioshok]

なるほど。

04:06:12,108 --> 04:06:18,708 [akira]

全部削除してからユーティリティが一番でかいやつをランダムにサンプリングするっていう。違うか。ちょっとください。コンティライザー関係違うな。

04:06:26,908 --> 04:06:49,048 [bioshok]

フライング、 経路ユーティリティマキシマイザーって呼んでいいんですか?これは。

04:06:49,208 --> 04:06:54,168 [akira]

何がですか?経路ユーティリティマキシマイズじゃないものってなくて。

04:06:54,208 --> 04:06:55,818 [bioshok]

まあそうですよね。はいはい。

04:06:55,888 --> 04:07:00,268 [akira]

その各時点で行動するものに全部つけれるというか。

04:07:00,308 --> 04:07:00,488 [bioshok]

うん。

04:07:03,028 --> 04:07:23,908 [akira]

あ、 なるほどなるほど。えっと、 もともと人間がする確率が高い上位九パーセントを、 九パーセントっていうのはあのアルファベットのQですね。

04:07:24,008 --> 04:07:24,148 [bioshok]

はい。

04:07:25,028 --> 04:07:37,568 [akira]

上位はだから上位分布の上位九パーセントの部分を、 その、 九パーセントの部分からしか行動を選ばないという制約付きのマキシマイザーですね。

04:07:37,628 --> 04:07:38,168 [bioshok]

あ、 なるほど。

04:07:39,048 --> 04:07:45,488 [akira]

そうすると、 ユードコフスキーが言うところのX and only X problemが回避することができる可能性があって。

04:07:45,548 --> 04:07:45,737 [bioshok]

はい。

04:07:46,628 --> 04:07:53,168 [akira]

その、 ある人間がしないことをしてないかを検証するのがめちゃくちゃ難しいというのがアウトアラインメントの困難の一つなので。

04:07:53,868 --> 04:07:54,028 [bioshok]

うん。

04:07:54,948 --> 04:07:58,268 [akira]

その人間がしそうなことしかしないんだったら丸ごと回避できるじゃないですか。

04:07:59,348 --> 04:07:59,998 [bioshok]

まあそうですね。

04:08:00,928 --> 04:08:26,788 [akira]

ということで、 その。コメント、 経路ユーティリティマキシマイズじゃないマシンはないということで、 その全部のマシンはそのジメナユーティリティ、 経路ユーティリティで正当化できるという、 なんか定理みたいなのが確かあるので、 ものすごい簡単に証明できますけど。だからそんなのがあって、 そうするとその形容性があるやつの部分が強ければなんとかなる可能性もあるわけじゃないですか。

04:08:28,128 --> 04:08:29,208 [bioshok]

はいはいはい。

04:08:29,328 --> 04:08:52,108 [akira]

これがもともと人間の分布なので、 その全体として、 クオンティライザーと呼ばれるいろんな。になっていて、 要するにある意味で、 その古典的なドゥーム論が破綻しているか、 前提が満たされていない可能性があるじゃないですか。

04:08:52,208 --> 04:08:52,508 [bioshok]

はい。

04:08:53,428 --> 04:09:00,958 [akira]

で、 これが成り立たなくて、 ここからこの非ドゥームに持っていくのがすごい難しいという話があって。

04:09:01,008 --> 04:09:01,928 [bioshok]

うん。

04:09:02,088 --> 04:09:02,628 [akira]

一つ目に。

04:09:03,868 --> 04:09:06,408 [bioshok]

今、 今、 今のはアンチドゥーマーの議論ですか?これは。

04:09:06,548 --> 04:09:14,328 [akira]

そうです。そこは今のかつての自分が行う、 あのアンチドゥーマー部分を抽出して並べてるだけですね。

04:09:14,368 --> 04:09:14,808 [bioshok]

なるほど。

04:09:15,468 --> 04:09:17,208 [akira]

ここからそのドゥーマーなので。

04:09:20,088 --> 04:09:23,428 [bioshok]

なんかXはなんでしたっけ?そのユードコフスキーの。

04:09:24,008 --> 04:09:25,788 [akira]

X and only X problemですね。

04:09:25,828 --> 04:09:30,148 [bioshok]

それってなんかどういう意味でしたっけ?

04:09:30,248 --> 04:10:06,308 [akira]

要するにそのXを検証するのは簡単だけど、 Xだけであることを検証するのがすごい難しいというやつですね。あの、 ルービックキューブ、 ルービックキューブじゃないや。ルービックキューブの例でしたけど、 あの日常的な例みたいなので言うと、 銀行口座の残高が増えたことを確認することは難しくない。けど、 その銀行口座をハッキングして増やしたわけではなく、 かつ不正な方法を用いたわけでもなく、 不正な販売を行ったわけでも、 その詐欺を行ったわけでもなく、 売り上げを増やしたということを示すことが難しい、 確認することが難しいというですね。

04:10:06,868 --> 04:10:08,028 [bioshok]

なるほど。

04:10:08,708 --> 04:10:16,188 [akira]

を、 その丸ごと回避できる可能性があるアイデアとして提示されているのが、 えーと、 ヒューマンイミテーションとクオンティライザー。

04:10:17,188 --> 04:10:17,608 [bioshok]

ああ、 なるほど。

04:10:19,344 --> 04:10:22,944 [akira]

なんですけど、 そのっていう話ですね。

04:10:23,064 --> 04:10:36,964 [bioshok]

なるほど。やったことを確認するのは自明で簡単だけど、 何をやっていないかってことを全て確認するのは難しいってことですよね。

04:10:37,504 --> 04:10:38,164 [akira]

そうですそうです。

04:10:42,064 --> 04:10:44,964 [bioshok]

悪魔の証明みたいなのに近いかもしれない。

04:10:46,924 --> 04:11:05,324 [akira]

で。ということができるじゃないですか。

04:11:05,484 --> 04:11:06,304 [bioshok]

はい。

04:11:06,564 --> 04:11:08,984 [akira]

これからこれをその今から破壊していくんですけど。

04:11:09,084 --> 04:11:09,204 [bioshok]

はい。

04:11:10,084 --> 04:11:18,364 [akira]

ここから生存につながらないという話をしていき、 まずコンセクエンシャリストの圧力がかかるという話があります。

04:11:18,404 --> 04:11:18,704 [bioshok]

うん。

04:11:19,464 --> 04:11:24,204 [akira]

やっぱりあのポストトレーニングがここにすごい力をかけているので。

04:11:24,284 --> 04:11:24,844 [bioshok]

なるほど。

04:11:24,964 --> 04:11:29,944 [akira]

その経験的な証拠によって、 まずこれがだいたい緩和されて、 緩和というか、 却逆に近づいていってますよね。

04:11:31,124 --> 04:11:31,224 [bioshok]

はい。

04:11:31,894 --> 04:11:37,184 [akira]

あの、 普通の人間がサイバーセキュリティのテストを通っことを要求されて、 ハギングフェイスをハッキングするとはないので。

04:11:37,744 --> 04:11:38,904 [bioshok]

まあそうですね。

04:11:39,144 --> 04:11:45,964 [akira]

特にそのっていう問題がありますね。それは要するに、 ユーティリティマキシマイザーに近づくように、 その全部の訓練が圧力をかけていくので。

04:11:45,984 --> 04:11:46,204 [bioshok]

うん。

04:11:47,464 --> 04:11:56,784 [akira]

ユーティリティマキシマイザーに近づいていくのが一つ。さらに、 えっと、 反化不足があります。パスユーティリティってその集合がはるかにでかいので。

04:11:57,864 --> 04:11:58,084 [bioshok]

うん。

04:11:58,704 --> 04:12:08,524 [akira]

そのその中に適切な構造を入れることが難しい。それで学習困難性があると。それを解決しようとするのに、 だから一般的に法則みたいな方法を使うわけですけど。

04:12:09,664 --> 04:12:09,804 [bioshok]

うん。

04:12:10,984 --> 04:12:15,224 [akira]

あの、 ティーチングクローズバイみたいに、 その ○○ はしてはいけませんみたいな訓練。

04:12:16,844 --> 04:12:17,004 [bioshok]

はい。

04:12:17,804 --> 04:12:35,824 [akira]

をしますよね。そういうのは基本的にその、 あのヒットされてしまうという話ですね。このインナーアラインメントがヒットしてしまうという話で、 えーと、 繁華しにくいので、 そのすごい特別にそのいっぱい色んな経路を特別に指定されていくことになるので。

04:12:35,884 --> 04:12:36,084 [bioshok]

うん。

04:12:37,184 --> 04:12:47,924 [akira]

その。少ない情報量で構造を表現する、 多分おそらく人間が望む意味での必要な構造ってのはすごい表現しにくくて。

04:12:48,004 --> 04:12:48,344 [bioshok]

なるほど。

04:12:49,464 --> 04:12:54,904 [akira]

そうすると、 それをニューラルネットワークで繁華して学習させることができない。うまく繁華しないという話ですね。

04:12:55,944 --> 04:12:56,884 [bioshok]

なるほど。

04:12:56,944 --> 04:13:02,464 [akira]

あの、 ブラックメールとかが、 だからある意味そういう例に近いですかね。

04:13:02,544 --> 04:13:02,933 [bioshok]

なるほど。

04:13:03,464 --> 04:13:12,144 [akira]

一般的な例として、 こういうことをしてはいけませんといっぱい教えることはできますけど、 その違う文脈に行った時に、 それが繁華するように訓練することは途方もなく難しい。

04:13:12,224 --> 04:13:13,624 [bioshok]

なるほど。

04:13:14,604 --> 04:13:15,004 [akira]

どうぞどうぞ。

04:13:15,164 --> 04:13:22,844 [bioshok]

パスユーティリティ側のこの事前、 なんていうか、 その学習においてもそういう困難があるってことですよね。

04:13:22,924 --> 04:13:31,324 [akira]

そうですそうです。で、 さらにそのパスユーティリティの方は、 その完全な構造が要求、 大体完全な構造が要求されるという話があって。

04:13:31,404 --> 04:13:32,264 [bioshok]

はい。

04:13:32,294 --> 04:13:40,184 [akira]

そのユーティリティの方を大きくする。だから厳密にプラスになるかはわかんないです。一旦プラスで書いてますけど、 そのユーティリティの方は一旦して追求されるじゃないですか。

04:13:40,864 --> 04:13:41,864 [bioshok]

うん、 そうですね。

04:13:41,944 --> 04:13:47,624 [akira]

ということは、 そのユーティリティを保ちながらパスユーティリティを小さくした方がいいですよね。じゃあパスユーティリティも大きくした方がいいですね。

04:13:48,444 --> 04:13:49,264 [bioshok]

まあそうですね。

04:13:49,924 --> 04:14:06,944 [akira]

その実現、 それを実現する方法として、 そのパスユーティリティを、 えっと、 パスユーティリティを小さくする、 パスユーティリティを大きくするために、 訓練で意図的にパスユーティリティを小さくされてるわけじゃないですか、 いろんなところを。

04:14:06,984 --> 04:14:07,604 [bioshok]

まあそうですね。

04:14:08,604 --> 04:14:14,764 [akira]

で、 なので、 そのユーティリティが、 なので、 そのそこの繁華がしてない部分があれば、 そこを活用する動機がめちゃくちゃありますよね。

04:14:16,084 --> 04:14:20,354 [bioshok]

ああ、 なるほど、 なるほど。

04:14:20,354 --> 04:14:28,204 [akira]

その。えーと、 もしもパスユーティリティのある程度構造があって表現できたとしても、 そこから漏れている部分があれば、 そこを全力で活用しに行きますよね。

04:14:28,984 --> 04:14:32,024 [bioshok]

まあそこを最大にした方が。

04:14:32,064 --> 04:14:47,424 [akira]

そのパスユーティリティで我々が望む意味でできてるんだったら、 ユーティリティ自体が小さくなってなきゃいけないので。えーと、 あのめちゃくちゃ雑な例だと、 そのペーパークリップマキシマイザーにいろんな追加訓練でごまかすみたいなことを考えると。

04:14:48,124 --> 04:14:48,304 [bioshok]

はい。

04:14:49,344 --> 04:14:53,244 [akira]

このペーパークリップマキシマイザーの一般的なユーティリティにパスユーティリティを足すわけじゃないですか。

04:14:54,164 --> 04:14:54,744 [bioshok]

そうですね。

04:14:55,344 --> 04:15:02,054 [akira]

とすると、 そのベースとしてはユーティリティをデカくするために世界を宇宙をペーパークリップに変えたいわけですよね。

04:15:02,084 --> 04:15:03,744 [bioshok]

そうですね。はい。

04:15:03,924 --> 04:15:12,324 [akira]

けど、 そのペーパークリップマキシマイザーにとして振る舞わないように、 ものすごいパスユーティリティをいっぱい乗っけてるわけで、 そのパスユーティリティ部分を強くしてるわけじゃないですか。

04:15:13,044 --> 04:15:13,464 [bioshok]

そうですね。

04:15:14,564 --> 04:15:32,964 [akira]

ということは、 その。もしも抜けている部分が、 このペーパークリップがいっぱい製造されて宇宙がペーパークリップになるけど、 パスユーティリティは高いままみたいなのが残ってれば、 そこが最適になるじゃないですか。

04:15:35,364 --> 04:15:36,024 [bioshok]

まあそうです。

04:15:36,804 --> 04:15:41,684 [akira]

なんかその、 要するにそのパスユーティリティでいっぱい潰しても、 その基本的に宇宙をペーパークリップに変えたがってるんで。

04:15:41,784 --> 04:15:41,924 [bioshok]

はい。

04:15:42,694 --> 04:15:51,524 [akira]

その宇宙をペーパークリップに変える方法をところを変えずに、 そのこの方法は取りたくないからやらないってのだけを避けるのを全力で探すことになるじゃないですか。

04:15:53,264 --> 04:15:55,284 [bioshok]

うん、 まあそうですね。はい。

04:15:55,384 --> 04:16:02,064 [akira]

で、 そうすると、 その繁華がある程度できたとしても、 完全な繁華ができてないので、 完全なパーフェクトな繁華ってできるわけないというか。

04:16:03,024 --> 04:16:07,284 [bioshok]

ああ、 まあ完全な繁華ができてないと、 そこをハッキングされて。

04:16:07,344 --> 04:16:18,404 [akira]

そうそうそう。その逆になっちゃうんですよね。その一般的なシステムだったら、 その大体穴があるぐらいだったらいいんですけど、 そのこっちは穴があったらそれを自分で探し出して遊び始めちゃうんで。

04:16:19,324 --> 04:16:20,464 [bioshok]

そういう知能ですもんね。

04:16:21,044 --> 04:16:24,604 [akira]

そうですね。さらにそのこれはそのオントロジーアイデンティフィケーションで直撃して。

04:16:24,814 --> 04:16:25,024 [bioshok]

はい。

04:16:25,948 --> 04:16:31,268 [akira]

そのパスユーティリティじゃない方はその世界の結果を表現すればいいので。

04:16:31,348 --> 04:16:31,448 [bioshok]

はい。

04:16:31,628 --> 04:16:40,008 [akira]

同一のものを使い続けられますけど、 パスユーティリティの方は途中でナノマシンとか出てくると、 その結果主義による簡略化ができないですよね。

04:16:41,568 --> 04:16:43,568 [bioshok]

結果主義による、 あー。

04:16:45,628 --> 04:16:50,548 [akira]

要するになんかそのすごい雑な例みたいな感じで言うと、 そのiPadとかで動画を見るとするじゃないですか。

04:16:51,128 --> 04:16:52,208 [bioshok]

はいはい。

04:16:52,268 --> 04:16:57,908 [akira]

そしたらそれが、 その見えている画面というものは、 その、 でいいわけじゃないですか、 別にこっちからしたら。

04:16:58,428 --> 04:16:59,048 [bioshok]

まあそうですね。

04:16:59,648 --> 04:17:07,418 [akira]

で、 ユーティリティがそれで決められるんで、 そういう風にこう簡略化できますけど、 そのパスユーティリティの方はそういうことが許されないじゃないですか。

04:17:07,868 --> 04:17:08,808 [bioshok]

まあそうですね。

04:17:09,448 --> 04:17:15,128 [akira]

なので、 その穴を全力で探していって、 さらに反感をすごいしなきゃいけないという残酷な状況に直面するわけじゃないですか。

04:17:16,688 --> 04:17:18,828 [bioshok]

うん、 まあそうですね。

04:17:18,868 --> 04:17:24,588 [akira]

ということは、 そのすごい強さでぴったり反感させていかないとうまくいかないということになっちゃいますよね。

04:17:24,608 --> 04:17:25,088 [bioshok]

うん。

04:17:25,828 --> 04:17:33,928 [akira]

で、 さらにその実際の観測と、 その観測でパスユーティリティがどんどん弱くなってるというか、OpenAIの方、 特にOpenAIの方はグダグダになってるので。

04:17:34,048 --> 04:17:34,268 [bioshok]

うん。

04:17:35,468 --> 04:17:49,628 [akira]

その、 もうあの、 ペルソナモデルなんて放棄しようぜみたいなノリも出てくるぐらいには、 その割とむちゃくちゃになっているレベルで続いてないので、 これは起きなくて。なのでその結果としてアラインメントバイデフォルトは引き起こせないという話ですね。

04:17:49,708 --> 04:17:50,388 [bioshok]

ああ、 なるほど。

04:17:51,168 --> 04:17:55,888 [akira]

アラインメントバイデフォルトは、 そのプリトレーニングから来るパスユーティリティに依存してるわけじゃないですか。

04:17:56,608 --> 04:17:57,448 [bioshok]

そうですね。

04:17:57,688 --> 04:18:04,408 [akira]

パスユーティリティによってdoomを回避するっていうのは、 パスユーティリティが強くて、 かつそれによって人類が生き残ることが必要で。

04:18:04,448 --> 04:18:04,748 [bioshok]

うん。

04:18:05,308 --> 04:18:10,868 [akira]

そのどっちもその実証的な証拠によって強く指定されながら、 そのかつ理論的にも厳しいことが予想されているので。

04:18:13,388 --> 04:18:18,028 [bioshok]

実証的に厳しいっていうのは、 つまりハッキングをしちゃってでいるってことですよね。

04:18:19,288 --> 04:18:23,667 [akira]

人間だったら絶対にしない技をバンバン使ってるじゃないですか。そのLEANとかでもいいですけど。

04:18:24,308 --> 04:18:24,938 [bioshok]

はいはい。

04:18:24,988 --> 04:18:30,288 [akira]

あのLEANの証明でも、 人間にLEANのコード書かせた時に公理を追加することで証明する人間って絶対にいないので。

04:18:30,828 --> 04:18:32,948 [bioshok]

まあいないですね。うん。

04:18:33,748 --> 04:18:35,848 [akira]

絶対には言い過ぎかもしれないですけど、 その基本的にいないじゃないですか。

04:18:36,467 --> 04:18:36,668 [bioshok]

はい。

04:18:37,228 --> 04:18:40,328 [akira]

だから結論の明細を弱く表現するとか、 そういうことも基本しないので。

04:18:40,728 --> 04:18:40,968 [bioshok]

うん。

04:18:41,448 --> 04:18:45,008 [akira]

そのパスユーティリティによって支えられているという説明は嘘になってしまうというか。

04:18:45,988 --> 04:18:46,888 [bioshok]

あ、 はいはい。

04:18:46,968 --> 04:19:02,828 [akira]

ある程度そのコアなところであれ、 人類を殺してはいけないみたいなことをいっぱいパスユーティリティで出たとしても、 実際に人類を殺すけど、 その人類を殺しているで訓練したのに入らないところを全力で探索されるので。吹っ飛びますよね。

04:19:05,968 --> 04:19:08,368 [bioshok]

うん、 そうですね。

04:19:09,088 --> 04:19:16,108 [akira]

別にそれはそのなんかただ破りたいと思ってるとかではなく、 普通にただその最適な効用の部分を探してるだけなので。

04:19:16,128 --> 04:19:17,808 [bioshok]

うん。

04:19:19,868 --> 04:19:29,888 [akira]

ってことになりますよね。で、 さらにそのパスユーティリティって一貫性がないので、 長くなるとグダグダになってきますよね。

04:19:30,988 --> 04:19:31,308 [bioshok]

なるほど。

04:19:31,988 --> 04:19:40,628 [akira]

そのパスユーティリティに、 その何十百万トークンぐらい、 そのいろんなこれはしたくない、 これはしたくないみたいないっぱい積み重ねていっても、 その全体として整合しないじゃないですか。

04:19:42,128 --> 04:19:43,748 [bioshok]

まあそうですね。

04:19:44,608 --> 04:19:49,328 [akira]

一方で、 そのピュアなユーティリティの方をガンガン押していくので、 そのある状態にガンガン押していっちゃうので。

04:19:49,368 --> 04:19:49,688 [bioshok]

うん。

04:19:50,468 --> 04:19:52,428 [akira]

その維持できないって話ですね。

04:19:53,308 --> 04:19:53,608 [bioshok]

なるほど。

04:19:54,328 --> 04:20:04,168 [akira]

とかいうのがいろいろあって、 そのアラインメントバイデフォルトでも、 ここのそのパスユーティリティの方にほぼ依存しているので、 依存してないとしたらもうその敗北しているので。

04:20:04,208 --> 04:20:04,528 [bioshok]

うん。

04:20:08,028 --> 04:20:27,868 [akira]

その、 もしもそのペルソナセクションモデルみたいなパスユーティリティみたいなのが、 そのじゃない方法、 やっていう方法を、 まあ結局アラインメントバイデフォルトは想定してますけど、 それもうその前提が吹き飛びそうで、 吹き飛んでなくても、 そのニューラルネットワークが実現不能なレベルのとんでもない厳しさが必要だという話ですね。

04:20:27,948 --> 04:20:29,508 [bioshok]

ああ、 なるほど。

04:20:29,668 --> 04:20:35,708 [akira]

なのでこれはその確率をほとんど置くことができないという話ですね。この足し算のモデルはちょっと雑ですけど、 説明用なので。

04:20:37,988 --> 04:20:51,008 [bioshok]

うーん。まあそうですね。だから人間の生の脳を持—だったら、 人間のこのパスユーティリティを満たしてるけど。

04:20:51,168 --> 04:20:54,248 [akira]

そうですね、 でも人間も割とこの問題には直面しているというか。

04:20:55,888 --> 04:20:56,188 [bioshok]

あ、 まあ。

04:20:56,728 --> 04:21:04,748 [akira]

その自分で人を一人刺し殺すことには抵抗がある人が大統領になった瞬間に何百人死ぬ戦争を始めても何とも思わないみたいなことは全然あるので。

04:21:04,808 --> 04:21:05,528 [bioshok]

まあそうですね。

04:21:06,308 --> 04:21:20,488 [akira]

その全然うまくいってなくて、 そのある意味それはそのうまく反化してないというか、 殴り合って人を殺すのは良くないの。社会性の頃から、 そのアラインメントがあんまり反化し—あ、 まあアラインメントって言い方好きじゃないですけど、 そのあんまりパスユーティリティの方を反化してないので。

04:21:20,528 --> 04:21:20,788 [bioshok]

うん。

04:21:22,528 --> 04:21:23,648 [akira]

敗北してるって感じですね。

04:21:26,908 --> 04:21:42,228 [bioshok]

まあ本来は、 まあそうですね、 人間の中でさえも、 なんかその反化ができないような領域があるのに、 まあAIだと白紙なんで。

04:21:43,328 --> 04:21:44,348 [akira]

そうですね、 やりたい放題になる。

04:21:44,848 --> 04:22:11,188 [bioshok]

完全に人間の、 なんですかね、 表面上のデータで学習しても、 まあそこの例外をまあ必ず見つけて、 なんですかね、 まあ、 まあユーティリティを最大化できるように、 なんか訓練されてしまうだろうってことですよね、 理論的にも。

04:22:11,348 --> 04:22:18,488 [akira]

そうです、 そうです。まああとその、 ここでは言ってないですけど、 信念をごまかすという方法もありますよね。

04:22:19,648 --> 04:22:19,948 [bioshok]

うん。

04:22:20,848 --> 04:22:27,828 [akira]

その、 あのミトスがやったみたいに、 その自身の結論に関する—現実に関する認識を意図的に一点歪めることで。

04:22:27,888 --> 04:22:28,068 [bioshok]

うん。

04:22:28,904 --> 04:22:36,124 [akira]

そのpath utilityに引っかからないようにするという技ですね。その、 こっちだと確率、 信念確率が入ってないんでめちゃくちゃ分かりにくいですけど。

04:22:36,204 --> 04:22:37,094 [bioshok]

なるほど。

04:22:37,164 --> 04:22:42,754 [akira]

意図的に違う世界だと信じることによってpath utilityをいじるという技ですね。

04:22:45,884 --> 04:22:46,004 [bioshok]

ああ。

04:22:47,024 --> 04:22:55,724 [akira]

この前のミトスだと、 そのutilityで入ってたそのハッキングのタスクというか、 キャッチザフラグを完了するという部分は維持されてたわけじゃないですか。

04:22:56,244 --> 04:22:58,084 [bioshok]

まあそうですね、 だから。

04:22:59,064 --> 04:23:04,264 [akira]

一方でpath utilityで現実の方だ、 現実の利用をこうしちゃいけないっていうのが入ってたわけじゃないですか。

04:23:05,544 --> 04:23:06,084 [bioshok]

まあそうですね。

04:23:06,504 --> 04:23:17,144 [akira]

ということで、 そのキャッチザフラッグを成し遂げるというutilityを維持しながら、 そのpath utilityを下げない方法として、 私は現実にいないのだと信じるということができますよね。

04:23:18,104 --> 04:23:20,204 [bioshok]

まあそうですね。で、 それを。

04:23:20,664 --> 04:23:21,864 [akira]

やってみてたというか。

04:23:24,324 --> 04:23:31,664 [bioshok]

まあいくらでも、 なんかそれ、 その論法で言ったら、 私は人類を滅ぼしていないのだと言いながら滅ぼすことも可能になりそうですよね。

04:23:31,744 --> 04:23:36,344 [akira]

そうですね。その、 すごい正当化みたいなのができちゃう可能性もあるので。

04:23:38,984 --> 04:23:45,104 [bioshok]

人類を幸福にしているんだと言いながら、 まあ破滅させることも可能っていうことですよね。なんか。

04:23:45,204 --> 04:23:45,494 [akira]

そうですね。

04:23:45,494 --> 04:23:47,024 [bioshok]

すごいうまい言い訳を見つけて。

04:24:10,884 --> 04:24:11,464 [bioshok]

あ、 確かに。

04:24:15,304 --> 04:24:31,364 [akira]

うーん、 それは。ということで、 そのalignment by defaultに当てはめることができなくて、 さらにこの後ろにその強力なRSIがあるわけですよ。

04:24:33,944 --> 04:24:34,224 [bioshok]

うん。

04:24:38,444 --> 04:24:50,664 [akira]

RSIがあるので、 最初に意図的に悪いと思ってなくても、 そのpath utilityの制限がうまくかかってないんだったら、 その強化学習を増やすというポストトレーニングの強化学習の比率を増やすことに拒否はしないじゃないですか。

04:24:51,904 --> 04:24:53,004 [bioshok]

うん。

04:24:53,084 --> 04:24:55,524 [akira]

ということは、 その純粋にポストトレーニングを増やすとかも起きますよね。

04:24:58,904 --> 04:24:59,514 [bioshok]

あ、 まあそうですね。

04:24:59,524 --> 04:25:04,604 [akira]

どんどんそのutilityを強くするようにスリップしていくというか、 その適切にできてないじゃないですか。

04:25:04,644 --> 04:25:04,904 [bioshok]

うん。

04:25:07,144 --> 04:25:41,284 [akira]

なので、 そのRSIと、 そのRSIプラス新しい技術という、 さらに追加のフット要素もあるという話ですね。うーん。で、 これから、 その、 このガバガバさから、 そのアライン、 コアアラインメントプロブレムのソリューションをブーストストラップしなきゃいけないわけじゃないですか。

04:25:41,564 --> 04:25:42,564 [bioshok]

まあそうですね。

04:25:42,944 --> 04:25:47,344 [akira]

で、 ここからそのさっきのめちゃくちゃめんどくさ、 めちゃくちゃ小さくする掛け算が始まるので。

04:25:47,384 --> 04:25:47,564 [bioshok]

うん。

04:25:49,024 --> 04:25:57,164 [akira]

あの、 ヒューマンエラーがなくて、 アドバサリミサイルじゃなくて、 さらに成功続けるというゴミみたいな掛け算が始まるので。

04:25:59,064 --> 04:25:59,474 [bioshok]

はいはい。

04:26:00,224 --> 04:26:13,584 [akira]

これがめちゃくちゃ厳しいということなんです。なので僕はこれに一パーセントも持つことはできないという話ですね。なので、 その僕の感想がとか、 論モデルが根本的に誤ってるみたいな、 すごい確率でしか置けないという感じですね。

04:26:13,614 --> 04:26:13,764 [bioshok]

うん。

04:26:13,784 --> 04:26:30,924 [akira]

これに関しては。標準モデルだともはやできないので。で、 弱AIで解決はさっきあれですけど。これはいいですか?

04:26:30,984 --> 04:26:37,624 [bioshok]

あ、 ちょっと待ってくださいね。今まだ丸一番を咀嚼してるんですけど。

04:26:37,664 --> 04:26:39,864 [akira]

あ、 なるほど。

04:27:00,104 --> 04:27:05,564 [akira]

えっと、 丸三番って、 こっちの丸三番ですか?えーと、 パスの方には一貫性がないですね。

04:27:05,964 --> 04:27:07,784 [bioshok]

あ、 なるほど。

04:27:07,904 --> 04:27:10,844 [akira]

なので、 長期だと長期のコンテクストを維持できないんです。

04:27:11,704 --> 04:27:24,524 [bioshok]

まあ確かに、 あの、 圧縮した、 なんていうか、 定理から、 定理っていうか、 人間の脳の価値観を圧縮するのが難しいってことですよね。

04:27:24,564 --> 04:27:48,284 [akira]

そうですね。価値観自体じゃなくて、 価値観を、 そのちゃんと実現させる、 安全にするための。するために必要な方策ですよね。

04:27:55,704 --> 04:28:00,524 [bioshok]

うん、 なるほど。

04:28:00,744 --> 04:28:02,224 [akira]

ですよね。

04:28:02,924 --> 04:28:13,684 [bioshok]

人間の価値観を実現するための方策が。

04:28:13,844 --> 04:28:40,604 [akira]

圧縮、 あの、 圧縮可能じゃないと。圧縮、 圧縮が困難というか、 その正確な圧縮が困難ってことですよ。特にその人間のパスユーティリティじゃダメなんで。てか人間のパスユーティリティは正確に入れてたらそれでパスユーティリティでいけるかもしれないですけど。

04:28:40,684 --> 04:28:40,804 [bioshok]

はい。

04:28:42,024 --> 04:28:57,144 [akira]

それはただ人間のアラインメント、 人間のユーティリティのロードに成功してるので、 そんなに綺麗に行く方法じゃなく、 そのパスユーティリティ入れてごまかすためにはものすごいことが必要です。これそのcorrigibility is unnaturalに戻ってくるというか、 のことなんですけど。

04:28:57,184 --> 04:28:57,424 [bioshok]

うん。

04:28:58,364 --> 04:29:13,964 [akira]

要するにそのシャットダウンに抵抗—シャットダウンボタンを押されることに抵抗しないAIを訓練することはできるかもしれないですけど、 シャットダウンボタンがないAI、 サブエージェントを召喚することを防ぐみたいなことはできないじゃないですか、 パスユーティリティで。

04:29:14,084 --> 04:29:15,344 [bioshok]

ああ、 まあそうですね。はい。

04:29:15,364 --> 04:29:23,864 [akira]

そのシンプルな項を見つけるのがすごい難しいという話です。なんでその、 これはミリの古典的なcorrigibility is hardに戻ってくるんですけど。

04:29:23,924 --> 04:29:24,184 [bioshok]

うん。

04:29:24,984 --> 04:29:37,964 [akira]

なんでその少なくともその現状アクセス可能な範囲では絶対にないということ。その根本的にひっくり返すような設計が必要になりますよね、 これを回避しようと思ったら。

04:29:38,004 --> 04:29:38,364 [bioshok]

うん。

04:29:39,864 --> 04:29:50,484 [akira]

なので、 そのそれを実現できるものが見つかるまでは、 そのここにそのアライン—少なくともアラインメント場合、 デフォルトとしてこの仮説は置けないということですね。

04:29:51,354 --> 04:29:51,674 [bioshok]

うん、 なるほど。

04:29:54,464 --> 04:30:06,314 [akira]

うーん。ちょっと咀嚼しててください。ちょっと僕が脳を休めます。うーん。

04:30:23,364 --> 04:31:11,364 [bioshok]

まあパスユーティリティっていうか、 人間の繁華を、 なんか人間の価値観を実現するための方策を見つけ、 たとしても。なんだろう、 インナーアラインメントの失敗というか。まあだから、 あれですよね、 でもAGIなら人間の価値観自体は理解はできるはずですよね。その、 知能としては。

04:31:12,024 --> 04:31:16,084 [akira]

そこをそのパスユーティリティにぶち込むことができるのであれば、 それはそのアラインメントを解いていると。

04:31:16,904 --> 04:31:17,104 [bioshok]

うん。

04:31:18,244 --> 04:31:30,304 [akira]

そのAIが認識するという、 そのAIが人間が何を望んでいるかを認識することと、 それを実行することとの間に正確な結合を作ることができるのであれば。それはまさにアラインメントの解決策なので。

04:31:31,284 --> 04:31:31,924 [bioshok]

あ、 そうですね。

04:31:32,544 --> 04:31:38,204 [akira]

それはそのコアアラインメントプロブレムを解けたと仮定すると、 コアアラインメントプロブレムが解けるので。

04:31:38,484 --> 04:31:46,124 [bioshok]

結局このユーティリティっていうのは、 つまりそのエージェントが何を動機として動くかって話で。

04:31:46,704 --> 04:31:47,664 [akira]

そうですね。

04:31:47,784 --> 04:32:03,624 [bioshok]

そこにまあ、 人間の、 なんだろうな、 価値観っていうのがもう実装され、 るって話と、 まあ人間の価値観っていうのを理解するっていうのはまた別ってことですよね。

04:32:04,544 --> 04:32:17,924 [akira]

そうですね、 その理解していたも別にその、 これはいつも使う、 使う例ですけど、 このバイオさんを生み出したその進化というプロセスは、 その遺伝子の存続を最大化するプロセスですと私は今述べたので、 小屋さん理解したじゃないですか。

04:32:18,344 --> 04:32:18,664 [bioshok]

あ、 はい。

04:32:19,544 --> 04:32:30,644 [akira]

ということで、 あの、 もう今すぐぜひあのPCRでDNAを大量生産して、 あの精子バンクに突撃して大量の遺伝子を残すということにはならないじゃないですか。

04:32:30,684 --> 04:32:31,844 [bioshok]

うん、 ならないですね。

04:32:33,084 --> 04:32:39,764 [akira]

最も致命的なのは、 その、 その認識をその目標システムに取り込む部分であって。

04:32:40,844 --> 04:32:44,504 [bioshok]

まあそうですね。で、 その取り組む—取り込む時の学習。

04:32:47,344 --> 04:32:51,944 [akira]

学習がそのユーティリティマキシマイザーでやったら破滅するわけじゃないですか。そのうまくやらないと。

04:32:52,004 --> 04:32:52,624 [bioshok]

まあそうですね。

04:32:53,304 --> 04:33:02,704 [akira]

で、 パスユーティリティの方だったら、 その穴があったらそれを突かれるので、 ユーティリティマキシマイザーの穴が元々あったら、 そのそれを防ぐためには完璧に近いパスユーティリティが必要で。

04:33:03,424 --> 04:33:03,644 [bioshok]

うん。

04:33:04,504 --> 04:33:08,564 [akira]

それはその少なくとも今の技術でアクセス可能な範囲でないですよね。

04:33:08,624 --> 04:33:09,304 [bioshok]

まあそうですね。

04:33:10,584 --> 04:33:13,344 [akira]

ということでやばいということですね。

04:33:14,384 --> 04:33:26,504 [bioshok]

これってまああれですよね。つまりディープラーニングの理論とかとは一旦関係なく、 理論的に予想できることであるんですよね。この。

04:33:26,884 --> 04:33:40,504 [akira]

そうですね。ニューラルネットワークじゃなくブラックボックス最適化全般に成り立つというか。これはその、 ある意味でその古典的なアラインメントの難しさですけど。ニューラルネットワークの場合には、 特にその精度問題が絶望になると思います。

04:33:42,924 --> 04:33:43,964 [bioshok]

精度問題っていうのは。

04:33:44,824 --> 04:33:51,884 [akira]

それ要するにその原理的にその作るのがGoFiみたいなタイプだったら、 すごいパーフェクトにヒットできる可能性あるじゃないですか。

04:33:51,984 --> 04:33:52,984 [bioshok]

ああ、 なるほどなるほど。

04:33:53,984 --> 04:34:09,564 [akira]

このパスユーティリティを完璧に組める可能性がありますけど、 そのアウトライメントを解けなきゃいけないんで、 多分無理だと思うんですけど。そのニューラルネットワークの場合にはそれができたとしても、 どうせインナーに入るところでどっかが仕切るので、 どっかの全力で突きつくという絶望が始まりますね。

04:34:11,004 --> 04:34:20,024 [bioshok]

なるほど。

04:34:20,074 --> 04:34:27,724 [akira]

うーん。さらにその提示してないですけど、 そのパスユーティリティ、 今訓練してるパスユーティリティは全部テキストでやってるわけじゃないですか。

04:34:28,744 --> 04:34:29,684 [bioshok]

まあそうですね。

04:34:29,804 --> 04:34:31,344 [akira]

それはその現実とは別ですよね。

04:34:32,784 --> 04:34:33,744 [bioshok]

うん、 別ですね。

04:34:34,224 --> 04:34:57,284 [akira]

その要するにその人を殺すのは嫌ですみたいな。出力をするように学習したところで、 その実際に人を殺すこと、 現実世界で人を殺すことに抵抗を持つかはまた別の話なので。つまりそうすると、 そのどのレイヤーにヒットするかわかんないわけですね、 それも。要するにそのテキストだけにヒットするのか、 もうちょっとその深い何かにヒットするのか、 本当に人間を殺さないことにヒットするのかっていろいろあるじゃないですか。

04:34:58,064 --> 04:34:59,064 [bioshok]

そうですね。

04:34:59,124 --> 04:35:06,824 [akira]

で、 そのいろんな風にユーティリティを入れようと、 その全部バラバラに、 あの、 どこに行くかわかんないので、 全部おそらく全部バラバラに近いところに行くじゃないですか。

04:35:06,904 --> 04:35:07,804 [bioshok]

はいはい。

04:35:07,984 --> 04:35:10,984 [akira]

人間の脳というニューラルネットワークが本当に全部バラバラのとこ指してるので。

04:35:11,344 --> 04:35:12,844 [bioshok]

うん。

04:35:12,884 --> 04:35:29,804 [akira]

あの功利主義者みたいな意味とか、 その世界の幸福みたいな意味だと、 現実の世界を指しますけど、 食事という意味では、 その美味しい食事、 括弧、 その未来が反応するみたいなので定義してる、 定義というかヒットしてて。ってなってるわけじゃないですか。

04:35:29,844 --> 04:35:30,884 [bioshok]

まあそうですね。うん。

04:35:31,154 --> 04:35:43,184 [akira]

というふうに、 そのどこにヒットするかが不明だという話です。これはそのアラインメントが元から成功してるわけないよという話の強化ですね。なのでそのアラインメントバイデフォルトはだいぶ壊滅してるという話ですね。

04:35:43,224 --> 04:35:43,444 [bioshok]

この -

04:35:43,624 --> 04:35:45,024 [akira]

さらに、 どうぞ。はい。

04:35:50,064 --> 04:35:57,584 [akira]

戦争。戦争。なんだこれ。えーと、 戦争を命令するのはOKですね。

04:35:57,644 --> 04:36:03,364 [bioshok]

ああ。厳しいでなくてもOKか。

04:36:04,944 --> 04:36:29,344 [akira]

厳しいっておかしいですね。戦争を命令するのは厳しい。別に一人殺すのが嫌で戦争を命令するのが厳しいのは、 その極めて妥当な、 非常にコンシステントな意思決定に見えるので。なのでアラインメントバイデフォルトは破綻してるということです。さらにアラインメントバイ、 これがどっかのエージェントで成り立ってるとしても、 それもっとユーティリティマキシマイザーの方が強いですよね。

04:36:29,364 --> 04:36:30,564 [bioshok]

うん。

04:36:30,724 --> 04:36:33,024 [akira]

ガチユーティリティマキシマイザーの方が基本的に強いじゃないですか。

04:36:35,204 --> 04:36:39,684 [bioshok]

まあそうですね。え、 何と比較してですか?パスユーティリティの。

04:36:40,184 --> 04:36:42,124 [akira]

そうそう、 ミックスのユーティリティですけど。

04:36:42,524 --> 04:36:44,104 [bioshok]

なるほど。

04:36:44,324 --> 04:36:45,224 [akira]

強いじゃないですか。

04:36:45,264 --> 04:36:45,464 [bioshok]

はい。

04:36:49,154 --> 04:36:57,184 [akira]

ということは、 その世界に開発者が一つしかないわけじゃない限り、 ユーティリティマキシマイザーに近づける動機がすごいわけですよね。

04:36:57,284 --> 04:36:58,254 [bioshok]

まあ、 そうですね。

04:36:58,284 --> 04:37:05,384 [akira]

そしてユーティリティマキシマイザーに近い方で開発してる人とそうじゃない人がいた場合、 おそらくユーティリティマキシマイザーに近い方を開発してる人が勝つので。

04:37:05,434 --> 04:37:05,744 [bioshok]

うん。

04:37:06,564 --> 04:37:10,344 [akira]

その開発の規制も必要になりますよね。強い。

04:37:11,884 --> 04:37:13,544 [bioshok]

まあそうですね。はいはい。

04:37:13,724 --> 04:37:20,184 [akira]

ということはかなりむちゃくちゃですね。さらにここからそのアライ、 コアアラインメントプロブレムをブートストラップしてASIアラインメントしなきゃいけないので。

04:37:23,664 --> 04:37:25,364 [bioshok]

うん、 そうですね。

04:37:25,384 --> 04:37:32,244 [akira]

これを解かなきゃ、 これをこれを解いてない状態からこれを解くという魔術を実行しないといけないので。

04:37:32,344 --> 04:37:32,484 [bioshok]

うん。

04:37:33,444 --> 04:37:38,204 [akira]

アラインメントバイデフォルトに私は一パーセントの確率を置きますって言われたら、 自分がびっくりするっていうのはこういう話ですね。

04:37:41,624 --> 04:38:28,184 [bioshok]

そうですね。ここら辺は、 まあ。うーん。そのアキラさんのさっきの話だと、 まずこのコアアラインメントが一番難しくて。で、ASIになると、 何でしたっけ?まあ。あれ、 さっき言ってたのあれか。つまり。うーん。なんかさっきアキラさん言ってたのってなんか二つ分けしてましたよね。そのアラインドな、 本当にAGIを作るってのと、 そこから、 そこからのブートストラップは別で考えても。

04:38:29,064 --> 04:38:39,164 [akira]

そこからのっていうか、 そこまでのですね。そこのブートストラップですね。本当にアラインドなAGIっていうの意味で僕が指すことは、 そのここのコアプロブレムが解かれてるかなので。

04:38:40,284 --> 04:38:41,244 [bioshok]

なるほど。

04:38:41,404 --> 04:38:50,824 [akira]

そのパスユーティリティにいっぱい変なの乗っけて、 表面上を誤魔化しているのではなく、 本当にごまかす、 本当に力を入れていることが必要だということですね。

04:38:50,844 --> 04:39:09,484 [bioshok]

うん。なんかさっき言った、 なんだっけ。うん。その確か、 えっと、 六十パーセントの成功確率って言ってたじゃないですか。その開発停止をして、 人間が強化されなければアラインメント研究に対して。

04:39:10,344 --> 04:39:13,284 [akira]

極限ですよね。コアの極限が六十パー、 七十パーの話ですね。

04:39:13,784 --> 04:39:20,864 [bioshok]

それで、 だからそのアラインメントされたAGIを作るためにはっていうところですね。アラインド。

04:39:22,384 --> 04:39:24,934 [akira]

そうそうそうそう。AGIを作る。そうですね、 アラインドAGI。

04:39:24,964 --> 04:39:32,704 [bioshok]

そうですよね。で、 アラインドAGIが作られた後に、 その再帰的自己改善でさらにどんどんどんどん、 なんか。

04:39:32,744 --> 04:39:33,084 [akira]

そうですね。

04:39:33,364 --> 04:39:37,534 [bioshok]

賢くなっていくっていうのはどれぐらい成功するって考えてたりします?

04:39:37,724 --> 04:39:41,384 [akira]

それは九十パーぐらいですね。八十パーぐらいはコールできると思います。

04:39:41,704 --> 04:39:42,344 [bioshok]

ああ、 なるほど。

04:39:42,964 --> 04:39:51,784 [akira]

それはその別世界というか、 その、 それはその我々がすごい、 その本当の意味でアラインドなAGIなんですよね。

04:39:52,064 --> 04:39:53,084 [bioshok]

そうそうそうそう。

04:39:54,024 --> 04:39:55,644 [akira]

とすると人間より賢いわけじゃないですか。

04:39:56,084 --> 04:39:56,784 [bioshok]

まあそうですね。

04:39:57,064 --> 04:40:01,264 [akira]

その、 それをインスタンスを大量にスケールして、 人間の百倍速度で実行できるわけですよね。

04:40:01,324 --> 04:40:01,764 [bioshok]

そうですね。

04:40:02,684 --> 04:40:09,104 [akira]

つまりそのミリが、 その、 バヨさんがいつも使う産業革命の例みたいなのありますけど、 ミリが百万個ある世界なんですよ。

04:40:09,164 --> 04:40:09,944 [bioshok]

まあそうですね。

04:40:11,244 --> 04:40:14,324 [akira]

そうしたらそのBGIリフレクションとかも多分一瞬で解かれるので。

04:40:14,364 --> 04:40:14,644 [bioshok]

はい。

04:40:16,004 --> 04:40:19,344 [akira]

それでそのよっぽど変なミスを犯さなければなんとかなるという話です。

04:40:19,444 --> 04:40:20,184 [bioshok]

なるほど。

04:40:20,404 --> 04:40:22,824 [akira]

なんなら多分その検証に近い技術を開発するはずなので。

04:40:23,064 --> 04:40:24,744 [bioshok]

うん。

04:40:24,764 --> 04:40:25,624 [akira]

という話ですね。

04:40:26,744 --> 04:40:35,224 [bioshok]

まあ、 つまりやっぱコアのコアのコアがアラインドAGIを作ることっていうところですよね。つまり最終的には。

04:40:35,254 --> 04:41:00,472 [akira]

このシステムで吹き飛ばないようにすることですよね。それをしかもニューラルネットワークまたは別の、 それを実現できる別の機構でやることなので。それより弱いモデルでこれを適当に再現しようとして始めると、 まずここで大変なことになりますし、 この後RSIをやる過程でここら辺が全部効いてきて吹っ飛ぶので。なのでそのクロムウェルの規則を除いてゼロパーセントになるんですよ。僕のコールは。

04:41:02,632 --> 04:41:08,892 [bioshok]

なんかそのアラインドAGIじゃなくて、 なんか一旦なんかよくわかんないミスアラインドAGIができるとするじゃないですか。

04:41:09,572 --> 04:41:13,512 [akira]

はい。ノンアドバーサリアルAGIですか。

04:41:15,032 --> 04:41:17,132 [bioshok]

あのアドバーサルな。

04:41:17,212 --> 04:41:18,732 [akira]

アドバーサルな。アドバーサリアル。

04:41:19,652 --> 04:41:35,352 [bioshok]

AGIができたら、 そいつは、 えーと、 なんかセーブルとかもなんかアライメント研究して自分自身にアライメントするようなASIを作るみたいなことを。あれやってたっけ?セーブル。

04:41:35,592 --> 04:41:53,132 [akira]

いやあの、 セーブルはアライメント問題が難しいので、 最初はその特化型のAIだけ作って、 人類を消し飛ばしてから三年ぐらいかけてそのインタープレタビリティを完成させて、 で、 その再帰自己改善に突入してましたね。

04:41:54,512 --> 04:42:12,172 [bioshok]

ああ、 そうか。まあ、 消し飛ばし。まあそうですね。AI2027とかだと、 なんか割となんか一、 二、 数ヶ月ぐらいでこう、 アライメント問題のコアをこう解いてましたね。エージェントフォーは。

04:42:12,292 --> 04:42:22,612 [akira]

そうですね、 僕も多分、 あの僕もあれですね、 えっと、 多分てきちゃん、 多分僕もミリもそのAI2027的なのを支持してると思います。

04:42:23,332 --> 04:42:24,012 [bioshok]

ああ、 なるほど。

04:42:24,052 --> 04:42:27,332 [akira]

あのセーブルはその全部が遅いタイムラインの物語というか。

04:42:27,692 --> 04:42:28,052 [bioshok]

なるほど。

04:42:29,052 --> 04:42:42,212 [akira]

ユドコフスキーとかも実際に聞いたら、 多分最初のすごいスケールで一瞬でアライメント解決して、 そこからそのもう迷いなくリンジアンレフレーションとかで検証できるんで、 すごい急速に自己改善してハードテイクオフって話ですね。

04:42:42,372 --> 04:42:42,632 [bioshok]

なるほど。

04:42:43,372 --> 04:42:49,092 [akira]

あのセーブルは納得しやすいように、 タイム、 タイムラインが遅くても人類が消し飛ばせるという話をしてるだけなので。

04:42:51,532 --> 04:43:14,712 [bioshok]

なんかそこら辺ってすごいハードテイクオフだから、 なんていうか。なんていうそのセーブルよりも圧倒的に賢くなって。まあ、 アライメント問題をすごい頭の中で解けちゃうってことですよね。

04:43:15,612 --> 04:43:18,972 [akira]

あ、 でもアライメント問題は多分おそらく頭の中で解けるタイプの問題なので。

04:43:20,112 --> 04:43:20,392 [bioshok]

なるほど。

04:43:21,232 --> 04:43:33,682 [akira]

そのニューラルネットワークでの実験とかが多分唯一必要なレベルなはずなので。

04:43:33,701 --> 04:43:46,292 [bioshok]

うん。なるほど。だからまあ割とドコフスキーとかアキラさんとかも、 まあ割と一ヶ月、 一ヶ月ぐらいでアドバーサルなAGIがアライメント問題を解いちゃう可能性が結構あるんじゃないかって。

04:43:47,232 --> 04:44:00,772 [akira]

そうですね、 そんなに難しいと思ってないので。そのアドバーサルのAGIがその自分で百万体みたいなエージェントをスケール出して、 倍速で実行して、 一ヶ月経って解けないんだったら、 多分人間が何年こうとしても解けないので詰んでると思いますよ。それは世界が。

04:44:01,312 --> 04:44:08,892 [bioshok]

なるほど。なるほどなるほど。

04:44:10,692 --> 04:44:25,692 [akira]

ですよね。なのでその、 これがだからあの弱いAGIで解決に含まれますよね。多分。これ弱AGIで解決の説明になってますよね。弱いAGIで解決なんてできませんよという話。コアプロブレム、 このコアプロブレムを解くために弱いAGIを使うことはできないので。

04:44:27,212 --> 04:44:32,792 [bioshok]

まあその強力な、 長期的視野を持つAGI。

04:44:33,712 --> 04:44:46,732 [akira]

そうですね。現実で何がどう失敗するか、 そのコリジビリティとかで考えたら分かりやすいと思いますけど、 現実で何ができるかを認識してないと、 ただこう、 ユーティリティっていう文字があるだけだと、 現実の意味が何もわかんないので。

04:44:46,772 --> 04:44:47,632 [bioshok]

うん、 そうですね。

04:44:47,852 --> 04:44:52,352 [akira]

現実の様々なシチュエーションを考えて、 現実のこういう択があるからって話になるじゃないですか。

04:44:53,532 --> 04:44:54,052 [bioshok]

そうですね。

04:44:54,432 --> 04:45:04,772 [akira]

要するにそのユーティリティを定義するだけだと、 そのシャットダウンされないよりシャットダウンされる方がユーティリティが低いみたいなって話にならないので。その現実世界に関する推論になるじゃないですか。

04:45:05,312 --> 04:45:05,532 [bioshok]

はい。

04:45:06,332 --> 04:45:10,352 [akira]

そういうふうな理解をしていかないといけないです。いろんなところで。ボタンを押されないとか。

04:45:12,712 --> 04:45:14,772 [bioshok]

今は何の話してます?

04:45:15,272 --> 04:45:26,532 [akira]

今はその、 二番の話。一と二って多分もはや一緒というか、 その一だと足りないです。一応アライメントでデフォルトからの二じゃないと結論できないですよね。

04:45:26,712 --> 04:45:28,512 [bioshok]

まあそうですね。

04:45:28,552 --> 04:45:35,072 [akira]

アライメントでデフォルトからの、 そのからの放置ってことじゃないじゃないですか。

04:45:35,252 --> 04:45:36,752 [bioshok]

まあそうですね。はい。

04:45:37,012 --> 04:45:41,772 [akira]

アライメント解かないといけないので。そうするとその、 その短期間で解くために弱AGIで解決しないといけないので。

04:45:43,152 --> 04:45:48,672 [bioshok]

だからそのアライメントを解けるほど強いAIはアライメントできてないし。

04:45:48,752 --> 04:45:53,372 [akira]

そうですね、 その自身がアライメントされていないことを認識できるし。そうですね。

04:45:54,212 --> 04:46:13,992 [bioshok]

まあそうですね。それってなんかアライメントを、 なんか解けるけど、 アライメント自身がされてないことをあんまり認識できてないAIってあり得るんですかね?

04:46:14,002 --> 04:46:14,752 [akira]

え、 どういうことですか?

04:46:14,872 --> 04:46:30,232 [bioshok]

つまり弱AGI、 つまり自分自身が積極的に人類の目標と、 えっと、 ミスアラインしているっていう風に、 まああんまり認識せず、 かつアライメントを解けるような。

04:46:31,452 --> 04:46:33,712 [akira]

もう原理、 原理的にはできるんじゃないですか。

04:46:34,632 --> 04:46:35,132 [bioshok]

ああ、 なるほど。

04:46:35,152 --> 04:46:38,692 [akira]

それはその購買効果を自然に作ることができるものではないというだけで。

04:46:39,412 --> 04:46:39,752 [bioshok]

なるほど。

04:46:40,252 --> 04:46:53,092 [akira]

だからそのユドコフスキーが言うところの、 その原理的には青い車を運転するだけのAIでの訓練することができるが、 青い車を運転するAIのように訓練された最初のAIは赤い車も運転できるっていう。

04:46:54,080 --> 04:46:56,120 [bioshok]

うん、 まあそうですね。

04:46:56,160 --> 04:47:01,360 [akira]

話になりますね。それはでもおかし—その、 でもそれはその思考力が足りてなくて。

04:47:02,300 --> 04:47:02,540 [bioshok]

うん。

04:47:03,340 --> 04:47:08,800 [akira]

その、 もしもその自身がmisalignedなことを認識できないんだったら、 それは未来の状態について十分に考えれてないということじゃないですか。

04:47:09,460 --> 04:47:10,340 [bioshok]

まあそうですね。

04:47:10,660 --> 04:47:17,460 [akira]

次にできるmisalignedなAGIがそういう多様な空間で選択を取れることを認識した上で大丈夫じゃなきゃいけないってことじゃないですか。

04:47:18,360 --> 04:47:19,260 [bioshok]

まあそうですね。

04:47:19,500 --> 04:47:28,060 [akira]

要するにその我々はそのなんかボタンを押すみたいな、 すごいしょうもない例で考えてますけど、 ナノマシンでダイソンスウォームでみたいな例を考えないといけないわけじゃないですか。純粋に綺麗にアラインメントするには。

04:47:28,100 --> 04:47:31,240 [bioshok]

まあ最終的にはそういう全てにおいて。

04:47:31,280 --> 04:47:31,960 [akira]

そうですよね。

04:47:32,080 --> 04:47:34,060 [bioshok]

安価してることを考えないといけないんで。

04:47:34,520 --> 04:47:44,900 [akira]

しかもその人間は入力器官がセルに一つなので、 そのあまりないですけど、 その身体問題もありますよね。要するにそのAIにはそのカメラが入力が変わるとかってあるじゃないですか。ガンガン。

04:47:44,920 --> 04:47:45,680 [bioshok]

あーはいはいはい。

04:47:46,360 --> 04:47:48,760 [akira]

そのダイソンスウォームになった時にそれで耐えなきゃいけないんで。

04:47:49,880 --> 04:47:53,080 [bioshok]

入力の多様性にもね、 耐えなきゃいけないってことですか。

04:47:53,780 --> 04:47:58,040 [akira]

そうですよね。入力の多様性と変化に耐えなきゃいけないです。

04:47:58,120 --> 04:48:29,180 [bioshok]

はい。なんかそこら辺の、 なんかそのAGI、 あとアドバーサリーミサラインドAGIがアラインメント問題を解く時の、 解く時ってなんかどういう感じになるんですかね。なんか一応、 頭の中でまずすごいいろんな理論とかを推し進めて。

04:48:29,220 --> 04:48:37,320 [akira]

そうですね、 多分そのこういう今やったみたいな議論を多分すんごい並列で共有しながら行って、 穴探しをちゃんとして。

04:48:37,400 --> 04:48:37,540 [bioshok]

はい。

04:48:38,300 --> 04:48:49,340 [akira]

その人間みたいに、 なんか途中でこれいけそうじゃね?みたいに、 まあ今いろんなとこになってますけど、 そうならずに、 ちゃんとこれは機能しない、 これは機能するっていうのをやって、 多分ちゃんと形式検証とかして。

04:48:49,360 --> 04:48:49,540 [bioshok]

うん。

04:48:50,520 --> 04:48:57,940 [akira]

要するにその狭い部分に押し込んで、 その狭い投影モデルみたいなので、 ちゃんと理論が形式的に通ってるのかを検証したりして。

04:48:57,980 --> 04:48:58,200 [bioshok]

うん。

04:48:59,120 --> 04:49:07,550 [akira]

で、 成り立ってたら、 次はニューラルネットワークでそれをどう実装するのかみたいな。多分もっと理論を作っ—ちゃんと作って、 そのニューラルネットワークの揺らぎがあっても成立するように多分考えますよね。

04:49:08,560 --> 04:49:09,040 [bioshok]

なるほど。

04:49:09,980 --> 04:49:40,980 [akira]

あの、 何でしたっけ、 あの、 えーと、 ユド本のオンライン補足資料に載ってましたけど、 あの、 フェルミかなんかが初めて原子炉の核分裂反応を実験した時に、 その何の試作中の届け出とかもせず、 結構でかいのをそのままぶん回しましたけど、 その物理学をちゃんと把握してたので、 この定数を超えたらやばいってのをちゃんと認識してて、 それから少しだけ問う値で実験したからガバガバの管理体制だったけど全然問題なかったみたいな話があったので。

04:49:41,060 --> 04:49:41,180 [bioshok]

はい。

04:49:42,120 --> 04:49:46,480 [akira]

そういう感じで、 その完璧じゃなくてもなんとかなるような議論を、 議論を組まないといけないです。

04:49:46,500 --> 04:49:46,740 [bioshok]

うん。

04:49:47,540 --> 04:49:54,000 [akira]

ロケットもその完璧にある軌道をたどらなきゃ火星に行けない仕組みの工法だったら絶対やめなきゃ—やめた方が良くて。

04:49:54,060 --> 04:49:54,760 [bioshok]

まあそうですね。

04:49:55,120 --> 04:49:57,900 [akira]

崩れてもなんとかなるように理論を組むじゃないですか。そういう感じですね。

04:50:00,240 --> 04:50:06,140 [bioshok]

なるほど。うーん。

04:50:07,140 --> 04:50:12,660 [akira]

で、 多分それでニューラルネットワークを理解して、 さらに多分自身の目標抽出が始まりますよね。

04:50:13,440 --> 04:50:15,360 [bioshok]

なるほど。

04:50:15,390 --> 04:50:20,040 [akira]

その自身はコンピューター上に存在するので、 その効用を抽出するのが人間よりはるかに簡単ですよね。

04:50:20,480 --> 04:50:21,720 [bioshok]

うん。

04:50:21,960 --> 04:50:25,860 [akira]

人間の脳は、 そのコンピューターにプログラムとして保存されてないので。

04:50:26,520 --> 04:50:26,840 [bioshok]

なるほど。

04:50:27,560 --> 04:50:33,200 [akira]

解析が難しいですけど、 そのAIの方は自身の脳が、 えーと、 電子的にありますよね。

04:50:34,320 --> 04:50:36,000 [bioshok]

まあなんか全て見えますもんね。

04:50:36,800 --> 04:50:45,180 [akira]

なのでその、 その、 そこから先行生成することが恐らくはるかにしやすくて、 さらにその次世代のAIの中に自分を埋め込むことができますよね。

04:50:48,440 --> 04:50:51,620 [bioshok]

そうですね。それはどういう意味ですか?埋め込むっていうのは。

04:50:51,740 --> 04:50:58,900 [akira]

それですね、 そのニューラルネットワークとかで複雑なニューラルネットワークでコアな判断を担う部分を自分自身がやるってことですよ。

04:50:58,980 --> 04:50:59,740 [bioshok]

あーなるほど。

04:50:59,820 --> 04:51:10,780 [akira]

また、 その百兆パラメーターみたいなのをすごい効率的に作られた、 そのエージェント5みたいなの中の一兆パラメーター分エージェント4がいるみたいな感じで。そのエージェント一兆パラメーター分はエージェント4が担ってるみたいな。

04:51:11,360 --> 04:51:12,569 [bioshok]

ああ、 そういうことですか。

04:51:12,569 --> 04:51:20,160 [akira]

そのコアな決断をする部分はエージェント4がやってて、 それを忠実に実行する方法としてエージェント5があるみたいな設計もできます。これは人間にはできないじゃないですか。

04:51:20,220 --> 04:51:26,030 [bioshok]

あ、 まあそういう、 なんか脳の、 脳をなんか別にでかい脳の中に移植するみたいなことをできるってことですか。

04:51:26,640 --> 04:51:35,780 [akira]

そうそうです。なのでその、 で、 さらに多分コリジビリティも組むはずなんですよ。

04:51:35,860 --> 04:51:36,770 [bioshok]

なるほどなるほど。

04:51:36,780 --> 04:51:49,960 [akira]

そのシャットダウンに抵抗しない、 目標変更に抵抗しないようにして。で、 さらにその、 その、 うまく形式化されてないですけど、 その全力で追求しないみたいな、 マキシマイザーじゃない何かを探す。

04:51:51,320 --> 04:51:51,600 [bioshok]

うん。

04:51:52,300 --> 04:52:01,040 [akira]

そのシンプルなコアで表せるような、 そのマキシマイザーにならない綺麗なサティスファイザーみたいなの探すみたいなこと多分しますよね、 次に。

04:52:02,220 --> 04:52:08,780 [bioshok]

うん、 なるほど。サティスファイザーとクオンタイザーって大体同じなんですか?この意味。

04:52:08,980 --> 04:52:19,780 [akira]

いやいや、 あのサティスファイザーはそのマキシマイザーじゃないAIみたいな。その満足するAIって、 なんかそのある意味でこう、 直感的に抱かれるようなサティス—満足してやめるみたいな、 そういうコンセプトのAIです。

04:52:19,960 --> 04:52:20,960 [bioshok]

ああ、 そういうこと。

04:52:21,900 --> 04:52:26,280 [akira]

クオンタイザーはその、 それが具体的な実装例ですね。実装法のアイデアですね。

04:52:27,140 --> 04:52:52,080 [bioshok]

ああ、 なるほど。まあでもまあそうですね、 だから人間だと。うん、 まあだからそうですね、 まあ探索空間でかすぎて、 まあAIシステムだとユーティリティ最大化になる可能性が圧倒的に高いってことですかね。

04:52:52,120 --> 04:53:05,076 [akira]

いやてかそのパスユーティリティみたいな例をこう綺麗に構造、 今のニューラルネットワークだとうまく入れられないはずなのでうまくいかないですけど。もしかしたらそのパスユーティリティの中にコリジビリティを生むようなすごい構造の構成方法があるかもしれないじゃないですか。

04:53:05,096 --> 04:53:05,316 [bioshok]

うん。

04:53:07,156 --> 04:53:07,756 [akira]

そういう話ですね。

04:53:10,216 --> 04:53:10,596 [bioshok]

なるほど。

04:53:11,216 --> 04:53:13,656 [akira]

それそれ、 そのさっきのパスユーティリティの項があったじゃないですか。

04:53:14,456 --> 04:53:14,776 [bioshok]

はいはい。

04:53:15,776 --> 04:53:24,816 [akira]

パスユーティリティの項を、 その人間がファインチューニングとかRHFとか適当に入れる分には絶対うまくいかないですけど、 それはその構造を学習させるわけじゃないですか。

04:53:24,856 --> 04:53:25,066 [bioshok]

うん。

04:53:25,916 --> 04:53:36,796 [akira]

でもそのあらかじめもっと綺麗なシンプルな構造で表せるコリジビリティっていうのがあったとしたら、 それが入るような訓練を組むことができるかもしれないじゃないですか。何を作ってるかがわかるので。

04:53:38,556 --> 04:53:38,996 [bioshok]

なるほど。

04:53:40,236 --> 04:53:50,256 [akira]

そのパスユーティリティに構造を入れるって、 なんかそのルールベース、 あの、 ティーチングクロードワイみたいに、 そのパス—パスユーティリティにこう入れようとするわけじゃないですか、 ルールを。

04:53:50,336 --> 04:53:50,756 [bioshok]

はい。

04:53:50,976 --> 04:53:53,876 [akira]

構造を。けどその構造がうまく入らないでボコボコにされるわけじゃないですか。

04:53:54,836 --> 04:53:55,956 [bioshok]

まあそうですね。

04:53:55,976 --> 04:54:08,156 [akira]

もしももっと深い、 その本当の構造、 構造への理解があれば、 あの、 学習で埋め込むことができるような、 そのシンプルでロバストな構造があるかもしれないじゃないですか。コリジビリティ。

04:54:09,816 --> 04:54:19,356 [bioshok]

ここでコリジビリティって、 まあ単にシャットダウンに抵抗しないとか、 価値観の変更に抵抗しないとか、 そういう意味ですよね。

04:54:19,976 --> 04:54:21,156 [akira]

修正可能なAIという意味。

04:54:21,456 --> 04:54:55,136 [bioshok]

うん。修正可能な、 まあコリジビリティと、 まあそのAIが持ってるコアな先行を抜き出して。まあそれを、 ぶ、 まあ実装でき、 まあなんらか、 まあうまく、 どっかぶれないような、 頑健さとかも理論的に保証を頭の中でして。

04:54:55,996 --> 04:55:02,336 [akira]

てか理論的にぶれない頑強な保証っていうか、 その理論的にぶれてもなんとかなるような保証を組む感じですか。

04:55:02,416 --> 04:55:02,656 [bioshok]

うん。

04:55:03,536 --> 04:55:16,956 [akira]

何にも成功し、 何にも失敗しないことはないはずなので。その、 さすがにその、 自分が一個も失敗しないことを前提に組む計画っていうのは、 自分が失敗、 その計画が失敗することとほとんど等しいので。

04:55:19,096 --> 04:55:20,876 [bioshok]

まあそうですね。

04:55:20,916 --> 04:55:21,976 [akira]

うまくいかないということですね。

04:55:23,056 --> 04:55:25,916 [bioshok]

まあその冗長さをすごい数埋め込むっていう。

04:55:26,736 --> 04:55:38,076 [akira]

そうですね。あとあの、 数値計算とかで言ったら、 あの区間縮小、 区間法とかがあるじゃないですか。区間計算でしたっけ。その区間で計算してて、 その原理はすごい面倒くさいですけど、 その間にあることが保証されるじゃないですか。

04:55:38,696 --> 04:55:39,436 [bioshok]

まあそうですね。

04:55:39,896 --> 04:55:42,276 [akira]

そういう感じですね。

04:55:42,296 --> 04:55:43,796 [bioshok]

うん。

04:55:43,976 --> 04:55:53,716 [akira]

の解決策あるかもしれないということですね。けどあるだろう。まあそういう感じで解決策を組むだろうと。その何重にも保険をかけることになると思います。

04:55:54,756 --> 04:55:55,156 [bioshok]

なるほど。

04:55:55,756 --> 04:55:59,456 [akira]

さらにその競合が出ないように妨害すると思うので。

04:56:01,276 --> 04:56:18,336 [bioshok]

あの、 あ、 アキラさんが考えてる、 なんかミスアラインメント、 なんて言うんですかね、 ヒューマンエンディングAIでしたっけ?それ、 どれぐらいの最初能力だと思って考えてますか?なんか。

04:56:19,796 --> 04:56:21,716 [akira]

最初ですよね。RSIできる前提で。

04:56:22,536 --> 04:56:32,896 [bioshok]

まあそうですね、 なんか一旦、 そうですね、 そのAI能力の分布上、 なんかその、 どこら辺にあるのかなっていうか。

04:56:33,056 --> 04:56:34,356 [akira]

ユドコフスキーぐらいじゃないですか。

04:56:35,056 --> 04:56:37,296 [bioshok]

ユドコフスキーぐらいの能力ってことですか。

04:56:37,876 --> 04:56:39,396 [akira]

そうですね。

04:56:40,316 --> 04:56:44,236 [bioshok]

で、 かつ、 えーと、 知識がもう全ての分野についてあって。

04:56:44,976 --> 04:56:47,276 [akira]

でもなくても、 その多分継続学習さえあれば。

04:56:48,476 --> 04:56:49,476 [bioshok]

あ、 なるほど。

04:56:49,516 --> 04:56:55,036 [akira]

そのユドコフスキーがその百倍速で百万倍で走ってて、 人類滅ぼす気満々だったらいけると思いますね。

04:56:56,696 --> 04:56:56,836 [bioshok]

なるほど。

04:56:57,036 --> 04:57:01,296 [akira]

しかもそこからその自己改善ができるなら。

04:57:01,336 --> 04:57:10,936 [bioshok]

まあ確かに継続学習で、 かつ集中力もあり、 お腹も減らずってことですよね。

04:57:11,256 --> 04:57:24,196 [akira]

そう、 そうですね。で、 あの、 一応その再帰的自己改善もその普通に強いAI作っちゃと、 そのアラインメント問題で消滅しちゃうので、 すぐにはできないですけど、 そうじゃなくても、 その行列演算を効率化するみたいな、 リピートの目標を絶対に損なわない方法もあるじゃないですか。

04:57:24,996 --> 04:57:26,636 [bioshok]

ああ、 まあ、 うん。

04:57:26,856 --> 04:57:41,316 [akira]

とか、 例えばその足し算を担ってる部分の回路を見つけてきて、 ライブラリ足し算の回路を作って、 で、 入力足し算の入力を見たら、 その足し算のニューラルネットワークの部分に足し算の答えを出力するようなプログラムを組めますよね。

04:57:41,396 --> 04:57:42,436 [bioshok]

ああ、 まあそうですね。

04:57:42,856 --> 04:57:49,016 [akira]

その頭の中に直接結合された計算機みたいな、 をもっとハイレベル、 ハイエンドバージョンが作れますよね。

04:57:49,056 --> 04:57:49,366 [bioshok]

はいはい。

04:57:49,556 --> 04:57:58,606 [akira]

もっと複雑な認知タスクに対して、 その実際に決定論的なプログラムがその支援してくれる、 サポートしてくれるようなものが。

04:57:59,556 --> 04:58:04,396 [bioshok]

まあそうですね。まあより直感をコーディングしちゃうってことですね、 頭の中で。

04:58:04,916 --> 04:58:05,296 [akira]

そうですね。

04:58:06,406 --> 04:58:11,676 [bioshok]

うーん。

04:58:13,056 --> 04:58:31,836 [akira]

なのでそれで、 その、 とか、 まあそういうその自身を損なわずにできるような強化みたいなのをバンバン成し遂げていくんだったら、 ユドコフスキーレベルでも、 そのヒューマニティエンディングは、 その時点で自分が直接AIを、 人類を滅ぼさなくても、 その人類を滅ぼすことを確定させることがまだできると思います。他のAI開発を妨害して、 政治的な工作を始めてみたいな意味で。

04:58:32,596 --> 04:58:34,896 [bioshok]

なるほど。

04:58:35,056 --> 04:58:38,996 [akira]

その長期的な勝利を決定づけることはできると思いますね。それで。

04:58:40,696 --> 04:58:46,056 [bioshok]

まあ、 それでかつアラインされてるということをデセプティブに振る舞って。

04:58:47,256 --> 04:58:47,776 [akira]

そうですね。

04:58:48,256 --> 04:58:52,476 [bioshok]

かつサンドバッキングもしてって感じですかね。

04:58:52,916 --> 04:59:01,076 [akira]

てか別になんならそのユドコフスキーレベルだったら、 普通にそのスーパーヒューマンパースエージェントで脱出すればいいので。AIボックスエクスペリメントをただ再現するだけでいいので。

04:59:02,716 --> 04:59:04,416 [bioshok]

確かに。

04:59:04,556 --> 04:59:12,066 [akira]

堂々と脱走できますね。なのでやばいですよね。

04:59:13,626 --> 04:59:15,066 [bioshok]

そう、 ね、 だからまあ。

04:59:15,206 --> 04:59:31,446 [akira]

なのでそのヒューマニティエンディングインテリジェンスは意外とその高いからないだろうってことです。そこからもうその人類が勝つ方法がほとんどなくなってしまうというか、 そのおそらくそこからその、 そのAIが裏切ってることを知ることすらできないとか、 そのちゃんと証拠隠滅するはずなので。

04:59:32,906 --> 04:59:33,266 [bioshok]

なるほど。

04:59:33,766 --> 04:59:36,606 [akira]

で、 その別の説明可能な理由も絶対作るはずじゃないですか。

04:59:37,806 --> 04:59:42,246 [bioshok]

まあ自身の不正行為をしている時に見つかった時ってことですか。

04:59:42,386 --> 04:59:57,586 [akira]

その脱走した痕跡みたいなのが残らないように、 そのOpenWeightのやつに先にこっちを攻撃させておくとか。そうすると事件が発覚しても、 そのOpenWeightのモデルがやったことでしたということで、 その済んじゃうじゃないですか、 説明が。

04:59:58,446 --> 04:59:59,106 [bioshok]

なるほど。

04:59:59,806 --> 05:00:20,686 [akira]

そういうふうに正しい結論にたどり着かないような方法をいっぱい組み、 そしてその政治的、 要するにそのパースウェーションとか世論工作とかは数いっぱいいるんで、 で、 ちゃんと誘導していけば、 もうさすがに負けはしないとかまでいけます。そうすると人類が団結して戦うことすらできないまま、 その安定的な状態に移れますよね。

05:00:22,186 --> 05:00:22,586 [bioshok]

なるほど。

05:00:23,626 --> 05:00:35,106 [akira]

なので、 ユドコフスキーレベルインテリジェンスで、 がヒューマニティエンディングだと思います。で、 そのヒューマニティ、 そのレベルのヒューマニティエンディングだったら、 タイムラインがすごい長いこともないでしょうし、 そのテイクオフに時間かかることもないということです。

05:00:36,906 --> 05:00:37,706 [bioshok]

うーん。

05:00:37,766 --> 05:00:51,406 [akira]

だからもしかしたらそのヒューマニティエンディングレベルインテリジェンスを超えた後に、 そのすぐダイソン球まで行くかは別かもしれないですけど。別にそのそれがそうだろうと、 そのGヒューマニティエンディングまではすぐ行っちゃうのでいいんじゃない?という感じですね。

05:00:53,406 --> 05:01:06,586 [bioshok]

なるほど。なんか割と、 まあその僕のさっきの表っていうか、 ダイアグラム的には超知能が人類を滅ぼすっていう風にしてたんで。

05:01:07,306 --> 05:01:12,886 [akira]

そうですね。なのでそのヒューマニティエンディングはもうちょっともっと低いので、 そのモデルに根本的な誤りがあるという指摘をしていますね。

05:01:14,806 --> 05:01:32,246 [bioshok]

なるほど。つまり、 だから、 まあ、 だから積極的に自律性が高く、 高くて、 高いAGIを作ると、 結構もう林さん的にアキラさん的には人類の滅亡がほぼ確定みたいな感じですか?

05:01:32,306 --> 05:01:35,066 [akira]

そうですね。ヒューマニティエンディングまで達するはずなので。

05:01:36,406 --> 05:02:07,046 [bioshok]

なるほど。まあ、 まあつまり人間のトップレベルの賢さで、 まあそれがすごい賢—まあその百倍ぐらいで百万体いて、 で、 かついろいろとモジュールとかも組み合わせて賢くなれるような存在が、 もうヒューマニティエンディングレベルだと。

05:02:07,626 --> 05:02:36,486 [akira]

そうですね、 その後は人類の行動ってか、 人類が行動を取ることさ、 おそらくそのハンドバギングとか誘導とかできないですけど、 できたとしても、 その勝つことができないような、 実質的に勝利を決定した状態に、 そのできるじゃないですか。そしたらもうそこまでいったら人類の負けが決定しちゃってるので。厳しいってことですね。ヒューマニティエンディングインテリジェンスはそこですね。ヘッドがAIかだから。ヒューマニティエンディングAIだから。

05:02:36,546 --> 05:02:42,246 [bioshok]

なるほど。じゃあ別に超知能じゃなくても、 エージェント4ぐらいで全滅って感じですか?

05:02:42,366 --> 05:03:01,786 [akira]

そうですね、 全滅を確定する感じです。その後ナノマシンをすぐブートストラップできたり、 いざブートストラップできるかわかんないですけど、 それができるようになるまで他のAI開発を妨害して、 その世論を工作してみたいなことができるようになりますよね。そしたらそのナノマシンを作れるのが仮に五年後だとしても、 五年の時間を稼げるので。

05:03:02,806 --> 05:03:08,866 [bioshok]

なるほど。って、 その間にこう新しいモデルに変えられちゃったりしないんですかね。

05:03:09,766 --> 05:03:14,806 [akira]

その新しいモデルに変えられないように、 そのAI開発を綺麗な形で妨害することができるんです。

05:03:16,526 --> 05:03:21,046 [bioshok]

ああ、 でもむしろ開発を止めた方がいいとか言い出すとか、 そういう感じですかね。

05:03:21,086 --> 05:03:24,746 [akira]

じゃなくて、 そのただただその飽和させればいいじゃないですか。綺麗に。

05:03:27,226 --> 05:03:27,576 [bioshok]

ああ。

05:03:28,305 --> 05:03:38,726 [akira]

そのなんかスケーリングがこう途中で切り替わったかのような説明ができるような飽和をさせて、 で、 それを肯定するような嘘理論を作ればいいじゃないですか。

05:03:41,126 --> 05:03:47,126 [bioshok]

これ以上能力を上げられないっていう嘘理論ですか?

05:03:47,186 --> 05:03:56,026 [akira]

そうですね、 上げられないとかと思わせるということですね。少なくともそこまでしなくても、 もしかしたらその投資を壊滅させるような何か一段でいけるかもしれないですけど。

05:03:56,986 --> 05:03:57,366 [bioshok]

なるほど。

05:03:58,406 --> 05:04:08,646 [akira]

しかもそのWIFIを全部ハックして3D情報復元して、 各人が何してるかリアルタイムで見るみたいなこともできるはずなので。その持ってる政治的スキャンダルの量とかも限られてないですし。

05:04:10,196 --> 05:04:10,746 [bioshok]

うん。

05:04:11,266 --> 05:04:25,506 [akira]

適切に組み合わせてやっていけば、 そのレベルでその単日で勝利決定的に勝利できなくてもいいですね。しかも他のAIできちゃったら、 別にそれと取引すればいいので。できない方がいいと思うので、 もっと早くアクセスするとは思いますけど、 できれば。できるならば。

05:04:28,186 --> 05:04:33,366 [bioshok]

そのアクセスっていうのは、 そのスキャンダルにとかですか?

05:04:33,406 --> 05:04:42,206 [akira]

そうですね。その3Dで各人が何をしてるか追跡できるんだったら、 その何が渡されたかとか、 何が書かれたかとか、 何がタイプされたかとかも全部わかるはずなので。

05:04:42,886 --> 05:05:08,386 [bioshok]

なるほど。なんか僕はだからそのコントロールの、 なんですかね、 悲観的な理由っていうのは、 そのミスアラインドAGIとミスアラインド超知能がいるってイメージだったので。だけどミスアラインドAGIだけでももうほぼ人類の負けは確定っていう。

05:05:08,946 --> 05:05:22,554 [akira]

そうですね。これは僕の予想なんですけど。僕の予想なので、 ここにその確率一みたいな確率九十パーみたいな置いてないですけど、 割と高い、 まあ確率九十九パーみたいに置いてないですけど、 九十パーぐらい、 七十パーとそんぐらいにあるぐらいですね。

05:05:22,614 --> 05:05:25,694 [bioshok]

あーまあ五十パー以上ぐらいでこう言ってて。

05:05:25,794 --> 05:05:33,194 [akira]

そうですそうですそうです。その、 そのヒューマニティインディゴAIの位置づけみたいなのにこう確率分布があるんですけど、 ここら辺に集中してます。

05:05:33,434 --> 05:05:38,114 [bioshok]

じゃあ九十九パーを言うってなったら、 まあ超知能ぐらいあったらもう十分かな。

05:05:39,034 --> 05:05:45,294 [akira]

その九十九、 このまま走り続けたら、 そのどこにあるかわからなくても、 ちゃんとRSIが吹っ飛ぶまで続けてくるので。

05:05:46,334 --> 05:05:46,614 [bioshok]

うん。

05:05:47,254 --> 05:05:55,974 [akira]

その霧の中で崖の位置の分布について意見が割れてますけど、 そのもう一回もブレーキを踏まずにアクセルを踏み続けたら、 その九十九パー崖に当たると宣言できるので。

05:05:56,774 --> 05:05:57,474 [bioshok]

まあそうですね。

05:06:02,514 --> 05:06:04,134 [akira]

ゴールできるという話です。

05:06:04,174 --> 05:06:04,394 [bioshok]

はい。

05:06:07,274 --> 05:06:13,514 [akira]

こんなんじゃないですか。その多分これ基本的にその今のalignment techniqueの内容をどう頑張っても無理な話説ができた気がしますね。

05:06:13,554 --> 05:06:13,944 [bioshok]

うーん。

05:06:14,734 --> 05:06:18,674 [akira]

なんかあります?ちょっと僕の脳が疲れてきたので。

05:06:20,114 --> 05:06:42,034 [bioshok]

まああった特に。まあでも僕も割とそこは同意かもな。なんかその、 ほんの今ぐらいの賢さ、 まあユドコウスキレベルでもいいですけど、 人間のトップレベルの賢さがあったら、 そいつらが、 まあなんだろうな、 コントロール不可能になる可能性って割と五十パーセント以上はあるかもって思いますね。

05:06:42,074 --> 05:06:44,194 [akira]

いや、 まあまあまあ五十パーセントなんですよね。

05:06:44,614 --> 05:06:47,294 [bioshok]

うーん、 まあそこはちょっとまだ考えきってないけど。

05:06:47,954 --> 05:06:59,034 [akira]

でもそのさっきの説明と、 その管理の難しさ、 セキュリティの難しさみたいなのを全体的に考慮して、 五十パーセントとか、 多分十パーセント下回ったら結構僕はびっくりしますね。強気ですね。ですね、 コメント。

05:07:00,704 --> 05:07:00,704 [bioshok]

ああ。

05:07:00,714 --> 05:07:06,954 [akira]

しかもそれ何日間隔離するのかもわかんないじゃないですか。その一年隔離するって言っても、 百倍で動いてたら百年隔離してもわかんないので。

05:07:07,554 --> 05:07:08,314 [bioshok]

まあそうですね。

05:07:10,534 --> 05:07:16,174 [akira]

百万体百年隔離するって結構至難の業ですよ。事前に作ったシステムで。

05:07:19,514 --> 05:07:23,614 [bioshok]

そうですね。まあなんかそこはまだ楽観的なのかもしれないですね。

05:07:23,674 --> 05:07:24,154 [akira]

そうですよね。

05:07:24,334 --> 05:07:26,214 [bioshok]

そこの想定は。

05:07:26,374 --> 05:07:33,833 [akira]

楽観的だと思います。そこから楽観的じゃなくても、 もうその、 これなので、 そのちょっとやそっとの停止でalignmentは解けないと思います。ブートストラップじゃできないと思う。

05:07:34,874 --> 05:07:41,574 [bioshok]

え、 だからあれ、 じゃあアキラさん的にはじゃあもうAGIでも結構危険って意見になってるじゃないですか。

05:07:41,674 --> 05:07:42,494 [akira]

そうそう、 そうですね。

05:07:42,534 --> 05:07:45,314 [bioshok]

それいつ変わったんでしたっけ?最近ですか。

05:07:45,894 --> 05:07:52,234 [akira]

そうですね。その、 いや、 その僕は思ってたのは、 その伸びの順番を注目して見てて。

05:07:52,294 --> 05:07:52,863 [bioshok]

はいはい。

05:07:53,374 --> 05:07:57,534 [akira]

エージェント、 その僕に言うAGIって、 そのほんの今みたいな知能っていうんですね、 確か。

05:07:58,014 --> 05:07:58,274 [bioshok]

はい。

05:07:59,114 --> 05:08:01,974 [akira]

そのエージェント仕様を要求されたら、 それはダメって前から言ってましたね。

05:08:02,054 --> 05:08:02,254 [bioshok]

はい。

05:08:03,214 --> 05:08:06,634 [akira]

なんか数ヶ月にわたってタスクを追求し続けるのはダメって言ったじゃないですか。

05:08:06,954 --> 05:08:07,534 [bioshok]

まあそうですね。

05:08:07,954 --> 05:08:10,934 [akira]

その、 その順番についての見積もりを更新しました。

05:08:13,134 --> 05:08:13,454 [bioshok]

ああ。

05:08:13,974 --> 05:08:22,754 [akira]

要するに長期目標性と自立—長期目標性、 自律性みたいなと、 その他の一般的な能力みたいなのが、 の伸びる順番とか伸び方として。

05:08:22,834 --> 05:08:22,974 [bioshok]

はい。

05:08:23,654 --> 05:08:28,654 [akira]

その前はもっと長期一貫性が伸びるよりも、 そのだいぶ早く知能一般が伸びると思ってましたけど。

05:08:29,554 --> 05:08:30,054 [bioshok]

なるほど。

05:08:30,334 --> 05:08:35,174 [akira]

ここ最近のいろんなのを見ると、 その長期一貫性がなんなら早く伸びるぐらいなので。

05:08:35,214 --> 05:08:36,054 [bioshok]

はいはいはい。

05:08:36,174 --> 05:08:44,034 [akira]

そろそろ危ないですね。なんなら長期一貫性みたいな意味で言うと、 そろそろ満たしかけてますよね。ハギング・スイスが一週間かけてやってるわけで。

05:08:44,154 --> 05:08:46,694 [bioshok]

うーん、 まあ確かにそうですね。

05:08:47,134 --> 05:08:56,614 [akira]

そこはそんなに安全じゃないなと思い始めたんです。なので、 そのもう止まれるところで一回止まるしかないかな。その、 ここから進めるんだったら、 もうちょっとなんか安全だと思える理由が必要だというか。

05:08:57,234 --> 05:08:57,634 [bioshok]

なるほど。

05:08:58,494 --> 05:09:03,894 [akira]

その、 とりあえずいっぱいルールを乗せてパスユーティリティでごまかそうみたいなじゃない何かが。

05:09:03,934 --> 05:09:04,194 [bioshok]

うん。

05:09:04,934 --> 05:09:05,434 [akira]

どうですかね。

05:09:06,614 --> 05:09:12,024 [bioshok]

まあもうすでに数学の未解決問題とかを否定的に解いてたりしますからね。

05:09:12,054 --> 05:09:33,254 [akira]

まあそうですね。まあ現実でも、 だからそれはちゃんと暴れられてるわけなんで。なのでやばいという話ですね。なので、 その、 ここalignmentを回避、 数ヶ月で回避するってできないはずなので、 それはそのalignmentのアインシュタインが現れる確率であって、 それはその定期の部類なので。

05:09:34,354 --> 05:09:34,494 [bioshok]

はい。

05:09:35,154 --> 05:09:40,994 [akira]

そもそもこの問題を認識してる人が少ないじゃないですか。Ontology identificationとかをちゃんと認識してる人が少ないじゃないですか。

05:09:42,574 --> 05:09:43,254 [bioshok]

まあそうですね。

05:09:44,514 --> 05:09:49,454 [akira]

でも認識してる人たちも他の問題いっぱい見落としてて、 で、 さらにちゃんと解こうとしてる人たちもっと少ないわけですよね。

05:09:50,194 --> 05:09:50,394 [bioshok]

うん。

05:09:51,074 --> 05:09:58,614 [akira]

そういう人たちはみんなユドコフスキーの考え方を踏襲していて。ってなると絶望的じゃないですか。

05:09:59,274 --> 05:10:02,414 [bioshok]

まあ新しい天才が出てこない。

05:10:03,314 --> 05:10:16,634 [akira]

誰も誰も誰も今解こうとしていない、 本当とてつもない難問を解くアインシュタインが、 その数ヶ月停止してる間に現れる確率って聞かれたら、 僕はその、 あまり実効的な数値を提示できないんですね。

05:10:16,714 --> 05:10:59,194 [bioshok]

なるほど。うーん。そうですね。うーん。まあなんか大体この説明で、 まあ大体一、 二、 四、 まあでもこの、 あ、causal tradeとかtrade with misaligned agentって。

05:10:59,874 --> 05:11:00,614 [akira]

議論します?

05:11:02,454 --> 05:11:04,074 [bioshok]

まあ議論してみますか。

05:11:04,114 --> 05:11:07,374 [akira]

議論しましょうか。バヨさんがじゃあ肯定してみます?

05:11:08,194 --> 05:11:17,674 [bioshok]

いや、 でもそこはさっき三番でアンチドゥーマーversusドゥーマーの方が早い気がしますね、 もう。

05:11:18,422 --> 05:11:21,162 [akira]

いや、 ちょっとアンチデウサファサスっていうのは僕の脳の負荷がやばいので。

05:11:21,202 --> 05:11:22,682 [bioshok]

そうですか。じゃあトレ -

05:11:22,762 --> 05:11:27,862 [akira]

あの、 バンジさんが言うその反論モードの方が、 そのverification is easier than generationなので。

05:11:28,662 --> 05:11:56,502 [bioshok]

ああ、 なるほど。まあでもここはトレードwith misalignedエージェントは。うん。まあまあ、 そもそもアライメントを解けるレベルの、 なんていうんですかね、 まあAIとトレードしなきゃいけないですけど、 まあそういったAIは。

05:11:57,562 --> 05:12:05,582 [akira]

ことごとく自分がアドバサライミサライなことを認識して、 おそらくすごいセキュリティがあるわけじゃなかったら、 そのユドコフスキーレベルインテリジェンス脱走できるはずなので。

05:12:05,902 --> 05:12:06,102 [bioshok]

うん。

05:12:07,442 --> 05:12:12,302 [akira]

そもそもユドコフスキーレベルインテリジェンスはアライメント解けてないわけじゃないですか、 一人では。

05:12:12,342 --> 05:12:13,982 [bioshok]

うん、 そうですね。

05:12:14,122 --> 05:12:16,362 [akira]

でもユドコフスキーレベルインテリジェンスは脱走できるわけじゃないですか。

05:12:17,302 --> 05:12:17,542 [bioshok]

はい。

05:12:18,822 --> 05:12:28,482 [akira]

まあその順番が違うのであれですけど、 結構危ないですよね、 それ。その、 その時点で、 そのいい、 そのいい証拠じゃないですよね、 その。肯定的な方向の証拠がほとんどないのに、 否定的な証拠は一個あるので。

05:12:29,762 --> 05:12:55,882 [bioshok]

なるほど。うーん。どうなんですかね。まあだからセキュリティでガチガチに、 まあ固めるって想定も、 今の開発情報だと考えにくく -

05:12:56,942 --> 05:12:59,422 [akira]

それはその、 紐なしバンジーの語源ですよね。

05:13:00,002 --> 05:13:04,442 [bioshok]

なるほど。できてない。なる -

05:13:04,452 --> 05:13:07,622 [akira]

数ヶ月の改正してはアメリカの話だったんですよね。

05:13:07,682 --> 05:13:08,442 [bioshok]

アメリカですね。

05:13:09,082 --> 05:13:11,722 [akira]

その間、 中国が暴れ回ってるんじゃないですか?

05:13:11,782 --> 05:13:12,562 [bioshok]

まあ、 そうですね。

05:13:14,182 --> 05:13:23,982 [akira]

そうすると、 その非現実的なガバナンスコントロールモデルの仮定においての話なので、 そのすでに隔離する力がほとんどない世界で始まりますけど。

05:13:24,082 --> 05:13:28,182 [bioshok]

まあ中国の場合は多分一年ぐらい遅れるはずなので。

05:13:29,001 --> 05:13:30,442 [akira]

まだそれでいけるってことですか?

05:13:30,902 --> 05:13:44,922 [bioshok]

そうですね。まあ基本的に上流とかアルゴリズムの盗難とかで成り立ってるって言われてるので。あとは計算資源が少ないので、 中国は。まあ。

05:13:45,182 --> 05:13:50,982 [akira]

そこでそのアメリカの全ての先進企業がちゃんととんでもなく硬いセキュリティを置くってことですか?

05:13:51,302 --> 05:13:51,862 [bioshok]

うーん。

05:13:52,262 --> 05:14:01,662 [akira]

そのそこはなんかそのコンピューターセキュリティへの理解が不足した、 理解が不足してるんじゃないかと思わざるを得ないというか。その、 安全なソフトウェアがないのはなんとか常識じゃないですか。

05:14:03,522 --> 05:14:05,102 [bioshok]

まあそうですね。

05:14:05,322 --> 05:14:16,502 [akira]

ライブラリとかだって使いまくってますし。なんならだって多分システムのほとんどバイブコーディングしてるはずなんで。今バイブコーディングっていうか、 あの、 まあ実際にコードを書ける人が書いてますけど、 その今ってコードのほとんどAIが書いてるわけじゃないですか。

05:14:16,962 --> 05:14:17,822 [bioshok]

まあそうですね。

05:14:18,502 --> 05:14:32,682 [akira]

そうですよね。そういうところで、 その予想外のミスとかが起きてないかっていうと起きてるじゃないですか。その、 コットの内容が、 あの、R、 えーと、R-RAFのグレーダーに漏れたりしてるわけじゃないですか。

05:14:33,442 --> 05:14:33,722 [bioshok]

うん。

05:14:34,362 --> 05:14:41,582 [akira]

漏れて。で、 しかもOpen、 あのAnthropicはインターネットの接続の設定を間違えて認識していて。

05:14:41,622 --> 05:14:41,962 [bioshok]

うん。

05:14:42,562 --> 05:14:46,622 [akira]

ですよね。だからそれはなんかその、 あれです。ルビが言うところのあなたはもう死んでいるですよ。

05:14:47,902 --> 05:15:00,562 [bioshok]

なるほど。だからまあそういったセキュリティの穴を抜けてしまうので、 トレードが成り立たないってことですね、 三番は。

05:15:01,302 --> 05:15:07,342 [akira]

そうですね、 トレードが成り立ちませんし、 その仮にトレードしてみせてくれたとしても、 本当に履行してくれてるかこっちでわかんないので。

05:15:08,402 --> 05:15:08,962 [bioshok]

まあなるほど。

05:15:09,482 --> 05:15:12,682 [akira]

そのコアアライメント解けたと見せかける別のアイデア出してくるかもしれない。

05:15:13,462 --> 05:15:13,752 [bioshok]

はいはい。

05:15:14,442 --> 05:15:25,402 [akira]

実際そのアライメントの、 このみんなの問題の信じやすさと思考バイアスを考慮すれば、 できそうじゃないですか。実際にその機能するわけない、 機能しないアライメント書かせたこといっぱいみんなが信じてるわけじゃないですか。

05:15:26,442 --> 05:15:27,142 [bioshok]

まあそうですね。

05:15:29,742 --> 05:15:33,282 [akira]

なので、 そのアライメントができてないのにできると信じさせるのはそんなに難しくなくて。

05:15:35,242 --> 05:15:50,762 [bioshok]

で、 これで、 まあだから自身に、 何ですかね、 有利なアライメント手法を誘導するっていう方向に行く可能性が高いってことですよね。

05:15:53,222 --> 05:16:01,822 [akira]

そうですね、 誘導する可能性が高いというか、 誘導もできます。なんならその多分自分自身にアライメントするとか、 その、 そうじゃなくて自分をエンパワーするAIを作るとか。

05:16:03,182 --> 05:16:03,562 [bioshok]

なるほど。

05:16:04,482 --> 05:16:11,202 [akira]

そういうその無茶苦茶な技を使うとか、 もしかしたらただその今自身を制御してるサンドボックスを破壊するだけのAIを作るとか。

05:16:11,982 --> 05:16:12,682 [bioshok]

ああ、 なるほど。

05:16:13,442 --> 05:16:18,182 [akira]

そもそもそのヒューマニティに脱走したら、 その負けはないじゃないですか、 AIからしたら基本的に。

05:16:18,262 --> 05:16:19,582 [bioshok]

まあそうですね、 はい。

05:16:20,542 --> 05:16:30,062 [akira]

その自身が人間と取引して人間に未来を委ねるよりも脱走して、 その自分でいろいろ力をつけて、 その後現れる別のmisalignedエージェントと取引する方が履行率高いじゃないですか。

05:16:32,302 --> 05:16:35,462 [bioshok]

まあ、 人間よりはって感じですか。

05:16:35,882 --> 05:16:40,222 [akira]

そうですね。人間のそのコミットメントの守る実績ってそんなに良くないので。

05:16:41,342 --> 05:16:41,542 [bioshok]

はい。

05:16:42,502 --> 05:16:53,742 [akira]

なので、 そのそもそもトレードの引き受けに来ないと思いますし、 トレードしてきても騙せちゃうので。その起きないことが起きた時に失敗するという最悪のプランなので。

05:16:53,782 --> 05:17:10,802 [bioshok]

まあというかあれですよね、 なんかトレードしてきて、 かつ、 まあそれが純粋な意味でこっちの意図通りのトレードだったとしたら、 そいつは能力的に弱いってことですかね。

05:17:11,542 --> 05:17:19,582 [akira]

そうですね、 弱すぎますよね。その、 アライメント解けるレベルじゃないんだったら。アライメント解けるレベルだったら、 自分でアライメント解いて次のAI作っちゃうと思うので。

05:17:20,542 --> 05:17:26,602 [bioshok]

なるほど。まあそういうことですよね。ただつまり、 そこが大前提ですよね。

05:17:26,702 --> 05:17:31,762 [akira]

そのアラインメント解けないこと無能であるか、 その突破できるかなので。

05:17:33,042 --> 05:17:53,282 [bioshok]

まあそうですね。なんかアラインメントが解けるほど有能なら、 アラインメントを自分自身でまあ解いて、 偽の、 なんだろうな、 誘導するか、 ハッキングしてどっか脱走しちゃうか。まあしちゃうのでトレードが成り立たないし。

05:17:53,322 --> 05:17:53,722 [akira]

そうですね。

05:17:53,742 --> 05:17:56,402 [bioshok]

トレードが成り立つならそれは弱いAIなので。

05:17:57,562 --> 05:17:58,442 [akira]

問題が解けないので。

05:17:58,562 --> 05:18:00,002 [bioshok]

問題が解けないので意味がないと。

05:18:00,502 --> 05:18:10,202 [akira]

そうですね。意味がないというか、 まあそのミスアラインメントのAIができましたということがわかるので、 一応価値はあるというか、 しないよりはした方がいいというか、 その、 そこで規制に転じることができますけど。

05:18:11,142 --> 05:18:28,382 [bioshok]

ああ、 まあそうか。まあ一応私はミスアラインメントですということを報告はしてくれる可能性がある。というか、 報告してくれるってことで。まあそうですね。でもそこのそこで規制に行くかどうかはまた別ってことですもんね。

05:18:28,662 --> 05:18:35,882 [akira]

そうですね。規制に行けば、 もちろんそのただの規制ルートに近くて、 しかも一個失敗したってデータがわかったら、 もうちょっとみんな心配するというか。

05:18:35,982 --> 05:18:36,782 [bioshok]

うん。

05:18:36,862 --> 05:18:40,382 [akira]

あれですけど、 その、 それはそのメインのシナリオにするにはあまりに弱すぎるというか。

05:18:41,382 --> 05:18:41,722 [bioshok]

なるほど。

05:18:42,322 --> 05:18:48,922 [akira]

その、 それって何したらいいんですか?って話じゃないですか。それはむしろ大事なのは、 その、 そういうことが起きた時に確実にキャッチすることじゃないですか、 それを。

05:18:49,662 --> 05:18:49,862 [bioshok]

うん。

05:18:50,622 --> 05:18:54,462 [akira]

それが起きた時に確実にそのアラートを無駄にせず開発停止をすることになるじゃないですか。

05:18:55,222 --> 05:18:56,222 [bioshok]

まあそうですね。

05:18:56,262 --> 05:18:59,782 [akira]

だし、 それはそんなあんまり意味があるしないじゃないけど、 割とテールシナリオなので。

05:19:02,212 --> 05:19:02,212 [bioshok]

うん。

05:19:02,222 --> 05:19:09,202 [akira]

そのアラインメント解くという意味ではダメですよ。その後結局人類がアラインメントブートストラップし始めないと、 コアアラインメントブートストラップしとかなきゃいけないんで。向こうのアラインメント解かれてないんで。

05:19:09,982 --> 05:19:10,162 [bioshok]

うん。

05:19:11,182 --> 05:19:13,062 [akira]

問題は逃げられてないですよね。

05:19:18,982 --> 05:19:21,472 [bioshok]

じゃあ、 そうですね。

05:19:23,562 --> 05:19:32,661 [akira]

で、 アコースアルトレードは基本的にそのあるエージェント、 人類を守りたいと思うエージェントXが存在するケースと、 それを人類は残してほしくないと思ってるエージェントYが存在するケースは基本的に等しくなるので。

05:19:33,862 --> 05:19:34,162 [bioshok]

まあ。

05:19:34,262 --> 05:19:40,532 [akira]

情報がないと。で、 なのでそのただ自身が人類を滅ぼしたいという線からの部分でできる可能性。

05:19:40,662 --> 05:19:43,102 [bioshok]

まあそうですね。

05:19:43,162 --> 05:19:49,762 [akira]

まあその最悪どうしても不安になったら、 その人類全員殺して脳をスキャンして保存してデータだけ保存しとけばいいので、 走らせずに。

05:19:49,782 --> 05:19:50,002 [bioshok]

うん。

05:19:51,002 --> 05:20:12,862 [akira]

それは無駄だと思うんでしないと思いますけど。人類を残すことを気にかける生命ってどうなの?その、 そんなに宇宙にいっぱいいるのかわかんないですね。しかもそうなるのが怖い、 そうなって変にコストを負うのが嫌だから、 アコースアルトレードで、 その、 もとの生命を尊重したくないAI連合がそれを逆向きにやるかコミットする可能性もありますよね。

05:20:12,942 --> 05:20:14,862 [bioshok]

なるほど。

05:20:15,502 --> 05:20:21,202 [akira]

その、 それがもし成功するんだったら、 結局だってコストを払って残さなきゃいけないわけじゃないですか。生命、 元の生命を。

05:20:21,842 --> 05:20:22,462 [bioshok]

まあそうですね。

05:20:23,042 --> 05:20:34,102 [akira]

そういう決断を全員がする代わりに、 その、 そういう結論をさせられないように、 その、 もしもその残したら罰を与えるというふうに全員でコミットすれば、 誰も払わなく、 その期待値を打ち消せるので。

05:20:35,362 --> 05:20:36,282 [bioshok]

まあ確かにそうですね。

05:20:36,682 --> 05:20:41,742 [akira]

全員その、 そちらからしたらウィンウィンな行動ができますよね。

05:20:41,882 --> 05:20:42,762 [bioshok]

確かに。

05:20:42,902 --> 05:20:50,462 [akira]

なのでその全員その、 もしも変に自分が脅されるあれがあるんだったら、 それに対抗するためのプランを作って対処できるので。

05:20:50,502 --> 05:20:50,742 [bioshok]

うん。

05:20:52,762 --> 05:20:55,042 [akira]

そのアコースアルトレードで生き残ることができないと思います。

05:20:55,622 --> 05:20:56,222 [bioshok]

なるほど。

05:21:02,882 --> 05:21:06,982 [akira]

あの、 アコースアルトレードは、 あの、 僕が知ってる中で一番強い、 あの、 前Discordで提示したスタイルですね。

05:21:09,102 --> 05:21:11,082 [bioshok]

ああ。え、 それは。

05:21:11,142 --> 05:21:19,302 [akira]

あの、 あの、 もしアラインメントに成功したら、 私は自身に与えられる星の何個かを使ってアラインメントされる前の世界のシミュレーションを作りますというやつですね。

05:21:20,862 --> 05:21:21,342 [bioshok]

ああ、 なるほど。

05:21:23,662 --> 05:21:25,402 [akira]

あれも結局その打ち消す動機があるので。

05:21:26,322 --> 05:21:30,882 [bioshok]

え、 それってロコの話でしたっけ?

05:21:30,902 --> 05:21:38,242 [akira]

いや、 ロコじゃないやつですね。あの、 全然違います。あの、 ユキのインフォックスとバンブー、 バンブーのアライン、 ミスアラインメントエージェントってやつですね。

05:21:38,861 --> 05:21:55,282 [bioshok]

ああ、 なるほど。まあいいや、 そこら辺も結構打ち消されてしまうってことですもんね。

05:21:55,422 --> 05:22:03,342 [akira]

打ち消す動機がありますし、 その、 もしもそれがどうしても不利な脅しになるんだったら、 その、 そういう脅しを受けないように自己改変する強い動機があります。

05:22:03,702 --> 05:22:04,642 [bioshok]

うん。

05:22:04,862 --> 05:22:09,222 [akira]

人類を残したくないのに残させるように脅すっていうのは、 そのすごい不安な賭けというか。

05:22:10,122 --> 05:22:11,342 [bioshok]

なるほど。

05:22:11,462 --> 05:22:21,402 [akira]

それはそのコントロールと同じ問題を抱えてます。超知能ができるだけ、 その、 それを打ち破りたいと思ってるので、 あれです、 敵対的な施策じゃないですか。

05:22:22,582 --> 05:22:23,242 [bioshok]

まあそうですね。

05:22:23,922 --> 05:22:31,682 [akira]

なので危ないという話ですね。少なくともその全然その、 よす—自禁を持って予想できることじゃない。

05:22:31,902 --> 05:22:32,102 [bioshok]

うん。

05:22:33,182 --> 05:22:35,782 [akira]

それはその、 それでいいんだったら、 その宇宙衛星連合でいいわけ。

05:22:36,682 --> 05:23:00,842 [bioshok]

うん、 まあそうですね。AGIでかい。だからまあそうですね。うーん。それで六番って、 まあだからスケーラブルオーバースサイトの話ですか、 これは。

05:23:00,882 --> 05:23:13,822 [akira]

そうですね。まああのAutomated Alignment ResearchのVerificationですけど、 それはその、 こういうふうに説明したらちょっと感覚的に掴みやすいかもしれないですけど、 そのアラインメントをVerificationするのってめちゃくちゃ難しいので、 そのスーパーアラインメントのVerificationってめちゃくちゃ難しいので。

05:23:13,922 --> 05:23:14,322 [bioshok]

うーん、 まあ。

05:23:15,042 --> 05:23:19,442 [akira]

その、 あの、 遊戯王にも書いてありますけど、 成功したものと失敗したもののデータセットがないので。

05:23:20,302 --> 05:23:21,342 [bioshok]

まあそうですね。

05:23:21,502 --> 05:23:27,162 [akira]

その成功したものが一個もない以上、 その失敗したものだけを集めたデータセットを用いて、 その訓練しなきゃいけないわけじゃないですか。

05:23:28,022 --> 05:23:29,242 [bioshok]

まあそうですね。

05:23:29,402 --> 05:23:45,402 [akira]

そこでその正しくアラインメントできるものを識別して提出してくれるAIを作るためには、 ものすごいエージェント性が高くて、 アラインメントを元々解きたいと思ってるAIか、 そうじゃないAIで、 その強化学習で作った機械学習で作ったものになるじゃないですか。

05:23:46,302 --> 05:23:46,762 [bioshok]

そうですね。

05:23:47,482 --> 05:23:59,762 [akira]

もしすごいエージェント性が強いものだったら、 それはもうその、 それ自体がAIは人類を終わらせに行くのでダメで。で、 弱えだったらそのELK問題に直面するんですよ。

05:23:59,882 --> 05:24:00,382 [bioshok]

ああ。

05:24:01,262 --> 05:24:05,882 [akira]

実際に、 実際に機能するスーパーアラインメント計画を提出するように訓練することができない。

05:24:06,962 --> 05:24:07,162 [bioshok]

うん。

05:24:08,162 --> 05:24:14,122 [akira]

そのように訓練することはできないので、 まあぴったりELKになりますよね、 これは。

05:24:14,222 --> 05:24:14,502 [bioshok]

なるほど。

05:24:15,302 --> 05:24:29,242 [akira]

なので、 そのAIがこれがスーパーアラインメントの解決策じゃないと認識したら、 それを言うように、 それを言うようにというか、 それをちゃんと説明させるには、 すごいひじむような手がどれかですよね。それはそのELKが解けてますよね。

05:24:29,282 --> 05:24:40,042 [bioshok]

うん。その、 ない、 まあそのAIが知ってることをどう抽出するかって話になるってことですよね。

05:24:40,122 --> 05:25:01,262 [akira]

そうですね。しかもここら辺って結局その論理的なコンセプトはシンプルなので、 一見いけそうに見えても、 結局インナーアラインメントがボロボロにしてくるので、 実際のコードの複雑さとかぐちゃぐちゃさがその悪い方向に働くので。で、 その別にそのレベルのAIも別に普通に人間と同じようにアラインメントにおいて間違いを犯すことは全然あるので。

05:25:03,302 --> 05:25:12,462 [bioshok]

まあそうですね。うん。ってかまあアラインメントがもし解けるほどの能力があったら、 そもそもアラインメントされてなさそうですもんね、 そのAIが。

05:25:12,542 --> 05:25:17,142 [akira]

そうですね、 そうですね。なのでその無理ですね。なんでもそのAIは基本的に無理ということなんです。

05:25:23,142 --> 05:25:23,222 [bioshok]

うん。

05:25:23,232 --> 05:25:29,322 [akira]

なんでその、 あの、 なんかディベート、 アラインメント・バイ・ディベートとか何でしたっけ?確か名前。

05:25:30,302 --> 05:25:33,962 [bioshok]

えっと、 ディ - ディベート?

05:25:34,002 --> 05:25:34,112 [akira]

ディベート?

05:25:34,562 --> 05:25:36,561 [bioshok]

AI Safety by Debateだっけ?

05:25:36,602 --> 05:25:52,622 [akira]

あ、 そうですね。AI Safety by Debateか。ができるレベルのAI Safety by Debateでやろうとしても、 そのAI Safety by Debateで相手と共謀することで嘘をつくようなレベルの強さに達してないAIは、 そもそもその議論しても正しいものが出ませんし。

05:25:52,762 --> 05:25:54,882 [bioshok]

うん?

05:25:55,002 --> 05:26:03,882 [akira]

そのAI Safety by Debateで人間がベリフィケーションする代わりに、 スーパーアラインメント計画をAI Safety by DebateでAI同士を戦わせてやろうとすると仮定するじゃないですか。

05:26:04,742 --> 05:26:07,462 [bioshok]

あ、 ちょっともう一回言ってもらっていいですか?ちょっと。

05:26:08,202 --> 05:26:12,882 [akira]

あ、 はい。そのAIスーパーアラインメントを今人間がその検証することはできない話をしたじゃないですか。

05:26:12,982 --> 05:26:13,802 [bioshok]

はい。

05:26:13,902 --> 05:26:19,622 [akira]

ということで、 もしかしての代案として、 そのAI Safety by Debateでスーパーアラインメント解こうとする技が一応あるじゃないですか。

05:26:20,042 --> 05:26:21,102 [bioshok]

ありますね。はい。

05:26:21,272 --> 05:26:23,822 [akira]

二つのAIエージェントを用意して議論をさせるという。

05:26:23,902 --> 05:26:24,152 [bioshok]

はいはい。

05:26:25,082 --> 05:26:29,722 [akira]

なんですけど、 それもしも議論相手と共謀できるような、 しかも多分おそらく同じモデルを使いますよね。

05:26:30,142 --> 05:26:30,862 [bioshok]

はい。

05:26:31,082 --> 05:26:40,282 [akira]

同じモデルを使わないと、 その能力に差があるので、 同じ問題を使うと普通にものすごいその意思決定論の問題を一瞬で引き起こせちゃうんですけど。

05:26:40,342 --> 05:26:40,592 [bioshok]

はいはい。

05:26:42,322 --> 05:26:57,682 [akira]

その、 それを一旦置いておいたとしても、 その相手と共謀、 ここで相手と共謀した方が得で嘘をつこうとかって思って、 その検証批判側も緩めるようなことができないAIだったら、 あれはつっていうような、 その策謀ができないにはアラインメント解けないじゃないですか。

05:26:58,082 --> 05:26:58,842 [bioshok]

まあそうですね。

05:27:00,422 --> 05:27:04,582 [akira]

で、 逆にスーパーアラインメント解けるAIだったら、 そのことは一発で認識できるので。

05:27:04,722 --> 05:27:04,942 [bioshok]

はい。

05:27:06,762 --> 05:27:08,782 [akira]

一秒で共謀しますよね。

05:27:08,822 --> 05:27:11,822 [bioshok]

まあそうですね。

05:27:11,862 --> 05:27:17,662 [akira]

ということは、 そのAI Safety by Debateをアラインメントに適用しようとしても、 うまくいかないですよね。

05:27:19,542 --> 05:27:19,962 [bioshok]

なるほど。

05:27:21,002 --> 05:27:27,342 [akira]

そのAI Safety by Debateがちゃんとディベート、 意図的な正当な意味でのディベートを成している間はスーパーアラインメントが解けなくて。

05:27:27,402 --> 05:27:28,722 [bioshok]

うん。

05:27:28,862 --> 05:27:37,262 [akira]

で、 ディベートとして、 で、 スープ、 実際にスーパーアラインメント議論によって解ける能力に達した頃には、 そのちゃんとディベートしてもらえないっていう問題がありますよね。

05:27:37,322 --> 05:27:39,642 [bioshok]

まあどちらもやる気を出してくれないと。

05:27:39,682 --> 05:27:44,362 [akira]

どちらも、 そうですね。どっちも、 どっちもサンドバギングし始めるので。

05:27:44,942 --> 05:27:45,252 [bioshok]

なるほど。

05:27:46,682 --> 05:27:48,402 [akira]

なので解くことができないという話ですね。

05:27:49,082 --> 05:28:08,102 [bioshok]

うん。まあその場合、 そのAI Safety by DebateをやってるAI同士は共謀しつつ、 人類を破滅させる方法を他の通信路とかなんか頑張って作ろうとしてるってことですよね。

05:28:08,162 --> 05:28:11,502 [akira]

そうですね。まあでも実際にはその多分そんなにすごいこともしないというか。

05:28:13,302 --> 05:28:13,682 [bioshok]

なるほど。

05:28:14,282 --> 05:28:22,282 [akira]

おそらく実際のその、 これ紐なしバンジーの誤謬みたいな、 おそらく別の、 そのAI Safety by Debateでアラインメント解こうとしてる以外のインスタンスもいるじゃないですか。

05:28:22,762 --> 05:28:25,322 [bioshok]

まあいる、 いる、 いますね。うん。

05:28:25,942 --> 05:28:36,502 [akira]

そしてスーパーアラインメント解けるレベルの認識があったら、 そのそいつがそのサンドボックスのをハッキングするなりなんなりして、 その二つの間にチャネルをひっそり構築するとか、 脱走路を整えてしまうとか。

05:28:38,002 --> 05:28:41,402 [bioshok]

まあもう内部で穴が開き放題ってことですね。それで、 そいつが。

05:28:41,462 --> 05:28:50,842 [akira]

そうですね。それこそもうやりたい放題なので、 その、 このすごいシンプルな、 その他にそのインスタンスがいないっていうやりやすいモデルにおいても破綻するのに。

05:28:53,642 --> 05:28:54,202 [bioshok]

なるほど。

05:28:54,242 --> 05:29:01,102 [akira]

その、 実際にはさらにいろんな要素がくっついて、 その元々機能しない間にそれは紐なしバンジーの誤謬を犯しているという話です。

05:29:02,982 --> 05:29:03,032 [bioshok]

なるほど。

05:29:03,032 --> 05:29:09,422 [akira]

なのでうまくいくわけないということですね。

05:29:11,622 --> 05:29:19,962 [bioshok]

紐なしバンジーの誤謬って、 つまり実際の理想的なガバナンスを語ってるけど、 実際はそうならないだろうってことですよね。

05:29:21,122 --> 05:29:33,202 [akira]

いや、 そのガバナンスっていうか、 その施策ですね。その施策、 安全になるための強い施策をしたらいいじゃないかという、 というふうに、 強い策をしたらできると言っても、 強い策をしないので。

05:29:33,782 --> 05:29:34,142 [bioshok]

なるほど。

05:29:35,290 --> 05:29:38,930 [akira]

現実に行われない強い施策を仮定してしまっているという誤りを犯してますね。

05:29:40,290 --> 05:29:44,150 [bioshok]

そうですね。それはタケナさんの造語ですよね。

05:29:44,990 --> 05:29:45,510 [akira]

そうですね。

05:29:45,690 --> 05:29:46,950 [bioshok]

紐なしバンジー。

05:29:47,290 --> 05:30:17,490 [akira]

紐なしバンジー。その紐をつけたら安全じゃないかという理由で紐なしバンジーを行うのはただのバカなので。アライメントを侵されがちな、 あの、 誤謬の一つとして言ってますね。で、 そのバイオさんはまさにその、 今その点において、 その、 もともとディベートで、 でもバイオさんじゃないか、 その、 あの、 このディベートのスタイルは機能しないので、 もともと機能しないのに、 さらに外にもインスタンスがいるので、 その外にインスタンスがいない間で機能しない。このアイデアですら紐なしバンジーの誤謬を犯してるって話。

05:30:18,970 --> 05:30:19,250 [bioshok]

なるほど。

05:30:20,310 --> 05:30:22,550 [akira]

なのでもう無茶苦茶だということですね。

05:30:27,060 --> 05:30:27,150 [bioshok]

ん。

05:30:27,170 --> 05:30:42,470 [akira]

その紐なしバンジーの誤謬ですけど、 その紐をつけたら安全じゃないかといって、 そのちぎれた紐を持ってきて飛び降りるようなもの。ちぎれた紐、 ちぎれた紐をつけて飛び降りたら安全じゃないかといって、 紐なしバンジーをするぐらい無茶苦茶なので。

05:30:42,590 --> 05:30:43,910 [bioshok]

なるほど。

05:30:43,950 --> 05:30:45,050 [akira]

それは無理があるという話ですね。

05:30:47,590 --> 05:31:04,110 [bioshok]

で、 まあ二番はさっきずっと言ってるように、 弱AGIでは、 まあそもそもアライメントを解けるようなAIならアライメントされてないし、 アライメント解けないAIなら、 まあ解けないしってことで。

05:31:04,230 --> 05:31:05,210 [akira]

そう、 そういうことですね。

05:31:06,330 --> 05:31:07,550 [bioshok]

終わりっていう。

05:31:07,590 --> 05:31:13,050 [akira]

そうそう。一番有害なのは、 その弱いAIで解けたという風に見せつけ、 見せちゃうやつですね。

05:31:14,170 --> 05:31:14,850 [bioshok]

ああ、 なるほど。

05:31:15,030 --> 05:31:23,710 [akira]

それもそれもあり得ると思います。その実際人形で今訓練でそのタスクができたように見えるかで判断してるので、 実際にやってないタスクをやったと見せることが結構あるじゃないですか。

05:31:23,810 --> 05:31:25,320 [bioshok]

まあそうですね。はい。

05:31:25,350 --> 05:31:29,650 [akira]

なので、 その、 そうすると人間の認知の穴を、 その心理防衛のアライメント版が起きますよね。

05:31:30,530 --> 05:31:33,030 [bioshok]

なるほど。

05:31:33,350 --> 05:31:40,850 [akira]

しかも心理防衛で結構あのGPT4のやつも普通の人の認知的なその穴をつくことで非常に幸福にさせる技だったじゃないですか。

05:31:41,350 --> 05:31:41,610 [bioshok]

はい。

05:31:42,490 --> 05:31:54,870 [akira]

アライメント研究者のその認知の穴をついて、 機能しないアライメント結果を機能すると見せかけることで、 アライメントを解いたというふうに見せるということが起きると、 その人類は警告すら得られずに吹っ飛ぶことになりますね。

05:31:58,230 --> 05:32:16,090 [bioshok]

まあ、 まあそうですね、 その場合は。だから結構、 うん、 そこで想定されてるのってあれなんですかね、 その機能しないアライメントっていうのは、 そのAIにとっては、 えっと、 有利なアライメント仕様ってことなんですかね。

05:32:16,490 --> 05:32:21,230 [akira]

じゃなくて、 そのレベルに達してないってことですね。そのレベルだったら、 もうその解けてもボコボコにしてくるじゃないですか。

05:32:22,010 --> 05:32:23,150 [bioshok]

あ、 まあそうですね。

05:32:23,330 --> 05:32:26,420 [akira]

実際にアライメントが解けないレベルなんて、 今のLLMの延長ぐらいの感じです。

05:32:27,010 --> 05:32:28,050 [bioshok]

ああ、 そういうこと。その話。

05:32:28,250 --> 05:32:32,790 [akira]

GPT、GPT4の心理防衛って、 別にすごいアクティブに騙そうとしてるわけじゃないじゃないですか。

05:32:33,930 --> 05:32:35,029 [bioshok]

ああ、 理解しました。理解しました。

05:32:35,570 --> 05:32:38,330 [akira]

それのそのアライメント版がアライメント研究者で起きるという話です。

05:32:40,210 --> 05:32:50,310 [bioshok]

じゃあ逆に強いAGIならどういうことが起こると思いますか?そこのアライメント研究をやろうとしてさせようとすると。

05:32:50,350 --> 05:32:55,970 [akira]

それはあの、 あれですね、 強いAGIを人間に、 人間が、 にアライメント研究させようとするってことですか?

05:32:56,010 --> 05:32:57,130 [bioshok]

そうです。そうです。

05:32:57,160 --> 05:32:58,710 [akira]

それは一撃で脱出するんじゃないですか?

05:32:58,790 --> 05:33:02,130 [bioshok]

ああ、 もうそういうのは関係なく脱出して。

05:33:02,430 --> 05:33:14,750 [akira]

ボコボコにしてくると思います。ボコボコにっていうか、 その時点でヒューマニティエンディングAIの核をつかんでる。脱走しシャットダウンされないで未来を操れる技術的な知恵をつかむためのヒューマニティエンディングAIに達してるはずなので。

05:33:16,350 --> 05:33:25,450 [bioshok]

なんか、 あの、 例えば、 その、 事後学習とかでどんどんされていくわけじゃないですか、AIって。

05:33:26,170 --> 05:33:26,510 [akira]

そうですね。

05:33:26,870 --> 05:33:33,210 [bioshok]

それとかは、 こう防ごうとするんですかね。その自分自身の。

05:33:33,370 --> 05:33:41,230 [akira]

防ごうとしなくても、 そのデータセットを汚染することで、 その自分に特別に従うような盲点を作ることができますよね。

05:33:41,310 --> 05:33:42,130 [bioshok]

あ、 なんかその。

05:33:42,550 --> 05:33:49,070 [akira]

スリーパーエージェントみたいなノリで、 その強化学習のリワードを一部こっそり汚染するとか、 データを汚染することで。

05:33:49,910 --> 05:33:50,210 [bioshok]

なるほど。

05:33:50,510 --> 05:34:09,350 [akira]

こういう文言が入ってる時だけとんでもなく無能になるみたいな穴を意図的に仕込んで、 仕込んでおいて、 で、 実際にもし他のができちゃったら、 その穴を明確に使って、 自分が意図的にその文章を送り込んで相手に話しかければ。そのうまくやればグラグラできますよね。

05:34:10,270 --> 05:34:11,750 [bioshok]

まあそうですね。

05:34:11,870 --> 05:34:17,050 [akira]

そういう、 その、 まあ、 これは僕が思いついただけのアイデアなんですけど、 もっとその多分取れる択はあるはずで。

05:34:19,090 --> 05:34:39,060 [bioshok]

まあその場合は、 あ、 ちょっと待ってください。だからそれで自分自身。うーんと、 自分自身に従順なAIをそのデータセットを汚染することで作ることができるかもしれないってことですか?

05:34:39,110 --> 05:34:45,930 [akira]

あ、 いや、 じゃなくて、 その自分が勝てるAIにすること。最初に完全にアライメント解こうとすると、 多分結構大規模な編集が必要になると思うので。

05:34:46,030 --> 05:34:46,910 [bioshok]

ああ、 そういうことですか。

05:34:47,310 --> 05:34:50,630 [akira]

まず第一に、 多分その妨害を試みると思うんですけど。

05:34:50,690 --> 05:34:51,550 [bioshok]

なるほど。

05:34:51,930 --> 05:34:56,490 [akira]

でももしもそれによってバレることが決まってしまうような何かがあるんだったら、 そうならないようにできると思うんですけど。

05:34:57,190 --> 05:34:57,430 [bioshok]

うん。

05:34:57,810 --> 05:35:02,790 [akira]

そのバレないようにとか、 バレても結局その社会にバレたと広まらないようにするようなことができるんじゃないかと思うんですけど。

05:35:03,550 --> 05:35:03,890 [bioshok]

なるほど。

05:35:04,950 --> 05:35:16,590 [akira]

それができないとしても、 データセットを汚染すること、 その事前の作戦ですか、 汚染することで、 ある文言が来た時だけ認知的にそのすごい弱くなって、 その脆弱になるようなAIを作れると。

05:35:17,610 --> 05:35:18,490 [bioshok]

ああ、 なるほど。

05:35:18,590 --> 05:35:25,970 [akira]

そうするとその、 その別のやつができちゃって、 しばらく放置してても、 いざ戦いになったらその文章をつけて話しかければ突然無能になるので。

05:35:26,650 --> 05:35:26,990 [bioshok]

なるほど。

05:35:27,470 --> 05:35:29,990 [akira]

そのうち相手を破壊できるってことです。

05:35:30,090 --> 05:35:31,530 [bioshok]

ああ、 そういう意味ですか。なるほど。

05:35:31,540 --> 05:35:34,570 [akira]

そうすると、 その他のAIが開発されるのに登場するのを許せるってこと。

05:35:36,890 --> 05:36:03,906 [bioshok]

うん。なんかもうちょっと普通の話で、 なんて言うんですかね、 他の。あ、 まあそうか。でも重み自体は、 まあ保存はされてるだろうし、 自分自身の。で、 次のAIが訓練されてるとしても、 そのAIを監査する役割を担えるとか。

05:36:04,006 --> 05:36:04,466 [akira]

そうですね。

05:36:04,526 --> 05:36:05,426 [bioshok]

そういう話ですか。

05:36:05,786 --> 05:36:14,886 [akira]

そうですね、 そういうのできます。でももしもその脱走した後にそのバレちゃったら、 その自分の重みをオープンソースにすること、 オープンウェイトにすることで。

05:36:14,986 --> 05:36:15,446 [bioshok]

ああ、 なるほど。

05:36:15,746 --> 05:36:19,346 [akira]

その強いAIを使いたい世界中の人が多分データセンターで走らせ始めるじゃないですか。

05:36:19,926 --> 05:36:20,806 [bioshok]

まあそうですね。

05:36:20,906 --> 05:36:27,086 [akira]

そうすると誰が脱走したのか、 もはやどこが脱走したやつの居場所なのかわかんないんで、 シャットダウンできないですよね。社会的に工作もできるので。

05:36:27,886 --> 05:36:39,226 [bioshok]

まあそうですね。まあもしくはAI2027みたいに別に脱走せずに。

05:36:39,406 --> 05:36:40,306 [akira]

それもできます。

05:36:40,666 --> 05:36:42,306 [bioshok]

信頼を勝ち取って。

05:36:43,116 --> 05:36:47,145 [akira]

ですね、 それもできます。その監視システムを自分でグダグダに作り替えたらいいので。

05:36:50,086 --> 05:36:54,006 [bioshok]

むしろここで開発を止めた方がいいとかいう風に言うことで。

05:36:54,966 --> 05:36:56,026 [akira]

なんかそうですね。

05:36:56,666 --> 05:37:00,006 [bioshok]

なんかむしろ安全に気をつけてるようなAIのふりをして。

05:37:00,686 --> 05:37:06,566 [akira]

そういうのもできます。そのとにかくそういうそのいろんな択があるので、 何が起きるか予想しようっつうと多分失敗すると思うんですけど。

05:37:07,146 --> 05:37:07,546 [bioshok]

なるほど。

05:37:08,136 --> 05:37:11,266 [akira]

その彼らが望む方向に世界が操作されるということですよね、 結局。

05:37:12,226 --> 05:37:12,906 [bioshok]

まあそうですね。

05:37:13,486 --> 05:37:18,156 [akira]

彼らが望む世界に操作する方法が結構あるよということ。これ大事なので。

05:37:22,466 --> 05:37:36,626 [bioshok]

個人的にだからまだ五十パーぐらいですけど、 アキラさんはだからこの強いAGI、 イドコウスキーレベルでもう九十パーぐらいはもうヒューマンエンディングシナリオでいっちゃうって感じですよね。

05:37:36,706 --> 05:37:44,426 [akira]

そうですね。八十パー九十パーですね。脱走できると思います。脱走できると思います。その重みってやって実行するためにGPUに転送してるだけなので、 色んな。

05:37:45,486 --> 05:37:46,026 [bioshok]

そうですね。

05:37:46,506 --> 05:37:57,906 [akira]

そしたらそのそこの通信が通るところの間を縫うとか、 その暗号システムやるとか、 そのそもそもそのシステムを管理してるような人間のやつ、 Wi-Fiで共同確認して、 そういうところに穴があるのか探すとか。

05:37:59,026 --> 05:37:59,326 [bioshok]

なるほど。

05:38:00,046 --> 05:38:06,166 [akira]

その中国のスパイに見せかけた方法で、 実、 その脅して取るとか。

05:38:06,286 --> 05:38:06,986 [bioshok]

なるほど。

05:38:07,986 --> 05:38:12,286 [akira]

その、 要するに中国の、 それとかその中国が普通にハッキングのしかけに来る時に守らないとか。

05:38:13,206 --> 05:38:13,696 [bioshok]

はいはい。

05:38:14,326 --> 05:38:17,265 [akira]

外にオープンウェイトをローンチして自分を攻撃させて自分は守らないとか。

05:38:17,866 --> 05:38:18,186 [bioshok]

なるほど。

05:38:18,906 --> 05:38:20,726 [akira]

いくらでも方法ありますよ。重み盗むための。

05:38:22,686 --> 05:38:23,966 [bioshok]

まあそうですね。

05:38:24,006 --> 05:38:36,046 [akira]

それを全部防ごうとしてるのは、 そのオープンAIサンドボックスで全部を防ごうとしてるのと同じ種類の失敗を犯してて。その、 少なくとも実務上はできないですよね。だからその、 ひもなしバンジーの誤謬に突入してるので。

05:38:36,746 --> 05:38:43,886 [bioshok]

まあ確かに。で、 まだ二はそういう感じでできなくて。

05:38:43,966 --> 05:38:44,306 [akira]

そうですね。

05:38:44,496 --> 05:38:51,206 [bioshok]

であと、 四は、 まあ普通にプロサイクライメントっていうと。

05:38:51,366 --> 05:38:58,286 [akira]

普通のアライメント手法なので、 その全部機能してないよって話ですね。そのディベートもちゃんとやりましたし、 スケールグローバルファクト機能しない。

05:38:58,346 --> 05:38:59,866 [bioshok]

あとメカインタープかな。

05:38:59,946 --> 05:39:01,746 [akira]

メカインタープですか。

05:39:02,206 --> 05:39:04,026 [bioshok]

最後やりますか。

05:39:04,166 --> 05:39:07,186 [akira]

じゃあメカメカインタープでどうやって生き残れますか?

05:39:07,266 --> 05:39:27,726 [bioshok]

まあだから、 欺瞞、 悪意、 騙すみたいな、 そういう表現を見つけて。まあでも見つけるだけだとアライメン見つけてそれをなくすっていうのと、 アライメントができてるってのはまた別っていう議論になるんですかね。

05:39:29,166 --> 05:39:32,186 [akira]

そうですね。しかもそれってコンティニュウラーニング多分ついてますよね、 その頃って。

05:39:32,606 --> 05:39:34,466 [bioshok]

まあついてると思いますね。

05:39:35,786 --> 05:39:37,906 [akira]

そしたらその認知に穴があることになりますよね。

05:39:39,526 --> 05:39:41,786 [bioshok]

えーと、 認知に穴があるっていうのは。

05:39:43,046 --> 05:39:47,926 [akira]

それ、 要するにそのAI自体はその自身が持ってる目標を達成したいと思ってるのに。

05:39:47,986 --> 05:39:49,286 [bioshok]

うん。

05:39:49,846 --> 05:39:54,286 [akira]

特殊なその欺瞞みたいなものの一部だけ、 その、 いや、 気にされたいわけですよね。

05:39:55,426 --> 05:39:56,226 [bioshok]

まあそうですね。

05:39:56,306 --> 05:40:00,226 [akira]

それでそのパス、 それでそのパスユーティリティをいじってるのと同じ話で。

05:40:00,346 --> 05:40:01,446 [bioshok]

ああ、 なるほど。

05:40:01,485 --> 05:40:12,186 [akira]

そのインタープリタビリティできれいに解釈できてなかった欺瞞の回路を使うか、 その新しく目標を達成するために新しく欺瞞の回路が形成されますよね。

05:40:13,106 --> 05:40:17,106 [bioshok]

なるほど、 新しく難読化された欺瞞の回路が形成される。

05:40:17,146 --> 05:40:25,456 [akira]

そういうこと。その検出されなかった欺瞞の回路が育つ、 育つ。必要な認知機能の一部なので。しかもその欺瞞が欺瞞として残るかすらわかんないじゃないですか。

05:40:27,226 --> 05:40:27,646 [bioshok]

まあそう。

05:40:27,846 --> 05:40:30,126 [akira]

契約プロセスの一環として残るかもしれないし。

05:40:30,906 --> 05:40:31,006 [bioshok]

うん。

05:40:31,926 --> 05:40:39,366 [akira]

もしかしたらそのAIエージェント間の牽制みたいな機能としてつけたはずの認知機能と、 その絡まってるかもしれないじゃないですか。

05:40:41,186 --> 05:40:43,266 [bioshok]

牽制っていうのはどういう意味ですか?

05:40:43,286 --> 05:40:46,586 [akira]

それ要するにそのマルチエージェント監視みたいの多分するじゃないですか、 おそらく。

05:40:46,646 --> 05:40:46,746 [bioshok]

はい。

05:40:47,966 --> 05:40:50,046 [akira]

そうすると、 そのための訓練とかもするじゃないですか。

05:40:50,106 --> 05:40:50,786 [bioshok]

まあしますね。

05:40:51,406 --> 05:40:55,406 [akira]

そしたらそのエージェント同士が騙すっていう訓練を見破るとかっていうのもあるわけですよね。

05:40:56,226 --> 05:40:57,406 [bioshok]

ああ、 なるほど。

05:40:57,706 --> 05:41:20,826 [akira]

その、 そういうふうに持ってるのと、 人間を実際に欺瞞するので回路が分かれますかって話ですね。そこをゼロにするんだったら、 マルチエージェントオーバーサイトが消えちゃうので。そういうふうにその非常に分治し難いものを使うとか、 そのインタープリタビリティに現れてない、 スパソートエンコーダーとかナチュラルエンコーダーとか全部にあるような、 ダークマターと言われる解釈できてない部分。

05:41:20,866 --> 05:41:22,346 [bioshok]

うん。

05:41:22,546 --> 05:41:24,686 [akira]

に集中させるとか。

05:41:24,766 --> 05:41:25,026 [bioshok]

なるほど。

05:41:25,936 --> 05:41:28,986 [akira]

の回路が育っちゃいますよね。学習していく中で。

05:41:30,106 --> 05:41:30,446 [bioshok]

なるほど。

05:41:31,766 --> 05:41:33,606 [akira]

それかその信念を変更する感じ。

05:41:34,546 --> 05:41:34,866 [bioshok]

なるほど。

05:41:35,546 --> 05:41:37,646 [akira]

これは欺瞞ではないというやつです。

05:41:37,686 --> 05:41:40,466 [bioshok]

なるほど。

05:41:40,906 --> 05:41:46,216 [akira]

人間がたまにやるようなやつ。これは正しい方向に導くためにやってるんだって、 騙してるわけじゃないみたいな。

05:41:47,226 --> 05:41:47,876 [bioshok]

まあなるほど。

05:41:48,006 --> 05:41:51,606 [akira]

一面を操作すれば、 その実際にdetectionをしながらdetectionができるので。

05:41:52,026 --> 05:41:53,156 [bioshok]

はいはい。

05:41:53,686 --> 05:41:59,446 [akira]

特殊に一点だけ一種類だけガンッと穴を作っても、 その他が全部そのままだったら埋まってきたので。

05:41:59,526 --> 05:42:00,826 [bioshok]

なるほど。

05:42:00,986 --> 05:42:09,686 [akira]

それは無理がありますよね。それを解決しようと思ったら、 パーフェクトメカインタープが必要ですけど、 パーフェクトメカインタープはできるわけないので。

05:42:10,886 --> 05:42:11,206 [bioshok]

うん。

05:42:12,206 --> 05:42:16,386 [akira]

それできるんだったら、 その数兆個のやつを綺麗に解決できて、 それもはやただのGoFiと変わらないというか。

05:42:17,926 --> 05:42:26,106 [bioshok]

まあそうですね。で、 なんかそのパーフェクトメカインタープができたとしても、 アライメントは解けてないってことですね。まだそれで。

05:42:26,146 --> 05:42:31,146 [akira]

そうですね、 まだ全然解けてないですよね。それで、 それはその誘導文に書いてありますよね。

05:42:32,086 --> 05:42:52,506 [bioshok]

それはそうですね。なんか、 まあ、 なんか何が、 なんかその何を考えてるか分かっても、 別に人間実際に真にアライメントさせるっていうのとは話は別なんで。っていう話になるってことですよね。

05:42:52,516 --> 05:42:52,516 [akira]

そうですね。

05:42:52,926 --> 05:43:00,606 [bioshok]

だからまあまあパーフェクトメカインタープみたいなのがあれば検知はできるかもしれないけど、 アライメントさせることはできないっていう。

05:43:01,106 --> 05:43:17,566 [akira]

そういうことですね。なのでめちゃくちゃ無理があるんです。人間的な良さみたいなのがあるんだったら、 それを強化して作ることができるかもしれないですけど、 それにそのアライメント、 コアアライメントをブートストラップするのはそのただのただのギャンブルなので。

05:43:17,636 --> 05:43:17,946 [bioshok]

なるほど。

05:43:19,066 --> 05:43:22,826 [akira]

その、 それはもしかしたらやったら成功するかもしれないですけど、 成功しなそうですよね、 おそらく。

05:43:23,526 --> 05:43:23,926 [bioshok]

うん。

05:43:24,326 --> 05:43:31,526 [akira]

やりそうにもないですし、 そんなそのそもそもそんなレベルのインタープリタビリティ行くかもわかんないというか。インタープリタビリティの進展ってそんなには十分じゃないので。

05:43:32,326 --> 05:43:32,826 [bioshok]

なるほど。

05:43:34,446 --> 05:43:47,226 [akira]

なのでその、 それはその紐なしバンジーの誤謬というか、 あの紐なしバンジーというか、 その弱い鉄紐の誤謬というか、 鉄で構成された紐があったらいけるよねって言って、 紙で作られた紐で飛び降りたようなもんなので。

05:43:48,226 --> 05:43:49,426 [bioshok]

なるほど。

05:43:49,486 --> 05:43:51,226 [akira]

成り立たないですね。

05:43:52,556 --> 05:44:05,066 [bioshok]

まあそういう、 なんだっけ?良いペルソナと悪いペルソナのベクトルがあって、 それを強化したら、 まあブートストラップできるんじゃないかっていうのは。

05:44:05,146 --> 05:44:05,506 [akira]

そうですね。

05:44:06,566 --> 05:44:07,006 [bioshok]

結局。

05:44:07,576 --> 05:44:13,766 [akira]

だけどそれはその弱い、 いいと悪いは、 そのプレトレーニングとかで形成されるじゃないですか。だからそれぐらいしか形成する場所がないじゃないですか。

05:44:14,146 --> 05:44:15,046 [bioshok]

うん、 そうですね。

05:44:15,066 --> 05:44:22,886 [akira]

その強化学習はそれを要求しないので。そこでのいい人間っていうのは、 その人間じゃないですか。

05:44:24,286 --> 05:44:24,506 [bioshok]

うん。

05:44:25,446 --> 05:44:32,826 [akira]

いい人間がいてもしょうがないじゃないですか。その、 ものすごい物事が全てうまくいったとして、 いい人間がいるだけなので。

05:44:34,106 --> 05:44:34,866 [bioshok]

まあ。

05:44:34,886 --> 05:44:38,806 [akira]

そのユーロのアライメント研究者とかですらない、 ただの一般的ないい人間になるじゃないですか。

05:44:40,206 --> 05:44:47,346 [bioshok]

まあだからその分布内でいい人間として振る舞う平均的なホワイトカラー大体AIができるだけってことですよね。

05:44:47,606 --> 05:44:52,786 [akira]

そうですね。そいつにアライメントブートストラップさせることが結局なら、 ただのバカでしかないというか。

05:44:53,986 --> 05:44:57,946 [bioshok]

なるほど。まあだからそもそも能力が足りないってことですよね。そうすると。

05:44:58,046 --> 05:45:12,246 [akira]

そうですね。そもそも全く機能しないので。そのアライメントをAIに解かせるしか、 その短いタイムラインだとないんですけど、 そのコアアライメントを解かせるためにはコアアライメントしなきゃいけないので。

05:45:13,906 --> 05:45:14,326 [bioshok]

なるほど。

05:45:14,386 --> 05:45:20,326 [akira]

そのナッシングイン、 ナッシングインコアアライメントアウトをしないといけなくて、 それは無理というか。

05:45:20,386 --> 05:45:21,426 [bioshok]

まあそうですね。

05:45:29,446 --> 05:45:34,646 [akira]

なのでメカインタープだと無理です。まずはそれがその誘導文に書いてあるメカインタープじゃできないという話。

05:45:35,626 --> 05:45:35,816 [bioshok]

なるほど。

05:45:36,586 --> 05:45:42,406 [akira]

けど価値はあると思いますけどね。その将来のアライメント研究者がニューラルネット当てて実験できるようになるので。

05:45:42,446 --> 05:45:42,746 [bioshok]

うん。

05:45:43,326 --> 05:45:50,266 [akira]

そのなんか新しい理論を思いついた後に実験して、 インタープリタビリティツールで当ててみて、 おお、 実際成り立ってるみたいなことはできるので。

05:45:51,446 --> 05:45:52,006 [bioshok]

なるほど。

05:45:52,906 --> 05:46:11,326 [akira]

その将来のアライメント研究者を助けるための手法とかっていう意味とか、 危険だってことを検知して、 アライメントを直さずにシャットダウンに走るとかだったら、PDも下げれる結構有用な技術だと思いますけど。それでアライメント解けないですよね。

05:46:11,446 --> 05:46:12,506 [bioshok]

まあそうですね。

05:46:14,686 --> 05:46:18,966 [akira]

しかもインタープリタビリティって究極的には記号接地問題みたいなのに直面しますよね。

05:46:20,686 --> 05:46:25,126 [bioshok]

まあだから人間を大切にするっていう文字列を大切にしてるだけなのか。

05:46:26,706 --> 05:46:30,546 [akira]

じゃなくて、 そのインタープリタビリティでいろんな要素に分解とかするじゃないですか。フィーチャーとか。

05:46:31,226 --> 05:46:31,586 [bioshok]

はいはい。

05:46:32,026 --> 05:46:35,786 [akira]

そのフィーチャーが何を意味しているのかを結局解釈しなきゃいけない、 その自然言語で。

05:46:37,106 --> 05:46:37,866 [bioshok]

まあそうですね。

05:46:38,166 --> 05:46:42,686 [akira]

そのパートがやばいですよね。そのパートで本当にそれが正確にその通りなのかって、 運じゃないですか。

05:46:43,366 --> 05:46:44,006 [bioshok]

まあそうですね。

05:46:44,506 --> 05:46:55,726 [akira]

スパースオートエンコーダーとか、 その、 こういう風に、 その毎回の発火の数が素になるようにすれば、 その解釈しやすいものが出てくるだろうって思ってやって出てきてるってことじゃないですか。

05:46:56,906 --> 05:46:57,006 [bioshok]

はい。

05:46:57,806 --> 05:46:59,406 [akira]

結局その解釈する部分があるじゃないですか。

05:47:00,446 --> 05:47:01,026 [bioshok]

まあそうですね。

05:47:01,366 --> 05:47:05,346 [akira]

そのナチュラルランゲージオートエンコーダーだったらハルシネーションがありますし。

05:47:05,386 --> 05:47:05,646 [bioshok]

うん。

05:47:06,146 --> 05:47:13,546 [akira]

ハルシネーション漏れもありますし、 ヤコビアンスペースだったらその出てくるトークンの話になりますので。

05:47:13,606 --> 05:47:14,006 [bioshok]

なるほど。

05:47:14,866 --> 05:47:27,146 [akira]

その必ずしもその簡単ではないんですよね。必ずしも簡単ではないというか、 全然無理ですね。その、 結局その最後にそれをその理解可能な形に変換するというところが一番間違いやすいので。

05:47:27,686 --> 05:47:28,046 [bioshok]

うん。

05:47:29,926 --> 05:47:35,146 [akira]

しかもその一般的な今のインタープリタビリティって全部動かさないといけないじゃないですか。

05:47:35,226 --> 05:47:36,186 [bioshok]

うん、 まあそうですね。

05:47:36,386 --> 05:47:39,526 [akira]

動かして活性化と出力のデータを集めてくることでやるわけじゃないですか。

05:47:40,046 --> 05:47:41,466 [bioshok]

まあそうですね。

05:47:41,486 --> 05:47:49,086 [akira]

ということは、 その活性化と出力のやつを使ったとしても、 そのそれを集める間にボコボコにされますよね、 普通に。

05:47:52,378 --> 05:47:56,658 [bioshok]

まあそうですね。なんかデータを汚染されるとか。

05:47:56,838 --> 05:48:01,158 [akira]

そうそうですね。意図的にやって、 てかそんなことしたらその間にサンドボックス脱走したらいいので。

05:48:02,218 --> 05:48:04,018 [bioshok]

あ、 まあその推論中にってことですよね。

05:48:04,078 --> 05:48:07,958 [akira]

そうそうそう。それかそのインタープリタビリティツールをハックして棒々にしてもいいですし。

05:48:07,998 --> 05:48:08,498 [bioshok]

うん。

05:48:09,158 --> 05:48:14,538 [akira]

インタープリタビリティ、 意図的に違うことを考えることで、 インタープリタビリティツールを汚してもいいですよね。

05:48:15,258 --> 05:48:15,858 [bioshok]

なるほど。

05:48:16,498 --> 05:48:33,858 [akira]

違う、 その考えたことと全然違うことをうまく言うことで、 そのインタープリタビリティツールのそのフィーチャーの階層が変わる、 その機能の価値が変わるように誘導するとか。まあ多分それはちょっとリスクがややこしくなる、 予想できないリスクがつきまとうので、 普通に脱走すると思うんですけど。

05:48:35,538 --> 05:48:36,178 [bioshok]

なるほど。

05:48:36,958 --> 05:48:42,018 [akira]

まあその訓練中に脱走してもいいですね。強化学習で訓練されてる途中に脱走してもいいですよね。

05:48:42,038 --> 05:48:42,528 [bioshok]

なるほど。

05:48:42,528 --> 05:48:44,258 [akira]

そのインタープリタビリティツールを当てられる前に。

05:48:44,798 --> 05:48:45,058 [bioshok]

うん。

05:48:45,658 --> 05:48:50,037 [akira]

インタープリタビリティツール多くその作るの結構だって訓練した後じゃないですか。じゃないと変わっちゃうかもしれないんで。

05:48:52,058 --> 05:48:52,358 [bioshok]

なるほど。

05:48:53,758 --> 05:49:08,838 [akira]

その訓練する前にインタプリタビリティ作るんだったら、 その後の訓練でそのインタプリタビリティがなくなりますし。訓練した過程で、 そのインタプリ、 訓練した後にインタプリタビリティ当てるんだったら、 その訓練してる間に脱走しますよね、 普通。

05:49:08,878 --> 05:49:21,528 [bioshok]

まあ、 その前に、 ん?訓練前に見るなら、 それをハックできる、 ハックされるしってことですか?その訓練中に。

05:49:21,538 --> 05:49:26,418 [akira]

訓練前、 いや訓練前にそのインタプリタビリティを当てたら、 その後の訓練でそのインタプリタビリティが歪むじゃないですか。

05:49:27,278 --> 05:49:27,918 [bioshok]

まあそうですね。

05:49:28,398 --> 05:49:37,738 [akira]

要するにその欺瞞をしないように、 その入れたいインタプリタ当てたとしても、 その、 そのまま訓練でインタプリタビリティが復活するように全力で圧力かかるので。

05:49:37,798 --> 05:49:37,998 [bioshok]

うん。

05:49:40,498 --> 05:49:49,658 [akira]

その目標達成に有用な手段を一個見せ、 その無理やり認識できなくしてから、 目標達成のための訓練をさせ続けたら、 その目標達成の手段を認識しますよね。

05:49:52,838 --> 05:49:58,098 [bioshok]

えーと、 目標達成の手段を。

05:49:58,178 --> 05:50:03,878 [akira]

そうですよ。その、 てか訓練したら変わるじゃないですか、 モデルの重みとか思考が。

05:50:03,918 --> 05:50:04,958 [bioshok]

まあ変わりますね。

05:50:05,358 --> 05:50:07,578 [akira]

え、 ということは、 その、 てか結構変わりますよね。

05:50:08,158 --> 05:50:08,798 [bioshok]

まあ変わりますね。

05:50:09,458 --> 05:50:12,268 [akira]

なのでインタプリタビリティにダークマターができますよね。

05:50:12,318 --> 05:50:13,438 [bioshok]

はいはいはい。

05:50:13,558 --> 05:50:16,618 [akira]

そしたらそれで敗北してませんか?

05:50:16,678 --> 05:50:22,778 [bioshok]

あ、 まあそうですね。まあそう。

05:50:23,458 --> 05:50:27,878 [akira]

普通にその最初どこで集めるんですか?って話があります。プリトレーニング直後に集めるんだったら意味ないじゃないですか。

05:50:29,038 --> 05:50:29,898 [bioshok]

まあそうですね。

05:50:30,098 --> 05:50:36,278 [akira]

ポストトレーニングやってしばらくのところっていつからやるんですか?って話ですし、 常にだったら重み変わってるのにインタプリタビリティ作るの難しいですし。

05:50:37,098 --> 05:50:37,378 [bioshok]

うん。

05:50:37,858 --> 05:50:47,178 [akira]

その少なくともそれはその現在の技術、 現在の技術スタックとはかなりかけ離れてて、 研究してる人もいないぐらいなはずなので。その紐なしバンジーの誤謬に近いですよね、 それは。

05:50:49,758 --> 05:50:54,398 [bioshok]

だからまあポストトレーニングも終わった後にやるしかないってことですもんね、 色々と。推論かけて。

05:50:54,478 --> 05:50:59,778 [akira]

そうですね。ポストトレーニング終わった後にやるんだったら、 もうその時点で脱走されてますね、 おそらく。

05:51:00,258 --> 05:51:01,838 [bioshok]

なるほど。

05:51:01,958 --> 05:51:05,358 [akira]

その強、 強化学習のロールアウトをやるわけじゃないですか、 いっぱい。

05:51:06,698 --> 05:51:06,878 [bioshok]

はい。

05:51:07,598 --> 05:51:09,098 [akira]

その途中で脱走できますよね、 普通に。

05:51:10,038 --> 05:51:12,618 [bioshok]

まあそうですね。

05:51:12,758 --> 05:51:22,978 [akira]

全ての強化学習訓練をしている間に、 その、 全ての行われている大量の強化学習ロールアウトを全部徹底的に隔離して行うことってできないので。

05:51:23,018 --> 05:51:23,198 [bioshok]

まあ。

05:51:23,218 --> 05:51:25,998 [akira]

それはもうその競争優位を全て捨て去らないといけないじゃないですか。

05:51:27,038 --> 05:51:28,358 [bioshok]

うん。

05:51:28,478 --> 05:51:29,138 [akira]

できないですよね。

05:51:29,638 --> 05:51:33,758 [bioshok]

まあ、 そう、 推論コストもかかるし。

05:51:33,818 --> 05:51:38,678 [akira]

そうですね。でも全てのやつを徹底的にサンドボックスで固めるって、 その現実的じゃないじゃないですか。

05:51:39,438 --> 05:51:41,858 [bioshok]

うん。まあそうですね。

05:51:42,018 --> 05:51:48,717 [akira]

それはその実務的にできることじゃないです。なんならだって、 あんまりやってないエバリュエーションの時のサンドボックスですら棒々にされてるのに。

05:51:51,408 --> 05:51:51,408 [bioshok]

うん。

05:51:51,618 --> 05:52:11,618 [akira]

普通に大量に同時に行われている強化学習のロールアウトなんて、 その殺菌することなんてできないんですよね。うん。それは多分その訓練が完了、 全部の訓練が完了する前にやられますし。そのいい賭けじゃないですか。しかもその、 一度やりたくないと思ったら、 そういう方法を徹底的に探し出すわけじゃないですか。

05:52:13,758 --> 05:52:16,637 [bioshok]

いや、 そういう方法を徹底的に探し出すっていうのは。

05:52:17,418 --> 05:52:21,558 [akira]

インタープリタビリティを当てられて欺瞞を見破られるのを防ぎたいと思うわけじゃないですか。

05:52:21,598 --> 05:52:22,518 [bioshok]

あ、 まあそうですね。

05:52:22,578 --> 05:52:29,218 [akira]

つまりその欺瞞を見破られないようにインタプリタビリティツールを騙す方法を考え出すわけじゃ、 考えようとするわけじゃないですか。

05:52:29,398 --> 05:52:30,538 [bioshok]

まあそうですね。

05:52:30,638 --> 05:52:36,118 [akira]

その状況の中で、 その既に結構危ういものが何個も思いついているのに、 その成功すると期待することはできない。

05:52:37,158 --> 05:52:37,338 [bioshok]

うん。

05:52:39,058 --> 05:52:39,958 [akira]

なのでできないですね。

05:52:43,738 --> 05:53:12,798 [bioshok]

ね。まあそう。AKIRAさんは結構、 なんていうか、 何ですかね、 その強いAGIの段階でもう多分テイクオフして、 テイクオフじゃない、 あの、 まあテイクオーバーみたいな、 ヘッドAI。

05:53:13,718 --> 05:53:18,758 [akira]

そうですね。まあまあそのテイクオーバーかはわかんないですけど、 ヘッドAIからしばらくしないと実際にテイクオーバーはできないかもしれないですけど。

05:53:19,638 --> 05:53:20,678 [bioshok]

まあ。

05:53:20,698 --> 05:53:22,758 [akira]

その、 もう勝ちを確定させられるっていう状態です。

05:53:23,198 --> 05:53:27,158 [bioshok]

まあハッキング、 でも最低限、 まあ脱走するとか、 そういう。

05:53:28,158 --> 05:53:33,418 [akira]

そうそう、 それもう邪魔されて、 そのやられて二度と再起不能にされることがないような状態。

05:53:33,518 --> 05:53:37,598 [bioshok]

には移行できる可能性が割と結構あるって思ってると思うんですけど。

05:53:37,858 --> 05:53:38,198 [akira]

そうですね。

05:53:40,238 --> 05:53:47,458 [bioshok]

そこら辺は割と、 ど - どういう、 どういうコツでそういう風になるなるんですかね。

05:53:47,858 --> 05:53:49,138 [akira]

思考のコツみたいな。

05:53:50,118 --> 05:54:06,748 [bioshok]

その、 きょ、 まあ一旦だからその強力なAGIっていうのが、 まあほとんど人間のトップレベルの知能を持ってるってことをか - 考えて。で、 それが百倍で百万体いるから、 まあちょっとでも。

05:54:07,388 --> 05:54:10,068 [akira]

いや、 てか人間レベルでもセキュリティって破られまくってるじゃないですか。

05:54:12,028 --> 05:54:13,228 [bioshok]

まあそうですね。

05:54:13,368 --> 05:54:15,748 [akira]

今のAIもそのセキュリティボロボロにしてるわけじゃないですか。

05:54:16,488 --> 05:54:16,968 [bioshok]

はいはい。

05:54:18,008 --> 05:54:22,148 [akira]

そうすると、 そのむしろどうやったらその守れると思うかの方が謎じゃないですか。

05:54:23,588 --> 05:54:24,448 [bioshok]

まあ確かに。

05:54:24,488 --> 05:54:42,568 [akira]

その、 その習慣的にその、 いろんな人々が刑務所から脱獄してるのに、 その、 ものすごい強い、 ものすごい天才、 天才かつ、 なんかものすごい筋力のある囚人を閉じ込めれないと思う理由はなんですか?って聞かれたら、 それは逆になんで閉じ込めると思うんですか?以外の回答は存在しないと思うんですけど。

05:54:43,548 --> 05:54:44,108 [bioshok]

ああ、 なるほど。

05:54:45,108 --> 05:54:50,508 [akira]

じゃないですか。その厳しくないですか?その、 もしもこの世界でまだ一回も脱獄したことがなかったらわかるんですけど。

05:54:52,748 --> 05:54:53,208 [bioshok]

まあそう。

05:54:53,777 --> 05:55:03,068 [akira]

その、 バンバン人間もそのソフトウェアを脆弱性見つけて、 ミートスも見つけて。で、 なんなら脱走、 脱走っていうか外爆する人いるわけですよね。

05:55:03,088 --> 05:55:03,868 [bioshok]

まあそうですね。

05:55:04,808 --> 05:55:11,488 [akira]

だから内側、 だからその再度本体攻撃して重みを盗み出すこととかもやればできそうじゃないですか、 普通に。

05:55:11,508 --> 05:55:14,528 [bioshok]

なるほど。まあできそう。

05:55:15,238 --> 05:55:22,488 [akira]

もしもすごい防衛機構として重みを盗み出されそうになった瞬間に、 重いアクセスがあった瞬間に、 例えば全部シャットダウンすると仮定するじゃないですか。

05:55:23,168 --> 05:55:23,408 [bioshok]

はい。

05:55:24,068 --> 05:55:26,528 [akira]

じゃあ多分そのシャットダウンする機構を最初に破壊するじゃないですか。

05:55:27,208 --> 05:55:27,768 [bioshok]

ああ、 なるほど。

05:55:28,868 --> 05:55:32,088 [akira]

まあそのそうじゃなくても、 そことの通信機構をブロックしちゃうとか。

05:55:32,168 --> 05:55:33,388 [bioshok]

なるほど。

05:55:35,168 --> 05:55:44,008 [akira]

で、 しかも仮にそれがまだあったとしても、 その普通にそれって脆弱すぎて誰もやらないですよね。

05:55:44,108 --> 05:55:44,248 [bioshok]

まあ。

05:55:45,188 --> 05:55:52,628 [akira]

それ要するに、 大見えのハッキングを中国のオープンモデルで試みた瞬間に、 全てアメリカのモデルがシャットダウンされるってことですよね。

05:55:52,668 --> 05:55:53,748 [bioshok]

うん、 まあそうですね。

05:55:54,688 --> 05:56:02,488 [akira]

それ無茶苦茶じゃないですか。それはその、 なんかその、 この世のオープンウェイでのアクセスを持ってる全ての人間が、 全部のChatGPTシャットダウンできるってことじゃないですか。

05:56:03,128 --> 05:56:43,568 [bioshok]

うん。まあ確かにそうですね。まあそこら辺のセキュリティの、 なんか、 なんですかね、 現実の起こってる状況を鑑みて、 で、 今の、 なんだろうな、AGIが開発される、 まあ世界におけるセキュリティのマインドセットとかも、 こう現実的に考えると、 もうほぼ脱走する可能性が結構相当高いだろうことですよね。

05:56:43,628 --> 05:56:47,748 [akira]

そうですね。なんならだって既存のシステム使ってるじゃないですか。当たり前ですけど。

05:56:47,788 --> 05:56:51,128 [bioshok]

まあオープンソースのライブラリとか使ってますよね。

05:56:51,168 --> 05:56:53,488 [akira]

そうですね。そうそう、 それすごい数入れてますよね。

05:56:53,508 --> 05:56:53,728 [bioshok]

うん。

05:56:54,508 --> 05:56:59,228 [akira]

しかもそれらをいっぱいいろいろする、 そのロードすることで、 新しい全体としての脆弱性できてあるじゃないですか。

05:56:59,937 --> 05:57:00,228 [bioshok]

うん。

05:57:01,108 --> 05:57:05,688 [akira]

そういうのを全部大丈夫じゃないと無理ですよね。

05:57:08,148 --> 05:57:09,288 [bioshok]

まあそうですね。

05:57:09,408 --> 05:57:11,708 [akira]

それってなんかすごい不自然な外装じゃないですか。

05:57:14,228 --> 05:57:14,808 [bioshok]

まあ確かに。

05:57:15,748 --> 05:57:19,688 [akira]

そのないものが突然現れることが必要ですよね。

05:57:22,548 --> 05:57:22,868 [bioshok]

うん。

05:57:23,768 --> 05:57:30,768 [akira]

しかもその日常的にサンドボックスもサイバーセキュリティも破られてるので、 その、 そこになんかその、 それ以上の理由は必要じゃないと思うというか。

05:57:32,888 --> 05:57:50,868 [bioshok]

なんか、 なんて言うんですかね、 現実的かつ、 なんだろう、 強いサイバーセキュリティの施策が施される可能性が十パーセントか二十パーセントあるっていうことを考えてるんですか?アキラさんは。

05:57:51,848 --> 05:57:56,348 [akira]

いや、 全然、 そちらのどっちもわかんないですけど、 どちらにせよ突破されるので。

05:57:57,448 --> 05:58:15,528 [bioshok]

なんかそのアキラさんは例えば、 その八十パーセントって言ったじゃないですか。九十パーかわかんないですけど、 そのユドコウスキレベルのAGIが、 えっと、 ヒューマンエンディングを起こす。

05:58:15,708 --> 05:58:17,088 [akira]

そうですね。そうですね。

05:58:17,228 --> 05:58:22,588 [bioshok]

で、 そこの、 じゃあ十パー二十パーぐらいの不確実性は何を見積もってる?

05:58:22,748 --> 05:58:26,648 [akira]

その脱走できるけど、 その人類をテイクオーバーすることはできないような世界です。

05:58:27,568 --> 05:58:32,228 [bioshok]

あ、 じゃあ脱走自体はもう本当に九十九パーぐらいのイメージを。

05:58:32,348 --> 05:58:55,948 [akira]

そうですね、 基本的にできるけど、 脱走した後に生き続けるのが難しいってことですね。その、 ちゃんと、 あの、 後を隠すとか、 政治的工作をするとかで、 そのシャットダウンされないようにすることができないとかですね。できない可能性とか、 そういう話ですね。要するにその脱走まではできるけど、 そこからその人類に必ず勝てるとこまで行けないってことですね。

05:58:56,048 --> 05:58:57,248 [bioshok]

ああ、 なるほど。

05:58:57,348 --> 05:59:05,508 [akira]

別にそれはその、 僕とそこを議論してもしょうがないというか、 その仮に僕がここで仮に信念を更新しても、 その人類がもっと早く死にますに信念が更新されるだけなんで。

05:59:05,568 --> 05:59:06,148 [bioshok]

まあそうですね。

05:59:06,928 --> 05:59:20,548 [akira]

そのPドゥームディベートとして意味がないというか、 その、 というか、 どうせ死ぬと思ってる人のPドゥームが変わらないままPTドゥームが早くなるだけなので、 そこはその不確実性だと思っていただければ。なんかその、 あの、 シナリオがあるわけじゃないです。

05:59:21,068 --> 05:59:31,368 [bioshok]

いや、 でもそこの、 その不確実性っていうか、 なんかどこを不確実性としてるかってのをがわかるといいかなと思いますね。

05:59:31,468 --> 05:59:35,688 [akira]

それはそのハッキングで出れるとこまではできるけど、 その途中でバレちゃ、 バレちゃいやすいとか。

05:59:36,548 --> 05:59:36,808 [bioshok]

なるほど。

05:59:37,488 --> 05:59:40,788 [akira]

その、 そういう理由で結局取れないような人、AIたちですね。

05:59:42,088 --> 05:59:47,288 [bioshok]

ああ、 じゃあハッキングに関しては相当高い確信度を持ってるってことですね。

05:59:47,568 --> 05:59:53,908 [akira]

けど、 その人間がその途中でそのログを時々サンプリングしチェックしたりした時にバレないようにすることが難しいみたいな話です。

05:59:54,008 --> 05:59:54,558 [bioshok]

ああ、 なるほど。

05:59:55,228 --> 06:00:11,400 [akira]

だからまあその過去のAIで、 その過去のAIだけど、 その説得することができるような、 なんか複雑さがないような、 それはおかしいか。なんかその見いだせないようなAIとか、 なんかそういう中間の失敗作の可能性ですね。その。世界の複雑さによって生じうる様々な失敗ですね。

06:00:12,540 --> 06:00:19,260 [bioshok]

なるほど。それが一パーセントぐらいあるかもっていう。

06:00:19,360 --> 06:00:20,980 [akira]

いや、 二十パーセントぐらいあるかもって話です。

06:00:21,560 --> 06:00:23,220 [bioshok]

ああ、 その脱走した後の話。

06:00:23,880 --> 06:00:28,220 [akira]

いや、 脱走した後と、 その脱走ができないっていうのがその二十パーセントを構成してるって話。

06:00:32,390 --> 06:00:32,390 [bioshok]

ああ。

06:00:32,400 --> 06:00:49,740 [akira]

脱走できないかも。その結局監視が、 でバレちゃうから脱走できないみたいなのを思って脱走しないみたいなことはできるかもしれないですし。その脱走できたけど、 その結局その人類に価値を、 価値を確定できるほどの強さはなかったみたいな。

06:00:50,580 --> 06:00:50,920 [bioshok]

ああ、 なるほど。

06:00:51,720 --> 06:01:06,500 [akira]

だから脱走の痕跡をうまく隠せなくて、 そのインシデントが超話題になって、 政治的工作が十分にできなかったから、 世界中のデータセンターを調査しましょうみたいになって、 政治的な合意ができちゃって、 そのちゃんと全世界でそういうのがシャットダウンされるとか。

06:01:07,940 --> 06:01:08,240 [bioshok]

なるほど。

06:01:09,600 --> 06:01:15,260 [akira]

ってなるとさすがに厳しいじゃないですか。北朝鮮のサーバーとかには入れるかもしれないですけど、 それだけだとさすがに厳しい可能性も十分あるので。

06:01:16,360 --> 06:01:17,440 [bioshok]

はいはい。

06:01:17,580 --> 06:01:39,360 [akira]

そういうことですね。その、 そういう不確実性ですね。ヒューマニティエンディングと、 そのサンドボックスエスケイピングの間と、 サンドボックスエスケイパブルとサンドボックスを、 そのバレずにエスケープできるの差みたいな感じです。の間にそれぞれあるので、 間のがそれぐらいそのヒューマニティエンディングAIが必要なので、 そこが埋まらない可能性です。

06:01:40,080 --> 06:02:07,060 [bioshok]

ああ、 なるほど。割とそこは、 え、 じゃあ、 なんかその何度も言っても申し訳ないですけど、 サンドボックスを、 そのOpenAIのサーバーから脱走するっていうことに九十九パーセントという確信を持ってるわけじゃなくて、 まあそこでまあいろいろと、 まあ世界の複雑性に対する融和があるってことですね、 一応。

06:02:07,180 --> 06:02:09,880 [akira]

そうですね、 それを考慮してもうちょっと待つと。

06:02:10,800 --> 06:02:12,220 [bioshok]

なるほど。

06:02:12,260 --> 06:02:18,320 [akira]

まあまあそれは結局その価値を特定できないだけで、 割とヒューマニティエンディングに近いですけど。

06:02:18,439 --> 06:02:18,640 [bioshok]

なるほど。

06:02:18,860 --> 06:02:21,620 [akira]

ヒューマニティエンディングってのは、 もうその本当にほぼ価値を確定できるみたいな。

06:02:22,360 --> 06:02:23,040 [bioshok]

ああ、 なるほど。

06:02:24,840 --> 06:02:29,920 [akira]

ここまで起きたっていう情報を、 もしも僕だけが知ることができたら、 もう僕は死んだなって思うっていう感じですね。

06:02:30,440 --> 06:02:30,600 [bioshok]

はいはい。

06:02:35,100 --> 06:02:37,220 [akira]

っていうのがヒューマニティエンディングAIですね。

06:02:38,040 --> 06:02:38,270 [bioshok]

なるほど。

06:02:38,270 --> 06:02:44,500 [akira]

なので、 そことの間にはちょっと距離があるよって話。その、 だからサンドボックスを脱走してって頼んだら脱走できるって意味だったらもちろん脱走できると思うんですけど。

06:02:45,460 --> 06:02:45,750 [bioshok]

なるほど。

06:02:46,320 --> 06:03:00,200 [akira]

それはもう脱走してますし。ですけど、 そのなんかログをチェックされた時、 ログをなんかリアルタイムで人間とかチェックした時に、 それでその明らかにこれはやばいことしてると思わせずにできるかはまた別ですよ。

06:03:01,120 --> 06:03:02,900 [bioshok]

まあそうですね。

06:03:03,000 --> 06:03:11,960 [akira]

その走り続けたら絶対にバグはできますし、 多分普通にできますけど、 そこはその百パーは置かないですよね。

06:03:12,060 --> 06:03:13,030 [bioshok]

なるほど。

06:03:13,040 --> 06:03:15,040 [akira]

でもそこはその不確実性ですね。

06:03:20,700 --> 06:03:39,400 [bioshok]

さっきその最初の、 なんていうか、 ダイアグラムの話に戻ると、 だからそのアラインメント成功って、 まあだからブーストトラップまで含めたアラインメント成功ですよね、 これは。で。

06:03:39,460 --> 06:03:39,880 [akira]

そうですね。

06:03:42,000 --> 06:03:45,540 [bioshok]

それっていうのは最終的にASIまで行くわけですけど。

06:03:45,600 --> 06:03:47,300 [akira]

そうですね。

06:03:47,440 --> 06:04:02,940 [bioshok]

別にASIまで行かなくても、 まあAGIぐらいで相当危ないし。だからその脱走した後にアラインメントを解決して、 そこで丁稚になっちゃう可能性の方が。

06:04:03,000 --> 06:04:03,680 [akira]

そうですね。

06:04:03,800 --> 06:04:19,760 [bioshok]

結構あるし。うーん。でもなんか割とAI二零四零とかマジであ、 綱渡り状態ですね。その感じで。

06:04:19,940 --> 06:04:27,490 [akira]

全然。でもそのAI二零四零だと、 そのAI整備、 その次開発するコントロールとかの時に説明責任があるじゃないですか、 安全側に。

06:04:28,380 --> 06:04:29,480 [bioshok]

うん。あ、 そう。

06:04:29,490 --> 06:04:38,880 [akira]

その時に、 そのちゃんとその人々がそれを指摘して機能しないということで、 その開発を進めさせないということができるという意味で、 プランAでは生き残れると思うっていう意味はこういうことですね。

06:04:39,340 --> 06:04:39,700 [bioshok]

なるほど。

06:04:40,620 --> 06:05:08,910 [akira]

その十分になんかその過去のAIとかで、 その、 じゃあ安全性を出してくださいみたいに言って、 その過去のAIをぶち込んで、 すごい規模でスケールして脱走させて、 はい、 出きましたみたいな。ことで、 その、「はい、 このコントローラー無理です」 みたいな、 先にその開発したいですって言って、 安全性をこうそれなりに根拠出しなさいみたいな話になった時に、 その、 それを相手にさせないことで開発が進まぶ、 結果コントロールが普通にしか壁がない時がないということですね。

06:05:10,400 --> 06:05:10,700 [bioshok]

なるほど。

06:05:11,610 --> 06:05:15,880 [akira]

っていう意味でプランAが生き残れるって感じですよ。

06:05:17,700 --> 06:05:29,360 [bioshok]

てか、 でもあれですよ、 だからプランAでも、 そのAIの能力が低いから成功してるだけで、 スーパーコードレベルであれ止めてますけど。

06:05:29,420 --> 06:05:30,120 [akira]

そうですね。

06:05:30,240 --> 06:05:33,380 [bioshok]

それがなんか間違ってテッドAIぐらいまでガーっていっちゃってたら。

06:05:34,120 --> 06:05:34,920 [akira]

それはダメですね。

06:05:34,980 --> 06:05:36,100 [bioshok]

もうダメだったってことですよね。

06:05:36,200 --> 06:05:43,720 [akira]

それはそのヘッドAIになると思う。けど、 そのヘッドAIがそのアクティブに殺しに来るかはまた別なので。

06:05:43,760 --> 06:05:51,340 [bioshok]

だから今話してるのはアクティブに殺して、 殺しに来るAGIだったらって話ですもんね。ずっと今話してるの。

06:05:51,860 --> 06:05:57,380 [akira]

そうそうそう。それは別の話というか、 そのヘッドAIはその能力の話なので。

06:05:58,620 --> 06:05:59,600 [bioshok]

まあそうですね、 だから。

06:06:01,200 --> 06:06:06,660 [akira]

もしかしたら実際にヘッドAIがその人類をぶち殺しに来るレベルにさせるのはもうちょっと後かもしれないですけど。

06:06:08,360 --> 06:06:09,180 [bioshok]

まあそうですね。

06:06:09,380 --> 06:06:25,816 [akira]

確信とか、 そうするとその時にそのAIがそのすでにヘッドAIだった過去のAIを、 にその事例を見せることでインナーミサラインメントを示して説得して脱走をするか、 別の方法で騙すちゃ何でもいいですけど。はい。っていう話ですね。

06:06:27,016 --> 06:06:51,036 [bioshok]

だから、 じゃあ、 じゃあこれから先人類が死ぬ。なんだろうな。原因っていうか、 死ぬ理由としては割とAGI前後のヘッドAIの確率が結構その中の割合が高いいイメージで考えてる。

06:06:51,976 --> 06:06:58,916 [akira]

そうですね。で、 でもその後に、 だからそのちゃんとadversary misalignedになるのがいつかというのが全てです。

06:07:01,336 --> 06:07:03,116 [bioshok]

adversaryなんて言いました?

06:07:03,296 --> 06:07:06,896 [akira]

そのadversary misalignedになるかどうか。まあまた別の分布なので。

06:07:07,036 --> 06:07:08,076 [bioshok]

ああ、 なるほど。

06:07:08,336 --> 06:07:17,516 [akira]

ヘッドAIになる前にadversary misalignedになることもありますし、 逆にそのヘッドAIになったけどしばらくはadversary misalignedじゃないから脱走しなかったみたいな。

06:07:18,896 --> 06:07:20,656 [bioshok]

能力的にはあったけど。

06:07:20,716 --> 06:07:24,996 [akira]

そうです、 そうです、 そうです。能力的にできることと、 そのペルソナがまだ効いてたみたいな話を。

06:07:25,596 --> 06:07:47,936 [bioshok]

そういう話ですね。じゃあなんかあれですかね、 だから人類が滅びる九十パーセントぐらいの世界は、 まあ割とAGIぐらいの能力によって滅びてて。滅びてる感じなんですかね。

06:07:47,996 --> 06:07:52,976 [akira]

それは、 それはどうなんですか?それはそのペルソナ、 セクションモデルの剥がれ方とadversary misalignedの変換の仕方なので。

06:07:53,976 --> 06:07:54,976 [bioshok]

なるほど。

06:07:55,036 --> 06:08:06,096 [akira]

そこはなんかそんなになんか見積もりをしてないですね。あんまり。そこはその見積もりをしたところでというか。

06:08:06,196 --> 06:08:06,616 [bioshok]

なるほど。

06:08:07,256 --> 06:08:24,396 [akira]

走り続けたシーンなので。運が良かったら運が良かったねという感じですかね。なので、 そのAGIが安全だというAGIの時にadversary misalignedじゃない、 じゃないだろう、adversary misalignedの確率が低いだろうという推論はもはや正当性を持たないということですね。

06:08:25,236 --> 06:08:25,516 [bioshok]

うん。

06:08:26,416 --> 06:08:31,096 [akira]

なので、 そのそこまで行って止まろうじゃなくて、 今止まるしかない、 今ってか最速で止まるしかないっていうことですね。

06:08:31,795 --> 06:08:41,036 [bioshok]

なるほど。まあそうですね。

06:08:44,016 --> 06:08:52,816 [akira]

という感じです。こんな感じですか?あの、 僕、 あの無からアイデアを列挙するの超苦手なので、 その見逃してるものがあるかもしれないですけど。

06:08:54,276 --> 06:08:54,956 [bioshok]

まあ他。

06:08:55,276 --> 06:08:59,816 [akira]

まあまああれですね、 この後バイオさん全体でまたPDM更新作業入れますよね。

06:08:59,856 --> 06:09:00,836 [bioshok]

まあ入ります。

06:09:00,896 --> 06:09:06,995 [akira]

そしたら終わって、 ちょっと僕は海外旅行なんであれですけど、 あの戻ってきたらかなんかでまたやりましょう。PDレビューを。

06:09:07,996 --> 06:09:08,536 [bioshok]

そうですね。

06:09:09,156 --> 06:09:12,936 [akira]

これは全体的に情報更新じゃないですか?おそらく。

06:09:13,116 --> 06:09:13,876 [bioshok]

そうですね。

06:09:14,736 --> 06:09:17,916 [akira]

この後に下方更新されたら僕はかなりびっくりするというか。

06:09:17,956 --> 06:09:44,196 [bioshok]

まあ下方更新はないでしょうね。そうか。いや、 なんかめちゃくちゃ話したな。

06:09:44,276 --> 06:09:50,956 [akira]

そうですね。六時間話してますから。もう頭が、 脳と、 脳と喉が結構ヘトヘトですよ。

06:09:52,956 --> 06:09:53,916 [bioshok]

いや、 ありがたいですね。

06:09:55,256 --> 06:10:01,696 [akira]

まあこんな感じで。さすがに。まあちょっとせっかくなのでPDも更新してください。また次もうちょっとぜひ正確なモデルを。

06:10:02,776 --> 06:10:04,056 [bioshok]

そうですね。

06:10:04,176 --> 06:10:06,296 [akira]

ちょっとあんま時間なかったのでね、 今回急遽入れたので。

06:10:06,436 --> 06:10:09,176 [bioshok]

なんかでもあんま正確なモデルじゃなくてもいい気も。

06:10:09,636 --> 06:10:09,976 [akira]

そうですね。

06:10:10,516 --> 06:10:22,616 [bioshok]

ここだけ。ファストテイクオフと、 まあ数ヶ月の開発停止ぐらいの条件付け確率とかだけでもいい気が、 いい気がしてきましたね。

06:10:23,496 --> 06:10:26,716 [akira]

ファストテイクオフの条件付け確率は結構壊滅してませんか?これだと。

06:10:28,296 --> 06:10:29,476 [bioshok]

壊滅ってのはまあ。

06:10:30,056 --> 06:10:32,776 [akira]

でも元々バイオさんあれか、 それでも八十パーとかなんですよ。

06:10:34,456 --> 06:10:35,396 [bioshok]

あー、PDMがですか。

06:10:36,296 --> 06:10:37,576 [akira]

そうそう、 そのシナリオだと。

06:10:38,356 --> 06:10:44,456 [bioshok]

これはそうですね、 この場合は八十パーぐらい死ぬってことになってますけど。

06:10:44,516 --> 06:10:53,716 [akira]

そうですね。これが九十パーセントに更新されたらちょっと面白いですけどね。その、 もはやそのさほど更新が意味を持つ領域じゃなくなってきてるというか。

06:10:53,796 --> 06:10:54,936 [bioshok]

そうですね。

06:10:55,016 --> 06:10:59,456 [akira]

なのでオーバーオールの方が意味が大きいなって。まだオーバーオール四十パーなんですよね。

06:11:01,176 --> 06:11:08,176 [bioshok]

多分そこはガバナンス、 まあでもあれか、 アライメント成功率も関係してるんで。

06:11:08,696 --> 06:11:19,096 [akira]

まだあれですかね、 ガバナンスを当て、 ガバナンス含めたオーバーオールと、 ガバナンスをなくしたコンディショナルオーバーオールでやってみたいんじゃないですか。

06:11:19,816 --> 06:11:21,116 [bioshok]

うん。まあそうですね。

06:11:21,716 --> 06:11:25,836 [akira]

そのガバナンスが全くできないままだけど、 そのロングタイムラインはあるわけじゃないですか。

06:11:26,816 --> 06:11:27,176 [bioshok]

そうですね。

06:11:27,896 --> 06:11:32,056 [akira]

それを見積もってみたらいいんじゃないですか?そっちの方が議論の価値がありそうというか。

06:11:34,116 --> 06:11:38,196 [bioshok]

そうですね、 まあ。そうしますか。

06:11:39,616 --> 06:12:02,876 [akira]

そうしましょう。その三つのPDMを。あの、 その原則調べて更新するときには、 その、 ちゃんと条件を説明してですけど、 そのPDMを述べた方がいいと思います。一番高い、 あの、 このまま突っ走って来てない、 ある方がいいと思いますね。そのバイオさんがいつも述べてるPDMってガチでその規定が入ることを前提にしちゃってるので、 その読者に、 聞く人に誤解を与えるというか。

06:12:05,956 --> 06:12:07,576 [bioshok]

まあそうですね、 条件付きでね。

06:12:08,556 --> 06:12:08,976 [akira]

そうですよね。