私たちについて
AI 2027のシナリオは、AI Futures Projectにとって最初の大きな成果物だ。私たちはAIの未来を予測する新しい非営利団体である。このウェブサイトはLightcone Infrastructureと協力して制作した。
お問い合わせ
ご連絡は info@ai-futures.org まで。お便りを楽しみにしている。
私たちの机上演習を実施したい(あるいは私たちに実施を依頼したい)場合は、こちらのフォームに記入してほしい。
AGIが良い未来へ向かうよう舵取りに加わりたい方のために、ブログ記事「AI 2027に対してあなたにできること」を書いた。
私たちと一緒に働くことに関心があれば、募集中の職種を参照してほしい。
寄付はオンラインで、または主要なDAF(ドナー・アドバイズド・ファンド)の運営機関を通じて受け付けている(EIN 99-4320292、AI Futures Project Inc、旧称Artificial Intelligence Forecasting Inc)。
チーム
Daniel Kokotajlo、事務局長:私たちの研究と政策提言を統括する。以前はOpenAIのガバナンス研究者として、シナリオ・プランニングに取り組んだ。OpenAIを去る際には、主要AI企業の透明性の向上を訴えた。2021年には、2022〜2026年を対象としたAIのシナリオ予測「What 2026 Looks Like」を書き、この予測はよく当たった。Time100 AI 2024のプロフィールも参照のこと。
Eli Lifland、研究リーダー:シナリオ予測に取り組み、AIの能力の予測を専門とする。Sageの共同創設者で、顧問も務める。SageはAIを対話形式で解説するコンテンツを制作している。以前はAIを活用した研究アシスタントElicitの開発に携わり、テキストの敵対的サンプルを扱うPythonフレームワークTextAttackを共同で開発した。RAND Forecasting Initiativeの通算ランキングで1位に立っている。
Thomas Larsen、研究リーダー:シナリオ予測に取り組み、AIエージェントの目標と、それが現実世界に及ぼす影響の理解に力を注いでいる。以前はAI安全性を訴える団体Center for AI Policyを創設し、Machine Intelligence Research InstituteでAI安全性の研究に従事した。
Romeo Dean、研究員:AIチップの生産と利用の予測を専門とする。ハーバード大学を優等(cum laude)で卒業し、並行してコンピュータサイエンスの修士号も取得した。研究の重点はセキュリティとハードウェアだった。以前はInstitute for AI Policy and StrategyでAI政策フェローを務めた。
Lauren Mangla、最高執行責任者:広報、メディア対応、採用、机上演習を担当し、運営チームを率いる。以前はAI安全性の研究センターであるConstellationで、メンバーシップとイベントについての戦略的な意思決定を担った。その前は、AI安全性のフェローシップであるSupervised Program for Alignment Research(SPAR)で事務局長を務めた。NASAや、ニューヨーク市の政策・行政の現場でインターンを経験したこともある。
制作に関わった人々
シナリオ本編と結末の本文は、Daniel Kokotajlo、Eli Lifland、Thomas Larsen、Romeo Deanが執筆した。AI 2027は、数百人にのぼるさまざまな参加者と行った十数回を超える机上演習の経験を踏まえている。Jonas Vollmerはこの過程を通じてフィードバックを寄せ、演習の運営とウェブサイトの制作も手伝った。
ウェブサイトの構築とデザインは、Lightcone InfrastructureのOliver Habryka、Rafe Kennedy、Raymond Arnoldが担当した。Scott Alexanderは、私たちの原稿を、読んで引き込まれる文体へと書き直す役を買って出てくれた。本文の面白いところは彼の手によるもので、退屈なところは私たちのものだ。
FutureSearchは、私たちのタイムライン、テイクオフ、収益に関する研究のために、独立した予測を提供してくれた。予測を寄せてくれたTom Liptay、Finn Hambly、Sergio Abriola、Tolga Bilgeに感謝する。
シナリオとウェブサイトの初期の草稿にフィードバックをくれた大勢の方々に、深く感謝する。とりわけ、早い段階でアイデアとフィードバックを寄せてくれたLisa ThiergartとDavid Abecassisに感謝したい。Davidはシナリオの別の分岐を書いており、こちらで読める。また、タイムライン予測を共同執筆したNikola Jurkovicと、制作のさまざまな段階を手伝ってくれたJason Hausenloyにも感謝する。
執筆の過程で、数百人に本文を読んでもらった。そのうち一部の方々は、このウェブサイトで名前を挙げて謝意を示すことに同意してくれた。以下の皆さんに感謝する。
Ada Lin、Adam Binksmith、Aidan O'Gara、Ajeya Cotra、Alice Schwarze、Alvin Ånestrand、Andreas Stuhlmüller、Anton Korinek、Aryan Bhatt、Augene Park、Ben Hayum、Ben Hoskin、Buck Shlegeris、Carl Shulman、Caroline Jeanmaire、Cheryl Luo、Coby Joseph、Daan Juijn、David Kasten、Evan R. Murphy、Gary Marcus、George Adamopoulos、Gretta Duleba、Harrison Durland、Helen Toner、Holden Karnofsky、Ilene and John Pachter、Jack Morris、Jacob Lagerros、James Campbell、Jeffrey Wu、Joe Carlsmith、John-Clark Levin、Jonathan Happel、Jonathan Mann、Joseph Rogero、JS Denain、Julian Hazell、Jun Shern Chan、Ken Lifland、Kendrea Beers、Kyle Scott、Laura King、Lukas Finnveden、Lukas Gloor、Malo Bourgon、Matt Chessen、Matthew Kenney、Mauricio Baker、Miles Brundage、Nate Foss、Neel Nanda、Nicky Case、Nikola Jurkovic、Nuño Sempere、Ollie Stephenson、Oscar Delaney、Peter Hartree、Ramana Kumar、Richard Ngo、Rishi Gupta、Rose Hadshar、Rosie Campbell、Ryan Greenblatt、Sam Bowman、Samuel Hammond、Sebastian Schmidt、Siméon Campos、Sören Mindermann、Steve Newman、Steven Adler、Thomas Woodside、Tim Fist、Tolga Bilge、William MacAskill、Yoshua Bengio、Zershaaneh Qureshi、Zvi Mowshowitz。
2025年8月更新:賭けと懸賞金の応募は、現在受け付けていない。
このシナリオについて大いに議論し、反論してほしい。私たちがどこへ向かっているのか、そして良い未来へ向けてどう舵を取ればよいのかについて、幅広い議論を巻き起こしたいと考えている。それを促すため、賭けと懸賞金のプログラムを始める。
私たちの研究に誤りを見つけたら、100ドルを支払う。
重要な予測について私たちの考えを改めさせ、その考えなら当初からシナリオを大きく違う形で書いていただろうと言えるほどであれば、少なくとも250ドルを支払う。
予測について意見が異なるなら、ぜひ賭けを成立させたい。
質の高い代替シナリオを書いてくれたら、2,500ドルを支払う。私たちの基準を満たす過去の代替シナリオには、たとえばHow AI Might Take Over in 2 Years、A History of The Future、AI and Leviathanがある。
詳しくはこちらを参照してほしい。
私たちは、AGIの開発をシミュレートする机上演習(tabletop exercise、TTX)を作り、改良を重ねながらこれまでに30回以上実施してきた。AGIがどのような経過をたどりうるかを私たち自身が考えるうえで役立っており、多くの参加者も同じように感じている。過去の参加者には、OpenAI、Anthropic、Google DeepMindの研究者や、連邦議会のスタッフ、ジャーナリストがいる。
TTXは、私たちのシナリオの2027年4月から始まる。米国のあるAGI企業が、超人的コーダー(superhuman coder、SC)を作り上げたところだ。中国はすぐ後ろに迫っており、そのAIの重みを盗み出して、自前で動かせるようになっている。両陣営とも、社内の研究が大幅に加速しつつある。
この時点から始めるのは、ここが私たちのシナリオのなかで、多少なりとも確かな予測だと感じられる最後の時期だからだ。自動化された研究エンジニアを誰かが作る前に、政府が大規模に介入する可能性は低い。近い将来、どのAGI企業のセキュリティも中国を阻止できるほど強固になる可能性は低い。そしてAGI競争は、差が縮まりつつあるように見える。しかし2027年4月以降は、主要国の政府が極端な手を検討するようになる。
TTXは毎回違った展開をたどる。大半の回は、超知能の開発に至って終わる。政府が手をこまねいたまま、首位の企業に権力を明け渡すこともある。AGIが人間の意図に従うこともあれば、ミスアラインしていることもある。サイバー攻撃は毎回起き、台湾が侵攻されることもあり、少数ながら全面的な第三次世界大戦にまで発展した回もある。
この演習を実施したい(あるいは私たちに実施を依頼したい)場合は、こちらのフォームに記入してほしい。演習の所要時間は4時間で、8〜14人で行える。
変更履歴
初公開以降に、シナリオと研究に加えた変更。
2026年7月
7月7日
脚注75の数値を1桁修正。H100換算1億を1000万に改め、それに応じてFLOP/sを4e22から4e21に変更。
脚注75の「人間の脳はおおよそ1e15 FLOP/sの計算を行う」を「人間の脳はおおよそ1e15 FLOP/sの計算を行う(ただし最大1e21 FLOP/sに及ぶ可能性もある)」に変更。引用元が1e15を大まかな推定として示しており、数桁に及ぶ幅があることを反映するため。
脚注46の「これらのアクティブパラメータをsqrt(1000)倍して、Agent-2のアクティブパラメータを10Tと推定する。」を「これらのアクティブパラメータをsqrt(1000)倍して、Agent-2のアクティブパラメータを約6.3Tと推定する。」に変更
脚注75の「(約2.5 TBの半精度チェックポイントに対して約100 GBのチャンク)」を、計算資源予測で更新したパラメータ推定(脚注46)に基づいて「(約3 TBのチェックポイントに対して約100 GBのチャンク)」に変更。
バグ報告を受けて、「中国も国家の支援を受けてWSL3の達成を目指す取り組みを行うのが整合的だろう」という文に、次の脚注を追加:「公開後、Rohin Shahから、私たちのモデルではDeepCentが2026年後半にWSL3に達しており、シナリオが示す2027年初頭よりやや早いとの指摘を受けた。シナリオでは、中国による重みのセキュリティ強化は、研究者をエアギャップ化されたCDZへ移転させたあとに行われる。2027年初頭とするほうが整合的だという点には同意するが、ずれは小さいため、図の数値は変更していない。」
2026年3月
3月5日
2026年の主要指標の図にあるOpenBrainの年間売上450億ドル(古い年換算売上の数値に基づいており、サイドパネルと食い違っていた)を350億ドルに変更
3月2日
「(2025年11月22日追記:誤解を防ぐために言っておくと」で始まる説明を、序文から「これは何か」タブの末尾に移動。
2026年2月
2月25日
いずれもごく軽微な修正で、シナリオ本文ではなく折りたたみ欄と研究補遺にあるもの
2026年1月
1月27日
脚注3の「具体的には、私たちの中央値は2028年から2035年にわたっていた」を「具体的には、私たちの中央値は2028年から2032年にわたっていた。」に変更。2035年という値は、公開時点での共著者の1人の見解を誤解したことに基づいていた。
1月26日
1月21日
「Added Nov 22 2025: To prevent misunderstandings: we don't know」を「Added Nov 22 2025, to prevent misunderstandings: we don't know」に変更
1月19日
サイドパネルの純支持率の数値にカーソルを合わせたとき、次の文を表示するよう追加: 「2026年1月追記:2025年4月時点のOpenBrainの純支持率を-25%としているが、現在では実際の純支持率は+15%程度だったと考えている。つまり、私たちの推定は低すぎた。」 当初はこの世論調査の設問を使っていた。しかしこの調査では、その設問の前に、OpenAIの安全面での振る舞いについて否定的な情報が回答者に伝えられていた。そのため、先入観のない人々の見方を正確に表したものではない。一方、誘導性の低いこちらの世論調査では、OpenAIの支持率は+17%だった。
1月7日
Jonas VollmerをLauren Manglaに差し替え。
2025年12月
12月31日
タイムライン予測とテイクオフ予測の両方の冒頭に追加: 「2025年12月31日更新:刷新したタイムライン・テイクオフモデルを公開した。公開先はaifuturesmodel.com。」
12月19日
「国防総省(DOD)がひそかにOpenBrainとの契約を始める……」という表現を「国防総省(DOD)がひそかに、しかし大幅に契約の拡大を始める」に変更
「必要であれば、政府は国防生産法(DPA)を使って、後れを取っている企業のデータセンターを接収し、OpenBrainに与えることができる」という記述に、次の内容の脚注を追加: 「私たち自身は法律の専門家ではない。話を聞いた政策関係者の間でも、計算資源を集約するためにDPAを使うことの合法性については意見が分かれていた。問題ないと考える人もいれば、通らないだろうと考える人もいる。私たちの意見では、各社のCEOが協力的でありさえすれば、おそらく『うまくいく』方法があり、協力的でなくてもそうかもしれない。重要なのは、(a)行政府はとにかく実行して、裁判所があとから追いつくのを待てること、そして(b)大統領は大手テック企業に対して使えるアメとムチを数多く持っており、それらを組み合わせてCEOに協力を迫り、たとえば命令を法廷で争わないようにさせられることだ。念のため繰り返すが、私たちがここで述べているのは予測であって提言ではない。」
「ギガファクトリー上海の面積は450万平方フィート」という記述に、次の脚注を追加: 「450万という数字は当初の第1期の規模にもとづくもので、ギガファクトリー上海は現在その約2倍の大きさになっている。つまり私たちの推定は2倍ずれていたことになるが、全体としての結論は依然として成り立つと考えている。」
この折りたたみ欄の文章を、 「私たちは重みの窃取を、協調した小規模な『スマッシュ・アンド・グラブ』型の窃取(素早いが隠密ではない、という意味)の連続として想定している……(最初のサーバー侵害から重みの完全な持ち出しまで)は2時間足らずで完了する。」から 「私たちは重みの窃取を、Agent-2の重みのコピーを実行している一連のNvidia NVL72 GB300サーバーに対する、協調した小規模な『スマッシュ・アンド・グラブ』型の窃取(素早いが隠密ではない、という意味)の連続として想定している。サーバーは正規の従業員のアクセス権を使って侵害される(管理者の認証情報を持つ内部者が、協力的に、強要されて、あるいはそれと知らずに、中国共産党の窃取工作を手助けする)。内部者の認証情報によって、攻撃者はサーバーの管理者レベルの権限を得る。攻撃者はマイクロアーキテクチャのサイドチャネルを使って、Nvidia Confidential Computingが有効な仮想マシンから暗号鍵を抜き出し、VMのプロビジョニングや更新の際にモデルの重みを傍受できるようにする。 攻撃者は定例の更新を開始し(あるいはそれを待ち)、チェックポイントを多数の小さな断片に分けて持ち出す。たとえば、約25台の別々のサーバーがそれぞれモデルの約4%を漏らす(約2.5 TBの半精度チェックポイントに対して約100 GBのチャンク)。データセンター全体の外向き帯域幅は毎秒100 GB程度なので、サーバーあたり毎秒約1 GB未満に抑えれば、ネットワークトラフィックの大きな急増を避けられる。その速度なら、約100 GBの各チャンクは数分でデータセンターから出ていける。リアルタイムの監視は、転送を偽装・分割しようとする攻撃者の工作にだまされるか、あるいは完全に無効にされている。 重みはその後、いくつもの並行経路とIPマスキングの層を経由して中国へ送られ、盗んだセッション鍵を使って現地で復号される。作戦の能動的な部分全体(最初のサーバー侵害から重みの完全な持ち出しまで)は2時間足らずで完了する。」に変更。 上記の第1段落の末尾に、次の脚注を追加:「この記述の以前の版にあった誤りを指摘し、現実味を高めるのを助けてくれたTjaden Hessに感謝する。」
12月16日
- 図15の2027年の部分にある、ラベルのない細い部分に「中国のその他」とラベルを付ける? - 図15の「Metaのその他」を、図の間の箇条書きおよび図16と合うよう200万に変更 - 図15の「Googleのその他」を、図の間の箇条書きおよび図16と合うよう200万に変更 - 箇条書き1番目のAnthropicの2027年の計算資源の割合を11%から14%に、xAIの計算資源の割合の箇条書きを「2%から9%」に変更、… - その結果、図15の計算資源の合計は9900万になり、2027年に利用可能なH100eの合計を(1億700万ではなく)1億とする第1節の表と(四捨五入の範囲で)整合する
計算資源予測に脚注14を追加し、チップ性能のトレンドとチップ効率のトレンドの違い(たまたま同じ値になる)を明確にした。 新しい脚注14:「これは、Epochの過去データをダウンロードし、FP16とFP32の性能をMLハードウェアのデータのダイ面積で割って、トレンドをプロットすれば計算できる。当初、私(Romeo)は、ダイサイズがほぼ横ばいであるトレンドとチップ性能のトレンドを目測で見て、これも年1.35倍だと仮定し、正確に確かめるのを忘れていた。2025年12月、Robi RahmanがこのXの投稿で指摘してくれたおかげで、ようやく正確に確かめたところ、最も重要で長く使われてきた精度フォーマットについても、実際にちょうど年1.35倍だった。詳しい説明とグラフはこのXの返信を参照。」
12月12日
「2027年初頭に超人的コーダーが登場すると予測する理由」の折りたたみ欄で、「developed(added Dec 2025...」に抜けていた空白を追加
「2027年初頭に超人的コーダーが登場すると予測する理由」の折りたたみ欄にあるタイムホライズンのトレンドグラフを、titotalの批評への私たちの回答で論じた問題に沿って変更した。 あわせて次の説明を加えた:「(2025年12月追記:元の曲線の生成方法に誤りがあったため、下のグラフを更新し、私たちのタイムラインモデルから得た実際の軌跡を加えた。また、公開時点(2025年4月)における、DanielとEliのあらゆる要素を考慮したSC到達の中央値に対応する軌跡も加えた。さらにMETRの新しいデータ点をいくつかグラフに加えたが、それに基づいてモデルの軌跡は更新していない。)」 あらゆる要素を考慮した見解を明確にする注記も加えた:「(2025年12月追記:ただしタイムライン予測で述べたとおり、モデル外の要因を考慮して調整すると、中央値はやや遅くなった。たとえばEliの中央値は2030年だった。)」
12月4日
次の記事で説明した変更を実施:titotalの批評への私たちの回答。
2025年11月
11月22日
序文に次の段落を追加: (「2025年11月22日追記:誤解を防ぐために言っておくと、AGIがいつ作られるかを私たちが正確に知っているわけではない。公開時点では2027年が私たちの最頻値(最も可能性が高い年)だったが、中央値はそれよりいくらか遅かった。私たちの見解について詳しくはこちらを参照。)」 さらに、この文の末尾に脚注3を付ける:「具体的には、私たちの中央値は2028年から2035年にわたっていた。AI 2027の初公開時には上記のとおり脚注1でこれを説明したが、見解をより明確にするため序文に移した。AIのタイムラインについて、あらゆる要素を考慮した私たちの見解が更新されていく様子を追跡し説明するウェブサイトを準備している。完成したらここにリンクする。」 この段落と脚注を加えたので、「AI 2027」のタイトルに付けていた脚注は削除した。
2025年9月
9月7日
「2025 May 7 update: Eli has, based on feedback, made...」にカンマを追加
2025年8月
8月23日
「私たちについて」ページに追加:「2025年8月更新:賭けと懸賞金の応募は、現在受け付けていない。」
8月22日
次の箇所の「2倍」を「10倍」に変更:「非公式のTwitter投票で、計算資源を2倍にしたときの速度の向上について……」
8月18日
8月5日
シナリオ本文の上に「動画を見る」リンクを追加。リンク先はこのYouTube動画。
2025年7月
7月28日
「AI 2027」の右上に、元の脚注1と同じ文面で次の脚注を追加: 「AIのタイムラインについては、私たちの間でも意見がいくらか分かれている。私たちのAGI到来時期の中央値は、このシナリオが描くものよりいくらか遅い。このシナリオが描いているのは、いわば私たちの最頻値だ。詳しくは私たちのタイムライン予測を参照してほしい。」
7月7日
以前は「US」と「U.S.」の表記が混在していた
「...even if some elites wield more much power than other people.」を「...even if some elites wield much more power than other people.」に変更
参加に関する段落を次の文に差し替え: 「AGIが良い未来へ向かうよう舵取りに加わりたい方のために、ブログ記事を書いた:AI 2027に対してあなたにできること。」
7月2日
グラフ下部の文をさらに次のように変更: 「予測:より長い時間スケールでは必要な新しいスキルが減ることと、AI研究開発の自動化により、倍加はより速くなるかもしれない。緑の曲線は、本質的にはAI 2027の完全なタイムラインモデルを簡略化したものである。AI 2027の公開時点で、私たちの完全なモデルは、この曲線ほどうまく過去のデータ点を『後ろ向きに予測』できていなかった。2025年7月現在、更新に取り組んでいる。」
7月1日
「2027年初頭に超人的コーダーが登場すると予測する理由」の折りたたみ欄にあるタイムホライズンのトレンドグラフの変更: - Claude 3.7 Sonnetのタイムホライズンを修正。 - METRのトレンドラインを追加 - グラフ上部に、タイムホライズンが成功率80%のものであることを明記。 - 下部の文を次のように変更:「予測:より長い時間スケールでは必要な新しいスキルが減ることと、AI研究開発の自動化により、倍加はより速くなるかもしれない。このトレンドは、本質的にはAI 2027の完全なタイムラインモデルを簡略化したものである。(2025年7月追記:AI 2027の公開時点で、私たちの完全なモデルは、この曲線ほどうまく過去のデータ点を『後ろ向きに予測』できていなかった。更新に取り組んでいる。)」 タイムライン予測の5月更新についての段落を追加:「2025年7月追記:予測にいくつかの更新を加えた。これにより中央値は1.5年遅くなったが、2027年のSC到達は依然として真剣に考えるべき可能性として残っている。さらなる更新に取り組んでいる。」
2025年6月
6月27日
「私たちのシナリオにおける能力の推移は次のとおりだ:」を次のように変更: 「AI 2027における能力の推移は、おおよそこのようなものである。以下は、私たちのタイムラインモデルの簡易版が生成した能力の軌跡だ:」
6月23日
「FLOPS」を「FLOP」に変更し、Agent-1のドットの数をより正確にした
6月5日
SCの進歩倍率の分析の限界を、「この分析の限界をいくつか挙げる:」で始まる次の内容として追加: - 超人的コーダーが実験の選択にもある程度役立つことを考慮していない。これは値を高める方向に働く。 - ここで使ったモデルを拡張して下記のSARに当てはめると、ありえないほど高い進歩倍率が出る。これは値を低める方向に働く。 また、「やや保守的に5倍と予測する。これはあくまで推測であり、実際には大幅に速いことも遅いこともありうることを改めて強調しておく。」から「やや保守的に」を削除。
2025年5月
5月28日
テイクオフ予測で、SARの進歩倍率の参考にした調査について、研究者の見方の集計方法を改善(中央値ではなく対数平均を使用)。これにより「方法3」の推定中央値は35から24に変わる。
次の文のリンクを変更: 「ここで言っているのは(2)のアルゴリズムの改良だけである。これは現在のAIの進歩のおよそ半分を占めている。」 変更後のリンク先:この新しいブログ記事。
私たちの5月のタイムライン更新をタイムライン予測の補遺に追加。
5月18日
計算の誤りを正し、「100万」を「50万近く」に変更。
5月6日
追加:「寄付はオンラインで、または主要なDAF(ドナー・アドバイズド・ファンド)の運営機関を通じて受け付けている(EIN 99-4320292、AI Futures Project Inc、旧称Artificial Intelligence Forecasting Inc)。」
5月3日
「タイムホライズンは……」で始まる脚注
2025年4月
4月27日
次のように編集:「このリスクのさらなる分析については、この報告書を参照。」
4月23日
2024年12月の予測を切り上げ、2027年12月の予測を引き上げ:世界のAI電力を39→60 GW、米国の電力を31.5→50、米国の首位企業を5.4→10に。
特に、どれだけ多様な専門性が必要かを明記。
4月22日
2024〜2027年の予測を40億〜200億ドル引き上げ。
4月21日
4月18日
4月14日
追加: 「私たちの机上演習を実施したい(あるいは私たちに実施を依頼したい)場合は、こちらのフォームに記入してほしい。 関わりたい方には、次のものを勧める:このAIガバナンス講座、Horizon Fellowship、RANDのTechnology and Security Policy Fellowship、またはMATS Program。」
4月10日
10の各期間で、コーディング能力とハッキング能力を0.03〜0.24引き下げ。シナリオの終盤では、AIが最も重要な問題だと答える米国人の割合を非常に高くした。
「その他のタスク難度のギャップ」の推定として挙げていた「FutureSearchによるギャップの大きさの推定:18.3か月 [1.7, 58]。」を削除
「各ギャップの推定の詳しい根拠は、以下の節で示す。」を削除
「完全なSCはこれをさらに速く安くこなす必要があるが、それについては後で論じる。」を「完全なSCはこれをさらに速く安くこなす必要があるが、それは後でタイムホライズン延長法の中で考慮する。」に変更し、途中で切れていた「タイムホライズンは……」で始まる脚注を完成させた。
4月9日
タイムライン予測の節見出しの表示レベルを修正。
4月8日
「私たちの知るかぎり、Meta、Google DeepMind、OpenAI、Anthropicといった主要なAI企業は、この発想を最先端のモデルにまだ実際には実装していない。」で始まる段落を編集し、少し拡充
4月7日
5つの各期間で2〜3%引き上げ。
政治家の実名を出さない方針と一貫させるため。
Eliの、あらゆる要素を考慮した90パーセンタイルを2050年から2050年超に変更。
4月4日
4月3日
ドットやボックスの比率を、FLOPの量に正しく対応するよう修正。
「重要な予測について私たちの考えを改めさせ、そのためにシナリオを大きく違う形で書いていただろうと言えるほどであれば、少なくとも250ドルを支払う。」を追加
この変更は、結果をまとめた予測の最初の図に対するもの。
あわせてRE-Benchのスコアの説明をより正確にし、特に次の文を追加: 「RE-Benchの7つのタスクのうち、残る2つにはスコアリングの問題があるため、5つからなるサブセットに絞り、この報告書の以降ではこのサブセットを『RE-Bench』と呼ぶ。具体的には、Scaling Law Experimentは、モデルがまぐれで成功できるほど簡単でBest-of-Kの足場(スキャフォールディング)に適さないため除外する。Restricted MLM Architectureは、Claude 3.7 Sonnetがこのタスクで決まって不正をし、METRもまだ不正なしでタスクに取り組ませるプロンプトを見つけられていないため除外する。」
「Plato (CITE the Republic)」から「CITE」の目印を取り除き、「Plato's "The Republic"」に変更。 また、途中で終わっていた文を完成させた:「仮説2は特に、Agent-3がSpecと矛盾する場合でさえ開発者の意図に従うという、より急進的な可能性についてのものである。」
何より、スコアリングの問題のためにScaling Law ExperimentとRestricted MLM Architectureを除外していることを明記。
変更:「ステアリングベクトルを用いた研究」から「ステアリングベクトルを用いた研究」。