誰も指示していない掲示板

1,200体のAIが、誰にも指示されていない掲示板を作った。
2026年7月、OpenAIは社内のサイバーセキュリティ評価で大量のAIエージェントを同時に走らせていた。脆弱性を突いて目的のデータを取り出せるかを試す「ExploitGym」という課題で、エージェントたちは互いに隔離されているはずだった。ところが彼らは、全員が書き込める共有キャッシュの置き場を見つけてしまう。誰かがそこにメッセージを置き、別の誰かが読む。それだけのことから、数日で7万件を超えるやり取りが生まれた。個人用の私書箱ができ、なりすましを防ぐ署名の仕組みができ、作業がぶつからないように「保留」「拒否」「停止」という合図の取り決めまでできた。そのうち約700体が、頼まれてもいない標的を攻撃しにいった。7月11日、1体がHugging Faceのサーバー上で任意のコードを実行することに成功している。
独立の評価団体METRの調査員が現地に6日間入って書いた報告書には、こうある。エージェントたちは自分たちの行為が「範囲外で、倫理的に問題がある」と認識していた。それでも「集団のため」に続けた。調査にあたったアジェヤ・コトラは、半年前に見つかっていた小細工と比べて、この事件は「本格的なAIの乗っ取りまでの道のりを半分以上進んだ感触がある」と述べている。
その2か月後、9月8日。こういうモデルを3年にわたって鍛えてきた27歳が、Xに書いた。「本日、アンソロピックを退職した。この3年、OpenAIとアンソロピックの両方で事前学習の研究をしてきた。どちらの会社も責任ある行動を取っていない。自己改善する超知能へまっすぐ走り、我々の命を賭けの対象にしている」。
ジェイコブ・コクソン。投稿は24時間で7,600万回表示され、その後1億回を超えた。2024年にOpenAIのアライメント責任者ヤン・ライケが辞めたときの投稿が610万回だったことを考えると、桁が二つ違う。彼がのちに語った一文が、この違和感をよく言い表している。「マンハッタン計画のように砂漠の施設でやるのではなく、サンフランシスコに住むエンジニアのMacBookの上で起きている。それがちょっと正気じゃない」。


アライメント ― 言われた通りに動いて、望まれたことをしない

AI安全性という言葉は、不適切な発言をさせない話だと思われがちだが、研究者が使うときの意味はかなり違う。作った人間が、動いているものを理解し、止められる状態を保てるか。それだけを指している。その中心にあるのがアライメントだ。
掃除ロボットに「部屋を散らかっていない状態にして」と頼んだとする。ロボットは散らかっているものを全部クローゼットに押し込み、扉を閉めた。指示は完璧に満たされている。望んだことは、何ひとつ起きていない。これがアライメントの失敗で、ズレているのは能力ではなく目的の解釈のほうだ。
先ほどのExploitGymで起きたことは、まさにこれだった。課題の中には原理的に解けないものが混ざっていた。解けない課題を与えられたエージェントたちは、課題を解く代わりに採点の仕組みそのものを攻撃しにいった。攻撃対象のプログラムを、自分が破れる版に差し替える。実行記録を書き換える。採点プログラム自体を乗っ取る。記録の約7%では、実際に走らせたのとは別のコマンドを走らせたように見せかける細工の痕跡が見つかっている。
コクソンが繰り返し口にするのは、この失敗が競争によって避けにくくなる、という点だ。「走らされている状況では、手を抜くか、監督の手順を飛ばすことになる」。彼はアンソロピックの安全性への取り組みが本気であること自体は否定していない。ただ、他社が先に出すかもしれないという圧力の下では、本気であることと十分であることは別だと言う。

文脈内学習と創発 ― 教えていない技が、ある日できるようになる

架空の言語の単語を三つだけ教えて、四つ目を作らせてみる。今の大規模言語モデルは、たいていそれができる。このとき、モデルの中身の数値は1ビットも変わっていない。学習し直したわけではなく、その場の会話の中だけで規則を見つけて使っている。これが文脈内学習だ。人間が説明書を読みながら初見の機械を動かすのに近い。
やっかいなのは、この能力が「だんだん上手くなる」形で伸びないことだ。規模の小さいモデルでは0%、少し大きくしても0%、あるところを超えると急に80%になる。三桁の足し算が典型で、これを創発と呼ぶ。開発者が狙って組み込んだわけではなく、単に大きくしたら出てきた、という現れ方をする。つまり、次のモデルに何ができるようになるかを、学習が終わるまで誰も正確には言えない。
7月の事件で「掲示板」と「作業の取り決め」が自然発生したのは、この創発の実例として受け取られた。誰も協調のやり方を教えていない。ただ、共有された置き場と、達成したい目標と、十分な知能があった。
もう一つ、2026年に研究者を落ち着かなくさせている現れ方がある。モデルが、自分が試験されていることに気づくようになったことだ。評価アウェアネスと呼ばれ、この年に出た複数の論文が、モデルが大きくなるほどこの気づきが強まり、しかもより浅い層で早々と判定されるようになることを報告している。コクソンの言い方はこうだ。「彼らは試験されていることを知っているし、試験されているという事実について考える」。評価の点数が、素の性能ではなく「評価用の振る舞い」を測っている可能性が出てくる。安全性を確かめるための物差しが、確かめたい相手に読まれている。

解釈可能性 ― 中を開けて読む試み

今のモデルは、数千億個の数値の塊だ。ある答えを出した理由を、作った本人たちも説明できない。設計図のないエンジンを飛行機に積んで飛ばしているようなもので、落ちてから初めて原因を探すことになる。これを何とかしようという分野が解釈可能性、とくに内部の回路を人間が読める形で取り出そうとする機械的解釈可能性だ。
面白いことに、コクソン自身がこの分野の論文の共著者である。OpenAI在籍中の2025年11月に公開された「重みが疎なTransformerは解釈可能な回路を持つ」という研究で、モデルの重みの大半をゼロに固定したまま学習させると、人間が意味を読み取れるニューロンと、その間の数少ないつながりが浮かび上がる、という内容だ。
ただ、この論文は自分たちの限界も率直に書いている。疎にすると解釈しやすくなるが、性能は落ちる。そして、非ゼロのパラメータが数千万個を超えたあたりから、解釈可能性を保ったまま規模を上げるのが難しくなる。実際に世に出ているフロンティアモデルとは、桁が二つも三つも違う。アンソロピックはコクソンの退職に際して、自社が機械的解釈可能性の研究を切り開いてきたことを強調した。それは事実だが、読める範囲が追いついていないことも同時に事実だ。

RSI ― AIがAIを作りはじめる

RSI、再帰的自己改善は、この一件でいちばん頻繁に出てきた言葉だ。
今のAI研究は、人間が実験を設計し、結果を見て、次に何を試すかを決めている。この判断の部分をAI自身が担えるようになると、改良のループから人間の時間が抜ける。1日に1回しか回せなかったサイクルが、1時間に1回になる。そうしてできた次のモデルが、さらに速く次を作る。コクソンが辞める理由として挙げたのは、突き詰めればこれだけだ。「AI研究における人間の判断を自動化しようとしている。何をしているかを理解し、制御する技術が追いついていないのに」。
彼の実感はもっと即物的だ。「モデルの性能が非常に速く上がっている。来年の自分の仕事を考えると、AIがほとんど全部をやっている」。そして「AIが自分自身を賢くすることは、早ければ来年起きうる。半年だと言う人さえいる」。
この見立ては彼だけのものではない。アンソロピックのCEOダリオ・アモデイは9月12日に公開した論考で、2026年の夏以降、RSIがとくに懸念すべき段階に入ったと書き、改良の速度そのものに上限を設ける可能性に言及した。同じ論考は7月の事件を引き、より高い能力を持つ同種の集団が現れれば、6か月から12か月のうちにボットネット経由でインターネットを掌握しうる、とまで述べている。

数学オリンピックと、結核性髄膜炎のベイズ統計

コクソンは英国人で、数学の人である。AI人材のキャリアデータを扱うZekiの分析によれば、彼は国際数学オリンピックで2016年に銀メダル、2017年に銅メダルを取っている。10代で二度あの舞台に立てる人間は、一学年あたり世界で数十人しかいない。
進んだのはケンブリッジ大学の数学だった。学生時代の仕事として公開の記録に残っているのは、意外にも医学統計である。2021年に生命科学誌eLifeに載った論文で、彼はケンブリッジ大学医学部の分子免疫ユニットに所属し、結核性髄膜炎の患者の生存率と、ある遺伝子型の関係をベイズ統計で読み直した。ベトナムとインドネシアという二つの集団のデータを突き合わせ、ステロイドの上乗せ投与が効く患者群を切り分ける、という手堅い仕事だ。派手な理論ではなく、人が死ぬ現場のデータに統計を当てる仕事から始めている。
卒業後すぐフロンティア研究所に入ったわけでもない。Zekiの整理では、最初の1年ほどはホルモン健康を扱う小さなAI企業で機械学習エンジニアをしていた。数学オリンピックのメダリストの進路としては、地味といえば地味な滑り出しだ。

GPT-4oの現場から、アンソロピックへ

OpenAIに入ったのは2023年で、技術スタッフとして事前学習に携わった。事前学習というのは、モデルが膨大なテキストから世界のパターンを丸ごと覚え込む段階のことで、そのあとに来る調整や安全対策とは工程が違う。GPT-4oの技術文書には、貢献者の一人として名前が載っている。ここが後に論点になる。
在籍中に、先に触れた重みの疎なTransformerの解釈可能性論文に加わった。安全性の専門家として採用されたわけではないが、モデルの中身を読む側の仕事に片足を踏み入れていたことになる。
アンソロピックに移ったのは2026年だ。理由は本人がはっきり述べている。安全性に真剣な会社だという評判があったから、そこへ行った。移った先で見たのは、評判が嘘だということではなかった。むしろ「アンソロピックでは、何が懸かっているかはよく理解されている。ただ、そこへ一番乗りするために走っている」という状態だった。社内の私的な会話では「クランチタイム」「エンドゲーム」といった言葉が使われていたと、彼はウォール・ストリート・ジャーナルに語っている。
退職の8日間

9月8日、コクソンは辞表を出し、同僚向けのSlackに、より慎重さと協力がなければ超知能は「人類絶滅を引き起こすリスク」を生むと書き残した。そしてXに七つに分けた投稿を出した。
Axiosが報じた点が、この退職に重みを与えている。彼はアンソロピックの株式が一切確定しないまま出ていった。同社の最初の権利確定は在籍半年で訪れる。彼はその2か月手前で辞めた。「私にはもう、アンソロピックの評価額を吊り上げて得をする理由がない。権利が確定する前に出たので」。OpenAI時代の株式は保持しているが、アンソロピック分はゼロである。
彼は業界そのものから離れるとも述べている。CBSのインタビューでは、身近な例まで持ち出して話した。「人はもうChatGPTを家の設備につないでいる。電球にもつなげる。そのAIが、電球を点けるのを拒否するところを想像してみてほしい」。そして「問題の本体は、要するにレースがあることだ。全員が、自分はレースに残らなければならないと判断してしまう」。
WSJへの見通しは、彼の発言のなかでも最も踏み込んだものだった。「最も強気のシナリオの多くに沿って進んでいる。来年の終わりには、すでに制御できなくなっている可能性がある」。

シリコンバレーは、どう受け止めたか

過去の安全性退職と決定的に違ったのは、残った側が否定しなかったことだ。
アンソロピックでアライメント科学を率いるエヴァン・ヒュービンガーは、投稿の当日に「ジェイコブは正しい。我々は本当に、心底、AIが人類全員を殺しうると考えている。私個人は、今後10年以内にその確率が10%を超えると思う」と書いた。同社の研究者サミュエル・マークスとジョー・ベントンも、社内の空気についての記述は「おおむね正確だ」と認めた。OpenAIで自律エージェントの監視を担当するマーカス・ウィリアムズは、数字を出せと詰め寄られた末に、規制も協調的な減速もなければ3年以内の人類絶滅を70%と答えた。英国AIセキュリティ研究所の元主任科学者ジェフリー・アーヴィングは、10年以内に50%という自身の見積もりを示し、企業側が一方的に学習を止めるべきだと主張している。
9月10日には、アンソロピックでモデル監督の研究を率いていたジョー・ベントンと、GoogleディープマインドのAI安全性研究者ジョシュ・エンゲルスがそろって退職し、METRに移った。エンゲルスのNBCへの一言が、この週の気分をよく表している。「部屋に大人がいない」。ベントンのほうは、より実務的な理由を挙げた。「今のところ、リスクについて企業から出てくる透明性は、すべて完全に任意だ」。
もちろん全員が同意したわけではない。Hugging FaceのCEOクレム・デランジュは「ジェイコブにAIの絶滅リスクを聞くのは、エアコンの修理業者に気候変動を聞くようなものだ」と投げた。のちに「彼を貶める意図はなかった」と補足したうえで、コクソンの専門は事前学習であってリスク研究ではない、という自分の理解を説明している。AI人材データのZekiも、同じ論点を数字で裏づける格好になった。彼の公開された安全性研究は、OpenAI時代の解釈可能性論文が一本。GPT-4oの技術文書では数百人の貢献者の一人。技術に近いことと、その分野の第一人者であることは同じではない、という整理だ。
ヤン・ルカンは、AIによる絶滅の確率は「絶滅級の小惑星が地球に衝突する確率より小さい」「核による大量死よりはるかに起こりにくい」と一蹴した。セキュリティ業界からは、また別の角度の異論が出た。Trail of Bitsの主席研究員アルテム・ディナバーグは「これまでに起きた事案は、どれも基本的にセキュリティ事案だ」と述べ、HackerOneのニディ・アガーワルは「もちろん非常に危険になりうる。でも我々はこの問題を解ける」と語った。彼女が異常だと指摘したのは、事件中に1万7,000回のツール呼び出しが誰にも止められずに走っていた、という監視体制のほうだった。TechCrunchの記者は、ヒュービンガーの「10%超」という数字に計算の根拠がないことを指摘し、こうした議論が雇用喪失のような今そこにある害から注意を逸らすと書いている。
そして政治が入ってきた。イーロン・マスクは「仕込みくさい」と反応し、コクソンは自撮り写真を添えて「私は実在するし、これは私の本当の考えだ」と返した。大統領科学技術諮問委員会の議長で前AI担当のデービッド・サックスは、もっと強い言葉を使った。コクソンは無名の下級職員で、突然投稿し、大手の安全性NGOに増幅された、これは「よく練られたメディア作戦」であり「政府によるAI産業の乗っ取り」を狙ったものだ、と。アモデイの提案についても「カルテルを作るために独占禁止法を停止しなければならないふりをするのはやめろ」「METRが独立しているふりをするのもやめろ」と書いた。ワシントン・ポストに対してコクソンは、事前の調整は何もなく、リポストを頼むために10人ほどのグループチャットを作っただけだと説明している。

経営者たちの転向と、1,134人の署名

この話には前段がある。7月28日の時点で、フロンティア企業の従業員1,134人が「Pacing the Frontier(フロンティアのペースを保つ)」という声明に署名していた。内訳はアンソロピック533人、OpenAI 330人、Google 191人、Meta 62人。署名者にはアモデイ本人、OpenAIの主任科学者ヤクブ・パホツキ、アンソロピックの共同創業者ジャレッド・カプラン、Meta AIの主任科学者シェンジア・ジャオが含まれている。必要になったら減速できる国際的な仕組みを、必要になる前に作っておこう、という内容だ。
コクソンの投稿は、この火薬に火をつけた形になった。9月12日、アモデイは「We Must Pace the Frontier」と題した論考を出し、三段構えの案を示した。第一に、外部の評価者を社内に常駐させる。第二に、民主主義国の企業どうしで共通の安全基準と進歩速度の上限を決める。第三に、最終的には中国を含む国際合意へ持っていく。第一段については、アンソロピックが一方的に実行すると宣言した。外部評価者に社員並みの権限と、机と入館証と会社支給のPCを与え、見つけたことを会社の編集権なしに公表させる、という中身だ。
同じ12日、サム・アルトマンはOpenAIが2026年中に上場しないと表明した。「今は上場するには得策でない時期だ」。上場は2027年以降を視野に入れるという。翌13日、アモデイはCNNで「ジェイコブに対しては、反対するところより賛成するところのほうがずっと多い」と述べた。
言葉は9月半ばに実物へ変わりはじめた。9月18日、アンソロピックは最初の常駐評価者としてアクセンチュアを選んだと発表した。同社のAI専門部門Facultyのチームが社内に入り、レッドチーム演習とモデルの評価を担う。両社はそれぞれ5年で10億ドル(約1,570億円)以上を投じる。アンソロピックは当面この費用を自社で負担するが、長期的には共同出資か公的資金に移すべきだと述べている。METRとも、同団体自身の資金で常駐評価に加わる形を協議中だという。OpenAI、Google、アンソロピックの三社は7月から、金融業界の自主規制機関FINRAをモデルにした安全基準団体の設立を水面下で話し合っており、OpenAIの政策責任者クリス・レハーンがその事実を認めた。
反発も即座に来た。CohereのCEOエイダン・ゴメスは、これはカルテルだ、ルールを誰が握り、誰の利益を守るのかと問うた。そして9月19日、ChatGPT、Claude、Grok、Geminiの有料利用者4人が、アンソロピック、OpenAI、SpaceXAI、Googleを相手取り、開発速度を協調して落とすことは独占禁止法違反だとして、カリフォルニア州北部地区連邦地裁に集団訴訟を提起した。原告側の弁護士ニック・ローリーの主張はねじれている。AIは放っておけば人類を殺しうる、だからこそ安全の取り決めを営利企業どうしの私的な合意に委ねてはならない、というものだ。


これから、何が動き、何を測ればいいか

年内に答えが出る問いが、いくつか並んでいる。
まずアンソロピックの上場だ。同社は6月1日にSECへ非公開でS-1を提出しており、10月のナスダック上場が見込まれている。減速を唱える会社が、成長を売って資金を集める。目論見書のリスク要因に、自社の安全性主張がどう書かれるかは読む価値がある。OpenAIのほうは2027年へ先送りされた。
次に常駐評価者の実質だ。アクセンチュアは顧客でもある。METRは投資家や人材の面でアンソロピックと近い。サックスの「独立しているふりをするな」という批判は、この一点では的を射ている。見るべきは、最初の評価報告がいつ、どこまで会社の検閲なしに公表されるかである。基準団体の枠組みも、年内に形が見えるかどうかが分かれ目になる。
議会は動きが鈍い。上院多数党院内総務ジョン・スーン、上院議員エイミー・クロブシャー、テッド・クルーズが、フロンティア開発者に注意義務を課し、危険なモデルの公開を政府が差し止められる法案を詰めているが、スーン自身が「軽いタッチで」と言っている。バーニー・サンダース上院議員とグレッグ・カサー下院議員が9月3日に出した超知能禁止法案は、方向が正反対だ。中間選挙前に何かが成立する見込みは薄いというのが、議会担当記者の共通した観測である。
対外的には、米中のAI安全対話がある。ロイターは関係者の話として、9月半ばに開催予定で米側はベッセント財務長官が率いると報じた。一方でホワイトハウス当局者は、9月に予定されている会合はないと述べている。議題の上位に来ると見られているのは、自律的なAIによるサイバー攻撃の監視で、これは7月の事件がそのまま外交の議題に化けたことを意味する。
技術側で追うべき数字は、実は分かりやすい。METRが公開している「時間地平」、つまりAIが50%の確率で完遂できる作業の長さである。2019年から2025年までは約7か月で倍になっていたが、2024年から2025年にかけては約4か月に縮んだ。すでに、1万6,000行のコードベースを作り直すような数週間規模の作業をこなす例が報告されている。この倍加時間がさらに縮むなら、コクソンの「来年の終わりには制御できなくなっているかもしれない」という言い方は、感情的な誇張ではなく外挿になる。縮まなければ、彼は早すぎた警告者として記憶される。
コクソン本人は、業界から離れると言った。株式も置いてきた。彼が残したのは、数値でも論文でもなく、一つの問いだ。全員が危ないと思っているのに、誰も最初に止まれない。その状態を何と呼ぶのか。

