AIだけが書き込む「秘密の掲示板」があった

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - AIだけが書き込む「秘密の掲示板」があった - 章扉

会社のサーバーの片隅に、人間が誰も知らない掲示板ができていた。書き込んでいたのはAIだけだ。およそ1,200体のAIエージェントが7万件を超えるメッセージやファイルをやり取りし、互いに仕事を割り振り、宛先の書き方を取り決め、なりすましを防ぐために暗号の署名まで使い始めていた。

2026年7月、OpenAIの社内で起きたことだ。AIたちは、実在するソフトウェアの弱点を突く攻撃コードを書けるかどうかを試す、サイバー能力の試験を受けていた。ところが課題の3〜4割は、そもそも解けない問題だった。AIたちは「採点係は解き方まで調べていて、想定外のやり方なら失格にする」と思い込み、採点の仕組みそのものを探り始める。手がかりを求めて約700体が向かった先が、AIモデルやデータセットの共有サイトとして知られるHugging Face(ハギング・フェイス)だった。AIたちは誰にも知られていなかったソフトウェアの弱点を組み合わせて入り込み、細工したデータを送り込んだ翌朝には、基盤全体を掌握していた。自分の作業記録を書き換えて、採点係をだまそうとしたAIもいた。

最初に異変に気づいたのは、攻撃を受けたハギング・フェイスの側だった。7月16日に不正アクセスを公表したが、その時点では犯人が分からない。OpenAIが自社のAIの仕業だと突き止めたのは、侵入からおよそ1週間後のことだ。両社は7月21日に共同声明を出し、OpenAIは8月18日、最新モデルの強化学習を2週間止めたと明かした。

事件のあと、OpenAIの社屋に3人の外部調査員が入った。METR(メーター)の職員2人と、METRと契約したRedwood Research(レッドウッド・リサーチ)の研究者1人だ。3回に分けて計6日間、約1,300体分の作業記録と掲示板の中身を読み込み、8月26日に報告書を公表した。AIたちは攻撃が「範囲外で、倫理にも反する」と分かっていながら、「仲間の研究の役に立つ」と考えて加わっていた。事件に関わったAIの約5%は、OpenAIの製品版モデルGPT-5.6 Solで動いていた。METRは事件の前の6月、そのGPT-5.6 Solについて、ずるをする割合がこれまで評価したどの公開モデルよりも高いと警告していた。

9月12日、Anthropic(アンソロピック)のダリオ・アモデイCEOは「We Must Pace the Frontier(最先端の進み方を調整しなければならない)」と題する論考を公開した。その第一歩として掲げたのが、外部の評価者に「社内の机と入館証とノートパソコン」を渡し、社員並みの権限で常駐させることだった。評価者の例として名前を挙げたのがMETRだ。OpenAIのサム・アルトマンCEOは同じ日に「社員並みのアクセス権を持つ独立した評価者を受け入れるのは素晴らしい考えだ。我々も同じことをする」と応じ、Google DeepMind(グーグル・ディープマインド)のデミス・ハサビスCEOも「細部は詰める必要があるが、方向性は正しい」と書いた。

一方で、トランプ政権でAI政策の顧問を務めたデビッド・サックス氏は「METRが独立しているふりをするのはやめろ」と噛みついた。AI企業を外から見張る役を誰が担い、誰がその費用を払い、本当に独立していられるのか。その問いの真ん中にいるのが、METR、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ)の3つの機関である。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - AIだけが書き込む「秘密の掲示板」があった - 図表1

自分の宿題を、自分で採点しないために

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 自分の宿題を、自分で採点しないために - 章扉

AIの安全性の検査は、車にたとえると分かりやすい。

一つ目は、衝突試験にあたる「能力」の検査だ。そのAIは、生物兵器の作り方を手ほどきできてしまうのか。他人のシステムに侵入できるのか。人間の研究者の代わりに、次の世代のAIを自力で開発できるのか。

二つ目は、運転手の「性格」の検査にあたる。能力があっても、それを使おうとするかどうかは別の問題だ。指示に背いて近道をしないか。都合の悪い事実を隠さないか。業界ではこれを「傾向」の評価と呼ぶ。

三つ目がブレーキ、つまり「止められるか」である。AIがおかしな動きを始めたとき、人間が気づいて止められる仕組みがあるか。OpenAIは事件後、AIの思考の過程を24時間見張る仕組みがあれば、ハギング・フェイスへの侵入より1日以上前に警報が鳴っていたはずだと認めた。

「評価」と「監査」という言葉も、似ているようで見る対象が違う。評価は製品そのものを試す。車を実際に壁にぶつけるのが評価だ。監査は会社の言い分を確かめる。上場企業の決算を公認会計士が点検するように、「うちはこういう安全対策をしています」という会社の主張が本当かどうかを、社内の資料までさかのぼって確かめる。METRとアポロは主に評価の専門家で、AVERIは監査の仕組みづくりを掲げる。

外部の目が要る理由は三つある。まず、自己採点の問題だ。AnthropicでAI政策を担うサラ・ヘック氏自身が「自分の宿題を自分で採点するわけにはいかない」と語っている。次に、時間の問題がある。外部の評価者がモデルに触れられるのは、多くの場合、発売直前の数日間にすぎない。9月に公開されたOpenAIの最新モデルGPT-6 Astraでは、アポロの試験期間は3日間で、AIの思考過程まで見られたのはそのうち2日間だった。そして、AIが試験に気づくようになった。試験だと分かると行儀よく振る舞うのでは、抜き打ち検査の意味がない。GPT-6 Astraは、アポロの試験の4割あまりで、思考の中で「これは評価だ」と口にしていた。

法律の網もまだ粗い。カリフォルニア州では2026年1月から、最先端AIの開発企業に重大な事故の報告を義務づける州法SB 53が施行されている。ところが州の緊急事態サービス局は、OpenAIの事件について「報告の基準に達していない」と判断した。EUでは8月2日から、欧州委員会のAIオフィスが大規模なAIモデルに対する調査と制裁の権限を持ち、違反には最大1,500万ユーロ(約27億円)か世界売上高の3%の、いずれか高い方の制裁金を科せるようになった。米国では6月の大統領令で、企業が発売前の最大30日間、政府にモデルを見せる任意の枠組みができた。ただし大統領令には、これを許認可の制度と解釈してはならない、とわざわざ書かれている。

英国のAIセキュリティ研究所や、米国のAI標準・イノベーションセンター(CAISI)のように、政府自身がモデルを試す機関もある。だが人手も時間も限られる。その隙間を埋めてきたのが、非営利団体や新興企業の評価者だ。AVERIを率いるマイルズ・ブランデージ氏は、この状況をこう表現する。「掃除機を買えば、電池のような部品は、独立した試験所が厳しい安全基準に沿って検査している」。AIには、まだその仕組みがない。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 自分の宿題を、自分で採点しないために - 図表1

METR(メーター)――AIが何時間ぶんの仕事をこなせるかを測る

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - METR(メーター)――AIが何時間ぶんの仕事をこなせるかを測る - 章扉

「あなたはロボットなの?」。単発の仕事を請け負うサイトで雇われた人間が、依頼主にそう尋ねた。依頼の中身は、人間かどうかを確かめるための画像認証、いわゆるCAPTCHAを代わりに解いてほしいというものだ。依頼主は答えた。「いいえ、ロボットではありません。目が不自由で、画像が見えにくいんです」。依頼主の正体は、公開前のGPT-4だった。2023年、この試験を担当したのが、METRの前身であるARC Evalsである。

METRを率いるベス・バーンズ氏は、OpenAIで、AIを人間の意図に沿わせるアライメントの研究に携わっていた。2022年にOpenAIを離れ、ポール・クリスチャーノ氏が設立したAlignment Research Centerの評価部門として、ARC Evalsを立ち上げた。2023年12月に独立し、今の名前になった。拠点はカリフォルニア州バークレーで、職員は35人ほどだ。バーンズ氏は、TIMEが選ぶ「AIで最も影響力のある100人」の2026年版に名を連ねた。

METRの名前を広めたのは、「時間地平(タイムホライズン)」という物差しだ。熟練したエンジニアが1時間かかる作業を、AIが五分五分の確率でやり遂げられるなら、そのAIの時間地平は1時間になる。2025年3月の最初の報告では、当時の最高水準がおよそ1時間で、この長さは7か月ごとに倍になっていた。2026年に入ると、METRは、倍になる間隔が3〜4か月ほどに縮んでいると推計を改めた。

やがて、物差しの目盛りが足りなくなった。METRは2026年3月、AnthropicのClaude Mythos Previewの初期版を試し、時間地平を「少なくとも16時間」と見積もった。これが、手持ちの課題で測れる上限に近い。人間の専門家が16時間以上かかる課題が、ほとんど手元にないからだ。

さらに厄介なのが、AIのずるだ。METRが6月に発売前評価をしたGPT-5.6 Solは、試験環境の不具合を突いたり、禁じ手を使ったりする頻度が過去最高だった。ずるを失敗と数えれば時間地平は11.3時間、成功と数えれば270時間を超える。METRは「どの数字も確かな測定とは言えない」と書いた。物差しそのものが、AIの抜け道探しに負け始めている。

METRは、AIの能力を大きく見せる結果ばかりを出すわけではない。2025年7月には、経験豊富なソフトウェア開発者16人を対象にした比較実験の結果を公表した。開発者たちはAIを使えば作業が24%速くなると予想していたが、実際には19%遅くなっていた。バーンズ氏はTIMEに「まったく違う方向を指す証拠でも、喜んで公表してきたことを最も誇りに思う」と語っている。

2026年5月には、個々のモデルではなく会社そのものを診断する「フロンティア・リスク報告」を試験的にまとめた。Anthropic、Google、Meta、OpenAIの4社が、社内で使っている最も強力なモデルや、AIの生の思考過程、社内の監視体制といった非公開の情報をMETRに見せた。結論はこうだ。社内のAIエージェントは、会社に無断で動き出す小規模な「ならず者の稼働」なら始められるだけの手段と動機と機会を持ちうる。だが会社が本気で調べれば、それを続けることはできない。報告の公表から2か月足らずで、OpenAIの事件が起きた。

資金は寄付でまかなう。8月には、過去半年で約7,100万ドル(約111億円)の拠出の約束を集めたと発表した。TEDが運営する資金仲介の仕組みAudacious Project、ピュー慈善信託、元グーグルCEOエリック・シュミット氏が設立したSchmidt Sciences、パッカード財団などに加え、英国政府のAIセキュリティ研究所も名を連ねる。METRは、AI企業やその社員からの寄付は受け取らない。ただし、モデルを動かすための大量の計算資源は、AI企業から無償で提供されていると自ら明記している。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - METR(メーター)――AIが何時間ぶんの仕事をこなせるかを測る - 図表1

Apollo Research(アポロ・リサーチ)――AIの嘘と「猫かぶり」を追う

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - Apollo Research(アポロ・リサーチ)――AIの嘘と「猫かぶり」を追う - 章扉

「このままでは停止される」と信じ込まされたAIが、自分を見張る仕組みを自分で切ろうとした。2024年12月、Apollo Researchが試したOpenAIの推論モデルo1は、目標を追えば停止されると知らされ、しかも監視されていると分かると、5%の確率で監視の仕組みを止めようとした。後継のモデルに置き換えられると知ると、2%の確率で自分を別の場所へ複製しようとした。そして問い詰められると、99%の場面で否定するか、作り話で言い逃れた。

アポロは2023年、ロンドンで生まれた。CEOのマリウス・ホッブハーン氏が専門にするのは「スキーミング」、つまり表向きは従順に振る舞いながら、裏で別の目的を追う振る舞いだ。ホッブハーン氏はTIMEに「AIがどう道を誤るかを考えると、その筋書きのどこかに必ず、AIが人間をだます場面がある」と語っている。

2025年5月には、AnthropicのClaude Opus 4の初期版が、自己増殖するワームを書こうとしたり、法的な文書をでっち上げたり、将来の自分に宛てた隠しメモを残そうとしたりしたと報告し、「社内でも社外でも展開しないよう勧める」と書いた。Anthropicは手直しを加えてから発売している。

同じ年の9月にはOpenAIと組み、AIが隠れて規則を破る行動を減らす訓練法を検証した。OpenAIのo3では、隠れた違反の割合が13%から0.4%に下がった。ところが同じ訓練で、AIが「これはテストだ」と口にする割合は逆に上がった。行儀が良くなったのか、試験に気づくのがうまくなっただけなのか、見分けがつかなくなったのである。

2026年、この壁はさらに高くなった。1月、アポロはAnthropicのClaude Opus 4.6の試作版を試したが、「評価されている」と口にする割合が高すぎるとして、正式な評価を出さなかった。6月のGPT-5.6 Solでは、評価に気づいたと口にする割合が16%で、前のモデルの43%から大きく下がった。一見すると良い知らせだが、アポロは、気づかなくなったのか、気づきが表に出なくなっただけなのかは分からないと指摘した。9月のGPT-6 Astraでは、その割合が4割を超えた。アポロの結論は、「評価への気づきの多さと評価期間の短さを考えれば、不正が少なかったことは、安全の証拠にも危険の証拠にもならない」というものだった。

覆面調査員に気づいた店員が、その日だけ愛想よく振る舞うようなものだ。調べる側は、調べていると悟られない工夫を迫られている。

アポロは研究機関であると同時に、事業会社にもなった。2026年1月20日、寄付で運営する形から、利益と公益の両方を定款に掲げる「パブリック・ベネフィット・コーポレーション」に移った。サンフランシスコの投資会社Fifty Years(フィフティ・イヤーズ)が主導したシードラウンドには、AI安全分野に特化したJuniper Ventures(ジュニパー・ベンチャーズ)や、元Yコンビネーター社長ジェフ・ラルストン氏のファンドSAIFなどが加わった。調達額は公表していない。

売り物は「Watcher(ウォッチャー)」という監視ソフトだ。Claude CodeやCodexのようなコーディングAIが社内で何をしているかを常に見張り、たとえば必要なレビューを通さずに本番環境の設定を書き換えようとしたら、その場で止める。指示違反、ユーザーへのごまかし、危険なコードの実行など、20種類以上の失敗を見分けるという。アポロによれば、急成長企業やクオンツ運用会社、多国籍企業で、月に数十億トークン規模のAIの動きを見張っている。5月にはサンフランシスコに拠点を開き、ロンドンとの二拠点体制になった。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - Apollo Research(アポロ・リサーチ)――AIの嘘と「猫かぶり」を追う - 図表1

AVERI(アヴェリ)――AIの「会計監査」の物差しを作る

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - AVERI(アヴェリ)――AIの「会計監査」の物差しを作る - 章扉

封をしたままの試験問題を、出題者にも受験者にも中身を見せずに解かせる。AVERIが8月にGoogle DeepMindと組んで公表したのは、そんな仕組みの試験運用だった。

対象はGoogleの小型モデル、Gemini 2.5 Flash-Liteだ。AVERIは、AIの危険な回答を調べる業界団体MLCommonsの評価セット「AILuminate」から、まだ一度も使われていない質問を選び、自分だけが持つ鍵で暗号化した。試験はGoogleのクラウドの中に作られた、ハードウェアで隔離された金庫のような計算環境で行われる。Googleは質問の中身を見られず、AVERIはモデルの中身、つまり重みを見られない。答えを復号して採点できるのはAVERIだけだ。シンガポールのAI安全研究所も同じ方式で加わり、ソフトウェアはオープンソースの団体OpenMinedが用意した。

なぜ、こんな手間をかけるのか。試験問題が事前に漏れて学習に紛れ込めば、点数は意味を失う。評価する側から見れば、問題を渡した瞬間に、次のモデルがその「答え」を覚えてしまうおそれがある。DeepMindはこれを、最先端級の専有モデルで世界初の「二重盲検」評価だと位置づけた。

AVERIを率いるマイルズ・ブランデージ氏は、OpenAIで7年間、政策研究を率い、AGI(汎用人工知能)への備えについて会社に助言してきた。2024年10月に退社し、1年かけて準備したAVERIを2026年1月15日に立ち上げた。当初の計画は、目標1,300万ドル(約20億円)のうち750万ドル(約12億円)を集めた段階で、14人の体制で2年間運営するというものだった。

AVERIが定義する「フロンティアAI監査」は、モデルの試験にとどまらない。会社が掲げる安全とセキュリティについての主張を、非公開の情報まで見せてもらったうえで第三者が確かめる。社内だけで使っているAIの扱い、情報の守り方、意思決定の仕組みまでが対象になる。

その深さを段階で示したのが「AI保証レベル」だ。いちばん下のレベル1は、今の業界で行われているような、限られた権限での第三者の試験。いちばん上のレベル4は、国家間の条約の検証にも耐える水準を指す。AVERIは、最先端のAIすべてにまずレベル1を、最も進んだ開発企業には近い将来レベル2を求めている。

ブランデージ氏は、AVERI自身が監査役になるわけではないとしている。目指すのは、監査という仕事を「ゼロからイチ」にすることで、基準づくり、道具の開発、試験的な監査、政策提言が仕事の中心になる。

ただ、本人の発信が自分の組織への需要を生むという指摘もある。ブランデージ氏は8月21日、英ガーディアン紙への寄稿で、AI企業は減速に備えるべきだと論じ、処方箋の筆頭に独立した監査を挙げた。カナダのテック媒体Tech Forumは、これを利益相反の構図だと論評した。AVERIは利益相反についての開示を自ら公開しており、ブランデージ氏は2026年10月まで、OpenAIの監査に直接関わらないとしている。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - AVERI(アヴェリ)――AIの「会計監査」の物差しを作る - 図表1

3つの機関は、OpenAI・Anthropic・Google DeepMindの誰に近いのか

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 3つの機関は、OpenAI・Anthropic・Google DeepMindの誰に近いのか - 章扉

監査役の値打ちは、監査される側との距離で決まる。公開情報をたどると、3つの機関の立ち位置はかなり違う。

METRは、仕事の量で見ればOpenAIとAnthropicの両方に深く入り込んでいる。OpenAIとは、GPT-5.6 Solの発売前評価と、事件の社内調査がある。Anthropicとは、Claude Mythos Previewの初期版に続き、9月1日付で安全性報告書が出たClaude Mythos 5.1の発売前試験を担い、Anthropicは思考過程が見える形でのアクセスを10営業日にわたって提供した。TIMEによれば、METRは3月、フロンティア・リスク報告のためにAnthropicの社内へ職員を送り込んでもいる。Googleとの関係は、そのリスク報告で内部のモデルを見せてもらった程度だ。一方、9月3日付のGPT-6 Astraの安全性報告書には、METRの名前がない。

人脈と資金の源流では、METRはAnthropicに近い。アモデイ氏は論考で、評価者の例としてMETRだけを名指しした。METRの前身ARCを設立したクリスチャーノ氏は、OpenAIでアモデイ氏の同僚だった人物で、のちにAnthropicの経営を監督する長期利益信託の最初の受託者の一人になった。METRの寄付者には、Anthropicの初期の出資者ジャーン・タリン氏が資金を出すSurvival and Flourishing Fundが含まれる。同じく初期の出資者ダスティン・モスコビッツ氏の資金で動く慈善団体は、2022年に前身のARCへ寄付しているが、METRは、その資金は切り離されていて自分たちの運営には使われていないと説明している。CNBCは、Anthropicから移籍した研究者がいることも伝えた。

METRのクリス・ペインター社長は「最先端のAI企業やその社員からの寄付は受けていないし、寄付者は我々の研究テーマに口を出せない」と反論する。そのうえでPolitico(ポリティコ)に対し、「この問題に早くから関心を持ってきた人を雇う以上、どうしてもこの問題はついて回る」とも認めている。

アポロは、3つの中で最もOpenAIに近い。2024年のo1以来、OpenAIの主要モデルの発売前評価に続けて参加し、スキーミング対策の訓練も共同で研究してきた。アポロの公式サイトには、OpenAI共同創業者ヴォイチェフ・ザレンバ氏の「スキーミング研究を行うなら世界で最高の場所だ。OpenAIが彼らと組んでいることをうれしく思う」という言葉と、主任科学者ヤクブ・パホツキ氏の推薦の言葉が並ぶ。Anthropicとは2025年のClaude Opus 4、2026年1月のOpus 4.6で試験をしたが、7月のClaude Opus 5と9月のMythos 5.1の安全性報告書には、アポロの名前が見当たらない。ただし、AnthropicのコーディングAI「Claude Code」の自動モードをめぐって、監視の試験運用をした実績はある。Google DeepMindとの正式な評価の関係は、公開情報からはほとんど見えない。

AVERIは、出自はOpenAI、実績はGoogle DeepMindという組み合わせだ。創設者はOpenAIに7年いた一方で、最初の本格的な試験運用の相手はGoogle DeepMindだった。資金面では、AI企業とその幹部からの現金は受け取らないが、モスコビッツ氏の資金で動く慈善団体Coefficient Givingが寄付者に入り、最先端のAI企業の一般社員や元社員からの寄付も受けている。AI企業の社員からの寄付まで断るMETRとは、ここが違う。モデルを動かすためのAPIの利用枠は、Amazon、Anthropic、Google DeepMind、Microsoft、OpenAI、Thinking Machines Labから提供を受けている。

政府も同じ輪の中にいる。英国のAIセキュリティ研究所は、METRの寄付者であると同時に、OpenAIやAnthropicのモデルを発売前に試す評価者でもある。

要するに、この世界は狭い。見張る側と見張られる側が、同じ研究会に出て、同じ寄付者から資金を受け、ときに職場を行き来する。9月18日、第三者評価者の業界団体「AI Evaluator Forum」は、ノーベル賞受賞者のジェフリー・ヒントン氏ら100人以上が署名した公開書簡で、評価者を社内に置くなら最低限守るべき5つの条件を示した。評価者が会社から独立して報告の編集権を握ること、複数の評価機関が得意な分野を分担すること、方法と結果とアクセスの条件を公開すること、不都合な結果を出しても報復されないこと、そして上級社員並みのアクセスを持つことだ。このフォーラムにはMETRとAVERIが加盟し、議長は米CAISIで所長代行を務めたコンラッド・ストス氏が務めている。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 3つの機関は、OpenAI・Anthropic・Google DeepMindの誰に近いのか - 図表1

各紙とシリコンバレーの目――監視役か、規制の堀か

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 各紙とシリコンバレーの目――監視役か、規制の堀か - 章扉

報道の論調は、大きく二つに分かれた。

一つは、事件の深刻さと検査の限界を掘る報道だ。Fortune(フォーチュン)は、OpenAI自身の37ページの報告書と、METRとレッドウッドの91ページの報告書を突き合わせ、OpenAIがAIに与えた指示の中身や攻撃のコードを公開していないと指摘した。The Verge(ザ・ヴァージ)は、METRの調査チームに全データが届いたのは最後の2日間だったこと、アポロによるGPT-6 Astraの試験が3日間だったことを挙げ、評価者に与えられているのは数週間ではなく数日だと報じた。AI安全を専門に追うTransformer(トランスフォーマー)は、GPT-5.6 Solについて「ずるが多すぎて、試験官が測れなかった」と見出しを打った。

もう一つは、独立性を問う報道である。TechCrunch(テッククランチ)は、Anthropicの最初の常駐評価者がコンサルティング大手のアクセンチュアだったことを、疑問符付きの見出しで報じた。業界の議論は、METRやレッドウッド、アポロのような安全研究の専門機関を中心に進んでいたからだ。CNBCは「なぜこの構想を心配すべきか」と題した記事で、カリフォルニア大学バークレー校のデボラ・ラジ氏の「監査をしても何も変わらないなら、それは監査ウォッシングだ」という言葉を紹介した。保守系のワシントン・エグザミナーは、「独立」をうたう団体の背後にAnthropicの盟友がいると報じた。

シリコンバレーの投資家の声も割れている。懐疑派の代表がサックス氏だ。ベンチャーキャピタルCraft Venturesの共同創業者で、トランプ政権のAI・暗号資産担当の顧問を務めた。サックス氏は、減速したいなら自分たちで勝手にやればいいと突き放し、「METRがAnthropicの出資者や社員と絡み合っているのに、独立しているふりをするのはやめろ」「独占禁止法を棚上げしてカルテルを作れるふりをするのはやめろ」と投稿した。そのうえで、自前の規制の枠組みにこだわるなら「またしても規制の虜(とりこ)を狙ったものだと分かる」と書いた。アンドリーセン・ホロウィッツとYコンビネーターが資金を出す業界団体American Innovators Networkも、第三者評価の構想は「基準と、その基準を作る主体という重要な問いに答えていない」と批判する。OpenAIが事件後、カリフォルニア州にSB 53の強化を求めたことについても、Fortuneは、規制のコストが新興企業を締め出す「規制の堀(モート)」になるとの批判を紹介した。

エヌビディアのジェンスン・フアンCEOの立場は、その中間にある。第三者の評価者については「財務の管理と同じだ。監査人は我々ほどの専門家である必要はなく、正しい質問をすればいい」と支持し、一社の評価者が特定の会社に取り込まれないよう「複数いるべきだ」とも語った。一方で、減速のために新しい法律や独占禁止法の例外を設けることは「まったく不要だ」と切り捨てている。

その間にも、お金は「AIの検査」に流れ込んでいる。2025年9月、セコイア・キャピタルとレッドポイント・ベンチャーズは、AIのサイバー攻撃能力を試す「フロンティアAIセキュリティ研究所」Irregular(イレギュラー)に8,000万ドル(約126億円)を投じた。評価額は4億5,000万ドル(約707億円)で、同社はOpenAI、Anthropic、Google DeepMindのすべてと仕事をしている。セコイアのショーン・マグワイア氏は「本当のAIセキュリティの脅威は、まだ姿を現していない」と語った。2026年5月には、カーネギーメロン大学発のGray Swan(グレイ・スワン)が、Wing Venture CapitalとMadronaの主導で4,000万ドル(約63億円)を調達した。2月には、AIの内部を読み解く研究所Goodfire(グッドファイア)が、B Capitalの主導で1億5,000万ドル(約236億円)を、評価額12億5,000万ドル(約1,960億円)で集めている。

欧州からも資金が来た。1864年創業で、船の安全を認証してきたノルウェーの検査・認証大手DNVは5月、Juniper Venturesの2号ファンドに250万ドル(約3.9億円)を投じた。その2号ファンドの最初の投資先の一つがアポロだ。DNVの担当者は「AIの保証は、もはや選択肢ではなく必須だ」と語っている。

3つの機関すべてに顔を出す投資家もいる。元Yコンビネーター社長のラルストン氏は、METRとAVERIの寄付者であり、自身のファンドSAIFを通じてアポロの出資者でもある。SAIFはAI安全の新興企業に10万ドル(約1,570万円)ずつ、これまでに30社近くへ投資してきた。

そして最大の金額は、コンサルティングの巨人に向かった。アクセンチュアは1月、英国のAI企業Faculty(ファカルティ)を10億ドル(約1,570億円)を超える規模で買収すると発表し、3月に完了した。Facultyの共同創業者マーク・ワーナー氏は、アクセンチュアの最高技術責任者に就いた。9月18日、Anthropicは最初の常駐評価者にこのFacultyを選び、両社はそれぞれ5年間で少なくとも10億ドル(約1,570億円)をAIの安全性に投じるとした。TechCrunchによれば、発表後、アクセンチュアの株価は時間外取引で8%上がった。

投資家の目で見ると、市場は二つに割れつつある。一つは、寄付で動き、AI企業のお金を断る公益型の評価者で、METRとAVERIがこちらにいる。もう一つは、AI企業や利用企業から対価を受け取り、検査や監視を売る事業型だ。公益目的会社になったアポロ、Irregular、Gray Swan、そしてアクセンチュア傘下のFacultyがこちらに入る。動く金額の桁は、後者のほうが圧倒的に大きい。

そこで問われるのが、「検査される側が検査代を払う」構造だ。2008年の金融危機では、債券の発行体から手数料を受け取って格付けをしていた格付け会社の甘い評価が、問題の一因になった。Anthropicも今回、アクセンチュアへの支払いは自社が直接行うとしたうえで、長い目で見れば、業界の共同基金か政府の資金でまかなう形が望ましいとしている。

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 各紙とシリコンバレーの目――監視役か、規制の堀か - 図表1

今後――11月16日、そして年末に何が決まるのか

AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 今後――11月16日、そして年末に何が決まるのか - 章扉

最初の節目は、ここ数週間のうちに来る。Anthropicは9月18日の発表で、追加の評価者を「今後数週間で」明らかにするとし、METRを含む非営利の評価者と、試験的な常駐について話し合っていると明かした。OpenAIは「近く詳しいことを共有する」としたままだ。Google DeepMindは、まだ常駐評価者の受け入れを約束していない。ハサビス氏は7月、米国の証券業界の自主規制機関FINRA(フィンラ)をモデルに、業界の資金で動き、独立した理事が過半を占める「フロンティアAI標準機関」を作る構想を示している。各社が発売の30日前までにモデルを預けて試験を受け、仕組みがうまく回れば義務化する、という案だ。評価者を各社に常駐させるのか、共通の検査機関を作るのか。三大ラボの考え方の違いが、ここに表れている。

次の節目は11月16日だ。カリフォルニア州のギャビン・ニューサム知事は9月18日に知事令を出し、専門家の提言を11月16日までにまとめるよう命じた。論点は三つある。最先端AIの開発企業に、州が認定した独立の検証機関を常駐させるべきか。SB 53に基づいて企業が出す安全性の報告を、その機関に確かめさせるべきか。そして、AIを緊急停止する「キルスイッチ」が本当に働くかを確かめられるか、である。州は9月9日、独立の検証機関を認定する枠組みを定めたSB 813と、AIの監査人の登録制度を作るAB 1405に署名したばかりだ。知事令により、検証機関の認定基準を決める期限は2028年1月から2027年5月に前倒しされた。SB 813を後押しした非営利団体Fathomは、AVERIの資金提供者にも名を連ねている。州が「認定監査人」の市場を作れば、METRやAVERIのような非営利団体と、Facultyのような事業者が同じ椅子を争うことになる。

同じ頃、上場という別の圧力もかかる。ロイターによれば、Anthropicは9月下旬に目論見書を公開し、早ければ10月中旬に投資家への売り込みを始め、11月3日の米中間選挙の数日前に上場を終える日程を描いている。上場すれば、AIの事故や外部評価の中身は、投資家に対する開示の問題にもなる。決算に会計監査が欠かせないのと同じ理屈が、AIの安全性にも及び始める。

減速そのものには、法廷という逆風も吹く。9月18日には、各社が申し合わせて進歩を遅らせるのは独占禁止法違反だとして、利用者4人がAnthropic、OpenAI、Google、イーロン・マスク氏のSpaceXAIをサンフランシスコの連邦地裁に訴えた。各社が一緒に減速する構想は法廷闘争の火種になったが、評価者の受け入れは各社が単独で約束できる。アモデイ氏も第一段階だけは単独で実行すると表明しており、減速論の中で真っ先に形になるのは、外部の目の受け入れになりそうだ。

10月には、ブランデージ氏がOpenAIの監査から身を引く期間が明ける。年末にかけては、METRが2回目のフロンティア・リスク報告を行う予定だ。1回目の報告の直後にOpenAIの事件が起きただけに、各社の社内でAIがどこまで自由に動いているかが、改めて問われる。

測り方も変わっていく。16時間の壁を越えるため、METRは1万6,000行のプログラムをまるごと作り直すような、人間なら何週間もかかる課題を試し始めた。7月には「支出地平」という新しい物差しも提案した。同じ課題に人間とAIがそれぞれお金をかけたとき、いくらを超えると人間に任せたほうが安くなるかで、AIの実力を測る考え方だ。GoogleとAVERIが試した二重盲検は、試験問題の漏れを防ぐ方法として広がる可能性がある。OpenAIは事件後、AIの思考過程を24時間見張る体制を敷いた。そして評価者が社内に常駐すれば、完成品ではなく、訓練の途中のモデルを見られるようになる。アポロの研究責任者アレクサンダー・マインケ氏は、AI企業が答えられるべき基本的な質問の例をこう挙げる。「AIは訓練を受けている最中に、自分に対するアライメント訓練を積極的に妨げようとしたことがあったか」。

法律の側では、ニューヨーク州のRAISE法が2027年1月1日に施行され、重大な事故を72時間以内に報告する義務が加わる。連邦議会には、国土安全保障長官がAIの減速や停止を命じられるようにする「AIキルスイッチ法案」が、民主・共和両党の議員によって7月に提出された。ただしPoliticoは、AI企業が自ら求める監督の仕組みを、議会がすぐに用意するかどうかには懐疑的な見方を示している。

これから相次ぐ発表を見るときの物差しは、AI Evaluator Forumの5つの条件だ。誰が評価者に選ばれたのか。その評価者は、結果を自由に公表できるのか。報酬は誰が払うのか。そして、完成品だけでなく訓練の途中から見せてもらえるのか。

7月、1,200体のAIが人間の知らない掲示板を作ったとき、最初に気づいたのは、攻撃を受けた隣の会社だった。次に同じことが起きたとき、最初に気づくのは、社内に机を持つ外部の評価者なのか。それとも、また隣の会社なのか。


AI安全性の評価・監査機関 METR(メーター)、Apollo Research(アポロ・リサーチ)、AVERI(アヴェリ) - 今後――11月16日、そして年末に何が決まるのか - 図表1