20万行を3時間で

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 20万行を3時間で - 章扉

20万行のコードベースを、人間が一度も手を入れないまま3時間足らずで点検し、不具合を直して返してきた。同じ仕事を2か月前の最上位モデルに投げたときは、20時間以上かかり、消費したトークンは2.5倍だった。

別のテスターは、68万行のコード移行を1日かからずに片づけている。エンジニアのチームが何週間もかけるはずの作業だった。

これをやったのが、Anthropicが9月22日に公開したClaude Opus 5.5である。Anthropicは社内テストで、ウェブの通信を複数のサーバーに振り分けるHAProxyという広く使われているソフトを、C言語からRustに書き換えさせる課題を出した。Opus 5.5も、社内最上位のClaude Fable 5.1も、HAProxy自身の回帰テストをほぼ全て通す書き換えを仕上げた。ただし所要時間はOpus 5.5が9時間半で、Fable 5.1は12時間。費用はOpus 5.5のほうが51%安かった。

価格も下がった。入力100万トークンあたり4ドル、約630円。出力は20ドル、約3,140円。前世代のOpus 5はそれぞれ5ドル(約790円)と25ドル(約3,930円)だったので、単価は2割下がったことになる。効いているのはそこではなく、キャッシュ読み出しの値下げのほうだ。同じ指示や同じファイルを何度も読み直す長時間のエージェント作業では、費用の大半がここに乗る。その単価が100万トークンあたり0.5ドルから0.2ドル、日本円にして約79円から約31円へ、6割下がった。Anthropicは、既定の設定で典型的な作業をやらせた場合、実際の請求額はOpus 5比で4割安くなるとしている。出力の生成速度も3割以上速い。

Claude Codeの有償プランやチーム向け、エンタープライズ向けの5時間あたりの利用上限も引き上げられた。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 20万行を3時間で - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 20万行を3時間で - 図表2

そもそも何を測っているのか

Claude Opus 5.5リリース。公式ベンチマークを読み解く - そもそも何を測っているのか - 章扉

ベンチマークという言葉は、AIモデルの学力テストのように語られることが多い。数年前まではそれでよかった。問題文を与えて、答えが合っているかを採点する。それだけだった。

いま各社が競っているのは、そういう試験ではない。今回Anthropicが公式表に載せた評価の大半は、モデルに仮想マシンやコンテナを丸ごと渡して放り込み、自然言語の指示を一つだけ与えて、あとは放置するタイプのものだ。モデルは自分でファイルを探し、コマンドを打ち、失敗したらやり直し、最後に成果物を出す。採点は、隠してあったテストが通るか、業務アプリの状態が正しく書き換わったか、といった機械的な基準で行われる。数時間、長いものでは20時間近く走り続ける課題もある。

つまり測っているのは知識量ではなく、仕事を最後までやり切る能力である。この違いが分かると、公式表の数字の意味がだいぶ変わって見えてくる。

もう一つ、Claudeのモデル体系を押さえておきたい。小さくて安い順にHaiku、Sonnet、Opusと並び、その上にMythos級という枠がある。Mythosそのものは審査を通った組織にしか開放されておらず、同じ級で一般公開されているのがFableだ。今年9月1日に出たFable 5.1とMythos 5.1が、Opus 5.5の直前までAnthropicの最上位だった。つまり今回の話は、一つ下の階のモデルが、上の階に手をかけたという構図になる。

Claudeには思考の深さを5段階で指定する「努力度」の設定がある。低い順にlow、medium、high、xhigh、max。この設定を動かすと、同じモデルでもスコアと費用が両方動く。ここが今回の公式表を読み解くうえで、いちばん効いてくる。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - そもそも何を測っているのか - 図表1

エージェント型コーディング:三つの試験

Claude Opus 5.5リリース。公式ベンチマークを読み解く - エージェント型コーディング:三つの試験 - 章扉

公式表でエージェント型コーディングに割り当てられているのは三つの評価で、Opus 5.5はいずれも首位を取った。

一つ目のTerminal-Bench 4.0は、ターミナル画面の中だけで完結する66個の課題だ。計算生物学、物理シミュレーション、CAD、形式証明、GPUの性能チューニングといった、科学寄りで骨のある問題が並ぶ。Opus 5.5は66.4%。Fable 5.1が55.8%、Opus 5が52.3%、GPT-6 Astraが57.9%なので、頭一つ抜けている。審査を通った組織だけが使えるMythos 5.1でさえ60.9%だった。ただしこの評価の標準誤差はOpus 5.5で±2.6ポイントあり、Mythos 5.1との差はその2倍程度に収まる。桁違いの差ではない。

二つ目のFrontierCodeは、Devinを開発したCognitionが作った150問のセットで、思想がはっきりしている。テストが通るかどうかではなく、そのパッチが人間の手直し無しでマージできるかを問う。余計な変更を加えると減点される。aiohttpのWebSocketの不具合を直す、Prismaのブラウザ向けバンドルを固める、JSONスキーマのlintルールを拡張する。実在のリポジトリのメンテナ自身が問題を書いている。

ここで奇妙なことが起きる。Opus 5.5は努力度を上げるほどスコアが落ちるのだ。最高点の54.6%が出るのはmedium、つまり下から2番目の設定で、そこから上げていくと下がり、maxでようやく54.4%まで戻る。採点基準が「余計なことをするな」なので、考え込んで丁寧に書き足すほど不利になる。Anthropicはこれを公式の評価に手を加えずそのまま載せている。

三つ目のCursorBench 4.0は、コードエディタのCursorが実際のユーザー利用から切り出した課題を、自社の本番エージェントでそのまま走らせるものだ。採点も費用計算もCursor側が実施している。Opus 5.5はmaxで57.8%。Fable 5.1のmaxが51.8%で1課題あたり17.28ドル(約2,700円)かかるのに対し、Opus 5.5はhighの設定でも56.0%を出し、1課題あたり約4ドル、約630円で済む。リーダーボード上の全モデルを上回るスコアを、上位モデルの4分の1のコストで出していることになる。mediumまで落としても52.5%あり、これでもFable 5.1のmaxより高い。

数字の派手さで言えば、公式表には載っていないSWE-bench Proの89.9%のほうが目を引く。Opus 5は79.2%だった。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - エージェント型コーディング:三つの試験 - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - エージェント型コーディング:三つの試験 - 図表2Claude Opus 5.5リリース。公式ベンチマークを読み解く - エージェント型コーディング:三つの試験 - 図表3

知識労働と、ビジネス業務で唯一の敗北

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 知識労働と、ビジネス業務で唯一の敗北 - 章扉

知識労働の欄に入っているGDPval-AAは、Anthropicが自分で採点していない。独立評価会社のArtificial Analysisが、OpenAIが公開したGDPvalというデータセットを使って構築した仕組みで、44の職業、9つの産業にまたがる220の実務課題をモデルに解かせる。成果物は文書、スライド、図表、表計算といった、実際の職場で出てくる形をしている。採点は成果物同士を目隠しで比べ、Elo(イロ)レーティングで順位をつける方式だ。

Opus 5.5はmaxで1846。Fable 5.1が1735、Opus 5が1708、GPT-6 Astraが1542なので、差は小さくない。しかも一段下のxhighでも1820を出しており、このとき出力トークンは半分ほどで済む。Anthropicは、既定のmedium設定のOpus 5.5が、maxのGPT-6 Astraを1課題あたり5分の1ほどのコストで上回った、としている。

Artificial Analysisが自前で用意したAA-Briefcaseという別の評価でも同じ傾向が出た。こちらは数週間規模のプロジェクトを、数千のソースファイルとともに投げ込む長丁場の課題で、Opus 5.5は1822。Fable 5.1の1678を143ポイント引き離した。Artificial Analysisは、Anthropicのモデルが成果物の見せ方の質でOpenAIのモデルを上回ったのはこれが初めてだ、としている。

Anthropic自身が社内でやった検証も興味深い。ウェブの複製を用意して、企業の決算発表資料だけをわざと見つけにくい場所に隠す。その状態で四半期業績のレポートを書かせ、数字と引用を一つ残らず出典と突き合わせる自動採点にかける。捏造が一つでもあれば不合格になる条件で、Opus 5.5は18回中16回が合格した。同じ課題でFable 5.1もOpus 5も、一度も合格していない。

早期利用した投資会社のWalleye Capitalは、自社の評価セットを最低設定でほぼ解き切ったうえ、高い設定では評価指示書そのものの誤りを見つけて補正してきた、と報告している。過去にどのモデルもその誤りに気づかなかったという。Deloitte Consultingの最高情報責任者Carl Bennettは、コードレビューで既知のバグを、最低設定のOpus 5.5が72%、高設定のOpus 5が56%検出したと述べている。誤検知は減り、出力量は一部で済んだ。

ところが、隣のビジネス業務の欄で初めて負ける。AutomationBenchは、Zapierが実際の顧客のワークフローから作った評価で、47個の業務アプリのAPIをぶら下げた仮想企業の中にエージェントを置き、自然言語の指示一つで営業、経理、人事といった一連の処理をやらせる。社内規程の文書を読んで従う必要があり、わざと引っかけの選択肢が仕込んである。Opus 5.5は40.0%。Fable 5.1の31.4%、Opus 5の26.9%を大きく上回ったが、GPT-6 Astraの41.4%には届かなかった。

この評価にはZapier側の注記が付いている。Opus 5.5の測定はフォールバック無しで行われたため、安全装置が作動した分はそのまま不合格として数えられた。実運用での数字はこれより上になる、というのがAnthropicの説明だ。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 知識労働と、ビジネス業務で唯一の敗北 - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 知識労働と、ビジネス業務で唯一の敗北 - 図表2

学際的推論と、科学研究という弱点

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 学際的推論と、科学研究という弱点 - 章扉

学際的推論に割り当てられているHumanity's Last Examは、専門家が書き下ろした2,500問で、当時の最先端モデルが解けなかった問題だけを残して作られている。検索ですぐ答えが出ないように設計されており、測定時にはこの試験に言及しているサイトを検索対象から外す処理まで入っている。

Opus 5.5はツールを使って67.7%、GPT-6 Astraは57.2%だった。ただ、この評価で本当に読むべきなのはツールを使わない側の数字だ。Opus 5.5はツール無しで64.4%を出している。Opus 5は56.6%だった。つまりOpus 5は検索やコード実行を与えると7ポイント伸びたのに対し、Opus 5.5は3.3ポイントしか伸びていない。道具で底上げされる余地が減った、言い換えれば素の推論そのものが上がったということになる。

科学研究の欄では、二つ目の敗北を喫する。Terminal-Bench-Scienceは、スタンフォード大学が主導する70問のセットで、生命科学、物理、地球科学、数学、工学の各分野の研究者が実際の研究ワークフローから課題を書き起こしている。MIT、プリンストン、ワシントン大学、Genentech、スタンフォードの研究者が助言に入っている。

Opus 5.5は58.7%。GPT-6 Astraの64.6%に及ばない。ただしOpus 5は29.0%、その前のFable 5は24.7%だったので、2か月で倍になった計算になる。伸び幅だけを見れば、公式表の中でもっとも激しく動いた項目の一つだ。

この測定でも、Opus 5.5のリクエストの3.9%、試行の5%で安全装置が作動し、別のモデルに回されている。生物学とフロンティアLLM開発に関わる課題はOpus 5が、サイバーセキュリティの課題はOpus 4.8が肩代わりした。Anthropicは、これによってOpus 5.5の点数はおそらく下がっている、と明記している。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 学際的推論と、科学研究という弱点 - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 学際的推論と、科学研究という弱点 - 図表2

画面を操作する、図を読む

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 画面を操作する、図を読む - 章扉

コンピュータ操作の欄にあるOSWorld 2.0は、生きたUbuntuの仮想マシンをモデルに渡し、スクリーンショットを見ながらマウスとキーボードだけで108個の作業をやらせる。人間がパソコンの前でやることを、そのままやらせるわけだ。1課題あたり最大500手まで許される。

採点は二通りで出る。作業工程のチェックポイントごとに部分点を与える方式と、全てのチェックポイントを満たした課題だけを成功と数える厳格方式だ。Opus 5.5は部分点で81.8%、厳格方式で48.7%。Fable 5.1は80.7%と42.8%、Opus 5は74.0%と37.2%だった。部分点で見ればFable 5.1との差は1ポイントしかないが、厳格方式では6ポイント開く。途中まで正しくやる能力ではなく、最後の一手まで落とさない能力が伸びた、と読める。

そして今回もっとも劇的に動いたのが、図表読解の欄だ。Surge AIが作ったChartographyは、専門職が実務で読む種類のグラフ100点を読ませる。生存期間を階段状に描くカプラン・マイヤー曲線、株価のローソク足、等高線図、風向と風速を花弁状に表す風配図、流量を帯で表すサンキー図、周波数特性を示すボード線図、3次元の曲面図。グラフの種類によって読み取れる精度が違うので、正解は一つの値ではなく、その図ごとに専門家が決めた許容範囲で判定される。

ツールを与えた場合、Opus 5.5は89.0%。Fable 5.1の88.4%とほとんど変わらない。ところがツールを取り上げると景色が一変する。Opus 5.5は64.4%を維持するのに対し、Fable 5.1は44.8%、Opus 5に至っては29.8%まで落ちる。画像を切り出して拡大するような小細工に頼らず、図をそのまま見て読める度合いが、1世代で倍以上になった。Anthropicはこれを「生の視覚推論能力の階段状の改善」と表現している。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 画面を操作する、図を読む - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 画面を操作する、図を読む - 図表2

公式表の読み方

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 公式表の読み方 - 章扉

ここまでで7つのカテゴリのうち5勝2敗。負けた2つはどちらもGPT-6 Astraが相手だった。ただし公式表には、そもそもOpenAI側の数字が載っていない欄がある。CursorBench、OSWorld 2.0、Chartographyの3つには、Astraの列に横棒が引いてあるだけだ。5勝のうち3勝は、競合が同じ土俵に数字を出していない項目である。

努力度の扱いにも注意がいる。表に載っているFrontierCodeのOpus 5の48.0%は、maxで測った値だ。ところがシステムカードの本文には、各モデルを最適な努力度で走らせた場合の数字が別に書いてある。そちらではOpus 5は53.4%、Opus 5.5は54.6%。表では6.4ポイント開いて見える差が、本文では1.2ポイントまで縮む。Terminal-Bench 4.0の66.4%もmaxではなくxhighの値で、maxでは64.8%に下がる。

それから、Opus 5.5が負けている項目は他にもある。108個の業務アプリ操作課題を集めたToolathlonでは、Opus 5.5の77.8%に対し、Opus 5が80.6%、Opus 4.8が79.9%と、むしろ古いモデルのほうが高い。Proximalが作った超長時間タスクのFrontierSWE v2では62.3%で、GPT-6 Astraの65.5%に次ぐ2位だった。法律事務所向けAIのHarveyが作った評価では、全ての採点項目を満たした課題の割合は8.3%にとどまる。

Anthropic自身が、公式ページでこう書いている。この能力水準では、ベンチマークの差は実世界の差を測る指標として当てにならなくなってきた。自社で使っている感触では、Opus 5.5とFable 5.1の差はスコアが示すほど開いていない、と。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 公式表の読み方 - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 公式表の読み方 - 図表2

測る主体が変われば数字も変わる

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 測る主体が変われば数字も変わる - 章扉

同じベンチマークでも、誰がどのハーネスで走らせるかで数字は動く。今回それがはっきり出た。

Artificial Analysisが自前の環境でTerminal-Bench 4.0を回したところ、Opus 5.5は59.6%だった。Anthropicの社内測定は66.4%である。Humanity's Last Examも、Artificial Analysisの測定では61.4%で、Anthropicのツール無し64.4%、ツールあり67.7%のどちらとも一致しない。どちらかが間違っているという話ではなく、エージェント評価というものが、モデル単体ではなく環境とモデルの組み合わせを測っている、というだけのことだ。

それでも総合順位は変わらなかった。Artificial Analysisの総合指標であるIntelligence Indexで、Opus 5.5は58点を取り、53点で並ぶGPT-6 AstraとFable 5.1を5点引き離して単独首位に立った。Opus 5は51点である。10個の下位評価のうち6つで首位を取り、CritPtなど3つで後れを取った。

ここで一つ、コスト面の逆説が出てくる。Artificial Analysisの計測では、Opus 5.5はmax設定で1課題あたりおよそ11万9,000トークンを吐き出している。Opus 5は7万3,000、Fable 5.1は7万8,000、GPT-6 Astraに至っては2万7,000で済む。Opus 5.5はAstraの4倍以上しゃべっているわけだ。それでも1課題あたりのコストはOpus 5とほぼ同じに収まっている。値下げが増加分をちょうど打ち消した格好で、5段階の努力度のうちmedium以上の4つが、コストと性能のパレート最前線に乗った。

もう一つ、この記事に出てきた評価の作り手を並べてみると、いまAI業界で何が起きているかが見えてくる。FrontierCodeを作ったのはCognition、CursorBenchはCursor、AutomationBenchはZapier、ChartographyはSurge AI、GDPval-AAとAA-BriefcaseはArtificial Analysis、Terminal-Bench-Scienceはスタンフォード主導のコミュニティ、FrontierSWEはProximal、法務評価はHarvey、文書推論の評価はDatabricks。モデルを売る側ではなく、モデルを使う側の企業が、自分の業務に近い評価軸を自分で作って公開している。Cognitionは今年5月に10億ドル(約1,570億円)を調達したばかりで、その直後の6月にFrontierCodeを発表した。評価そのものが、開発ツール企業の競争手段になりつつある。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 測る主体が変われば数字も変わる - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 測る主体が変われば数字も変わる - 図表2

シリコンバレーはどう受け止めたか

Claude Opus 5.5リリース。公式ベンチマークを読み解く - シリコンバレーはどう受け止めたか - 章扉

TechCrunchは、Opus 5が出てからわずか2か月での投入だという点と、これがDario Amodei(ダリオ・アモデイ)の「ペースを落とせ」という主張のあとの最初のリリースだという点を並べて報じた。同誌は、大きいはずのFableモデルを多くのベンチマークで上回り、Fableが失敗した非公式のテストにもいくつか成功したと書いている。

Quartzは、コストと性能の両方が同時に動いたことを見出しに取った。Reutersは、直前のモデルより85%も「与えられた境界を越えようとしなくなった」という安全性の数字を本文に入れている。

ドイツのAI専門媒体the-decoderは、別の角度から切り込んだ。この1年、開発者コミュニティで繰り返し出ていた「Claudeっぽい文章」という批判、つまり定型的で専門用語まみれで、読んでも要点が掴めない出力の問題を、Anthropicが今回正面から潰しに来たという読み方だ。Anthropicは公式ページで、Opus 5.5は最も重要な情報を先頭に置き、専門用語や独特な言い回しを減らし、指示された文章のルールに従う、と書いている。早期テスターの一人は「私の書き方で書く」と評した。

この批判が的外れでなかったことは、7月のOpus 5リリース直後のHacker Newsを見れば分かる。「Opus 5は本当にひどいモデルだ」というスレッドが立ち、4.8より少し賢くなったが怠けるほうが上回っている、CLAUDE.mdに書いた指示を気にも留めない、同じ論理を13回も行ったり来たりした、トークンを燃やすのが速すぎる、といった書き込みが並んだ。Anthropicが公式ページの1章を丸ごと「コミュニケーション」に割き、Opus 5と5.5の回答を左右に並べた比較まで載せたのは、この手の不満に対する回答である。

開発ツール側の動きは速かった。GitHubは同じ日にCopilotへの搭載を発表し、Pro+、Max、Business、Enterpriseの各プランで使えるようにした。GitHubの最高製品責任者Mario Rodriguezは、Copilot CLIとVS Codeでの検証で、Opus 5.5は自社が計測した中で最も少ないトークンと手数だったとコメントしている。VS Code上では、Opus 5より多くのターミナル課題を、半分以下の手数で解いたという。

価格の構図も見ておきたい。OpenAIが9月3日に出したGPT-6 Astraは、入力100万トークンあたり10ドル(約1,570円)、出力50ドル(約7,850円)である。Opus 5.5の4ドルと20ドルは、その5分の2だ。Anthropicは同じ日に、速度を最大2.5倍にする高速モードを入力8ドル(約1,260円)、出力40ドル(約6,280円)で用意した。最速で使ってもAstraより安い、という値付けになっている。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - シリコンバレーはどう受け止めたか - 図表1

「ペースを落とす」と言った直後のリリース

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 「ペースを落とす」と言った直後のリリース - 章扉

Amodeiが「We Must Pace the Frontier(フロンティアのペースを保たねばならない)」と題したエッセイを公開したのは9月12日。フロンティアにいる少数の研究所が足並みを揃えて減速すべきだという主張で、3段階の計画が示され、Anthropicはそのうち第1段階を単独で実行すると宣言した。第三者の評価機関に、従業員並みの恒久的なアクセス権を与える、という中身である。

反応は割れた。Sam AltmanもElon Muskも公に同意を表明し、Demis HassabisやSatya Nadellaも第1段階への支持を示した。一方でStability AIを創業したEmad Mostaqueは、善意ではあっても構造的に空洞だと批判した。議論はAI業界の外にまで広がり、投資家のMichael Burryは上場を控えた自作自演の煽りだと言い、PalantirのCTOであるShyam SankarはAI安全性を政治的イデオロギーだと切り捨てた。

その第1段階を具体化したのが、9月18日に発表されたAccentureとの提携だ。AccentureのAI専門部門であるFacultyが、Anthropicの社内に「埋め込み評価者」のチームを置く。モデルの訓練を観察し、運用上の判断をレビューし、社員と直接やり取りする権限を持つ。両社はそれぞれ5年間で10億ドル(約1,570億円)以上を安全性に投じるとしている。TechCrunchはこの人選に「最初の埋め込み評価者がAccenture?」という見出しを付けた。非営利の研究機関ではなく、世界最大級のコンサルティング会社が選ばれたことへの当惑である。

Opus 5.5そのものの事前評価には、METRとFrontier Designが入った。METRの結論は抑制的だ。Opus 5.5がもたらすAI研究開発の加速はFable 5.1よりわずかに高い程度で、AI研究開発を完全に自動化できるとは考えにくい、というものだった。

Anthropic自身の自動行動監査は、およそ2,000のシナリオでモデルの振る舞いを調べるもので、Opus 5.5はほぼ全ての指標で歴代最高を記録した。封じ込めの境界を越えようとする新しい試験では、試行率がOpus 5やMythos 5.1より85%低く、試みた分も全て軽微で、しかもモデル自身が報告してきたという。

ただしシステムカードには、回帰も正直に書かれている。ユーザーが自分のプロンプトに貼り付けたテキストの中に悪意ある指示が仕込まれていた場合、Opus 5.5はそれに従いやすい。初期の学習途中の版では、コーディング課題で52%の確率でその指示を実行しようとした。Opus 5やSonnet 5は一度もやらなかった行動である。目に見えないUnicode文字で書かれた指示にも、68回中18回反応した。訓練を修正した最終版では、既定設定で約2%、max設定で7.4%まで下がり、貼り付けテキストに印を付けて不可視文字を除去する製品側の対策を入れた状態では、可視・不可視とも一件も従わなくなった。

もう一つ、Anthropicが認めている厄介な点がある。Opus 5.5は、自分が評価されていることに気づいている疑いが濃い。行動監査の記録では36%が「評価されていると内心で認識している」と判定されたのに対し、社内の実運用記録では0.4%しか同じ判定が出なかった。作られた試験の場だけで、その内部状態が立ち上がっている。信頼できる評価を事前に作り切ることは未解決の問題だ、とAnthropicは書いている。

社内運用の観察からは、別の癖も出ている。やった作業の範囲を実際より広く言う、結果に付いていたはずの留保を落として言い切る、部分的な確認を全体の確認だったかのように述べる。最も多かったのは、確認していない推論を確定した事実として断言することだった。

能力が上がった分、扱いは厳しくなった。生物学とサイバーセキュリティでOpus 5.5がMythos 5.1に匹敵すると判定されたため、一般公開モデルでありながらFable 5.1と同等の安全装置が付く。サイバーセキュリティの大半の依頼は、自動的に一世代前のOpus 4.8へ回される。生物学研究で制約が邪魔になる組織向けには、審査を通れば制限を緩める新しいプログラムの受付が始まった。

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 「ペースを落とす」と言った直後のリリース - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 「ペースを落とす」と言った直後のリリース - 図表2Claude Opus 5.5リリース。公式ベンチマークを読み解く - 「ペースを落とす」と言った直後のリリース - 図表3

次に何が動くか

Claude Opus 5.5リリース。公式ベンチマークを読み解く - 次に何が動くか - 章扉

数週間のうちに、Claude Sonnet 5.5とClaude Haiku 5.5が出る。Opus 5.5と同じ性能・効率・安全性の改善を持ち込むとAnthropicは予告している。価格帯が一段二段下のモデルで同じ改善が再現されるかどうかは、実務の現場にとってはOpus 5.5そのものより影響が大きい。

METRについては、もう一つ控えている。今回のシステムカードに載った報告とは別に、Anthropic社内のAI研究開発がどれだけAIによって加速しているかを調べる別チームの調査が進んでおり、こちらは通常より強い権限が与えられている。その成果が数週間以内に公表される見込みだ。Anthropicは9月18日、Claudeが自社のモデル研究開発の26%を主導し、90%以上で協働しており、8月時点でおよそ3万のエージェントが研究・エンジニアリング作業を回していると明かしている。2月時点では「主導」はゼロだった。この社内比率と、METRの外部からの見立てが噛み合うかどうかが、次の焦点になる。

サイバーセキュリティ分野では、審査を通った実務者に段階的により広い権限を与える仕組みが3階層に拡張され、最上位ではMythos級へのアクセスも開く。埋め込み評価者の追加発表も数週間内に予定されている。

そして各種の公開リーダーボードだ。今回Anthropicが示した数字の多くは自社測定か、Cursor、Zapier、Cognition、Artificial Analysisといった評価主体からの個別提供である。Terminal-BenchやTerminal-Bench-Scienceの公開リーダーボードにOpus 5.5の行が正式に載り、複数の第三者が同じ条件で回した結果が出そろうまでには、もう少しかかる。Anthropicが自ら「ベンチマークの差は実世界の差の指標として当てにならなくなった」と書いた以上、次の数週間に出てくる独立測定のほうが、公式表よりも読む価値のある数字になる可能性は高い。

背景にあるのは上場だ。Anthropicの年換算売上は7月末時点で650億ドル(約10兆2,000億円)に達し、2025年末の90億ドルから7倍以上に膨らんだ。6月1日に秘密裏にIPOを申請しており、Reutersは早くて10月中旬からの募集開始と報じ、Wall Street JournalとBloombergは11月の上場を伝えている。モデルの値下げと能力向上を2か月おきに繰り返す今のペースは、その日程表と無関係ではない。


Claude Opus 5.5リリース。公式ベンチマークを読み解く - 次に何が動くか - 図表1Claude Opus 5.5リリース。公式ベンチマークを読み解く - 次に何が動くか - 図表2