製品・サービス · · Team LATENT
出力が3割以上速くなったClaude Sonnet 5.5がリリース
Claude Sonnet 5.5はAPI単価を据え置き、出力を高速化した。Artificial Analysis、Vals AI、Mercorなどの評価で性能と費用を比較し、利用先とAPI移行の注意点を解説する。
AnthropicがClaude Sonnet 5.5を発表した。同社によると、前モデルより出力が3割以上速く、作業あたりの費用も減った。API単価を変えずに、何が改善したのか。性能の比較と、利用時に変わる点を見ていく。
この記事の要点
- 開発元は最大30%の費用削減を報告した。一方、第三者評価では推論量を最大にするとOpus 5.5より高くなる例もあり、API単価と実行費用は分けて見る必要がある。
- 第三者の総合指数ではGPT-6 Astraを上回った。開発・知識労働・画像理解でも前モデルから改善し、一部ではOpus 5.5の公表得点を上回る。ただし、分野や評価条件によって順位は異なる。
出来事
- Anthropicが9月28日付でClaude Sonnet 5.5を発表。Opus 5.5に続く、Claude 5.5シリーズの第2弾となる。
- Claudeのアプリ、API、AWS、Google Cloud、Microsoft Azureで提供する。
- APIのモデル名は
claude-sonnet-5-5。料金は前モデルのSonnet 5から据え置いた。
一次情報:Anthropicの発表、料金表
開発元は作業あたり最大30%の費用削減を報告
Anthropicは、Sonnet 5.5が同じ作業を以前より少ないトークンで進めると説明している。同社のテストでは、作業1件あたりの費用はSonnet 5より最大30%少なくなった。これは開発元の測定であり、すべての依頼で3割安くなるという意味ではない。公式発表では、出力を生成する速度も30%以上向上したとしている。
出力速度と、依頼を終えるまでの時間は別の指標だ。ファイルの読み込みや外部サービスの応答待ちもあるため、「出力が3割速い」を「仕事が3割早く終わる」と読み替えることはできない。
実際の費用を比べるなら、同じ仕事を最後まで終えた時点で、やり直しも含めて数える必要がある。途中の回答が安くても、修正の依頼が増えれば合計額は変わる。速さとともに、求めた品質まで届いたかも確認したい。
ターミナルを使う開発作業の評価ではOpus 5.5も上回った
Anthropicの発表に掲載された、コードを書く作業の評価では、Sonnet 5.5がSonnet 5を上回った。ターミナルを操作して複数の手順を進めるTerminal-Bench 4.0と、実際のCursorの利用から作られた課題を使うCursorBench 4.0で改善が見られる。
Terminal-Bench 4.0では、Sonnet 5.5が70.6%を記録し、Opus 5.5の66.4%を4.2ポイント上回った。公式評価資料の113ページによると、Sonnet 5.5は推論量を最大にしたmax、Opus 5.5は最も高い得点を出したxhighでの結果だ。両モデルとも1課題につき5回の試行を平均している。公表得点での逆転だが、推論量は同一ではなく、測定にもばらつきがある。
Anthropicの発表掲載値。Sonnet 5.5はmax、Opus 5.5はTerminal-Benchでxhigh、CursorBenchでmaxの得点。
測定条件Terminal-BenchはAnthropicの測定、CursorBenchはCursorが測定しAnthropicに提供した値。得点は発表の比較表による。推論量と実行条件は公式評価資料の113・115ページに記載されている。Terminal-Benchは安全対策による旧モデルへの切り替えを含む。LATENTによる再測定ではない。
複雑で答えの決まっていない仕事ではOpus 5.5を上位に位置づける
一方、CursorBench 4.0ではSonnet 5.5が55.5%、Opus 5.5が57.8%で、Opusが上回る。Anthropicは、範囲が明確な日常の作業をSonnet 5.5の得意分野とし、判断を続けながら進める複雑な仕事ではOpus 5.5が依然として強いと説明している。Terminal-Benchで上回っても、あらゆる仕事で優位とは限らない。
モデルの使い分けを考えるなら、小さな不具合の修正と、仕様から考え直す設計作業を分けて比べる方法がある。自分の仕事でどこまで任せられるかは、点数だけでは決められない。
第三者の総合指数でもGPT-6 Astraを上回った
Artificial Analysisの総合指数では、Sonnet 5.5は56を記録した。各モデルの推論量を最大にしたときの表示値は、Opus 5.5が58、GPT-6 Astraが53、GPT-6 Solが48。Sonnet 5.5はOpusに届かないものの、OpenAIの両モデルを上回った。
この指数は、知識労働、科学的なプログラミング、長文の理解など10種類の評価を組み合わせたものだ。同社の発表によると、業務の自動化を測るAutomationBench-AAではSonnet 5.5が71%、Opus 5.5が70%。一方、事実知識を問うAA-Omniscienceの正答率は54%対66%で、Opusが上回る。総合点で上位でも、すべての能力で勝っているわけではない。
ただし、この測定には構造化出力の応答を悪化させる不具合があった公開前モデルを使っている。Anthropicは公開時に修正したと説明し、Artificial Analysisは関連評価をやり直す予定としている。Claudeの測定では旧モデルへの切り替えも有効にしており、Sonnet 5.5では課題の約0.1%でSonnet 5に切り替わった。
知識労働ではOpus 5.5に近づき、APEXでは上回る結果も出た
Artificial Analysisによる仕事の成果物の評価では、Sonnet 5.5はGDPval-AA v2.1で1844、AA-Briefcase v1.1で1811となった。Opus 5.5はそれぞれ1846、1822で、差は小さい。これらは成果物の比較から算出するEloという評点で、正答率ではない。
別の評価機関であるMercorのAPEX-Agentsでは、Sonnet 5.5が75.5%、Opus 5.5が73.5%だった。投資銀行・経営コンサルティング・企業法務の240課題で、複数のアプリを使いながら仕事を完了できるかを測る。両モデルとも推論量はmaxで、Sonnet 5.5が公表得点で上回った。
一方、ソフト開発の200課題からなるAPEX-SWEではSonnet 5.5が66.4%、Opus 5.5が67.6%。Mercorが併記する誤差の幅も重なっており、小さな点差をそのまま決定的な優劣と見ることはできない。
コード移行・アプリ作成・生物学の推論でも高得点
Vals AIの評価では、Sonnet 5.5は総合指標のVals Indexで69.22%を記録し、Opus 5.5の69.69%に続いた。内訳では、既存コードの移行を測るCode Migrationが69.83%、アプリ作成のVibe Code Bench v1.1が92.39%、生物学の問題を解くBioMysteryBenchが81.11%で、確認時点の各ランキングで首位だった。
ただし、得意分野は一様ではない。医療文書の作成を扱うMedScribeは91.10%だった一方、Harvey’s Legal Agent Benchmarkは2.92%で下位だった。課題も採点方法も異なるため、別のベンチマークどうしの割合を直接比べることはできない。
Vals AIは基本的に推論量をmaxにし、回答を拒否したときはSonnet 5へ切り替えて測定した。切り替えに助けられた課題を失敗として数え直すと、Vals Indexは68.89%になる。特にサイバーセキュリティや障害対応の評価では切り替えの影響が大きい。
グラフの読み取りやPC操作も前モデルから改善した
Anthropicの公表値では、専門的なグラフを読み取るChartographyが、Sonnet 5の15.6%からSonnet 5.5の61.6%へ伸びた。Opus 5.5は64.4%。いずれもツールを使わない条件の値だ。
PCを操作するOSWorld 2.1でも、Sonnet 5.5は80.1%で、Sonnet 5の57.0%を上回り、Opus 5.5の81.8%に近づいた。この数字は、課題の途中までできた分も加点する部分点を含む得点であり、課題を完全に終えた割合ではない。
複数分野の難問を解くHumanity’s Last Examでは、ツールを使う条件で64.5%となり、Sonnet 5の54.9%から改善した。これらはAnthropicの評価資料に記載された値で、前述の第三者の測定とは区別して読む必要がある。
100万トークンあたりの米ドル建て単価。通常のAPI利用で比較する。
入力
Sonnet 5$2
Sonnet 5.5$2
Opus 5.5$4
出力
Sonnet 5$10
Sonnet 5.5$10
Opus 5.5$20
キャッシュの読み取り
Sonnet 5$0.20
Sonnet 5.5$0.20
Opus 5.5$0.20
公式料金Anthropicの料金表と発表。9月29日確認。キャッシュの書き込みやツールの利用などには、別の料金がかかる場合がある。
単価が半分でも作業の合計額が半分になるとは限らない
入力と出力で使うトークン数が同じなら、その部分の料金はOpus 5.5の半分になる。ただし、実際にはモデルによって回答の長さや作業の手順が変わる。キャッシュの読み取り単価も同じなので、単価表だけから作業全体の料金を半分と見積もることはできない。
実際に、Artificial Analysisの総合指数を測る課題では、推論量を最大にしたSonnet 5.5の1件あたり費用が7.60ドルとなり、Opus 5.5の5.98ドルを上回った。GPT-6 Astraは3.26ドル、GPT-6 Solは1.06ドル。Sonnet 5.5は高い得点に届くまでに多くのトークンを使っており、最大推論量が常に割安とはいえない。
一方、Vals AIのVals Indexでは、Sonnet 5.5は1テストあたり20.80ドル、Opus 5.5は32.77ドルだった。Artificial Analysisとは課題の構成や実行方法が違うので、両サイトのドル額を同じ物差しで並べることはできない。
Boxが自社の複雑な業務を想定した評価では、Sonnet 5.5の正確さは65%で、Sonnet 5の61%から改善した。成果物を完成させる速さは約2.4倍、総トークン消費は12%減ったという。これはBox独自の環境での結果だ。Anthropicの費用削減の説明と、最大推論量では費用が増える第三者評価は、対象の仕事や条件が異なるものとして読む必要がある。
GitHub Copilotでも提供が始まった
GitHubも9月28日、Copilotでの一般提供を発表した。同社の事前テストでは、Sonnet 5と同程度のコーディング結果を、より少ない手順・トークン・ツール呼び出しで得られ、完了までの時間も短くなったという。これはGitHubが報告した利用結果で、第三者による共通条件の性能ランキングとは性質が異なる。
対象はCopilot Pro、Pro+、Max、Business、Enterprise。VS CodeやVisual Studio、Copilot CLI、GitHubのアプリなどで選択できる。段階的に提供されるため、すぐに候補に現れない場合もある。組織での利用は管理者のモデルポリシーにも左右される。
APIの移行では推論を無効にする指定の変更が必要になる
Google Cloudのモデル仕様では、入力は文章・画像・PDF、出力は文章に対応する。入力上限は100万トークン、出力上限は12万8,000トークン。多くの資料を渡せることと、その内容を漏れなく使えることは別なので、長い文書では参照箇所や回答の根拠も確認したい。
Anthropicの移行ガイドでも説明されているとおり、既存のAPI実装から切り替えるときは、モデル名の変更に加えて推論の指定を確認する必要がある。Sonnet 5.5は thinking.type: disabled に対応しない。これまで推論を無効にしていた用途では、代わりに between_tools を使うよう案内されている。この指定では最初に長く考える処理は行わず、ツール呼び出しの間に書く短い進捗が推論ブロックとして返る。
回答の文章だけを受け取る前提のプログラムでは、この返却形式も確かめたい。上限の大きさやモデルの速さに加え、既存アプリで会話とツールの実行を続けられるかが、切り替え時の確認点になる。
高リスクのサイバー関連作業は旧モデルに切り替わる
Anthropicは、リスクの高いサイバー関連の依頼ではSonnet 5に切り替える仕組みを案内している。APIの移行ガイドでは、対象の依頼に回答を停止し、サーバー側の切り替えを有効にした場合はSonnet 5で再試行すると説明する。APIで常に自動切り替えになるわけではない。通常のソフト開発でバグを探して直す作業は続けて利用できるという。
出典・参考資料
- Introducing Claude Sonnet 5.5 Anthropic/2026年9月28日
- Claude APIの料金表 Anthropic/2026年9月29日確認
- Claude Sonnet 5.5 in GitHub Copilot GitHub/2026年9月28日
- Claude Sonnet 5.5 on Google Cloud Google Cloud/2026年9月29日確認
- Claude Sonnet 5.5 System Card Anthropic/評価の条件と測定主体
- Sonnet 5.5への移行ガイド Anthropic/2026年9月29日確認
- Claude Sonnet 5.5の総合指数・実行費用 Artificial Analysis/2026年9月29日確認
- Sonnet 5.5の評価結果と公開前モデルの注意点 Artificial Analysisの公式X投稿/2026年9月29日確認
- Claude Sonnet 5.5 Benchmarks, Cost and Capabilities Vals AI/2026年9月29日確認
- APEX-Agents・APEX-SWEの評価結果 Mercor/2026年9月29日確認
- Sonnet 5.5のAPEX評価と前モデルの比較 Mercorの公式X投稿/2026年9月29日確認
- Claude Sonnet 5.5 on real enterprise knowledge work Box/2026年9月29日確認