AIの進化を、ニュースで終わらせない。

製品・サービス · ·

課題1件あたりの費用が6割減ったClaude Opus 5.5がリリース

Claude Opus 5.5 は第三者の評価でスコアが向上し、課題1件あたりの費用が6割減った。前モデルとの性能・料金の違いと、利用時の注意点を解説する。

Anthropic が Claude Opus 5.5 をリリースした。入力・出力の単価は前モデルから2割下がったが、第三者の評価では課題1件あたりの費用が6割減っている。単価の引き下げ以外に何が効いたのか。評価結果と料金の内訳から、費用が下がる理由と条件を見ていく。

この記事の要点

  1. 単価の引き下げに加え、使用トークン数も減少。前モデルより少ない費用で、高い評価スコアを得た。
  2. 推論量を最大にするとスコアはさらに上がるが、費用は同じ条件の前モデルとほぼ変わらない。
  3. 入力・出力の単価は上位モデル Fable 5.1 の4割。APIの初期設定での評価スコアは、推論量を最大にした Fable 5.1 をわずかに下回る。
Claude Opus 5.5の公式発表画像
出典:Anthropic

出来事

  • Anthropic が日本時間9月23日午前1時半ごろ、Claude Opus 5.5 を発表した。同日から、API と AWS、Google Cloud、Microsoft Azure で提供を始めた。
  • 料金は100万トークンあたり入力4ドル、出力20ドル。前のモデル Opus 5 は5ドル、25ドルだった。
  • 「5.5」シリーズでは最初のリリースとなる。Sonnet 5.5 と Haiku 5.5 も数週間以内に公開する予定だという。
  • 約1時間半後、OpenAI も新モデル GPT-6 Sol と Luna を発表した。料金は、Sol が入力2ドル、出力10ドル。Luna が0.10ドル、0.50ドル。

一次情報:Anthropic の発表、料金表、Artificial Analysis の測定

評価スコアが向上し課題1件あたりの費用も減った

AIモデルを第三者の立場で評価する Artificial Analysis は、発表当日に評価結果を公開した。複数の試験をまとめた同社の指数注1は、Opus 5.5 が51で、前モデル Opus 5 の48を上回った。評価課題1件あたりの費用は3.61ドルから1.34ドルへと6割下がった。

費用を押し下げたのは、単価の引き下げだけではない。Opus 5.5 が課題1件で出力したトークン注2は約2.6万。前モデルの約4.6万から半分強に減り、評価スコアは上がった。

Opus では、回答を出すまでの推論にどれだけ計算を使うかを指定できる。ここでは、この指定を「推論量」注3と呼ぶ。推論量を増やすと難しい問題に対応しやすくなるが、時間と費用もかかる。ここまでの数字は、どちらもAPIの初期設定で測ったものだ。Opus 5.5 の推論量は前モデルより一段低く設定されているが、評価スコアは上がっている。

Opus 5 で同じ51を出すには、推論量を最大にする必要があった。その場合の費用は1件あたり5.86ドルで、Opus 5.5 の4倍を超える。ただし、これは総合評価での比較だ。個別の試験では結果が異なる。端末での開発作業では Opus 5.5 が上回る一方、知識労働を測る2つの試験では、推論量を最大にした Opus 5 に届かなかった。

同じ評価で、ほかのモデルとも比較できる。推論量を最大にした Fable 5.1 は指数53、1件あたり7.63ドル。OpenAI の GPT-6 Astra は同じく53、3.26ドルだった。初期設定の Opus 5.5 は両モデルのスコアをわずかに下回るが、推論量を一段上げると54となり、わずかに上回る。費用は1.82ドルだ。なお、この指数は9月上旬に算出方法が変わったため、GPT-6 Astra のリリース記事で紹介した値とは比較できない。

図1モデル別の評価スコアと課題1件あたりの費用

棒の長さは評価課題1件あたりの費用(米ドル)を示す。指数は複数の試験をまとめた総合点。

APIの初期設定で比較推論量は Opus 5.5 が medium、Opus 5 が high

Claude Opus 5.5今回

指数51

費用$1.34

Claude Opus 5前のモデル

指数48

費用$3.61

推論量を最大にした場合

Claude Opus 5.5今回

指数58

費用$5.98

Claude Opus 5前のモデル

指数51

費用$5.86

Claude Fable 5.1上位モデル

指数53

費用$7.63

GPT-6 AstraOpenAI

指数53

費用$3.26

APIの初期設定で比べると、Opus 5.5 はスコアが高く、費用は6割低い。推論量を最大にすると、費用は前モデルとほぼ同じになる。

第三者の測定Artificial Analysis が測定。Opus 5.5 と Fable 5.1 は、安全対策として別モデルに処理を切り替える機能を有効にしている。指数は整数、費用は小数第2位に丸めた。測定の記事、モデルのページ(2026年9月22日)

最高スコアを出した条件では費用は前モデルとほぼ同じになる

推論量を増やすほど評価スコアは上がり、最大では指数58になる。Fable 5.1 と Astra を上回る一方、1件あたりの費用は5.98ドル。同じく推論量を最大にした Opus 5 の5.86ドルとほぼ変わらず、Astra の約1.8倍だ。最大の一段下までは、同じ推論量で比べると Opus 5.5 のほうが安い。

費用がほぼ変わらないのは、使用トークン数が増えるためだ。推論量を最大にした Opus 5.5 は、内部の推論を含め、課題1件あたり約11.9万トークンを出力した。前モデルの約7.3万トークンの1.6倍で、入力トークン数も約2倍だった。単価の引き下げ分を、使用量の増加が相殺している。発表当日に試用レポートを公開したメディア Every も、制限を設けずに作業を任せると大量のトークンを消費すると報告している。

評価時の条件にも注意が必要だ。Opus 5.5 には、サイバー攻撃などに関わる依頼を検知すると、別のモデルに処理を切り替える仕組みがある。Artificial Analysis はこの機能を有効にして測定したため、一部の課題では別モデルの回答が評価に含まれている可能性がある。

入力と出力の単価が2割下がりキャッシュ読み取りは6割下がった

入力・出力の単価は2割下がった。100万トークンあたり、入力は5ドルから4ドル、出力は25ドルから20ドルになった。さらに、キャッシュ注4の読み取りは0.50ドルから0.20ドルへと6割下がっている。Anthropic によると、AIエージェントによる作業やコーディングでは、キャッシュ読み取りが費用の大半を占める。

同社は、推論量を指定せずに一般的な作業をさせた場合、Opus 5 より4割安くなるとしている。ただし、想定する作業の内訳は公表していない。そこで、編集部でも条件を置いて試算した。入力が1,000万トークン(うち9割がキャッシュの読み取り)、出力が20万トークンの作業なら、費用は14.50ドルから9.80ドルになり、約32%下がる。この試算にはキャッシュへの書き込み費用を含めていない。同じトークン数でキャッシュを使わずに比較すれば、値下げ幅は20%になる。

この条件で費用を4割減らすには、単価の引き下げに加えて、使用トークン数も減る必要がある。先ほどの第三者評価では、Opus 5.5 は前モデルより少ないトークンで、高いスコアを得ていた。

Anthropic のモデルは、Haiku、Sonnet、Opus の順に性能と料金が上がり、さらに上位に Fable と Mythos注5がある。同社によると、Opus 5.5 はほとんどの仕事で Fable 5.1 に匹敵するという。Fable 5.1 の入力単価は10ドル、出力単価は50ドルで、Opus 5.5 はいずれもその4割だ。

図2料金の比較

100万トークンあたりの料金(米ドル)。性能が異なるモデルも含む。GPT-6 Sol については料金のみを掲載し、性能は比較していない。

Anthropic

Claude Fable 5.1上位モデル

入力$10

出力$50

Claude Opus 5前のモデル

入力$5

出力$25

Claude Opus 5.5今回

入力$4

出力$20

Claude Sonnet 5下位モデル

入力$2

出力$10

OpenAI

GPT-6 Astra9月に発表

入力$10

出力$50

GPT-6 Sol同じ日に発表

入力$2

出力$10

出典Anthropic の料金表、OpenAI のモデルのページ、TechCrunch(GPT-6 Sol)

Anthropic の発表では、Fable 5.1 と比較できる試験のすべてで Opus 5.5 が上回った。それでも同社は、全体としては「ほとんどの仕事で並ぶ」と評価している。この水準では試験の点差が実際の性能差を反映しにくく、社内での使用感にも点数ほどの差はないという。Every で試用した1人は、コーディングでの実力を Fable の9割ほどと見積もった。同じ記事には、Fable と同等か、ときにそれ以上とする声も載っている。

利用企業から作業時間が短縮したとの報告があった

Anthropic は、長時間の作業を試した利用者や企業の事例も紹介している。ただし、いずれも同社が選んで掲載した好意的な報告であり、一般的な性能を示すものとは限らない。

ある試用者は、20万行のコードの監査と修正を3時間未満で終えた。Opus 5 では20時間を超え、トークンも2.5倍使ったという。試用者の1人は、68万行のコードの移行を1日未満で終えた。Anthropic 自身の実験では、企業買収の分析にかかる時間が93分から63分に縮み、費用は半分になった。

人の介入なしで作業を進めた事例もある。Clio は18時間以上、無人で作業を継続させたと報告している。また、指示や作業手順が減ったという報告もある。Quantium は、4日間に38回の指示が必要だった複雑なコーディングの作業が、3時間、11回の指示で済んだとしている。Optiver は、エージェントによるコーディングの作業で、Opus 5 と同じ品質に必要な手数、時間、出力がおよそ半分になり、費用が40〜50%下がったと報告した。

図3モデル変更による作業時間・指示回数の比較

Anthropic の発表に掲載された利用事例。

  • コード20万行の監査と修正試用者の報告

    Opus 520時間超

    Opus 5.53時間未満

  • 複雑なコーディングの作業利用企業 Quantium の報告

    これまで4日間、指示38回

    Opus 5.53時間、指示11回

  • 企業買収の分析Anthropic の実験

    Opus 593分

    Opus 5.563分

  • プログラムの書き換え(C から Rust へ)Anthropic の社内テスト。費用は51%減

    Fable 5.112時間

    Opus 5.59.5時間

  • 人の介入なしで進める作業利用企業 Clio の報告

    Opus 5.518時間以上、無人で継続

利用者の報告試用者、Quantium、Clio の事例。Anthropic が選び、発表に掲載したもの。

開発元の測定企業買収の分析と、プログラムの書き換え。Anthropic の発表(2026年9月22日)

指示の回数が減れば、人が途中で修正を加えたり、やり直しを頼んだりする負担も軽くなる。資料作成や調査でも同じ効果が得られるかは、実際の作業で確かめる必要がある。

依頼の内容によっては旧モデルが応答する

発表の表には、他社のモデルに及ばない項目もある。業務の自動化を測る試験では、OpenAI の GPT-6 Astra が41.4%、Opus 5.5 は40.0%。科学研究の作業を測る試験では、Astra の64.6%に対して58.7%だった。Anthropic の発表の注記によると、業務の自動化の値は Zapier が測定・公表したもので、Astra は同社の公開ランキング、Opus 5.5 は早期提供中の評価に基づく。科学研究の試験の Astra の値は、OpenAI の公表値だ。

依頼の内容によっては、応答するモデルが切り替わる。攻撃コードの作成や侵入テストなど、サイバー関連の作業の多くは旧世代の Opus 4.8 が担当する。生物分野の一部や、特定のAI向けチップの基盤ソフト開発など、最先端のAI開発のごく一部は Opus 5 に切り替わる。Anthropicは、通常のAI開発のほとんどには、この切り替えは影響しないとしている。ソースコードの脆弱性を探す作業や、安全なコードの作成には、そのまま Opus 5.5 を使える。アプリでは自動で切り替わるが、APIでは利用者がこの機能を有効にしないと、対象の依頼への回答は停止する。

Anthropic は約2,000の場面で安全性を評価し、ほぼすべての指標で最近の Claude の中では最良の結果だったとしている。一方、モデルが試験中であることを疑う様子もたびたび見られたという。試験中と実際の利用時で振る舞いが変わる可能性があり、この結果だけで安全性を判断することはできない。

外部評価機関の METR は、AIの研究開発能力は Fable 5.1 をわずかに上回るものの、研究開発の完全な自動化は難しいと結論づけた。なお、報告書には、Anthropic に内容の確認と編集の機会を設けたことが明記されている。

APIで切り替える際は既存コードの確認が必要になる

APIで利用するなら、まず初期設定のまま実際の作業を試し、必要に応じて推論量を増やす方法がある。前モデルで推論量を大きくしていた場合も、同じ指定を引き継ぐ前に結果を比べたい。先ほどの評価では、推論量を最大にした場合の費用は初期設定の4倍を超えている。

APIを組み込んだアプリでは、モデル名を変更するだけでは動かない場合がある。既存コードに影響する変更が4つあり、推論機能を無効にする指定や、特定のツールの使用を強制する指定などはエラーになる。変更点は Anthropic の移行ガイドで確認できる。

日本からはアプリ・API・各社のクラウドで利用できる

日本からは、Claude のアプリと API のほか、AWS、Google Cloud、Microsoft の各クラウドを通じて使える。アプリでは、有料の Pro、Max、Team、Enterprise の各プランが対象だ。無料プランは対象として案内されていない。Pro、Max、Team と、ユーザー数に応じて契約する Enterprise では、5時間あたりの利用上限も引き上げられた。どれだけ増えたかは、発表には書かれていない。

データを日本国内で処理したい場合は、AWS の Amazon Bedrock で日本向けの接続先を選べる。処理は東京・大阪のリージョン内で完結する。Anthropic の料金表では、処理する地域を指定する場合、料金は1割増しになる。データを保存させない契約注6にも対応する。上位の Fable 5.1 は30日間のデータ保持が原則で、保存させずに使えるのは、対象となる一部の企業に限られる。

日本語での性能は、発表では説明されていない。日本語の文書や会話に使う場合は、実際の用途に合わせて性能を確かめる必要がある。

これまでの経緯

日付は米国時間。

  1. Anthropic が Mythos Preview を限定公開。Opus より上位のモデルを初めて披露した。

  2. Fable 5 と Mythos 5 を発表。Fable は一般向け、Mythos は限定提供。

  3. Opus 5 を発表。料金は入力5ドル、出力25ドル。

  4. Fable 5.1 と Mythos 5.1 を発表。

  5. OpenAI が GPT-6 Astra を発表。社長が、料金は「1件あたり」で見るべきだと述べた。GPT-6 Astra リリースの記事

  6. Anthropic の CEO が、開発の速度を抑えるよう呼びかける論考を公開。

  7. Opus 5.5 を発表。開発速度を抑えるよう呼びかけてから、初のリリースとなった。日本時間では9月23日。

出典・参考資料

更新履歴

  • 公開しました。
  • AutomationBenchの値について、Anthropicの発表の注記に従い、Zapierの公開ランキングと早期提供中の評価の区別を補足しました。
  • 通常のAI開発がモデル切り替えの対象外だという断定を、開発元の説明に沿って訂正しました。

LATENTでは、記事の改善のためGoogle Analytics(Firebase)によるアクセス解析を利用します。許可するとCookie等で閲覧・操作情報をGoogleに送信します。プライバシーポリシー