AIの進化を、ニュースで終わらせない。

製品・サービス · ·

GPT-6.1 SolリリースでOpus 5.5とのコスト競争に

標準API単価はOpus 5.5の半額。GPT-6.1 Solはコード修正からPC操作まで競う対抗馬になる。ただし長文では価格差が縮み、性能試験の条件もそろわない。両社の公式資料から任せられる仕事と選び方を読み解く。

AIにコードの修正や資料の読み取り、画面の操作を繰り返し頼むなら、最後まで任せられるかを確かめたい。一問の正解率に加え、待ち時間や、やり直しを含む費用も判断材料になる。

OpenAIが9月29日に投入したGPT-6.1 Solは、こうした仕事を想定した更新だ。OpenAIは、上位のGPT-6 Astraに近い能力を、より低い費用で提供すると説明している。9月22日に発表されたClaude Opus 5.5も、長い開発作業や知識労働を、前モデルより効率よく進めることを打ち出した。OpenAIの更新履歴・GPT-6.1 Solの発表・Opus 5.5の発表

仕事を任せるAIを費用込みで選ぶなら、GPT-6.1 SolはOpus 5.5の有力な比較対象になる。標準APIの入力・出力・キャッシュ読み出し単価は、いずれもOpus 5.5の半分だ。ただし、性能の全面的な逆転を示す資料はそろっていない。長い入力では、この価格差にも例外がある。

この記事の要点

  • GPT-6.1 SolはGPT-6 Solの後継にあたる更新。Astraそのものを安くした同一モデルではなく、複雑な仕事で能力と費用の釣り合いを変えるモデルだ。
  • コード修正、PC操作、業務処理は両社が競う領域。ただし試験の版、推論量、実行用ソフト、別モデルへの切り替えが違い、公表値を一つの順位表にはできない。
  • 入力が27万2,000トークンを超えるとSolの単価は上がる。選ぶ基準は、単価に加えて作業完了までの消費量、時間、人が直す手間になる。

資料確認日:2026年9月30日。発表日は公式資料の日付で表記する。この記事は公開資料に基づく比較・分析であり、LATENTが両モデルを同条件で実測したレビューではない。

目次

  1. GPT-6.1 SolがOpus 5.5の比較対象になる理由
  2. コーディング性能は試験と実行条件をそろえて比べる
  3. PC操作と業務処理では試験内容と採点方法が異なる
  4. 長文入力ではAPI料金の差が縮む
  5. 応答の速さと作業完了までの時間を分けて見る
  6. 利用方法と、AIに操作を任せる際の注意点
  7. 自分の用途に合うモデルを選ぶ

GPT-6.1 SolがOpus 5.5の比較対象になる理由

名前が似ていても、GPT-6 Sol、GPT-6.1 Sol、GPT-6 Astraは区別したい。GPT-6 SolとLunaの提供開始は9月22日で、GPT-6.1 Solはその翌週の更新にあたる。Astraは引き続き別の上位モデルとして残り、OpenAIのモデル資料も、自分の課題でAstraと比較して品質と費用の差を確かめるよう案内している。公式更新履歴・GPT-6.1 Solの仕様

Opus 5.5も、こうした用途を想定している。AnthropicはOpus 5.5を「長時間のエージェント型コーディングと知識労働」に向くモデルとして案内する。通常の仕事でまず検討するモデルにも挙げており、道具を使って何段階もの仕事を進める用途でSolと競合する。Claudeのモデル一覧

OpenAIの発表には、PDFを読み解くGDP.pdfと業務を処理するAutomationBenchで、Opus 5.5との費用対性能の比較が載る。競争相手として意識されていることは、発表の構成から読み取れる。ただし「Opusを倒すために急いで発売した」といった開発の動機までは、この資料から分からない。

また、価格だけで選ぶなら相手はOpusに限らない。現在のClaude Sonnet 5.5も、通常の入力が100万トークン当たり2ドル、出力が10ドルで、Solと同じ単価だ。Opusと比べる際には、複雑な仕事を任せるために追加の料金を払う価値があるかを確かめたい。Anthropicの料金表

コーディング性能は試験と実行条件をそろえて比べる

ソフトウェア開発を任せるには、数行のコードを書く能力だけでは足りない。既存の構造を読み、複数のファイルを直して、テストを通すまで進められる必要がある。DeepSWEは、こうした長い開発課題を測る試験だ。提供元のDatacurveは、既存の修正履歴をコピーせずに課題を作り、コードの形よりソフトウェアの挙動を検証すると説明している。DeepSWE

OpenAIによれば、GPT-6.1 SolはDeepSWE v1.1でAstraと並ぶ成績を、およそ5分の1の費用で得た。GPT-6 Solの最高得点も、より少ない推論量と費用で6.4ポイント上回ったという。同社の比較では、以前のSolで予算や推論量を増やしていた仕事を、安く処理できる余地が広がったことになる。GPT-6.1 Solの発表

Opus 5.5も、システムカードではDeepSWE v1.1で5回の試行平均74.2%を報告している。ただし今回取得したDatacurveの公開一覧には、両モデルの新しい結果がそろっておらず、同じ実行条件での直接比較までは確認できなかった。システムカード175ページ・DeepSWE公開一覧

Anthropicの発表では、Terminal-Bench 4.0が66.4%、複数ファイルにまたがる課題を扱うCursorBench 4.0が57.8%だった。しかし、そこにGPT-6.1 Solの値はない。発売前の比較表に載るGPT-5.6 SolやAstraの数字を、GPT-6.1 Solの成績として読み替えることはできない。Opus 5.5の性能表

条件にも違いがある。Anthropicの表は原則として推論量をmaxにしているが、Terminal-Bench 4.0のOpusはxhigh、比較対象のAstraはOpenAI公表のhighの値を採用する。Opusの66.4%には標準誤差±2.6ポイントも付く。システムカードによると、OpusはClaude Codeの--bareモードで66課題を各5回、計330回試した。安全機構による別モデルへの切り替えは、試行の10%に影響している。システムカード178ページ

結果は、AIが使う道具や実行手順を定めるソフトウェアの構成によっても変わる。たとえばAnthropicが掲載したFrontierCodeの評価では、ClaudeをClaude Code、GPTをCodex CLIで実行している。モデル名と得点だけでは、この違いが見えなくなる。システムカード175〜177ページ

OpenAIも、自社モデルは研究環境またはAPIで測り、他社モデルは公開報告を参照したと明記する。普段のCodexやClaude Codeと、指示文や使える道具まで同じという意味ではない。今回の資料ではSolの世代更新を確認できるが、Opusとの優劣は別に評価する必要がある。「コードを書くならSolが勝つ」「Opusが上」とまでは判断できない。

PC操作と業務処理では試験内容と採点方法が異なる

画面を操作する能力にも改善がある。OpenAIは、GPT-6.1 SolがOSWorld 2.0のオフライン課題で、推論量を最大にしたGPT-6 Solを7ポイント上回り、費用は半分未満だったとする。Astraとの差も2.1ポイントまで縮めたという。ここで公表しているのは、2026年8月8日版の課題における、部分点を含む得点だ。OpenAIのPC操作評価

AnthropicはOpus 5.5について、発表ページではOSWorld 2.1で部分点を含む81.8%を公表している。一方、同社のシステムカードは同じ81.8%を2.0と記載し、9月10日版の課題を使ったと説明する。名称には資料間の食い違いが残るが、少なくとも課題の版はOpenAIの8月8日版とそろっていない。発表ページ・システムカード205〜206ページ

さらにAnthropicは、過去の画面画像を捨てる方式から、画像を保持して会話が10万トークンを超えると圧縮する方式へ変更した。1080pのUbuntu環境、最大500操作、推論量max、5回の独立試行という条件も明記されている。同カードは、以前の課題や異なる実行構成の結果とは直接比較できないと注意する。

得点には部分点が含まれる。Opusの81.8%に対し、すべての確認項目を満たした課題の割合は48.7%だった。81.8%は仕事を完全に終えた割合ではない。Solとは評価条件も異なるため、得点を勝率として同じ棒グラフで比べることはできない。システムカード206ページ

実務については、直接の比較が示された領域もある。OpenAIは、複雑なPDFから専門的な質問に答えるGDP.pdfで、GPT-6.1 Solが、別モデルへの切り替えを含むOpus 5.5を、試した推論設定の範囲で上回り、課題当たり費用は半分未満だったと報告する。AutomationBenchでも、SolのmediumでOpusを2.2ポイント上回り、費用はおよそ3分の1だったとする。OpenAIの実務評価

ただし、これらはOpenAIが掲載した比較で、LATENTによる再測定ではない。AutomationBenchの2.2ポイント差について、発表本文からは統計的に明確な差かどうかまで判断できない。Anthropicの発表に載る同試験のOpusは、Zapierが事前提供期間に測定した値で、別モデルへの切り替えを使わず、安全機構による停止は失敗として数えている。

評価する仕事 今回確認した公表結果 比較するときの境界
PDFの読解 OpenAIはSolがOpusを上回ると報告 PDFへの質問回答であり成果物作成全体ではない
複数段階の業務 OpenAIはSol mediumの得点と費用の優位を報告 版や推論設定に加え切り替え条件の照合が必要
画面を使った操作 両社とも自社の前モデルから改善 課題の更新日や履歴管理が違い直接順位にしない

資料から数字を拾って答える仕事と、その数字で表計算を作り、アプリへ入力して仕上げる仕事では、失敗する箇所が違う。自分の用途で選ぶときも、この違いを考慮したい。読解の成績だけでは、操作から納品まで任せられるとは判断できない。

長文入力ではAPI料金の差が縮む

通常料金の差は明瞭だ。以下は両社の直接APIの標準料金で、100万トークン当たりの米ドル額。トークンは文章を処理する小さな単位で、日本語の文字数とは一致しない。月額プランの料金や利用枠とも別である。OpenAIの料金・仕様・Anthropicの料金表

課金対象 GPT-6.1 Sol Claude Opus 5.5
通常の入力 $2 $4
キャッシュ読み出し $0.10 $0.20
キャッシュ書き込み $2.50 $5(5分保持)/$8(1時間保持)
出力 $10 $20

Solのこの料金は入力27万2,000トークン以下。キャッシュは再利用できた部分に適用される。高速化、地域指定、道具の利用料などは別条件になる。

キャッシュは、繰り返し渡す資料や会話の先頭部分について、前回の計算を再利用する仕組みだ。長い開発作業では同じコードや指示を何度も扱うため、読み出し単価の低さが費用の削減につながる。ただし、最初に保存する書き込みにも料金がかかる。OpenAIの書き込み料は通常入力料への上乗せではなく、該当する入力部分に適用される別の単価だ。OpenAIのキャッシュ解説

保持条件も同一ではない。GPT-6.1 Solを含むGPT-5.6以降は、最後の書き込みまたは再利用から30分が最低保持期間の設定となる。Anthropicは5分と1時間の書き込みを選べる。安い読み出し料金を比べるだけでなく、実際の依頼の間隔でキャッシュが使えるかを見る必要がある。OpenAIの保持条件・Anthropicのキャッシュ料金

そして、長文では価格差が縮む。Solは入力が27万2,000トークンを超えると、そのリクエスト全体で入力とキャッシュの単価が2倍、出力が1.5倍になる。 通常入力4ドル、キャッシュ読み出し0.20ドル、書き込み5ドル、出力15ドルだ。一方、Opus 5.5は100万トークンの文脈全体で通常単価が適用される。Solの長文条件・Claudeの長文料金

同じ課金トークン数を使うと仮定した、キャッシュなしの一回分の計算はこうなる。

仮定する使用量 GPT-6.1 Sol Claude Opus 5.5
入力10万+出力1万 $0.30 $0.60
入力30万+出力1万 $1.35 $1.40

LATENTによる単価の試算。出力は推論分を含む課金対象トークンの総数とする。キャッシュ書き込み・読み出し、道具、高速化、地域指定、税を含めない。モデルによって文章の区切り方や消費量が違うため、同じ仕事の実測費用ではない。

後者の費用差は5セントに縮まる。Solでどれだけ安くなるかは、大量の資料を毎回丸ごと渡すか、必要な部分を取り出して再利用するかによっても変わる。

一度に扱える文脈はSolが105万トークン、Opusが100万トークンで、最大出力はどちらも12万8,000トークン。文脈は入力と生成のための作業領域であり、上限いっぱいの資料を渡せば全箇所を同じ精度で読める、という保証ではない。Solの仕様・Claudeの仕様

応答の速さと作業完了までの時間を分けて見る

両モデルには、回答や作業にどれだけ推論を使わせるかを調整する機能がある。Solはlow、medium、high、xhigh、maxに対応し、既定はmedium。Opus 5.5も既定はmediumで、lowからmaxまで選べる。Solはnoneとminimalに対応せず、Opus 5.5もthinkingをオフにはできない。両社で同じ名前を使っていても、同じ計算量や待ち時間を表す共通規格ではない。Solの推論設定・Claudeのeffort解説・モデル一覧

推論を減らすと、一回の処理は軽くできる。しかし難しい作業で試行錯誤が増えれば、完了までの時間は延びる可能性がある。逆に、推論量を最大にすれば必ず得点が上がるわけでもない。AnthropicのFrontierCode v1.1では、Opusのmediumが54.6%、性能表のmaxは54.4%だった。こうした小差を、設定の確実な優劣と扱うべきではない。Opusの推論量別評価

速度の宣伝も、比較相手を確かめたい。Anthropicの「出力が3割以上速い」はOpus 5との比較で、Solとの比較ではない。同社は別料金のFast modeで最大2.5倍の速度も掲げる。OpenAIはSolのUltrafastについて、Codexの標準速度に対して最大8倍のトークン生成を今後数日で提供すると発表した。提供予定の倍率と、現在の通常速度を並べて勝敗は決められない。 両社の発表・Opusの速度説明

9月30日確認のAPI料金では、SolのFastは入力4ドル・出力20ドル、OpusのFastは8ドル・40ドル。OpusのFastは研究プレビューで、提供経路にも制限がある。これも、通常料金での比較とは分けて考える必要がある。OpenAI料金表・Anthropic料金表

今回確認した資料では、入力長や推論条件、実行環境をそろえた両モデルの速さを確定できなかった。応答開始までの時間も、作業完了までの時間も直接比較できていない。仕事にかかる時間を考える際には、文字が流れる速度に加え、最初の応答や道具の呼び出しを待つ時間、失敗から復帰する時間も含めたい。

利用方法と、AIに操作を任せる際の注意点

GPT-6.1 Solの発表時の対象は、ChatGPT WorkとCodexのPlus、Pro、Business、Enterprise、Edu利用者、およびAPIだ。通常のChatには、発表時点では未提供と明記されている。実際に選べるかはプラン、クライアント、組織の設定にも左右される。APIの識別名はgpt-6.1-solで、道具を使う処理はResponses APIを利用する。OpenAIの提供案内・モデル仕様・更新履歴

Opus 5.5はClaude、Claude Code、Claude Platformに加え、AWS、Google Cloud、Microsoft Azureでの提供が案内されている。直接APIの識別名はclaude-opus-5-5。クラウド事業者経由の料金や機能まで、この記事の直接API料金表と同じと考えることはできない。Anthropicの提供案内・プラットフォーム別モデル一覧

操作を任せる際には、安全機構で処理が止まる条件も確認したい。Anthropicの評価では、安全機構が働いた際にサイバー関連の仕事をOpus 4.8、生物学などの仕事をOpus 5へ引き継ぐ場合がある。切り替えを含む結果は、Opus 5.5だけが全課題を解いた値ではない。切り替えを使わない試験とは分ける必要がある。Opus 5.5の評価条件

OpenAIも、GPT-6.1 SolにAstraと同じ安全対策を適用すると説明する。自動審査の拒否を迂回しようとする行動や、利用者が認めていない操作を試す評価を行っているが、難しい状況を意図的に集めた試験であり、通常利用の事故率を示すものではない。GPT-6.1 Solのシステムカード

どちらのモデルでも、指示を守る傾向が改善したからといって、確認なしですべて任せられるわけではない。メール送信や本番への反映など、結果を戻しにくい操作については、人が確認するタイミングも決めておきたい。

自分の用途に合うモデルを選ぶ

GPT-6.1 Solは、Opus 5.5を検討している人が比べる価値のあるモデルになった。とくに、同じ背景資料を再利用しながらコード修正や文書処理を繰り返す用途では、通常単価とキャッシュ料金の低さで費用を抑えられる可能性がある。公開評価でも、実務性能の改善が報告されている。

一方、長い入力で価格差が縮む仕事や、Opusのほうが少ない手戻りで終えられる仕事なら、単価だけで切り替える理由は弱くなる。後者については、この資料比較だけでどの仕事が該当するかを断定できない。

たとえば、普段の仕事から「既存コードの修正」「長い資料からの報告書」「画面操作を伴う定型処理」を選び、同じ合格基準で比べる方法がある。料金の明細に加え、完了までの時間、人が修正した箇所、止まった理由を残す。通常の推論量で十分な仕事と、多く考えさせる価値のある仕事を分ければ、最高得点のモデルを毎回使う必要もなくなる。

今回の更新で、Opus 5.5との勝敗が決まったわけではない。複雑な仕事を任せるモデルに、より低い費用で試せる選択肢が増えた。 自分の仕事が仕上がるまでの時間や費用、手戻りを比べて、その違いを確かめたい。