製品・サービス · · Team LATENT
Gemini 4 Argonは100万トークンの出力で長時間の実務に挑む
GoogleがGemini 4 Argonを発表。出力上限100万トークン、実務評価での強み、導入価格と通常価格を整理する。専門家への先行提供と一般提供の予定を分け、Googleの測定値と外部評価の条件も確認した。
GoogleがGemini 4 Argonを発表しました。長時間にわたる開発や調査を想定し、出力上限を従来の64Kから100万トークンへ広げたモデルです。英語版の発表は2026年9月30日、日本語版は10月1日付です。Googleの発表・日本語版
今回の発表で、すぐに一般利用が始まったわけではありません。まずはFairwind Programの一部のサイバー防御担当者へ提供されます。一般向けには有料APIの顧客とGoogle AI Ultraの契約者から広げる予定ですが、開始日は示されていません。
注目したいのは、長い出力を何に使い、どの仕事で成果が出たかです。性能、費用、使える時期を分けて確認すると、導入後に試す仕事を選びやすくなります。
資料確認日:2026年10月2日。公式資料と評価機関の公開情報に基づく記事です。LATENTではArgonの実機検証を行っていません。
目次
- 100万トークンは出力側の上限
- 実務の総合評価で上位でも得意分野は異なる
- 同じ表でも測定の出どころと条件が異なる
- Rust移植の事例では比較対象を確かめたい
- 導入価格の終了後は入力も出力も2倍になる
- 先行提供は防御担当者に限られる
100万トークンは出力側の上限
100万トークンという数字は、今回の発表では出力側の上限です。入力資料をどこまで読み込めるかを示すコンテキスト長とは、区別して読む必要があります。Googleは、長い推論や多段階の処理を続けるために、この上限を拡大したと説明しています。公式発表
出力の余裕が増えても、毎回100万トークンを生成するという意味ではありません。利用時に確かめたいのは、自分の依頼を終えるまでの時間と総費用です。短い質問への応答速度は、この上限だけでは判断できません。
実務の総合評価で上位でも得意分野は異なる
評価機関Vals AIの公開表では、ArgonのVals Indexは68.90%で首位です。Claude Sonnet 5.5が67.04%、Claude Opus 5.5が66.97%で続きます。これは金融、コーディング、法務、税務の成績を、米国GDPに占める各分野の比重で集計した指標です。日本の業務全般で約69%の仕事を自動化できるという意味ではありません。Vals AIの公開表と評価方法
同じ表には、1テストあたりの費用としてArgonが15.68ドル、Sonnet 5.5が21.34ドルと載っています。Argonの計算に使われた単価は入力4ドル・出力20ドルです。導入価格の2ドル・10ドルで計算された結果と取り違えないようにしたいところです。
一方、Googleのモデル紹介ページでは、評価項目によって順位が変わります。代表的な数値を抜き出すと、次のようになります。各行は異なる試験であり、行をまたいだ点数の大小は比較できません。
| 評価項目 | Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 74.1% | 74.2% |
| FrontierSWE v2 | 55.0% | 65.5% | 62.3% |
| Terminal-bench 4.0 | 57.4% | 58.2% | 66.4% |
| AutomationBench | 51.3% | 41.4% | 42.5% |
| LVBench | 91.7% | 87.5% | 83.7% |
| CWE-bench v1 | 68.0% | 68.0% | 67.0% |
出典:Google DeepMindの性能表。2026年10月2日確認。表に載せた3モデルでは、ArgonはDeepSWEで上回り、FrontierSWEではAstra、ターミナル作業ではOpusが上回っています。CWE-benchの68.0%は同点で、Argonだけが首位という結果ではありません。
コードの修正、ターミナルでの操作、業務全体の自動実行では、必要な能力が違います。「コーディングに強い」という一言でまとめず、自分が任せる仕事に近い試験を選んで読む方が実用的です。
同じ表でも測定の出どころと条件が異なる
Googleの評価方法資料によると、Argonは原則として最大の思考設定で評価されています。多くの指標は1回の試行で成功する割合を測るpass@1ですが、例外もあります。評価方法のPDF
DeepSWEのArgonの値は、mini-sweというエージェントの実行環境を使ってGoogleが測定したものです。他モデルの値は公開ランキングや各社のシステムカードから取得しています。すべてのモデルを同じ環境で測り直した比較ではありません。
長い動画の理解を測るLVBenchにも条件差があります。GoogleはArgonに1秒あたり1フレームを与え、Astraには800フレーム、Opus 5.5には600フレームを使用したと説明しています。APIの制約による違いで、91.7%という値を読む際にも考慮が必要です。
Vals Indexは評価機関自身の公開ページでも確認できます。一方、Googleが自社で測った項目は開発元による報告です。第三者が同じ条件で再現した結果とは区別して扱います。
Rust移植の事例では比較対象を確かめたい
Googleは社内利用の例として、動画デコーダーlibgav1のRust版の改善を挙げています。Argonのエージェントが既存のRust移植版をもとに3万2,000行のSIMDコードを置き換え、同じ動画出力を保って2.7倍に高速化したという報告です。Googleの事例説明
比較対象は改善前のRust版です。最適化されたC++版に近づいたという説明であり、C++版より2.7倍速いという意味ではありません。コード移行を検討する読者にとっては、移行後の安全性だけでなく、既存実装に対する性能をどこまで保てるかを考える事例です。
導入価格の終了後は入力も出力も2倍になる
発表されたAPI単価は米ドル建てで、いずれも100万トークンあたりです。導入価格と、その期間が終わった後の価格を分けて示します。
| 料金の区分 | 入力 | 出力 |
|---|---|---|
| 導入価格 | 2ドル | 10ドル |
| 導入期間の終了後 | 4ドル | 20ドル |
キャッシュ済み入力には、入力単価から95%の割引が案内されています。ただし、発表文には導入価格の終了日はありません。Googleの料金案内と脚注
単純な計算では、課金対象の出力を100万トークン使った場合、出力分だけで導入期間中は10ドル、終了後は20ドルです。ここに入力などの費用が加わります。長い処理を任せるなら、1回の呼び出しの単価に加え、完了までの呼び出し回数も見て予算を決める必要があります。
先行提供は防御担当者に限られる
Fairwind Programは、政府、医療、通信などの防御担当者に高度なモデルを先行提供する取り組みです。Argonの提供対象は一部のパートナーに限られます。対象者は、脆弱性修正を支援するCodeMenderでもArgonを利用できます。Fairwind Program
同プログラムは、防御や研究のための利用に条件を設けています。組織内でアクセスを認められるのは、サイバーセキュリティ、インシデント対応、侵入テストの担当チームです。利用者ごとの認証やフィッシング耐性のある多要素認証、アクセスと利用の記録も求められます。
Googleが一般提供に向けて進める安全対策は4分野です。有害な依頼への拒否、外部の文章を通じた不正な指示への対策、意図から逸脱した動作の監視、隔離環境の強化を挙げています。監視で問題を検知した場合は実行を止める仕組みも説明されています。Google DeepMindの安全対策
一般の読者が今判断できるのは、公開後に試したい仕事と、その評価基準までです。Ultraへの加入だけで直ちに使えるとは案内されていません。正式な開始日、対象地域、利用上限、APIのモデルIDを確認してから、実際の導入を判断するのがよさそうです。