AIの進化を、ニュースで終わらせない。

製品・サービス · ·

パソコン操作の性能が向上したGPT-6 Astraがリリース

GPT-6 Astra はパソコン操作の評価で得点が上がり、作業時間も短縮した。前モデルとの性能・料金の違い、提供範囲、利用上の制限を解説する。

OpenAI が新しいAIモデル GPT-6 Astra を発表した。同社の社長は「AGIの時代」の始まりと表現するが、実際の仕事にはどこまで使えるのか。パソコン操作の評価結果を中心に、前モデルとの違いと利用条件を見ていく。

この記事の要点

  1. パソコン操作の性能が向上。OpenAI の評価では、課題の得点が上がり、作業時間は約半分になった。
  2. APIの入力・出力単価は、割引適用中の前モデルの2.5倍。作業1件あたりの費用が下がるかは、作業内容による。
  3. 発表当日の提供先は一部の組織に限られる。OpenAI と Microsoft の Azure は、数日かけて提供先を広げるとしている。
  4. 一般の利用者は、攻撃コードの作成など一部の機能を利用できない。
星の渦を背景にGPTとAstraの文字が入ったタイトル画像
出典:OpenAI

出来事

  • OpenAI が日本時間9月4日午前3時、GPT-6 Astra を発表した。まず一部の組織に提供し、数日以内に有料プランの利用者と API へ広げるとしている。Microsoft の Azure でも同じ日に、対象を限ったプログラムの参加者への提供が始まった。
  • API の料金は100万トークンあたり入力10ドル、出力50ドル。
  • グレッグ・ブロックマン社長は記者向けの説明会で、AGI の時代に入ったという認識を示した。
  • 同社は米国時間の9月1日、このモデルのサイバー能力が、同社の評価基準で最上位の「Critical」に達したと公表していた。

一次情報:OpenAI の発表、システムカード、Path to Astra

パソコン操作の得点が上がり作業時間も短くなった

Astra では、画面を見てマウスやキーボードを操作し、ソフトを使って作業を進める能力が向上した。こうしたAIの使い方は、エージェント注1と呼ばれる。

OpenAI の評価では、パソコン操作の試験の得点が、前モデル GPT-5.6 Sol の65.7%から72.6%に上がった。作業時間も短くなっている。応答の遅延を再現した条件では、課題1件にかかる時間が約75分から約40分に縮んだ。業務自動化の試験の得点は18.1%から41.4%へと2倍以上になり、50万トークン注2を超える資料から必要な箇所を探す試験では、73.8%から96.3%に上がった。

同社は、Webフォームへの入力、顧客管理システムの更新、予定表の整理などを利用例として挙げている。回路図をもとに製造可能な基板の配置と配線を設計したり、3Dソフトで作った家をゲームエンジンに読み込み、室内を歩けるようにしたりする例もある。いずれも、同社が選んで発表した事例だ。

長時間の作業を続けるための機能も加わった。開発者向けツール Codex では、AIが途中経過をメモに残し、後から読み返せる機能を試験的に利用できる。AIが一度に扱える情報量には限りがあるため、過去の作業内容をメモから確認できるようにしている。

図1前モデルとの評価結果の比較

OpenAI が発表した評価結果。各値は、推論量を変えて測定した中で最も高い結果を採用している。

  • パソコンを操作して課題をこなすOSWorld 2.0。部分点を含む得点

    GPT-5.6 Sol65.7%

    GPT-6 Astra72.6%

  • パソコン操作の課題1件にかかる時間応答の遅延を再現した条件

    GPT-5.6 Sol約75分

    GPT-6 Astra約40分

  • 業務を自動化するAutomationBench。得点

    GPT-5.6 Sol18.1%

    GPT-6 Astra41.4%約2.3倍

  • 長い資料から必要な箇所を探すMRCR。51.2万〜100万トークンの資料

    GPT-5.6 Sol73.8%

    GPT-6 Astra96.3%

  • 画面の中から操作する場所を見つけるScreenSpot-Pro

    GPT-5.6 Sol76.9%

    GPT-6 Astra92.7%

  • パソコン操作で意図しない結果が生じた割合社内の安全性テスト。安全確認機能を無効にした条件。低いほど良い

    GPT-5.6 Sol22.0%

    GPT-6 Astra2.4%

パソコン操作の作業時間は約半分に、業務自動化の得点は2倍以上になった。OSWorld 2.0の得点には部分点が含まれるため、完了した課題の割合を示すものではない。

OpenAI の公表値図の数値は、OpenAI の発表(2026年9月3日)に掲載された値。試験の多くは外部機関が作成した。「約2.3倍」は、新旧モデルの得点から編集部が計算した。

第三者評価の総合スコアは前モデルと同点だった

パソコン操作の試験で得た72.6%という値には、部分点が含まれている。課題の72.6%を最後まで完了したという意味ではない。実際に作業を任せる際には、人による結果の確認が必要だ。

ここまでに示した数値は、OpenAI の発表に掲載されたものだ。同社は、GPT の評価を研究用の環境かAPIで行い、推論量を変えた中で最も高い結果を採用したと説明している。ChatGPT では結果が多少異なる可能性があるとしている。

一方、発表当日に公開された第三者の評価では、総合スコアに前モデルとの差はなかった。Artificial Analysis の総合指数注3は Astra が61で、前モデルと同点。Anthropic の Claude Fable 5.1 より5点低かった。この指数は OpenAI の発表にも掲載されている。コーディングの指数は67で前モデルを2点上回ったが、Fable 5.1 の70には届かなかった。両世代のモデルを推論量が最大の条件で比べると、コーディングの試験に使ったトークン数は前モデルの3分の1だった。

推論能力を測る ARC-AGI-3 でも、測定条件によって結果が大きく異なる。試験を運営する ARC Prize によると、推論の途中経過を引き継げる接続方式では99.9%、標準の方式では62.7%だった。2つの測定では推論量も異なる。

OpenAI の発表にも、他社モデルを下回る項目はある。専門的な難問を集めた試験では57.2%で、Fable 5.1 の65.0%、Claude Opus 5 の63.6%を下回った。同社が開発した、実務での価値を測る指標 GDPval の結果は掲載されていない。

安全性の評価では改善が見られる一方、懸念も報告されている。社内テストで、パソコン操作中に意図しない結果が生じた割合は、前モデルの22.0%から2.4%に下がった。自動の安全確認機能を無効にした条件での値だ。サイバー攻撃への協力を引き出そうとする依頼を集めた試験では、依頼を断った割合がGPT-5.6 Solの59%からAstraの91.5%に上がった。一方、システムカード注4には、Astra の推論過程を外部から監視しにくくなったと記されている。外部機関 Apollo の評価では、推論量が最大の条件で、評価中だと認識した割合が50.6%に達した。試験中と実際の利用時で、振る舞いが変わる可能性がある。

発表時点では利用者が限られており、第三者による評価もまだ少ない。幅広い用途での性能を判断するには、今後の評価を待つ必要がある。

単価は上がったが作業あたりの費用は用途によって異なる

APIの料金は100万トークンあたり入力10ドル、出力50ドル。前モデルの定価(入力5ドル、出力30ドル)に比べ、入力は2倍、出力は約1.7倍になった。前モデルには少なくとも11月21日まで割引が適用されているため、割引後の価格(入力4ドル、出力20ドル)と比べると、どちらも2.5倍になる。Anthropic の上位モデル Fable 5.1 と同額だ。入力が27.2万トークンを超える場合は、入力とキャッシュの単価が2倍、出力の単価が1.5倍になるため、長い資料を扱う際は追加の費用がかかる。

OpenAI は、単価よりも作業1件あたりの費用を重視すべきだとしている。ブロックマン社長は説明会で、1トークンが表す内容は会社やモデルによって異なるため、トークン単価での比較には意味がないという趣旨の発言をした。同社の発表では、ソフトウェア開発の試験における課題1件あたりの推定費用が、前モデルより約32%低くなったという。

発表当日の第三者評価では、用途によって結果が分かれた。Artificial Analysis が両モデルの推論量を最大にして比較したところ、コーディングの試験では使用トークン数が3分の1になったものの、課題1件あたりの費用は前モデルとほぼ同じだった。同社は、費用に対する性能はトップクラスと評価している。一方、総合指数の評価課題では、出力トークン数の減少は約10%にとどまり、課題1件あたりの費用は75%高かった。比較には前モデルの割引価格を使っている。OpenAI の測定とは試験が異なるため、結果は直接比較できない。

使用トークン数が減っても、実際の費用が下がるとは限らない。発表当日の結果を見る限り、費用への影響は作業内容によって異なる。早期に試用したニュースレター Latent Space の筆者は、実験の監視などを2日間任せ、約100ドルかかったと報告している。また、毎秒33トークン、出力100万トークンあたり50ドルで単一の処理を続けた場合、出力トークン分だけで約5.94ドル/時になる試算も示した。入力・キャッシュなどの費用や、並列に動かすエージェントの費用は別途かかる。

図2料金の比較

100万トークンあたりの料金(米ドル)。

OpenAI

GPT-6 Astra今回

入力$10

出力$50

GPT-5.6 Sol前モデル・定価

入力$5

出力$30

GPT-5.6 Sol前モデル・割引価格(少なくとも11月21日まで)

入力$4

出力$20

Anthropic

Claude Fable 5.1上位モデル

入力$10

出力$50

Claude Opus 5

入力$5

出力$25

出典OpenAI のモデルのページ(GPT-6 Astra、GPT-5.6 Sol)、GPT-5.6 の発表、Anthropic の料金表

発表当日の提供先は一部の組織に限られる

発表当日に利用できるのは一部の組織に限られる。OpenAI は数日以内に、ChatGPT の有料プラン(Plus、Pro、Business、Enterprise)とAPIでの提供を広げるとしている。Enterprise では管理者による有効化が必要だ。無料プランへの提供は案内されていない。

Microsoft の Azure でも発表当日から、一部のプログラム参加者への提供が始まった。数日かけて参加顧客への提供を広げるという。OpenAI は、AWS でも数日以内に利用できるようになるとしている。発表には、日本を提供対象から除外する記述はない。

データを日本国内だけで処理できるかは不明

発表時点では、データを日本国内だけで処理できるかは確認できない。Microsoft が Azure で案内したのは、処理地域を限定しない方式と、米国内で処理する方式の2つ。米国内での処理を指定すると、料金は1割高くなる。

日本語での性能は、発表にもシステムカードにも記載されていない。日本語の文書や会話に使う場合は、実際の用途に合わせて性能を確かめる必要がある。

攻撃コードの作成などに利用できない

Astra のサイバー分野の機能には、利用者によって異なる制限が設けられている。OpenAI は米国時間9月1日、Astra のサイバー能力が、同社の評価基準で最上位の「Critical」に達したと公表した。同社でこの水準に分類されたモデルは初めてだという。評価中には、未知のソフトウェアの脆弱性を2件発見し、悪用できることを示した。脆弱性はソフトウェアの開発・保守担当者への報告を進めているとしている。

一般の利用者が使えるのは、コードの安全性のレビューや、脆弱性を修正するパッチの作成など、防御を目的とする機能だ。脆弱性を悪用する攻撃コードの作成などは制限される。

防御に携わる専門家には、審査制のプログラムを通じ、数週間以内に利用できる機能を増やす予定だ。脆弱性や攻撃コードの検証、マルウェアの解析、攻撃を検知するルールの作成が対象になる。攻撃コードの作成など、より高度な機能は少数の試験利用者から提供を始め、その後、審査を受けた利用者に広げるとしている。

図3サイバー分野の機能と提供対象

発表時点
一般の利用者

  • 01コードの安全性のレビュー
  • 02脆弱性を修正するパッチの作成

一般の利用者が使える機能

数週間以内
審査を受けた利用者

  • 03脆弱性や攻撃コードの検証
  • 04マルウェアの解析
  • 05攻撃を検知するルールの作成

先行提供
少数の試験利用者

  • 06攻撃コードの作成など、より高度な作業その後、審査を受けた利用者に広げる

図の下段に示した機能は、対象者を限定しながら順次提供する予定。

出典OpenAI の発表と Path to Astra

「AGIに達した」という発言は社長個人の見解にとどまる

ブロックマン社長は説明会で、個人的には OpenAI が AGI に達したと考えている、と述べた。AGI は、人間のように幅広い仕事に対応できるAIを指す。ただし、その定義は人によって異なり、達成の時点について全員が合意するわけではないとも説明している。また、AGI の達成を条件に発動する契約上の取り決めは、すでに存在しないと述べた。TechCrunch によると、これは Microsoft との契約を指している。

この発言は、幅広い仕事を人の確認なしで任せられることを裏づけるものではない。実用性を判断するには、自分の用途での性能、結果を確認する手間、費用を検討する必要がある。第三者による評価や利用者の報告は、発表時点ではまだ限られている。

これまでの経緯

日付は米国時間。

  1. OpenAI が GPT-5.6 を公開。

  2. 外部のサービス Hugging Face への侵入は、試験中の自社のモデルによるものだったと、OpenAI が公表。

  3. OpenAI が、次のモデルのサイバー能力が最上位の水準に達している可能性を否定できないと公表し、一部の開発作業を止める。

  4. 学習を2週間止めたことと、最大規模の学習を保留したことを公表。

  5. 保留していた学習を再開。

  6. 「Path to Astra」を公開。サイバー能力を、同社の評価基準で最上位の「Critical」と判定。

  7. GPT-6 Astra を発表、一部の組織に提供を開始。日本時間では9月4日。

出典・参考資料

更新履歴

  • 公開しました。
  • Criticalをサイバー能力の評価として表現し、脆弱性の報告状況を進行中の記述に訂正しました。時間あたりの費用は、単一の処理の出力トークン分の試算であることを補足しました。
  • 図1とその後の説明で、OpenAIが公表した値と、測定を行った主体を区別する表現に訂正しました。
  • 依頼の拒否率がサイバー分野の試験の値であることと、図1の部分点の注記がOSWorld 2.0を指すことを明記しました。

LATENTでは、記事の改善のためGoogle Analytics(Firebase)によるアクセス解析を利用します。許可するとCookie等で閲覧・操作情報をGoogleに送信します。プライバシーポリシー