GPT-6 Astra、PC操作ベンチで部分スコア72.6% 「75分→40分」は何を意味する?

長いAIエージェント処理が、より短く整理されたPC作業フローへ変化することを表した概念イメージ AI・テクノロジー

OpenAIが2026年9月3日に発表した「GPT-6 Astra」で、かなり気になる数字があります。

PCを操作する能力を測る「OSWorld 2.0」のオフライン評価で、GPT-6 Astraは部分スコア72.6%を記録。GPT-5.6 Solの65.7%を上回りました。

さらにOpenAIのレイテンシーシミュレーションでは、1タスクあたりの所要時間がGPT-5.6 Solの約75分から、GPT-6 Astraでは約40分へ短縮。差は約35分、割合では約47%減っています。

ただし、この数字を「普段のChatGPTでPC作業をすると何でも47%速くなる」と受け取るのは正確ではありません。

72.6%が何を表す数字なのか、そして「75分→40分」がどのような条件で測られたのかを見ていきます。

72.6%だけでなく「約75分→約40分」が目を引く

OpenAIが公表した比較を整理すると、次のようになります。

指標 GPT-6 Astra GPT-5.6 Sol
OSWorld 2.0部分スコア 72.6% 65.7% +6.9ポイント
レイテンシーシミュレーション上の所要時間 約40分/タスク 約75分/タスク 約35分短縮
所要時間の削減率 約47%減
GPT-6 AstraはOSWorld 2.0の部分スコア72.6%、レイテンシーシミュレーション約40分で、GPT-5.6 Solの65.7%、約75分より所要時間が約47%短いというOpenAI公表値の比較図

※OpenAI公表値。OSWorld 2.0 v2026.08.08のoffline set、partial scoreを使用。

ポイントは、単に評価スコアを上げただけではありません。

部分スコアを65.7%から72.6%へ伸ばしながら、シミュレーション上の所要時間は約75分から約40分へ短くなっています。

AIエージェントへ長時間の作業を任せる場合、「どこまで正しく進められたか」と同時に、「結果が返るまでどれくらい待つのか」も実用性を左右します。

約40分という時間自体は短くありません。それでも約75分から約40分への変化なら、人間が結果を確認して次の作業へ進むサイクルを短くできる可能性があります。

72.6%は「タスク成功率」ではない

今回の数字で特に注意したいのが、72.6%の意味です。

これは「与えられたPC作業の72.6%を完全に成功させた」という成功率ではありません。

OpenAIがGPT-6 Astraの比較に使ったのは、

OSWorld 2.0 v2026.08.08 / offline set / partial score

です。

partial scoreは、長い作業の途中に設定された評価ポイントをどこまで満たせたかを部分的に評価する指標です。

そのため、72.6%という数字をそのまま「PC作業の成功率72.6%」と読み替えることはできません。

OSWorld 2.0全体は108の長時間タスクで構成され、研究チームによると、人間が完了するまでの中央値は約1.6時間。69.6%のタスクは熟練した人間でも1時間を超えます。

例えば、複数のWebサービスやアプリをまたぎながら情報を探し、書類を処理し、途中で変化する状況にも対応するといった長いワークフローが含まれます。

普段のチャットで質問に答える速度を測ったテストではありません。

「約35分短縮」はレイテンシーシミュレーションの結果

もう一つ区別したいのが「約75分→約40分」という数字です。

OpenAI自身も、これをOSWorld 2.0上のlatency simulations(レイテンシーシミュレーション)として説明しています。

つまり、

「GPT-6 Astraを使えば、実際の仕事が必ず35分短くなる」

という実測値ではありません。

利用する環境、操作対象、ネットワーク、推論設定、ツール、タスクの長さなどが変われば、実際の所要時間も変わります。

また、OpenAIは比較対象となったGPT-5.6 Solについて、API、ChatGPT Work、Codexで提供されるバージョンを指しており、通常のChatGPT Chatで動くバージョンとはわずかに異なると説明しています。

それでも今回の比較には分かりやすい意味があります。

これまでAIモデルの性能比較というと、

「何%正解できたか」

が目立ちがちでした。

PCを自律操作するAIエージェントでは、そこに、

「どの程度まで作業を進められたか」

「何分かかったか」

という要素が加わってきています。

長時間の仕事をAIへ任せるほど、スコアだけでは性能を判断しにくくなりそうです。

Plusでは使える? Chat・Work・Codexで提供範囲が違う

提供状況にも注意が必要です。

OpenAIの発表では、GPT-6 AstraをChatGPT Plus、Pro、Business、Enterpriseなどへ段階的に提供すると案内しています。

ただし、「PlusでもAstraが提供される」ことと、「通常のChatでGPT-6 Proを選択できる」ことは同じではありません。

2026年9月6日朝時点のOpenAI Help Centerでは、通常のChatGPT ChatでGPT-6 Astraを「GPT-6 Pro」として利用できる対象は、

  • Pro $100
  • Pro $200
  • Business
  • Enterprise

とされています。

ChatGPT Plusは、通常ChatのGPT-6 Proには含まれていません。

一方、OpenAIのHelp Centerでは、PlusについてもChatGPT WorkとCodexでGPT-6 Astraを段階的に提供すると案内されています。

つまりPlusユーザーでは、

「AstraがPlusにも来た」

「通常のChatでGPT-6 Proを選択できる」

ではありません。

Chat、Work、Codexで展開状況が異なるため、「自分のPlusアカウントにAstraが見当たらない」というケースも不思議ではありません。

提供は段階展開中のため、この範囲は今後変わる可能性があります。

ネットでは「性能」だけでなく提供場所や使い勝手も話題に

Redditでは、ベンチマークそのものだけでなく「Plusではどこから使えるのか」という点にも関心が集まっています。

r/OpenAIのPlus展開に関する投稿では、2026年9月6日08:41の確認時点で367票。コメントには、

「WorkとCodexでは使えるがChatにはない」

という報告が見られました。

GitHub Copilotでも9月4日からGPT-6 Astraの提供が始まっており、関連するr/GithubCopilotの投稿は同時点で159票を集めていました。

一方、実際にAstraを使ったという別のr/OpenAI投稿では、能力の高さを評価しつつも、ユーザーの意図を自然にくみ取る部分では調整が必要だという趣旨の体験談も投稿されています。

もちろん、これは一人の利用者による初期評価であり、モデル全体の性能を示すものではありません。

提供開始直後だからこそ、OpenAIのベンチマークと実際のユーザー体験は分けて見る必要があります。

AIエージェントは「スコア+所要時間」で見る時代へ

今回の結果で特に興味深いのは、72.6%という数字だけではありません。

65.7%→72.6%へ部分スコアを伸ばしながら、レイテンシーシミュレーションでは約75分→約40分へ短縮した。

この組み合わせです。

チャットAIなら、回答までの数秒の違いは気にならない場面もあります。

しかしAIへ30分、1時間と続く作業を任せるようになると、所要時間の意味は大きくなります。

長時間のエージェント作業では、今後、

  • タスクを完全に終えられるか
  • 途中までどこまで正確に進められるか
  • 何ステップ必要か
  • 何分かかるか
  • 利用コストはいくらか

といった指標をまとめて見る必要がありそうです。

GPT-6 Astraの「約35分短縮」は、その変化を分かりやすく示す数字です。

ただし、現時点ではOpenAIが特定条件で実施した評価結果です。

実際のChatGPT WorkやCodexなどで、さまざまな利用者が同じような速度向上を体感できるかは、今後確認したいポイントです。

参照したネット反応

参照した一次情報

タイトルとURLをコピーしました