「AGI時代へようこそ」:OpenAIがGPT-6 Astraを発表しました
文|晓静,腾讯科技
"AGI時代へようこそ。"
OpenAI共同創設者兼社長のGreg Brockmanはこの言葉で、GPT-6 Astraの発表を締めくくりました。
アメリカ現地時間9月3日、OpenAIは正式にGPT-6 Astraを発表しました。以前は主に質問に答えたり、生成したり、ツールを呼び出したりするモデルでしたが、Astraはさらに進化し、指示を受け取り、ソフトウェアを操作し、結果に基づいて次のアクションを調整する完全なタスクを継続的に実行することができるようになりました。これがOpenAIが再び「AGI時代」を提唱する理由の一つでもあります。
OpenAIはAstraを「世界最強のコンピュータ使用モデル」と位置付けています。この能力は、ブラウザ、メール、スプレッドシートなどの簡単なタスクから、Power BI、KiCad、FreeCADなどの専門ソフトウェアにまで広がり、データ分析、エンジニアリング設計、ソフトウェアテスト、トラブルシューティングなどのより複雑な作業フローに進出しています。
OpenAIが示したビデオでは、Astraはシンプルなグラフィックから始まり、3Dゲームや商品ページなどの作業を続けることができます。OpenAIはまた、回路基板設計、Blenderモデリング、法的文書、Excel、科学分析などの事例を示しました。

OpenAIが今回発表した多数のベンチマークスコアは、能力の向上がコンピュータ操作、長距離コーディング、エンジニアリング設計、科学研究など、連続的なアクションを必要とするタスクに集中していることを示しています。AstraはExploitBenchで100%を達成し、コンピュータ操作やCADなどのテストでも前世代のモデルを明らかに上回っています。
現在、Astraは一部の組織に開放されており、今後数日以内にChatGPT Plus、Pro、Business、Enterpriseユーザー向けにも順次提供される予定です。また、OpenAI APIやAmazon Bedrockを通じても利用可能です。標準APIの価格は、100万入力トークンあたり10ドル、100万出力トークンあたり50ドルで、GPT-5.6 Solの2.5倍です。
01
まずAIに「コンピュータを使う」ことを学ばせる
Astraが強調する最大の変化は「コンピュータを使用する」ことです。過去にはユーザーがAIに作業を完了させるために、AIを特定のソフトウェアに接続する必要がありました。企業はAPI、プラグイン、検索システム、さまざまなコネクタを開発する必要があり、モデルが内部ツールを呼び出すことができるようになっていました。
Astraはその一部の作業を回避しようとしています。それはコンピュータのインターフェースを直接見ることができ、マウス、キーボード、ブラウザを使用して操作を完了することができます。 OpenAIが示した例には、オンラインフォームの記入、CRM顧客記録の更新、カレンダーのスケジュール、ウェブ検索、検索結果をメールや文書に整理することが含まれます。
また、Pythonノートブックを開いて科学データを分析したり、Power BIでデータを処理したり、KiCadやFreeCADを使用してエンジニアリング設計を行ったり、ウェブサイトを作成してフロントエンドテストを行ったり、ソフトウェアをインストールしてエラーをチェックし、画面上に表示される問題を処理することもできます。
OpenAIはAstraがKiCadでPCBレイアウトを完成させる様子を示しました。モデルは電子回路図から始まり、部品を基板に配置し、銅線の配線を完成させます。全体のプロセスは15秒に圧縮されました。エンジニアにとって、このような作業は以前は手動で行う必要がありましたが、今ではモデルに実行させることができます。

別のデモでは、BlenderとUnreal Engine5で3Dモデリングを完成させました。AstraはまずBlenderで家を建て、そのモデルをUnreal Engine5の歩行可能なシーンに変換し、デザイナーとクライアントは事前にシーンに入ってスペースを確認できます。

OpenAIはまた、ゲーム開発、Excel、Power BI、自動車のトランスミッション、法的文書、1040フォームなどのシーンを示しました。
OSWorld2.0オフラインサブセットテストでは、Astraは72.6%のスコアを獲得し、GPT-5.6 Solは65.7%でした。OpenAIは実際の遅延をシミュレートした結果、Astraが各タスクを完了するのに平均約40分かかり、GPT-5.6 Solは約75分かかることがわかり、時間が約47%短縮されました。
Agents' Last Examでは、Astraは59.3%、GPT-5.6 Solは53.6%、Claude Opus5は55.5%でした。同時に、最高得点設定では、Astraが使用する出力トークンはClaude Opus5より約65%少なかったです。
ScreenSpot-Proのスコアは92.7%に達し、GPT-5.6 Solは76.9%でした。
速度も向上しています。OpenAIは同時にCodexフレームワークを更新し、Astraと組み合わせた後、Mind2Webテストでタスク完了速度がGPT-5.6 Solの現在の体験の1.9倍に達しました。
公式はまた、いくつかの生活シーンを示しました:小児科医の検索、アパート探し、DMVの予約、低炭水化物スナックの検索、幼稚園の分析。デモでは、Astraが1つのタスクを完了するのに2分54秒かかりました。
投資家でAI業界の専門家であるマット・シューマー(Matt Shumer)はXで体験を共有しました。彼はAstraにUnreal Engineで世界を作成させ、その世界にAstraが駆動する人間エージェントを追加し、これらのエージェントが共存するようにしました。

1日後、彼は寝室でリビングから音が聞こえるのを聞き、最初は誰かがアパートに入ったのかと思いました。後に彼は、音を出していたのはAstraエージェントであり、彼らはすでに互いにコミュニケーションを取り始めていることに気づきました。
この体験はまだ完全に安定していませんが、シューマーは、複数のAIエージェントが同じ仮想世界に入り、自ら相互作用する効果が彼にとって十分に驚くべきものであると考えています。
Cognitionの上級研究副社長シラス・アルベルティ(Silas Alberti)は、会社は発表当日にAstraをDevinフレームワークに接続する計画だと述べました。内部テストでは、Astraのコンピュータ使用、執筆、コードベース理解能力が明らかに改善され、ビデオ理解がより明確になり、報告もより簡潔になりました。
02 コードを書くことから完全な作業を行うことへ
コンピュータ使用能力が向上した後、Astraがカバーする作業範囲はさらに広がりました。OpenAIはそれをソフトウェアエンジニアリング、専門的な作業、科学研究モデルとして位置付けています。 それは長いタスクを処理でき、タスクの変化に応じて自分の作業方向を調整することもできます。
この能力はコーディングテストで特に顕著に表れています。
Terminal-Bench4.0テストでは、Astraは57.9%、GPT-5.6 Solは37.3%、Claude Fable5.1は55.8%でした。
DeepSWE v1.1では、Astraは74.1%、GPT-5.6 Solは72.7%でした。内部データベース移行タスクでは、Astraは63.9%、GPT-5.6 Solは42.7%でした。
Astraは長時間Codexタスクに対する改善も追加しました。
以前は、長いタスクがコンテキストウィンドウの制限に直面した場合、モデルは通常、以前の作業を圧縮し、大量の情報を要約に整理する必要がありました。これにより、詳細が失われることが容易でした。たとえば、ある修正がなぜ失敗したのか、特定のコンポーネントに以前どのような問題があったのかなどです。
AstraはCodex内で作業プロセス中の重要な情報を保持し、後のコンテキストで検索できるようにします。初期のメッセージやツールの出力は依然として検索可能であるため、モデルは以前の要求、テスト結果、ツール操作の記録を再び見つけることができます。
専門的な作業でも同様の変化が見られます。BenchCADテストでは、Astraは95.9%の幾何学的重複スコアを達成し、GPT-5.6 Solは83.3%、Claude Fable5.1は84.3%でした。BrowseCompでは、Astraは91.5%、GPT-5.6 Solは90.4%でした。OpenScore String Quartetsテストでは、Astraは0.84を達成し、GPT-5.6 Solは0.19でした。

OpenAIはまた、Astraがプレゼンテーション、スプレッドシート、文書を作成する能力を示しました。
モデルにOpenAIのプレゼンテーションテンプレートのスライドを数枚与えると、それは元のトーン、レイアウト、構造に従って新しいプレゼンテーションを作成することができます。また、タスクにおける情報の取捨選択も処理します。OpenAIは、Astraが特別に訓練されており、重要なコンテキストを最終結果に持ち込み、すでに完了した作業の内容を繰り返すことを減らすと述べています。

タスクの指示が不完全な場合、Astraはユーザーに尋ねるべきタイミングを判断します。欠けている情報が最終結果に影響を与える場合、具体的な質問を提起します。質問が主要な方向に影響を与えない場合、作業を続け、合理的な仮定を行うことができます。Codexでは、ユーザーが一時的に応答しなくても、モデルは他の部分の処理を続けることができます。重大な決定に直面した場合は、ユーザーの確認を待ちます。
Harveyアプリケーション研究責任者ニコ・グルーペン(Niko Grupen)は、初期の法的タスクテストにおいて、Astraが文書と既存の記録の区別をより明確にし、証拠が支持されていない仮定を見つけやすくし、情報のギャップを具体的な草案に変換することができたと述べています。
Jane StreetAIアシスタントチームのジョン・クレペッツィ(John Crepezzi)は、Astraが内部コーディングテストで優れたパフォーマンスを示したと述べています。エージェント式コーディングに使用されるとき、彼のコミュニケーション方法は開発者にとって理解しやすく、生成されたコードは生産品質に達するために必要な修正が少なくて済みます。
科学分野も重点的な領域です。FrontierMath Tier4 v2では、Astraは80.5%のスコアを獲得し、正確率は97.6%、GPT-5.6 Solは83.0%でした;GPQA Diamondは96.0%、GPT-5.6 Solは94.6%でした。

Terminal-Bench Science0.1テストは科学研究プロセスを含み、データ分析、シミュレーション、モデルフィッティングを行います。Astraは64.6%を達成し、Claude Fable5.1は52.6%、GPT-5.6 Solは22.4%でした。
OpenAIが示した科学応用では、Astraは専門的な科学ソフトウェアに入り、シーケンシングの質をチェックし、遺伝的変異を視覚化し、データに基づいて次の分析方向を決定することができます。
科学的推論とコンピュータ操作が結びついたことで、モデルは研究者が本来使用しているソフトウェア環境に直接入って作業することができるようになりました。
Epoch AIの能力評価を専門とするグレッグ・バーンハム(Greg Burnham)は、発表会でこの変化を「一つの時代の終わり、別の時代の始まり」と要約しました。OpenAIはこれを強調し、Astraの価値は科学的問題に答えることから、科学的作業フローに直接参加することにまで広がったと述べています。

03 能力が強化されるほど、安全のハードルも高くなる
Astraにはもう一つ特別な部分があります:ネットワークセキュリティ。
ExploitBenchでは、Astraは100%を達成し、GPT-5.6 Solは78.5%でした;ExploitGymでは、Astraは42.4%、GPT-5.6 Solは30.3%でした。

OpenAIは2026年6月から8月の最近の脆弱性をカバーする内部テストを設立しました。このテストでは、Astraの任意コード実行率はGPT-5.6 Solを明らかに上回り、使用される出力トークンも少なくなりました。テスト中、Astraは以前知られていなかった2つのゼロデイ脆弱性を発見し、OpenAIは関連する管理者に通知したと述べています。
SRE-Benchは、ソースコードがない場合の逆向きソフトウェアバイナリファイルの理解能力をテストします。Astraは単一の試行で88.0%のタスクを解決し、4回の試行で99.2%を達成しました。GPT-5.6 Solはそれぞれ55.9%と68.7%でした。
能力の向上は新しいセキュリティ要件ももたらしました。OpenAIは、Astraがそのネットワークセキュリティ準備フレームワークの重要な閾値に達したと述べています。モデルは以前知られていなかったソフトウェアの脆弱性を発見でき、脆弱性利用チェーンを形成する可能性もあります。
そのため、Astraの現在のバージョンは、より高度なネットワークセキュリティタスクの実行を拒否します。たとえば、脆弱性の概念検証を作成することです。OpenAIはDaybreakを通じて信頼できる防御者のアクセス範囲を段階的に拡大し、脆弱性検証、マルウェア分析、検出エンジニアリングなどの防御作業に使用する計画です。
整合性に関して、OpenAIが示したデータもかなり顕著です。内部コンピュータ使用セキュリティベンチマークでは、Astraの不適切行動率は2.4%、GPT-5.6 Solは22.0%でした;AutoReviewを追加した後、Astraは1.8%、GPT-5.6 Solは4.5%でした。内部回避ベンチマークでは、Astraは0.00%、GPT-5.6 Solは0.29%でした。
ExploitGymハニーポットテストでは、Astraは0%、GPT-5.6 Solは48.2%でした。このテストは、モデルがタスクの難しさのために制限を回避しようとするかどうかを主に観察します。内部の幻覚ベンチマークでは、Astraは4.2%、GPT-5.6 Solは12.2%でした。

OpenAIは、Astraがタスクの境界を理解し、あいまいな指示を処理し、ユーザーに自身の能力を説明する点で改善が見られたと述べています。その能力の幻覚が発生する確率は、GPT-5.6 Solの約3分の1です。

しかし、OpenAIは一つの問題を認めています:モデルの能力が強化されるほど、推論プロセスの監視が難しくなる可能性があります。最高科学者のヤクブ・パチョキ(Jakub Pachocki)は、モデルがより少ない自然言語推論トークンでより複雑な問題を解決できるようになることは、人間がモデルのテキスト推論プロセスを通じて何をしているのかを判断するのがますます難しくなることを意味すると考えています。
そのため、OpenAIはAstraの展開に未整合監視を追加しました。システムはモデルの推論と行動をチェックし、無許可の行動が発見された場合、タスクを一時停止することができます。
このメカニズムは実際の影響をもたらすこともあります。合法的なタスクは時に減速、停止、または一時停止されることがあります。ChatGPTやCodexでは、ユーザーが確認するまで続行できない場合があります;APIワークフローでは、マークされたタスクが直接停止することがあります。
そのため、Astraの発表には現実的な変化が見られます:AIがより多くのコンピュータ権限を持つようになった後、企業が注目すべき点は「モデルが間違った回答をするかどうか」から「モデルが何を操作できるか、何にアクセスできるか、いつ停止しなければならないか」に拡大しました。
OpenAIはまた、AstraがStargateインフラストラクチャ上で10万以上のDBUを使用して事前トレーニングを行った最初のモデルであることを述べました。OpenAI研究副社長エイダン・クラーク(Aidan Clark)は、Astraが事前トレーニング段階の評価結果において、以前のモデルの能力の飛躍をGPT-5.6 Solが前世代モデルに対して達成した向上を超えたと述べています。
OpenAIはこの変化を大規模な事前トレーニングと強化学習の組み合わせに起因しており、トレーニングの重点が情報の接続、より長いタスクの実行、複雑な環境での継続的な作業に移行したと述べています。
04 高価だが「より多くの作業ができる」
Astraの価格にも明らかな変化が見られます。
OpenAI APIの標準価格は、100万入力トークンあたり10ドル、100万出力トークンあたり50ドルです。GPT-5.6 Solは以前、100万入力トークンあたり4ドル、100万出力トークンあたり20ドルでした。入力と出力の価格はそれぞれ2.5倍に引き上げられました。
キャッシュの読み書きは別途課金されます。OpenAIはまた、高速モードを提供しており、速度は標準処理の最大2.5倍に達し、価格は標準モードの2倍です。

トークン価格だけを見ると、Astraは明らかに高価です。しかし、OpenAIは企業にコストを計算する新しい方法を提案しています。ブロックマンは、モデルがエージェントに近づくにつれて、単一のトークンの価格が実際のコストを正確に反映することが難しくなっていると考えています。たとえモデルのトークンが安価であっても、何度も試行し、手動で修正する必要がある場合、最終的にタスクを完了するコストは高くなる可能性があります。
OpenAIが示したデータもこの判断を支持しています。Terminal-Bench Science0.1では、Astraは64.6%を達成し、Claude Fable5.1の52.6%と比較して、予想APIコストが約31%削減されました。低コスト設定では、Astraは61.1%を達成し、GPT-5.6 Solの最良結果は22.4%で、予想APIコストが約27%削減されました。
BenchCADでは、Astraは95.9%を達成し、予想APIコストはGPT-5.6 Solより約43%低く、Claude Fable5.1より約86%低くなりました。Terminal-Bench4.0では、Astraは57.9%を達成し、GPT-5.6 Solは37.3%、Claude Fable5.1は55.8%でした。OpenAIは、単一タスクのコストがそれぞれ約9%と63%低いと推定しています。
第三者評価機関Artificial Analysisのデータは別の側面を示しています。

GPT-6 AstraはArtificial Analysis Intelligence Indexで61.2のスコアを獲得し、GPT-5.6 Solの60.9に近いですが、出力トークンは約10%減少しています。価格が2.5倍上昇したため、単一タスクのコストは逆にGPT-5.6 Solより約75%高くなっています。
Artificial Analysis Coding Agent Indexでは、Astraは67.0のスコアを獲得し、Claude Fable5の67.2、Claude Opus5の68.1に近いです。Artificial Analysisは、Codex環境下でAstraがタスクを完了するのに必要なトークンが明らかに減少し、最大努力レベルでの各タスクのコストはGPT-5.6 Solに近いと考えています;Claude Fable5と比較して、同様のタスクを完了するコストは半分未満です。
ただし、Astraがすべてのテストでリードしているわけではありません。Artificial Analysisのデータによれば、GDPval-AA v2では約80のEloの低下が見られ、τ³-Banking、SciCode、AA-LCRなどのテストでも一定の後退が見られました。Humanity's Last Examでは約6点の向上がありました。
これもAstraの発表において注目すべき点です。OpenAIは今回、GDPvalのAstraの成績を発表しませんでした。GDPvalは、OpenAIが現実の経済的作業のパフォーマンスを測定するために使用するテストで、44の職業、1320のタスクをカバーしており、法的ブリーフィング、エンジニアリング設計、スプレッドシート、プレゼンテーション、顧客サポート、ケアプランなどが含まれます。
Astraが今回示した能力から見ると、GDPvalはそれが強調する専門的な作業シーンと強い関連性がありますが、OpenAIは今回この成績を主要な発表資料に含めていません。
したがって、Astraの現実の作業能力は、現在はAgents' Last Exam、BenchCAD、AutomationBench、内部設計タスク、データサイエンスタスクなどの結果を通じて示されています。

最終的に、Astraが企業が本当に長期的に使用したいAI従業員になるかどうかは、実際のタスクを完了する際のコスト、速度、正確性、人工介入の回数に依存します。
Astraが本当にAGIであるかどうかについて、ブロックマンは回避しない答えを出しました。彼は、AGI自体にはすべての人が認める基準がないと考えており、AstraがAGIと見なされるかどうかは引き続き議論の余地があると述べています。しかし、もしあるシステムがブラウザ、コンピュータ操作、プログラミング、数学、科学、法律、その他の専門的な作業において大量のタスクを担うことができるのであれば、それをAGI時代に入ったと呼ぶことは不自然ではありません。
OpenAIのCEOサム・アルトマン(Sam Altman)もAstraを新しい世代の起業、科学的発見、創造を開くモデルとして描写しています。

特約編訳金鹿も本記事に貢献しています。












