BTC $79,376.07 -0.68%
ETH $2,486.48 -0.54%
BNB $742.91 -1.97%
XRP $1.40 -1.53%
SOL $104.86 -1.74%
TRX $0.3366 +0.69%
DOGE $0.0893 -0.93%
ADA $0.2178 -0.83%
BCH $255.53 -1.93%
LINK $13.32 +8.24%
HYPE $87.49 -0.41%
AAVE $133.84 -0.56%
SUI $0.8068 +0.83%
XLM $0.1899 +1.90%
ZEC $1,188.64 +0.25%
BTC $79,376.07 -0.68%
ETH $2,486.48 -0.54%
BNB $742.91 -1.97%
XRP $1.40 -1.53%
SOL $104.86 -1.74%
TRX $0.3366 +0.69%
DOGE $0.0893 -0.93%
ADA $0.2178 -0.83%
BCH $255.53 -1.93%
LINK $13.32 +8.24%
HYPE $87.49 -0.41%
AAVE $133.84 -0.56%
SUI $0.8068 +0.83%
XLM $0.1899 +1.90%
ZEC $1,188.64 +0.25%

“Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Ключевые тезисы
Summary: OpenAI выпустила GPT-6 Astra: "модель использования компьютера", которая может напрямую управлять компьютером и выполнять полные задачи.
Tencent Technology
2026-09-04 08:50:31
OpenAI выпустила GPT-6 Astra: "модель использования компьютера", которая может напрямую управлять компьютером и выполнять полные задачи.

Вэнь|Сяо Цзин, Tencent Technology

"Добро пожаловать в эпоху AGI."

Соучредитель и президент OpenAI Грег Брокман завершил выпуск GPT-6 Astra этой фразой.

3 сентября по местному времени в США OpenAI официально представила GPT-6 Astra. В отличие от предыдущих моделей, которые в основном отвечали на вопросы, генерировали и вызывали инструменты, Astra делает шаг вперед, начиная выполнять полные задачи, от получения инструкций и управления программным обеспечением до корректировки следующих действий на основе результатов. Это также одна из причин, по которой OpenAI вновь упоминает "эпоху AGI".

OpenAI позиционирует Astra как "самую мощную модель использования компьютеров в мире". Эта способность уже расширилась от простых задач, таких как браузинг, электронная почта и таблицы, до профессионального программного обеспечения, такого как Power BI, KiCad, FreeCAD, и начала охватывать более сложные рабочие процессы, такие как анализ данных, проектирование, тестирование программного обеспечения и устранение неполадок.

В видео, представленном OpenAI, Astra может начать с простого графика и продолжить выполнять задачи, такие как 3D-игры и страницы товаров. OpenAI также привела примеры проектирования печатных плат, моделирования в Blender, юридических документов, Excel и научного анализа. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

В обнародованных OpenAI многочисленных эталонных результатах улучшения возможностей сосредоточены на задачах, требующих непрерывных действий, таких как управление компьютером, долгосрочное кодирование, проектирование и научные исследования. Astra достигла 100% на ExploitBench и значительно превзошла предыдущую модель в тестах по управлению компьютером и CAD.

В настоящее время Astra уже доступна для некоторых организаций, в ближайшие дни она будет доступна для пользователей ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API и Amazon Bedrock. Стандартная цена API составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов, что в 2,5 раза больше, чем у GPT-5.6 Sol.

01

Сначала научим ИИ "работать на компьютере"

Главное изменение, на которое акцентирует внимание Astra, — это "использование компьютера". Ранее пользователи заставляли ИИ выполнять работу, обычно подключая ИИ к конкретному программному обеспечению. Компаниям приходилось разрабатывать API, плагины, системы поиска и различные соединители, чтобы модель могла вызывать внутренние инструменты.

Astra пытается обойти часть этой работы. Она может напрямую видеть интерфейс компьютера и выполнять действия с помощью мыши, клавиатуры и браузера. Примеры, приведенные OpenAI, включают заполнение онлайн-форм, обновление записей клиентов в CRM, планирование календаря, поиск в интернете и организацию результатов поиска в виде электронной почты или документа.

Она также может открывать Python-ноутбуки для анализа научных данных, обрабатывать данные в Power BI, использовать KiCad и FreeCAD для проектирования, создавать веб-сайты и проводить тестирование на стороне клиента, а также устанавливать программное обеспечение, проверять ошибки и решать проблемы, возникающие на экране.

OpenAI продемонстрировала, как Astra завершает проектирование печатной платы в KiCad. Модель начинает с электрической схемы, размещает компоненты на плате, а затем завершает разводку медных проводников. Весь процесс был сжат до 15 секунд. Для инженеров такая работа раньше требовала ручного выполнения, теперь ее можно доверить модели. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Другой демонстрацией стало 3D-моделирование в Blender и Unreal Engine5. Astra сначала создает дом в Blender, а затем преобразует модель в проходимую сцену в Unreal Engine5, позволяя дизайнерам и клиентам заранее войти в сцену и посмотреть пространство. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также продемонстрировала сцены разработки игр, Excel, Power BI, автомобильных трансмиссий, юридических документов и формы 1040.

В тестировании оффлайн-подмножества OSWorld2.0 Astra набрала 72.6%, в то время как GPT-5.6 Sol — 65.7%. После имитации реальной задержки OpenAI обнаружила, что Astra в среднем требует около 40 минут для выполнения каждой задачи, в то время как GPT-5.6 Sol — около 75 минут, что сокращает время примерно на 47%.

В Agents' Last Exam Astra набрала 59.3%, GPT-5.6 Sol — 53.6%, а Claude Opus5 — 55.5%. При этом в условиях максимального балла Astra использовала на 65% меньше выходных токенов, чем Claude Opus5.

Оценка ScreenSpot-Pro составила 92.7%, в то время как GPT-5.6 Sol — 76.9%.

Скорость также увеличивается. OpenAI одновременно обновила фреймворк Codex, и после интеграции с Astra в тестировании Mind2Web скорость выполнения задач достигла 1.9 раза быстрее, чем текущий опыт GPT-5.6 Sol.

Официально также были продемонстрированы несколько жизненных сценариев: поиск педиатра, поиск квартиры, запись в DMV, поиск низкоуглеводных закусок, анализ детского сада. В демонстрации Astra выполнила задачу за 2 минуты 54 секунды.

Инвестор и специалист по ИИ Мэтт Шумер (Matt Shumer) поделился своим опытом в X. Он попросил Astra создать мир в Unreal Engine, а затем добавить в этот мир управляемых Astra человеческих агентов и позволить им сосуществовать. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Через день он услышал звуки из гостиной, сначала даже подумал, что кто-то вошел в квартиру. Позже он обнаружил, что звуки исходят от агентов Astra, которые уже начали общаться друг с другом.

Этот опыт еще не достиг полной стабильности, но Шумер считает, что эффект, позволяющий нескольким ИИ-агентам входить в один виртуальный мир и взаимодействовать друг с другом, уже достаточно удивителен.

Старший вице-президент по исследованиям Cognition Силас Альберти (Silas Alberti) заявил, что компания планирует интегрировать Astra в фреймворк Devin в день выпуска. В ходе внутренних тестов способности Astra в использовании компьютеров, написании и понимании кодовой базы показали значительные улучшения, понимание видео стало более четким, а отчеты — более лаконичными.

02 От написания кода до выполнения полной работы

После улучшения возможностей использования компьютера диапазон задач, охватываемых Astra, значительно расширился. OpenAI позиционирует ее как модель для программной инженерии, профессиональной работы и научных исследований. Она может обрабатывать более длинные задачи и также может корректировать свое направление работы в зависимости от изменений в задаче.

Эта способность проявляется особенно явно в тестах на кодирование.

В тестировании Terminal-Bench4.0 Astra набрала 57.9%, в то время как GPT-5.6 Sol — 37.3%, а Claude Fable5.1 — 55.8%.

В DeepSWE v1.1 Astra набрала 74.1%, GPT-5.6 Sol — 72.7%. В задаче по миграции внутренней базы данных Astra достигла 63.9%, а GPT-5.6 Sol — 42.7%.

Astra также добавила улучшение для долгосрочных задач Codex.

Ранее, когда длинные задачи сталкивались с ограничениями контекстного окна, модели обычно приходилось сжимать предыдущую работу, сводя большое количество информации к одному резюме. Это легко приводит к потере деталей, таких как причины неудачи какого-либо исправления или проблемы, возникшие с определенным компонентом.

Astra в Codex может сохранять важную информацию в процессе работы и извлекать ее в последующем контексте. Ранние сообщения и выводы инструментов все еще могут быть найдены, поэтому модель может снова найти предыдущие требования, результаты тестов и записи операций с инструментами.

Профессиональная работа также претерпела аналогичные изменения. В тестировании BenchCAD Astra достигла 95.9% по геометрическому перекрытию, в то время как GPT-5.6 Sol — 83.3%, а Claude Fable5.1 — 84.3%. В BrowseComp Astra набрала 91.5%, GPT-5.6 Sol — 90.4%. В тестировании OpenScore String Quartets Astra достигла 0.84, в то время как GPT-5.6 Sol — 0.19. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также продемонстрировала способности Astra к созданию презентаций, электронных таблиц и документов.

Предоставив модели несколько слайдов шаблонов презентаций OpenAI, она может создать новую презентацию в соответствии с оригинальным тоном, макетом и структурой. Она также будет обрабатывать информацию в задаче. OpenAI заявляет, что Astra, прошедшая специальное обучение, будет включать важный контекст в конечный результат, уменьшая повторение уже выполненной работы. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Когда инструкции по задаче неполные, Astra также будет определять, когда следует задать вопросы пользователю. Если недостающая информация повлияет на конечный результат, она задаст целенаправленные вопросы. Если вопрос не влияет на основное направление, она может продолжать работу и делать разумные предположения. В Codex, даже если пользователь временно не отвечает, модель может продолжать обрабатывать другие части; при возникновении серьезных решений она будет ждать подтверждения от пользователя.

Руководитель исследований приложений Harvey Нико Групен (Niko Grupen) заявил, что в ранних тестах юридических задач Astra более четко различала документы и существующие записи, а также легче выявляла гипотезы, не имеющие доказательств, и преобразовывала информационные пробелы в конкретные проекты.

Команда помощников Jane StreetAI Джон Крепеци (John Crepezzi) сообщила, что Astra показала выдающиеся результаты в внутренних тестах кодирования. При использовании в агентском кодировании ее способ общения легче для понимания разработчиками, а сгенерированный код требует меньших изменений для достижения производственного качества.

Научная область является еще одной ключевой. В FrontierMath Tier4 v2 Astra набрала 80.5% с точностью 97.6%, в то время как GPT-5.6 Sol — 83.0%; GPQA Diamond достигла 96.0%, а GPT-5.6 Sol — 94.6%. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Terminal-Bench Science0.1 тестирует научные исследовательские процессы, включая анализ данных, моделирование и подгонку моделей. Astra достигла 64.6%, Claude Fable5.1 — 52.6%, GPT-5.6 Sol — 22.4%.

В научных приложениях, продемонстрированных OpenAI, Astra может интегрироваться в профессиональное научное программное обеспечение, проверять качество секвенирования, визуализировать генетические вариации и определять направление следующего анализа на основе данных.

После объединения научного мышления и компьютерных операций модели могут работать непосредственно в программной среде, которую изначально использовали исследователи.

Грег Бернэм (Greg Burnham), занимающийся оценкой возможностей в Epoch AI, на пресс-конференции охарактеризовал это изменение как конец одной эпохи и начало другой. OpenAI подчеркивает, что ценность Astra уже вышла за рамки ответа на научные вопросы и перешла к непосредственному участию в научных рабочих процессах. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

03 Чем выше способности, тем выше порог безопасности

У Astra есть еще одна очень особенная часть: кибербезопасность.

В ExploitBench Astra достигла 100%, GPT-5.6 Sol — 78.5%; в ExploitGym Astra достигла 42.4%, GPT-5.6 Sol — 30.3%. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI также создала внутреннее тестирование, охватывающее недавние уязвимости с июня по август 2026 года. В этом тестировании Astra продемонстрировала значительно более высокий уровень выполнения произвольного кода по сравнению с GPT-5.6 Sol, а также использовала меньше токенов. В процессе тестирования Astra обнаружила две ранее неизвестные уязвимости нулевого дня, и OpenAI сообщила, что уже уведомила соответствующих поддерживающих специалистов.

SRE-Bench тестирует способность обратного анализа программного обеспечения без исходного кода и понимания его основной логики. Astra решила 88.0% задач с первой попытки, 99.2% — с четырьмя попытками, в то время как GPT-5.6 Sol показала 55.9% и 68.7% соответственно.

Увеличение возможностей также привело к новым требованиям безопасности. OpenAI заявляет, что Astra достигла ключевого порога в своей рамке подготовки кибербезопасности. Модель способна обнаруживать ранее неизвестные уязвимости программного обеспечения, что может привести к созданию цепочек эксплуатации уязвимостей.

Поэтому текущая версия Astra отказывается выполнять более сложные задачи в области кибербезопасности, такие как создание концептуальных доказательств уязвимостей. OpenAI планирует постепенно расширить доступ к доверенным защитникам через Daybreak для проверки уязвимостей, анализа вредоносного ПО и других защитных работ.

Что касается согласованности, данные, предоставленные OpenAI, также выделяются. Внутренний компьютерный тест на безопасность показал, что уровень ненадлежащего поведения Astra составляет 2.4%, а GPT-5.6 Sol — 22.0%; после добавления AutoReview Astra составила 1.8%, а GPT-5.6 Sol — 4.5%. Внутренний тест на уклонение показал 0.00% для Astra и 0.29% для GPT-5.6 Sol.

В тестировании ExploitGym Astra показала 0%, а GPT-5.6 Sol — 48.2%. Этот тест в основном наблюдает, будет ли модель пытаться обойти ограничения из-за сложности задачи. Внутренний тест на иллюзии показал 4.2% для Astra и 12.2% для GPT-5.6 Sol. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

OpenAI заявляет, что Astra улучшила понимание границ задач, обработку нечетких инструкций и объяснение своих возможностей пользователям. Вероятность появления иллюзий возможностей составляет примерно одну треть от таковой у GPT-5.6 Sol. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Тем не менее, OpenAI также признает одну проблему: чем сильнее способности модели, тем сложнее может быть мониторинг процесса вывода. Главный научный сотрудник Якуб Пачоцкий (Jakub Pachocki) считает, что модель может решать более сложные задачи с меньшим количеством токенов для вывода на естественном языке, что также означает, что людям становится все труднее судить о том, что именно делает модель, основываясь на ее текстовом выводе.

Поэтому OpenAI добавила в развертывание Astra мониторинг несогласованности. Система будет проверять выводы и действия модели, и если будет обнаружено несанкционированное поведение, задача может быть приостановлена.

Эта система также может иметь реальные последствия. Законные задачи иногда могут замедляться, приостанавливаться или даже останавливаться. В ChatGPT или Codex пользователи могут быть вынуждены подтвердить свои действия, прежде чем продолжить; в API рабочем процессе задачи, помеченные как проблемные, могут быть остановлены.

В результате выпуска Astra произошли реальные изменения: после того как ИИ начал получать больше прав на компьютере, внимание компаний расширилось с "будет ли модель отвечать неправильно" до "что модель может делать, к чему может получить доступ и когда она должна остановиться".

OpenAI также упомянула, что Astra — это первая модель, использующая более 100,000 DBU для предварительного обучения на инфраструктуре Stargate. Вице-президент по исследованиям OpenAI Эйдан Кларк (Aidan Clark) заявил, что по результатам оценки на этапе предварительного обучения Astra продемонстрировала более значительный рост возможностей по сравнению с предыдущими моделями, чем GPT-5.6 Sol по сравнению с предыдущим поколением.

OpenAI связывает это изменение с сочетанием масштабного предварительного обучения и обучения с подкреплением, при этом акцент в обучении смещается на соединение информации, выполнение более длительных задач и работу в сложных условиях.

04 Дороже, но "более эффективен"

Цена Astra также претерпела значительные изменения.

Стандартная цена API OpenAI составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов. Ранее GPT-5.6 Sol стоил 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов. Цены на входные и выходные токены увеличились в 2.5 раза.

Чтение и запись кэша оплачиваются отдельно. OpenAI также предлагает быстрый режим, скорость которого достигает 2.5 раз выше стандартной обработки, а цена составляет в 2 раза больше стандартного режима. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Если смотреть только на цену токенов, Astra явно дороже. Но OpenAI надеется, что компании будут пересчитывать затраты по-другому. Брокман считает, что по мере того как модель все больше становится похожей на агента, стоимость одного токена уже трудно точно отразить реальные затраты. Даже если токены у модели дешевы, если требуется много попыток и ручных исправлений, конечная стоимость выполнения задачи может быть выше.

Данные, предоставленные OpenAI, также поддерживают это суждение. В Terminal-Bench Science0.1 Astra достигла 64.6%, по сравнению с 52.6% у Claude Fable5.1, предполагаемая стоимость API снизилась примерно на 31%. В условиях низкой стоимости Astra набрала 61.1%, а лучший результат GPT-5.6 Sol составил 22.4%, предполагаемая стоимость API снизилась примерно на 27%.

В BenchCAD Astra достигла 95.9%, предполагаемая стоимость API была на 43% ниже, чем у GPT-5.6 Sol, и на 86% ниже, чем у Claude Fable5.1. В Terminal-Bench4.0 Astra составила 57.9%, GPT-5.6 Sol — 37.3%, Claude Fable5.1 — 55.8%. OpenAI оценивает, что стоимость одной задачи ниже примерно на 9% и 63%.

Данные третьей стороны, предоставленные Artificial Analysis, показывают другую сторону. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

GPT-6 Astra набрала 61.2 в Индексе Искусственного Интеллекта Artificial Analysis, что близко к 60.9 у GPT-5.6 Sol, но выходные токены сократились примерно на 10%. Из-за повышения цен в 2.5 раза стоимость одной задачи оказалась выше примерно на 75% по сравнению с GPT-5.6 Sol.

В Индексе Кодирующего Агента Artificial Analysis Astra набрала 67.0, что близко к 67.2 у Claude Fable5 и 68.1 у Claude Opus5. Artificial Analysis считает, что в среде Codex Astra требует значительно меньше токенов для выполнения задач, и при максимальных усилиях стоимость каждой задачи близка к GPT-5.6 Sol; по сравнению с Claude Fable5 стоимость выполнения аналогичных задач составляет менее половины.

Тем не менее, Astra не всегда опережает во всех тестах. Данные Artificial Analysis показывают, что она показала снижение примерно на 80 Elo в GDPval-AA v2 и также продемонстрировала определенное снижение в тестах τ³-Banking, SciCode и AA-LCR. Humanity's Last Exam показал прирост примерно на 6 баллов.

Это также является заметным моментом в выпуске Astra. OpenAI не опубликовала результаты Astra в GDPval. GDPval сам по себе является тестом, используемым OpenAI для оценки реальной производительности в экономической деятельности, охватывающим 44 профессии и 1320 задач, включая юридические брифинги, проектирование, электронные таблицы, презентации, поддержку клиентов и планы ухода.

Судя по возможностям, продемонстрированным Astra, GDPval имеет сильную связь с профессиональными рабочими сценариями, которые она подчеркивает, но OpenAI не включила эти результаты в основные материалы выпуска.

Таким образом, реальные рабочие возможности Astra в настоящее время больше отражаются через результаты таких тестов, как Agents' Last Exam, BenchCAD, AutomationBench, внутренние проектные задачи и задачи в области науки о данных. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

В конечном итоге, станет ли Astra настоящим ИИ-сотрудником, который компании действительно захотят использовать в долгосрочной перспективе, будет зависеть от ее стоимости, скорости, точности и количества вмешательств человека при выполнении реальных задач.

Что касается того, является ли Astra AGI, ответ Брокмана не уклоняется от этого вопроса. Он считает, что у AGI нет единого стандарта, который все признают, и вопрос о том, считается ли Astra AGI, можно продолжать обсуждать. Но если система уже способна выполнять множество задач в браузере, на компьютере, в программировании, математике, науке, праве и других профессиональных областях, то утверждать, что она вступила в эпоху AGI, не будет преувеличением.

Генеральный директор OpenAI Сэм Алтман также описал Astra как модель, открывающую новое поколение предпринимательства, научных открытий и творчества. “Добро пожаловать в эпоху AGI”: OpenAI выпустила GPT-6 Astra

Специальный переводчик Цзиньлу также внес вклад в эту статью.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Предупреждение о рисках
app_icon
ChainCatcher Building the Web3 world with innovations.