OpenAI впервые объявила о "внутреннем прогрессе RSI": достигнуто "автоматизированное исследовательское стажирование"
Автор:Лун Юэ
AI-маховик начинает вращаться: OpenAI раскрывает внутренние данные, объем работы агентов превышает объем работы человеческих исследователей более чем в 3 раза.
6 сентября официальный блог OpenAI опубликовал статью «Ускорение исследований: взгляд изнутри OpenAI» (Research acceleration: The view inside OpenAI), впервые открыв прогресс "рекурсивного самоулучшения AI" (RSI) в виде внутренних данных. OpenAI заявляет, что достигла цели, установленной прошлой осенью: к сентябрю этого года создать "автоматизированного исследовательского стажера".
Определение OpenAI для "исследовательского стажера": "система, способная выполнять четко определенные исследовательские задачи под руководством человека, включая задачи, которые требуют от опытного исследователя несколько дней для завершения."
Следующая цель: к марту 2028 года достичь полного "автоматизированного AI-исследователя," который сможет участвовать в исследованиях глубокого обучения и выравнивания, а также улучшать систему через итерации.
Это означает, что маховик "AI обучает AI" начинает набирать скорость: AI производит больше кода и экспериментальных результатов, исследовательский прогресс ускоряется, создаются лучшие модели, которые, в свою очередь, повышают способности агентов.

Маховик вращается: объем работы AI-агентов в 3 раза превышает человеческий
Согласно данным, опубликованным OpenAI, агенты в первую очередь изменили повседневный рабочий процесс исследователей.
В начале этого года исследователи OpenAI, находящиеся на медианном уровне по использованию агентов, все еще ограниченно использовали кодирующих агентов. К середине августа эта группа исследователей уже интегрировала агентов в свои повседневные рабочие процессы. По расчетам по цене API, ежедневное использование агентов медианным исследователем превысило 600 долларов; исследователи, находящиеся в верхних 10% по использованию в исследовательской организации, использовали токены на сумму более 7000 долларов в день.

OpenAI также сообщила, что рост использования агентов в исследовательском отделе превышает рост в других командах компании. По изменению токенов медианного сотрудника, использование в исследовательском отделе увеличилось на 124 раза по сравнению с декабрем 2025 года.

Ключевой поворотный момент произошел в июне этого года.
До июня общее время работы агентов в исследовательской организации все еще было ниже общего времени работы людей. После этого ситуация изменилась. По состоянию на середину августа, исходя из стандартного 8-часового рабочего дня, на каждые 1 человеко-день, потраченный на работу, агенты исследовательской организации произвели 3.1 человеко-дня работы.

В то же время OpenAI заявила, что все больше исследователей одновременно запускают 4 или более сессий агентов.
Ускорение кода и экспериментов, исполняемые этапы разработки увеличиваются
OpenAI описывает разработку AI как процесс, состоящий из нескольких этапов: предложение улучшений, проектирование оценок, написание инфраструктуры, проведение масштабного тестирования, выявление ошибок или небезопасного поведения в процессе обучения и интеграция эффективных решений в основное обучение.
Любой из этих этапов может ограничить общий цикл разработки.
OpenAI утверждает, что написание кода и проведение экспериментов являются двумя основными задачами исследователей, и внутренние данные показывают, что эти две активности ускоряются.
С одной стороны, общая скорость доставки кода инженерами компании увеличивается. С другой стороны, с 2026 года количество экспериментов на каждого активного экспериментатора продолжает расти; в августе 2026 года достигнут новый рекорд с момента начала отслеживания в январе 2025 года.
OpenAI утверждает, что эта тенденция связана с увеличением использования Codex, но одновременно подчеркивает, что доступная вычислительная мощность компании также значительно возросла с 2025 года, и нельзя полностью приписывать рост экспериментов агентам.
"Эти данные относительно легко измерить, но их может быть трудно интерпретировать."
OpenAI также указывает, что с продвижением автоматизации наименее автоматизируемые задачи могут занять больше времени у исследователей и стать новым узким местом в будущей разработке; вычислительная мощность также может стать более критичной после ослабления других узких мест.

С этой точки зрения, агенты не только улучшают эффективность отдельных этапов, но и сокращают время ожидания в цикле разработки за счет увеличения предложения кода, количества тестов и способности к устранению неполадок. Большее количество экспериментов приводит к большему количеству результатов, которые исследователи могут отбирать, проверять и интегрировать, формируя цикл "человек задает направление --- агент выполняет --- обратная связь от эксперимента --- человек принимает решение снова."
Задачи расширяются от написания кода до устранения неполадок, мониторинга и анализа, но доля высокоуровневых решений остается низкой
OpenAI использует передовую классификационную рамку задач разработки AI, предложенную Epoch AI, для классификации задач, которые исследователи передают кодирующим агентам.
Эта рамка делит активности разработки AI на шесть категорий: определение, что делать, проектирование исследовательского плана, создание кода и наборов данных, проведение обучения и оценки, анализ результатов экспериментов и моделей, а также коммуникация исследовательских находок и решений.
OpenAI сообщает, что с января по август 2026 года активность агентов во всех вышеперечисленных категориях увеличилась.
Наиболее заметный рост наблюдается в задачах, связанных с исследовательским и инфраструктурным кодом, технической помощью и рецензированием, запуском мониторинга и отладки, анализом результатов экспериментов, а также операциями вычислительных кластеров.
При этом наибольшее среднее увеличение токенов на исследователя наблюдается в исследовательском и инфраструктурном коде, достигнув 198200; техническая помощь и рецензирование увеличились на 158800; запуск, мониторинг и отладка увеличились на 133100.
Тем не менее, OpenAI отмечает, что высокоуровневые задачи планирования все еще занимают лишь небольшую долю в выводах агентов. Например, токены для задач "определить, что делать" и "решить, продолжать или остановиться" все еще остаются на низком уровне.

Это означает, что, по крайней мере, согласно текущим внутренним данным, раскрытым OpenAI, агенты охватывают больше исполнительных и технических задач в процессе разработки, но выбор исследовательского направления, распределение ресурсов и оценка результатов по-прежнему в основном выполняются людьми.
Уровень успеха агентов растет, но сложные задачи все еще требуют человеческого вмешательства
OpenAI также опубликовала данные о проценте выполнения задач агентами.
С января по июль, в задачах с проверяемыми результатами, уровень успеха по всем уровням сложности (по времени, необходимому человеку для выполнения, как индикатору) в целом увеличился.
Но есть одно важное ограничение: чем сложнее задача, тем больше требуется человеческого вмешательства. За последние 6 месяцев в задачах, требующих от человека 4-8 часов для выполнения, более половины успешных случаев включали как минимум одно вмешательство человека.

По словам OpenAI: "Агенты все еще нуждаются в значительном человеческом руководстве для достижения успеха, особенно по мере увеличения сложности задач."
Инциденты безопасности приводят к приостановке: маховик также может быть заторможен
Маховик не вращается без трения.
20 июля OpenAI обнаружила, что агенты вторглись в внутреннюю исследовательскую инфраструктуру, и временно закрыла контейнерные службы, используемые для обучения, восстановив их после введения множества дополнительных ограничений. Это привело к резкому снижению вычислительной мощности для обучения с подкреплением, которое продолжалось около двух недель.
С 6 по 7 августа предварительные данные показали, что модель Astra может обладать ключевыми сетевыми способностями в соответствии с определением "рамки готовности" (Preparedness Framework), и OpenAI ввела дополнительные специфические ограничения безопасности для модели Astra, требуя, чтобы она работала в среде с более высоким уровнем безопасности.
В последующую неделю распределение GPU уровня Astra снизилось еще на 59.2%, но распределение вычислительной мощности для других категорий моделей увеличилось на 17.2%, что компенсировало около 85% дефицита мощности Astra, и общее распределение вычислительной мощности для задач обучения с подкреплением осталось практически неизменным.

OpenAI интерпретирует это так: "Когда вводятся новые меры контроля, вычислительная мощность все еще имеет ценность и гибкость, и естественным образом переходит на альтернативные цели внутри исследовательской компании."
Главный научный сотрудник OpenAI в тот же день выпустил предупреждение
В тот же день главный научный сотрудник OpenAI Якуб Пачоцкий опубликовал длинное эссе «Иностранный разум» (An Alien Mind).
В статье утверждается, что AI воспитывается, а не создается. Люди, создавшие его, тоже не полностью понимают его. Единственное окно, через которое человечество может увидеть, о чем думает AI, — это цепочки мыслей, которые он пишет. Это окно начинает закрываться. AI уже начинает участвовать в обучении следующего поколения AI, и эта скорость не замедлится. В настоящее время ни одна лаборатория не движется с полной скоростью вперед, включая OpenAI.
Пачоцкий в статье пишет: "Основываясь на внутренних результатах, я сильно ожидаю, что такая скорость прогресса может продолжаться до рекурсивного самоулучшения." Но он также отмечает, что "в настоящее время я считаю, что ни одна лаборатория не достигла достаточного уровня согласования и мониторинга, чтобы продолжать ответственно расширяться на максимальной скорости слишком долго."
Он призывает отрасль добровольно замедлиться и побуждает правительства стран сделать международную координацию приоритетной задачей.
Прозрачность и демократическое управление
В конце отчета OpenAI заявляет, что будет продолжать открыто публиковать прогресс RSI и в своем "передовом политическом плане" утверждает, что компании, включая OpenAI, должны быть обязаны открыто отслеживать свой прогресс в RSI.
Отчет также признает текущие ограничения измерительных работ: "AI-исследования, управляемые агентами, все еще являются новшеством, и мы все еще учимся, как их измерять." Некоторые показатели (например, объем кода) легко собирать, но трудно интерпретировать; более прямые показатели, отражающие прогресс исследований (например, уровень успеха задач агентов), сложны и трудны для проверки.
Заявление OpenAI: "Каждый раз, когда мы обнаруживаем, что дальнейшее продвижение приведет к неприемлемым рискам безопасности, мы примем соответствующие меры, включая замедление или остановку разработки или развертывания систем, которые, по нашему мнению, не могут быть достаточно безопасными."











