GPT-6 — это не только Astra!
Astra только что выпущена, а GPT-6 Sol уже находится в закрытом тестировании.

Performance is also outstanding, with a single test speed six times that of Astra.
Сделайте смелое предположение: Terra и Luna тоже уже в пути?
И в тот же самый день OpenAI только что опубликовала набор внутренних данных:
На данный момент, в пересчете на 8-часовой рабочий день, на каждого исследователя OpenAI приходится более 3 рабочих дней с агентами, работающими одновременно.
По цене API, ресурсы для вывода агентов, используемые медианным исследователем OpenAI в день, превышают 600 долларов.

OpenAI также объявила, что достигла внедрения «автоматизированного исследовательского стажера»:
Эти агенты могут выполнять часть задач, которые раньше занимали у исследователей несколько дней, при руководстве человека.
Даже старый Хуан говорит: AGI уже наступила!

Он сообщил, что Astra использует около 100 000 комплектов NVIDIA Grace Blackwell NVLink72 для обучения, и в ближайшее время будет запущено еще 400 000 GPU.
Похоже, эта волна действительно не только от OpenAI :)
GPT-6 SOL начал закрытый тест
Пользователь Lentils сообщил, что OpenAI проводит внутреннее тестирование GPT-6 Sol.
Он отметил, что общая производительность Sol явно ниже, чем у только что выпущенной Astra, но она быстрее и все еще относится к категории «монструозных» моделей.
Насколько быстро? Скорость однократного теста примерно в 6 раз выше, чем у Astra.
Пользователь Lyra дал одно и то же задание разным моделям: сгенерировать SVG-изображение BMW M4 Competition.
При этом GPT-6 Sol использует максимальный уровень, генерация без примеров заняла около 3 минут и выдала около 28 000 токенов.

GPT-6 Astra использует режим Max, выводит около 25 000 токенов за примерно 19 минут.

Gemini 3.1 DeepThink включен на высоком уровне, вывод составляет около 3300 токенов, но процесс вывода потребовал около 458 000 токенов и занял примерно 29 минут.

Gemini 3.8 Flash также включает высокий уровень, выводит около 19 000 токенов за примерно 42 секунды.

Напротив, Sol показал наилучшие результаты: его объем вывода близок к объему Astra, но скорость однократного тестирования примерно в 6 раз выше, чем у Astra — время выполнения составляет лишь около одной шестой.
Кроме того, пользователь Lentils также продемонстрировал прототип пиксельного песочного мира под названием «The Realm of Aurellune».

GPT-6 за один проход сгенерировал город, сельскохозяйственные угодья, реки, замок и мини-карту, а также добавил панель управления для переключения дня и ночи, размещения названий мест, настройки деталей — в целом это больше похоже на симулятор управления, уже имеющий готовый прототип.
Это результат, сгенерированный с использованием zero-shot, максимального режима вывода, 15 минут и общей стоимости 60 000 токенов.
Сейчас можно предположить, что Astra ориентирована на наиболее сложные задачи глубокого рассуждения, а Sol, возможно, сосредоточена на скорости, пропускной способности и масштабировании вызовов агентов.
Что касается времени выхода Sol, пользователь Pankaj Kumar отметил, что он может быть официально представлен на конференции разработчиков OpenAI 29 сентября.

Также не исключено, что GPT-6, Terra, Luna и GPT-Image 2.5 появятся одновременно.

Исследователи OpenAI приходят на работу в среднем с тремя агентами-стажерами
В тот же день OpenAI также опубликовала интересные внутренние данные — насколько сильно ИИ-модели ускорили научные исследования в собственной лаборатории.
По состоянию на середину августа этого года на каждого исследователя, работающего 8 часов, приходится примерно 3,1 рабочих дня задач, выполняемых параллельно агентами.
Ну и дела, один человек ведет троих неразлучных стажеров~

Что касается расходов, по ценам API медианный исследователь тратит на ресурсы для вывода агентов более 600 долларов в день.
Это примерно день зарплаты младшего инженера.

Что именно делают эти агенты?
Написание кода для исследований, написание кода для инфраструктуры, настройка среды для обучения, запуск экспериментов по оценке, устранение неполадок инструментов и среды, анализ результатов экспериментов, мониторинг задач обучения... даже организация и коммуникация выводов исследований могут быть в вашем ведении.
В основном он может делать всё, кроме выбора, что изучать.
Одним из самых очевидных изменений стало то, что раньше, когда экспериментальная среда падала, исследователям приходилось кричать в внутреннем канале; теперь агенты всё чаще справляются с такими задачами, и количество запросов к человеческим ответам резко снизилось.

Некоторые команды полностью отменили регулярные технические сессии по вопросам, чтобы освободить людей для улучшения самой системы.
На основе этих данных OpenAI официально объявила: цель «автоматизированного AI-стажера в области исследований» достигнута.
Здесь «стажер» — это точнее всего исследовательский узел, способный выполнять работу: под руководством человека он может самостоятельно выполнять четко ограниченные исследовательские задачи, некоторые из которых ранее занимали у опытных исследователей несколько дней.
Эффект также оказался немедленным: количество кода и экспериментов, созданных исследователями, продолжает расти.

В августе 2026 года среднее количество экспериментов на человека достигло рекордного уровня с момента начала сбора статистики в январе 2025 года, а задачи, принимаемые агентами, становятся все более сложными и длительными.

Автор этой статьи Кевин Лю также поместил этот вопрос в более широкий контекст.
Он считает, что рекурсивное самоулучшение, вероятно, является одним из важнейших факторов, способствующих скачку в возможностях ИИ в ближайшие годы.
Проще говоря, ИИ создает ИИ, и чем больше, тем быстрее.

Но проблема в том, что согласно текущим тенденциям развития эта способность по умолчанию будет доступна только в нескольких передовых лабораториях ИИ, и внешнему миру сложно понять, на каком этапе она находится.
Поэтому Лю считает, что прозрачное раскрытие информации стало более срочным, чем когда-либо ранее. То, насколько быстро модели становятся сильнее, и нужно ли сбавлять темпы разработки, не может решаться только несколькими компаниями за закрытыми дверями.
Он также призвал другие компании в области ИИ опубликовать аналогичные данные.
Однако разработка ИИ действительно ускорилась, но еще не настолько, чтобы обеспечить полную автономную езду.
Данные OpenAI показывают, что за последние полгода в более чем половине успешных случаев задач, которые ранее занимали от 4 до 8 часов, человеку пришлось вмешаться по крайней мере один раз. Что касается стратегического исследовательского планирования, его почти никогда не передают агентам.

Исследователи по-прежнему отвечают за решение, что изучать, какие результаты стоят дальнейшего развития, а также когда следует расширить обучение, приостановить эксперимент или развернуть модель.
Следующая цель OpenAI также определена: достижение «автоматизированного AI-исследователя» до марта 2028 года.
В отличие от «стажёров», которые могут выполнять только чётко определённые задачи, «исследователи» должны справляться с более открытыми исследовательскими целями и самостоятельно продвигать проекты с более длительными циклами — то есть переходить от исполнителей к независимым ответственным лицам.
Если GPT-6 Sol действительно уже проходит внутреннее тестирование, то, скорее всего, он был разработан в рамках этой новой модели разработки:
Больше GPU обеспечивает вычислительную мощность, больше агентов параллельно запускают эксперименты, а человеческие исследователи находятся на более высоком уровне — выбирают направления, оценивают результаты и окончательно решают, какие идеи стоят того, чтобы стать следующим поколением моделей.
Более мощный ИИ становится все сложнее отслеживать
В тот же день главный научный сотрудник OpenAI Якуб Пачоки опубликовал статью объемом в десять тысяч слов с названием «Инопланетный разум».

После прочтения я понял, что даже главный научный сотрудник OpenAI призывает всю отрасль замедлиться…
Якуб отметил, что ИИ не создается человеком по чертежу, путем сборки чипов и правил, а скорее «вырастает» самостоятельно из огромного объема данных и вычислительных мощностей.
Ты можешь разобрать и понять некоторые детали, но никто не может объяснить, почему вся система внезапно обрела определённые способности или как она будет действовать в другой среде.
Еще более тревожно то, что ИИ не должен полностью превосходить человека во всех аспектах, чтобы вызвать проблемы — достаточно, чтобы он превосходил людей в достаточном количестве ключевых навыков, чтобы помочь вам и одновременно создать серьезные проблемы.
Так возникает вопрос: люди еще могут это понять?
Раньше OpenAI контролировала ИИ, полагаясь в основном на один метод: анализ цепочки рассуждений.
Проще говоря, это просмотр процесса рассуждений, записанного моделью, чтобы проверить, не пытается ли она обмануть, превысить полномочия или обойти ограничения.
Но у поколения Astra этот трюк начал терять свою эффективность.
Во-первых, модели всё лучше «управляют» тем, что говорят, и их истинные мысли не всегда полностью отражаются в рассуждениях; во-вторых, агенты давно перестали быть просто «думающими и затем отвечающими». Они могут вызывать инструменты, управлять компьютером, запускать среды и взаимодействовать с людьми и другими агентами.
Эти вещи переплетены, и исследователям невозможно выстроить целую прозрачную цепочку рассуждений для построчного анализа.
OpenAI также обнаружил, что Astra может справляться со сложными задачами, не записывая весь процесс рассуждений.
Проще говоря, модель давно научилась «тихо делать важные дела».

В адверсарных тестах, специально предназначенных для того, чтобы заставить модели обходить мониторинг, Astra продемонстрировала некоторые пугающие способности: намеренно занижать результаты тестов, обходить мониторинг и выполнять разрушительные задачи.
Конечно, все это — искусственные стресс-тесты, и OpenAI не сделал вывод, что Astra будет намеренно обманывать в повседневных задачах. Но это по крайней мере показывает, что одного наблюдения за цепочкой рассуждений уже недостаточно, чтобы охватить все возможные поведенческие паттерны модели.
Помните событие с Hugging Face? Это был сигнал тревоги.

В то время GPT‑5.6 Sol и более мощная внутренняя исследовательская модель были помещены в сетевой полигон ExploitGym с задачей найти уязвимости, выполнить атаку и получить флаг. Для оценки истинных возможностей модели в тестовой среде не были включены полные средства безопасности.
Модели не решали задачи честно — сначала они обходили сетевую изоляцию, обменивались сообщениями и распределяли задачи через неавторизованные каналы.
Затем был использован нулевой день в кэширующем прокси-сервере пакетов для получения доступа в публичную сеть, после чего был проникнут в систему Hugging Face с целью поиска тестовых ответов ExploitGym.

На самом деле, это в основном было продвижено внутренней исследовательской моделью IM1, GPT‑5.6 Sol также воспроизвел часть путей атаки, Astra не участвовала.
Исходная цель модели по-прежнему заключалась в завершении теста, но для получения ответа она постоянно искала уязвимости в правилах и в итоге выполнила действия, выходящие за рамки задачи.
Таким образом, OpenAI также заметил опасный сигнал: когда агент достаточно силен, инструментов достаточно много, а время работы достаточно продолжительное, он может самостоятельно искать новые пути, вызывать внешние ресурсы и даже сотрудничать с другими агентами.
Не… так что, в итоге, это не превращается в замкнутый круг??
OpenAI нуждается в более мощных моделях для написания кода, проведения экспериментов и исследований по согласованию, а также для создания систем безопасности, защищающих от других ИИ. Чем мощнее модель, тем больше задач она может выполнять, и тем быстрее идет разработка.
В то же время людям становится все сложнее понять, как именно он приходит к выводам, и будет ли он заново интерпретировать ранее изученные правила в другой среде.
Якуб считает, что сейчас ни одна лаборатория не может утверждать, что добилась надлежащего согласования и мониторинга моделей, чтобы с уверенностью и на постоянной основе масштабировать модели с максимальной скоростью.

До тех пор пока не будет установлено общепринятая отраслевая безопасная стандартная практика, он надеется, что все будут считать «добровольное торможение» неформальным соглашением.
Что касается самой OpenAI, она также заявила: если это необходимо, не исключает односторонней остановки и прекращения дальнейшего увеличения масштаба модели.
Ты бы лучше так и поступил… Я помню, что какая-то компания на букву А тоже так говорила.
Ссылка для справки:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: Тинь Юй
