Google выпустила Gemini 3.8 Flash и Gemini 3.8 Flash Cyber для организаций, занимающихся надежной киберзащитой, 2 сентября 2026 года. Обычная версия имеет контекст из 1 миллиона токенов и ориентирована на программирование, агенты и профессиональные задачи; в тестах, опубликованных Google, ее результаты в долгосрочной программной инженерии достигли 73,7%, что близко к 74,0% у Claude Opus 5, а показатели финансовых агентов, юридических агентов и部分 комплексных рассуждений превзошли другие протестированные модели. Версия Cyber способна самостоятельно обнаруживать уязвимости и генерировать патчи: в тестах Google внутри компании на 20 языках программирования成功率 превысила 70%, а команда Chrome получила в 2,6 раза больше правильных патчей, чем крупные коммерческие модели. Текущая цена API составляет 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных токенов, однако модель достигает производительности за счет большего количества шагов рассуждения и вызовов инструментов; независимые оценки показывают, что стоимость выполнения одной задачи на самом деле на 40% выше, чем у 3.7 Flash. Ключевой сигнал этого выпуска заключается в том, что возможности агентов, ранее доступные только дорогим флагманским моделям, теперь внедряются в недорогие, масштабируемые «рабочие» модели, однако данные о возможностях основаны в основном на тестах Google и партнеров, а версия Cyber не доступна обычным пользователям.Автор статьи, источник: DeepMind
За шесть недель три обновления: Google превратил Flash в основную модель
Gemini 3.8 Flash вышел всего через три недели после выпуска 3.7 Flash и является третьим версией Flash, выпущенной Google за шесть недель.
Раньше «Flash» обычно означало высокую скорость и низкую стоимость, но при этом явно уступало флагманским моделям по возможностям. Позиционирование Gemini 3.8 меняется: Google по-прежнему называет его «рабочей» моделью, подходящей для масштабного развертывания, но теперь основными его возможностями являются долгосрочное программирование, последовательный вызов инструментов и профессиональный анализ, а не только легкие задачи, такие как чат и резюмирование.
Новая модель поддерживает ввод текста, изображений, аудио, видео и PDF, имеет контекст в 1 миллион токенов и максимальный вывод в 64 тысячи токенов, а также может вызывать инструменты поиска, функций и управления компьютером. Она уже официально доступна, а не в режиме тестового просмотра, и может использоваться через Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, приложение Gemini, режим AI в поиске и Google Sheets.
Хостинг-агент Google Antigravity также по умолчанию использует 3.8 Flash. Это указывает на то, что модель действительно направлена на агентов, которым требуется многократное планирование, вызов инструментов, проверка результатов и постоянная корректировка, а не на одноразовые вопросы и ответы.
Programming performance is approaching that of expensive flagship models.
В долгосрочном тесте по программной инженерии DeepSWE v1.1, опубликованном Google, Gemini 3.8 Flash показал результат 73,7%, что выше, чем у 3.7 Flash — 65,3% и GPT‑5.6 Sol — 72,7%, и на 0,3 процентных пункта ниже, чем у Claude Opus 5 — 74,0%.
Такие тесты требуют от модели входа в реальный кодовый репозиторий, понимания взаимосвязей между несколькими файлами, выявления проблем и внесения изменений, проходящих тесты. Это ближе к реальной работе программного агента, чем самостоятельная генерация отдельной функции.
В Vals Finance Agent v2 3.8 Flash показал 61,4%, тогда как протестированные 3.7 Flash, Claude Opus 5 и GPT‑5.6 Sol показали 59,0%, 58,6% и 53,8% соответственно.
В тесте Harvey Legal Agent, Flash 3.8 показал результат 10,0%, что выше, чем 8,8% у Flash 3.7, 6,7% у Claude Opus 5 и 2,5% у GPT‑5.6 Sol. Однако абсолютные результаты всех моделей в этом тесте очень низки, и «первое место» не означает, что они уже способны надежно справляться со сложными юридическими задачами.
В многодисциплинарном тесте на рассуждение HLE-Verified 3.8 Flash показал результат 54,9%, GPT‑5.6 Sol и Claude Opus 5 — 54,5% и 54,4% соответственно; разница между ними незначительна и недостаточна для доказательства устойчивого общего преимущества какой-либо из моделей.
Эти результаты в основном опубликованы Google в соответствии со своими настройками. Финальные результаты зависят от модели, фреймворка агента, мощности вывода, прав доступа к инструментам и бюджета на тестирование, поэтому более обоснованный вывод заключается в том, что модели уровня Flash приблизились к некоторым дорогим флагманским моделям, а не в том, что Gemini полностью превосходит их во всех задачах.
«Больше стараться» означает действовать умнее, а может означать и дороже
Google приписывает повышение способности 3.8 Flash прямому дизайнерскому решению: заставить модель «работать усерднее».
При выполнении сложных задач он использует больше промежуточных шагов рассуждения, многократно вызывает инструменты и активно проверяет уже выполненную работу. Разработчики могут выбрать три уровня мышления: низкий, средний и высокий; средний уровень установлен по умолчанию. Высокий уровень подходит для сложного программирования и многошаговых рассуждений, а низкий — для живого чата, создания черновиков и задач, чувствительных к задержкам.
Это снижает вероятность преждевременной остановки агента, пропуска шагов или полного отклонения от цели после неудачного вызова инструмента, но также потребляет больше токенов.
В независимых тестах Artificial Analysis, 3.8 Flash показал интеллектуальный индекс 59 баллов при высоком уровне мышления, что на 3 балла выше, чем у 3.7 Flash, и находится на сопоставимом уровне с не максимальной конфигурацией GPT‑5.6 Sol. Средняя скорость вывода составляет около 300 токенов в секунду, а на выполнение одного теста в среднем требуется 2,5 минуты.
Однако средний выход токенов для 3.8 Flash увеличился примерно на 30%, а количество циклов выполнения в оценке агента также выше. Хотя цена за токен не выросла, средняя стоимость одной задачи составляет около 0,58 доллара США, что на 40% выше, чем 0,40 доллара США у 3.7 Flash.
Таким образом, «низкая цена за единицу» не означает, что каждая задача будет обязательно дешевле. Если задача не требует сложных рассуждений, запуск 3.8 Flash на высокой интенсивности может лишь увеличить время и стоимость. Google также рекомендует оптимизировать рабочие процессы с приоритетом на эффективность, снижая уровень мышления или продолжать использовать поддерживаемую версию 3.7 Flash.
Сейчас низкая цена — это только временная акция
По состоянию на 31 декабря 2026 года цена на Gemini 3.8 Flash составляет 0,75 доллара США за миллион входящих токенов и 3,75 доллара США за миллион исходящих токенов, что совпадает с текущей ценой 3.7 Flash.
С 1 января 2027 года стандартные цены составят 1,50 доллара США за миллион входящих токенов и 7,50 доллара США за миллион исходящих токенов, что ровно вдвое больше. Разработчики, оценивая долгосрочные расходы, не должны рассматривать цены в период запуска как постоянные.
Даже при расчете по будущей стандартной цене он все еще дешевле некоторых флагманских моделей; однако для агентов, которым необходимо генерировать десятки тысяч токенов и выполнять десятки вызовов инструментов, следует сравнивать полную стоимость задачи, а не только цифру за миллион токенов в ценовом списке.
Цель Cyber-версии — не объяснять уязвимости, а сразу предоставлять патчи.
Google одновременно выпустила Gemini 3.8 Flash Cyber. Она делит базовые возможности с обычной версией, но прошла более целенаправленную подготовку в области кибербезопасности и использует более мягкие ограничения кибербезопасности, что позволяет ей выполнять анализ уязвимостей, которые обычные модели могут отклонить.
В базе данных обнаружения уязвимостей CyberGym Google заявила, что достигла передового уровня. Поскольку CyberGym в основном сосредоточен на проектах на C и C++, компания разработала внутренний тест, охватывающий 20 языков программирования и включающий сложные реальные кодовые базы, при этом успех 3.8 Flash Cyber в обнаружении уязвимостей превысил 70%.
Обнаружение уязвимости — это только первый шаг. Google особо подчеркивает, что обучение Cyber направлено на устранение проблем, а не на генерацию эксплойтов для атак.
В тесте CWE-Bench, проводимом Collinear, первая отправка Flash Cyber показала процент прохождения 47,2%, в то время как ведущие флагманские модели для сравнения показали 47,8%. Результаты близки, но Google заявляет, что стоимость выполнения Flash Cyber ниже.
Это означает, что цель агента кибербезопасности смещается с «сообщить инженерам, что здесь может быть проблема» на понимание уязвимостей, написание патчей, запуск тестов и проверку изменений. Если результаты достаточно надежны, это может сократить время, необходимое команде безопасности от обнаружения уязвимости до развертывания исправления.
Chrome получает 2.6-кратное исправление, но все еще проходит тестирование производителем и партнерами
Google уже использует Flash Cyber для внутренней работы по обеспечению безопасности кода.
Команда безопасности Chrome заявила, что количество правильно сгенерированных исправлений уязвимостей в два с половиной раза превышает количество, генерируемое крупными коммерческими моделями. Компания по кибербезопасности Wiz сообщила, что в своих тестах на проникновение показатель обнаружения уязвимостей Flash Cyber выше на 7,5–9,7 процентных пунктов по сравнению с другими передовыми моделями, при этом стоимость ниже в 2,3–5,2 раза.
Команда исследователей уязвимостей Google Cloud также сообщила, что модель обнаружила критическую базовую уязвимость менее чем за два часа, тогда как аналогичные исследования обычно могут длиться несколько месяцев.
Эти результаты имеют практическую ценность, но не могут рассматриваться как независимые и воспроизводимые публичные тесты. Google не раскрыла подробности ключевой уязвимости, список сравниваемых моделей и полные данные выполнения; данные Chrome получены из внутренних источников Google, а Wiz является партнером Fairwind. Следовательно, они доказывают, что модели уже способны участвовать в реальных задачах безопасности, но не доказывают, что они стабильно достигают того же уровня эффективности на всех кодовых базах и типах уязвимостей.
Самые мощные возможности кибербезопасности доступны только доверенным организациям
Flash Cyber предоставляется через новую программу Google Fairwind, в которой сейчас участвует более 650 организаций, в основном государственные агентства кибербезопасности, операторы критической инфраструктуры, разработчики программного обеспечения и крупные компании в области безопасности.
Участвующие организации должны ограничить круг лиц, имеющих внутренний доступ, и применять меры безопасности, такие как многофакторная аутентификация. После интеграции с CodeMender Agent модель может находить, проверять и устранять уязвимости в собственной облачной среде организации.
Обычные клиенты Google Cloud по-прежнему могут использовать CodeMender вместе с публичной версией модели Gemini, но не получат прямого доступа к полным возможностям Flash Cyber.
Такой подход к выпуску — «одна базовая модель, два уровня прав доступа» — очень близок к стратегии Anthropic, которая ранее разделила Claude на Fable и Mythos: общие программные и аналитические возможности открываются для рынка, а функции кибербезопасности, которые легче использовать для атак, защищаются с помощью проверки личности, контроля доступа и постоянного мониторинга.
Security has not seen significant upgrades, but some non-English performances have regressed
Обычная версия 3.8 Flash включает ограничения безопасности, касающиеся химических, биологических, радиологических, ядерных материалов и кибератак; версия Cyber, поскольку требуется для выполнения профессиональных задач по защите, имеет более мягкие ограничения по кибербезопасности и доступна только для одобренных организаций.
Карточка модели Google указывает, что по сравнению с 3.7 Flash, модель 3.8 Flash не демонстрирует существенно новых возможностей в высокорисковых областях, на которые ориентирована корпоративная рамочная система безопасности, и поэтому не вызывает повышения уровня риска. Ее защита также улучшилась в тестах на косвенную инъекцию подсказок Gray Swan.
Однако в карточке модели также указано, что 3.8 Flash показал снижение на 5,4 процентных пункта по сравнению с 3.7 Flash в автоматизированных многоязычных тестах безопасности. После ручной проверки Google заявила, что большинство различий относятся к ложным срабатываниям или несерьезным содержаниям, однако полные выборки и данные по языкам не были опубликованы.
Модель также сохраняет типичные проблемы крупных языковых моделей, включая галлюцинации, случайную медленную реакцию или превышение времени ожидания, а также использование избыточного количества токенов для повышения производительности. Срок действия знаний указан как март 2026 года, однако Google отмечает, что надежные знания в некоторых областях могут быть обновлены только до января 2025 года; при работе с самой свежей информацией необходимо проверять данные в интернете.
Настоящая конкуренция смещается с вопроса «кто умнее» на вопрос «кто может быть масштабно использован»
Самое важное в Gemini 3.8 Flash — не то, что он лидирует по какому-то одному показателю на доли процента, а то, что Google внедряет в ценовой диапазон Flash возможности длительного программирования, профессионального анализа и автономного вызова инструментов.
Флагманские модели подходят для сложных задач с высокой стоимостью и низкой частотой; однако агенты, реально используемые в корпоративной службе поддержки, конвейерах программирования, финансовом анализе и сканировании безопасности, могут обрабатывать миллионы вызовов в день. В этих сценариях скорость, стоимость за единицу и成功率 задачи зачастую важнее, чем первое место в рейтинге.
3.8 Flash также показывает противоречие в этом подходе: чем лучше модель способна к повторной проверке и постоянной работе, тем больше токенов она может сгенерировать, повышая стоимость однозадачной обработки для «дешевых моделей». Таким образом, ключевым аспектом будущей конкуренции агентов станет не только кто даст лучший ответ, но и кто сможет определить, когда продолжать размышления, когда использовать инструменты и когда следует остановиться.
