Прямо сейчас Google вернулся!
Сегодня ночью Google официально выпустил Gemini 3.8 Flash и Gemini 3.8 Flash Cyber, специализирующийся на кибербезопасности.
Это уже третья версия Flash, выпущенная Google за шесть недель.
Предыдущие два обновления казались лишь разминкой, потому что на этот раз Google напрямую вывел соотношение цены и качества на передний план—
Стоимость одной задачи — 0,58 доллара США! Ввод всего за 0,75 доллара США за миллион токенов!
Эта небольшая модель, цена которой едва ли превышает стоимость капусты, смогла достичь уровня таких ведущих моделей, как Opus 5, GPT-5.6 Sol и Grok 4.6, в нескольких ключевых тестах.
Гугл DeepMind, эксперт Яо Шуньюй прокомментировал: для модели это всего лишь небольшой шаг; но для RSI — это огромный прорыв.

На X разработчики взорвались.
После практической проверки кто-то задался вопросом: «Боже мой, Google не перепутал ли товар? Это же Gemini 3.5 Pro, который так и не выпускали! За цену Flash выполняет задачи Pro!»


В команде DeepMind, вероятно, кто-то не спал с июля.
Все еще переваривают Fable 5.1, как Google снова перевернул игровой стол.
Вернулся «король конкурентов» от Google: король соотношения цены и качества
Долго молчавший Google объявил миру о своем возвращении с помощью крайне агрессивного подхода.

Чтобы понять впечатляющий потенциал Gemini 3.8 Flash, нам нужно сначала взглянуть на текущую ситуацию на рынке ИИ.
Изначально в тесте Artificial Analysis уже сформировалась чрезвычайно строгая барьерная система. Чтобы обладать топовым интеллектом (Индекс Интеллекта около 60 баллов), необходимо потратить значительное количество токенов.
В результате Gemini 3.8 Flash ведет себя как убийца — совершенно не по правилам.
В режиме высоких рассуждений Artificial Analysis интеллектуальный показатель Gemini 3.8 Flash достиг 59 баллов!

Что это за концепция? Это на шаг от самых передовых GPT-5.6 Sol и Grok 4.6, а в некоторых аспектах даже превосходит Claude Opus 5!
А какова цена за все это? Стоимость выполнения одной задачи составляет всего 0,58 доллара.
Конкретно: стоимость ввода составляет 0,75 доллара США за миллион токенов, стоимость вывода — 3,75 доллара США за миллион токенов.
Гугл создал график: на парето-границе интеллекта и стоимости синяя точка, представляющая Gemini 3.8 Flash, находится в верхнем правом углу программного инженерного бенчмарка DeepSWE, значительно опережая второе место.

Gemini 3.8 Flash не только умный, но и невероятно быстрый. Его скорость генерации достигает поразительных 305 токенов/с, в то время как следующая по уровню модель едва достигает 154 токенов/с.
Быстро, умно и дешево, как будто бесплатно —这才是人类真正能天天用的模型。

Особенно на долгосрочном программном инженерном бенчмарке DeepSWE v1.1, 3.8 Flash показал поразительный результат в 73,7%.
В этом тесте, где требуется, чтобы ИИ самостоятельно решал сложные инженерные задачи и писал код端到端, он не только превзошел большинство дорогих передовых крупных моделей, но и стоил лишь небольшую долю от их цены.
Помните, это только версия «Flash», а не «Pro» и тем более не «Ultra».
На этот раз Google снова позволил небольшим моделям отобрать у флагманских моделей их место.
Кто-то протестировал Gemini 3.8 Flash и Opus 5 на выполнении одной и той же задачи.

Такой значительный скачок в программировании не является случайностью.

Такой значительный скачок в программировании не является случайностью.
Согласно сообщениям, при тестировании внутреннего инструмента кода Google под названием Jetski инженеры Google даже предпочитают использовать 3.8 Flash, а не модель Anthropic Opus.

За этим стоит Google, которая с начала года активно вкладывает ресурсы в обучение с подкреплением — то есть в заключительный этап обучения моделей, когда модели учатся реально выполнять задачи через пробу и ошибки.
Google DeepMind сформировала команду по написанию кода, сосредоточенную на повышении способностей языковых моделей; командой руководит технический директор DeepMind, а сооснователь Сергей Брин непосредственно контролирует её работу.
Их цель — вывести рекурсивную самоэволюцию, принудительно преобразовав модель программирования в полностью автоматизированного AI-исследователя, полностью замкнув весь исследовательский цикл.

В внутренней записке Google прямо сказал:
Чтобы выиграть финальный рывок, нам необходимо срочно устранить разрыв в выполнении агентов и превратить наши модели в основных разработчиков.

Кроме того, Google привлек Баррета Зофа — соучредителя Thinking Machines Lab, бывшего руководителя по пост-обучению в OpenAI, который теперь занимает должность вице-президента по исследованиям и отвечает за направления усиленного обучения и пост-обучения. Эти действия явно демонстрируют решимость довести дело до конца.
В прошлом месяце сооснователь и лауреат Нобелевской премии Демис Хассабис ушел с поста генерального директора, и его преемник Корай Кавукчоглу сразу заявил: ускоряться, ускоряться и еще раз ускоряться.
Базовый «наполнение», или реальное превосходство?
Однако в midst of praise, Google was widely criticized for opening the champagne too early.

Самое неприятное — это Meta—
Meta’s Muse Spark 1.3 и Gemini 3.8 Flash столкнулись, причем первый получил 62 балла по интеллектуальному индексу Artificial Analysis, что соответствует Claude Fable 5, и вошел в число лидеров.
При этом стоимость ввода для Muse в 8 раз ниже, чем у Fable 5, а стоимость вывода — почти в 12 раз ниже, что обеспечивает максимальную ценность.
Главный директор по ИИ Meta Александр Ван прямо заявил: на индексе Artificial Analysis Gemini — ничего не стоит, ему остаётся только дышать выхлопными газами моделей других компаний.


Muse Spark 1.3 показывает результат выше, чем GPT-5.6 Sol, Grok 4.6 и Gemini 3.8 Flash, но пока доступен только в ограниченном превью.
Некоторые отметили, что, хотя график базового тестирования 3.8 Flash выглядит хорошо, на практике это может оказаться не так.
Да, Gemini 3.8 Flash превзошел GPT-5.6 Sol и Opus 5 в тестах Terminal-Bench 2.1, HLE и других, но огромная разница в баллах между TBench 2.1 и TBench 4 раскрывает возможное присутствие элементов «фальсификации рейтинга».
То есть, когда речь заходит о незнакомых, реальных Zero-shot задачах, не включенных в обучающий набор, 3.8 Flash, скорее всего, все еще уступает таким гигантам, как Opus 5.
Но решение Google невероятно умно — труд компенсирует недостатки.
Как указано в официальном блоге Google: «Эти улучшения производительности обусловлены ключевыми архитектурными решениями: 3.8 Flash работает усерднее».
При выполнении сложных задач 3.8 Flash спроектирован так, чтобы выполнять дополнительные шаги рассуждения и многократно вызывать инструменты в цикле. Когда он сталкивается с непонятной задачей, он не сдается, а тратит больше токенов, проводя внутреннюю высокоскоростную самопроверку и рефлексию.
Даже если он потребляет больше токенов за счет многократного циклического мышления, из-за крайне низкой базовой цены (0,75 доллара за миллион токенов) в итоге он все равно значительно дешевле, чем прямой вызов GPT-5.6!
Эта стратегия напрямую разрушила одномерную конкуренцию прошлого, где «большие параметры = высокая производительность».
Это доказывает: в идеальном цикле агента скорость и крайне низкая стоимость вывода сами по себе являются мощным интеллектом.
Почему Flash? «Отменённая» версия Pro
На этот раз Google действительно не отправил неверный товар?
Gemini 3.5 Pro до сих пор не появился. Следующее поколение флагмана Gemini 4 имеет красивые данные предварительного обучения, но этап дообучения еще не завершен.

На самом деле, задержка с выпуском Pro-версии Google связана с печальной историей.
В мае этого года Pi Chai пообещал, что «в следующем месяце» появится более мощная серия Pro, но всё это время откладывал выпуск.
На самом деле, внутри Google изначально было несколько кандидатов на модель 3.5 Pro, но все они были безжалостно отклонены — потому что они не превосходили текущую серию Flash достаточно сильно!
В то же время долгожданная следующая флагманская модель Gemini 4, хотя и показала хорошие результаты на этапе предварительного обучения, сейчас застряла на самом важном этапе пост-обучения.
В итоге все случайности привели к безумной итерации серии Flash.
Уязвимость, обнаруженная за 2 часа, которую иначе пришлось бы искать месяцы: кибербезопасность взломала рейтинг
На этот раз Google просто заставил 3.8 Flash конкурировать по цене на обычных задачах?
Far beyond that.
Настоящим секретным оружием этого релиза является его двойник — Gemini 3.8 Flash Cyber.
Даже разработчики удивляются: «Какая же это такая задача безопасности, что Google специально создал версию Cyber для Flash?»
Ответ Google: чтобы противостоять будущим AI-хакерам.
На тестовой платформе CyberGym, где была обнаружена уязвимость, 3.8 Flash Cyber показал результат 86,2%, сразу возглавив рейтинг и значительно опередив предыдущие крупные модели.
Кроме того, в реальном мире код пишется не только на C/C++.
В комплексном тестировании сложной кодовой базы внутри Google, охватывающей 20 языков программирования, эта модель успешно обнаружила широкий спектр уязвимостей с успехом более 70%.
Еще более впечатляющим является его реальная боевая статистика.
Команда безопасности Chrome протестировала его и обнаружила, что количество правильно сгенерированных исправлений в 2,6 раза превышает количество у лучших коммерческих моделей, которые ранее были на рынке и намного больше по размеру.
Компания Wiz обнаружила, что в ходе пентеста её показатель полноты повысился на 7,5–9,7%, а затраты снизились в 2,3–5,2 раза.
Самым удивительным является то, что команда исследователей уязвимостей Google Cloud использовала её и обнаружила критическую фундаментальную уязвимость всего за два часа — тогда как ранее человеческие эксперты высочайшего уровня находили такие уязвимости в течение нескольких месяцев!
В тесте CWE-Bench (оценка способности к исправлению) первичная успешность Flash Cyber составила 47,2%, что практически сопоставимо с лучшими передовыми крупными моделями (47,8%), но ее стоимость составляет лишь малую долю.

Именно из-за невероятной разрушительной силы сетевых атак и защиты 3.8 Flash Cyber Google не решил полностью открыть исходный код, а вместо этого запустил новую программу Fairwind, предоставив доступ только доверенным организациям.
OpenAI, Anthropic и Google: Большой модельный триумвират достиг переломного момента
Выпуск Gemini 3.8 Flash показывает, что три крупнейших игрока в области ИИ сегодня выбрали три совершенно разных пути эволюции.
Anthropic (семейство Claude) сосредоточен на «надежности и стабильности знаний».
В тестах, ориентированных на охват знаний и точность фактов (например, AA-Omniscience), Claude по-прежнему демонстрирует подавляющее превосходство.
Первые семь мест заняты моделями Claude, которые сейчас явно усиливают способность избегать ошибок при выполнении корпоративных задач, стремясь к стабильным результатам.
OpenAI (семейство GPT) делает ставку на «глубокие рассуждения и озарение».
В тесте CritPt, ориентированном на физические и математические выводы, GPT-5.6 Sol значительно опережает других.
OpenAI будто стремится к чистому возникновению интеллекта, требуя, чтобы модель сама, без подсказок, могла «думать», как ученый.
Google (семейство Gemini) создает «бесконечный цикл сверхбыстрых работников».
На этот раз Google дал третий ответ: возможно, я не могу сразу решить самую сложную физическую задачу, но я реагирую очень быстро и с минимальными затратами.
В эпоху агентов я могу думать 100 раз за секунду: писать код, запускать, получать ошибки, исправлять — с помощью жесткой итерации на крайне низкой стоимости, чтобы добиться правильного результата.
Agen сталкивается с трудностями в реальном мире, требующими многократных проб и ошибок, использования инструментов и динамической настройки.
А Gemini 3.8 Flash идеально подходит для таких «длительных рабочих процессов».
В Google Antigravity можно сгенерировать полную игру с головоломками, текстурами среды и 3D-уровнями, используя всего одно подсказочное слово и циклическую команду для 3.8 Flash.
Вы можете использовать его для一键生成 версии Google Maps в стиле DOS с панорамными видами и навигацией.
Очевидно, что удобство использования и стоимость Gemini 3.8 Flash преодолели определенную точку невозврата.
Появление Gemini 3.8 Flash словно говорит от имени Google всей отрасли: большие модели выходят за рамки «доступны только крупным игрокам» и стремительно движутся к демократизации вычислительных ресурсов.
Задачи агентов, которые раньше требовали десятков тысяч долларов и нескольких дней непрерывной работы, теперь можно выполнить за несколько минут и за стоимость нескольких чашек кофе.
Эпоха супериндивидуумов для обычных людей действительно наступила.
Это момент пробуждения малых моделей.
Справочные материалы:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Редактирование: Аэнеас Дэвид
Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение
