Google випустила Gemini 3.8 Flash та Gemini 3.8 Flash Cyber для організацій, що займаються захистом довірених мереж, 2 вересня 2026 року. Звичайна версія має контекст у 1 мільйон токенів і зосереджена на програмуванні, агентах та професійних завданнях; у тестах, опублікованих Google, її результати у довгостроковому програмному інжинірингу досягли 73,7%, що майже дорівнює 74,0% у Claude Opus 5, а також перевищила інші моделі у тестах з фінансовими агентами, юридичними агентами та деякими комплексними міркуваннями. Версія Cyber може самостійно виявляти вразливості та генерувати патчі: у внутрішніх тестах Google з 20 мов програмування частка успішних результатів перевищила 70%, а команда Chrome отримала у 2,6 рази більше правильних патчів, ніж велика комерційна модель. Поточна ціна API становить 0,75 долара за мільйон вхідних токенів і 3,75 долара за мільйон вихідних токенів, але модель досягає продуктивності за рахунок більшої кількості кроків міркування та викликів інструментів; незалежні оцінки показують, що вартість однієї задачі насправді на 40% вища, ніж у 3.7 Flash. Ключовим сигналом цього випуску є те, що здатності агентів, які раніше були притаманні лише дорогим флагманським моделям, тепер входять до дешевих, масштабованих «робочих моделей», але дані щодо продуктивності все ще базуються переважно на тестах Google та її партнерів, а версія Cyber недоступна для звичайних користувачів.Автор статті, джерело: DeepMind
За шість тижнів три оновлення — Google перетворив Flash на основну модель
Gemini 3.8 Flash вийшов лише через три тижні після випуску 3.7 Flash і є третім Flash-версією, запущеною Google за шість тижнів.
Раніше «Flash» зазвичай означав високу швидкість та низьку вартість, але значно слабші можливості порівняно з флагманськими моделями. Позиціонування Gemini 3.8 змінюється: Google все ще називає його «робочою» моделлю, придатною для масштабного розгортання, але тепер основними функціями є довготривале програмування, послідовний виклик інструментів та професійний аналіз, а не лише легкі завдання, такі як чат або скорочення.
Нова модель підтримує введення тексту, зображень, аудіо, відео та PDF, має контекст до 1 мільйона токенів і максимальний вивід до 64 000 токенів, а також може викликати інструменти пошуку, функцій та керування комп’ютером. Вона вже офіційно доступна, а не у режимі тестового перегляду, і може використовуватися через Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, додаток Gemini, режим штучного інтелекту у пошуку та Google Sheets.
Хостовий агент Google Antigravity також за замовчуванням використовує 3.8 Flash. Це свідчить про те, що модель справді спрямована на агентів, які потребують багаторазового планування, виклику інструментів, перевірки результатів та постійної корекції, а не на одноразові запити та відповіді.
Результати програмування вже наблизилися до дорогих флагманських моделей
У довгостроковому тесті з програмної інженерії DeepSWE v1.1, опублікованому Google, Gemini 3.8 Flash показав результат 73,7%, що вище, ніж у 3.7 Flash — 65,3% і GPT‑5.6 Sol — 72,7%, і відрізняється від Claude Opus 5 на 0,3 процентних пункти.
Ці тести вимагають від моделі ввійти до справжнього кодового репозиторію, зрозуміти взаємозв’язки між кількома файлами, виявити проблеми та внести зміни, які пройдуть тести. Вони ближчі до реальних завдань програмного агента, ніж самостійне створення окремої функції.
У Vals Finance Agent v2, 3.8 Flash отримав 61,4%, тоді як протестовані 3.7 Flash, Claude Opus 5 і GPT‑5.6 Sol показали 59,0%, 58,6% і 53,8% відповідно.
У тесті Harvey Legal Agent, Flash 3.8 показав 10,0%, що вище, ніж 8,8% у Flash 3.7, 6,7% у Claude Opus 5 та 2,5% у GPT‑5.6 Sol. Однак абсолютні бали всіх моделей у цьому тесті були дуже низькими, і перше місце не означає, що вони вже можуть надійно вирішувати складні правові завдання.
У багатодисциплінарному тесті на міркування HLE-Verified 3.8 Flash показав 54,9%, GPT‑5.6 Sol і Claude Opus 5 — 54,5% і 54,4% відповідно; різниця між ними дуже мала і не достатня, щоб довести стабільну загальну перевагу будь-якої моделі.
Ці результати в основному опубліковані Google відповідно до своїх налаштувань. Остаточні результати впливають модель, агентська фреймворка, інтенсивність міркувань, права доступу до інструментів та бюджет тестування, тому більш обґрунтованим висновком є те, що моделі рівня Flash наблизилися до деяких дорогих флагманських моделей, а не те, що Gemini повністю перевершила всі завдання.
«Більше зусиль» означає розумніше, а може й дорожче
Google приписує підвищення здатності 3.8 Flash прямому дизайнерському рішенню: змусити модель «працювати наполегливіше».
Під час вирішення складних завдань він використовує більше проміжних кроків міркування, багаторазово викликає інструменти та активно перевіряє вже виконану роботу. Розробники можуть вибрати три рівні міркування: низький, середній та високий; середній є налаштуванням за замовчуванням; високий рівень підходить для складного програмування та багатокрокових міркувань, а низький — для реального чату, генерації чернеток та завдань, чутливих до затримки.
Це зменшує ймовірність раннього зупинення агента, пропуску кроків або повного відхилення від мети після невдалого виклику інструменту, але також споживає більше токенів.
У незалежних тестах Artificial Analysis, 3.8 Flash показав інтелектуальний індекс 59 балів при високому рівні міркувань, що на 3 бали вище, ніж у 3.7 Flash, і близький до рівня GPT‑5.6 Sol без найвищої конфігурації висновків. Середня швидкість виведення становить приблизно 300 токенів за секунду, а на виконання однієї тестової задачі в середньому витрачається 2,5 хвилини.
Але середній вихідний токен Flash 3.8 збільшився приблизно на 30%, а кількість ітерацій у оцінках агента також більша. Хоча ціна за токен не зросла, середня вартість однієї задачі становить близько 0,58 долара США, що на 40% вище, ніж у Flash 3.7 — 0,40 долара США.
Тому «низька ціна» не означає «кожне завдання обов’язково буде дешевшим». Якщо завдання не вимагає складних міркувань, запуск 3.8 Flash у інтенсивному режимі може лише збільшити час і витрати. Google також рекомендує оптимізувати робочі процеси з пріоритетом на ефективність, знижуючи рівень міркувань, або продовжувати використовувати версію 3.7 Flash, яка все ще підтримується.
Зараз низька ціна — це лише обмежена пропозиція
До 31 грудня 2026 року ціна на Gemini 3.8 Flash становить 0,75 долара США за мільйон вхідних токенів і 3,75 долара США за мільйон вихідних токенів, що відповідає поточній ціні на 3.7 Flash.
З 1 січня 2027 року стандартна ціна стане 1,50 долара за мільйон вхідних токенів і 7,50 долара за мільйон вихідних токенів, що є точним подвоєнням. Розробники, оцінюючи довгострокові витрати, не повинні вважати ціни періоду запуску постійними.
Навіть за майбутніми стандартними цінами він дешевший за деякі флагманські моделі; але для агента, який має генерувати десятки тисяч токенів і виконувати десятки викликів інструментів, слід порівнювати загальну вартість завдання, а не лише цифру на мільйон токенів у ціновому списку.
Мета Cyber-версії — не пояснювати вразливості, а безпосередньо надавати патчі
Google одночасно випустила Gemini 3.8 Flash Cyber. Він має спільні базові можливості зі звичайною версією, але отримав більш цілеспрямоване навчання з кібербезпеки та застосовує більш м’які обмеження кібербезпеки, що дозволяє йому виконувати аналіз вразливостей, які звичайні моделі можуть відмовитися виконувати.
У базисі виявлення вразливостей CyberGym Google заявила, що досягла передового рівня. Оскільки CyberGym зосереджений переважно на проектах на C і C++, компанія розробила внутрішні тести, які охоплюють 20 мов програмування та містять складні реальні кодові бази, і 3.8 Flash Cyber досягла успішності виявлення вразливостей понад 70%.
Виявлення вразливості — це лише перший крок. Google особливо підкреслює, що навчання Cyber зосереджене на виправленні проблем, а не на генерації експлойтів для атак.
У тесті CWE-Bench, запущеному Collinear, перший коміт Flash Cyber показав результат 47,2%, у порівнянні з 47,8% у провідних флагманських моделях. Результати близькі, але Google зазначає, що витрати на запуск Flash Cyber нижчі.
Це означає, що мета агента кібербезпеки зміщується з «повідомити інженерам, що тут може бути проблема» на розуміння вразливостей, написання патчів, запуск тестів та перевірку змін. Якщо результати достатньо надійні, це може скоротити час, необхідний команді безпеки для виявлення вразливості та впровадження виправлення.
Chrome отримав 2,6-кратне правильне виправлення, але все ще проходить тестування виробником та партнерами
Google вже використовує Flash Cyber для внутрішньої роботи з безпекою коду.
Команда безпеки Chrome стверджує, що кількість правильних виправлень вразливостей, які вона генерує, у 2,6 рази більша, ніж у великих комерційних моделей. Компанія з кібербезпеки Wiz повідомляє, що у своєму тестовому наборі для проникнення, показник виявлення вразливостей Flash Cyber вищий на 7,5–9,7 відсоткових пунктів порівняно з іншими передовими моделями, при цьому витрати нижчі у 2,3–5,2 рази.
Команда дослідників безпеки Google Cloud також зазначила, що модель виявила критичну базову вразливість за менше ніж дві години, тоді як подібні дослідження зазвичай можуть тривати місяці.
Ці результати мають практичну цінність, але не можуть вважатися незалежними, відтворюваними публічними тестами. Google не оприлюднила конкретну інформацію про цей критичний вразливий елемент, список моделей для порівняння та повну трасування виконання; дані Chrome походять із внутрішніх джерел Google, а Wiz є партнером Fairwind. Тому вони підтверджують, що моделі вже здатні брати участь у реальних завданнях безпеки, але не доводять, що вони стабільно досягають того ж рівня ефективності на всіх кодових базах та типах вразливостей.
Найсильніші здібності кібербезпеки доступні лише довіреним організаціям
Flash Cyber надається через нову програму Google Fairwind, у якій наразі бере участь понад 650 організацій, зокрема урядові агентства кібербезпеки, оператори критичної інфраструктури, розробники програмного забезпечення та великі компанії з кібербезпеки.
Установлені організації повинні обмежити діапазон внутрішніх користувачів та застосувати заходи безпеки, такі як багатофакторна автентифікація. Після інтеграції з CodeMender Agent модель може знаходити, перевіряти та виправляти вразливості у хмарному середовищі організації.
Звичайні клієнти Google Cloud все ще можуть використовувати CodeMender разом із публічною версією моделі Gemini, але не отримують прямого доступу до повного функціоналу Flash Cyber.
Цей підхід до випуску «одна базова модель, два рівні дозволів» дуже схожий на попередню стратегію Anthropic, коли Claude було розділено на Fable і Mythos: загальні програмні та аналітичні здібності відкрито для ринку, тоді як функції кібербезпеки, які легше можуть бути використані для атак, забезпечуються перевіркою особистості, контролем доступу та постійним моніторингом.
Без значного підвищення безпеки, але деякі неангломовні версії зазнали погіршення
Звичайна версія 3.8 Flash містить обмеження безпеки щодо хімічних, біологічних, радіологічних, ядерних матеріалів та кібератак; версія Cyber, оскільки вона призначена для виконання професійних завдань з захисту, має менш строгі обмеження щодо кібербезпеки, тому доступна лише для організацій, що пройшли перевірку.
Модельна картка Google вважає, що порівняно з 3.7 Flash, 3.8 Flash не демонструє суттєвих нових здібностей у високоризикованих областях, що є пріоритетом для корпоративного фреймворку безпеки, тому не викликає підвищення рівня ризику. Також покращилася захистність у тесті на непряму ін’єкцію підказок Gray Swan.
Проте, у картці моделі також зазначено, що 3.8 Flash показав зниження на 5,4 процентних пункта порівняно з 3.7 Flash у автоматизованих багатомовних тестах безпеки. Після ручної перевірки Google зазначив, що більшість розбіжностей є хибними сповіщеннями або несуттєвим вмістом, але повні вибірки та дані за мовами не оприлюднені.
Модель також зберігає типові проблеми великих мовних моделей, включаючи галюцинації, випадкове повільне відповідь або перевищення часу очікування, а також використання надмірної кількості токенів для підвищення продуктивності. Дата закінчення знань вказана як березень 2026 року, але Google зазначає, що надійні знання в деяких галузях можуть бути оновлені лише до січня 2025 року; при роботі з найсвіжішою інформацією необхідно перевіряти дані в інтернеті.
Справжня конкуренція зміщується від «хто найрозумніший» до «хто може бути масово використаний»
Найбільш важливе в Gemini 3.8 Flash — не те, що він випереджає інші показники на кілька сотих, а те, що Google втискає довгострокове програмування, професійний аналіз та здатність автономного виклику інструментів у ціновий діапазон Flash.
Найпотужніші моделі підходять для складних завдань з високою вартістю та низькою частотою; а агенти, які реально використовуються в корпоративному обслуговуванні клієнтів, програмних конвеєрах, фінансовому аналізі та скануванні безпеки, можуть обробляти мільйони викликів щодня. У цих сценаріях швидкість, вартість за одиницю та успішність виконання кожної задачі часто важливіші, ніж перше місце у рейтингах.
3.8 Flash також виявляє суперечність цього підходу: чим краще модель вміє перевіряти себе та постійно працювати, тим більше токенів вона може генерувати, що підвищує вартість виконання однієї задачі для «дешевих моделей». Тому ключовим аспектом майбутньої конкуренції агентів буде не лише хто дасть найкращу відповідь, а й хто зможе правильно визначити, коли продовжувати міркування, коли використовувати інструменти та коли слід зупинитися.
