Автор: Google DeepMind
Переклад: Deep潮 TechFlow
Огляд Shenchao: Три нові моделі, представлені Google, спрямовані на вирішення реальних бізнес-проблем AI-Agent — витрати та швидкість. 3.6 Flash економить на 17% токенів порівняно з попередньою версією, коштує дешевше, але має кращу якість; 3.5 Flash-Lite досягає швидкості 350 токенів/сек — найшвидша модель серії 3.5 на даний момент; а спеціалізована модель безпеки Flash Cyber спрямована на ринок виправлення вразливостей у коді — реальну потребу. Це не гра у вимірюванні продуктивності — це підготовка до масштабного розгортання AI-Agent.
Google DeepMind сьогодні представила три нові моделі Gemini: 3.6 Flash, 3.5 Flash-Lite та 3.5 Flash Cyber. Ці моделі розроблені для ефективності, низької затримки та надійності, необхідних для масштабної побудови AI-агентів.
Gemini 3.6 Flash: більш ефективно, більш якісно
3.6 Flash було покращено на основі зворотного зв’язку розробників щодо 3.5 Flash. Воно не лише просунулося далі у кодуванні та роботі зі знаннями, а й значно підвищило ефективність токенів. Згідно з Artificial Analysis Index, 3.6 Flash зменшує споживання вихідних токенів на 17% порівняно з 3.5 Flash. У деяких тестах, таких як DeepSWE від Datacurve, зменшення досягає 65%. Також зменшується кількість кроків міркувань та викликів інструментів, необхідних для завершення багатокрокових робочих процесів.
Це підвищення ефективності супроводжується нижчими цінами. Ціни становлять 1,5 долара за мільйон вхідних токенів і 7,5 долара за мільйон вихідних токенів; 3.6 Flash зменшує загальну вартість завдання для кожного агента, роблячи створення та запуск агентів більш економічними.
Навіть більш ефективний, 3.6 Flash має кращу продуктивність у порівнянні з 3.5 Flash у різних сценаріях використання:
Редагування коду стало точнішим, зменшено непотрібні зміни та цикли виконання, досягнуто 49% на DeepSWE (3.5 Flash — 37%), а на інтелектуальному тесті з машинного навчання MLE Bench — значне підвищення до 63,9% (3.5 Flash — 49,7%)
Покращено навички роботи з комп’ютером, результат OSWorld-Verified — 83,0% (3,5 Flash — 78,4%). Робота з комп’ютером тепер доступна як вбудований інструмент через Gemini API та Gemini Enterprise
Краще виконує завдання, пов’язані зі знаннями, наприклад, результат GDPval-AA v2 — 1421 (у 3.5 Flash — 1349). Клієнти, такі як Hebbia та Harvey, виявили, що він особливо добре справляється з багатомодальними завданнями, такими як розбір документів, аналіз діаграм і даних, складання звітів тощо.
Відгук клієнта: 3.6 Flash — це прогрес щодо витрат і якості, який забезпечує баланс між ефективністю токенів, точністю та швидкістю у складних робочих процесах і знаннєвих завданнях.
Дизайн безпеки
3.6 Flash оснащений покращеними передовими заходами безпеки, що охоплюють хімічні, біологічні, радіологічні та ядерні (CBRN) загрози, а також зловживання кібератаками. Ці заходи значно підвищують стійкість моделі до атак на обхід обмежень. Крім того, модель навчена мінімізувати відмови у корисних застосуваннях.
Gemini 3.5 Flash-Lite: створений для масштабування робочих процесів Agent
3.5 Flash-Lite розроблений для завдань з низькою затримкою та сценаріїв розробки, що вимагають високої пропускної здатності, таких як пошук агентів та обробка документів.
3.5 Flash-Lite — найшвидша модель серії 3.5. За вимірами Artificial Analysis, швидкість роботи досягає 350 вихідних токенів за секунду. Ціна становить 0,3 долара за мільйон вхідних токенів і 2,5 долара за мільйон вихідних токенів, при цьому якість значно перевищує 3.1 Flash-Lite, забезпечуючи відмінне співвідношення ціни та якості для розробників і клієнтів, які запускають завдання з великою пропускною здатністю.
3.5 Flash-Lite підтримує ефективне масштабування системи Agent. На всіх рівнях міркування ця модель значно перевершує 3.1 Flash-Lite. Розробники можуть налаштовувати модель залежно від навантаження: використовувати мінімальний та низький рівень міркування для масових завдань, забезпечуючи низьку затримку та низькі витрати, або ввімкнути вищі рівні міркування для обробки багатокрокових під-Agent завдань. Тепер ця модель також має операції з комп’ютером як вбудований інструмент, надійно підтримуючи завдання Agent через різні інтерфейси.
Він має значне покращення в кодуванні та завданнях агента, наприклад, результат Terminal-Bench 2.1 — 54% (у 3.1 Flash-Lite — 31%), довгі контексти, такі як GDM-MRCR v2 — 72,2% (у 3.1 Flash-Lite — 60,1%), реальні завдання, такі як GDPval-AA v2 — 1140 (у 3.1 Flash-Lite — 642).
На практиці у багатьох агентах та кодових тестах 3.5 Flash-Lite навіть перевершив 3 Flash, включаючи SWE-Bench Pro (54,2% проти 49,6%) та OSWorld-Verified (74,0% проти 65,1%), ставши швидшим і потужнішим варіантом для робочих навантажень 2.5 та 3 Flash.
Ранні клієнти підкреслили унікальне поєднання швидкості, інтелекту та витратної ефективності 3.5 Flash-Lite у розширенні робочих процесів агента та завдань обробки даних.
Gemini 3.5 Flash Cyber у CodeMender: ефективне виявлення та виправлення вразливостей
Моделі ШІ виявляють безпекові вразливості швидше, ніж поточні системи здатні їх виправляти. Для боротьби з цією все більш серйозною загрозою потрібен ефективний та потужний підхід до безпеки програмного забезпечення.
Продуктивність та ефективність Flash роблять його ідеальною основою для масштабного виявлення, перевірки та виправлення проблем безпеки коду. Gemini 3.5 Flash Cyber побудований на основі 3.5 Flash, доопрацьований спеціально для виявлення та виправлення кібербезпекових уразливостей, при цьому вартість за токен нижча, ніж у великих моделей.
У CodeMender кілька 3.5 Flash Cyber Agent працюють разом, щоб створити єдиний комплексний звіт, досягаючи передового рівня конкуренції на популярному бенчмарку CyberGym.
З урахуванням двоїстої природи цієї технології ми застосували обережний підхід до її розгортання. Модель скоро буде доступна лише для урядових органів та надійних партнерів у рамках обмеженого пілотного проекту через CodeMender. Це дозволить першим лініям захисту виявляти та виправляти критичні вразливості до їх використання, водночас зменшуючи ризики ширшого зловживання.
Почніть використовувати зараз
3.6 Flash і 3.5 Flash-Lite доступні з сьогодні:
Розробники можуть використовувати через Gemini API в Google AI Studio та Android Studio. 3.6 Flash також доступний у Google Antigravity.
Підприємства можуть використовувати 3.6 Flash на платформі Gemini Enterprise Agent. 3.6 Flash також доступний у додатку Gemini Enterprise.
Усі можуть використовувати через додаток Gemini. 3.5 Flash-Lite також запускається в Google Пошуковій системі.
Будь ласка, надайте зворотний зв’язок для покращення майбутніх моделей Gemini; ми очікуємо запуску 3.5 Pro дуже скоро.
