Автор: Google DeepMind
Перевод: Shenchao TechFlow
DeepChao Overview: Три новые модели, представленные Google, направлены на решение реальных проблем коммерциализации AI-агентов — стоимость и скорость. Модель 3.6 Flash на 17% экономит токены по сравнению с предыдущей версией, при более низкой цене и лучшем качестве; модель 3.5 Flash-Lite достигает скорости 350 токенов/секунду — это самый быстрый представитель серии 3.5; а специализированная модель для кибербезопасности Flash Cyber ориентирована на рынок устранения уязвимостей в коде, который является насущной потребностью. Это не игра в тестирование производительности — это прокладывание пути для масштабного развертывания AI-агентов.
Google DeepMind сегодня выпустила три новые модели Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. Эти модели разработаны для обеспечения эффективности, низкой задержки и надежности, необходимых для масштабного создания AI-агентов.
Gemini 3.6 Flash: более эффективно, более качественно
3.6 Flash был улучшен на основе обратной связи от разработчиков по версии 3.5 Flash. Он не только продвинулся в области кодирования и работы с знаниями, но и значительно повысил эффективность токенов. Согласно Artificial Analysis Index, 3.6 Flash снижает потребление выходных токенов на 17% по сравнению с 3.5 Flash. В некоторых тестах, таких как Datacurve DeepSWE, снижение достигает 65%. Также уменьшается количество шагов рассуждения и вызовов инструментов, необходимых для выполнения многоэтапных рабочих процессов.
Это повышение эффективности сопровождается более низкими ценами. Ценообразование составляет 1,5 доллара США за миллион входных токенов и 7,5 доллара США за миллион выходных токенов; 3.6 Flash снижает общую стоимость каждой задачи агента, делая создание и запуск агентов более экономичными.
Даже при более высокой эффективности 3.6 Flash превосходит 3.5 Flash по производительности во всех сценариях использования:
Редактирование кода стало более точным, сокращено количество ненужных изменений и циклов выполнения: достигнут результат 49% на DeepSWE (у 3.5 Flash — 37%), а на машинном обучении и исследовательском бенчмарке MLE Bench — значительный рост до 63,9% (у 3.5 Flash — 49,7%).
Улучшены навыки работы с компьютером, результат OSWorld-Verified — 83,0% (3,5 Flash — 78,4%). Работа с компьютером теперь доступна через Gemini API и Gemini Enterprise в качестве встроенного инструмента клиента.
Когнитивные задачи выполняются лучше, например, результат по бенчмарку GDPval-AA v2 составляет 1421 (у 3.5 Flash — 1349). Клиенты, такие как Hebbia и Harvey, обнаружили, что он особенно эффективен в многосетевых задачах, включая анализ документов, графиков и данных, а также составление отчетов.
Отзывы клиентов: 3.6 Flash — это прогресс с точки зрения стоимости и качества, обеспечивающий баланс между эффективностью токенов, точностью и скоростью в сложных рабочих процессах и задачах, требующих знаний.
Дизайн безопасности
3.6 Flash оснащен усовершенствованными передовыми мерами безопасности, охватывающими химические, биологические, радиологические и ядерные (CBRN) угрозы, а также злоупотребления в области кибератак. Эти меры значительно повышают устойчивость модели к атакам на обход ограничений. В то же время модель была обучена минимизировать отказы в полезных применениях.
Gemini 3.5 Flash-Lite: создан для масштабирования рабочих процессов Agent
3.5 Flash-Lite разработан для задач с низкой задержкой и сценариев, требующих высокой пропускной способности, таких как поиск агентов и обработка документов.
3.5 Flash-Lite — это самый быстрый модель в серии 3.5. Согласно измерениям Artificial Analysis, скорость работы составляет 350 выходных токенов в секунду. Ценовая политика: 0,3 доллара США за миллион входных токенов и 2,5 доллара США за миллион выходных токенов, при этом качество значительно превосходит 3.1 Flash-Lite, обеспечивая отличное соотношение цены и качества для разработчиков и клиентов, запускающих задачи с высокой нагрузкой в продакшене.
3.5 Flash-Lite поддерживает эффективное масштабирование системы Agent. На всех уровнях мышления эта модель значительно превосходит 3.1 Flash-Lite. Разработчики могут настраивать модель в зависимости от рабочей нагрузки: использовать минимальные и низкие уровни мышления для пакетных задач, обеспечивая низкую задержку и низкую стоимость выполнения, или включать более высокие уровни мышления для обработки многошаговых рабочих нагрузок суб-Agent. Эта модель теперь также включает управление компьютером в качестве встроенного инструмента, надежно поддерживая задачи Agent через различные интерфейсы.
Он демонстрирует значительное улучшение в кодировании и задачах агента: результат на Terminal-Bench 2.1 — 54% (у 3.1 Flash-Lite — 31%), в длинных контекстах, например, GDM-MRCR v2 — 72,2% (у 3.1 Flash-Lite — 60,1%), при выполнении реальных задач, таких как GDPval-AA v2 — 1140 (у 3.1 Flash-Lite — 642).
На самом деле, в многих оценках агентов и кодирования 3.5 Flash-Lite превзошла 3 Flash, включая SWE-Bench Pro (54,2% против 49,6%) и OSWorld-Verified (74,0% против 65,1%), став более быстрым и мощным выбором для рабочих нагрузок 2.5 и 3 Flash.
Ранние клиенты подчеркнули уникальное сочетание скорости, интеллекта и стоимости в 3.5 Flash-Lite при масштабировании рабочих процессов агентов и задач обработки данных.
Gemini 3.5 Flash Cyber в CodeMender: эффективное обнаружение и устранение уязвимостей
Искусственные интеллектуальные модели обнаруживают уязвимости безопасности быстрее, чем текущие системы их устраняют. Для борьбы с этой все более серьезной угрозой необходима эффективная и надежная методология обеспечения безопасности программного обеспечения.
Производительность и эффективность Flash делают его идеальной основой для масштабного обнаружения, проверки и устранения проблем безопасности кода. Gemini 3.5 Flash Cyber построен на основе 3.5 Flash, дообучен специально для выявления и устранения уязвимостей кибербезопасности и стоит меньше за токен, чем крупные модели.
В CodeMender несколько 3.5 Flash Cyber Agent работают совместно, создавая единый комплексный отчет, достигая передового уровня конкуренции на популярном бенчмарке CyberGym.
Учитывая двойное назначение этой технологии, мы применяем осторожный подход к ее внедрению. Модель будет вскоре предоставлена исключительно правительственным органам и надежным партнерам в рамках пилотного проекта через CodeMender с ограниченным доступом. Это позволит специалистам по защите обнаруживать и устранять критические уязвимости до их эксплуатации, одновременно снижая риски более широкого злоупотребления.
Начните использовать сразу
3.6 Flash и 3.5 Flash-Lite доступны с сегодняшнего дня:
Разработчики могут использовать через Gemini API в Google AI Studio и Android Studio. 3.6 Flash также доступен в Google Antigravity
Предприятия могут использовать его на платформе Gemini Enterprise Agent. 3.6 Flash также доступен в приложении Gemini Enterprise.
Доступно всем через приложение Gemini. 3.5 Flash-Lite также запускается в Google Поиске.
Спасибо за обратную связь, которая поможет улучшить будущие модели Gemini. Мы с нетерпением ждем выпуска 3.5 Pro.
