Claude 5.1 только что вышел, а рядом сразу появляется OpenAI Astra.
Теперь даже Google сделал новый шаг. Последние утечки сообщают, что Gemini 3.8 Flash появится завтра.


Похоже, в мире ИИ снова наступает «Новый год».
Gemini 3.5 Pro отменен, следующая крупная версия — 4.0
Вместо выпуска Gemini 3.8 Flash многие больше интересуются: когда же появится Gemini 3.5 Pro?!
Извините, не ждите, Google уже отказался...

С момента анонса конференции I/O в мае этого года прошло почти четыре месяца, и эволюция Gemini 3.5 Pro не дотягивает даже до Flash.
Google также вынужден был просто «пожертвовать» этим.
К счастью, Gemini 4.0 показал отличные результаты на этапе предварительной подготовки, а последующая подготовка продолжается успешно.


Этот эксклюзивный материал от WSJ также с размахом анонсирует впечатляющие программные способности Gemini 3.8 Flash (кодовое имя «Skimaki»).
Согласно сообщениям, в сравнительных тестах с внутренним инструментом кодирования Google Jetski, 3.8 Flash полностью превзошел модель Opus.
Кроме того, эта модель разрабатывалась в течение нескольких месяцев еще до «землетрясения» в руководстве Google.
Хассабис уступил место, а главный научный сотрудник Джефф Дин ушел, что заставило многих сомневаться в будущем Gemini.

Однако на данный момент все проходит организованно внутри.
Сейчас Google планирует сначала запустить Gemini 3.8 Flash, потому что эта модель имеет меньшее количество параметров, требует меньше вычислительных ресурсов и легче дает результаты.
По слухам, с начала этого года Google направила больше ресурсов и вычислительных мощностей на улучшение способности Gemini к написанию кода.
В частности, значительно увеличены вложения в «обучение с подкреплением», чтобы ИИ мог действительно освоить новые навыки путем постоянного проб и ошибок.
Кроме того, Google DeepMind и другие лаборатории одновременно продвигают несколько проектов, поэтому, если один не сработает, другой сможет его заменить.
Gemini 3.5 Pro не оправдал ожиданий, но Gemini 4.0 еще не «выпущен».
Сегодня «две ведущие компании» из Силиконовой долины — OpenAI и Anthropic — отлично справляются с передовыми моделями и программными агентами.
Согласно информации, следующее поколение OpenAI Astra использует новый метод вывода «рекуррентная глубина», который снижает количество токенов мышления и одновременно значительно повышает производительность.
Эта козырная карта будет раскрыта на этой неделе.

А в это самое время Google должен что-нибудь представить.
Ведь после обещания劈柴, в течение нескольких месяцев ничего, кроме выпуска 3.7 Flash, не было представлено, что могло бы вызвать волнение в сообществе ИИ.
Возможно, уже сегодня вечером появится Gemini 3.8 Flash.

Gemini впервые научился смотреть видео
Перед этим объявлением Google сегодня провела предварительную кампанию, добавив Gemini новую функцию —
Видение видео агентом (Agentic Video Understanding)
Эта функция просто супер.
Загружено видео с конференции I/O: та же модель Gemini 3.7 Flash, потребление токенов снизилось сразу на 88%.

В официальном блоге Google сообщается, что модели Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite поддерживают агентное понимание видео, доступ к которому осуществляется через Google AI Studio и Gemini Enterprise Agent Platform.
Включите этот переключатель на стандартных видеопрофильных базах данных: потребление токенов снижается до 88%, стоимость анализа снижается до 66%, а точность, наоборот, увеличивается до 7%.

И при этом не взимается ни копейки сверху — используется стандартная токен-цена API. Экономия и точность обычно конфликтуют. На этот раз конфликта не произошло.

Потому что Gemini научился «перематывать ползунок».
Предыдущий подход назывался «статическим»: модель пассивно получала поток изображений с фиксированной частотой кадров, которая жестко задавалась параметрами API, и модель не имела права голоса.
Теперь модель сама решает, какой фрагмент выбрать, с какой скоростью его просматривать, смотреть ли видео, слушать аудио или сразу читать транскрипцию.

Это не первый раз, когда Google делает это.
Ранее агентное видение объединяло выполнение кода и встроенное понимание изображений Gemini, позволяя модели писать код для увеличения, обрезки и сравнения изображений.
Теперь очередь за видео — та же идея, только инструмент заменен на нативный видеоинструмент.
Четыре дела, которые раньше было сложно сделать
В официальном блоге также перечислены несколько сложных сценариев применения.
Получение фрагментов с субсекундной точностью. Ранее модели «смотрели» видео и делали один кадр в секунду. Проблема в том, что многое проходит быстрее секунды.
Теперь можно точно определить эти моменты с точностью до доли секунды.
Это означает, что «автоматическая резка» впервые стала по-настоящему осуществимой: раньше монтажёрам приходилось вручную просматривать временную шкалу, кадр за кадром, чтобы определить, где сделать разрез; теперь модель может сначала просмотреть материал и отметить потенциальные точки резки, а человек уже выбирает из них.

Искать иголку в стоге сена. Задайте сложный вопрос в нескольких часах материала, не тратя миллионы токенов.
Обнаружение аномалий. После того как модель фокусируется на определенном временном окне, можно повысить частоту кадров и повторно выбрать этот фрагмент, чтобы четко увидеть быстрые движения и мелкие дефекты изображения. Это особенно полезно для контроля качества на производственной линии и систем видеонаблюдения, поскольку аномалии обычно происходят лишь в течение нескольких секунд.
Посчитайте. Раньше модель постоянно ошибалась в вопросах типа: сколько раз повторяется действие, сколько разных объектов на экране — причина проста: в пропущенных кадрах как раз оказывались какие-то объекты.

Агент наконец-то начал смотреть видео
Видео всегда было самым дорогим среди всех модальностей.
Текст дешевый, изображения нормальные, видео же большие и длинные — одна минута может заменить книгу по токенам.
Так что последние два года все говорят об агентах, но больше всего обсуждают, что они могут читать, писать и использовать инструменты.
Проблема в том, что агент, который в основном понимает мир через текст, видит лишь мир, «пересказанный» другим человеком.
Оно не знает ничего о том, что зафиксировано камерами, записано на совещаниях или прошло по производственной линии — всё, что никто не хочет потратить время, чтобы превратить в текст.
Сейчас эта кривая затрат была значительно сокращена.
Если агент может самостоятельно просмотреть несколько часов видеонаблюдения, десятки часов курсов и сотни материалов, не израсходовав при этом весь бюджет, то его способ взаимодействия с миром меняется.
Ему больше не нужно ждать, пока кто-то переведет изображение в текст, и больше не нужно выбирать между «видимостью» и «точностью».
Google стал этим первопроходцем.
Битва ИИ, следующий раунд
В эти дни график публикаций четырех компаний почти совпал.
Claude 5.1 только прибыл, OpenAI Astra уже у двери, а Google, несколько месяцев сдерживаясь, наконец выпустил Gemini 3.8 Flash для борьбы.
После этого обновления Claude теперь сосредоточен на двух основных направлениях: программирование и научные исследования.
Следующее поколение Astra станет «постоянным агентом»; словами Ультрамана, его вычислительные способности достигли уровня человека.

Gemini 3.8 Flash также сделает большой скачок в области программирования.
Сейчас OpenAI, Anthropic, Google и SpaceXAI одновременно работают на полную мощность.

Маск анонсировал выпуск Grok 4.7 через 10 дней
Эта битва только вошла в самую ожесточённую фазу.
Справочные материалы:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, Откровение
