Google запустит Gemini 3.8 Flash завтра, акцент на программировании и понимании видео

icon MarsBit
Поделиться
AI summary iconСводка
Google готова запустить Gemini 3.8 Flash завтра — это крупное событие по запуску токена в сфере ИИ. Модель под кодовым названием «Skimaki» улучшает понимание кода и видео, сокращая использование токенов до 88%. Разработка Gemini 3.5 Pro отменена, все усилия сосредоточены на Gemini 4.0. События в блокчейне показывают, что Google также внедряет агентное понимание видео для динамического анализа контента.

Claude 5.1 только что вышел, а рядом сразу появляется OpenAI Astra.

Теперь даже Google сделал новый шаг. Последние утечки сообщают, что Gemini 3.8 Flash появится завтра.

Google

Google

Похоже, в мире ИИ снова наступает «Новый год».

Gemini 3.5 Pro отменен, следующая крупная версия — 4.0

Вместо выпуска Gemini 3.8 Flash многие больше интересуются: когда же появится Gemini 3.5 Pro?!

Извините, не ждите, Google уже отказался...

Google

С момента анонса конференции I/O в мае этого года прошло почти четыре месяца, и эволюция Gemini 3.5 Pro не дотягивает даже до Flash.

Google также вынужден был просто «пожертвовать» этим.

К счастью, Gemini 4.0 показал отличные результаты на этапе предварительной подготовки, а последующая подготовка продолжается успешно.

Google

Google

Этот эксклюзивный материал от WSJ также с размахом анонсирует впечатляющие программные способности Gemini 3.8 Flash (кодовое имя «Skimaki»).

Согласно сообщениям, в сравнительных тестах с внутренним инструментом кодирования Google Jetski, 3.8 Flash полностью превзошел модель Opus.

Кроме того, эта модель разрабатывалась в течение нескольких месяцев еще до «землетрясения» в руководстве Google.

Хассабис уступил место, а главный научный сотрудник Джефф Дин ушел, что заставило многих сомневаться в будущем Gemini.

Google

Однако на данный момент все проходит организованно внутри.

Сейчас Google планирует сначала запустить Gemini 3.8 Flash, потому что эта модель имеет меньшее количество параметров, требует меньше вычислительных ресурсов и легче дает результаты.

По слухам, с начала этого года Google направила больше ресурсов и вычислительных мощностей на улучшение способности Gemini к написанию кода.

В частности, значительно увеличены вложения в «обучение с подкреплением», чтобы ИИ мог действительно освоить новые навыки путем постоянного проб и ошибок.

Кроме того, Google DeepMind и другие лаборатории одновременно продвигают несколько проектов, поэтому, если один не сработает, другой сможет его заменить.

Gemini 3.5 Pro не оправдал ожиданий, но Gemini 4.0 еще не «выпущен».

Сегодня «две ведущие компании» из Силиконовой долины — OpenAI и Anthropic — отлично справляются с передовыми моделями и программными агентами.

Согласно информации, следующее поколение OpenAI Astra использует новый метод вывода «рекуррентная глубина», который снижает количество токенов мышления и одновременно значительно повышает производительность.

Эта козырная карта будет раскрыта на этой неделе.

Google

А в это самое время Google должен что-нибудь представить.

Ведь после обещания劈柴, в течение нескольких месяцев ничего, кроме выпуска 3.7 Flash, не было представлено, что могло бы вызвать волнение в сообществе ИИ.

Возможно, уже сегодня вечером появится Gemini 3.8 Flash.

Google

Gemini впервые научился смотреть видео

Перед этим объявлением Google сегодня провела предварительную кампанию, добавив Gemini новую функцию —

Видение видео агентом (Agentic Video Understanding)

Эта функция просто супер.

Загружено видео с конференции I/O: та же модель Gemini 3.7 Flash, потребление токенов снизилось сразу на 88%.

Google

В официальном блоге Google сообщается, что модели Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite поддерживают агентное понимание видео, доступ к которому осуществляется через Google AI Studio и Gemini Enterprise Agent Platform.

Включите этот переключатель на стандартных видеопрофильных базах данных: потребление токенов снижается до 88%, стоимость анализа снижается до 66%, а точность, наоборот, увеличивается до 7%.

Google

И при этом не взимается ни копейки сверху — используется стандартная токен-цена API. Экономия и точность обычно конфликтуют. На этот раз конфликта не произошло.

Google

Потому что Gemini научился «перематывать ползунок».

Предыдущий подход назывался «статическим»: модель пассивно получала поток изображений с фиксированной частотой кадров, которая жестко задавалась параметрами API, и модель не имела права голоса.

Теперь модель сама решает, какой фрагмент выбрать, с какой скоростью его просматривать, смотреть ли видео, слушать аудио или сразу читать транскрипцию.

Google

Это не первый раз, когда Google делает это.

Ранее агентное видение объединяло выполнение кода и встроенное понимание изображений Gemini, позволяя модели писать код для увеличения, обрезки и сравнения изображений.

Теперь очередь за видео — та же идея, только инструмент заменен на нативный видеоинструмент.

Четыре дела, которые раньше было сложно сделать

В официальном блоге также перечислены несколько сложных сценариев применения.

Получение фрагментов с субсекундной точностью. Ранее модели «смотрели» видео и делали один кадр в секунду. Проблема в том, что многое проходит быстрее секунды.

Теперь можно точно определить эти моменты с точностью до доли секунды.

Это означает, что «автоматическая резка» впервые стала по-настоящему осуществимой: раньше монтажёрам приходилось вручную просматривать временную шкалу, кадр за кадром, чтобы определить, где сделать разрез; теперь модель может сначала просмотреть материал и отметить потенциальные точки резки, а человек уже выбирает из них.

Google

Искать иголку в стоге сена. Задайте сложный вопрос в нескольких часах материала, не тратя миллионы токенов.

Обнаружение аномалий. После того как модель фокусируется на определенном временном окне, можно повысить частоту кадров и повторно выбрать этот фрагмент, чтобы четко увидеть быстрые движения и мелкие дефекты изображения. Это особенно полезно для контроля качества на производственной линии и систем видеонаблюдения, поскольку аномалии обычно происходят лишь в течение нескольких секунд.

Посчитайте. Раньше модель постоянно ошибалась в вопросах типа: сколько раз повторяется действие, сколько разных объектов на экране — причина проста: в пропущенных кадрах как раз оказывались какие-то объекты.

Google

Агент наконец-то начал смотреть видео

Видео всегда было самым дорогим среди всех модальностей.

Текст дешевый, изображения нормальные, видео же большие и длинные — одна минута может заменить книгу по токенам.

Так что последние два года все говорят об агентах, но больше всего обсуждают, что они могут читать, писать и использовать инструменты.

Проблема в том, что агент, который в основном понимает мир через текст, видит лишь мир, «пересказанный» другим человеком.

Оно не знает ничего о том, что зафиксировано камерами, записано на совещаниях или прошло по производственной линии — всё, что никто не хочет потратить время, чтобы превратить в текст.

Сейчас эта кривая затрат была значительно сокращена.

Если агент может самостоятельно просмотреть несколько часов видеонаблюдения, десятки часов курсов и сотни материалов, не израсходовав при этом весь бюджет, то его способ взаимодействия с миром меняется.

Ему больше не нужно ждать, пока кто-то переведет изображение в текст, и больше не нужно выбирать между «видимостью» и «точностью».

Google стал этим первопроходцем.

Битва ИИ, следующий раунд

В эти дни график публикаций четырех компаний почти совпал.

Claude 5.1 только прибыл, OpenAI Astra уже у двери, а Google, несколько месяцев сдерживаясь, наконец выпустил Gemini 3.8 Flash для борьбы.

После этого обновления Claude теперь сосредоточен на двух основных направлениях: программирование и научные исследования.

Следующее поколение Astra станет «постоянным агентом»; словами Ультрамана, его вычислительные способности достигли уровня человека.

Google

Gemini 3.8 Flash также сделает большой скачок в области программирования.

Сейчас OpenAI, Anthropic, Google и SpaceXAI одновременно работают на полную мощность.

Google

Маск анонсировал выпуск Grok 4.7 через 10 дней

Эта битва только вошла в самую ожесточённую фазу.

Справочные материалы:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, Откровение

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.