Google запускає Gemini 3.8 Flash завтра, акцент на кодуванні та розумінні відео

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Google збирається запустити Gemini 3.8 Flash завтра — це важлива новина про запуск токена в сфері ШІ. Модель, яка має кодову назву «Skimaki», покращує розуміння коду та відео, а також зменшує використання токенів до 88%. Розробка Gemini 3.5 Pro була скасована, а всі зусилля перенесено на Gemini 4.0. Дані в блокчейні показують, що Google також вводить агентне розуміння відео для динамічного аналізу контенту.

Claude 5.1 тільки що з’явився, а вже за ним іде OpenAI Astra.

Зараз навіть Google зробив новий крок. Останні повідомлення стверджують, що Gemini 3.8 Flash з’явиться завтра.

Google

Google

Здається, у світі ШІ знову наступає «Новий рік».

Gemini 3.5 Pro відмінено, наступний великий випуск — 4.0

Натомість із запуском Gemini 3.8 Flash, багато хто цікавиться: коли ж з’явиться Gemini 3.5 Pro?!

Вибачте, чекати не варто — Google вже відмовився...

Google

З моменту анонсу конференції I/O у травні цього року минуло майже 4 місяці, і еволюція Gemini 3.5 Pro навіть не досягла рівня Flash.

Google теж змушений, прямо «відмовляється від фігури».

На щастя, Gemini 4.0 добре впорався з попереднім навчанням, а післянавчання продовжується успішно.

Google

Google

Цей ексклюзивний матеріал від WSJ також зробив важливий анонс про вражаючі програмні здібності Gemini 3.8 Flash (кодова назва «Skimaki»).

За даними, у порівняльних тестах інструменту внутрішнього кодування Google Jetski, 3.8 Flash беззаперечно перевершив модель Opus.

Крім того, цю модель розробляли протягом кількох місяців, ще до «землетрусу» у керівництві Google.

Хассабіс звільнився, а головний науковець Джефф Дін покинув посаду, що викликало занепокоєння щодо майбутнього Gemini.

Google

Проте наразі все проходить усередині організовано та безперебійно.

На даний момент Google планує спочатку запустити Gemini 3.8 Flash, оскільки ця модель має менший розмір параметрів, вимагає менше обчислювальних ресурсів і легше досягає результатів.

За інформацією з внутрішніх джерел, з початку цього року Google вкладає більше ресурсів і обчислювальних потужностей для покращення здатності Gemini писати код.

Зокрема, значно збільшено інвестиції в «підсилене навчання», щоб AI міг шляхом постійних спроб і помилок справді засвоїти нові навички.

Крім того, Google DeepMind та інші лабораторії одночасно розробляють кілька проектів, тому навіть якщо один не вдасться, інший може його замінити.

Gemini 3.5 Pro не відповідає очікуванням, але Gemini 4.0 ще не «вийшов».

Зараз «два великі» з Сіліконової долини — OpenAI та Anthropic — дуже сильні у сфері передових моделей та програмних агентів.

Інформація стверджує, що наступне покоління OpenAI Astra також використовує новий метод міркувань «циклічна глибина» (recurrent depth), що зменшує кількість токенів міркувань та значно підвищує продуктивність.

Цей джокер буде розкритий цього тижня.

Google

А зараз, зараз Google має щось пред’явити.

Після обіцянки劈柴, протягом кількох місяців він не представив жодної моделі, яка б викликала ентузіазм у AI-середовищі, крім випуску 3.7 Flash.

Можливо, сьогодні вночі з’явиться Gemini 3.8 Flash.

Google

Gemini вперше сама дивиться відео

Перед цим публікацією Google сьогодні провела підготовчу кампанію, додавши Gemini нову функцію —

Відео-розуміння агента (Agentic Video Understanding)

Ця функція просто додає багато балів.

Завантажте відео з конференції I/O: та сама модель Gemini 3.7 Flash, витрати токенів зменшилися на 88%.

Google

У офіційному блозі Google зазначено, що моделі Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite підтримують агентну здатність розуміння відео, доступ до якої надається через Google AI Studio та Gemini Enterprise Agent Platform.

Увімкніть цей переключник на стандартних відеоаналітичних тестах — споживання токенів зменшується до 88%, витрати на аналіз — до 66%, а точність зростає до 7%.

Google

І додатково не стягнуто жодного цента — використовується стандартна ціна токенів API. Звичайно, економія грошей і точність суперечать одна одній. Але цього разу не виникло конфлікту.

Google

Тому що Gemini навчився «переміщати повзунок».

Попередній підхід називався «статичним»: модель пасивно отримувала потік зображень із фіксованою частотою кадрів, яка жорстко визначалася параметрами API, і модель не мала ніякого впливу.

Тепер модель сама вирішує, яку частину переглядати, з якою швидкістю, чи дивитися відео, слухати аудіо чи прямо читати транскрипцію.

Google

Це не перший раз, коли Google це робить.

Попереднє агентне бачення поєднувало виконання коду з нативним розумінням зображень Gemini: модель могла самостійно писати код для збільшення, обрізання та порівняння зображення.

Тепер черга за відео — та сама ідея, лише інструмент замінено на нативні відеоінструменти.

Чотири справи, які раніше було важко виконати

У офіційному блозі також перелічено кілька складних сценаріїв використання.

Пошук фрагментів з підсекундною точністю. Раніше моделі «дивилися» відео і робили знімок лише один раз на секунду. Проблема в тому, що багато речей проходять швидше, ніж за секунду.

Зараз можна точно визначити ці моменти з точністю менше ніж за одну секунду.

Це означає, що «автоматичне вирізання» вперше справді стало реальним: раніше монтажери мусили самі працювати з часовою шкалою, знайшовши кожен кадр, де потрібно робити зріз, зараз можна спочатку дати моделі оглядати відео, позначивши кандидатів на точки зрізу, а потім людина вибирає.

Google

Шукати голку у стогу сіна. Задати складне питання до кількох годин матеріалу, не витрачаючи мільйони токенів.

Виявлення аномалій. Після того як модель визначить певний часовий інтервал, можна збільшити частоту кадрів і повторно вибрати цей фрагмент, щоб детальніше розглянути швидкі рухи та дрібні дефекти зображення. Це особливо корисно для контролю якості на виробничих лініях та систем безпеки, оскільки аномалії виникають лише протягом кількох секунд.

Порахуйте. Раніше модель постійно помилялася у таких запитаннях, як: скільки разів повторюється дія, скільки різних об’єктів є на екрані — причина дуже проста: у пропущених кадрах саме тоді з’являлися об’єкти.

Google

Агент нарешті почав дивитися відео

Відео завжди було найдорожчим серед усіх модальностей.

Текст дешевий, зображення нормальні, відео великі й довгі — одна хвилина може споживати стільки ж токенів, скільки книга.

Тож ці два роки всі обговорювали агентів, більшою мірою зосереджуючись на тому, що вони можуть читати, писати та використовувати інструменти.

Проблема в тому, що агент, який здебільшого розуміє світ через текст, бачить лише світ, який було «переказано» іншими.

Він не знає нічого про те, що зафіксовано камерами, записано на зустрічах або пройшло вздовж виробничої лінії — все, що ніхто не хоче витрачати час на перетворення на текст.

Зараз цю криву витрат скорочено на значну частину.

Агент, який здатний самостійно переглянути кілька годин спостереження, десятки годин курсів і сотні матеріалів, не витрачаючи при цьому весь бюджет, змінює свій спосіб взаємодії зі світом.

Йому більше не потрібно чекати, поки хтось перетворить зображення на текст і підам йому, і більше не потрібно вибирати між «бачити» і «бачити точно».

Google став цим розривом.

Бій штучного інтелекту, наступний раунд

Протягом цих днів графік публікацій чотирьох компаній майже збігся.

Claude 5.1 тільки що прибув, OpenAI Astra вже біля дверей, а Google, який кілька місяців тримав у собі, нарешті випустив Gemini 3.8 Flash у відповідь.

Після цього оновлення Claude тепер зосереджений на двох основних напрямках: програмування та наукові дослідження.

Наступне покоління Astra перетвориться на «постійного агента»; за словами Ультрамана, його комп’ютерні здібності досягли рівня людини.

Google

Gemini 3.8 Flash також зробить значний стрибок у програмуванні.

Зараз OpenAI, Anthropic, Google та SpaceXAI працюють одночасно на повну потужність.

Google

Маск передбачив випуск Grok 4.7 через десять днів

Ця битва лише входить у найбільш запеклу фазу.

Джерела:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Цей матеріал з іншого веб-сайту «XinZhiYuan», автор: Apokalypsy ASI

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.