Claude 5.1 тільки що з’явився, а вже за ним іде OpenAI Astra.
Зараз навіть Google зробив новий крок. Останні повідомлення стверджують, що Gemini 3.8 Flash з’явиться завтра.


Здається, у світі ШІ знову наступає «Новий рік».
Gemini 3.5 Pro відмінено, наступний великий випуск — 4.0
Натомість із запуском Gemini 3.8 Flash, багато хто цікавиться: коли ж з’явиться Gemini 3.5 Pro?!
Вибачте, чекати не варто — Google вже відмовився...

З моменту анонсу конференції I/O у травні цього року минуло майже 4 місяці, і еволюція Gemini 3.5 Pro навіть не досягла рівня Flash.
Google теж змушений, прямо «відмовляється від фігури».
На щастя, Gemini 4.0 добре впорався з попереднім навчанням, а післянавчання продовжується успішно.


Цей ексклюзивний матеріал від WSJ також зробив важливий анонс про вражаючі програмні здібності Gemini 3.8 Flash (кодова назва «Skimaki»).
За даними, у порівняльних тестах інструменту внутрішнього кодування Google Jetski, 3.8 Flash беззаперечно перевершив модель Opus.
Крім того, цю модель розробляли протягом кількох місяців, ще до «землетрусу» у керівництві Google.
Хассабіс звільнився, а головний науковець Джефф Дін покинув посаду, що викликало занепокоєння щодо майбутнього Gemini.

Проте наразі все проходить усередині організовано та безперебійно.
На даний момент Google планує спочатку запустити Gemini 3.8 Flash, оскільки ця модель має менший розмір параметрів, вимагає менше обчислювальних ресурсів і легше досягає результатів.
За інформацією з внутрішніх джерел, з початку цього року Google вкладає більше ресурсів і обчислювальних потужностей для покращення здатності Gemini писати код.
Зокрема, значно збільшено інвестиції в «підсилене навчання», щоб AI міг шляхом постійних спроб і помилок справді засвоїти нові навички.
Крім того, Google DeepMind та інші лабораторії одночасно розробляють кілька проектів, тому навіть якщо один не вдасться, інший може його замінити.
Gemini 3.5 Pro не відповідає очікуванням, але Gemini 4.0 ще не «вийшов».
Зараз «два великі» з Сіліконової долини — OpenAI та Anthropic — дуже сильні у сфері передових моделей та програмних агентів.
Інформація стверджує, що наступне покоління OpenAI Astra також використовує новий метод міркувань «циклічна глибина» (recurrent depth), що зменшує кількість токенів міркувань та значно підвищує продуктивність.
Цей джокер буде розкритий цього тижня.

А зараз, зараз Google має щось пред’явити.
Після обіцянки劈柴, протягом кількох місяців він не представив жодної моделі, яка б викликала ентузіазм у AI-середовищі, крім випуску 3.7 Flash.
Можливо, сьогодні вночі з’явиться Gemini 3.8 Flash.

Gemini вперше сама дивиться відео
Перед цим публікацією Google сьогодні провела підготовчу кампанію, додавши Gemini нову функцію —
Відео-розуміння агента (Agentic Video Understanding)
Ця функція просто додає багато балів.
Завантажте відео з конференції I/O: та сама модель Gemini 3.7 Flash, витрати токенів зменшилися на 88%.

У офіційному блозі Google зазначено, що моделі Gemini 3.7 Flash, 3.6 Flash і 3.5 Flash-Lite підтримують агентну здатність розуміння відео, доступ до якої надається через Google AI Studio та Gemini Enterprise Agent Platform.
Увімкніть цей переключник на стандартних відеоаналітичних тестах — споживання токенів зменшується до 88%, витрати на аналіз — до 66%, а точність зростає до 7%.

І додатково не стягнуто жодного цента — використовується стандартна ціна токенів API. Звичайно, економія грошей і точність суперечать одна одній. Але цього разу не виникло конфлікту.

Тому що Gemini навчився «переміщати повзунок».
Попередній підхід називався «статичним»: модель пасивно отримувала потік зображень із фіксованою частотою кадрів, яка жорстко визначалася параметрами API, і модель не мала ніякого впливу.
Тепер модель сама вирішує, яку частину переглядати, з якою швидкістю, чи дивитися відео, слухати аудіо чи прямо читати транскрипцію.

Це не перший раз, коли Google це робить.
Попереднє агентне бачення поєднувало виконання коду з нативним розумінням зображень Gemini: модель могла самостійно писати код для збільшення, обрізання та порівняння зображення.
Тепер черга за відео — та сама ідея, лише інструмент замінено на нативні відеоінструменти.
Чотири справи, які раніше було важко виконати
У офіційному блозі також перелічено кілька складних сценаріїв використання.
Пошук фрагментів з підсекундною точністю. Раніше моделі «дивилися» відео і робили знімок лише один раз на секунду. Проблема в тому, що багато речей проходять швидше, ніж за секунду.
Зараз можна точно визначити ці моменти з точністю менше ніж за одну секунду.
Це означає, що «автоматичне вирізання» вперше справді стало реальним: раніше монтажери мусили самі працювати з часовою шкалою, знайшовши кожен кадр, де потрібно робити зріз, зараз можна спочатку дати моделі оглядати відео, позначивши кандидатів на точки зрізу, а потім людина вибирає.

Шукати голку у стогу сіна. Задати складне питання до кількох годин матеріалу, не витрачаючи мільйони токенів.
Виявлення аномалій. Після того як модель визначить певний часовий інтервал, можна збільшити частоту кадрів і повторно вибрати цей фрагмент, щоб детальніше розглянути швидкі рухи та дрібні дефекти зображення. Це особливо корисно для контролю якості на виробничих лініях та систем безпеки, оскільки аномалії виникають лише протягом кількох секунд.
Порахуйте. Раніше модель постійно помилялася у таких запитаннях, як: скільки разів повторюється дія, скільки різних об’єктів є на екрані — причина дуже проста: у пропущених кадрах саме тоді з’являлися об’єкти.

Агент нарешті почав дивитися відео
Відео завжди було найдорожчим серед усіх модальностей.
Текст дешевий, зображення нормальні, відео великі й довгі — одна хвилина може споживати стільки ж токенів, скільки книга.
Тож ці два роки всі обговорювали агентів, більшою мірою зосереджуючись на тому, що вони можуть читати, писати та використовувати інструменти.
Проблема в тому, що агент, який здебільшого розуміє світ через текст, бачить лише світ, який було «переказано» іншими.
Він не знає нічого про те, що зафіксовано камерами, записано на зустрічах або пройшло вздовж виробничої лінії — все, що ніхто не хоче витрачати час на перетворення на текст.
Зараз цю криву витрат скорочено на значну частину.
Агент, який здатний самостійно переглянути кілька годин спостереження, десятки годин курсів і сотні матеріалів, не витрачаючи при цьому весь бюджет, змінює свій спосіб взаємодії зі світом.
Йому більше не потрібно чекати, поки хтось перетворить зображення на текст і підам йому, і більше не потрібно вибирати між «бачити» і «бачити точно».
Google став цим розривом.
Бій штучного інтелекту, наступний раунд
Протягом цих днів графік публікацій чотирьох компаній майже збігся.
Claude 5.1 тільки що прибув, OpenAI Astra вже біля дверей, а Google, який кілька місяців тримав у собі, нарешті випустив Gemini 3.8 Flash у відповідь.
Після цього оновлення Claude тепер зосереджений на двох основних напрямках: програмування та наукові дослідження.
Наступне покоління Astra перетвориться на «постійного агента»; за словами Ультрамана, його комп’ютерні здібності досягли рівня людини.

Gemini 3.8 Flash також зробить значний стрибок у програмуванні.
Зараз OpenAI, Anthropic, Google та SpaceXAI працюють одночасно на повну потужність.

Маск передбачив випуск Grok 4.7 через десять днів
Ця битва лише входить у найбільш запеклу фазу.
Джерела:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Цей матеріал з іншого веб-сайту «XinZhiYuan», автор: Apokalypsy ASI
