Gemini 3.8 Flash від Google ставить під питання лідери у сфері ШІ, пропонуючи низьку вартість та високу продуктивність

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Найважливіші новини про альткоїни з’являються, коли Google представила Gemini 3.8 Flash та її кібербезпеку-версію — Gemini 3.8 Flash Cyber. Модель досягає $0,58 за мільйон токенів для однієї задачі та $0,75 за вхід, перевершуючи або зрівнюючись з GPT-5.6 Sol та Grok 4.6. Gemini 3.8 Flash Cyber показує 86,2% у тестах CyberGym і виявляє критичні недоліки за дві години. Орієнтація Google на швидкість, низьку вартість та ітеративне міркування змінює сцену новин про ШІ та криптовалюти, ставлячи під сумнів модель «більше — краще».

Тільки що Google повернувся!

Сьогодні вночі Google офіційно запустила Gemini 3.8 Flash та Gemini 3.8 Flash Cyber, спеціалізовану на кібербезпеці.

Це вже третій випуск Flash від Google за шість тижнів.

Попередні два оновлення здавалися лише розминкою, бо на цей раз Google безпосередньо вивів співвідношення ціни та якості на передовий план—

Вартість однієї задачі — 0,58 долара США! Введення лише 0,75 долара США/мільйон токенів!

Ось ця мала модель «за ціною капусти» вдалося досягти рівня найсильніших флагманських моделей світу — Opus 5, GPT-5.6 Sol та Grok 4.6 у кількох ключових тестах.

Гугл DeepMind, Яо Шуньюй зауважив: для моделі це лише невеликий крок; але для RSI це величезний стрибок.

Google

У X розробники вже вибухнули.

Після практичного тестування хтось задав провідне питання: «Боже, чи Google не перепутав відправку? Це ж саме Gemini 3.5 Pro, який ніколи не випускали! За ціною Flash виконує роботу Pro!»

Google

Google

У команді DeepMind хтось, мабуть, не спав з липня.

Поки всі ще засвоюють Fable 5.1, Google знову перевернув стіл.

Повернувся «король» Google: король співвідношення ціни та якості

Довго мовчазний Google найбільш інтенсивним способом оголосив світу: великий демон повернувся.

Google

Щоб зрозуміти вплив Gemini 3.8 Flash, ми повинні спочатку розглянути сучасну ситуацію на ринку ШІ.

У тесті Artificial Analysis вже сформувалася надзвичайно жорстка бар'єр. Щоб отримати топовий інтелект (Індекс інтелекту близько 60 балів), вам доведеться заплатити високу вартість у токенах.

Як наслідок, Gemini 3.8 Flash веде себе, як вбивця — просто без жодної честі.

У режимі високих міркувань Artificial Analysis інтелектуальний індекс Gemini 3.8 Flash стрімко зростав до 59 балів!

Google

Що це за концепція? Це на крок від найкращих GPT-5.6 Sol та Grok 4.6, а в деяких аспектах навіть перевершує Claude Opus 5!

А яка ціна за все це? Його вартість однієї задачі становить лише 0,58 долара.

Зокрема, вартість введення залишається на рівні 0,75 долара США за мільйон токенів, а виведення — 3,75 долара США за мільйон токенів.

Google створила графік: на Pareto-межі між інтелектом і витратами синя точка, що позначає Gemini 3.8 Flash, як «найефективнішу», розташована у верхньому правому куті тесту DeepSWE з програмної інженерії, відставляючи друге місце на велику відстань.

Google

Gemini 3.8 Flash не лише розумний, а й надзвичайно швидкий. Його швидкість генерації досягає дивовижних 305 токенів/с, тоді як наступний модельний рядок лише зусиллями досягає 154 токенів/с.

«Швидкий, розумний і дешевий, наче взагалі безкоштовний — ось справжня модель, яку люди зможуть використовувати щодня.»

Google

Зокрема, на довгостроковому програмному інженерному бенчмарку DeepSWE v1.1, 3.8 Flash показав вражаючий результат у 73,7%.

У цьому тесті, де потрібно, щоб ШІ самостійно вирішував складні інженерні завдання та писав код кінцем до кінця, він не лише перевершив більшість дорогих передових великих моделей, але й коштував лише частину їх витрат.

Пам’ятайте, це лише версія «Flash», а не «Pro» і тим більше не «Ultra».

На цей раз Google знову дозволила невеликим моделям забрати роботу у флагманських моделей.

Хтось протестував Gemini 3.8 Flash і Opus 5 на одній і тій самій задачі.

Google

Цей стрімкий стрибок у програмуванні не є випадковим.

Google

Цей стрімкий стрибок у програмуванні не є випадковим.

За повідомленнями, у тестах інструменту для коду Jetski всередині Google інженери Google навіть віддають перевагу 3.8 Flash перед моделлю Opus від Anthropic.

Google

За цим стоїть те, що Google з початку року інвестував великі ресурси в навчання з підсиленням — тобто в остаточну фазу навчання моделей, коли модель насправді вчиться працювати через проби та помилки.

Google DeepMind створила команду з розробки коду, яка зосереджена на підвищенні здатностей моделей програмування; цю команду очолює технічний директор DeepMind, а безпосередньо наглядає засновник Сергій Брин.

Їхня мета — вимусити рекурсивну саморозвиткову еволюцію, насильницьки перетворити програмувальну модель на повністю автоматизованого AI-дослідника, повністю замкнувши весь дослідницький цикл.

Google

У внутрішній запам’ятовувальній записці Google прямо сказав:

Щоб виграти останній спринт, ми повинні терміново ліквідувати розрив у виконанні агентів і перетворити наші моделі на головних розробників.

Google

Крім того, Google запропонував посаду Баррету Зофу — співзасновнику Thinking Machines Lab, колишньому керівнику післятренування в OpenAI, який тепер обіймає посаду віце-президента з досліджень і керує напрямками підсилювального навчання та післятренування. Ця серія кроків очевидно свідчить про їхнє незламне намір продовжувати боротьбу.

У минулому місяці співзасновник, лауреат Нобелівської премії Деміс Хассабіс звільнився з посади генерального директора, і його наступник Корай Кавукчоглу негайно заявив: прискорювати, прискорювати і знову прискорювати.

Базовий «підкачаний», чи справжня перевага?

Проте серед захоплених відгуків Google зазвичай звинувачують у тому, що вона занадто рано відкрила шампанське.

Google

Найбільше розчарування — Meta——

Meta’s Muse Spark 1.3 та Gemini 3.8 Flash зустрілися в боротьбі, де перший отримав 62 бали за інтелектуальним індексом Artificial Analysis, поступившись Claude Fable 5, і потрапив до топ-класу.

Вартість введення Muse на 8 разів нижча, ніж у Fable 5, а вартість виведення — майже на 12 разів нижча, що забезпечує максимальну співвідношення ціни та якості.

Головний офіцер з ШІ Meta Александр Ванг прямо відзначив: у індексі Artificial Analysis Gemini нічого не значить і може лише вдихати вихлопні гази моделей інших.

Google

Google

Muse Spark 1.3 показав результат вищий, ніж GPT-5.6 Sol, Grok 4.6 та Gemini 3.8 Flash, але наразі доступний лише в обмеженому попередньому огляді.

Хтось зазначив, що хоча графік тестування 3.8 Flash виглядає добре, на практиці це може бути не так.

Справді, Gemini 3.8 Flash перевершив GPT-5.6 Sol та Opus 5 у тестах Terminal-Bench 2.1, HLE тощо, але велика різниця в балах між TBench 2.1 та TBench 4 виявляє можливу присутність «розкрутки» рейтингів.

Іншими словами, коли стикаєшся з незнайомими, реальними Zero-shot викликами, які не включені до тренувального набору, 3.8 Flash, ймовірно, все ще поступається Opus 5 — цьому гігантському моделю з великою кількістю параметрів.

Але рішення від Google надзвичайно розумне — праця виправляє недоліки.

Як зазначено у офіційному блозі Google: «Ці покращення продуктивності є результатом ключових проектних рішень: 3.8 Flash працює інтенсивніше».

При вирішенні складних завдань 3.8 Flash розроблений так, щоб виконувати додаткові кроки міркування та постійно ітеративно викликати інструменти. Коли він зустрічає незрозуміле питання, він не відмовляється від спроб, а замість цього витрачає більше токенів, проводячи швидку внутрішню перевірку та рефлексію.

Навіть якщо він витрачає більше токенів через кілька циклів міркувань, через надзвичайно низьку базову ціну (0,75 долара за мільйон токенів), у підсумку він значно дешевший, ніж безпосереднє викликання GPT-5.6!

Ця стратегія прямо порушує минулу одновимірну конкуренцію «великі параметри = висока продуктивність».

Це доводить: у досконалому циклі агента швидкість і надзвичайно низькі витрати на висновування самі по собі є потужною інтелектуальністю.

Чому Flash? «Відмінена» версія Pro

Чи насправді Google цього разу не надіслав неправильний товар?

Gemini 3.5 Pro до цього моменту навіть не з’явився. Наступна зірка, Gemini 4, має дуже гарні дані для попереднього навчання, але етап післянавчання ще не завершено.

Google

Насправді, те, що Google так довго не випустив Pro-версію, має за собою сумну історію.

Pai Chai у травні цього року обіцяв, що «наступного місяця» запустить потужнішу серію Pro, але постійно відкладав.

Насправді, у Google спочатку було кілька кандидатів на модель 3.5 Pro, але їх усіх безжально «відхилили» — бо вони не були достатньо кращими за поточну сімейство Flash!

Тим часом, очікувана наступна флагманська модель Gemini 4, хоча й добре показала себе під час попереднього навчання, зараз застрягла у найважливішій фазі післянавчання.

В цілому, все випадково призвело до безумної ітерації серії Flash.

За 2 години виявлено вразливість, яку інші шукали місяцями: кібербезпека захопила топ

Чи цього разу Google просто знизив ціни на 3.8 Flash для звичайних завдань?

Багато більше.

Справжнім ключовим елементом цього запуску є його двійник — Gemini 3.8 Flash Cyber.

Навіть розробники вирикають: «Яка ж це безпекова задача варта того, щоб Google спеціально створив версію Cyber для Flash?»

Відповідь Google: щоб боротися з майбутніми AI-хакерами.

На базовому тесті CyberGym, де було виявлено вразливість, 3.8 Flash Cyber показав результат 86,2%, безпосередньо очоливши рейтинг, залишивши позаду всі попередні великі моделі.

Крім того, у реальному світі код пишуть не лише на C/C++.

У складному тестуванні кодової бази всередині Google, яка охоплює 20 мов програмування, ця модель досягла успішності понад 70% у виявленні широкого спектру вразливостей.

Ще більш захоплюючим є його реальні результати на практиці.

Команда безпеки Chrome використала її для тестування і виявила, що кількість правильних виправлень, які вона генерує, у 2,6 рази більша, ніж у попередньої найкращої комерційної моделі, яка була значно більшою за розміром.

Компанія Wiz виявила, що під час пентестів її показник повноти збільшився на 7,5–9,7%, а витрати зменшилися в 2,3–5,2 рази.

Найбільш здивувало те, що команда дослідників вразливостей Google Cloud використала її, щоб за дві години виявити критичну фундаментальну вразливість — тоді як раніше людським експертам-професіоналам для знаходження таких вразливостей зазвичай потрібно було кілька місяців!

У CWE-Bench (тест на здатність застосування патчів) перший показник успішності 3.8 Flash Cyber досяг 47,2%, що майже збігається з найкращими сучасними великими моделями (47,8%), але його вартість у порівнянні з ними — крапля в морі.

Google

Саме через надзвичайно велику здатність 3.8 Flash Cyber до кібератак та захисту, Google не вирішив повністю відкрити її код, а замість цього запустив нову ініціативу Fairwind, доступну лише для довірених організацій.

OpenAI, Anthropic та Google: велика модельна війна досягає переломного моменту

З випуском Gemini 3.8 Flash видно, що сьогоднішні три великі гравці в сфері ШІ вибрали три абсолютно різні шляхи еволюції.

Anthropic (сімейство Claude) зосереджений на «надійності та стабільності знань».

У тестах, спрямованих на охоплення знань та точність фактів (наприклад, AA-Omniscience), Claude залишається перевагою.

Сім перших місць зайнято моделями Claude, які зараз явно підсилюють здатність уникати помилок у корпоративних завданнях, прагнучи до стабільного виведення.

OpenAI (серія GPT) робить ставку на «глибоке міркування та озарення».

У тесті CritPt, спрямованому на фізичні та математичні обчислення, GPT-5.6 Sol демонструє стрімкий лідерський перевагу.

OpenAI схоже на прагнення до чистого інтелектуального виникнення, вимагаючи, щоб модель сама, без підказок, могла «думати» як вчений.

Google (серія Gemini) створює «нескінченний цикл надшвидких працівників».

На цей раз Google надав третю відповідь: можливо, я не можу одразу розв’язати найскладнішу фізичну задачу, але я дуже швидко реагую і з мінімальними витратами.

У епоху агента я можу думати 100 разів за секунду: писати код, запускати, отримувати помилки, виправляти — за допомогою жорсткої ітерації з надзвичайно низькими витратами, щоб наполегливо досягти правильного результату.

Agen стикається з труднощами в реальному світі, що вимагає багаторазових спроб, використання інструментів та динамічного регулювання.

А Gemini 3.8 Flash просто створений саме для таких «довгострокових робочих процесів».

У Google Antigravity можна за допомогою лише одного підказки та циклічної команди змусити 3.8 Flash автоматично згенерувати повну гру з головоломками, текстурами оточення та 3D-рівнями.

Ви можете використовувати його для одноклікового створення версії Google Maps у стилі DOS з панорамними видами та навігацією.

Звичайно, зручність і вартість Gemini 3.8 Flash уже подолали певну точку невідворотності.

З’явлення Gemini 3.8 Flash схоже на те, як Google оголошує всій галузі: великі моделі виходять за межі «доступні лише для великих компаній» і швидко рухаються до демократизації обчислювальних ресурсів.

Ті завдання агентів, які раніше вимагали витрат десятків тисяч доларів і кілька днів і нічей, зараз можна виконати за кілька хвилин за ціну кількох чашок кави.

Епоха суперіндивідуумів для звичайних людей справді настала.

Це момент пробудження малих моделей.

Джерела:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Редагування: Aeneas Девід

Цей матеріал з іншого веб-сайту «XinZhiYuan», автор: ASI Apokalypsy

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.