За минулий тиждень Qwen3.8-Max-Preview та Kimi K3 були представлені один за іншим, піднявши масштаб параметрів китайських великих моделей до 2 трильйонів і більше.
Проте боротьба великих моделей давно минула етап, коли оцінювали лише показники Benchmarks та кількість параметрів. Найкращим критерієм для вимірювання здатності базової моделі є її здатність реальний інтегруватися в повсякденні робочі процеси.
Щодо цього, Biteye сьогодні вирішив перевірити, хто є ким — вивести на перевірку.
Те саме запитання: «Зробіть веб-гру у стилі Biteye про літаки-бомбардувальники за допомогою одного речення» — три моделі: Qwen3.8, Kimi K3 та gpt5.6 sol, подали зовсім різні відповіді:
- Qwen3.8: може діяти, але лише в межах можливості діяти
- GPT-5.6 Sol: Виглядає добре, як офіційний сайт бренду
- Kimi K3: найбільше фішок, найбільше гейміфікації
⚠️ Відмітка: через обмеження обчислювальної потужності Kimi K3 більше не доступний для підписки, цей тест був виконаний за допомогою WorkBuddy.
Qwen3.8: Літак піднявся в повітря, а потім нічого не сталося | Оцінка: 1 зірка
https://x.com/i/status/2079865420576927996
Відкрити версію Qwen3.8, перше враження: ти що, жартуєш?
Глибокий синій тло, по центру — логотип, який не є нативним для Biteye, та кнопка «Почати гру». Чорний текст у заголовку зливається з темним тлом, наче вже активував режим невидимості.
Після входу в гру базові функції варто вважати задовільними:
- Перетягування літака мишею
- Автоматичний випуск куль
- Червоний трикутний ворожий літак
- Оцінка за балами
- Зіткнення та механізм завершення
У ході тестування літаки могли безперервно стріляти, а рейтинг збільшився до 858, Qwen3.8 принаймні працює.
Проблема в тому, що вся гра схожа на лише що зібрану Canvas-демо: ворожі літаки — це трикутники, кулі — це світлові точки, геймплей майже не змінився. Немає жодного розвитку зброї, жодної системи предметів і немає чіткого ритму рівнів.
Як самі представники команди Qwen оголосили, післятренування Qwen3.8 ще не завершено і перебуває на “ітераціях щодня”.
Звісно, художники та сценаристи ще не увійшли до чату.
GPT-5.6 Sol: Дизайн добрий, геймплей треба покращити | Оцінка: 3.5 зірки
https://x.com/i/status/2079865420576927996
🔗:Спробуйте GPT-5.6 Sol версію
Відкрийте GPT-5.6 Sol, і атмосфера одразу піднімається.
Зліва — чіткі завдання, посередині — бойова зона, справа — візуалізований радар і телеметричні модулі. Темний фон з флуоресцентною ціановою кольоровою гамою, поєднаний зі змішаною англійською та китайською мовами та елементами бренду Biteye, створюють візуальний ефект інструментальної панелі агента 007.
Її система також значно багатша, ніж у Qwen, наприклад:
- Wave波次
- Armor
- Стан Overdrive
- Комбо-удар
- Найвищий рекорд
- Функція призупинення
- Використання миші та клавіатури одночасно
У ході тестування гра успішно запустилася й отримала 922 бали. Після поразки не з’являється просте повідомлення «Game Over», а замість цього відображається «Літак офлайн», а для початку знову використовується термін «Перепідключення». Від початку до підсумків текст і візуальне оформлення підтримують єдиний світ, що досить fancy.
Проте проблема GPT-5.6 Sol у тому, що вона надто добре упакована. Інформаційні панелі з обох боків займають велику кількість простору, а справжня ігрова зона виявилася зажатою посередині. Вона більше схожа на високоякісну сторінку бренду, в яку випадково вбудовано невелику гру.
Порівняно з Qwen3.8, художники, брендинг і операційна команда gpt-5.6 sol вже на місці, але планувальники гри, схоже, трохи відгульнили.
Kimi K3: Коли інші роблять демо, він починає додавати точки для платних функцій | Оцінка: 4 зірки
https://x.com/i/status/2079865420576927996
Хоча перший екран Kimi K3 не так вражає, як GPT-5.6 Sol, але з’являється опис гри — і все виглядає інакше:
- W: Підсилення вогню
- S: StarShield
- B: бомба
- H: Виправлено
- Пробіл: викинути бомбу
- P: Призупинено
- M: Вимкнути звук
Після входу в гру ви отримуєте три життя, рівень вогневої потужності, кількість бомб, кнопку паузи та перемикач звуку.
Два інших варіанти ще повільно вирішують, як рухатися літаком, а Kimi K3 вже думає, як гравцям грати після отримання предметів.
Це найбільш очевидна різниця між трьома версіями: Qwen реалізував функцію стрільби, Sol створив візуальне оформлення, а Kimi активно додав предмети, ресурси, розвиток та активні навички.
Звичайно, його графіка все ще не дуже деталізована. Ворожі літаки та ефекти в основному є простими геометричними фігурами, а деякі логотипи накладені досить прямо. Але як гра, вона найкраще розуміє, як постійно надавати гравцям щось нове.
Три моделі, у які відділи їх прийняти?
Якщо уявити три моделі як нових співробітників, цей тест буде приблизно таким:
Генерація ігор одним реченням — це вже не просто код.
Наприклад, з тестом «Рейдер» від Biteye, зараз не складно за допомогою великої моделі написати код для веб-сайту, де «літак рухається, а кулі вистрілюються».
Але справжнім розривом є те, чи буде модель після попереднього навчання логіки активно розробляти зворотний зв’язок, рівні, предмети, прогресію та візуальну тематику. Великі моделі повинні не лише розуміти код, а й справді розуміти, чому гравці хочуть зіграти ще один раунд.
