Tether відкриває код 460-мільйонного візуального моделі для штучного інтелекту на пристрої

iconBitcoin.com
Поділитися
AI summary iconКороткий зміст
Tether Data відкрила код 460-мільйонного візуально-мовного моделі для аналізу ланцюга, що дозволяє штучний інтелект на пристрої. Модель, запущена QVAC 29 липня 2026 року, перевершила конкурентів у 16 з 17 тестів і включає мобільну оптимізовану версію Flash. Вона підтримує аналіз документів та OCR і доступна за ліцензією Apache 2.0 для комерційного використання.

Tether Data відкрила код 460-мільйонного візуально-мовного моделі, створеної для безпосереднього запуску на смартфонах замість залежності від хмарних серверів.

Основні висновки

  • Tether’s QVAC unit відкрила код 460-мільйонного візуального моделі 29 липня 2026 року.
  • Модель перевершила конкурентів Liquid AI та Hugging Face у 16 з 17 тестів на еталонних даних.
  • Його версія Flash працювала до 36 разів швидше, ніж SmolVLM2-500M на iPhone 15.

Випущено в середу підрозділом з досліджень штучного інтелекту компанії, QVAC, VisionPsy-Nano може аналізувати зображення, документи та діаграми, а потім відповідати на запитання, не надсилаючи вихідні дані на віддалену систему. Телефон обробляє як вхідні дані, так і відповідь, що дозволяє програмному забезпеченню працювати автономно та зберігати дані на пристрої.

QVAC стверджує, що модель Tether AI Research показала найвищий загальний бал серед візуально-мовних систем з менше ніж 500 мільйонами параметрів. На 17 тестах вона перевершила конкуруючі моделі на 16.

Як це порівнюється

Модель показала нормалізовану оцінку 62,3, порівняно з 59,6 у Liquid AI’s LFM2.5-VL-450M та 52,5 у SmolVLM2-500M від Hugging Face. Попередня базова модель QVAC nanoVLM-460M-8k отримала оцінку 54,9.

Випуск Tether Data має дві версії. Стандартна версія пріоритетно забезпечує точність, тоді як Flash жертує невеликою кількістю якості для швидших відповідей. QVAC стверджує, що Flash зберігає приблизно 99% продуктивності повної моделі, при цьому генеруючи перший вихід до 23 разів швидше, ніж SmolVLM2-500M на телефонах Android, і до 36 разів швидше на iPhone 15.

Час відповіді має значення на мобільному обладнанні. Компактна модель може добре показати себе у тестах, але все ще здаватися непрактичною, якщо користувачам доведеться чекати, поки пристрій обробляє зображення. Flash розроблений для зменшення цієї початкової затримки.

Система штучного інтелекту (AI) також підтримує аналіз документів та оптичне розпізнавання символів, витягуючи текст і структуру з фінансових звітів, діаграм і інфографік.

QVAC стверджує, що модель перевершила схожі за розміром конкуренти в середньому на 7,4% у тестах візуального міркування. Вона також показала кращі результати, ніж моделі, більш ніж у два рази більші за розмір, на MM-IFEval і POPE, включаючи релізи від Qwen та InternVL.

Чому важлива мала відбиток

Перенесення обробки зображень із центру обробки даних на телефон вводить суворі обмеження щодо пам’яті, тепла, використання батареї та обчислювальної потужності. Компактні моделі часто добре справляються з простим текстом, але втрачають точність при читанні щільних діаграм, таблиць або сканованих документів.

Результати еталонного тестування QVAC свідчать, що модель зберегла значну частину цієї здатності, залишаючись достатньо компактною для споживчих пристроїв. Локальна обробка також означає, що документи не потрібно завантажувати, а програмне забезпечення може продовжувати роботу без підключення до мережі.

Створено для кількох варіантів розгортання

Розробники можуть отримати доступ до моделі через Hugging Face Transformers, квантовану версію GGUF для llama.cpp або vLLM backend для використання на серверах з високим навантаженням.

QVAC також опублікувала свої еталонні конфігурації через VLMEvalKit, що дозволяє зовнішнім дослідникам повторити тести. Обидві версії використовують ліцензію Apache 2.0, що дозволяє комерційне використання, модифікацію та перерозподіл.

Частина ширшої стратегії Tether у сфері ШІ

Генеральний директор Tether Паоло Ардойно сказав, що випуск підтримує зусилля компанії щодо створення локальних, ефективних систем ШІ.

«Досягнення найкращої якості та продуктивності у загальних завданнях комп’ютерного зору лише з 460 мільйонами параметрів доводить, що шлях, заснований на локальній, високоефективній ШІ, є життєздатним», — сказав Ардіно.

Модель відповідає кількома випусками QVAC, що датуються жовтнем 2025 року, включаючи синтетичні навчальні набори даних, крос-платформний набір інструментів розробки програмного забезпечення та медичні моделі, розроблені для телефонів і носимих пристроїв.

Для розробників цей реліз пропонує аналіз зображень автономно, без витрат на API, залежних від використання. Бізнес може зберігати конфіденційні документи на пристрої, а користувачі можуть використовувати функції ШІ без сигналу. Дослідники можуть незалежно перевіряти твердження компанії щодо продуктивності за допомогою опублікованих конфігурацій.

Tether фінансував своє розширення в галузі ШІ за рахунок прибутків від бізнесу стейблкоїна USDT. Він також інвестував у інфраструктуру ШІ, біотехнології та робототехніку, включаючи інвестицію серії C у NEURA Robotics на суму до 1,4 млрд доларів США.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.