Tether Data открыла исходный код модели визуально-языковой сети с 460 миллионами параметров, предназначенной для работы непосредственно на смартфонах, а не на облачных серверах.
Основные выводы
- Единица QVAC Tether открыла исходный код компьютерного зрения с 460 миллионами параметров 29 июля 2026 года.
- Модель превзошла конкурентов Liquid AI и Hugging Face в 16 из 17 тестов на оценку.
- Его Flash-версия работала до 36 раз быстрее, чем SmolVLM2-500M на iPhone 15.
Выпущено в среду исследовательским подразделением компании по искусственному интеллекту, QVAC, VisionPsy-Nano может анализировать изображения, документы и графики, а затем отвечать на вопросы, не отправляя исходные материалы на удалённую систему. Телефон обрабатывает как ввод, так и ответ, позволяя программному обеспечению работать оффлайн и хранить данные на устройстве.
QVAC сообщает, что модель Tether AI Research показала наивысший общий балл среди систем визуально-языкового взаимодействия с менее чем 500 миллионами параметров. На 17 тестах она превзошла конкурирующие модели на 16 из них.
Как это сравнивается
Модель показала нормализованный результат 62,3, в сравнении с 59,6 у LFM2.5-VL-450M от Liquid AI и 52,5 у SmolVLM2-500M от Hugging Face. Ранняя базовая модель nanoVLM-460M-8k от QVAC набрала 54,9.
Выпуск Tether Data доступен в двух версиях. Стандартная сборка ориентирована на точность, а Flash жертвует небольшим количеством качества ради более быстрых ответов. QVAC утверждает, что Flash сохраняет около 99% производительности полной модели, при этом первые результаты появляются до 23 раз быстрее, чем у SmolVLM2-500M на телефонах Android, и до 36 раз быстрее на iPhone 15.
Время отклика имеет значение на мобильном оборудовании. Компактная модель может хорошо показывать результаты в тестах, но всё равно казаться неудобной, если пользователям приходится ждать, пока устройство обрабатывает изображение. Flash разработан для сокращения этой начальной задержки.
Система искусственного интеллекта (ИИ) также поддерживает анализ документов и распознавание оптических символов, извлекая текст и структуру из финансовых отчетов, блок-схем и инфографики.
QVAC утверждает, что модель превзошла аналогичные по размеру конкуренты в среднем на 7,4% на тестах визуального рассуждения. Она также показала лучшие результаты, чем модели более чем в два раза больше по размеру, на MM-IFEval и POPE, включая релизы от Qwen и InternVL.
Почему малый размер имеет значение
Перенос обработки изображений из центра обработки данных на телефон вводит строгие ограничения по памяти, теплу, расходу батареи и вычислительной мощности. Компактные модели обычно справляются с обычным текстом, но теряют точность при чтении плотных диаграмм, таблиц или отсканированных документов.
Результаты тестирования QVAC показывают, что модель сохранила большую часть этих возможностей, оставаясь достаточно компактной для потребительских устройств. Локальная обработка также означает, что документы не нужно загружать, и программное обеспечение может продолжать работать без подключения к сети.
Создано для нескольких вариантов развертывания
Разработчики могут получить доступ к модели через Hugging Face Transformers, квантованную версию GGUF для llama.cpp или vLLM-бэкенд для использования на серверах с высокой нагрузкой.
QVAC также опубликовала свои эталонные конфигурации через VLMEvalKit, что позволяет внешним исследователям повторить тесты. Обе версии используют лицензию Apache 2.0, разрешающую коммерческое использование, модификацию и распространение.
Часть более широкой стратегии Tether в области ИИ
Генеральный директор Tether Паоло Ардойно заявил, что выпуск поддерживает стремление компании к локальным и эффективным ИИ-системам.
«Достижение наилучшего качества и производительности в общих задачах компьютерного зрения всего при 460 миллионах параметров доказывает, что подход, основанный на локальном и высокоэффективном ИИ, является жизнеспособным», — сказал Ардуино.
Модель следует за несколькими выпусками QVAC, начиная с октября 2025 года, включая синтетические обучающие наборы данных, кроссплатформенный набор инструментов разработки программного обеспечения и медицинские модели, предназначенные для телефонов и носимых устройств.
Для разработчиков выпуск предоставляет анализ изображений в автономном режиме без платы за использование API. Бизнесы могут хранить конфиденциальные документы на устройстве, а потребители могут использовать функции ИИ без сигнала. Исследователи могут независимо проверять заявления компании о производительности с использованием опубликованных конфигураций.
Tether профинансировал своё расширение в области ИИ за счёт прибыли от бизнеса своего стейблкоина USDT. Он также инвестировал в инфраструктуру ИИ, биотехнологии и робототехнику, включая инвестиции серии C в NEURA Robotics объёмом до 1,4 млрд долларов.

