Tether Data a open-sourcé un modèle vision-langage de 460 millions de paramètres conçu pour fonctionner directement sur les smartphones, sans dépendre des serveurs cloud.
Points clés
- L'unité QVAC de Tether a open-sourcé un modèle de vision de 460 millions de paramètres le 29 juillet 2026.
- Le modèle a surpassé les concurrents Liquid AI et Hugging Face dans 16 des 17 tests de référence.
- Sa version Flash a atteint jusqu'à 36 fois plus rapidement que SmolVLM2-500M sur un iPhone 15.
Publié mercredi par la branche recherche en IA de l'entreprise, QVAC, VisionPsy-Nano peut examiner des images, des documents et des graphiques, puis répondre à des questions sans envoyer le matériel source à un système distant. Le téléphone gère à la fois l'entrée et la réponse, permettant au logiciel de fonctionner hors ligne et de conserver les données sur l'appareil.
QVAC affirme que le modèle de Tether AI Research a obtenu le meilleur score global parmi les systèmes vision-langage comportant moins de 500 millions de paramètres. Sur 17 benchmarks, il a surpassé les modèles concurrents sur 16.
Comment cela se compare
Le modèle a obtenu un score normalisé de 62,3, contre 59,6 pour le LFM2.5-VL-450M de Liquid AI et 52,5 pour le SmolVLM2-500M de Hugging Face. Le modèle de base nanoVLM-460M-8k de QVAC avait obtenu un score de 54,9.
The Tether Data est disponible en deux versions. La version standard privilégie la précision, tandis que Flash sacrifie un faible montant de qualité pour des réponses plus rapides. QVAC affirme que Flash conserve environ 99 % des performances du modèle complet tout en produisant sa première sortie jusqu’à 23 fois plus rapidement que SmolVLM2-500M sur les téléphones Android et jusqu’à 36 fois plus rapidement sur un iPhone 15.
Ce temps de réponse est important sur le matériel mobile. Un modèle compact peut bien performer lors des tests, mais rester impraticable si les utilisateurs doivent attendre pendant que l'appareil traite une image. Flash est conçu pour réduire ce délai initial.
Le système d'intelligence artificielle (IA) prend également en charge l'analyse de documents et la reconnaissance optique de caractères, extrayant le texte et la structure des rapports financiers, des organigrammes et des infographies.
QVAC affirme que le modèle a surpassé les concurrents de taille similaire en moyenne de 7,4 % sur les tests de raisonnement visuel. Il a également surpassé des modèles plus de deux fois plus volumineux sur MM-IFEval et POPE, y compris les versions de Qwen et InternVL.
Pourquoi la petite empreinte compte
Déplacer le traitement d’images d’un centre de données vers un téléphone introduit des limites strictes en matière de mémoire, de chaleur, de consommation de batterie et de puissance de calcul. Les modèles compacts gèrent souvent le texte simple, mais perdent en précision lorsqu’ils lisent des graphiques, tableaux ou documents numérisés denses.
Les résultats de référence de QVAC suggèrent que le modèle a conservé une grande partie de cette capacité tout en restant suffisamment léger pour les appareils grand public. Le traitement local signifie également que les documents n'ont pas besoin d'être téléchargés, et que le logiciel peut continuer à fonctionner sans connexion réseau.
Conçu pour plusieurs options de déploiement
Les développeurs peuvent accéder au modèle via Hugging Face Transformers, une version quantifiée GGUF pour llama.cpp ou un backend vLLM pour une utilisation serveur à plus fort volume.
QVAC a également publié ses configurations de référence via VLMEvalKit, permettant à des chercheurs externes de répéter les tests. Les deux versions utilisent la licence Apache 2.0, autorisant l'utilisation commerciale, la modification et la redistribution.
Partie de la stratégie IA plus large de Tether
Tether CEO Paolo Ardoino a déclaré que cette publication soutient l'engagement de l'entreprise en faveur de systèmes d'IA locaux et efficaces.
« Atteindre une qualité et une performance de premier plan sur les tâches de vision générale avec seulement 460 millions de paramètres prouve que l’IA locale et hautement efficace est une voie viable », a déclaré Ardoino.
Le modèle suit plusieurs versions QVAC datant d'octobre 2025, notamment des jeux de données d'entraînement synthétiques, un kit de développement logiciel multiplateforme et des modèles médicaux conçus pour les téléphones et les appareils portables.
Pour les développeurs, cette version offre une analyse d'images hors ligne sans coûts d'API basés sur l'utilisation. Les entreprises peuvent conserver des documents sensibles sur l'appareil, tandis que les consommateurs peuvent utiliser les fonctionnalités IA sans connexion. Les chercheurs peuvent tester indépendamment les affirmations de performance de l'entreprise en utilisant les configurations publiées.
Tether a financé son expansion dans l'IA avec les bénéfices de son activité de stablecoin USDT. Elle a également investi dans des infrastructures d'IA, la biotechnologie et la robotique, notamment un investissement de série C dans NEURA Robotics évalué jusqu'à 1,4 milliard de dollars.

