Tether Data ha abierto el código de un modelo de visión-lenguaje de 460 millones de parámetros diseñado para ejecutarse directamente en smartphones en lugar de depender de servidores en la nube.
Principales conclusiones
- La unidad QVAC de Tether lanzó en código abierto un modelo de visión de 460 millones de parámetros el 29 de julio de 2026.
- El modelo superó a los rivales Liquid AI y Hugging Face en 16 de 17 pruebas de referencia.
- Su versión Flash funcionó hasta 36 veces más rápido que SmolVLM2-500M en un iPhone 15.
Lanzado el miércoles por la rama de investigación de IA de la empresa, QVAC, VisionPsy-Nano puede examinar imágenes, documentos y gráficos, y luego responder preguntas sin enviar el material de origen a un sistema remoto. El teléfono maneja tanto la entrada como la respuesta, permitiendo que el software funcione sin conexión y mantenga los datos en el dispositivo.
QVAC afirma que el modelo de Tether AI Research obtuvo la puntuación general más alta entre los sistemas de visión-lenguaje con menos de 500 millones de parámetros. En 17 benchmarks, superó a los modelos competidores en 16.
Cómo se compara
El modelo obtuvo una puntuación normalizada de 62,3, en comparación con 59,6 para el LFM2.5-VL-450M de Liquid AI y 52,5 para el SmolVLM2-500M de Hugging Face. El modelo base anterior nanoVLM-460M-8k de QVAC obtuvo una puntuación de 54,9.
La liberación de Tether Data viene en dos versiones. La compilación estándar prioriza la precisión, mientras que Flash sacrifica una pequeña cantidad de calidad para obtener respuestas más rápidas. QVAC dice que Flash conserva aproximadamente el 99% del rendimiento del modelo completo, produciendo su primera salida hasta 23 veces más rápido que SmolVLM2-500M en teléfonos Android y hasta 36 veces más rápido en un iPhone 15.
Ese tiempo de respuesta es importante en el hardware móvil. Un modelo compacto puede obtener buenos resultados en las pruebas, pero aún así resultar poco práctico si los usuarios deben esperar mientras el dispositivo procesa una imagen. Flash está diseñado para reducir ese retraso inicial.
El sistema de inteligencia artificial (IA) también admite el análisis de documentos y el reconocimiento óptico de caracteres, extrayendo texto y estructura de informes financieros, diagramas de flujo e infografías.
QVAC afirma que el modelo superó a sus competidores de tamaño similar en un promedio del 7,4% en pruebas de razonamiento visual. También superó a modelos más del doble de su tamaño en MM-IFEval y POPE, incluyendo lanzamientos de Qwen e InternVL.
Por qué importa el pequeño tamaño
Mover el procesamiento de imágenes desde un centro de datos a un teléfono introduce límites estrictos en memoria, calor, consumo de batería y potencia de cómputo. Los modelos compactos suelen manejar texto plano, pero pierden precisión al leer gráficos densos, tablas o documentos escaneados.
Los resultados de referencia de QVAC sugieren que el modelo conservó gran parte de esa capacidad mientras permanece lo suficientemente pequeño para dispositivos de consumo. El procesamiento local también significa que los documentos no necesitan cargarse, y el software puede seguir funcionando sin conexión a la red.
Diseñado para varias opciones de implementación
Los desarrolladores pueden acceder al modelo a través de Hugging Face Transformers, una versión cuantizada GGUF para llama.cpp o un backend vLLM para uso en servidores con mayor volumen.
QVAC también publicó sus configuraciones de referencia a través de VLMEvalKit, permitiendo a investigadores externos repetir las pruebas. Ambas versiones utilizan la licencia Apache 2.0, que permite el uso comercial, la modificación y la redistribución.
Parte de la estrategia general de IA de Tether
Tether CEO Paolo Ardoino dijo que el lanzamiento respalda el impulso de la empresa hacia sistemas de IA locales y eficientes.
“Lograr la mejor calidad y rendimiento en tareas de visión general con solo 460 millones de parámetros demuestra que la inteligencia artificial primero local y altamente eficiente es un camino viable,” dijo Ardoino.
El modelo sigue varios lanzamientos de QVAC desde octubre de 2025, incluyendo conjuntos de datos de entrenamiento sintéticos, un kit de desarrollo de software multiplataforma y modelos médicos diseñados para teléfonos y dispositivos portátiles.
Para desarrolladores, la versión ofrece análisis de imágenes sin conexión sin costos de API basados en el uso. Las empresas pueden mantener documentos sensibles en el dispositivo, mientras que los consumidores pueden usar funciones de IA sin señal. Los investigadores pueden probar independientemente las afirmaciones de rendimiento de la empresa utilizando las configuraciones publicadas.
Tether ha financiado su expansión en IA con las ganancias de su negocio de la stablecoin USDT. También ha invertido en infraestructura de IA, biotecnología y robótica, incluyendo una inversión de la Serie C en NEURA Robotics valorada en hasta $1.4 mil millones.

