Dữ liệu Tether đã mở nguồn một mô hình thị giác-ngôn ngữ với 460 triệu tham số, được xây dựng để chạy trực tiếp trên điện thoại thông minh thay vì phụ thuộc vào máy chủ đám mây.
Những điểm chính
- Đơn vị QVAC của Tether đã mở nguồn một mô hình thị giác 460 triệu tham số vào ngày 29 tháng 7 năm 2026.
- Mô hình đã vượt trội hơn các đối thủ Liquid AI và Hugging Face trong 16 trên 17 bài kiểm tra chuẩn.
- Bản Flash của nó chạy nhanh gấp 36 lần so với SmolVLM2-500M trên iPhone 15.
Được công bố vào thứ Tư bởi bộ phận nghiên cứu AI của công ty, QVAC, VisionPsy-Nano có thể phân tích hình ảnh, tài liệu và biểu đồ, sau đó trả lời các câu hỏi mà không cần gửi tài liệu nguồn đến hệ thống từ xa. Điện thoại xử lý cả đầu vào và phản hồi, cho phép phần mềm hoạt động ngoại tuyến và giữ dữ liệu trên thiết bị.
QVAC cho biết mô hình của Tether AI Research đạt điểm tổng thể cao nhất trong số các hệ thống thị giác-ngôn ngữ có ít hơn 500 triệu tham số. Trên 17 bộ kiểm tra, nó đã vượt các mô hình đối thủ trên 16 bộ.
Nó so sánh như thế nào
Mô hình này đạt điểm chuẩn hóa 62,3, so với 59,6 của LFM2.5-VL-450M do Liquid AI phát triển và 52,5 của SmolVLM2-500M do Hugging Face phát triển. Mô hình nền nanoVLM-460M-8k trước đó của QVAC đạt điểm 54,9.
Dữ liệu Tether được phát hành dưới hai phiên bản. Phiên bản tiêu chuẩn ưu tiên độ chính xác, trong khi Flash hy sinh một lượng nhỏ chất lượng để có phản hồi nhanh hơn. QVAC cho biết Flash duy trì khoảng 99% hiệu suất của mô hình đầy đủ, đồng thời tạo ra đầu ra đầu tiên nhanh hơn tới 23 lần so với SmolVLM2-500M trên điện thoại Android và nhanh hơn tới 36 lần trên iPhone 15.
Thời gian phản hồi đó rất quan trọng trên phần cứng di động. Một mô hình nhỏ gọn có thể đạt điểm cao trong kiểm tra nhưng vẫn cảm thấy không thực tế nếu người dùng phải chờ trong khi thiết bị xử lý hình ảnh. Flash được thiết kế để giảm độ trễ ban đầu đó.
Hệ thống trí tuệ nhân tạo (AI) cũng hỗ trợ phân tích tài liệu và nhận dạng ký tự quang học, trích xuất văn bản và cấu trúc từ các báo cáo tài chính, sơ đồ luồng và infographic.
QVAC cho biết mô hình đã vượt trội hơn các đối thủ có kích thước tương đương trung bình 7,4% trên các bài kiểm tra suy luận hình ảnh. Nó cũng vượt mặt các mô hình lớn hơn gấp đôi kích thước của nó trên MM-IFEval và POPE, bao gồm các phiên bản từ Qwen và InternVL.
Tại sao kích thước nhỏ lại quan trọng
Việc chuyển xử lý hình ảnh từ trung tâm dữ liệu sang điện thoại gây ra những giới hạn nghiêm ngặt về bộ nhớ, nhiệt độ, mức tiêu thụ pin và sức mạnh tính toán. Các mô hình nhỏ gọn thường xử lý tốt văn bản thuần túy nhưng giảm độ chính xác khi đọc các biểu đồ, bảng hoặc tài liệu quét dày đặc.
Kết quả chuẩn của QVAC cho thấy mô hình đã duy trì phần lớn khả năng đó trong khi vẫn đủ nhỏ để sử dụng trên các thiết bị tiêu dùng. Xử lý tại chỗ cũng có nghĩa là tài liệu không cần được tải lên, và phần mềm có thể tiếp tục hoạt động mà không cần kết nối mạng.
Được thiết kế cho nhiều tùy chọn triển khai
Các nhà phát triển có thể truy cập mô hình thông qua Hugging Face Transformers, phiên bản GGUF đã lượng tử hóa cho llama.cpp hoặc backend vLLM để sử dụng trên máy chủ với khối lượng lớn hơn.
QVAC cũng đã công bố các cấu hình chuẩn của mình thông qua VLMEvalKit, cho phép các nhà nghiên cứu bên ngoài lặp lại các bài kiểm tra. Cả hai phiên bản đều sử dụng giấy phép Apache 2.0, cho phép sử dụng thương mại, chỉnh sửa và phân phối lại.
Một phần trong chiến lược AI rộng hơn của Tether
CEO của Tether, Paolo Ardoino cho biết việc phát hành này hỗ trợ nỗ lực của công ty hướng tới các hệ thống AI địa phương, hiệu quả.
“Việc đạt được chất lượng và hiệu suất hàng đầu trong các nhiệm vụ thị giác chung với chỉ 460 triệu tham số chứng minh rằng AI ưu tiên cục bộ, hiệu quả cao là một con đường khả thi,” Ardoino nói.
Mô hình tuân theo một số bản phát hành QVAC kể từ tháng 10 năm 2025, bao gồm các bộ dữ liệu huấn luyện tổng hợp, bộ công cụ phát triển phần mềm đa nền tảng và các mô hình y tế được thiết kế dành cho điện thoại và thiết bị đeo.
Đối với các nhà phát triển, bản phát hành này cung cấp phân tích hình ảnh ngoại tuyến mà không tốn chi phí API theo mức sử dụng. Các doanh nghiệp có thể giữ các tài liệu nhạy cảm trên thiết bị, trong khi người dùng tiêu dùng có thể sử dụng các tính năng AI mà không cần tín hiệu. Các nhà nghiên cứu có thể tự mình kiểm tra các tuyên bố về hiệu suất của công ty bằng cách sử dụng các cấu hình đã công bố.
Tether đã tài trợ cho sự mở rộng AI bằng lợi nhuận từ hoạt động stablecoin USDT. Nó cũng đã đầu tư vào cơ sở hạ tầng AI, công nghệ sinh học và robot, bao gồm khoản đầu tư Series C vào NEURA Robotics có giá trị lên tới 1,4 tỷ USD.

