تيرفر تُطلق مفتوحة المصدر نموذج رؤية بحجم 460 مليون معلمة للذكاء الاصطناعي على الجهاز

iconBitcoin.com
مشاركة
AI summary iconملخص
أصدرت Tether Data نموذجًا بصريًا-لغويًا بحجم 460 مليون معلمة مفتوح المصدر لتحليل السلسلة، مما يمكّن الذكاء الاصطناعي على الجهاز. تم إطلاق النموذج من قبل QVAC في 29 يوليو 2026، وتفوق على المنافسين في 16 من أصل 17 معيارًا، ويتضمن نسخة مُحسّنة للجوّال تُسمى Flash. كما يدعم تحليل المستندات وتحويل النصوص الممسوحة ضوئيًا، وهو متاح بموجب ترخيص Apache 2.0 للاستخدام التجاري.

لقد فتحت Tether Data مصدر نموذج مرئي-لغوي بحجم 460 مليون معلمة مصمم للعمل مباشرة على الهواتف الذكية بدلاً من الاعتماد على خوادم السحابة.

النقاط الرئيسية

  • فتحت وحدة QVAC الخاصة بـ Tether نموذجًا بصريًا بحجم 460 مليون معلمة في 29 يوليو 2026.
  • تفوق النموذج على منافسي Liquid AI وHugging Face في 16 من أصل 17 اختبارًا مرجعيًا.
  • عملت نسخته السريعة حتى 36 مرة أسرع من SmolVLM2-500M على iPhone 15.

أُصدرت الأربعاء من قبل ذراع البحث بالذكاء الاصطناعي للشركة، QVAC، يمكن لـ VisionPsy-Nano تحليل الصور والمستندات والرسوم البيانية، ثم الإجابة على الأسئلة دون إرسال المواد المصدر إلى نظام بعيد. الهاتف يعالج كل من المدخلات والردود، مما يسمح للبرنامج بالعمل دون اتصال بالإنترنت والحفاظ على البيانات على الجهاز.

تقول QVAC إن نموذج Tether AI Research سجّل أعلى درجة إجمالية بين أنظمة الرؤية-اللغة التي يقل عدد معلماتها عن 500 مليون معلمة. وفي 17 معيارًا، تفوق على النماذج المنافسة في 16 منها.

كيف تقارن

نشر النموذج درجة معيارية قدرها 62.3، مقارنة بـ 59.6 لنموذج LFM2.5-VL-450M من Liquid AI و52.5 لنموذج SmolVLM2-500M من Hugging Face. حصل النموذج الأساسي nanoVLM-460M-8k الأسبق من QVAC على درجة 54.9.

إطلاق بيانات Tether يأتي في نسختين. تُفضل النسخة القياسية الدقة، بينما تضحّي نسخة Flash بكمية صغيرة من الجودة للحصول على استجابات أسرع. تقول QVAC إن Flash تحتفظ بحوالي 99% من أداء النموذج الكامل، بينما تُنتج أول مخرجات لها أسرع بـ 23 مرة من SmolVLM2-500M على هواتف Android وأسرع بـ 36 مرة على iPhone 15.

وقت الاستجابة هذا مهم على الأجهزة المحمولة. يمكن أن يحقق نموذج مضغوط درجة جيدة في الاختبارات، لكنه لا يزال يبدو غير عملي إذا كان على المستخدمين الانتظار أثناء معالجة الجهاز للصورة. تم تصميم Flash لتقليل هذه المهلة الأولية.

نظام الذكاء الاصطناعي (AI) يدعم أيضًا تحليل المستندات والتعرف الضوئي على الحروف، واستخراج النص والهيكل من التقارير المالية والمخططات الانسيابية والمخططات التوضيحية.

تقول QVAC إن النموذج تفوق على المنافسين من نفس الحجم بمتوسط 7.4% في اختبارات الاستدلال البصري. كما تفوق على نماذج أكبر من ضعفي حجمه في MM-IFEval وPOPE، بما في ذلك الإصدارات من Qwen وInternVL.

لماذا يهم الحجم الصغير

نقل معالجة الصور من مركز بيانات إلى هاتف يفرض قيودًا صارمة على الذاكرة والحرارة واستخدام البطارية وقوة الحوسبة. غالبًا ما تتعامل النماذج المدمجة مع النصوص العادية لكنها تفقد الدقة عند قراءة المخططات الكثيفة أو الجداول أو المستندات الممسوحة ضوئيًا.

تشير نتائج معيار QVAC إلى أن النموذج حافظ على جزء كبير من هذه القدرة مع بقائه صغيرًا بما يكفي للأجهزة الاستهلاكية. كما أن المعالجة المحلية تعني أن الوثائق لا تحتاج إلى رفعها، ويمكن للبرنامج الاستمرار في العمل دون اتصال بالشبكة.

مصمم لعدة خيارات النشر

يمكن للمطورين الوصول إلى النموذج من خلال Hugging Face Transformers، أو إصدار GGUF المُكمَّل لـ llama.cpp، أو خلفية vLLM للاستخدام على الخوادم ذات الحجم الأكبر.

نشرت QVAC أيضًا تكوينات المرجع الخاصة بها من خلال VLMEvalKit، مما يسمح للباحثين الخارجيين بتكرار الاختبارات. كلا الإصدارين يستخدمان ترخيص Apache 2.0، والذي يسمح بالاستخدام التجاري والتعديل وإعادة التوزيع.

جزء من استراتيجية Tether الأوسع للذكاء الاصطناعي

رئيس تنفيذي تيثر باولو أردوينو قال إن الإصدار يدعم جهود الشركة نحو أنظمة ذكاء اصطناعي محلية وفعالة.

قال أردينو: "إن تحقيق جودة وأداء من الطراز الأول في مهام الرؤية العامة باستخدام 460 مليون معلمة فقط يثبت أن الذكاء الاصطناعي القائم محليًا وعالي الكفاءة هو مسار قابل للتطبيق."

يتبع النموذج عدة إصدارات من QVAC تعود إلى أكتوبر 2025، بما في ذلك مجموعات بيانات تدريب اصطناعية، وحزمة تطوير برمجيات متعددة المنصات، ونماذج طبية مصممة للهواتف والأجهزة القابلة للارتداء.

للمطورين، توفر الإصدار تحليل صور دون اتصال دون تكاليف وفقًا للاستخدام للواجهة البرمجية. يمكن للشركات الاحتفاظ بالمستندات الحساسة على الجهاز، بينما يمكن للمستهلكين استخدام ميزات الذكاء الاصطناعي دون إشارة. يمكن للباحثين اختبار ادعاءات الأداء الخاصة بالشركة بشكل مستقل باستخدام التكوينات المنشورة.

قام تيتر بتمويل توسعه في الذكاء الاصطناعي باستخدام أرباحه من عملة USDT المستقرة. كما استثمر في البنية التحتية للذكاء الاصطناعي، والتكنولوجيا الحيوية، والروبوتات، بما في ذلك استثمار من السلسلة C في NEURA Robotics بقيمة تصل إلى 1.4 مليار دولار.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.