Vals AI تجمع 40 مليون دولار في جولة_series A بقيادة a16z لبناء معايير مستقلة لنماذج الذكاء الاصطناعي
2026/08/22 12:06:00

جولة تمويل تُشير إلى تزايد الطلب على معايير أداء الذكاء الاصطناعي في العالم الحقيقي
في منتصف أغسطس 2026، أعلنت Vals AI عن جولة من الفئة A بقيمة 40 مليون دولار بقيمة سوقية قدرها 400 مليون دولار، بقيادة Andreessen Horowitz مع مشاركة المستثمرين الحاليين 8VC و Pear VC و Bloomberg Beta، بالإضافة إلى مستثمرين جدد هم HRT Ventures و Next Ladder Ventures. وتُعرّف الشركة المقرّة في سان فرانسيسكو نفسها كمُقيّم مستقل لنماذج الذكاء الاصطناعي المتقدمة، حيث تبني مقاييس تُقيّم الأداء في أعمال مهنية ذات معنى اقتصادي بدلاً من الاختبارات الأكاديمية التي أصبحت مُشبعة إلى حد كبير. وتشمل نتائجها بالفعل بطاقات النماذج من OpenAI و Anthropic و Google و Meta و xAI. وقد نما الإيرادات ثمانية أضعاف مقارنةً بعام 2025 بأكمله، وانضمّ قاعدة العملاء إلى الضعف، وازداد فريق العمل ثلاثة أضعاف خلال ستة أشهر.
إلى جانب التمويل، أطلقت Vals Vals Smith لاختبارات البرمجة المخصصة المستمدة من أي مستودع GitHub، ومؤشر RSI المطور بالتعاون مع CoreWeave لقياس قدرات التحسين الذاتي التكراري، وReverseEngBench المنشأ مع باحثين من جامعة كولومبيا وجامعة تافتس وجامعة كاليفورنيا في بيركلي وكلية جامعة كاليفورنيا في لوس أنجلوس، بالإضافة إلى مؤشر Vals 2.0 الموسّع الذي يُرجّح الأداء وفقًا لمساهمات القطاعات في الناتج المحلي الإجمالي الأمريكي. تأتي هذه الخطوات في وقت تواجه فيه الشركات ضغوطًا متزايدة لتبني الذكاء الاصطناعي مع غياب وسائل موثوقة لقياس العائد على الاستثمار، وفي وقت تسعى فيه الحكومات إلى الحصول على مقاييس مستقلة لقدرات الحدود前沿 ومخاطر الأمن السيبراني. الفرضية الأساسية هي أن اختبارات المهام المهنية المستقلة والمحدثة باستمرار أصبحت بنية تحتية ضرورية لاقتصاد الذكاء الاصطناعي، مما يغلق الفجوة المتزايدة بين درجات القوائم الرائدة المبلغ عنها من قبل البائعين والقدرة الفعلية على إنجاز مهام متعددة الخطوات في مجالات المالية والقانون وهندسة البرمجيات وقطاعات المخاطر عالية الأهمية.
لماذا فقدت لوحات تصنيف الذكاء الاصطناعي التقليدية قدرتها التنبؤية لاتخاذ قرارات المؤسسات
كانت المعايير الأكاديمية العامة تقدم لغة مشتركة لتتبع تقدم النماذج، لكن تحليلًا أجرته باحثون من ETH زيوريخ وستانفورد في فبراير 2026 درس 60 تقييمًا شائعًا للنماذج اللغوية الكبيرة ووجد أن 29 منها وصلت إلى حالة التشبع، حيث انخفضت الفجوات في الأداء بين النموذجين الأعلى والأدنى داخل ضجيج القياس. يحدث التلوث عندما تدخل بيانات الاختبار إلى مجموعات التدريب، أحيانًا عبر Common Crawl، بينما تقوم المختبرات أيضًا بتحسين النماذج مباشرة ضد أهداف معروفة. والنتيجة هي أن الدرجات العالية على MMLU أو HumanEval أو مجموعات مشابهة لم تعد تتنبأ بشكل موثوق بالنجاح في سير العمل المهنية الفوضوية متعددة الخطوات. يعالج Vals هذا من خلال الحفاظ على مجموعات الاختبار الأساسية سرية، والتعاون مع خبراء في المجال لتحديد مهام تمثيلية، وتقاعد المعايير بمجرد توقفها عن التمييز بين النماذج.
في مايو 2026، استبدلت الشركة تقييم CorpFin السابق بمقياس Excel Modelling أكثر صرامة بالضبط لأن التمايز قد تلاشى. هذا النهج التكيفي يعامل التقييم نفسه كبنية تحتية مستمرة بدلاً من امتحان ثابت، مما يمنح المؤسسات إشارة أوضح عند اختيار النماذج للنشر الإنتاجي. ويؤكد كل من الوثائق الرسمية حول منهجية الشركة وإعلان الاستثمار من a16z أن المجموعات الخاصة، التي تم جمعها من قبل خبراء وتخضع للتبديل المستمر، تقاوم مسار التشبع بشكل أكثر فعالية من الاختبارات الثابتة الكاملة العامة أو الخاصة تمامًا.
كيف يبني فالس المعايير المرجعية حول سير العمل المهني الفعلية
تتعاون فالس مع محامين ممارسين، و محللين ماليين، ومهندسين برمجيات، وأطباء لرسم تصنيف المهام التي تحدد العمل الكفؤ في كل مجال، ثم تطور أنظمة تقييم آلية تُقيّم منتجات العمل المُنشأة وفقًا للمعايير الخبرائية بدلاً من صحة الاختيارات المتعددة أو التطابق الدقيق للنصوص. تتطلب مهمة وكيل المالية الإصدار 2 عادةً من الوكيل استرجاع البيانات الداعمة من الوثائق، وتركيب نماذج القيمة النسبية عبر الشركات المنافسة، وتحديد عوامل التحفيز في القطاع، وإنتاج توصيات استثمارية مدعومة دون تزييف أرقام أو فقدان السياق عبر الخطوات. في مايو 2026، بلغ أعلى نموذج درجة دقة قدرها 52 بالمائة فقط في هذه المجموعة، مما يشير إلى أن حتى الأنظمة الرائدة لا تزال تفشل في نحو نصف المهام التي يُتوقع من محلل محترف إنجازها.
ينطبق نفس المبدأ على البحث القانوني، وتهيئة الكود، والهندسة القائمة على المحطة، وترميز الطب. وبما أن التقييم يتم تلقائيًا مع ضبطه وفقًا لتقدير الخبراء، فيمكن إنتاج التقييمات خلال ساعات من الحصول على وصول النموذج، مما يتوافق مع الإيقاع الأسبوعي الحالي لإطلاق الإصدارات الرائدة. وقد أطلقت الشركة مصادر أجزاء من بنية تقييمها لدعم التكرار مع حماية سلامة مجموعات الاختبار الخاصة التي تولد الدرجات الأساسية. هذه المزيج من الشراكة المجالية، والتقييم التلقائي على مستوى الخبراء، والسرعة العالية في الإنجاز، يميز المنصة عن لوحات الصدارة الأكاديمية وعن الساحات القائمة فقط على التفضيلات.
مبرر a16z لقيادة الجولة بتقييم قدره 400 مليون دولار
صاغ أندريسن هوروفي茨 الاستثمار حول مشكلة عدم التوازن المعلوماتي الكلاسيكية التي وصفها الاقتصادي جورج أكرلوف: عندما يكون البائعون على دراية أكبر بجودة المنتج مقارنة بالمشترين، و لديهم حوافز لتقديم بيانات إيجابية، فإن الأسواق تتدهور نحو نتائج ذات جودة أقل. وقارنت جينيفر لي وزملاؤها في a16z الحاجة إلى مُقيّم ذكي مستقل بظهور شركة موودي في أسواق الائتمان والمدققين المستقلين في تقارير الشركات العامة. ويهدف نموذج إيرادات Vals، القائم على فرض رسوم مقابل خدمات التقييم بدلاً من شهادة أي مختبر معين، إلى الحفاظ على الاستقلالية الهيكلية.
أشارت الشركة إلى العمق التقني للمؤسسين وشكوكهم المستمرة بشأن صحة المعايير، مشيرةً إلى أن ريان كريشنان ولانغستون ناشولد قد سبق لهما التعاون في حل مشكلات قياس واقعية أثناء دراستهما علوم الحاسوب في ستانفورد. ويشير تقييم الجولة ومشاركة هـ.آر.تي. فنتشرز المرتبطة بالتداول الكمي إلى أن رأس المال المتقدم يرى القياس الموثوق كبنية تحتية حاسمة وليس أداة بحثية ثانوية. وتشدد التعليقات الرسمية من a16z على أن النماذج تنتقل من الإجابة عن الأسئلة إلى تنفيذ سير عمل وكيلية تستمر لساعات عديدة، مما يزيد من تكلفة اختيار نموذج سيء من إنفاق الرموز إلى فقدان الوقت ونتائج العملاء.
خلفيات المؤسسين وأصول أطروحة التقييم المستقل
رايان كريشنان، الذي يشغل منصب الرئيس التنفيذي للشركة، لديه خلفية بارزة تشمل عمله السابق في شركة Palantir، وهي شركة معروفة في مجال تحليل البيانات. شريكه المؤسس، لانغستون ناشولد، يشغل منصب المدير التقني ويجسد خبرة واسعة من تجربته في شركات تقنية كبرى مثل Meta وNVIDIA وHudson River Trading. التقى المؤسسان لأول مرة خلال رحلة مشي لمسافات طويلة قبل بدء التوجيه في جامعة ستانفورد، حيث تكوّن بينهما رابط سريع. ثم تعاونا لاحقًا على مشاريع متعددة في مساقات علوم الحاسوب، مما أدى بهما إلى إدراك مهم: أن نماذج اللغة الكبيرة لديها القدرة على ثورة طريقة إنجاز العمل. لكنهما أدركا أيضًا أن الصناعة ما زالت تفتقر إلى أساليب موثوقة وفعالة لاختبار هذه النماذج. وبناءً على رؤاياهما، اتخذا قرارًا جريئًا بالانسحاب من برامجهما الدراسية العليا لإنشاء Vals. كان التركيز الأولي لمشروعهما الجديد على المهام المالية وكتابة الأكواد، والتي حددوا أنها تمثل أجزاء كبيرة من النشاط الاقتصادي في الولايات المتحدة.
مع بدء اكتسابهم زخماً في السوق، تلقوا اشارات بارزة في بطاقات النماذج الرئيسية وحصلوا على دعم من وزارة التجارة لمبادراتهم، بالإضافة إلى مشاركتهم في الجهود البرلمانية المتعلقة بسياسة الذكاء الاصطناعي. يولي المؤسسون أهمية كبيرة لأهمية التخلص المستمر من المعايير القديمة واستخدام مجموعات الاختبار الخاصة. هذا النهج هو نتيجة مباشرة لملاحظاتهم حول مدى سرعة وصول النماذج إلى ذروة المعايير الثابتة وكيف يمكن لبيانات التدريب أن تؤثر على التقييمات العامة. وقد أثرت خبرتهم المشتركة في أنظمة الإنتاج والبيئات الكمية بشكل كبير على تصميم مجموعة التقييم، وكذلك المنتج التجاري الذي تستخدمه الشركات الآن لاختيار ومراقبة النماذج بما يتماشى مع أحدث التطورات التكنولوجية.
كشفت معايير وكلاء التمويل عن فجوات مستمرة بين درجات القائمة الرائدة وعمل المحللين
على الرغم من أن النماذج تحقق نتائج شبه مثالية على مجموعات أكاديمية أقدم، فإن مجموعة Finance Agent v2 لا تزال تكشف عن نقص كبير في المواد لا يمكن تجاهله. تشمل المهام المتضمنة في هذه المجموعة توليف متعدد المستندات، ونمذجة القيمة النسبية، وتوليد التوصيات، وكلها تعكس عن كثب الإنتاج اليومي الذي ينتجه محللو المالية المحترفون في الصناعة. إن الحد الأقصى البالغ 52 بالمئة المسجل في مايو 2026 للنظام الرائد يُذكّر بشكل صارخ بأن درجات المعرفة العامة العالية لا تعني تلقائيًا قدرات تحليل مالي موثوقة ومستقلة.
يُوزّع Vals بشكل استراتيجي مؤشره المركب Vals Index من خلال أخذ مساهمات القطاعات التقريبية في الناتج المحلي الإجمالي الأمريكي في الاعتبار، مما يمنح القطاع المالي تأثيرًا مضاعفًا كبيرًا، ويضمن انعكاس الأثر الاقتصادي بدقة في التصنيف الشامل للنماذج المختلفة. تُبلغ الشركات التي نجحت في تطبيق نماذج تم اختيارها جزئيًا من خلال تقييمات Vals أنها تستخدم المنصة ليس فقط لعملية الاختيار الأولي، بل أيضًا لقياس أداء المنتجات باستمرار مقابل خطوط أساس متقدمة محددة. علاوة على ذلك، فإن الفجوة الحالية في الأداء تلعب أيضًا دورًا حاسمًا في إبلاغ قرارات تخصيص رأس المال داخل المؤسسات المالية. يجب على هذه المؤسسات تبرير نفقاتها في الذكاء الاصطناعي من خلال مكاسب إنتاجية قابلة للقياس، وليس الاعتماد فقط على العروض النوعية، التي يمكن أن تكون ذات طابع ذاتي وأقل موثوقية. إن عملية التقييم المستمرة هذه ضرورية لضمان تحقيق الاستثمارات في تقنيات الذكاء الاصطناعي فوائد وتحسينات ملموسة في الكفاءة التشغيلية.
vals smith يفتح معايير برمجة مخصصة مستمدة مباشرة من مستودعات المؤسسات
مع إعلان السلسلة A، جعل Vals Smith متاحًا للجميع، مما يسمح لأي منظمة بإنشاء معيار برمجي مخصص من مستودعات GitHub الخاصة بها. يستخرج النظام مهام تطوير حقيقية من طلبات السحب التاريخية ويطبق اختبارات مخفية لتحديد ما إذا كان النموذج قادرًا على إكمال العمل. يتلقى المستخدمون 120 رصيدًا مجانيًا للبدء. بالنسبة للشركات التي تحتوي قواعد كودها على أنماط وكتابات واتفاقيات هندسية حصرية، فإن الفرق بين الكفاءة العامة في بايثون أو جافا وقدرة العمل داخل هذا البيئة المحددة هو حاسم.
لذلك يحول سميث السؤال المجرد حول القدرة على البرمجة إلى مقياس ملموس محدد بالمنظمة. يمكن الآن للمبادرين المبكرين في المؤسسات ترتيب النماذج وفقًا لأدائها على عبء العمل الهندسي الفعلي الخاص بهم، وليس وفقًا لمجموعات عامة قد تم حفظها جزئيًا أو تحسينها ضدها. يوسع الإصدار نطاق Vals خارج مقاييس المجال المُعدة مسبقًا إلى بنية تقييم مخصصة تتوسع مع احتياجات العملاء.
مؤشر RSI وReverseEngBench يوسعان التغطية إلى مجالات المخاطر المتقدمة
بالتعاون مع التمويل الأخير، كشفت Vals بفخر عن مؤشر RSI، الذي تم تطويره بالتعاون مع CoreWeave. يهدف هذا المؤشر المبتكر إلى تقييم ما إذا كانت النماذج المختلفة قادرة على تنفيذ مهام البحث الضرورية لدفع عجلة تطوير النماذج، وتقنيات الضغط، ومناهج التدريب، واستراتيجيات تحسين المعلمات، وممارسات هندسة الحزم، والتقييمات ما بعد التدريب. علاوة على ذلك، أطلقت الشركة ReverseEngBench، وهو مشروع تم تطويره بدقة بالشراكة مع مؤسسات أكاديمية مرموقة، بما في ذلك جامعة كولومبيا، وجامعة تافتس، وجامعة كاليفورنيا ببركلي، وجامعة كاليفورنيا في لوس أنجلوس. يتكون هذا المعيار الشامل من 19 برنامجًا مملوكًا، والتي تبلغ متوسطها الإجمالي أكثر من 16,000 سطر من التعليمات البرمجية.
تمتد هذه البرامج عبر مجموعة متنوعة من المجالات، بما في ذلك بروتوكولات الشبكة، والبرمجيات الثابتة، وتطبيقات الألعاب، وعمليات استعادة تنسيقات الملفات، وتحليل البرمجيات الخبيثة، وكلها محمية بواسطة مجموعة شاملة لمنع التحليل مصممة لتعزيز الأمان. تشير النتائج الأولية إلى فروق كبيرة بين النماذج الرائدة في الحدود، مما يكشف عن إمكانات كبيرة لا تزال متبقية قبل أن يتمكن الوكلاء من تحليل العكسي للثنائيات الواقعية بشكل متسق. بالإضافة إلى هذه الجهود، تم بدء أعمال مبكرة أيضًا في مجال تطبيقات الصحة العقلية، مع خطط للتوسع الإضافي في مجالات حاسمة مثل تقييمات الأثر البيئي، والتطبيقات العسكرية، ومجالات الأمن الحيوي. هذه التقييمات، التي تركز على المخاطر، تعالج القدرات الحاسمة لكل من تعزيز مواقف أمن المؤسسات وتقييمات الحكومات للأنظمة المتقدمة.
مؤشر فالس 2.0 يجمع الأداء موزونًا حسب المساهمة الاقتصادية
يتميز الموقع الإلكتروني المعاد تصميمه ومؤشر فالس 2.0 الآن بتغطية أوسع بكثير عبر مجالات متنوعة، بما في ذلك المالية والبرمجة والمهام القانونية. يتم اشتقاق أوزان القطاعات المستخدمة في المؤشر من بيانات القيمة المضافة المقدمة من مكتب التحليل الاقتصادي. وتستخدم الصيغة المركبة متوسط مؤشرات الأداء داخل كل قطاع، ثم تجمع هذه الدرجات القطاعية بناءً على حصصها التقريبية من الناتج المحلي الإجمالي. اعتبارًا من منتصف أغسطس 2026، يتصدر كلويد أوبوس 5 المؤشر، يليه عن كثب كلويد فابل 5 وGPT-5.6 Sol.
يُحدَّث المؤشر بشكل متكرر ليعكس أحدث إصدارات النماذج، ويعمل كمقياس رئيسي واحد يدل على التأثير الاقتصادي المحتمل، مع السماح للمستخدمين بالتنقيب في قوائم الصدارة الفردية لكل مجال للحصول على رؤى أكثر تفصيلاً. نظرًا لأن المعايير الأساسية لا تزال سرية إلى حد كبير وتُحدَّث دوريًا، فإن المؤشر قادر على الحفاظ على تميّزه لفترة أطول مقارنة بالتركيبات العامة تمامًا. يلجأ المؤسسات والباحثون على حد سواء إلى هذا المؤشر ليس فقط لأغراض التصنيف النسبي، بل أيضًا لإجراء تحليلات توازن بين التكلفة والتأخير والقدرة عبر نظام النماذج الحالي، مما يضمن اتخاذ قرارات مستنيرة استنادًا إلى أكثر البيانات صلةً المتاحة.
أنماط تبني المؤسسات وطلب العائد على الاستثمار قابل للقياس
تُدمج عمليات النشر الواسعة للذكاء الاصطناعي تقييمات Vals بشكل متزايد عند اختيار النماذج الأساسية وعند تقييم المنتجات الداخلية مقابل مقاييس الأداء المتقدمة. إن هذا المزيج من السرعة العالية في الإنجاز، والتخصص في المجال، والاستقلالية يعالج بفعالية التحديات العملية التي تواجهها فرق المشتريات والقادة التقنيون: لم تعد بطاقات تقييم الموردين كافية وحدها لاتخاذ قرارات ذات أهمية كبيرة.
نمو الإيرادات المذهل بمقدار ثمانية أضعاف مقارنةً بمجموع عام 2025، إلى جانب ضعف قاعدة العملاء وثلاثة أضعاف عدد الموظفين خلال ستة أشهر فقط، يُظهر بوضوح أن الطلب انتقل من مرحلة التجربة الأولية إلى مرحلة الاعتماد التشغيلي. كما تعاونت الحكومات مع المنصة للحصول على رؤى قيمة حول قياس القدرات والمخاطر السيبرانية، مما يعزز أهميتها في السياقات التجارية والسياسية على حد سواء. إن قدرة المنصة على مواكبة إصدارات النماذج الأسبوعية تضمن بقاء الإشارة حديثة وذات صلة، بدلاً من أن تكون متأخرة عن الحدود前沿 بشهور عديدة.
النظام البيئي والتمايز الهيكلي عن المنصات القائمة على التفضيلات
توجد جهود تقييم أخرى فعلاً في هذا المجال، بما في ذلك بيئات التصويت على التفضيلات التي تجمع الأحكام البشرية على المخرجات المفتوحة، بالإضافة إلى النهج النفسية التي تهدف إلى تقليل وقت التقييم بشكل كبير. يميز Vals نفسه من خلال تصميم مهام مهنية مُعدّة من قبل خبراء، مما يضمن الصلة والتطبيق العاليين، إلى جانب التصحيح الآلي الذي تم ضبطه بدقة ليلبي المعايير المعتمدة في المجال. تستخدم الشركة مجموعات اختبار خاصة تُستبعد باستمرار للحفاظ على سلامة تقييماتها، كما تمتلك سجلاً موثقاً من الاقتباسات من قبل جميع المختبرات الرائدة الكبرى في هذا المجال.
هذه السجلات الاقتباسية تُعد شكلاً حاسماً من أشكال الشرعية التي يجب على الدخولين الجدد السعي لكسبها من أجل اكتساب المصداقية. علاوة على ذلك، فإن تركيز الشركة على سير العمل متعددة الخطوات الموزونة اقتصادياً، بدلاً من الاقتصار فقط على التفضيل الحواري أو السرعة البحتة، يضعها كبنية تحتية حيوية لاتخاذ قرارات إنتاج مستنيرة، وليس مجرد لاعب في قوائم قادة البحث. وقد أدرك المستثمرون بوضوح هذا التمييز الفريد وسعرّوه في التقييم المذهل البالغ 400 مليون دولار.
الاستنتاج لمطوري النماذج ووتيرة قياس القدرات
تعمل مختبرات Frontier الآن في بيئة تتمتع فيها الدرجات المستقلة بمصداقية خارجية تفتقر إليها الأرقام المبلغ عنها ذاتيًا بشكل متزايد. يشير الاستشهاد في بطاقات النموذج إلى مشتري المؤسسات أن النتائج خضعت لمراجعة طرف ثالث. في الوقت نفسه، فإن الإنشاء المستمر للمعايير الأصعب يرفع من مستوى النماذج التالية التي يجب أن تتجاوزه. لذلك، فإن عملية "تسلق التل" التي دفعت تقدم الذكاء الاصطناعي تواجه مجموعة أكثر وعورة وتُجدد بشكل متكرر من التلال.
المطورون الذين يعاملون التقييم كأمر ثانوي يخاطرون باكتشاف فجوات القدرة فقط بعد النشر؛ بينما أولئك الذين يدمجون القياس المستقل مبكرًا يمكنهم تحديد الأولويات للتحسينات التي لها أهمية حقيقية في العمل الفعلي. إن فتح مكونات البنية التحتية المختارة يشجع أيضًا على إمكانية التكرار مع حماية التقييمات الخاصة الأساسية التي تولد أعلى درجات الإشارة.
الحاجة الأوسع للسوق إلى مؤسسات قياس موثوقة
مع تعمّق أنظمة الذكاء الاصطناعي في سير العمل ذات العواقب القانونية والمالية، فإن غياب القياس المستقل يخلق نفس مخاطر عدم التوازن في المعلومات التي أنتجت تاريخياً وكالات التصنيف والمدققين في الصناعات الأخرى. تشير مقاييس نمو Vals ومستوى داعميها إلى أن رأس المال يُدرك هذا الفجوة المؤسسية. وتماشياً مع مهمتها المعلنة، وهي أن تكون المقيّم المستقل للذكاء الاصطناعي، فإن الشركة تتماشى مع المتطلبات العملية للشركات الساعية لوضوح العائد على الاستثمار، ولصانعي السياسات الراغبين في فهم القدرات والمخاطر.
سيختبر التوسع المستمر إلى مجالات مهنية ومخاطر إضافية ما إذا كانت المنهجية قابلة للتوسع مع الحفاظ على الاستقلالية وجودة الإشارة. حاليًا، يُعتبر مزيج الإطلاقات المنتجات الأخيرة، والنمو التجاري السريع، والالتزام الرأسمالي ذي السمعة العالية، Vals نقطة مرجعية مركزية لأي شخص يجب عليه اتخاذ قرار بشأن النماذج التي يمكنها فعليًا أداء العمل المهم.
الأسئلة الشائعة
ما الذي أعلنته Vals AI بالضبط في جولة التمويل من السلسلة A؟
أكملت Vals AI جولة تمويل من السلسلة A بقيمة 40 مليون دولار بقيمة سوقية قدرها 400 مليون دولار في 13 أغسطس 2026. قادت هذه الجولة شركة Andreessen Horowitz، مع عودة المستثمرين الحاليين 8VC وPear VC وBloomberg Beta، وانضمام مستثمرين جدد هما HRT Ventures وNext Ladder Ventures. وفي الوقت نفسه، أطلقت الشركة Vals Smith لمعايير البرمجة المخصصة، ومؤشر RSI، وReverseEngBench، ومؤشر Vals 2.0 الموسّع، وموقعًا إلكترونيًا مُعاد بناؤه. وتأكّد البيانات الرسمية من كل من Vals وa16z على الأرقام والإطلاقات المنتجة المرافقة.
كيف تختلف معايير Vals عن لوحات الصدارة العامة مثل MMLU أو SWE-bench؟
يركز Vals على سير عمل احترافية متعددة الخطوات، تم تعريفها بالتعاون مع خبراء المجال وتقديرها بواسطة أنظمة آلية مُعايرة وفق معايير الخبراء. تظل مجموعات الاختبار الأساسية خاصة وتُزال عند توقفها عن التمييز بين النماذج، مما يقلل من التلوث والاحتيال في التحسين. غالبًا ما تصل مجموعات الأكاديميين العامة إلى نقطة التشبع أو تسرب إلى بيانات التدريب، مما يحد من قيمتها التنبؤية للمهام المؤسسية الحقيقية. ينتج نهج Vals نتائج خلال ساعات من الوصول إلى النموذج، وهو ما يظهر بالفعل في بطاقات النماذج الخاصة بالمختبرات الكبرى.
ما أهمية درجة 52 بالمائة في مهام وكيل التمويل؟
في مايو 2026، حقق النموذج الرائد دقة تقارب 52 بالمائة في مجموعة Finance Agent v2، التي تتطلب نمذجة القيمة النسبية، وتركيب الوثائق، وتوصيات مبنية على أسس واقعية. يشير هذا الرقم إلى أن حتى أقوى الأنظمة المتاحة لا تزال تفشل في حوالي نصف المهام المتوقعة من محلل مالي محترف. هذه الفجوة بين النتائج الأكاديمية وأداء المهام المهنية هي بالضبط المشكلة التي يهدف Vals إلى قياسها وبالتالي المساعدة في سدّها.
من هم المؤسسون وما الخبرات التي يجلبونها؟
عمل المدير التنفيذي ريان كريشنان سابقًا في بالانتر. ولديه المدير التقني لانغستون ناشولد خبرة في ميتا ونفيديا وهودسون ريفير تريدينج. وقد درس كلاهما علوم الحاسوب في ستانفورد وبدأ التعاون في حل مشكلات القياس قبل تأسيس الشركة. وتجمع خلفياتهما بين خبرة في أنظمة الإنتاج ومنظور كمي وبحثي يشكلان تركيز فالفس على التقييم الصارم والمرن.
ما الذي يمكّن فالس سميث من أجل المؤسسات؟
يسمح Vals Smith لأي منظمة بإنشاء معيار برمجي مخصص مباشرة من مستودعات GitHub الخاصة بها. يستخرج النظام مهام تطوير واقعية من طلبات السحب التاريخية ويطبق اختبارات مخفية. يبدأ المستخدمون بـ 120 رصيدًا مجانيًا. يحول الأداة مقاييس البرمجة العامة إلى قياسات مخصصة للمنظمة تعكس أنماط الكود الخاصة والممارسات الهندسية.
كيف يدمج مؤشر فالس الوزن الاقتصادي؟
يجمع المؤشر الأداء عبر مهام المالية والبرمجة والقانون، ثم يوزن متوسطات القطاعات وفقًا لمساهماتها التقريبية في الناتج المحلي الإجمالي الأمريكي باستخدام بيانات مكتب تحليل الاقتصاد. ويقدم المركب الناتج مقياسًا رئيسيًا واحدًا للتأثير الاقتصادي المحتمل، مع السماح في الوقت نفسه بمراجعة مفصلة لنتائج المجالات الفردية. ووسع الإصدار 2.0 نطاق التغطية ويُحدَّث بشكل متكرر ليعكس الإصدارات الجديدة للنماذج.
🔥 توفر KuCoin خيارًا أكثر استقرارًا في سوق متقلب
إذا كنت قلقًا من التقلبات المتكررة في السوق، وتسعى لخيار أكثر استقرارًا لكسب المال بشكل سلبي، فإن KuCoin هي المكان المناسب للقدوم إليه:

Simple Earn: أودع واسحب الرموز في أي وقت واحصل على عوائد ثابتة.
KuCoin Earn: اكسب أرباحًا مستقرة مع إدارة أصول احترافية.
الاحتفاظ لكسب المكافآت: اكسب مكافآت من خلال الاحتفاظ بالأصول في حسابات التمويل، التداول، الهامش، العقود الآجلة، التعدين، والحسابات الموحدة.
الاستثمار: فك قفل إمكانات الربح للأصول على السلسلة.
الاستثمارات المتقدمة: تقدم الاستثمارات المتقدمة مجموعة متنوعة من المنتجات المهيكلة لمساعدة أموالك على النمو في أي سوق.
الزعانف القرشية: حماية الرأس المال وأرباح مضمونة
الاستثمار المزدوج: اشترِ منخفضًا وابيع مرتفعًا مع حسابات عوائد شفافة.
Snowball: عوائد عالية، مع حماية من السعر.
الشراء بخصم: اشترِ العملات المشفرة بأسعار مخفضة.
KCS Loyalty: ترقية المستوى للاستمتاع بمزايا حصرية عن طريق تجميد ≥ 1 KCS.
KuCoin Wealth: اكتشف القيمة المستقبلية وابدأ رحلتك في الاستثمار الذكي.
فوائد KCS: احتفظ بـ KCS وقم بتعطيله للوصول إلى المزايا عبر المنصة.
KCS Staking 2.0: شارك في حوكمة KCS على السلسلة لكسب العائد.
إخلاء المسؤولية: هذا المحتوى لأغراض إعلامية فقط ولا يشكل نصيحة استثمارية. تتضمن استثمارات العملات المشفرة مخاطر. يرجى إجراء بحثك الخاص (DYOR).
اخلاء المسؤوليه: تُرجمت هذه الصفحة باستخدام تقنية الذكاء الاصطناعي لراحتك. للحصول على المعلومات الأكثر دقة، ارجع إلى النسخة الإنجليزية الأصلية.
