اوپن اے آئی نے GPT-6 Astra کی ایوالویشن ڈیٹا کو تبدیل کر دیا، جس سے شفافیت کے معاملات ابھرے ہیں

icon MarsBit
بانٹیں
AI summary iconخلاصہ
رپورٹس کے مطابق، OpenAI نے GPT-6 Astra کے ایوانلیوشن ڈیٹا میں تبدیلی کی ہے، جس سے شفافیت کے بارے میں فکر پیدا ہوئی ہے۔ Astra کی ہالوسینیشن ریٹ 4.2% سے گھٹ کر 2% ہو گئی، جبکہ Anthropic اور GPT-5.6 Sol جیسے مقابلہ کرنے والوں کے ریاضی کے اسکور میں کمی آئی۔ OpenAI کا کہنا ہے کہ یہ تبدیلیاں درست کارکردگی کو ظاہر کرتی ہیں، لیکن Stanford کے محققین "benchmaxxing" کے خطرے کی نشاندہی کرتے ہیں۔ جبکہ بازار میں تبدیلیوں کے ساتھ آلٹ کوائنز جن پر نظر رکھی جا رہی ہے، وہ توجہ حاصل کر رہے ہیں، قابل اعتماد ڈیٹا اب بھی اہم ہے۔ انفلیشن ڈیٹا کے رجحانات سے AI اور کرپٹو سیکٹرز میں واضح، دوبارہ قابل حاصل بینچ مارکس کی ضرورت بھی واضح ہوتی ہے۔

动察 Beating AI خبریں، OpenAI نے 3 ستمبر کو GPT-6 Astra جاری کرنے کے بعد، کئی ماڈل ایوانٹس کے ڈیٹا کو بار بار تبدیل کیا ہے، جس میں کچھ تبدیلیوں سے Astra کی کارکردگی بہتر ہوئی، جبکہ کچھ مقابلہ کرنے والے ماڈلز کے اسکورز میں کمی آئی، جس سے AI کے "بینچ مینیپولیشن" اور ایوانٹس کی شفافیت کے بارے میں سوالات اٹھائے گئے۔ اس میں، Astra کی ہالوسینیشن ریٹ 4.2% سے گھٹا کر 2% کر دی گئی، جبکہ GPT-5.6 Sol کی 12.2% سے 9.4% کر دی گئی، لیکن بعد میں دونوں دوبارہ 4.2% اور 12.2% پر واپس آ گئے۔ ریاضی کے ایوانٹس میں، Anthropic کے Fable 5.1 کا اسکور 87.8% سے 78% تک گھٹا، جو اب 83% تک واپس آ چکا ہے؛ GPT-5.6 Sol کا اسکور 83% سے 80.5% تک گھٹا، لیکن بعد میں دوبارہ 83% پر واپس آ گیا۔ علاوہ ازیں، Astra نے ARC-AGI-3 ایوانٹ میں اپنا اسکور جاری کرنے سے پہلے کے منصوبہ بندی والے 98.6% سے بڑھا کر نہایت نہایت آخری صفحہ پر 99.99% کر دیا، اور اس کا پروگرامنگ ایوانٹ اسکور بھی 57.7% سے تھوڑا بڑھا کر 57.9% کر دیا گیا۔ OpenAI نے کہا کہ ایوانٹس کے نتائج ماڈل ورژن، ٹولز کانفگریشن، استدلال سطح اور ٹیسٹ رن وغیرہ کے اثرات سے متاثر ہوتے ہیں، اور ان تبدیلیوں کا مقصد ماڈل کی بہترین پرفارمنس کو زیادہ درست طریقے سے ظاہر کرنا ہے۔ تاہم، اسٹینفورڈ یونیورسٹی کے تحقیقی ماہرین کا خیال ہے کہ ایوانٹس کو بار بار دوبارہ رن کرنا "Benchmaxxing" کا ممکنہ طریقہ ہو سکتا ہے، جس میں ٹیسٹ شرائط کو تبدیل کرکے بینچمارک اسکورز کو زیادہ سے زیادہ کرنے کا پروگرام بنایا جاتا ہے۔ صنعت کے ماہرین نے بتایا کہ جب AI ماڈلز کا مقابلہ بڑھ رہا ہے، تو ایوانٹس کا ڈیٹا ماڈلز کی صلاحیتوں کو ناپنے اور بازار میں مقابلہ کرنے کا اہم ذریعہ بن چکا ہے، اور بینچمارک ٹیسٹنگ کی شفافیت اور دوبارہ قابلِ تکرار صلاحیت پر زور دینا مسلسل زیادہ توجہ حاصل کر رہا ہے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔