OpenAI змінює дані для оцінки GPT-6 Astra, що викликає занепокоєння щодо прозорості

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Згідно з повідомленнями, OpenAI змінила дані для оцінки GPT-6 Astra, що викликало занепокоєння щодо прозорості. Частота галюцинацій Astra знизилася з 4,2% до 2%, тоді як конкуренти, такі як Anthropic і GPT-5.6 Sol, побачили зниження балів з математики. OpenAI стверджує, що зміни відображають точну продуктивність, але дослідники з Стенфорду попереджають про «benchmaxxing». На тлі ринкових змін зростає популярність альткоїнів, які варто стежити, і надійні дані залишаються ключовими. Тренди в даних щодо інфляції також підкреслюють необхідність чітких, відтворюваних тестових показників у секторах ШІ та криптовалют.

Новини Beating AI: Після запуску GPT-6 Astra 3 вересня OpenAI неодноразово коригувала дані з тестів моделей — деякі зміни покращили показники Astra, тоді як інші моделі-конкуренти показали погіршення, що викликало сумніви щодо «маніпулювання рейтингами» та прозорості тестування штучного інтелекту. Наприклад, рівень галюцинацій Astra спочатку знизили з 4,2% до 2%, а GPT-5.6 Sol — з 12,2% до 9,4%, а потім обидва значення знову повернули до 4,2% і 12,2%. У математичних тестах оцінка Fable 5.1 від Anthropic спадала з 87,8% до 78%, а зараз відновилася до 83%; GPT-5.6 Sol знизився з 83% до 80,5%, а потім повернувся до 83%. Крім того, результат Astra у тесті ARC-AGI-3 зрос з 98,6% у попередній чернетці до 99,99% у фінальній версії, а його показник у тестах програмування трохи підвищився з 57,7% до 57,9%. OpenAI пояснила, що результати тестування можуть впливати версія моделі, конфігурація інструментів, рівень міркувань та умови запуску тесту, і ці коригування були зроблені для точнішого відображення найкращих характеристик моделей. Однак дослідники Стенфордського університету вважають, що часте повторне тестування може вказувати на так зване «Benchmaxxing» — маніпуляцію умовами тестування для максимізації результатів. Експерти з галузі вказують, що з посиленням конкуренції між моделями ШІ дані тестування перетворилися на ключовий інструмент для оцінки здатностей та боротьби за ринок, і все більше уваги приділяється підвищенню прозорості та відтворюваності стандартних тестів.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.