Beating AI Новости: После выпуска GPT-6 Astra OpenAI 3 сентября данные по нескольким оценочным стандартам моделей неоднократно корректировались — некоторые изменения улучшили показатели Astra, в то время как результаты некоторых конкурентных моделей снизились, что вызвало вопросы со стороны общественности о «маневрировании» в рейтингах и прозрачности оценок. Например, уровень галлюцинаций Astra ранее снижался с 4,2% до 2%, а у GPT-5.6 Sol — с 12,2% до 9,4%, после чего оба показателя вернулись к исходным значениям 4,2% и 12,2%. В математических тестах оценка Fable 5.1 от Anthropic падала с 87,8% до 78%, а затем восстановилась до 83%; GPT-5.6 Sol снижался с 83% до 80,5%, после чего также вернулся к 83%. Кроме того, результат Astra в тесте ARC-AGI-3 вырос с предварительной версии 98,6% до окончательной версии 99,99%, а его показатель в программировании незначительно повысился с 57,7% до 57,9%. OpenAI заявила, что результаты оценок зависят от версии модели, конфигурации инструментов, уровня рассуждений и условий тестирования, и что эти корректировки направлены на более точное отражение наилучшей производительности модели. Однако исследователи из Стэнфордского университета считают, что частое повторное проведение тестов может быть связано с так называемым «Benchmaxxing» — манипуляцией условиями тестирования для достижения максимальных результатов. Эксперты отмечают, что по мере усиления конкуренции между ИИ-моделями оценочные данные становятся важным инструментом для измерения способностей моделей и завоевания рынка, и все больше внимания уделяется повышению прозрачности и воспроизводимости тестовых стандартов.
OpenAI корректирует данные оценки GPT-6 Astra, вызывая опасения по поводу прозрачности
MarsBitПоделиться
Сообщается, что OpenAI изменила данные оценки GPT-6 Astra, что вызвало опасения по поводу прозрачности. Уровень галлюцинаций Astra снизился с 4,2% до 2%, в то время как у конкурентов, таких как Anthropic и GPT-5.6 Sol, снизились баллы по математике. OpenAI утверждает, что изменения отражают точную производительность, но исследователи Стэнфорда предупреждают о «benchmaxxing». На фоне рыночных изменений набирают популярность альткоины, за которыми стоит наблюдать, и надежные данные остаются ключевыми. Тренды в данных по инфляции также подчеркивают необходимость четких и воспроизводимых эталонов в секторах ИИ и криптовалют.
Источник:Показать оригинал
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации.
Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.