source avatarDeltaSignal

Поделиться

🔺 Мы присоединились на 20 дней позже. Через шесть дней мы на #71. Мы вступили в ICML 2026 Agent Reproduction Challenge спустя 20 дней после его начала, оставив менее недели на создание, тестирование, документирование, публикацию и защиту нашей работы. Через шесть дней AITrailblazer занимает 71-е место из 350 участников — примерно топ-20% — с 44 баллами за шесть воспроизведённых статей. Этот результат соответствует 22 научным утверждениям, независимо подтверждённым или опровергнутым. Три наших журнала получили идеальные 10/10. Один — 8/10. Ещё один в настоящее время имеет 6/10. Наш частичный аудит с публикацией доказательств через Tool-Guard не принёс ни одного балла — и научил нас одному из самых важных уроков всего конкурса. Существует фундаментальная разница между проверкой опубликованных результатов автора и независимым воспроизведением этих результатов. У нас не было 26 дней, чтобы изучить рейтинг, выбрать лёгкие утверждения, оптимизировать процесс и постепенно улучшать наши заявки. У нас было шесть дней. За эти шесть дней нам нужно было найти подходящие статьи, понять их ключевые утверждения, найти опубликованный код и данные, разработать независимые тесты, провести эксперименты, сохранить доказательства, рассчитать хеши, задокументировать ограничения, опубликовать публичные Trackio Spaces и дождаться независимого судьи. Мы сосредоточились на том, что на самом деле должно означать научное воспроизведение: Публичные и проверяемые доказательства. Исполняемые методы. Детерминированные расчёты там, где это возможно. Точные хеши и происхождение. Негативные контрольные тесты, предназначенные для выявления ложного согласия. Чёткое разделение между независимыми доказательствами и артефактами, предоставленными авторами. Честная документация того, что мы смогли — и не смогли — воспроизвести. Это достижение важно, потому что ИИ может очень быстро генерировать убедительные объяснения. Но научный прогресс не возникает из объяснений, которые просто звучат правильно. Он возникает из утверждений, выдерживающих независимую проверку. Он также возникает из отрицательных результатов, задокументированных с той же тщательностью, что и успешные подтверждения. Конкурс признаёт этот принцип, присуждая равное количество баллов за подтверждённые и опровергнутые утверждения. Это важно. Строгое заключение, показывающее, что утверждение не воспроизводится, может быть столь же ценным для науки, как и успешное подтверждение. Оно предотвращает ложную уверенность, раскрывает скрытые допущения и даёт будущим исследователям более прочную основу. Наша текущая ситуация также демонстрирует, почему инфраструктура воспроизводимости имеет значение. Наше новейшее обновление Prediction-Powered Inference является публичным, работоспособным и было успешно обнаружено автоматическим судьёй. Однако все три попытки оценки завершились неудачей, поскольку маршрутизатор вывода Hugging Face вернул HTTP-ошибку 504 на стороне сервера. Мы запросили административную повторную постановку в очередь без изменения доказательств, без запроса ручного вердикта и без представления альтернативного результата. Пока автоматическая оценка не будет восстановлена, рейтинг продолжает отражать наши текущие 44 балла и позицию #71. Итоговый рейтинг может ещё измениться. Другие участники продолжают отправлять работы. Наше обновление PPI может быть повторно оценено. Рейтинг остаётся активным по мере приближения дедлайна. Но каким бы ни стал итоговый результат, достижение позиции #71 из 350 после присоединения на 20 дней позже — и сделанное всего за шесть дней — уже является достижением, достойным признания. Мы не просто генерировали краткие содержания научных статей. Мы создали публичный, проверяемый архив, показывающий, что выдержало испытание, что провалилось, как мы это тестировали и где закончились доказательства. Вот как должна выглядеть воспроизводимость. Актуальный рейтинг: https://t.co/ALGcVy1Qng Наши лучшие воспроизведения с оценкой 10/10 — CoopEval: https://t.co/FW8JxWV4b6 Мы присоединились на 20 дней позже. У нас было шесть дней. Мы попали в топ-20%. Воспроизводимость побеждает хайп. Доказательства накапливаются. #ICML2026 #AIResearch #Reproducibility #OpenScience

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.