Люди из передовой лаборатории почти не читают статьи?
Исследователь OpenAI одним заявлением охватил три ведущих конференции: слишком много преувеличений и фальсификаций!

Причиной всего стало исследование ICLR, результаты которого были настолько впечатляющими, что вызывали недоумение; пользователи сети разобрались и обнаружили «секрет».

Даже публикация статей на ведущих конференциях дошла до такого?

Во-первых, проверить, открыто ли исходное код; во-вторых, выяснить, не скрыто ли в методах эксперимента что-то «нечестное»; и только в-третьих — можно ли подтвердить основные выводы полученными результатами. Сколько статей с ведущих конференций выдержат такой многоуровневый анализ?
На самом деле кто-то уже это сделал.
Из 105 статей только 8 «соответствуют требованиям»
В июле этого года SAI, совместно основанная доцентом кафедры компьютерных наук и данных Чикагского университета Тань Чэньхао, объявила о масштабном «экспериментальном рецензировании».
Они выбрали все 168 устных статей ICML 2026.
В этом году на ICML поступило 23 918 работ, и только 168 из них получили право на устное выступление, что составляет около 0,7%.
Другими словами, SAI проверяет уже самые верхние статьи, отобранные из более чем 20 000 поданных работ.
Помимо чтения статей, проектирования экспериментов и анализа результатов, как это делают традиционные рецензенты, SAI Review также загружает код, модели и данные, настраивает среду и запускает эксперименты, после чего сопоставляет полученные результаты с оригинальным текстом статьи по каждому пункту.
SAI проверил все 168 устных докладов, из которых только 104 работы имели открытый исходный код, и в итоге было полностью воспроизведено 105 работ.
Среди них только 34 статьи воспроизвели более 40% утверждений; лишь 8 статей показали коэффициент воспроизводимости выше 80%.

Независимо от того, содержит ли каждая статья как минимум 1, 3 или 5 проверяемых утверждений, медиана рейтинга воспроизводимости всегда остается в диапазоне 28–30%, а общее распределение практически не меняется.

После исключения экспериментов, которые не были запущены, прерваны досрочно или превысили возможности оборудования, медиана воспроизводимости составляет всего 42%–50%; когда каждая статья содержит как минимум три проверяемых утверждения, медиана стабилизируется на уровне 42%.
Возникли все самые распространенные проблемы при воспроизведении: код не запускается, отсутствуют файлы, описание неполное, зависимости повреждены или результаты работы кода не совпадают с результатами в статье.
Еще четыре статьи зависят от моделей, которые уже были отключены. Последующие исследователи, даже если захотят потратить деньги и время, не смогут воспроизвести те же результаты.
SAI также привел два более конкретных примера.
В статье утверждается, что «обучается только 0,77% параметров базовой модели», однако фактически опубликованные контрольные точки были обучены на 6,31% параметров — примерно в 8 раз больше заявленного числа.
Другая статья демонстрирует таблицу надежности, оцененную моделью-судьей, однако в открытом исходном коде невозможно найти эту модель судьи, а также нет скриптов, способных рассчитать числа в таблице.
Плохая статья, высокая прибыль, низкий риск
Результаты воспроизведения SAI можно назвать весьма плохими.
Еще хуже то, что обнаруженные здесь проблемы — это лишь те, которые «могли быть обнаружены».
Те статьи, у которых нет кода, сразу считаются «безупречными».

Даже если код полностью открыт, для проверки научной статьи потребуются огромные затраты времени, сил и денег, а итоговый результат все равно будет неудовлетворительным — невозможно представить, насколько это разочаровывает.
Согласно оценкам SAI на основе публичных цен Google Cloud по мере необходимости, медианная стоимость полного повторного запуска статьи ICML Oral составляет около 8900 долларов США. Из 105 статей 17 статей превысили 100 000 долларов США, а самая дорогая — приблизительно 2,2 миллиона долларов США.
Чем больше статья зависит от масштабных вычислительных ресурсов, тем сложнее её независимо воспроизвести.
Без кода никто не может проверить; даже с кодом未必 кто-то сможет себе это позволить.
Таким образом, статья с проблемами может успешно пройти рецензирование, быть цитируемой, затем включенной в резюме, что принесет возможность поступления, преподавательской должности или работы в крупной лаборатории.
Иногда люди обнаруживают несоответствия, но совещания редко пересматривают результаты, и статьи не всегда отменяются.
Вот что имеется в виду под «за плохое исследование можно получить прибыль, но почти не нести никаких последствий».

Не читайте статьи, но при найме требуйте статьи
В области больших моделей действительно много действительно важных достижений больше не появляются в виде научных статей.
Как инженеру OpenAI, стоящему на переднем крае отрасли, иметь такое ощущение несложно понять. Ведь при наличии большего объема вычислительных ресурсов, более быстрой обратной связи от экспериментов и большого количества непубличных внутренних результатов есть основания «не читать статьи».
Но так сказать — немного странно.
Один комментарий иронично назвал это поведение людей в технологических компаниях «вытащить лестницу после того, как взобрался на берег»: они привлекают исследователей из университетов, опираясь на публично накопленные достижения академического сообщества, вытесняют таланты и GPU, предлагая более высокие цены, всё меньше подвергаются рецензированию коллегами, а затем поворачиваются и заявляют, что академические исследования — «в основном мошенничество».

Немного резко, но по существу.
Люди из этих передовых лабораторий могут «не читать статьи», но тем, кто хочет попасть внутрь, всё равно нужно сначала опубликовать статью.
Для студентов и молодых исследователей без опыта в отрасли научные статьи на ведущих конференциях остаются самым прямым подтверждением исследовательских способностей.
Подача заявки на докторантуру, поиск академической должности и попадание в передовые лаборатории, такие как OpenAI, требуют привлечения внимания через публикации.
Представители отрасли, войдя в крупные лаборатории, пренебрегают научными статьями, но всё ещё используют количество публикаций, уровень конференций и показатели цитируемости для отбора тех, кто остаётся за пределами.
Диссертация оказывается в затруднительном положении: её доверие в распространении знаний подвергается сомнению, однако её ценность в конкуренции за таланты никуда не исчезла.
Таким образом, фраза «большая лаборатория уже не читает статьи» звучит немного высокомерно и надменно, потому что те, кто действительно имеет право не читать статьи, уже преодолели этот барьер благодаря им.
Of course, not all students are meticulously crafted academic villains.
Один исследователь из университета шутливо сказал, что ему бы даже хотелось, чтобы его студенты уже умели писать преувеличенные или даже фальсифицированные статьи.

Некоторые люди пытаются стать академическими мошенниками, а другие всё ещё борются с LaTeX.
Ссылка для справки:
https://x.com/MathewShen42/status/2084465434506768867
https://x.com/kellerjordan0/status/2084721463089902074
https://sai.science/blog/how-much-science-is-verifiable
https://x.com/mengyer/status/2085134204786921886
Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Machine Heart
