Un investigador de OpenAI afirma que los principales laboratorios de IA ya no leen artículos

icon MarsBit
Compartir
AI summary iconResumen
Un investigador de OpenAI afirma que los principales laboratorios de IA ya no leen artículos debido a afirmaciones exageradas y baja reproducibilidad. Una auditoría liderada por la Universidad de Chicago encontró que solo 8 de 105 artículos top de ICML 2026 pudieron verificarse por completo. Faltaban código, documentación incompleta y resultados no reproducibles eran comunes. El costo para reproducir un artículo alcanzó los $2.2 millones. Los operadores que evalúan activos relacionados con IA deben considerar cuidadosamente la relación riesgo-recompensa. Los niveles de soporte y resistencia en el mercado podrían cambiar a medida que disminuye la confianza en la investigación de IA.

¿La gente del laboratorio前沿 casi no lee artículos académicos?

Un investigador de OpenAI disparó contra tres conferencias principales: ¡Demasiado exageración y fraude!

SAI

La causa fue un artículo de ICLR cuyo rendimiento era tan bueno que resultaba incomprensible; los usuarios de internet lo estudiaron y descubrieron el "secreto".

SAI

¿Acaso publicar artículos en conferencias de primer nivel ha evolucionado hasta este punto?

SAI

Primero, revisar si el código es de código abierto; segundo, verificar si el método experimental oculta alguna «treta»; y solo en tercer lugar, evaluar si los resultados obtenidos respaldan la conclusión principal: tras esta serie de preguntas, ¿cuántos artículos de conferencias de primer nivel resisten la prueba?

Alguien realmente lo hizo.

De 105 artículos, solo 8 están «aprobados»

En julio de este año, SAI, cofundada por Chenhao Tan, profesor asociado de ciencias de la computación y ciencias de los datos de la Universidad de Chicago, anunció un gran «experimento de revisión por pares».

Ellos seleccionaron las 168 ponencias orales completas de ICML 2026.

Este año, ICML recibió 23,918 contribuciones, y solo 168 obtuvieron la categoría de Oral, lo que representa aproximadamente el 0.7%.

En otras palabras, lo que revisa SAI ya es el top de más de 20,000 envíos filtrados.

Además de leer el artículo, el diseño experimental y los resultados como lo harían los revisores tradicionales, SAI Review descarga el código, los modelos y los datos, configura el entorno y ejecuta los experimentos, luego compara punto por punto los resultados obtenidos con el texto original del artículo.

SAI revisó las 168 presentaciones orales, de las cuales solo 104 tenían código de artículo abierto, y finalmente completó 105 reproducciones completas.

De ellos, solo 34 replicaron más del 40 % de las afirmaciones; solo 8 superaron una tasa de replicación del 80 %.

SAI

Independientemente de si cada artículo contiene al menos 1, 3 o 5 afirmaciones verificables, la mediana de las puntuaciones de reproducción siempre se mantuvo entre el 28% y el 30%, con pocos cambios en la distribución general.

SAI

Tras excluir experimentos que no se ejecutaron, se interrumpieron anticipadamente o excedieron las capacidades del hardware, la mediana de las puntuaciones de reproducción sigue siendo solo del 42% al 50%; cuando cada artículo contiene al menos tres afirmaciones verificables, la mediana se estabiliza en el 42%.

Se encontraron los problemas más comunes en la reproducción: el código no se ejecuta, faltan archivos, las instrucciones son incompletas, las dependencias están dañadas o los resultados del código no coinciden con los de la publicación.

Además, cuatro artículos dependen de modelos ya retirados. Los investigadores posteriores, aunque estén dispuestos a gastar dinero y tiempo, no podrán reproducir los mismos resultados.

SAI también enumeró dos ejemplos más específicos.

Un artículo de investigación presenta como principal ventaja «entrenar solo el 0.77% de los parámetros del modelo base», pero el punto de control publicado realmente entrenó el 6.31% de los parámetros, aproximadamente 8 veces el número afirmado.

Otro artículo presenta una tabla de confiabilidad calificada por un modelo juez, pero en el código abierto no se encuentra este modelo juez ni ningún script que pueda calcular los números de la tabla.

Papel de baja calidad, rendimiento alto y bajo riesgo

Los resultados de la reproducción de SAI pueden considerarse bastante malos.

Lo peor es que los problemas encontrados aquí son solo aquellos «con condiciones para ser descubiertos».

Los artículos sin código se consideran directamente «irreprochables».

SAI

Incluso si el código está completamente abierto, verificar un artículo científico requiere una cantidad enorme de tiempo, esfuerzo y dinero, y el resultado final aún así podría ser decepcionante, sin saber cuánto se estaría desesperado.

Según la estimación basada en los precios a la carta públicos de Google Cloud proporcionados por SAI, el costo mediano para volver a ejecutar completamente un artículo oral de ICML es de aproximadamente 8,900 dólares estadounidenses. De los 105 artículos, 17 superan los 100,000 dólares, y el más caro alcanza casi 2.2 millones de dólares.

Cuanto más depende un artículo científico de grandes recursos de cómputo, más difícil es reproducirlo de forma independiente.

Sin código, nadie puede verificarlo; con código, tampoco necesariamente alguien puede costear este costo.

Por lo tanto, un artículo con problemas puede pasar fácilmente la revisión, recibir citas, incluirse en un currículum y abrir puertas a admisiones, puestos académicos u oportunidades laborales en grandes laboratorios.

Algunas veces se descubre que los resultados no coinciden, las reuniones rara vez se revisan nuevamente, y los artículos no siempre se retractan.

Esto es lo que se dice en los comentarios: «hacer una mala investigación genera beneficios, pero casi no tiene costo».

SAI

No leas los artículos, pero para contratar sí se revisan los artículos.

En el campo de los modelos grandes, ciertamente muchos avances realmente importantes ya no aparecen en forma de artículos académicos.

Como ingeniero de OpenAI, estar en la vanguardia de la industria, es fácil comprender este sentimiento. Después de todo, con más capacidad de cómputo, retroalimentación más rápida de los experimentos y una gran cantidad de resultados internos no publicados, se tiene la confianza de «no leer artículos».

Pero decirlo así suena un poco sutil.

Un comentario satiriza que las personas en las empresas tecnológicas están "subiéndose al bote y retirando la escalera": reclutan investigadores de las universidades, se basan en los logros públicamente acumulados por la comunidad académica, roban talento y GPU con precios más altos, cada vez menos aceptan revisión por pares, y finalmente giran y declaran que la investigación académica "es principalmente una estafa".

SAI

Un poco áspero, pero ciertamente tiene sentido.

Las personas de estos laboratorios de vanguardia pueden «no leer artículos», pero quienes deseen ingresar aún deben publicar artículos.

Para estudiantes y jóvenes investigadores sin experiencia industrial, los artículos de conferencias de alto nivel siguen siendo el certificado más directo para demostrar capacidad de investigación.

Solicitar un doctorado, buscar un puesto académico o ingresar a laboratorios de vanguardia como OpenAI requiere obtener atención a través de artículos científicos.

La industria desprecia los artículos tras ingresar a grandes laboratorios, pero aún utiliza la cantidad de artículos, el nivel de conferencias y los índices de citas para seleccionar a quienes están fuera.

El ensayo cae así en una posición incómoda: su credibilidad en la transmisión de conocimiento es cuestionada, pero su valor en la competencia por talento no ha desaparecido en absoluto.

Entonces, decir que "el gran laboratorio ya no lee artículos" suena un poco altivo y arrogante, porque quienes realmente tienen derecho a no leer artículos ya han cruzado ese umbral gracias a ellos.

Of course, not all students are meticulously crafted academic villains.

Un investigador universitario bromeó diciendo que preferiría que sus estudiantes ya tuvieran la capacidad de escribir un artículo exagerado o incluso falsificado.

SAI

Algunas personas están tratando de convertirse en fraude académico, mientras que otras aún luchan con LaTeX.

Enlace de referencia:

https://x.com/MathewShen42/status/2084465434506768867

https://x.com/kellerjordan0/status/2084721463089902074

https://sai.science/blog/how-much-science-is-verifiable

https://x.com/mengyer/status/2085134204786921886

Este artículo proviene del canal de WeChat "Machine Heart" (ID: almosthuman2014), autor: Machine Heart

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.