Google Research anunció el marco Science One el 30 de julio de 2026, cuyo núcleo es un mecanismo llamado "Chain-of-Evidence" (CoE), que requiere que cada conclusión de la IA en investigación científica esté vinculada a fuentes, código y registros experimentales.Autor del artículo, fuente: 0x9999in1, ME News

TL;DR
- Google Research anunció el marco Science One el 30 de julio de 2026, cuyo núcleo es un mecanismo llamado "Chain-of-Evidence" (CoE), que requiere que cada conclusión de la IA en investigación científica esté vinculada a fuentes, código y registros experimentales.
- Los problemas tradicionales del sistema actual de investigación en IA son graves: fabricar citas, puntuaciones que no se pueden reproducir, y descripciones de métodos que no coinciden con el código. La tasa de citas ilusorias en el sistema base llega hasta un 21%, y la tasa de reproducibilidad de las puntuaciones es tan baja como un 42%.
- Los resultados de Science One son: cero ilusiones en citas, puntuación de verificación perfecta y la mayor coherencia entre métodos y código. Se revela que las 337 citas generadas son todas reales, los 12 experimentos reproducibles coinciden completamente y 14 de las 15 publicaciones son coherentes con el código.
- El diseño clave es "generar mientras se recopila evidencia", no "escribir primero y luego agregar referencias". Las referencias no provienen de la memoria del modelo, sino de una búsqueda real a través de la API de Semantic Scholar.
- Juzgamiento más importante: Science One no sacrificó la competencia por la "honestidad". Obtuvo 2 oros y 2 platas en MLE-Bench y logró el mejor resultado actual en Parameter-Golf.
- El verdadero significado de esto no radica en que otra IA escriba un artículo, sino en que por primera vez convierte lo "verificable" en la base de su arquitectura, no como un parche posterior.
Primero, una pregunta dolorosa: ¿Confías en un artículo escrito por IA?
En los últimos dos años, los sistemas de investigación en IA han avanzado asombrosamente.
Puede leer literatura. Puede formular hipótesis. Puede ejecutar experimentos. Puede escribir completamente un artículo con una estructura sólida y un tono profesional. Solo con una mirada, no podrás encontrar errores.
Pero el problema está escondido en ese "echar un vistazo".
Echar un vistazo no tiene problema, ¿qué pasa si lo investigas más a fondo?
Google Research se dedica a investigar a fondo este asunto. Tomaron cinco sistemas principales de investigación autónoma, generaron un total de 75 artículos en cinco tareas de optimización del sistema, y cuestionaron punto por punto: ¿existe realmente la referencia que citas? ¿El puntaje que reportas sigue siendo válido si vuelves a ejecutar el código? ¿Realmente implementaste el algoritmo que dices en el código?
El resultado no se ve bien.
Cada sistema de referencia cometió al menos un error sistemático. La tasa de ilusiones de citas alcanzó hasta un 21 %, es decir, podría haber una cita por cada cinco que apunte a un artículo que no existe. La tasa de aprobación en la verificación de puntuaciones fue tan baja como un 42 %. La coherencia entre métodos y código fluctuó entre un 20 % y un 80 %.
Míralo bien, ese 42%. Más de la mitad de los artículos, los resultados publicados no se pueden reproducir al volver a ejecutar el código.
This is not a small bug. This is a collapse of trust.
Porque la investigación científica, en su lógica fundamental, se basa en la "reproducibilidad" y la "trazabilidad". El valor de un artículo científico no radica en lo fluido que sea su lectura, sino en si otros pueden seguir sus referencias, su código y sus datos paso a paso para confirmar que no está mintiendo. La IA ha elevado la "calidad superficial" de los artículos, pero ha retirado el pilar más fundamental.
Cuanto más brillante sea la superficie, más ocultos estarán los problemas. Ese es el lugar más peligroso.
La respuesta de Google: No confíes, confía en la cadena
La idea de Science One, en pocas palabras, es muy sencilla.
Dado que no se puede confiar en que la IA sea honesta por sí misma, no esperes que lo sea. Cárgale cadenas.
Esta cadena es la "cadena de evidencia" (Chain-of-Evidence).
Google le encontró una analogía muy precisa: en el ámbito de las bases de datos, existe un concepto llamado ACID, que no importa cómo construyas tu base de datos, solo establece qué propiedades debe cumplir una transacción para ser "confiable". La cadena de evidencia es igual. No te dice cómo construir un agente científico, solo establece: cada cosa que produzcas, si quieres que sea confiable, debe cumplir qué condiciones.
Una regla, dos mitades.
La primera mitad se llama integridad: cada afirmación en el artículo —ya sea una cita, un número, una descripción de método o una conclusión— debe estar respaldada por una cadena de evidencia documentada.
La segunda mitad se llama corrección: esta cadena debe realmente sostener la frase que lleva colgada.
En palabras sencillas: cada cosa que digas debe tener una fuente, y esa fuente debe demostrar realmente lo que dices.
¿Cómo se implementa? La clave está en el momento.
¿Cómo funciona el sistema actual? Primero se escribe extensamente el artículo, y luego se vuelven atrás para agregar referencias y evidencias. Es como crear primero una historia y luego buscar pruebas para respaldarla. Donde no se puede encajar, simplemente se inventa. Así surgen las citas ilusorias.
Science One al revés. En el momento en que genera esta frase, también construye la cadena de evidencia. Las afirmaciones y las pruebas crecen unidas, no se cosen después.
El cambio en este orden secuencial es el alma de todo el asunto.
Míralo por partes: tres módulos, cada uno encargado de una mentira.
La arquitectura de Science One se divide en tres partes, cada una de las cuales aborda con precisión una posibilidad de fraude.
Primera sección, investigador de problemas, encargado de la falsificación de citas.
No depende de la "memoria" del modelo para citar referencias. La memoria del modelo es un caldo de cultivo para ilusiones: puede "recordar" un artículo que en realidad no existe. Science One se conecta directamente a la API de Semantic Scholar para construir un mapa de citas real, leyendo hasta 100 PDF de artículos completos por tema y generando un informe de investigación estructurado. Cada cita en el artículo final proviene de esta búsqueda real mediante API, eliminando por completo la dependencia de la memoria del modelo.
Las citas no se "imaginan", se "buscan". Con este corte, se corta la raíz de las citas ilusorias.
Segundo bloque, motor de detección, encargado de la falsificación de registros experimentales.
Utiliza una estrategia paralela de "exploración-explotación" para probar soluciones simultáneamente en múltiples ramas. En cada ronda, un Solver implementa una solución, y un evaluador especializado asigna una puntuación. Las ramas con mejor rendimiento se refinan repetidamente, y todas las evaluaciones originales se registran en un registro estricto y de solo lectura.
Solo lectura. Estas dos palabras son importantes. Una vez registrada la calificación original, no se puede modificar. ¿Quieres informar una calificación más bonita al escribir tu tesis? Lo siento, el libro mayor está aquí, no se puede cambiar.
Tercer bloque: redactor de tesis y verificador de declaraciones, encargado de asegurar que los métodos y el código coincidan.
Antes de generar realmente el documento, estructura cada afirmación factual, etiquetando cada oración con una etiqueta de evidencia en línea vinculada a un producto específico en el espacio de trabajo. Luego, un verificador especializado compara cada afirmación con la fuente que cita.
¿Qué hacer si no coincide? Aquí hay un detalle especialmente ingenioso: no lo elimina de forma brusca, sino que lo "recupera" — lo expresa con más cautela, devolviéndolo al ámbito que la evidencia puede respaldar. Donde la evidencia llega, ahí llega la afirmación.
Sin exagerar, y tratando de no desperdiciar. Este sentido del equilibrio es más sofisticado que un enfoque único.
Transcript: The cost of honesty, are you getting dumber?
Aquí, una pregunta aguda debería surgir.
¿Darle tantas cadenas a la IA, haciendo que cada frase busque cuidadosamente evidencia, hace que ya no se atreva a explorar con audacia? ¿Acaso se sacrifica la "competencia" en nombre de la "honestidad"?
Esta preocupación es muy razonable. También es la clásica contradicción entre "seguridad" y "capacidad".
La respuesta de Science One es: no.
Primero, examine la columna de honestidad. Bajo el mismo conjunto de protocolos de auditoría —Google lo llama CoE Audit, un revisor automático tipo forense que vuelve a verificar cada cita contra bases de datos académicas en tiempo real— Science One lidera en las cuatro verificaciones de integridad. Tiene cero ilusiones en las citas, cada una apunta a un artículo académico real y recuperable; logra una verificación perfecta de puntuaciones; y alcanza la mayor tasa de consistencia entre métodos y código. Según los datos revelados, todas las 337 citas generadas son reales, los resultados de los 12 experimentos reproducibles coinciden completamente, y 14 de las 15 publicaciones coinciden con el código real.
Compara esos nombres impresionantes en la línea base, como "solucionadores híbridos neurales simbólicos": suenan impresionantes, pero al abrir el código, resulta ser simplemente una regla heurística determinista. Los nombres son para las personas, el código es la verdad.
Vuelve a ver la columna de capacidad.
En las cinco tareas del benchmark ADRS, Science One empató o superó el nivel de los expertos humanos, obteniendo los mejores resultados de todos los sistemas en dos de ellas (Cloudcast y EPLB).
Fuera de este círculo, también se enfrentó a desafíos externos aún más difíciles. En MLE-Bench, compitió en cinco intensas competencias de Kaggle que abarcan imágenes médicas, reconocimiento de granularidad fina y percepción 3D, obteniendo dos medallas de oro y dos de plata; en la competencia de detección 3D de objetos, otros sistemas fallaron por completo, mientras que él obtuvo una puntuación de nivel campeón. En Parameter-Golf, una competencia de entrenamiento en tiempo real de LLM con restricciones estrictas sobre hardware y tamaño de archivo, otros sistemas ni siquiera lograron presentar una solución válida; él no solo cumplió con todas las restricciones, sino que también logró el mejor resultado hasta el 27 de abril de 2026, utilizando verdaderas técnicas algorítmicas novedosas, no simplemente ajustando hiperparámetros al azar.
Entonces la respuesta es clara: honestidad, sin hacerlo tonto.
Eso es exactamente lo que más valoro. Si Science One lograra su limpieza a costa de ser limitado, no tendría ningún valor, porque nadie usaría una herramienta de investigación torpe pero honesta. Pero demuestra que es posible lograr verificabilidad y alto rendimiento al mismo tiempo. Esto convierte a "considerar la honestidad como una restricción rígida" de una iniciativa moral en una opción económicamente viable desde el punto de vista de la ingeniería.
Mi juicio: es importante, pero no lo idealices de inmediato
After saying so many good things, it's time to pour two buckets of cold water.
Primera observación: Google lo escribe claramente al final, Science One es un prototipo de investigación experimental, no una herramienta lista para producción.
Esto no es modestia, es un límite. Las cinco tareas que puede realizar pertenecen a campos como la optimización del sistema, donde existen evaluadores claros y puntuaciones automáticas. En otras palabras, lo bueno y lo malo pueden ser juzgados objetivamente por una máquina. ¿Pero qué pasa con la investigación científica de vanguardia? El valor de muchas hipótesis y el significado de muchas conclusiones no tienen, en el corto plazo, ningún evaluador que pueda puntuarlos. La cadena de evidencia puede prevenir "citaciones falsificadas", pero no puede evitar "elegir un problema mediocre". Se ocupa de la honestidad, pero no de la calidad.
Segundo punto: La cadena de evidencia también tiene un costo. Leer 100 PDFs por tema, construir evidencia para cada frase, vincular etiquetas y verificarlo nuevamente: este proceso no es barato. Mientras persigue la verdad, también consume capacidad de cómputo y tiempo. Cuando se escala, aún no hay respuesta sobre cómo calcular este costo.
Pero después de verter estos dos recipientes de agua, sigo considerando que esto es algo subestimado.
Why?
Porque cambió la forma de hacer la pregunta.
En los últimos dos años, todos se han preguntado: ¿Puede la IA realizar investigación científica? ¿Qué tan fuerte puede ser? Todos competían por su capacidad para resolver problemas y por sus puntuaciones en rankings. La pregunta que plantea Science One es de otra dimensión: ¿Se puede confiar en la investigación realizada por la IA?
Estas dos preguntas no están en la misma categoría.
Cuando cada vez más sistemas puedan generar soluciones elegantes, la capacidad de resolver problemas ya no será un factor diferenciador. En ese momento, lo que realmente los distinguirá será si sus resultados pueden ser confiados. Google ha elevado la "verificabilidad" a la categoría de "ciudadano de primera clase", afirmando que debe ser una restricción arquitectónica, no un remedio posterior: este juicio considero que es correcto y llega en el momento oportuno.
Porque la confianza se acumula lentamente, pero se derrumba rápidamente. Si la investigación en IA, desde sus inicios, agota la confianza de toda la comunidad académica con una serie de artículos que parecen brillantes pero están llenos de vulnerabilidades, luego intentar recuperarla tendrá un costo demasiado alto para soportarlo. Science One está haciendo precisamente eso: reforzar el acero en los cimientos antes de que la confianza se derrumbe.
Epílogo
Volvamos a la pregunta inicial: ¿Te crees un artículo escrito por IA?
Antes de Science One, la respuesta honesta es: no demasiado confiado. Cuanto mejor esté escrito, más debes estar alerta.
Science One no hizo que la IA se volviera más inteligente. Lo que hizo fue otra cosa más sencilla, pero también más difícil: hacer que la IA deje evidencia verificable para cada afirmación que hace.
Ya hay suficientes inteligencias artificiales inteligentes.
La IA que asume responsabilidad por sí misma acaba de comenzar.
Este paso es pequeño, es un prototipo, y aún hay muchos problemas sin resolver. Pero la dirección es correcta. A veces, el verdadero peso de una cosa no radica en lo rápido que puede correr en este momento, sino en dónde ha establecido la regla.
Science One ha movido la métrica de "escribir como si fuera" a "resistir la verificación".
Este movimiento vale la pena.
Referencias
- Google Research Blog. "Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence", 30 de julio de 2026.
- Investigación de IA de Google Cloud. arXiv:2605.26340 Artículo «Science One Framework / Chain-of-Evidence».
- AlphaSignal. 《Google's Science One Framework Fixes AI Research's Fake Citation Crisis》, julio de 2026.
- Zhidingwang. "El marco Science One: Sistema de investigación autónoma verificable basado en cadenas de evidencia", 31 de julio de 2026.
- Sakana AI. arXiv:2504.08066 «The AI Scientist v2» (comparación con la línea base).
- OpenAI. Proyecto GitHub «Parameter-Golf» benchmark.
- arXiv:2410.07095 Artículo de referencia MLE-Bench.
- Benchmark de arXiv:2510.06189 «Automated Design of Research Systems (ADRS)».
