Noticias de Beating AI: Desde que OpenAI lanzó GPT-6 Astra el 3 de septiembre, varios datos de evaluación de modelos han sido ajustados continuamente; algunas modificaciones mejoran el rendimiento de Astra, mientras que los resultados de algunos modelos competidores han disminuido, generando dudas externas sobre el "manipulación de rankings" y la transparencia de las evaluaciones. Por ejemplo, la tasa de alucinaciones de Astra se redujo temporalmente del 4,2% al 2%, mientras que la de GPT-5.6 Sol descendió del 12,2% al 9,4%; posteriormente, ambos volvieron a sus valores originales del 4,2% y 12,2%. En evaluaciones matemáticas, la puntuación de Fable 5.1 de Anthropic bajó temporalmente del 87,8% al 78%, y actualmente ha recuperado el 83%; GPT-5.6 Sol descendió del 83% al 80,5%, luego volvió al 83%. Además, el rendimiento de Astra en la evaluación ARC-AGI-3 aumentó del 98,6% en el borrador previo al lanzamiento hasta el 99,99% en la página final, y su puntuación en evaluaciones de programación se incrementó ligeramente del 57,7% al 57,9%. OpenAI indicó que los resultados de evaluación pueden verse afectados por factores como la versión del modelo, la configuración de herramientas, el nivel de razonamiento y las ejecuciones de prueba, y que estos ajustes buscan garantizar que los datos reflejen con mayor precisión el mejor rendimiento del modelo. Sin embargo, investigadores de la Universidad de Stanford consideran que ejecutar repetidamente las evaluaciones podría implicar lo que se conoce como "Benchmaxxing", es decir, ajustar las condiciones de prueba para maximizar los puntajes de referencia. Expertos del sector señalan que, a medida que se intensifica la competencia entre modelos de IA, los datos de evaluación se han convertido en una herramienta clave para medir la capacidad de los modelos y competir por el mercado, y cada vez se presta más atención a cómo mejorar la transparencia y la reproducibilidad de las pruebas de referencia.
OpenAI ajusta los datos de evaluación de GPT-6 Astra, generando preocupaciones sobre la transparencia
MarsBitCompartir
Se informa que OpenAI ha modificado los datos de evaluación de GPT-6 Astra, generando preocupaciones sobre la transparencia. La tasa de alucinaciones de Astra disminuyó del 4,2% al 2%, mientras que competidores como Anthropic y GPT-5.6 Sol experimentaron caídas en sus puntajes de matemáticas. OpenAI afirma que los cambios reflejan un desempeño preciso, pero investigadores de Stanford advierten sobre el "benchmaxxing". Mientras las altcoins a vigilar ganan impulso ante los cambios del mercado, los datos confiables siguen siendo clave. Las tendencias de los datos de inflación también destacan la necesidad de benchmarks claros y reproducibles en los sectores de IA y cripto.
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.