OpenAI ajusta os dados de avaliação do GPT-6 Astra, levantando preocupações sobre transparência

icon MarsBit
Compartilhar
AI summary iconResumo
A OpenAI supostamente alterou os dados de avaliação do GPT-6 Astra, gerando preocupações sobre transparência. A taxa de alucinação do Astra caiu de 4,2% para 2%, enquanto concorrentes como Anthropic e GPT-5.6 Sol viram quedas nos scores de matemática. A OpenAI afirma que as mudanças refletem desempenho preciso, mas pesquisadores da Stanford alertam sobre "benchmaxxing". Com altcoins para acompanhar ganhando tração amid market shifts, dados confiáveis permanecem essenciais. Tendências nos dados de inflação também destacam a necessidade de benchmarks claros e reprodutíveis nos setores de IA e cripto.

Notícia do Beating AI: Desde o lançamento do GPT-6 Astra pela OpenAI em 3 de setembro, diversos dados de benchmarks de avaliação de modelos foram continuamente ajustados, com algumas modificações melhorando o desempenho do Astra, enquanto os resultados de modelos concorrentes apresentaram queda, despertando questionamentos externos sobre "manipulação de rankings" e transparência nos benchmarks. Por exemplo, a taxa de alucinação do Astra foi reduzida de 4,2% para 2%, enquanto a do GPT-5.6 Sol caiu de 12,2% para 9,4%; posteriormente, ambos retornaram aos níveis originais de 4,2% e 12,2%. No benchmark matemático, a pontuação do Fable 5.1 da Anthropic caiu de 87,8% para 78%, e agora subiu novamente para 83%; o GPT-5.6 Sol caiu de 83% para 80,5%, mas depois retornou a 83%. Além disso, o desempenho do Astra no benchmark ARC-AGI-3 aumentou de 98,6% na versão rascunho anterior ao lançamento para 99,99% na página final, e sua pontuação no benchmark de programação subiu levemente de 57,7% para 57,9%. A OpenAI afirmou que os resultados dos benchmarks podem ser influenciados por fatores como versão do modelo, configuração de ferramentas, nível de raciocínio e execução do teste, e que esses ajustes visam garantir que os dados reflitam com maior precisão o desempenho máximo do modelo. No entanto, pesquisadores da Universidade de Stanford sugerem que a reexecução frequente dos benchmarks pode envolver o chamado "Benchmaxxing" — ou seja, ajustar condições de teste para maximizar os resultados nos benchmarks. Especialistas apontam que, com a intensificação da competição entre modelos de IA, os dados dos benchmarks tornaram-se ferramentas cruciais para medir a capacidade dos modelos e conquistar mercado, aumentando a atenção sobre como melhorar a transparência e a reprodutibilidade dos testes.

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.