Berita Pantauan Beating AI: Sejak OpenAI melancarkan GPT-6 Astra pada 3 September, data pelbagai piawaian penilaian model telah berterusan disesuaikan, dengan beberapa ubah suai meningkatkan prestasi Astra sementara prestasi model pesaing tertentu menurun, memicu keraguan dari luar mengenai "penipuan senarai" dan transparansi penilaian AI. Sebagai contoh, kadar ilusi Astra pernah diturunkan dari 4.2% kepada 2%, manakala GPT-5.6 Sol turun dari 12.2% kepada 9.4%, sebelum kedua-duanya kembali kepada 4.2% dan 12.2%. Dalam penilaian matematik, skor Fable 5.1 dari Anthropic pernah turun dari 87.8% kepada 78%, dan kini telah pulih kepada 83%; GPT-5.6 Sol pula turun dari 83% kepada 80.5%, sebelum kembali kepada 83%. Selain itu, skor Astra dalam penilaian ARC-AGI-3 meningkat dari 98.6% dalam draf awal kepada 99.99% dalam halaman akhir, manakala skor penilaian pemrogramannya juga dinaikkan sedikit dari 57.7% kepada 57.9%. OpenAI menyatakan bahawa keputusan penilaian dipengaruhi oleh versi model, konfigurasi alat, tahap penalaran, dan pelaksanaan ujian, dan penyesuaian ini bertujuan memastikan data lebih tepat mencerminkan prestasi terbaik model. Namun, penyelidik dari Universiti Stanford percaya bahawa pelaksanaan semula penilaian yang kerap mungkin melibatkan apa yang dikenali sebagai "Benchmaxxing"—iaitu menyesuaikan syarat ujian untuk memaksimumkan skor piawaian. Ahli industri menunjukkan bahawa seiring dengan meningkatnya persaingan model AI, data penilaian kini menjadi alat penting untuk mengukur kemampuan model dan merebut pasaran, serta bagaimana meningkatkan transparansi dan kebolehulangan ujian piawaian semakin mendapat perhatian yang lebih banyak.
OpenAI Menyesuaikan Data Evaluasi GPT-6 Astra, Meningkatkan Kekhawatiran Tentang Transparansi
MarsBitKongsi
OpenAI dilaporkan telah mengubah data penilaian GPT-6 Astra, memicu kebimbangan mengenai transparansi. Kadar ilusi Astra turun dari 4.2% kepada 2%, sementara pesaing seperti Anthropic dan GPT-5.6 Sol melihat penurunan dalam skor matematik. OpenAI menyatakan perubahan tersebut mencerminkan prestasi yang tepat, tetapi penyelidik dari Stanford memperingatkan tentang "benchmaxxing". Dengan altcoin yang perlu diawasi mendapat tarikan semasa perubahan pasaran, data yang boleh dipercayai tetap menjadi kunci. Trend data inflasi juga menekankan keperluan akan tolok yang jelas dan boleh diulang dalam sektor AI dan kripto.
Sumber:Tunjukkan artikel asal
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini.
Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.