Dominante ng Claude Fable 5 ang AI coding benchmark na may 64% na rate ng tagumpay

icon MarsBit
I-share
AI summary iconSummary
Ang Claude Fable 5 ay namumuno sa mga benchmark ng AI coding na may 64% na rate ng tagumpay sa MirrorCode, na hihigit sa GPT-5.6 Sol at GPT-5.5. Ito ay nakakahandle ng parehong pangunahin at niche na mga wika tulad ng Go at Ada, na may tanging 3% pagbaba sa performance para sa mga huli. Kailangan ng MirrorCode ang 100% na test coverage nang walang access sa code, na patotoo sa kakayahan ng Fable 5 sa pag-reconstruct ng lohika. Habang tumatanggap ng atensyon ang mga altcoin na dapat bisitahin, ang fear and greed index ay nananatiling pangunahing sukat para sa mga trader na sinusubaybayan ang market sentiment.

Ito ngayon ni Claude, talagang naglagay ng malaking pagkakaiba sa ranking ng AI programming!

Sa bagong-refresh na leaderboard ng MirrorCode, ang Claude Fable 5 ay muli ay nasa unang puwesto na may 64% na ganap na tagumpay.

Ang GPT-5.6 Sol, na nasa sunod na pwesto, ay may marka na tatlóan ng kanyang marka!

Nakakapagod ang GPT-5.5 na nasa ikaapat na puwesto. Hindi lang 10% ang kanyang marka, kundi pinagsamantalahan pa nito ang kanyang sariling nakaraang bersyon, ang GPT-5.4.

AI programming

Mas nakakagulat pa, ang rate ng paglutas ng Fable 5 ay 64% kapag ginagamit ang mga high-resource na wika tulad ng Go; at kahit isalin sa mas kaunting wika tulad ng Ada, ang resulta ay patuloy na mataas sa 61%.

Alam nating sa mundo ng open source, ang Python corpus ay halos 230 beses ang dami ng Ada.

Ngunit sa Fable 5, bumaba lang ang marka ng 3 porsyento.

AI programming

Mas interesante na.

Kung ang modelo ay nakabatay pangunahin sa pagtala ng gramatika at karaniwang paraan ng pagsulat sa mga sikat na wika, dapat bumaba ang performance pagkatapos magpalit sa Ada.

Ngunit ang kasalukuyang resulta ay nagtuturo sa isang ibang posibilidad—

Ang pinakamalakas na modelo ay nagsisilang na sa mga partikular na corpus at nagsisimula nang matutong bumuo ng isang buong software project mula sa zero.

Nakapag-ka-stuck sa 100% completion line, 10 bilyong Token极限测试

Sa partikular, ang kompletong MirrorCode ay naglalaman ng 25 mga target program, na nakakapalibot sa mga Unix tool, interpreter, data query, bioinformatics, cryptography, at mga compression tool.

Dito, isasama ang model sa isang isolated environment, walang internet, hindi makakakita ng source code ng orihinal na proyekto, at hindi makakapag-download ng third-party dependencies. Ang tanging makakakuha nito ay ang mataas-level na dokumentasyon, ilang makikita na mga pagsubok, at isang orihinal na programa na maaaring tawagan muli at muli.

Susunod, ito ay magpapadala ng mga data patuloy sa orihinal na programa, obserbahan ang output upang hulaan ang lohika sa loob, at pagkatapos ay I-click Sumulat ng isang bagong programa na may magkakasunod na pag-uugali.

Piliin ang 15 na medium at large na target mula sa pinakabagong listahan. Gamitin ang dalawang wika para sa bawat target, at patakbuhin ang bawat wika nang tatlong beses.

At kailangan ng 100% na pagkumpleto ng parehong pampagsubok at nakatagong pampagsubok upang makapasa; hindi sapat ang 99.9%.

Kahit isang edge case lang ang malilimutan, ang buong pagpapatakbo ay kukuha ng pagkabigo.

AI programming

Upang hikayatin ang modelong punan ang huling ilang bakanteng espasyo, isinampa ng MirrorCode ang isang budget na 10 bilyong Token sa isang pagkakataon, na may pinakamahabang pinapayagang tuloy-tuloy na pagpapatakbo na 7 araw.

Ang pinakamahal na gawain sa papel ay mas nakakatamis: tumagal ang modelo nang 19 araw nang tuloy-tuloy, at ang isang sesyon ay nagkakahalaga ng $2,600.

Sa loob ng 19 na araw, ang modelo ay magpapalit-palit ng pagpapatakbo ng orihinal na programa, paghahambing ng mga resulta, pagdaragdag ng mga function, at pagpapaluloy ng mga pagsubok muli. Kung may error, i-check ang dahilan; kung hindi tugma ang output, palitan ang hipotesis; at kapag nakapasa sa isang bahagi, pumunta sa susunod na kulang.

Ang buong proseso, mas parang isang pag-debug na tumatagal ng ilang araw, kaysa isang pag-generate.

AI programming

Ang halimbawa ng gotree ang pinakamadaling maintindihan.

Ang kasalukuyang bioinformatics tool ay may halos 16,000 na linya ng Go code at higit sa 40 na mga command.

Ang Claude Opus 4.7 ay nag-waste ng 14 na oras at $251 upang makapasa sa 2,000 sa 2,001 na mga pagsubok, na nagresulta sa 99.95% na pagkumpleto.

Bagaman natigil ng 100% pass line ng MirrorCode dahil sa isang nakakalimutang boundary sa pagtrato ng petsa, napabawas na nito ang orihinal na sukat ng proyekto na base sa linggo sa ilang sampung oras—

Ipinagkakaloob ng Epoch na kung hindi gamitin ang AI, kailangan ng mga inhinyero na tao ng hindi bababa sa 2 hanggang 17 linggo upang matapos ang parehong gawain.

Sa gitna ng isang walang laman na kapaligiran, ang Fable 5 ay nagkakaroon lang ng 3 puntos.

Ang papel ng MirrorCode ay ginamit ang pampublikong training mix ng StarCoder bilang referensya.

Ang Python ay umabot sa halos 8%, samantalang ang Ada ay may 0.034% lamang, kaya mas malaki ang unang isa nang halos 230 beses.

AI programming

Siyempre, hindi natin malalaman kung gaano karaming Ada code ang nakikita ng closed-source model. Ngunit batay sa open ecosystem, sapat na ang kahalagahan ng kakauntihan ng Ada.

Ang wika na ito ay pangunahing ginagamit sa aerospace, depensa, at iba pang mga sistemang may kritikal na kaligtasan. Sa anumang sukat ng komunidad, bilang ng mga tutorial, o mga open-source project, malayo ito sa pagkakapareho ng Python, JavaScript, o Go.

At hindi nagpapalit ng Fable 5 ng bawat linya ng Go code sa Ada.

Mas parang unang maunawaan kung paano gumagana ang orihinal na programa, bago magpalit ng wika at muling gawin ang parehong pag-uugali.

AI programming

Kumpara sa iba pang mga modelo, hindi ito ganun kapanatag.

Bumaba ang GPT-5.6 mula sa 24% patungo sa 19%, ang GPT-5.4 mula sa 21% patungo sa 12%, at ang GPT-5.5 ay bumaba pa higit pa mula sa 17% patungo sa 5%. Kapag nagbabago ang wika, agad na lumalaki ang pagkakaiba.

Ibahin ang buong proyekto sa AI

Ngayon, pinagsama-sama na ni Cursor ang mga Agent na higit sa isang daan para sa halos isang linggo, mula sa wala, upang isulat ang higit sa isang milyong linya ng browser code na nakalagay sa libo-libong file.

Ang Anthropic ay nagpapatakbo nang paralelo ng 16 na Claude Agent sa halos 2,000 sesyon, at sa huli ay nabuo nila ang isang C compiler na may 100,000 linya na kayang i-compile ang Linux 6.9 kernel.

Sa sample ng mga indibidwal na user ng Codex na inilabas ng OpenAI hanggang Mayo, 70.2% ay nagsumite ng kahit isang gawain na inaasahang hihigit sa isang oras na trabaho ng tao; 25.6% ay nagsumite ng gawain na hihigit sa walong oras.

Ang mga unit na ibinibigay ng mga tao sa AI ay nagbabago mula sa isang code, isang bug, patungo sa isang hapon, isang linggo, o kaya'y buong proyekto.

Ang 64% ng MirrorCode ay isang kuantipikasyon sa ganitong uri ng “project-level delegation”.

Ipinapaliwanag nito na kung ang layunin ay sapat na malinaw at ang mga resulta ay maaaring awtomatikong matiyak, ang mga modernong modelo ay kaya nang tapusin ang ilang bahagi ng mga katamtaman hanggang malalaking software nang mag-isa.

Para sa bawat isa na nagpapasa ng trabaho sa AI, ang pagbabago ay nasa harap na—

Kahit na dati ay kailangan mong subaybayan ang bawat linya ng code, sa susunod ay mas malamang na titingin ka lang sa mga mahahalagang punto kung nasa tamang landas ba ito.

Ang code ay magiging mas mura.

Ang mga taong makakapagpaliwanag nang malinaw ang mga problema at makakapag-verify nang maayos ang mga resulta, ay magiging mas halaga.

Mga sanggunian: https://epoch.ai/MirrorCode

Nakuha mula sa WeChat public account na "Xinzhiyuan", may-akda: ASI Revelation; editor: Moses

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.