Ito ngayon ni Claude, talagang naglagay ng malaking pagkakaiba sa ranking ng AI programming!
Sa bagong-refresh na leaderboard ng MirrorCode, ang Claude Fable 5 ay muli ay nasa unang puwesto na may 64% na ganap na tagumpay.
Ang GPT-5.6 Sol, na nasa sunod na pwesto, ay may marka na tatlóan ng kanyang marka!
Nakakapagod ang GPT-5.5 na nasa ikaapat na puwesto. Hindi lang 10% ang kanyang marka, kundi pinagsamantalahan pa nito ang kanyang sariling nakaraang bersyon, ang GPT-5.4.

Mas nakakagulat pa, ang rate ng paglutas ng Fable 5 ay 64% kapag ginagamit ang mga high-resource na wika tulad ng Go; at kahit isalin sa mas kaunting wika tulad ng Ada, ang resulta ay patuloy na mataas sa 61%.
Alam nating sa mundo ng open source, ang Python corpus ay halos 230 beses ang dami ng Ada.
Ngunit sa Fable 5, bumaba lang ang marka ng 3 porsyento.

Mas interesante na.
Kung ang modelo ay nakabatay pangunahin sa pagtala ng gramatika at karaniwang paraan ng pagsulat sa mga sikat na wika, dapat bumaba ang performance pagkatapos magpalit sa Ada.
Ngunit ang kasalukuyang resulta ay nagtuturo sa isang ibang posibilidad—
Ang pinakamalakas na modelo ay nagsisilang na sa mga partikular na corpus at nagsisimula nang matutong bumuo ng isang buong software project mula sa zero.
Nakapag-ka-stuck sa 100% completion line, 10 bilyong Token极限测试
Sa partikular, ang kompletong MirrorCode ay naglalaman ng 25 mga target program, na nakakapalibot sa mga Unix tool, interpreter, data query, bioinformatics, cryptography, at mga compression tool.
Dito, isasama ang model sa isang isolated environment, walang internet, hindi makakakita ng source code ng orihinal na proyekto, at hindi makakapag-download ng third-party dependencies. Ang tanging makakakuha nito ay ang mataas-level na dokumentasyon, ilang makikita na mga pagsubok, at isang orihinal na programa na maaaring tawagan muli at muli.
Susunod, ito ay magpapadala ng mga data patuloy sa orihinal na programa, obserbahan ang output upang hulaan ang lohika sa loob, at pagkatapos ay I-click Sumulat ng isang bagong programa na may magkakasunod na pag-uugali.
Piliin ang 15 na medium at large na target mula sa pinakabagong listahan. Gamitin ang dalawang wika para sa bawat target, at patakbuhin ang bawat wika nang tatlong beses.
At kailangan ng 100% na pagkumpleto ng parehong pampagsubok at nakatagong pampagsubok upang makapasa; hindi sapat ang 99.9%.
Kahit isang edge case lang ang malilimutan, ang buong pagpapatakbo ay kukuha ng pagkabigo.

Upang hikayatin ang modelong punan ang huling ilang bakanteng espasyo, isinampa ng MirrorCode ang isang budget na 10 bilyong Token sa isang pagkakataon, na may pinakamahabang pinapayagang tuloy-tuloy na pagpapatakbo na 7 araw.
Ang pinakamahal na gawain sa papel ay mas nakakatamis: tumagal ang modelo nang 19 araw nang tuloy-tuloy, at ang isang sesyon ay nagkakahalaga ng $2,600.
Sa loob ng 19 na araw, ang modelo ay magpapalit-palit ng pagpapatakbo ng orihinal na programa, paghahambing ng mga resulta, pagdaragdag ng mga function, at pagpapaluloy ng mga pagsubok muli. Kung may error, i-check ang dahilan; kung hindi tugma ang output, palitan ang hipotesis; at kapag nakapasa sa isang bahagi, pumunta sa susunod na kulang.
Ang buong proseso, mas parang isang pag-debug na tumatagal ng ilang araw, kaysa isang pag-generate.

Ang halimbawa ng gotree ang pinakamadaling maintindihan.
Ang kasalukuyang bioinformatics tool ay may halos 16,000 na linya ng Go code at higit sa 40 na mga command.
Ang Claude Opus 4.7 ay nag-waste ng 14 na oras at $251 upang makapasa sa 2,000 sa 2,001 na mga pagsubok, na nagresulta sa 99.95% na pagkumpleto.
Bagaman natigil ng 100% pass line ng MirrorCode dahil sa isang nakakalimutang boundary sa pagtrato ng petsa, napabawas na nito ang orihinal na sukat ng proyekto na base sa linggo sa ilang sampung oras—
Ipinagkakaloob ng Epoch na kung hindi gamitin ang AI, kailangan ng mga inhinyero na tao ng hindi bababa sa 2 hanggang 17 linggo upang matapos ang parehong gawain.
Sa gitna ng isang walang laman na kapaligiran, ang Fable 5 ay nagkakaroon lang ng 3 puntos.
Ang papel ng MirrorCode ay ginamit ang pampublikong training mix ng StarCoder bilang referensya.
Ang Python ay umabot sa halos 8%, samantalang ang Ada ay may 0.034% lamang, kaya mas malaki ang unang isa nang halos 230 beses.

Siyempre, hindi natin malalaman kung gaano karaming Ada code ang nakikita ng closed-source model. Ngunit batay sa open ecosystem, sapat na ang kahalagahan ng kakauntihan ng Ada.
Ang wika na ito ay pangunahing ginagamit sa aerospace, depensa, at iba pang mga sistemang may kritikal na kaligtasan. Sa anumang sukat ng komunidad, bilang ng mga tutorial, o mga open-source project, malayo ito sa pagkakapareho ng Python, JavaScript, o Go.
At hindi nagpapalit ng Fable 5 ng bawat linya ng Go code sa Ada.
Mas parang unang maunawaan kung paano gumagana ang orihinal na programa, bago magpalit ng wika at muling gawin ang parehong pag-uugali.

Kumpara sa iba pang mga modelo, hindi ito ganun kapanatag.
Bumaba ang GPT-5.6 mula sa 24% patungo sa 19%, ang GPT-5.4 mula sa 21% patungo sa 12%, at ang GPT-5.5 ay bumaba pa higit pa mula sa 17% patungo sa 5%. Kapag nagbabago ang wika, agad na lumalaki ang pagkakaiba.
Ibahin ang buong proyekto sa AI
Ngayon, pinagsama-sama na ni Cursor ang mga Agent na higit sa isang daan para sa halos isang linggo, mula sa wala, upang isulat ang higit sa isang milyong linya ng browser code na nakalagay sa libo-libong file.
Ang Anthropic ay nagpapatakbo nang paralelo ng 16 na Claude Agent sa halos 2,000 sesyon, at sa huli ay nabuo nila ang isang C compiler na may 100,000 linya na kayang i-compile ang Linux 6.9 kernel.
Sa sample ng mga indibidwal na user ng Codex na inilabas ng OpenAI hanggang Mayo, 70.2% ay nagsumite ng kahit isang gawain na inaasahang hihigit sa isang oras na trabaho ng tao; 25.6% ay nagsumite ng gawain na hihigit sa walong oras.
Ang mga unit na ibinibigay ng mga tao sa AI ay nagbabago mula sa isang code, isang bug, patungo sa isang hapon, isang linggo, o kaya'y buong proyekto.
Ang 64% ng MirrorCode ay isang kuantipikasyon sa ganitong uri ng “project-level delegation”.
Ipinapaliwanag nito na kung ang layunin ay sapat na malinaw at ang mga resulta ay maaaring awtomatikong matiyak, ang mga modernong modelo ay kaya nang tapusin ang ilang bahagi ng mga katamtaman hanggang malalaking software nang mag-isa.
Para sa bawat isa na nagpapasa ng trabaho sa AI, ang pagbabago ay nasa harap na—
Kahit na dati ay kailangan mong subaybayan ang bawat linya ng code, sa susunod ay mas malamang na titingin ka lang sa mga mahahalagang punto kung nasa tamang landas ba ito.
Ang code ay magiging mas mura.
Ang mga taong makakapagpaliwanag nang malinaw ang mga problema at makakapag-verify nang maayos ang mga resulta, ay magiging mas halaga.
Mga sanggunian: https://epoch.ai/MirrorCode
Nakuha mula sa WeChat public account na "Xinzhiyuan", may-akda: ASI Revelation; editor: Moses
