Ginawang mali ng GPT-5.6 Pro ang 30-taong paniniwala sa matematika gamit ang isang prompt na may 58-salita lamang

icon MarsBit
I-share
AI summary iconSummary
Gumamit ang isang mananaliksik na si Dmitry Rybin ng tanging 58 salitang Ingles sa apat na prompt upang gabayan ang GPT-5.6 Pro sa pagtutol sa 30-taong paniniwala ng Dinitz-Garg-Goemans conjecture. Binalik ng AI ang isang directed graph na may 7-node at 9-edge na nagpapakita na hindi natutugunan ng konjetura ang mga kundisyon sa gastos at congestion. Kinakailangan ng proseso ang maraming pagpapabuti at pagpapatotoo. Ang resulta ay nagpapakita ng potensyal ng AI sa paglutas ng mga kumplikadong matematikal na problema, tulad ng paano ang mga mekanismo ng Proof of Work (PoW) at Proof of Stake (PoS) ay nagdadala ng consensus sa blockchain systems.

Ulit ulit na? GPT-5.6, ano ba ang nangyari sa mga kontrang halimbawa ng matematika lately…

Isang hipotesis na Dinitz-Garg-Goemans na umiiral sa larangan ng teoriya ng grap na halos 30 taon, ay kumukuha ng isang kontrabuwis na hinukay ng GPT-5.6 Pro.

Isang researcher na si Dmitry Rybin, ay nag-input lamang ng 4 na prompts sa buong proseso, na may kabuuang 58 na Ingles na salita.

Walang libo-libong salitang prompt engineering, walang komplikadong pormula, pangkabuuang karamihan ay:

Patuloy na mag-aral, patuloy na maghanap, bigyan ako ng isang kompletong kontrabida!!!

Portfolio Optimization

Sa ganitong paraan, patuloy na pinipush ang bawat round, ang GPT-5.6 Pro ay naglabas ng isang talagang nakakagulat na konklusyon—

Ang Dinitz-Garg-Goemans conjecture ay mali.

Portfolio Optimization

Ang huling ibinigay ng AI, kasama ang isang sketch, ay apat na pahina ng sertipiko ng patotoo, eksaktong exhaustive verification program, machine-readable counterexample data, at LaTeX source code.

Pagkatapos, ang isang matematikal na konjektura na nagtagal ng halos 30 taon, ay nasira lamang ng ilang mga “pagsisikil”?

Higit sa 30 taon ng paghula, natuklasan ng GPT-5.6 Pro ang fatal na Bug

Una nating pag-usapan, ano ba talaga ang pinag-aaralan ng hypotesis na Dinitz-Garg-Goemans na may mahabang pangalan.

Maaari nating isipin ito nang direkta bilang isang “problemang pagdadala”.

Kung ang isang warehouse ay nagdadala ng mga produkto sa maraming destinasyon, pinapayagan ang paghahati ng isang pagkakasunod-sunod upang magkaroon ng iba’t ibang ruta—

Kalahati sa highway, kalahati sa pagsisilbi ng national road, basta't lahat ay nadadala sa dulo, OK lang~

Sa ilalim ng mga patakaran na hindi maaaring hatiin, bawat batch ay dapat puno at sundin ang isang ruta, hindi maaaring hatiin!!!

Sa totoong buhay, karaniwan lang ang ganitong sitwasyon, tulad ng sa network data, logistics orders, traffic scheduling, at supply chain allocation, kung saan makakatagpo ka ng katulad na problema:

Ang matematikal na pinakamabuting solusyon ay maaaring hatiin ang isang gawain sa walang hanggang maliit na bahagi, ngunit sa katotohanan, hindi mo maaaring hatiin ang isang sasakyan o isang order sa 0.37 bahagi.

Portfolio Optimization

At once na ipagbawal ang paghahati, mahirap na direktang gamitin ang dating pinakamabuting solusyon.

Ang mga kargamento na dati ay nakalat sa maraming daan, ay ngayon ay kailangang i-press sa isang ruta lamang, at malamang na biglaang tumataas ang load sa ilang mga daan.

Kaya, ang tunay na isusolusyon ng tanong na ito ay:

Paano baguhin ang plano na “maaaring dalhin sa mga bahagi” patungo sa “kailangang dalhin bilang isang buong grupo”, habang hindi nagiging sobrang sira ang trapiko?

Noong 1999, ipinakilala ni Yefim Dinitz, Naveen Garg, at Michel Goemans ang klasikong papel sa larangan ng single-source unsplittable flow at ipinatotohanang maaaring kontrolin ang ganitong pagkabigat sa isang tiyak na saklaw.

Ngunit pagkatapos malutas ang “baka sobrang siksik,” may isa pang napakatotoong tanong: baka magmura ba?

Kaya ipinakilala naman ni Goemans, isang kilalang eksperto sa larangan ng combinatorial optimization, ang isang mas malakas na bersyon na may gastos—

Habang nananatili sa itaas na limitasyon ng overload, ang kabuuang gastos ay dapat din na hindi hihigit sa orihinal na distribuhyon na solusyon.

Sa madaling salita, dati ay maaari mong i-split ang pagdadala upang maging murang at hindi sobrang abala, kaya ngayon, kung ang hiling ay ang bawat pagkakasunod-sunod ay dapat maglakbay sa isang buong ruta, teoretikal na dapat mayroon tayong parehong murang solusyon na kung saan ay maaaring magdulot ng pagkaabala sa isang pagkakasunod-sunod lamang.

Gayunpaman, ang tila lubos na intuitibong hipotesis na ito ay hindi pa patunayan sa pangkalahatang istrakturang grap, at ang mga susunod na pag-aaral ay nagtagumpay lamang sa ilang partikular na kaso.

Sa mga taon na sumunod, ang hipotesis na ito ay hindi pa patunayan o refutado.

Portfolio Optimization

At ang halimbawang ibinigay ng GPT-5.6 Pro ay tumpak na nagpapahinga sa dalawang bagay na kailangang magkasama sa hipotesis:

Hindi dapat sobrang dami, at hindi rin dapat magmahal.

Nagbuo siya ng isang maliit na grap na may 7 mga node at 9 na directed edges, kung saan may isang karaniwang simula at tatlong destinasyon, na may mga pangangailangan sa kargamento na 15, 10, at 15:

Portfolio Optimization

May dalawang opsyonal na ruta bawat batch:

Mas mataas ang gastos sa isang ruta, kailangan ng ₱30 bawat pagkumpleto ng order; samantalang ang ibang ruta ay may gastos na ₱0, ngunit kailangan magbahagi ng ilang daan sa ibang order.

Kung pinapayagan ang paghahati, maaaring magkaroon ng ilang bahagi ng tatlong kargamento na gumagamit ng daan na may bayad at ilang bahagi na gumagamit ng libreng daan, na nagtatapos sa kabuuang gastos na 58.

pero! Kapag kailangan na piliin ang isang ruta nang buo para sa bawat pagkakaroon ng kargamento, ang mga problema ay dumating...

Ang konklusyon ng GPT-5.6 Pro ay ang tatlong libreng opsyon ay talagang magkakasalungat! Magkakasalungat! Magkakasalungat!

Kapag pinipili ang parehong libreng ruta para sa dalawang pagkakataon, magkakaroon sila ng komon na pagkakasaliksik sa isang bahagi ng daan, na nagdudulot ng aktwal na load na 25, 30 o 40; samantalang ang pinapayagang limitasyon para sa bawat daan ay 24, 29 o 39 lamang.

Bawat beses, may labis na isang yunit.

Kaya, upang panatilihin ang limitasyon sa load ayon sa hipotesis, maaaring magkaroon ng pinakamaraming isang batch sa mga tatlong batch na gumamit ng libreng opsyon.

Ang dalawang hulang pagkakataon ay kailangang pumili ng route na may bayad.

Ang cost bawat batch ay 30, kaya ang kabuuang cost ng dalawang batch ay: 60.

Nakakabuo ito ng isang sitwasyon na hindi maaaring matugunan nang sabay-sabay: upang kontrolin ang load ng daan sa loob ng itinakdang limitasyon, ang pinakamababang gastos ay 60; upang bawasan ang gastos pabalik sa orihinal na 58, kailangang lumabas sa limitasyon ang kahit isang daan.

At ang spekulasyon ay kumbinsi na ang dalawang kondisyon ay maaaring maisagawa nang sabay-sabay.

Portfolio Optimization

At ang pag-verify ng kontrabidang ito ay hindi gaanong kumplikado tulad ng inaasahan.

Mayroong dalawang daan bawat tatlong destinasyon, kaya mayroon lamang 2³=8 na kombinasyon.

Kapag isinasaayos ang bawat isa sa 8 posibilidad, makikita na ang 4 sa kanila ay sumasapat sa mga kinakailangang kapasidad, na may gastos na 90, 60, 60 at 60; habang ang iba pang 4, bagaman mas mura, ay lahat ay may sobrang load sa daan.

Lahat ng mga sitwasyon ay maaaring ma-check nang buo, at walang nakatagong daan na naliligaw.

Ibig sabihin, kahit anong pagkakasulat ng larawan na may katumbas na depinisyon sa orihinal na hipotesis, sapat na ang dalawang yunit na puwang sa pagitan ng 58 at 60 upang sirain ang hipotesis.

Patuloy na pagsisikap sa apat na pagkakataon, nakamit ang isang halimbawang kontraryo mula sa GPT-5.6

Ang pinakamalaking interes sa bagay na ito ay nakatago sa pampublikong usapan ni Rybin at ng GPT-5.6 Pro.

Nakikita ko ang isang matematikal na konjetura na nakahintay ng halos 30 taon ay napalagda ng AI, agad kong isipin na mayroong isang buong serye ng napakakomplikadong prompt na sumisigaw nang paulit-ulit!!

Sa totoo lang, kami pa rin ang malaking E.

Dahil sa unang utos na ibinigay ni Rybin kay GPT-5.6 Pro, maliban sa mga kasamang file, ang lahat ng iba ay talagang simpleng salita lang:

Portfolio Optimization

Oo, ganito lamang ang simpleng anyo nito.

Pagkatapos ay sumunod agad ang GPT-5.6 Pro sa mga utos at nagsimula magtrabaho.

Una niyang itinatag ang isang paraan ng pag-verify ng linear programming, at pagkatapos ay sinubukan ang iba’t ibang istruktura tulad ng hypercube, hierarchical graph, at merge–fork network, at sinuri ang libu-libong maliit na instance.

Pagkatapos ng malalim na paghahanap, ang unang sagot na ibinigay ng modelo ay: Walang natagpuang epektibong kontrabidyo. (doge)

Kahit ang GPT-5.6 Pro ay nagbabala nang serio na kung ang mga approximative construction na natuklasan sa kasalukuyan ay isasama bilang counterexample, magiging mali ang matematikal na konklusyon.

Nagtrabaho na ako nang buong pagpapakusà, ngunit talagang hindi ko kayang lutasin ang problemang ito!!!

Hindi naglalabas ng bagong pormula o personal na gabay ang ating pangunahing tauhan na si Rybin, kundi nagbigay lang ng simpleng sagot:

Magpatuloy sa pag-aaral at hanapin ang isang kompletong, walang kondisyon na kontrabildo哈~

Portfolio Optimization

Kaya sinubukan muli ni GPT-5.6 Pro ang paghahanap, ngunit sa pangalawang pagkakataon, nagkamali pa rin.

Patuloy ni Rybin ang pag-push, hinihingi na batay sa malalim na pag-unawa sa istruktura ng problema, muna siyang magbuo ng malinaw na estratehiya bago maghanap.

Sa ikatlong ronda, ang modelo ay naiwasan na ang hanapin sa isang ruta na mayroon lamang 24 estado, at tila malapit na sa sagot.

Gayunpaman, hindi pa rin nakapagbigay ang AI ng kompletong kontrabidyo...

Sa panahong ito, naglabas ang Rybin ng ikaapat na paalala: Sapat na ang ilang mga resulta, hayaan nating tapusin natin ito gamit ang isang buo at walang kondisyon na kontrabildo.

Portfolio Optimization

Sige na, nagsasalita na ako hanggang dito.

Sa pagkakataong ito, ang GPT-5.6 Pro ay naglabas ng huling halimbawang grap na binubuo ng 7 mga node at 9 mga directed edge—apat na prompt, kabuuang 58 na Ingles na salita.

Walang libo-libong salitang character setup, walang dosen-dosenang komplikadong patakaran, maaaring maipaliwanag ang buong teksto sa:

Ipinapag-iiwan ko! Ipinapag-iiwan ko! Ipinapag-iiwan ko pa!

Portfolio Optimization

Ngunit kung i-trace ang buong usapan, makikita na ang GPT-5.6 Pro ay nagdusa rin sa ilang pagkakamali sa loob ng mga oras na ito…

Madalas na nakakakita ang AI ng mga kasalungat na halimbawa na tila wasto, ngunit kapag natapos na nito ang pagsusuri ng lahat ng mga ruta, natuklasan nito na mayroong ilang “mga mixed path” na nakatago sa network na naaabot noon.

Ang mga path na ito ay kukunin ang mga bahagi mula sa iba’t ibang pre-set na ruta, at pipiliin muli ang mga ito upang stablishin ang bagong paraan, at palaging iwasan ang orihinal na limitasyon ng kapasidad ng modelo.

Ang resulta ay, habang tila mayroon nang nagawa nang kontra-eksemplong matatag, pagkatapos ng pagsusuri, bumagsak na naman.

Ang GPT-5.6 Pro ay nagsummarize nang malinaw sa gitna din:

Hindi sapat ang pagsusuri lamang sa ilang sandaang pre-set na ruta. Dapat isama sa kalkulasyon ng isang totoong kontra-eksemplong lahat ng posibleng hindi ma-divert na ruta sa network.

Portfolio Optimization

Ito ay nagiging medyo mahirap sa buong pakikipagtulungan ng tao at makina.

Sa surface, ang tanging kontribusyon ni Rybin ay 58 na salita, ngunit ang tunay na mahalagang galaw ay ang kanyang kakayahang masuri na ang mga resulta ng unang tatlong round ng model ay mga pansamantalang resulta at paulit-ulit na pagsisigla na huwag magsauli nang maaga.

Pagkatapos makita nito ni Professor Ethan Mollick ng Wharton, nagtakda siya ng isang bagong tanong:

Sino ang dapat ituring na may-akda ng gawaing ito, si Rybin na sumulat ng 58 na salita, o si GPT-5.6 Pro na nagpatuloy sa pagpapalawak ng ilang oras?

Sa totoo lang, anuman ang paraan ng pagkalkula sa pangalan, ang talakayang ito ay nagbigay ng isang napakasimpleng karanasan sa paggamit ng AI—

Ang pinakamabisang prompt para ipagawa sa AI ay minsan ay maaaring simpleng gawin itong asno na patuloy na magmimina nang walang paghinto.

Sa nakaraang linggo, mula sa Jacobi conjecture hanggang sa Dinitz-Garg-Goemans, ang bilis ng AI sa paghahanap ng mga mathematical counterexamples ay talagang nagsimulang mukhang medyo sobra na…

Nakamula sa WeChat public account na "Quantum Bit", may-akda: Meng Yao

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.