Ang shelf life ng “pinakamalakas na model” ay umuunlad.May-akda ng artikulo, pinagkukunan: Dingjiao
Sa loob ng isang buwan, isinilang ang 9 na flagship models, isang bagay na hindi karaniwan sa industriya ng malalaking modelo.
Mula sa unang araw ng buwan, nang ipinalabas ng Tencent ang opisyal na bersyon at in-open source ang Hunyuan Hy3, hanggang sa huling araw ng buwan nang ipinalabas ng Anthropic ang Claude Opus 5, ang mga modelo tulad ng Kimi K3, Qwen3.8-Max preview, at Grok 4.5 ay tumungo nang paulit-ulit. Ang July ay naging isang malaking pagsisikap sa paglalabas na hindi karaniwan sa nakaraang taon.

Hindi magkakapareho ang oras na pinili ng bawat kumpanya. Ilan ay naglunsad pagkatapos ng pag-update ng kanilang mga kalaban, ilan naman ay naglunsad sa panahon ng World Artificial Intelligence Conference, habang ang iba ay sumagot sa kompetisyon sa pamamagitan ng pag-adjust ng presyo.
Ngunit hindi lang ang July ang may malaking bilang ng paglalabas ng modelo, kundi mas mahalaga ang dalawang pagbabago na ipinapakita ng serye ng paglalabas na ito.
Una, ang pagkakaiba sa kakayahan sa pagitan ng mga modelo ay patuloy na bumababa. Ang pinakabagong Comprehensive Intelligence Index ng Artificial Analysis ay nagpapakita na ang pagkakaiba sa pagitan ng mga lider ay malinaw nang nabawasan. Kasabay ng mabilis na pag-update ng mga bersyon, ang posisyon ng “pinakamalakas na modelo” ay mas mahirap pang panatilihin sa matagalang panahon, at ang bawat kumpanya ay nagsisimula nang maghanap ng kalamangan sa iba’t ibang gawain, hindi lamang sa paghahanap ng absolute na lider sa isang dimensyon.
Pangalawa, ang mga open-source model ay pumasok na sa unang tier. Sa mga bagong model na ipinakilala noong Hulyo, ang Tencent Hunyuan Hy3 at Kimi K3 ay nagpili na magbukas ng weights (bukas ang model parameters, pinapayagan ang mga developer na i-download at ideploy ang sarili nila). Sa pagkakasunod-sunod ng Code Arena sa frontend programming, ang Kimi K3 ay nasa unang lugar, hihigit pa sa GPT-5.6 Sol at Claude Fable 5. Sa nakaraang dalawang taon, mas madalas na itinuturing ang open-source models bilang mga tagapaglalabas sa mga closed-source models, ngunit sa kamakailang kompetisyon, ipinakita na ang open-source models ay nagsisimula nang direktang makipagkompetensya sa mga closed-source models sa ilang development scenarios.
Ano nga ba ang mga pagbabago at kahulugan na dinala ng malakas na paglalabas sa buwang ito?
01. Hindi na lang patungan kung sino ang mas matalino
Sa mga nakalipas na taon, ang pangunahang pagkukumpetensya sa industriya ng malalaking modelo ay ang pangkalahatang kakayahan—sino ang may mas malawak na kaalaman at mas tumpak na mga sagot. Ngunit ngayon, nagbago na ang mga dimensyon ng kompetisyon.
Sa round na ito, ang kakayahan sa code ang naging pinakamalabas na direksyon ng pakikidigma.
Patuloy na pinapalakas ni OpenAI ang pag-program at komplikadong pag-iisip, at patuloy na pinapalawak ang ekosistema ng Codex sa pamamagitan ng pag-unlad ng mga kasangkapan upang makabigay ng pagkakabukod sa mga programmer. Pinaniniwalaan ni Anthropic ang pag-unawa sa code at pag-audit ng seguridad upang tulungan ang mga developer sa pagharap sa mga komplikadong inhinyeriya sa malalaking proyekto. Pinapahalagahan ni Grok 4.5 ang bilis at mababang gastos, at nakabukod sa AI na kasangkapan sa pag-program na Cursor para sa mga pang-araw-araw na pag-unlad.
Sinabi ni Yao Yuhang, ang researcher ng malalaking model, sa «Dingjiao One» na ang bawat kumpanya ay naglalagay ng malaking pagpapahalaga sa kakayahan sa pagprograma, at ang pagkakaiba ay mabilis na nagkakasama, tulad ng malaking pag-unlad sa kakayahan sa code ng Kimi K3 na kasalukuyang umaabot sa antas ng mga nangungunang saradong model.

Sanggunian sa larawan / pexels
Ang agent ay isa pang direksyon na pinaglalaban ng mga kumpanya. Ang GPT-5.6 Sol ay kasama ang Codex upang suriin ang automated programming, ang Opus 5 ay nagte-teklado sa pagpapatakbo ng mahabang gawain, ang Kimi K3 ay ipinakikita ang kakayahan na magpatuloy sa pagpapatakbo upang tapusin ang mga kumplikadong gawain, habang ang Tencent Hunyuan Hy3 ay sinusubukang ihalo sa ecosystem ng WeChat upang suriin ang mga aplikasyon ng agent.
Ngunit ang mga agent ay patuloy pa ring hindi kumpleto sa praktikal na paggamit. Sinabi ni Beicheng, isang independiyenteng developer, na ang pangunahing kahinaan ng ilang produkto ng agent ay hindi kung kaya nilang gamitin ang mga kasangkapan, kundi ang kanilang kakayahang mag-iskedyul ng mga gawain. Halimbawa, ang Ultra mode ng Codex ay nagpapagana ng maraming sub-agent, at ang iba’t ibang sub-agent ay nagrerepeta ng pagbabasa sa iisang file at nagpapagawa ng katulad na pagsusuri, na nagresulta sa pagtaas ng token consumption, ngunit hindi nagdudulot ng karagdagang epektibong trabaho. Sa kanyang pananaw, ang pagpapabuti ng kakayahan ng agent ay hindi maaaring magmula lamang sa pagdami ng bilang ng sub-agent; ang susi ay ang kakayahang masuri kung aling mga gawain ang值得 analisahin at aling mga hakbang ang maaaring iwasan.
Kapareho ang pananaw ni Yao Yuhang. Naniniwala siya na ang mga agent ay ang pinakamahalagang direksyon sa kasalukuyan, ngunit malayo pa sa pagiging tunay na matatag. Sa kanyang pananaw, may malaking pagkakataon pa ang mga agent sa mga espesipikong sektor tulad ng kalusugan at pondo; ang susunod na yugto na magpapalit ng pagkakaiba ay hindi lamang ang kakayahan ng modelo, kundi kung gaano kagaling ang agent sa mga partikular na sitwasyon at kung gagawin ba ng mga kliyente ang pagbili.
Ang mga lokal na modelo ay humahanap ng pagbubukas sa pamamagitan ng pagpapalakas ng iba't ibang kakayahan. Pumili ang Kimi K3 ng pagpapalakas ng mahabang konteksto, frontend programming, at kakayahan sa produkto design, at nasa unang pwesto sa maraming pagsubok sa programming, na malapit na sa kakayahan ng mga overseas na proprietary flagship models.
Ang kompetisyon sa pagitan ng laki ng parameter at efisyensiya ng pag-iisip ay naging isa pang pangunahing linya.
Noong Hulyo, ang ilang modelong ipinakilala ay pumasok sa interval ng trilyon o maraming trilyon na parameter, ngunit ang laki ng parameter ay hindi na maaaring isama nang direkta sa antas ng kakayahan. Kasabay ng pag-unlad ng MoE architecture, ang mga model ay maaaring magkaroon ng mas malaking kapasidad ng parameter, samantalang pinapagana lamang ang isang maliit na bahagi nito para sa pag-iisip, na nagbabawas sa tunay na gastos sa pagkalkula.
Nabuo ng industriya ang dalawang direksyon: ang una ay patuloy na pagpapalawak ng sukat, gamit ang mas malalaking parameter para sa mas malakas na kakayahan; ang pangalawa ay pagpapahalaga sa efisensya, gamit ang mas maliit na aktibong parameter upang makamit ang halos katulad na epekto ng flagship model.
Ang presyo ay naging pinakadirektang variable sa kompetisyon ng modelo noong Hulyo.
Mas maraming dayuhang kumpanya ang gumagamit ng iba’t ibang estratehiya sa pagtatakda ng presyo. Pumili ang OpenAI na higit pang maghihiwalay ang merkado, na naghihiwalay ang GPT-5.6 sa iba’t ibang bersyon upang pahintulutan ang mga user na pumili ng tamang modelo batay sa kahirapan ng gawain; habang patuloy na pinapanatili ni Anthropic ang kanilang estratehiya sa mga flagship na modelo na may mataas na performance, na gumagamit ng Opus series upang sakop ang mga mataas na halaga sa pag-unlad at mga enterprise scenario; samantalang gumagamit ang Grok 4.5 ng mababang presyo, na ang presyo ng output ay apat na beses na mas mababa kaysa sa Opus series, at gumagamit ng pagkakabind sa Cursor upang tarhikin ang mga developer.
Ang mga lokal na tagagawa ay mas nagtataglay ng pangunahing kahusayan sa gastos. Sa nakaraang anim na buwan, patuloy na binaba ng maraming lokal na tagagawa ng modelo ang presyo ng API, na naghahanap ng paraan upang bawasan ang hadlang sa paggamit sa pamamagitan ng mababang gastos at palawakin ang bilang ng mga developer at mga corporate user.
Isang pahayag na sumasaklaw: Ang kompetisyon sa malalaking modelo noong Hulyo ay nagsimula nang palawakin mula sa paghahambing sa isang kakayahan patungo sa maraming aspeto tulad ng code, agent, efficiency ng parameter, at presyo.
02. Sino ang lumampas sa mga inaasahan, sino ang may magkakaibang pagsusuri?
Batay sa paghahambing sa mga pagbabago sa nakaraang bersyon, pagganap sa listahan, at mga puna ng mga developer, ang antas ng mga modelo na ipinakilala noong Hulyo ay maaaring i-classify sa tatlong kategorya.
Una sa mga nanggaling sa higit sa inaasahan: Kimi K3, Grok 4.5, Hunyuan Hy3.
Ang pinakamalaking pansin ay ang Kimi K3. Ang modelo ay gumagamit ng MoE architecture, na may kabuuang sukat ng parameter na nasa antas ng trilyon, at pinapalakas ang mga kakayahan sa mahabang konteksto, frontend programming, at product design. Sa araw ng paglalabas, umabot ang Kimi K3 sa unang pwesto sa Code Arena frontend programming leaderboard na may 1679 puntos, na isang pagtaas ng 17 pwesto kumpara sa ika-18 na pwesto ng nakaraang bersyon, Kimi K2.6. Sa Arena overall leaderboard isang linggo pagkatapos, unang naka-entra ang Kimi K3 sa global Top 10.
Ngunit may malinaw na hangganan sa kakayahan ang Kimi K3. Sa pagsubok sa kumpiyansa ng kaalaman ng Artificial Analysis, tumaas ang rate ng hallucination nito mula sa 39% sa Kimi K2.6 patungo sa 51%, at ang bilis ng output ay humigit-kumulang 33 Token/s, na mas mababa kaysa sa mga katulad na modelo.
Ang mga real-world na karanasan ng mga developer ay nagpapatotoo sa ganitong “pagkakaiba-iba.” Naniniwala si Beicheng na ang Kimi K3 ay may malinaw na pag-unlad kumpara sa nakaraang bersyon, at ang mga pangunahing kahusayan ay nasa frontend development, UI design, at product expression. Halimbawa, sa mga gawain tulad ng pag-optimize ng UI ng website o pagdisenyo ng UI ng app, ang Kimi K3 ay makapagbibigay ng mas magandang produkto, ngunit ang kanyang pagganap ay hindi laging stable kapag kinakailangan ang mga kumplikadong engineering tasks.

Sanggunian sa larawan / pexels
Kasama rin sa pagmamasid ang Grok 4.5. Pagkatapos ng paglalabas nito noong Hulyo 9, nakaabot ito sa mga lider sa Artificial Analysis Intelligence Index at nagpakita ng malakas na pagganap sa ilang pagsubok sa paggamit ng mga kasangkapan, at itinuturing ng maraming developer bilang isang mapagkakatiwalaang pagpipilian.
Kasunduan ng Běichéng, naniniwala siya na ang pinakamalaking kahusayan ng Grok 4.5 ay ang bilis; sa parehong pangangailangan, maaari itong tapusin sa loob ng tatlo hanggang limang minuto, samantalang ang GPT-5.6 ay kailangan ng kahit 20 minuto o kahit kalahating oras. Kasama pa ang mas mababang presyo, ito ay idinudulot para sa mga may mabilis na pangangailangan sa pag-unlad. Naniniwala si Yao Yuhang na ang kakayahan sa pag-program ng Grok 4.5 ay espesyal na inoptimo, at ang kombinasyon nito sa Cursor ay nagbibigay ng magandang karanasan. Isang konteksto ay ang pagpapahayag ng SpaceX na bumili sa Anysphere, ang parent company ng Cursor, na inaasahang matatapos noong ikatlong kuartal; ang data collaboration ng xAI at Cursor ay itinuturing na nakatulong sa pag-optimize ng karanasan sa pag-program ng Grok 4.5.
Ang Huan Yuan Hy3 ay nagpapakita ng pagbobreakthrough sa ruta ng efisensiya. Ang modelo ay may kabuuang 295B na parameter at lamang 21B na aktibong parameter, at sa mas maliit na sukat ng parameter—hindi pa kahit isang lima ng flagship model—nagkamit ito ng mga resultang malapit sa mas malalaking kalaban. Gayunpaman, sa SWE-Bench Pro, ang marka ng 57.9 ng Huan Yuan Hy3 ay may malinaw na pagkakaiba sa marka ng 69.2 ng Claude Opus, na nagpapakita na kailangan pa ring mapabilis ang kakayahan nito sa pagpapabuti ng kumplikadong code.
Sa paniniwala ni Yao Yuhang, ang Hunyuan Hy3 ay may pag-unlad kumpara sa mga modelo ng Tencent dati, at kasama ang pagiging open-source at ang maliit na disenyo, ito ay isang magandang pagpipilian sa gitnang sukat.
Tingnan muli ang mga katayuan na nakapirma sa unang grupo, ngunit may limitadong pagkakataon sa pagkabigla: GPT-5.6 Sol at Claude Opus 5.
Ang GPT-5.6 Sol at Claude Opus 5 ay patuloy na nasa unang antas, ngunit walang malaking pagbabago. Pinahusay ng GPT-5.6 Sol ang kanyang kakayahan sa komplikadong pag-iisip at pag-program ng mga agent, at nakamit ang 88.8% sa Terminal-Bench 2.1 (isang benchmark na sumusukat sa kakayahan ng model sa pagkumpleto ng mga praktikal na gawain sa command-line environment), na tumataas pa sa 91.9% sa Ultra mode. Ang Claude Opus 5 ay patuloy na nagsasagawa ng malalaking gawain, at mas nagbibigay-diin sa kahusayan nito sa mga sitwasyon tulad ng komplikadong insinyeriya, pag-unawa sa code, at pagsusuri ng seguridad. Ang pangunahing kahusayan ng Opus 5 ay ang pagiging malapit sa performance ng Fable 5, habang ang presyo nito ay kalahati lamang ng huli.
Ang dalawang modelo ay nananatili sa unang tier, ngunit hindi nagdala ng malaking paglilinaw.
Binanggit ni North City na nakakapag-coverage na ang GPT-5.6 sa kanyang karamihan sa pang-araw-araw na mga pangangailangan sa pag-develop, ngunit kapag nakakatagpo ng mga partikular na kumplikadong problema, ginagamit niya ang Opus 5 upang lutasin ito. Gayunpaman, ang mas malakas na kakayahan ay nangangahulugan din ng mas mataas na gastos. Para sa kanya, ang posisyon ng Opus 5 ay mas malapit sa isang “eksperto” na ginagamit kapag lutasin ang mga mahalagang problema.
Huling klase na may magkakaibang feedback at kailangan pa ng pagpapatotoo: Gemini 3.6 Flash at Qwen3.8-Max preview.
Ang pinakakaraniwan ay ang Gemini 3.6 Flash. Nakakuha ito ng marka na 50 sa Artificial Analysis Intelligence Index, na pareho sa nakaraang bersyon na 3.5 Flash. Ang pangkalahatang feedback mula sa komunidad ng developer ay ang ganitong bersyon ay walang malaking pagpapabuti kumpara sa nakaraan at hindi nagsisilbing kahit na kumpetitibo sa mga katulad na produkto sa panahong iyon. Gayunpaman, may ilan na naniniwala na bilang isang lightweight na modelo, ang output quality ng Gemini 3.6 Flash ay sapat.
Sa pananaw ni Kapdim, isang independiyenteng developer, ang Gemini 3.6 Flash ay may magandang karanasan sa araw-araw na paggamit, kahit na hindi ito lalong nakikilala sa pagprograma, ang multi-modal na pag-unawa ay patuloy na malakas. Ito ay sumusuporta sa pag-input ng anumang uri ng file, at ang tono at karanasan sa pang-araw-araw na pakikipag-usap ay mas mabuti kaysa sa maraming mga kalaban.
Pagkatapos ng paglulunsad ng preview version ng Qwen3.8-Max noong Hulyo, hindi patag ang performance ng model, at iba-iba ang feedback ng merkado. Ang pinakamalaking pagkakatanda ni Beicheng ay ang malalim na pag-iisip ng Qwen3.8-Max preview version, ngunit minsan ay nasisira sa mahabang pag-iisip, “parang nakakapalibot sa sarili nito,” ngunit hindi nagbigay ng epektibong solusyon. Ang Kapdim naman ay naniniwala na ang Qwen3.8-Max preview version ay mas mababa kaysa sa inaasahan; habang sinusuri ito gamit ang kanyang sariling set ng pagtataya sa frontend aesthetics, natuklasan niya na ang tunay na kakayahan ay may malaking pagkakaiba sa pagpapahayag. Bilang isang preview version na nasa proseso ng pagpapabuti, ang huling performance ay kailangang i-verify muli pagkatapos ng paglulunsad ng opisyal na bersyon.
Hindi nagkaron ng isang modelo na nangunguna sa lahat ng dimensyon noong Hulyo, at ang iba’t ibang modelo ay nagsimulang magkaroon ng pagkakahati-hati batay sa mga partikular na skenaryo.
Sa halimbawa ng Northern City, siya ay pumipili ng mga kasangkayon batay sa gawain: ang GPT-5.6 ay ginagamit para sa pang-araw-araw na pag-unlad, ang Grok 4.5 para sa mabilis na pagkumpleto ng mga kahilingan, ang Kimi K3 para sa mga produkto at frontend na scenaryo, at ang Claude Opus 5 para sa paglutas ng mga kumplikadong problema. Ang搭配 ni Kapdim naman ay iba: ginagamit niya ang mga modelo na Claude Fable 5 o Opus 5 para sa pagpaplano, at pagkatapos ay ginagamit ang GPT-5.6 Sol para sa pagpapatupad.
03. Mas mabilis ang pagpapalabas, lumalala ang digmaan sa pagitan ng open source at closed source
Sa likod ng masalimuot na paglalabas na ito, may ilang tanong na dapat pag-aralan: Bakit lalong mabilis ang pag-iterate ng model, bakit ito ay nakatuon sa July, at bakit ang open source ay nakakaapekto sa umiiral na negosyo model.
Una, ang paraan ng pag-iiterate ng modelo ay nagbabago. Noong nakaraan, ang pagpapabuti ng kakayahan ng malalaking modelo ay pangunahing nakabatay sa pag-retrain ng mas malalaking modelo, na may mahabang siklo at mataas na gastos. Ngunit kasabay ng pagiging matatag ng mga teknolohiya tulad ng reinforcement learning at post-training (pagpapabuti pa sa pagganap ng modelo sa pamamagitan ng fine-tuning, reinforcement learning, at iba pang paraan pagkatapos ng unang pag-train ng base model), ang pag-upgrade ng modelo ay nagsisimula na naingatan ang pagpapabuti pagkatapos ng pag-train.
Sinabi ni Yao Yuhang sa «Dingjiao One» na nangabilis ang bilis ng paglalabas ng mga modelo sa loob ng dalawang taon, at ang isang mahalagang dahilan ay ang industriya ay nagsanay na sa mas matatag na mga paraan ng post-training. Sa kasalukuyan, hindi kailangan ng maraming modelo na muling i-train upang mapabuti ang mga ito; kundi, pinapabuti lamang ang mga umiiral na base model sa pamamagitan ng mga paraan tulad ng reinforcement learning at self-iteration.
Ibig sabihin nito, ang cycle ng kompetisyon sa mga modelo ay nagiging mas maikli. Noon, maaaring manatili sa pangunguna ang isang lider na modelo nang ilang buwan; ngayon, ang pagkakataon para sa pangunguna mula sa mga update ng bersyon ay maaaring magtagal lamang ng ilang linggo. Kung hindi makasunod sa ritmo ng pagpapalabas, maaaring madaling masakop ng mga bagong bersyon. Para sa mga tagapagawa, ang pagpapalabas ng mga modelo ay hindi lamang isang pagpapakita ng teknolohiya—ang oras ng pagpapalabas ay naging bahagi rin ng kompetisyon.

Sanggunian sa larawan / pexels
Sa pangalawa, ang Hulyo ay isang panahon kung saan nagkakasabay ang iba’t ibang mga pangyayari. Para sa mga lokal na manufacturer, ang World Artificial Intelligence Conference (WAIC) ay ginaganap sa Hulyo, kung saan ang mga manufacturer ay naglalabas ng mga model at nagpapakita ng kanilang mga pag-unlad sa teknolohiya sa panahong ito. Para sa mga dayuhang manufacturer, maraming pangunahing kumpanya ang nagpapasya ring i-update ang kanilang mga model sa panahong ito, na naghahanap ng pagkakataon na maging maunawaan sa ecosystem ng mga developer at sa komersyal na pakikidigma.
Sa karagdagan, ang mga patakaran sa kompetisyon sa industriya ay nagbabago. Ang pagkakaroon ng sapat na kakayahan ng modelo ay hindi na ang tanging layunin; ang kompetisyon ay napalawak patungo sa kung paano ginagamit ang modelo at kung paano ito isasalin sa kita.
Ito rin ang dahilan kung bakit nag-usbong muli ang digmaan sa pagitan ng open-source at proprietary noong Hulyo. Matagal nang may pagkakaiba sa kakayahan sa pagitan ng open-source at proprietary models. Ngunit habang ang ilang open-source models ay pumasok sa unang tier, lumabas ang isang mas realistiko na tanong: Kapag maaaring makakuha ng libreng mga mataas na performance na models, babawasan ba nito ang kita mula sa API calls at subscription ng mga kumpanya ng model?
Ang mga tagasuporta ng open source ay naniniwala na ang pagpapalabas ng weights ay maaaring bawasan ang teknikal na hadlang at pahintulutan ang higit pang mga kumpanya at developer na makilahok sa pag-innoBAt ng AI. Ang open source ay nangangahulugan na ang mga tagapagbigay ng teknolohiya ay aktibong ipinapasa ang ilang benepisyo upang suportahan ang pag-unlad ng ekosistema; samantalang ang mga tagapagtaguyod ng closed source ay naghahanap ng pagkakataon na ang kanilang mga user ay maaaring ma-divert ng open source models. Ang mga kumpanya tulad ng Anthropic ay naniniwala na habang tumataas ang kakayahan ng mga model, ang pagpapalabas ng weights ay maaaring magdulot ng mga panganib sa kaligtasan at kailangan ng mas mahigpit na pamamahala.
Sa likod ng debate na ito, mayroon talagang iba’t ibang interes ng mga kumpanya. Para sa mga infrastrukturang kumpanya tulad ng NVIDIA, ang pagbubukas ng model ay nangangahulugan ng higit pang pangangailangan sa deployment, at higit pang market para sa computing power. Para sa mga kumpanya ng model tulad ng OpenAI at Anthropic, ang closed-source na modelo ay nakakatulong na panatilihin ang kita mula sa API calls at subscription. Gayunpaman, kailangan ding tandaan ang ibang panig: ang open-source ay talagang lalawak sa pangangailangan sa deployment, ngunit kasabay ng pagpapabuti ng parameter efficiency, ang pagkakalawak ng computing power bawat task ay maaaring mabawasan, kaya’t ang pagdami ng market para sa computing power ay hindi laging sumasabay sa antas ng pagbubukas ng model. Para sa mga lokal na manufacturer, ang pagbubukas ng weights ay hindi lamang isang pagpili sa teknikal na landas, kundi isang pagtatangka na makakuha ng developer ecosystem, cloud services, at entry point para sa susunod na komersyalisasyon.
Pagkatapos ng Hulyo, patuloy ang kompetisyon sa malalaking modelo. Ang komunidad ng mga developer ay naghihintay nang pangkabuuang paglalabas ng mga bagong modelo tulad ng DeepSeek V4, Fable 5.1, at GPT-6 noong Agosto.
Ang pagkakaiba sa kakayahan ng mga modelo ay patuloy na bumababa, at ang pagpapalabas ng isang mas malakas na modelo ay naging mas mahirap upang makabuo ng matatag na pangmatagalang kahihintay. Ang mga sumusunod na partikular na indikador ang dapat obserbahan: Saan matatapos ang limitasyon ng kakayahan ng mga open-source na modelo sa pamamagitan ng opisyal na bersyon ng DeepSeek V4, kung patuloy bang bababa ang presyo ng API, kung makakarating ba ang mga agent sa mga tiyak at patuloy na pagbabayad na escenario, at kung makakapasok ba ang mga open-source na modelo sa mas maraming pribadong pag-deploy sa mga kumpanya. Ang mga sagot sa mga tanong na ito ay mas magpapakita kung ano ang tunay na nagbago sa gulo na ito kaysa sa posisyon sa mga listahan.
*Ang larawan sa pamagat ay galing sa Pexels.
