Bagaman ang lokal na malalaking AI model ng China ay nangunguna sa paggamit ng 9 linggo kaysa sa US, ang tunay na gastos nito sa mga intensibong programming scenario ay mas mataas kaysa sa GPT Codex package. Ang Zhipu ay nagkita ng pagkawala ng higit sa 3 bilyong yuan noong 2025, habang ang mga package tulad ng Kimi ay may limitadong kuwota at may traffic control sa peak hours. Ang pangunahing dahilan ay ang kakulangan ng China sa infrastructure ng computing (449 data centers kumpara sa 5,427 sa US), na nagiging sanhi ng hindi pagkakaroon ng mga high-value package tulad ng Codex. Sa kasalukuyan, ang mga developer ay kailangang mag-isip sa tatlong aspeto: performance, presyo, at stability; ang lokal na models ay nasa malapit lamang sa ilang performance metrics kumpara sa mga international top models, at patuloy pa ring nakakaranas ng hamon kung saan tinatanggap sila ng pagsuporta ngunit hindi pa nagsisilbing malawak na paggamit.May-akda at pinagmulan: FunTalk
Sa nakalipas na isang buwan, ang Silicon Valley AI scene ay naglabas ng maraming malalaking pagpapabago: ang GPT-5.6, fable5, at Grok-4.5 ay sumulpot nang sunod-sunod.
Sa isang panahon, ang mga lokal na developer at programmer ay nagkakaroon ng malaking gulo, kasama ang iba’t ibang talakayan at pagsusuri tungkol sa mga advance na modelong tulad ng GPT-5.6.
Bagaman may mga bagong lokal na modelo tulad ng Kimi-K3 na lumabas sa buwang ito, sa kabuuan, ang mga lokal na malalaking modelo ay patuloy na nasa isang kalagayang “papuri ngunit hindi malawakang tinatanggap” sa loob ng komunidad ng mga unang-tier na developer.

Batay sa pinakabagong datos, sa paggamit: Ayon sa datos mula sa OpenRouter mula Hunyo 22 hanggang 28, ang lingguhang paggamit ng mga modelong Tsino ay umabot sa 20.39 trilyon na Token, habang ang mga modelong Amerikano ay 4.25 trilyon, at nangunguna na ito ng ika-siyam na linggo nang patuloy.
Ngunit sa kabaligtaran, ang mga kita ng anim na maliliit na AI na kompanya sa bansa ay hindi gaanong nakakatuwa: ayon sa mga pampublikong pahayag ng pananalapi, ang Zhipu ay kumita ng 724 milyong yuan noong 2025, ngunit ang pagkawala ay umabot sa higit sa 3 bilyong yuan; ang MiniMax naman ay 79 milyong dolyar (halos 570 milyong yuan); ang iba pang apat na kompanya, kabilang ang Moonshot, ay hindi pa naglabas ng kumpletong taunang kita.
Kahit ang mga kumpanyang lider, ang kita ay nananatili sa antas ng ilang milyon na yuan.
Kumpara sa iba, ang Anthropic, isang pangunahing kumpanya sa AI, ay may ARR na humigit-kumulang $60 bilyon hanggang $70 bilyon, na pangunahing dinudulot ng B2B API at mga AI Coding na scenario.
Ito ay nagdudulot ng isang makapal na tanong:
Bakit patuloy na populer ngunit hindi malawakang tinatanggap ang mga lokal na modelo na itinuturing na “mura” at may “malaking paggamit”, at bakit patuloy pa ring mahihirapan itong makipag-ahon sa mga pinakamahusay na foreign model sa mga mataas na halaga tulad ng AI Coding?
Kahit recent, pagkatapos makipag-usap sa maraming pangunahing developer tungkol sa isyu na ito, natuklasan ko ang isang napakalaking katotohanan:
Ang mga malalaking lokal na modelo ay sa ilang paraan ay talagang “mahal”.
Tulad ng ganitong “kataas-taasan,” ang ilang lokal na modelo na may pag-unlad sa performance ay mahirap makapakita ng kanilang mga kalakasan.
01 Ang ilusyon ng “mababang presyo”
Kapag sinasabi ang mga malalaking lokal na modelo, marami ang isasalin sa DeepSeek, Kimi at iba pang mga representante, at ang isa sa mga pinakakaugnay na label ay mura, mura;
Kung titingnan lang ang presyo bawat token, may malaking kahusayan ang mga lokal na modelo kumpara sa mga lider tulad ng GPT-5.6 at Fable 5; halimbawa, ang GLM-5.2 ay ₱1.4/₱4.4 bawat milyong token ng input/output, samantalang ang DeepSeek-V4-Pro ay ₱0.435/₱0.87; ang GPT-5.6 Sol naman ay ₱5/₱30, at ang Claude Fable 5 ay ₱10/₱50.
Sa katotohanan, ang ganitong pagkakaintindi na “mura” ay isang matagal nang maling paniniwala ng mga labas ng kalakalan.
Lalo na sa mga intensibong pag-programming, ang presyo bawat yunit ng mga lokal na malalaking modelo ay hindi lamang walang kahalagahan, kundi mas mataas pa nang ilang beses kaysa sa GPT at Claude na may pakete.
Si Li Guang (pseudonym) ay isang siyentipiko sa larangan ng AI, at dahil sa kanyang mga pangangailangan sa trabaho, kailangan niyang gamitin ang ilang milyar na Token araw-araw sa mga skenaryo ng AI Coding. Sa ganitong antas ng paggamit, kung gagamitin ang lokal na malaking modelo tulad ng GLM-5.2, ang kabuuang gastos ay magiging napakalaking problema.

Ang token bill na ipinakita ni Li Guang
Sa araw ng pag-uusap, ang mga Token na ginamit ni Li Guang ay malapit nang umabot sa 4 bilyon. Kung gagamitin niya ang GLM-5.2, ang gastos ay halos: (86.39 milyong karaniwang input × $1.4 + 3.38 bilyong cached input × $0.26 + 19.06 milyong output at inference × $4.4) = humigit-kumulang $1,084. Batay sa palitan na $1 = ¥7.2, ito ay katumbas ng humigit-kumulang ¥7,800.
Ang dahilan kung bakit pinagbigyan ni Li Guang ang paggastong ito sa mga Token ay dahil nag-open siya ng CodeX plan ni GPT,
Narito ang simpleng paliwanag sa anyo ng CodeX package: Sa madaling salita, ito ay isang package na idinisenyo para sa mga pagkakataon sa pag-program: Sa teknikal na pananaw, hindi ito totoong walang limitasyon, kundi isinasama ang Codex sa pag-subscribe sa ChatGPT: ang Plus ay $20/buwan, habang ang Pro ay nagsisimula sa $100/buwan, na may kaukulang kapasidad na halos 5 hanggang 20 beses ang dami ng Plus; pagkatapos makarating sa limitasyon, maaari mong bumili ng Credits para magpatuloy.
Kasunod nito, mayroon din ang Claude Code mula sa Anthropic ng isang katulad na package: ang Claude Pro ay $20/mo, habang ang Max 5x at Max 20x ay $100 at $200/mo, ayon sa pagkakasunod-sunod; ang web na bersyon ng Claude at ang Claude Code ay nagbabahagi ng quota na 5 oras at lingguan, at maaaring magpatuloy gamit ang presyo ng API pagkatapos maabot ang limitasyon.
Sa ilalim ng ganitong package, ang malaking gastos sa Token ay nabawasan.
Para sa mga developer sa loob ng bansa, ang paggamit ng milyon-milyon hanggang daan-daang milyon na token araw-araw sa mga intensibong AI Coding na sitwasyon ay isang karaniwang kalagayan.
Si Xiao Liu ay isang matinding developer ng AI Coding, at ang kanyang tunay na gastos sa isang linggo sa Codex ay ₱300 na Tsino, at ito ay nangyayari pa rin kahit walang kompensasyon mula sa kanyang kumpanya.
Ngunit kahit sa ganitong gastos, mas mura pa rin ito kumpara sa mga lokal na modelo, dahil sa parehong 300 yuan, hindi mo kayang bilhin ang katumbas na bilang ng token ng GLM 5.2.

Ang token bill ni Xiao Liu
Sa pananaw ng mga lokal na developer, ang GPT Codex package ay ang pinakamura na token na maaaring bilhin ngayon, mas mura kaysa sa ZhiPu at Kimi ng ilang beses, maaaring ito ay hindi intuïtibo, ngunit totoo na ang mga lokal na model ay hindi kayang makipagkumpetensya sa kahusayan sa mga intensibong coding scenario.
Dapat ipaunawa dito: ang Codex ay hindi talagang unlimited plan sa tunay na kahulugan; kung susundin ang pinakamataas na antas na $200, ang nakalaan na limitasyon ay halos 2 bilyon sa isang linggo.
Gayunpaman, dahil sa ilang developer na gumagamit ng mga paraan tulad ng “intermediate stations” upang gamitin ang mga model, ang tunay na gastos ng ilang mga model ay maraming beses na mas mababa kaysa sa opisyal na channel, kaya may mga pagkakataon na mas mura ang pagbili ng mas maraming Token, kaya mayroong sitwasyon kung saan 300 piso ang kayang bumili ng 12 bilyong Token.
Sa totoo lang, hindi walang naglabas ng katulad na package ang lokal na model, ngunit kung titingnan nang mabuti, may malaking limitasyon ang package na ito sa mga limitasyon kumpara sa Codex.
02 Pighati sa pagtatakda ng presyo sa lokal
Ang kasalukuyang kalagayan ng mga lokal na malaking modelo sa pagtatakda ng presyo ay maaaring ilarawan sa isang pangungusap:
Akala mo pumasok ka sa isang buffet, ngunit natuklasan mong ang vendor ay nagbabayad pa rin batay sa timbang.
Halimbawa, sa mga package, ang Kimi at GLM-5.2 sa bansa ay may apat na antas: 49, 99, 199, at 699 yuan, na binabawasan araw-araw; ang Lite, Pro, at Max ng GLM Coding Plan ay may mga 80, 400, at 1600 na Prompt bawat 5 oras, o halos 400, 2000, at 8000 bawat linggo, at ang GLM-5.2 ay may triple deduction sa peak hours.
Kung kukunin ang halimbawa ng Qoder ni Alibaba, ayon sa isang kaibigan ng manunulat na nagtatrabaho sa pagpapanatili ng B-end na kliyente na si Ami (pangalan na pang-likha): “Noong isang panahon, ang Qoder ay ang pinakamainam na AI IDE sa bansa, ngunit nasira nito ang kanyang kahusayan dahil sa bagong presyo nito.”
Sa mga package: ang Qoder CN Personal Pro at Pro+ ay ₱59 at ₱169 bawat buwan, kasama ang 2,000 at 6,000 Credits; ang Teams at VPC versions ay ₱99 at ₱199 bawat user bawat buwan, kasama ang 3,000 Credits bawat isa, at ang VPC ay nagsisimula sa 50 users.
“Pagkatapos nilang i-merge ang Lingma at i-adjust ang pricing, ayon sa aking alam, hindi bababa sa dalawampu’t tatlo ang tumigil na sa pagpapalawig ng kanilang subscription,” ayon kay Ami.
Ayon sa pagsubok ni Ami, ang planong Enterprise Edition 199 ng Qoder ay natutupad na sa loob ng 3 araw ayon sa kanyang paggamit, at kung gagamitin ng isang malalim na developer, maaaring matapos na sa isang araw.
Gayundin, sa mga pakete, ang GLM-5.2 ay nagdudulot ng iba’t ibang damdamin sa mga lokal na user.
Ayon sa developer na si Xiao Wei: "Ang mga package ng GLM-5.2 ay katumbas ng walang package; kahit may package, patuloy pa rin ang pag-limita sa peak hours, at mayroon pa ring pag-atake sa mga user."
Ayon sa 36Kr: Ang mga package ng GLM-5.2, dati ay mas mahirap makakuha kaysa sa mga tiket sa konsiyerto, at laging nag-refresh tuwing sampung gabi araw-araw—ang pagkakaroon nito ay nakasalalay sa iyong bilis.
Noong Enero 2026, inilabas ng Zhipu ang isang pahayag na dahil sa kakulangan sa computing power, bawasan nito ang araw-araw na bilang ng mga produkto na matatabi sa 20% lamang ng dating dami, at ipinapalabas ang limitasyon tuwing alas-dasal ng umaga, at nasasakop agad sa ilang minuto.
Sa huli, ang pagiging mababaw sa mga package at presyo ng lokal na modelo ay dulot ng kakulangan sa computing power.
Batay sa datos ng Chinese Academy of Information and Communications Technology at Ministry of Industry and Information Technology noong 2025, mayroon ang China ng 449 na data center, habang ang Estados Unidos ay may 5,427. Sa kabuuang computing power, ang China ay may 1,053 EFLOPS, samantalang ang Estados Unidos ay may 2,400.
Ngunit ang susi dito ay: sa mga 2,400 EFLOPS ng Estados Unidos, malaki ang bahagi ng mga high-end GPU; sa kalkulasyon ng Tsina, marami ang mga lokal na chip tulad ng Huawei Ascend at Cambricon, at mayroon pa ring pagkakaiba sa generasyon sa performance ng bawat card kumpara sa H100.
Upang tugunan ang patuloy na pagtaas ng demand sa computing power, noong Marso 2026, ang Zhipu, Alibaba Cloud, Tencent Cloud, at Baidu ay nagtaas ng presyo ng Token, kasama ang pagtaas na mula sa 5% hanggang 460%.
Sa madaling salita, ang “mababang presyo” at “pakikidigma sa presyo” ng mga lokal na modelo ay naging nakaraan na.
Hindi dahil ang lokal na modelo ay ayaw gumawa ng buffet, kundi dahil na-ccount na: sa kasalukuyang gastos sa computing power at kalagayan ng pagkawala, ang pagpapatakbo ng monthly subscription ay parang pagtaya na hindi magiging overuse ng mga user, at ayon sa paggamit ng mga developer at programmer sa bansa na maaaring mag-spent ng milyon o higit pa sa Token araw-araw, ang ganitong business model ay mabilis na mabubulok sa cost line.
Ang mga programming package ng OpenAI at Anthropic ay binibili ng mga kliyente na may mataas na net worth—ang mga malalaking kliyente tulad ng Cursor at GitHub Copilot ay nakakapagdala ng $1.4 bilyon sa kita taun-taon para sa Anthropic.
Sa ilalim ng suporta ng mataas na computing power, ang business model na ito ay nagpapalit ng “fixed monthly fee” para sa “long-term customer retention”, may mataas na kalidad ng customer, at mas mataas din ang ARPU, na nagpapalawak ng gastos.
Kung ihahambing naman sa loob ng bansa, bagaman mayroon tayong mga malalaking cloud company tulad ng Alibaba, ang problema ay: ang adjusted EBITA Margin ng Alibaba Cloud para sa FY2026 ay lamang 7.5%, at bagaman mabilis ang paglago ng kita ng Cloud Intelligence Group, hindi naman ito napakalaking kita.
At ang mga tradisyonal na cloud provider ay nakakapagbenta ng “unlimited cloud servers” dahil ang mga user ay hindi 24 oras na may full load. Isang ECS, ang tunay na CPU utilization ay maaaring tanging 10%, kaya maaari ng cloud provider na i-overcommit ang isang physical machine sa sampung tao.
Ngunit iba ang pagrerepresenta ng malalaking modelo: bawat token na dumating, kailangan talagang isagawa ang isang paggamit ng GPU computing power. Kung ang user ay magpapalit nang tuloy-tuloy sa loob ng 24 oras, ang HBM memory, GPU cores, at kuryente ng cloud provider ay lahat ay mga fixed cost, walang puwang para sa overbooking.
03 Ang "Golden Triangle" ng model
Bukod sa mga salik sa presyo, ang pagpili ng Codex at Claude Code ng mga lokal na developer ay walang alinlangan dahil sa kanilang malakas na performance sa pagprograma.
Gayunpaman, sa aspeto ng performance, ang mga lokal na modelo ay hindi tulad ng ilang stereotipo.
Pagkatapos makipag-usap sa maraming developer, natuklasan ng manunulat na isang karaniwang pananaw ay: ang mga lokal na malalaking modelong AI, lalo na ang pinakabagong mga modelong tulad ng GLM-5.2, ay maaari nang gamitin para sa ilang pansuporta at pangalawang gawain, tulad ng pagsubok at pagpapabuti ng mga bug.
Sa mas kumplikadong, mahabang panahon na asynchronous na mga gawain, mayroon pa ring malaking pagkakaiba ang mga lokal na modelo kumpara sa mga pinakamahusay na modelo tulad ng GPT at Claude.
Si Developer Xiao Zhang, noong Marso ng taong ito, gumamit ng isang lokal na modelo para sa pag-program, at sinukat ang GLM, Qwen, at GPT sa parehong gawain; lamang ang GPT ang nakumpleto at sumunod sa mga kinakailangan ng pahina—isang proyektong nangangailangan ng maraming antas at maraming kolum na paghahambing at pagbuo ng resulta.
Samantalang ang isa pang developer na si Xiao Wei ay nagsabi na batay sa kanyang karanasan, ang Kimi 2.7 at DouBao 2.1 Pro ay may sapat na performance, ngunit sa kabuuan ay mas mababa sa isang antas (kabilang sa pangalawang grupo), ngunit higit pa sa Claude Sonnet 4.6.
Sa kasalukuyan, ang pangkalahatang pagkakasundo sa loob ng komunidad ng mga developer ay: ang GLM-5.2 ay ang unang lokal na modelo na nakamit ang antas ng Opus.
Nakakapagpapagana ito sa mga totoong, kumplikadong, at matagalang asynchronous na task.
Bagaman may malaking pagkakaiba pa sa maraming aspeto, tulad ng pandaigdigang kaalaman, sa tunay na Opus model, hindi ito nagpapahinto sa pagiging bagong antas ng lokal na model.
Ngunit ang katotohanan ay: ito ay kung ano ang nagsisimula lamang, ang ilang “mga pinakamahusay,” ngunit hinaharang ng iba pang mga salik na walang kaugnayan sa performance.
Sa partikular, ang mga ganitong salik ay kasama ang mababang epekto ng cache, pati na ang pagpapalimita pa rin sa oras ng puno, na nagiging sanhi ng masamang karanasan para sa mga developer.
Ito ang nagdadala sa isang iba pang dimensyon sa kasalukuyang paghahambing ng mga modelo: ang katatagan.
Sa pagkaranas ng mga developer at programmer sa unang linya, ang pagpili ng modelo ay hindi na simpleng paghahambing ng performance, kundi—
Ang “golden triangle” ng performance, presyo, at stability.
Sa tatlong dimensyon, ang mga lokal na modelo ay nakakuha lamang ng ilang mga indikador sa unang dimensyon.
Kamakalabas, inilabas ng lokal na Kimi ang kanilang pinakabagong flagship model, K3: isang bukas na timbang na flagship model na may 2.8 trilyon na parameter, native multimodal, at 1 milyong Token na konteksto, na nakatuon sa mahabang pag-program, paggawa ng kaalaman, at malalim na pag-iisip.

Sa maraming pagtataya, ang kanyang IQ sa Artificial Analysis ay 57 puntos at nasa ikatlong lugar sa buong mundo; nangunguna sa Arena Frontend Programming Leaderboard na may 1,679 puntos, at may mga alamat na ang kanyang performance ay nakakapareho na sa Claude Fable 5.
Gayunpaman, sa likod ng nakakatulong na puntos at ranking, ang pinakamalaking pag-aalala ng mga developer ay isang salita: value for money.
Pagkatapos ng paglalabas ng K3, maraming developer ang nagsabi na ang Kimi ay patuloy na mahal, walang value sa pagkukumpara sa Codex, at ang quota ay hindi sapat. Tanging tingnan ang presyo ng API, ang K3 ay hindi rin maaaring ituring na “mura”: ang bawat milyong Token para sa cache/input/output ay ₱2/₱20/₱100; ang GPT-5.6 Sol ay $0.5/$5/$30, habang mas mababa ang K3 kaysa sa Sol, ngunit malinaw na mas mataas kaysa sa GPT-5.6 Luna na $0.1/$1/$6.
At habang ginagamit ang K3, sinabi ng mga developer na mayroon ding nangyaring pagkakawala ng koneksyon sa API, kahit na nagsimula ito sa buong umaga.
Sa kasalukuyan, hindi nagtatanggi ang mga lokal na developer na magbayad para sa mga lokal na modelo, kundi dahil sa kakulangan ng computing power at mataas na gastos, hindi sila makakapag-open ng mga package na may magandang halaga tulad ng Codex, at kailangan nilang pumili ng “package ng Dazhong Dianping” na tila buffet ngunit may limitasyon (tulad ng Coding Plan ng Zhipu).
Ang hindi konsistente na karanasan at ang malabo na halaga sa presyo ng package ay nagresulta sa mahirap na pagpanatili ng mga user pagkatapos gamitin. Sa pangkabuuang pagtingin, ito ay rasyonal na pagpili ng mga user sa ilalim ng mataas na gastos sa base ng computing power sa kasalukuyan.
Ang mga ito ay hindi namin sinasadyang palakasin ang kalaban at palakasin ang sarili, kundi isang paalala sa isang panganib.
Sa kasalukuyan, habang hinahabol ng mga lokal na modelo ang GPT at Claude, mas pinapahalagahan nila ang performance, ngunit ang mga lokal na malalaking modelo ay kailangang aakyat sa higit pa sa isang bundok lamang—ang performance—mula sa pagbuo hanggang sa paggamit.
Kailangan nating hintayin hanggang sa malaki ang produksyon ng lokal na base ng computing power, at sa teknolohiya, presyo, at katatagan, mabuo ang pagkakaisa—tungo sa pagpapatupad ng aming produkto upang matugunan ang mga inaasahan ng mga user.
