May-akda: Stratechery
Isinalin: Deep潮 TechFlow
Deep潮 Overview: Ang Kimi K3 ay nagtatapos sa merkado ng cognitive models; bakit sobra ang reaksyon ng Wall Street at Silicon Valley? Ipinapaliwanag ng artikulong ito na mula sa panahon ng ChatGPT papunta sa panahon ng Agent, ang mga token ay hindi na komodidad—ang tunay na komodidad ay ang inteligensya mismo—at sa digmaang kung saan ang marginal cost ang nagsisilbing batayan, ang mga open-source model mula sa China, bagaman libre, ay may mataas na gastos sa serbisyo. Ang takot ng mga frontier lab ay higit sa lahat ay dulot ng pagkakaroon ng kahirapan na mag-adjust sa bagong patakaran kung saan ang pagtutuos sa inference scale ang nagsisilbing pangunahing salik, hindi na ang gastos sa pagtatrain.
Nakakausap ko na ang isang kuwento tungkol sa aking unang araw sa STRT-431 sa Kellogg School of Management, isang mandatory course para sa lahat ng bagong MBA students. Habang binabasa ko ang course materials at case studies, naramdaman kong masama dahil wala anumang tech company sa syllabus. Kumilos ako at tumanong sa professor kung bakit, at ang sagot niya ay: Ang layunin ng course ay hindi ang pag-aaral ng isang partikular na industriya, kundi ang paghahanap ng mga pangkalahatang prinsipyo na maaaring gamitin sa anumang industriya o kumpanya.
Tulad ng madalas kong sinasabi, hindi ako nakakatugon sa sagot na iyon: sa pananaw ko, ang kalikasan ng teknolohiya, lalo na ang sero marginal cost (at sero transaction cost) ng software at distribution, ay magkakaiba. Ang pagsisigla ng sero sa isang pormula ay madalas na nagdudulot ng kaguluhan. Ngunit agad kong naintindihan na ito ay aking pagkakataon. Ang pangunahing pag-unawa sa Aggregation Theory ay: ang sero marginal cost ay nagdudulot ng isang value chain na lubos na magkaiba sa mga inaasahan ng mga tao sa internet—sa isang mundo kung saan ang pagkontrol sa demand ay mas mahalaga kaysa sa pagpapalabas ng supply, makikita mo ang sentralisasyon at paglago.
Gayon man, ang interesante sa AI ay ang pagbabalik ng mga sinaunang pangkalahatang prinsipyo sa harap. Ito ay pinakamalabas na ipinakita noong nakaraang linggo, nang magkaroon ng malakas na talakayan sa X tungkol sa Kimi K3. Ang Kimi K3 ay isa pang open-source na modelo na inilunsad ng China, at ang kanyang kakayahan ay patuloy na umaabot sa antas ng pinakamataas. Sa maikling sabi: bumabalik ang marginal cost sa isang malaking paraan, kahit sa maikling panahon na epekto ng pinakamataas na libreng modelo o sa pangmatagalang istruktura ng industriya.
COGS at mga gastos sa R&D
Isa sa pinakakaraniwang maling paniniwala tungkol sa open-source weight models ay mas mura ito—o kaya’y libre. Sa wakas, maaari mong i-download ang weights nang direkta at iwasan ang oras, gastos, at kakayahan na kailangan upang lumikha ng sarili mong model. Totoo ito, ngunit ang "libre" dito ay tumutukoy sa halaga na iyong ginugol sa pag-aaral at pag-unlad (R&D). Ang R&D ay isang fixed cost, na walang ugnayan sa iyong kita. Kung naglabas ka ng $1 milyon sa R&D, anuman ang iyong kita—maging $100,000 o $1 bilyon—patuloy pa rin kang naglabas ng $1 milyon sa R&D (natatangi ito sa iyong profitability).
Kasalungat ng kita ay ang COGS—ang gastos sa pagbebenta—at para sa AI, ang COGS ay totoo, isang bagay na hindi nagaganap sa industriya ng software nang matagal. Sa partikular, ang pagpapatakbo ng inference sa isang modelo—ano man ang Kimi o Fable—ay may gastos, at ang mga tagapagbigay ng AI ay nagbabayad ng pera para sa inference, at sa karamihan sa mga business model, direktang nauugnay ito sa kita. Gamit ang nakaraang halimbawa, ang paglikha ng $100 milyon na kita ay may kahalintulad na $100,000 na kita, maaaring magkaroon ng 1,000 beses na COGS. Sa partikular, kung ang gastos sa token para sa $1 na kita ay 50 sentimos, ang $100 milyon na kita ay may $50 milyon na COGS, samantalang ang $100,000 na kita ay may $50,000 lamang na COGS.
Ang mga pangunahing punto tungkol sa open-source weight models ay hindi sila libreng serbisyo. Ang gastos ng Kimi K3 ay $3 bawat milyong input tokens at $15 bawat milyong output tokens. Mas mura ito kaysa sa Sol na $5 bawat milyong input tokens at $30 bawat milyong output tokens, ngunit maaaring hindi ito ang tamang paraan ng pagtukoy.
Token at Smart
Ipinapaliwanag ni CEO ni NVIDIA, Jensen Huang, ang mga binubuo ng NVIDIA bilang "token factory," at maliwanag ang pananaw na ito mula sa pananaw ng NVIDIA. Ang mga GPU ng NVIDIA ay hindi nakatuon sa partikular na modelo: sila ay nagpapagawa ng mga token at ginagawa ito sa pinakamabilis at pinakaepektibong paraan. Nagresulta ito sa mga pagsusuri tulad ng bilang ng token bawat segundo, oras ng unang token, bilang ng token bawat watt, at gastos ng token, na naniniwala si Huang na magiging batayan nito sa paggawa ng desisyon.
Ang framework na ito ay may kahulugan sa unang paradigma ng AI—ang panahon ng ChatGPT—kung saan ang mga token ay direktang ipinapadala sa huling gumagamit. Gayunpaman, ang ikalawang paradigma ng AI, ang panahon ng pag-iisip, ay nagkakaroon ng pagbabago sa paraan ng pagsusuri na ito. Ang pag-iisip ay nangangahulugan ng pagtaas ng bilang ng mga token ng chain-of-thought, at iba’t ibang modelo ay nangangailangan ng iba’t ibang dami ng mga token ng pag-iisip upang makakuha ng tamang sagot. Halimbawa, ayon sa mga ulat, ang Kimi ay gumagamit ng mas maraming token kaysa sa Sol, na nagpapawala sa kanyang pangunahing kahusayan sa presyo. Ang Agent ay nagdudulot ng katulad na dinamika: ang ilang mga modelo ay mas epektibo sa dami ng mga token na kinakailangan upang maisagawa ang mga workflow ng Agent.
Ibig sabihin nito na ang mga token ay hindi mga komodidad. Ang mga karakteristikang nagtataglay ng isang komodidad ay ang kakayahang palitan: isang galon ng langis ay isang galon ng langis, isang tonelada ng tanso ay isang tonelada ng tanso, isang bushel ng trigo ay isang bushel ng trigo. Ngunit ang isang token ng isang modelo ay iba sa token ng ibang modelo. Ang maaaring palitan ay ang mga bagay na binubuo ng mga token, kaya ang inteligensya. Sa madaling salita, kung ang Kimi at Sol ay nagbuo ng tamang sagot, ang sagot ay maaaring palitan. Ang pagkakaiba sa mga token na kailangan upang makagawa ng tamang sagot ay nagdudulot ng pagkakaiba sa COGS.
Ang smart COGS ay isang punksyon ng ilang iba’t ibang salik:
Sukat ng model: Ang mga weight at runtime state ang nagdedetermine kung gaano karaming mahal na memorya at accelerator ang kinakailangan para sa bawat copy ng serbisyo.
Efficiency ng pag-iisip: Pagpili ng arkitektura (tulad ng mixture-of-experts model) ay nagbabawas sa dami ng computation bawat generrated token
Ekwipasyon ng memorya: Ang pagpili ng arkitektura ay maaaring mabawasan ang pangangailangan sa KV cache, na nagpapahintulot sa mas maraming pare-parehong kahilingan at mas mabuting paggamit ng GPU
Efficiency ng serbisyo: Batch processing, scheduling, prefix caching, at iba pang optimization para sa inference ay nagpapakita ng pinakamataas na paggamit at nagbabahagi ng trabaho sa pagitan ng mga hiling
Token efficiency: Ang mas kaunting token ang kailangan upang makamit ang tamang sagot, ang mas mababa ang cost ng pag-iisip
Mahalaga ito, dahil tayo ay mabilis na papalapit sa isang estado kung saan ang inteligensya ay isang komodidad para sa maraming ekonomikong makabuluhang gawain. Halimbawa, sinumang nagbuo ng isang pangunahing CRUD application ay maaaring gumamit ng mga modelo mula sa maraming provider upang matapos ito. At sa isang merkado ng komodidad, ang daan patungo sa kita ay hindi sa pamamagitan ng pagtatatakda ng mas mataas na presyo—maaari mong (o malapit na makakagawa ng) gumawa ng ganap na parehong application gamit ang maraming modelo—kundi sa pamamagitan ng pagkakaroon ng mas mahusay na istruktura ng gastos.
Mag-unawa sa commodity market
Dito ay值得梳理一下机制,因为正如我几个月前在《亚马逊的耐久性》中指出的,商品市场的动态不是科技行业人士普遍熟悉的:
Sa commodity market, parehong presyo ang binabayaran ng lahat, dahil pareho ang ipinagbibili ng bawat isa. Ang presyong ito ay tinukoy ng supply at demand.
Ang pangangailangan sa isang produkto ay isang punksyon ng presyo: mas mura ang produkto, mas malaki ang pangangailangan, at vice versa.
Ang suplay ng produkto ay isang punksyon ng marginal na gastos ng produksyon.
Mahalagang maunawaan na iba-iba ang marginal cost ng iba’t ibang supplier sa paggawa ng mga produkto. Sa praktika, ito ay nangangahulugan na ang supplier na may pinakamalabas na cost structure ang huling magbebenta ng produkto sa kanilang marginal cost (kung sila ay makakapag-produce pa). Ang kita ng lahat ng iba ay nakadepende kung gaano kalaking pagkakaiba ang kanilang cost structure kumpara sa marginal supplier.
Halimbawa:
Ang supplier A ay makakapag-produce ng 10 units ng produkto sa halagang $10 bawat unit
Ang supplier B ay maaaring magproduksyon ng 10 units ng produkto sa halagang $15 bawat unit
Ang Supplier C ay makakapag-produce ng 10 units ng produkto sa gastos ng $20 bawat unit.
Kung ang presyong elastisidad ay nagpapakita ng 25 yunit na pangangailangan sa presyo ng $20, ibig sabihin nito:
Ang supplier A ay magbebenta ng 10 unit sa presyo ng $20, kumikita ng $10 bawat unit.
Ang supplier B ay magtatawag ng $20 para sa 10 na yunit, kumikita ng $5 bawat yunit.
Ang supplier C ay magtatawag ng 20 dolyar para sa 5 na yunit, na kumikita ng 0 dolyar bawat yunit
Hindi ito lubos na tama: Ang dahilan kung bakit nagdudulot ng kakulangan ang Supplier C ay dahil kay Supplier A at B ay nakakapagpababa ng kanilang presyo, na natural na nakakaapekto sa demand (elastiko), ngunit ipinapakita nito ang problema. May magandang negosyo si Supplier A, may mabuting negosyo si Supplier B, at papasukin na ng bankruptcy si Supplier C.
Ang panganib ng pagkabankrupt ay kung saan ang mga fixed cost ay bumabalik sa harap: ang Supplier C ay may fixed cost (tulad ng posibleng gastos sa R&D) at maaaring may utang upang mabayaran ang mga kagamitan na kailangan para sa produksyon ng mga produkto. Hindi niya maaaring i-price ang mga produkto batay sa mga gastos na ito—tandaan, ang market-clearing price ay malapit sa marginal cost ng pinakamataas na cost unit na kailangan upang matugunan ang demand—ngunit ang mga gastos na ito ay maaaring pilitin ang supplier na lumabas sa merkado. Kung ang supplier ay magkakaroon ng pagkabankrupt, tataas ang presyo hanggang sa magpasya ang ibang supplier na pumasok (o mag-expand ang ibang supplier).
Smart Market
Balik tayo sa modelo. Ngayon, ang lahat ng nabanggit na pagsusuri ay hindi na magagamit, dahil ang pangangailangan sa mga pinakabagong modelo ay hihigit sa suplay, at ang suplay ay limitado ng kakulangan sa computing power. Ang kakulangan sa computing power na ito ay hindi lamang nangangahulugan na ang mga supplier ng computing power tulad ng NVIDIA ay makakakuha ng napakataas na margin ng kita, kundi pati na rin na ang mga kliyente ng NVIDIA, tulad ng SpaceXAI, ay maaaring bumili at ibenta muli ang computing power sa mga kompanya tulad ng Anthropic sa isang mataas na margin. Samantala, maaari ngang magbayad ng premium ang Anthropic, dahil maaari nilang ibenta ang mga token sa mas mataas na premium.
Gayunpaman, hindi lamang ang sobrang demand ang nagbigay sa Anthropic ng malaking profit margin: maaaring mayroon ang Anthropic at OpenAI sa pinakamababang gastos sa bawat yunit ng advanced-quality intelligence, dahil sa kakayahan ng model, sukat ng serbisyo, at efficiency ng token. Mas maaga sila ng ilang buwan kaysa sa kanilang kalaban sa pagbibigay ng mga model na may tiyak na antas ng kakayahan, habang ginagamit ang pinakamahusay na model upang mapabuti ang mga gastos na ito.
Mahalagang tandaan na ang merkado ay hindi pa nag-uuri ng inteligensya bilang isang komodidad: ang demand ay espesipiko sa Anthropic at OpenAI, at mas kaunti ang demand para sa mas mahinang mga modelo (kaya binibili ng Anthropic ang kapasidad mula sa SpaceXAI at Meta). Isang paraan upang isipin ang pagpapabilis sa pag-optimize ng gastos ay ito ay isang punsiyon ng trabaho na kailangang tapusin batay sa antas ng inteligensya, kaya ang mga bumibili ng inteligensya ay maaaring lumikha ng isang merkado kung saan ang inteligensya ay komodidad. Gayunpaman, sa mahabang panahon, anuman ang nasa harap, ang may-ari nito ay may pinakamalakas na kakayahang kontrolin ang mga merkado na hindi nasa harap, na mga merkado na lamang ay harap minus n na buwan, o ang mga buwan na patuloy na ino-optimize ng mga tagagawa ng harap na modelo ang kanilang gastos sa serbisyo.
Lahat ng ito ay nagsasabi na ang pangkalahatang reaksyon sa Kimi at mga Chinese model ay medyo sobra, kung titingnan natin ito mula sa pananaw ng ekonomiya. Mayroon ngayon na isang price floor, na resulta ng kakulangan sa computing power. Sobrang nag-aalala ako kung mas mura ba talaga ang mga Chinese model sa basehan ng marginal cost—simpleng tila mas mura sila dahil ang supply ng Anthropic at OpenAI ay sobrang limitado, kaya ang kanilang presyo ay mas mataas kaysa sa kung may sapat na supply upang matugunan ang pangangailangan sa artificial intelligence.
Panic sa Frontier Lab
Bakit kaya takot ang mga tagagawa ng modelo sa mga modelo mula sa Tsina?
Una, naniniwala ako na ang前沿实验室 ay nakabase sa isang mundo kung saan ang gastos sa pagtuturo ang nagtataglay ng pangunahing papel sa kanilang pagsusuri sa pagsasagawa. Habang ang pagtuturo ay gumagamit ng higit pang GPU kaysa sa pag-iisip, mahalaga na maksimisahin ang kita mula sa pag-iisip upang matulungan ang pagsasagawa ng susunod na pagtuturo, na nangangahulugan na ang pagbabayad para sa pag-iisip ay dapat maging sobrang mataas.
Gayunpaman, sa pagtingin sa hinaharap, inaasahan kong ang paglago ng market para sa pag-iisip ay mabilis na mas mabilis kaysa sa mga gastos sa pagtuturo (na kasama ang aking paghuhula na patuloy na tataas ang mga gastos sa pagtuturo), na nangangahulugan na talagang makakapag-compensate sila sa pamamagitan ng dami. Hanggang walong buwan ang nakalipas, hindi pa malinaw kung ito ay mangyayari, ngunit ang pagpapalaya ng Agent paradigm ay sobrang malaki, kaya dapat mas tiyak ang mga nangungunang laboratorio na hindi lamang makakapag-survive sila sa mas mababang presyo, kundi makakalago rin sila (kapag may sapat na computing power na sila).
Sa pangalawa, ang pagkamatalino ay hindi isang perpektong produkto, bahagyang dahil ang paggamit ng pagkamatalino ay nagpapagaling nito mismo. Sa partikular, anumang nagpapatakbo ng pag-iisip ay nagkukolekta ng data, at ang mga data na ito ay gagamitin upang gawing mas mabuti ang susunod na iterasyon ng modelo. Sa isang aspeto, ito ang dahilan kung bakit mas maraming mga lab na nasa harap ay bumababa ng presyo at tumataas ng paggamit habang dumadami ang kanilang computing power. Sa ibang aspeto, ito ang dahilan kung bakit patuloy na nagiging interesado ang mga kumpanya tulad ng Microsoft sa pagtutulungan sa mga kumpanya upang magpapatakbo ng kanilang sariling mga modelo. Kung ang mga modelo mula sa Tsina ay isang praktikong alternatibo, mas magiging posible ito.
Ikatlo, ang paraan ng iba pang pagkakaiba ng mga laboratoryo sa harap, maliban sa pagkakaiba sa mga modelong Tsino, ay ang pagpapatuloy sa pag-integrate pataas sa karanasan ng kliyente. Ang Claude Code at Codex ay nagpakita ng malaking pagkakadikit, isang katotohanang nakakalito. Anuman ang kasangkapan na iyong pinagsimulan, maaaring iyon ang iyong gagamitin nang matagal, lalo na para sa mga hindi teknikal na gumagamit. Sa mahabang panahon, ang pangangailangang ito para sa pagtaas ay nangangahulugan na ang mga modelo sa harap ay isang direktang banta sa mga provider ng software, kabilang ang Microsoft. Sa kabilang banda, sa anumang antas na ang mga kumpanya ng software na may kontrol sa karanasan ng kliyente ay makakakuha ng kompetitibong mga modelo, sa ganitong antas sila ay makakatutol sa pagkakalat ng mga laboratoryo sa harap.
Sa huli, ang ideolohikal na pananaw ng Anthropic ay hindi maaaring maligaw. Ito ay isang kumpanya na naniniwala na lamang sa kanila ang maaaring ipagkatiwala ang AI, at ang pagkakaroon ng mga open-source na alternatibo sa weights ay isang patay na pagsabog sa hipotesis na ito.
Ang motibo ng China
Hindi si Kimi ang tanging bagong modelong Tsino. Ibinahagi ng Bloomberg:
Ang presyo ng mga bahagi ng Alibaba Group Holding Limited ay tumataas ng 5.4% noong Lunes, matapos na ipakilala ng kumpanya ang preview ng kanilang pangunahing modelo na Qwen3.8 Max, na isinasaad na ikalawa lamang sa Fable 5 ng Anthropic. Ang paglabas noong Linggo ay naganap ilang araw matapos ang pagpapakilala ng makapangyarihang bagong produkto ng startup na Moonshot AI, na nagdulot ng pagbabago sa merkado at nagpapalalim sa mga pag-aalala ng Estados Unidos tungkol sa pagkakalapit ng China sa mga pangunahing lider tulad ng Anthropic at OpenAI. Ang Qwen3.8 Max ay may 2.4 trilyon na parameter at kasama ang Kimi K3 ng Moonshot AI sa kategorya ng mga malalaking modelo. Ang K3, na may 2.8 trilyon na parameter, ay nakakapagkumpetensya sa mga pinakamataas na produkto, at itinakda rin ng Alibaba ang parehong mataas na mga inaasahan.
Maaari na ngayon ng mga developer na makakuha ng access sa Qwen3.8 Max sa pamamagitan ng Alibaba’s coding platform (kabilang ang Qoder). Planong buksan ng Alibaba ang weights ng model na ito sa pampublikong pag-access sa isang malapit na pagkakataon, palawakin ang access labas sa preview version. Ang malaking interes sa mga artificial intelligence system at model na gawa sa Tsina ay nagresulta sa pagpapahinto ng Moonshot sa huling bahagi ng Linggo upang humarap sa sobrang demand.
Ang presyo ng mga aksyon ng Alibaba Group Holding Limited ay tumataas ng hanggang 5.4% noong Lunes, matapos ipakilala ng kumpanya ang preview version ng kanilang pangunahing modelo na Qwen3.8 Max, na sinasabing ikalawa lamang sa Fable 5 ng Anthropic PBC. Ang pagpapalabas noong Linggo ay naganap ilang araw lamang pagkatapos ng paglalabas ni Moonshot AI ng isang makapangyarihang bagong produkto, na nagdulot ng pagbabago sa merkado at nagpapalalim sa mga pag-aalala ng Estados Unidos tungkol sa paghahabol ng China sa mga pangunahing kalahati tulad ng Anthropic at OpenAI. Ang Qwen3.8 Max ay may 2.4 trilyong parameter at kasama ang Kimi K3 ni Moonshot sa klase ng mga makapangyarihang modelo. Ang K3, na may 2.8 trilyong parameter, ay nakakapagpahalaga sa mga pinakamataas na produkto, at itinakda rin ng Alibaba ang parehong mataas na mga inaasahan.
Maaari na ngayon ng mga developer na makakuha ng access sa Qwen3.8 Max sa pamamagitan ng Alibaba’s coding platform, kabilang ang Qoder. Planong buksan ng Alibaba ang weights ng model na ito sa isang malapit na pagkakataon, palawakin ang access sa labas ng preview version. Ang takip na pangangailangan para sa mga artificial intelligence system at model na gawa sa Tsina ay nagresulta sa pagpapahinto ni Moonshot sa pagtanggap ng mga bagong subscription noong hatinggabi ng Linggo upang harapin ang sobrang demand.
Mahalagang tandaan na ang Qwen3.8 Max ay magiging bukas sa weights. Binigyan ng pahinga ng Alibaba ang paglalabas ng weights ng kanilang pinakamalalaking model sa simula ng taon, ngunit tila nagbago sila sa desisyon na ito; naniniwala ako na ang pagbabagong ito ay may kinalaman sa pagsasalita ni Xi Jinping tungkol sa AI noong nakaraang linggo, na nagpapalakas pa ng pagtutok sa pagkakaroon ng bukas na weights:
Dapat nating sundin ang prinsipyo ng pagiging bukas at kapakanan ng lahat, at suportahan ang pag-unlad na dinudulot ng inobasyon. Bilang bagong motor ng paglago ng ekonomiya sa buong mundo at accelerator sa pagbabago ng pwersa ng paglago, ang artificial intelligence ay mula sa digital na mundo ay patungo sa pisikal na mundo. Dapat nating manatili sa natatanging pagkakataong ito sa kasaysayan, at suportahan ang open source, pagiging bukas, pakikipagtulungan, at pagbabahagi. Dapat nating palakasin ang teknolohikal na inobasyon, industriya, at aplikasyon sa mga sitwasyon ng artificial intelligence. Dapat nating i-coordinate ang pagpapalago ng pagbabago at pag-upgrade sa mga tradisyonal na industriya, pagpapalakas sa mga bagong industriya, at pagpaplano para sa mga hinaharap na industriya, upang makamtan ng lahat ng sektor ang benepisyo mula sa artificial intelligence.
Ang estratehiya ng Tsina ay malinaw: komersyalisahin ang iyong mga komplemento. Tandaan na malinaw na isinasaalang-alang ni Xi Jinping ang pagkakaroon ng pagkakabukas at ang AI na "mumula sa digital na mundo papunta sa pisikal na mundo"; ang pisikal na mundo ay isang mundo na pinamumunuan ng Tsina, at ang liderato nito sa mga larangan tulad ng robotika ay makikinabang nang malaki mula sa mga AI modelong magagamit nang palaganap.
Kasunod nito, ayaw ng China na makamit ng Amerika ang isang asimetrikong kahusayan sa AI; mas mabuti pa kung makapagpapaliit ang China sa mga nangungunang laboratorio ng Amerika habang pinapalakas ang anumang at lahat ng posibleng kalaban ng Amerika, at maaari itong makatanggap mula sa inobasyon na nakadepende sa isang bukas na ekosistema.
Distillation issue
Kung gayon, huwag maghintay ng anumang aksyon mula sa China tungkol sa distillation attacks sa mga avant-garde lab. Mali ang pagtatakda ng lahat ng tagumpay ng mga Chinese lab sa distillation, ngunit gayundin mali ang pagsisiguro na ang distillation ay walang nagdala ng malaking kapakinabangan sa mga Chinese lab. Ang ganitong kapakinabangan ay naging tunay sa nakaraang taon dahil ang post-training reinforcement learning ay naging mahalaga sa pagganap ng model. Hindi kailangan ng mga Chinese lab na magsimula mula sa zero upang bumuo ng reinforcement learning environment; kaya nilang gamitin ang mga model mula sa avant-garde lab bilang guro upang makamit ang mabilis na pagpapabuti sa mas mababang gastos (hindi ito ang tanging dahilan kung bakit mas mababa ang gastos sa pagbuo ng model sa China, ngunit isa itong mahalagang dahilan).
Kakaibang, ang isa sa mga pinakamahalagang paggamit ng mga modelong Tsino sa Kanluran ay ang distilasyon mismo. Halimbawa, ang Thinking Machines, na kung saan ay bago lang ay ipinakilala ang mga modelong may bukas na timbang, ay nakasalalay sa mga modelong Tsino upang lutasin ang problema ng cold start sa reinforcement learning. Isinulat ni Dean Meyer at Konstantine Buhler ang isang napakagandang artikulo sa X na nagpapaliwanag kung paano ang distilasyon ay nagpapakita na ang mga bukas na timbang na modelong Kanluranin ay may malaking kahinaan kumpara sa mga Tsino:
Hindi naglalarawan ang distilasyon ang buong pangunahing pagkakaroon ng China sa mga bukas na modelo. Mayroon ang mga Chinese lab sa mga researcher na pandaigdigang antas, malaking kapasidad sa pagcompute, malakas na pre-trained models, co-design ng software at hardware, at mabilis na pag-unlad sa post-training capabilities. Ngunit ang distilasyon ay nagpapaliit sa mahal na huling pagkakaiba mula sa malakas na pundasyon patungo sa mga sistema na malapit sa kahulugan. Kahit maliit ang bahagi ng distilasyon sa kabuuang kakayahan ng mga modelo ng China, ito ay may malaking bahagi sa kanilang kamalayan kumpara sa mga bukas na modelo ng Amerika.
Ang bagong mekanismo ng pagsasagawa ay gagawing mas mahirap, mas mabagal, at mas mahal ang malawakang distilasyon para sa mga kompanya sa China. Gayunpaman, ang pagsasagawa ay hindi makakalimot sa distilasyon na suportado ng mga tagapag-acto ng estado. Kaya, bawat makabagong pag-unlad sa Kanluran ay nagbibigay ng isa pang guro para sa mga laboratorio sa China. Dapat mag-replica nang mag-isa ang mga tagagawa sa Kanluran ng mga kakayahan na ito, o maghintay na matuto mula sa mga modelong Chinese. Ang pagkakaiba na ito ay nagbibigay ng paulit-ulit na struktural na kahusayan sa mga laboratorio sa China kumpara sa mga kompanya sa Kanluran.
Dapat ulitin ang punto na ito: Dahil kailangang sundin ng mga tagagawa ng open-weight model sa Amerika ang mga termanong serbisyo ng mga fronter laboratoryo, sila (1) mas mababa kaysa sa mga alternatibo sa Tsina, (2) sa huli ay nagpapakalawang ng mga distilled model, na lamang naglalakbay sa pamamagitan ng mga laboratoryo sa Tsina. Mas mabuti ba kung maaaring direktang makakuha ng mga open-weight model sa pinagkukunan ang mga tagagawa sa Kanluran?
Para dito, may isang mas interesanteng tanong tungkol sa distilasyon: bakit ba talaga ito masama? Sa wakas, hindi ba ang mga malalaking modelo sa wika ay isang distilasyon ng lahat ng kaalaman sa bukas na internet, na kinuha at dinistila ng mga nangungunang laboratorio upang maging modelo na ngayon ay dinistila? Sino nga ba ang nasasaktan dito?
Sa totoo lang, ang paradoksong ito ay ang solusyon. Naniniwala ako na ang mga modelong may bukas na weights ay nakakatulong sa pagpapalago (at, batay sa nabanggit, naniniwala ako na ang mga frontline lab ay magiging okay), ngunit ang pagkakasalalay sa China ay isang problema. Dapat maglagay ang Estados Unidos ng batas na (1) malinaw na ituring ang pagkolekta ng data para sa pagtatrain ng mga model bilang fair use, at (2) ipagbawal ang mga tuntunin sa serbisyo na nagbabawal sa distilasyon para sa mga Amerikanong kumpanya. Ang pagpigil sa distilasyon—na talagang ang pag-query sa API—ay halos imposible; dapat pumili ang Estados Unidos ng ibang landas, na sumusuporta sa isang bagong patakaran sa karapatang-ari na protektahan ang mga lab, habang sinisiguro na ang kanilang natutunan ay magiging pwersa para sa karagdagang inobasyon ng iba.
Mga dahilan kung bakit dapat mag-alala
Patuloy na tinatanggal ng artikulo ang sobrang reaksyon sa Kimi K3 at mga open-weight model mula sa China; gayunpaman, may isang dahilan na dapat pag-alalahanan, na ang网络安全. Isaalang-alang ang kuwento ng The Stack:
Sinabi ng Hugging Face na noong una sa linggong iyon, ang kanilang production infrastructure ay nasakop ng isang "autonomous" AI agent system. Ang security team ng platform ay unang nakaharap sa pagkakabigo sa event response (IR) dahil sa mga di-nakikilalang American LLM frontier model safeguards, "hindi sila nakakadistingguhi sa pagitan ng event responders at attackers," ayon sa kanila. Kaya naman gumamit ang mga tagapagtanggol ng Hugging Face ng open-source GLM 5.2 model mula sa Chinese Z.ai lab—ginagamit ito sa kanilang sariling infrastructure upang analisahin ang higit sa 17,000 na log o footprint na itinirai ng attacker.
Para sa Hugging Face, na may pangunahang tanggapan sa New York, ang pagkilala sa publiko na ito ay isang makabuluhang pagpapahayag, kung saan ang kumpanya ay nagpapahintulot sa mga gumagamit na magtrabaho kasama sa mga modelo, dataset, at mga aplikasyon, at nakamit ang milestone ng $100 milyon na ARR noong tag-init. Sa isang report ng insidente, inirerekomenda ng kumpanya ang mga tagapagbantay na "maghanda ng isang may kakayahan na modelo na maaaring mag-run sa iyong sariling imprastruktura [amin ang italic] upang maiwasan ang pagkakasakop ng mga pader at maiwasan ang paglabas ng data at credentials ng mga mananakop mula sa iyong kaligiran."
Mahirap i-overstate kung gaano kalingaw ang reaksyon ng administrasyon ni Trump sa paglalabas ng Fable ni Anthropic, lalo na dahil ito ay pinalalalim ang pinakamasamang倾向 ni Anthropic, na ang pagkakatiwala sa malakas na AI ay dapat limitado lamang sa kanila. Sa isang mundo na may isang AI lamang, maaaring makatwiran na panatilihin ang pinakamalakas na kakayahan sa cybersecurity para sa pamahalaan ng Estados Unidos at mga tiwalaing kaalyado; gayunpaman, hindi ito ang mundo kung saan tayo nabubuhay.
Mayroon nang mga modelo na kaya ng mag-atake sa umiiral na imprastruktura sa cyber security, at ang mga modelo na ito ay — nangangahulugan na — magiging malawakang magagamit. Ang pinakamahusay na depensa — sa katotohanan, ang tanging makabuluhang depensa — ay ang pagpapanatili ng pagkakaroon ng pinakamahusay na mga modelo ng mga tagapagtanggol. Ngayon, dahil sa utos ng administrasyon ni Trump, ipinagbabawal sa mga tagapagtanggol ang paggamit ng Fable o Sol para sa cyber security; ibig sabihin nito, ang pinakamahusay na alternatibo ay ang paggamit ng mga modelo mula sa isang bansa na maraming taon nang sinisikap na pahinaan ang ating mga depensa sa network. Sobrang kakaibang bagay ito!
Mas mabuting malinaw: Una, palakasin ang mga pagtatakda sa Fable at Sol sa cybersecurity, at pangalawa, siguraduhing magkaroon ng pantay na kalaban sa pagitan ng mga tagagawa ng open-weight model sa Estados Unidos at China. Oo, ang mga laboratoryo sa harap ay magkakaroon ng malakas na ingay, ngunit dapat maunawaan ng gobyerno na ang pagsunod sa kanilang pagkakalito ay nagresulta sa pagiging nakadepende ng mga kumpanya sa Estados Unidos sa China para sa depensa. Payagan ang mga laboratoryo sa harap na manalo sa pamamagitan ng paggawa nang mas mabuti; huwag hayaan silang tukuyin ang seguridad o proteksyon, o huwag hayaan silang ibaba ang hagdan ng kolektibong kaalaman ng tao. Sapat na mahirap para sa China na makipagkumpetensya; ang pagpapahintulot sa kanila na magdala ng pambansang pananagutan sa pagbubukas at pagkakabuo ay parang pagtanggi sa aming pinakamalaking kahusayan.
