Mặc dù mô hình AI trong nước có lượng gọi vượt trội so với Mỹ trong chín tuần, nhưng chi phí thực tế trong các tình huống lập trình cường độ cao vẫn cao hơn đáng kể so với gói GPT Codex. ZhiPu lỗ hơn 3 tỷ nhân dân tệ vào năm 2025, các gói như Kimi bị giới hạn hạn mức và giới hạn lưu lượng trong giờ cao điểm. Nguyên nhân chính là cơ sở hạ tầng tính toán của Trung Quốc còn thiếu hụt (449 trung tâm dữ liệu so với 5.427 của Mỹ), khiến không thể đưa ra các gói có giá thành cao như Codex. Hiện tại, các nhà phát triển phải cân nhắc giữa hiệu năng, giá cả và độ ổn định ở ba khía cạnh; các mô hình trong nước chỉ đạt mức gần với các mô hình hàng đầu quốc tế ở một số chỉ số hiệu năng, toàn bộ vẫn đang đối mặt với tình trạng được khen nhưng ít người dùng.Tác giả bài viết, nguồn: Zuihua FunTalk
Trong tháng vừa qua, giới AI tại Thung lũng Silicon liên tục tung ra những đòn mạnh: GPT-5.6, fable5, Grok-4.5 lần lượt ra đời.
Trong một thời gian ngắn, cộng đồng nhà phát triển và lập trình viên trong nước đã sôi nổi, các cuộc thảo luận và đánh giá về các mô hình tiên tiến như GPT-5.6 nổ ra liên tục.
Mặc dù tháng này cũng đã xuất hiện các mô hình trong nước mới như Kimi-K3, nhưng nhìn chung, các mô hình lớn trong nước hiện nay vẫn luôn ở tình trạng “được khen nhưng không được dùng” trong cộng đồng nhà phát triển hàng đầu.

The latest data shows that, in terms of usage: From June 22 to 28, Chinese models reached 2.039 trillion tokens used per week, while U.S. models reached 425 billion tokens, with the former leading for nine consecutive weeks.
Tuy nhiên, trái ngược với điều đó, doanh thu của sáu "tiểu long" AI trong nước lại không mấy khả quan: Báo cáo tài chính công khai cho thấy, Zhizhang có doanh thu 724 triệu nhân dân tệ năm 2025 nhưng lỗ lên tới hơn 3 tỷ nhân dân tệ; MiniMax đạt 79 triệu USD (khoảng 570 triệu nhân dân tệ); bốn công ty còn lại, như Yue Zhi An Mian, chưa công bố doanh thu cả năm đầy đủ.
Ngay cả các doanh nghiệp hàng đầu, doanh thu vẫn chỉ ở mức hàng trăm triệu nhân dân tệ.
So sánh với đó, Anthropic – doanh nghiệp hàng đầu trong lĩnh vực AI – đã đạt ARR khoảng 60-70 tỷ USD, chủ yếu nhờ vào B2B API và các kịch bản AI Coding.
Điều này đặt ra một câu hỏi sắc sảo:
Tại sao các mô hình trong nước được tuyên truyền là "rẻ" và "có lượng truy cập lớn" đến nay vẫn chỉ được khen mà không được sử dụng rộng rãi, và vẫn khó có thể cạnh tranh trực tiếp với các mô hình hàng đầu nước ngoài trong các ngữ cảnh giá trị cao như AI Coding?
Gần đây, sau khi thảo luận sâu với nhiều nhà phát triển hàng đầu, tôi đã phát hiện ra một sự thật rất phi trực giác:
Các mô hình lớn trong nước, ở một mức độ nào đó, thực sự rất “đắt”.
Chính vì sự “đắt đỏ” này, một số mô hình trong nước có bước đột phá về hiệu năng khó có thể thực sự thể hiện được những điểm nổi bật của mình.
01 Ảo giác về “giá thấp”
Khi nhắc đến các mô hình lớn trong nước, nhiều người nghĩ ngay đến các đại diện như DeepSeek, Kimi, và một trong những nhãn dán gắn liền nhất với chúng là giá thấp, rẻ tiền;
Nếu chỉ xem xét giá mỗi Token, các mô hình trong nước thực sự có lợi thế đáng kể so với các mô hình hàng đầu như GPT-5.6 và Fable5. Lấy GLM-5.2 và DeepSeek V4 làm ví dụ: GLM-5.2 có giá 1,4/4,4 USD cho mỗi triệu Token đầu vào/đầu ra, DeepSeek-V4-Pro là 0,435/0,87 USD; GPT-5.6 Sol là 5/30 USD, còn Claude Fable 5 là 10/50 USD.
Tuy nhiên, thực tế ấn tượng về “giá thấp” này là một sự hiểu lầm kéo dài của những người ngoài ngành.
Đặc biệt trong các tình huống lập trình cường độ cao, giá đơn vị của các mô hình lớn trong nước không chỉ không có lợi thế mà còn đắt hơn nhiều lần so với GPT và Claude có gói dịch vụ.
Li Guang (bút danh) là một nhà nghiên cứu trong lĩnh vực AI, do yêu cầu công việc, hàng ngày anh ấy phải tiêu tốn hàng tỷ Token trong các tình huống AI Coding. Với mức tiêu thụ này, nếu sử dụng các mô hình lớn trong nước như GLM-5.2, chi phí tổng thể sẽ trở nên cực kỳ kinh khủng.

Hóa đơn Token mà Lý Quang công khai
Trong ngày trò chuyện, số Token mà Lý Quang tiêu thụ đã gần 4 tỷ. Có thể tính toán sơ bộ: nếu anh ấy sử dụng GLM-5.2, chi phí ước tính khoảng: (86,39 triệu đầu vào thông thường × 1,4 đô la + 3,38 tỷ đầu vào bộ nhớ đệm × 0,26 đô la + 19,06 triệu đầu ra và suy luận × 4,4 đô la) khoảng 1.084 đô la, quy đổi theo tỷ giá 1 đô la = 7,2 nhân dân tệ, tương đương khoảng 7.800 nhân dân tệ.
Lý do khiến Lý Quang có thể thoải mái đốt Token như vậy là vì anh ấy đã đăng ký gói CodeX của GPT,
Ở đây, chúng tôi giải thích đơn giản về hình thức gói CodeX: nói một cách đơn giản, đây là gói được thiết kế dành riêng cho các tình huống lập trình: về mặt kỹ thuật, nó không thực sự là không giới hạn, mà là tích hợp Codex vào gói đăng ký ChatGPT: Plus là 20 USD/tháng, Pro bắt đầu từ 100 USD/tháng, với dung lượng khoảng 5 đến 20 lần gói Plus; sau khi hết hạn, bạn có thể mua Credits để tiếp tục sử dụng.
Tương tự, Claude Code của Anthropic cũng có một gói tương tự với các mức giá: Claude Pro là 20 USD/tháng, Max 5x và Max 20x lần lượt là 100 và 200 USD/tháng; hạn mức mỗi 5 giờ và hàng tuần trên nền tảng web Claude và Claude Code được chia sẻ, sau khi hết hạn mức có thể tiếp tục sử dụng theo giá API.
Dưới gói ưu đãi này, chi phí Token lớn đã được xóa bỏ.
Đối với các nhà phát triển trong nước, việc tiêu thụ hàng chục tỷ, hàng trăm tỷ token mỗi ngày trong các kịch bản AI Coding cường độ cao là một trạng thái phổ biến.
Tiểu Lưu cũng là một người dùng nặng của AI Coding, chi tiêu thực tế hàng tuần trên Codex là 300 nhân dân tệ, và đây vẫn là mức chi tiêu chưa có công ty hoàn trả.
Nhưng ngay cả chi phí như vậy, so với các mô hình trong nước, vẫn显得 “rẻ” hơn nhiều, vì với cùng 300 nhân dân tệ, bạn hoàn toàn không thể mua được số token tương đương với GLM 5.2.

Hóa đơn Token của Tiểu Lưu
Theo quan điểm của các nhà phát triển trong nước, gói Codex của GPT là token rẻ nhất hiện có trên thị trường, rẻ hơn nhiều lần so với ZhiPu và Kimi. Điều này có thể phản trực giác, nhưng sự thật là các mô hình trong nước hoàn toàn không thể so sánh về hiệu quả chi phí trong các kịch bản lập trình cường độ cao.
Cần lưu ý rằng: Codex không phải là gói không giới hạn thực sự; nếu tính theo mức cao nhất là 200 đô la, thì mỗi tuần khoảng có hạn mức 2 tỷ.
Tuy nhiên, do một số nhà phát triển sử dụng các mô hình thông qua các phương tiện trung gian như "trạm trung chuyển", chi phí thực tế của một số mô hình có thể thấp hơn nhiều so với kênh chính thức, dẫn đến việc đôi khi bạn có thể mua được nhiều Token hơn với giá thấp hơn, từ đó tạo ra hiện tượng chỉ với 300 nhân dân tệ có thể mua được 12 tỷ Token.
Thực tế, các mô hình trong nước đã từng đưa ra các gói tương tự về mặt định giá, nhưng nếu xem xét kỹ hơn, các gói này có nhiều hạn chế đáng kể về giới hạn so với Codex.
02 Nỗi đau định giá trong nước
Hiện trạng định giá của các mô hình lớn trong nước có thể được miêu tả bằng một câu:
Bạn nghĩ mình đang bước vào một bữa tiệc buffet, nhưng cuối cùng mới phát hiện, chủ cửa hàng vẫn tính theo cân.
Ví dụ, về các gói dịch vụ, Kimi và GLM-5.2 trong nước chia thành bốn mức giá là 49, 99, 199 và 699 nhân dân tệ, hạn mức được cập nhật lại hàng tuần; đối với kế hoạch GLM Coding Plan, các phiên bản Lite, Pro, Max lần lượt cung cấp khoảng 80, 400, 1600 lần Prompt mỗi 5 giờ, tương đương khoảng 400, 2000, 8000 lần mỗi tuần, và trong giờ cao điểm của GLM-5.2, phí sẽ bị trừ gấp 3 lần.
Lấy Qoder của Alibaba làm ví dụ, theo giới thiệu của một người bạn của tác giả, làm công việc vận hành khách hàng B2B (biệt danh A Mi): “Qoder từng là IDE AI dễ sử dụng nhất tại Trung Quốc, tiếc là mức giá mới của chính nó đã làm mất đi lợi thế đó.”
Về gói dịch vụ: Qoder CN Cá nhân Pro và Pro+ lần lượt là 59 và 169 nhân dân tệ/tháng, bao gồm 2.000 và 6.000 Credits; phiên bản Teams và VPC lần lượt là 99 và 199 nhân dân tệ/ghế/ tháng, đều bao gồm 3.000 Credits, phiên bản sau bán từ 50 ghế trở lên.
Sau khi họ hợp nhất và điều chỉnh giá vào năm nay, theo những gì tôi biết, ít nhất đã có hai ba chục công ty từ bỏ gia hạn.
Theo thử nghiệm của Ami, gói Enterprise Edition 199 của Qoder sẽ hết sau 3 ngày theo cách sử dụng của anh ấy; nếu dùng theo cách của một nhà phát triển nặng, có lẽ sẽ hết trong một ngày.
Tương tự, đối với các gói dịch vụ, GLM-5.2 cũng khiến người dùng trong nước cảm thấy hỗn hợp nhiều cảm xúc.
Theo lời của nhà phát triển Tiểu Vi: “Gói GLM-5.2 gần như không có, ngay cả khi có gói, trong giờ cao điểm vẫn bị giới hạn lưu lượng và còn xảy ra hiện tượng ‘đâm sau lưng’ người dùng.”
Theo báo cáo của 36Kr: Gói GLM-5.2 trước đây khó mua hơn cả vé concert, mỗi sáng lúc 10 giờ đúng sẽ được làm mới lại, việc có mua được hay không hoàn toàn phụ thuộc vào tốc độ của bạn.
Tháng 1 năm 2026, Zhipu phát thông báo rằng do thiếu hụt năng lực tính toán, họ đã giảm ngay lượng bán hàng hàng ngày xuống còn 20% so với trước đây, mỗi sáng 10 giờ phát một lượng hạn mức nhỏ và bán hết trong vài phút.
Cuối cùng, sự keo kiệt của các mô hình trong nước về gói dịch vụ và giá cả về bản chất là do thiếu hụt năng lực tính toán.
Theo dữ liệu năm 2025 của Viện Thông tin và Công nghiệp Trung Quốc và Bộ Công nghiệp và Công nghệ Thông tin, Trung Quốc hiện có 449 trung tâm dữ liệu, trong khi Hoa Kỳ có 5.427 trung tâm. Về tổng năng lực tính toán, Trung Quốc là 1.053 EFLOPS, trong khi Hoa Kỳ là 2.400 EFLOPS.
Tuy nhiên, điểm then chốt ở đây là: trong 2.400 EFLOPS của Mỹ, tỷ lệ GPU cao cấp chiếm rất cao; trong năng lực tính toán của Trung Quốc, phần lớn là các chip trong nước như Huawei Ascend và Cambricon, hiệu năng đơn card vẫn còn khoảng cách thế hệ so với H100.
Để đáp ứng nhu cầu năng lực tính toán ngày càng tăng cao, kể từ tháng 3 năm 2026, Zhipu, Alibaba Cloud, Tencent Cloud và Baidu đồng loạt tăng giá token, mức tăng từ 5% đến 460%.
Nói một cách đơn giản, “giá thấp” và “cuộc chiến giá” của các mô hình trong nước đã trở thành quá khứ.
Không phải vì mô hình trong nước không muốn làm buffet, mà vì đã tính toán kỹ: với chi phí tính toán hiện tại và tình trạng lỗ, việc áp dụng gói đăng ký hàng tháng đồng nghĩa với việc lấy phí hàng tháng cố định để đánh cược rằng người dùng sẽ không làm quá tải hệ thống. Theo cách sử dụng của các nhà phát triển và lập trình viên trong nước, thường tiêu tốn hàng chục tỷ, thậm chí hàng trăm tỷ Token mỗi ngày, mô hình kinh doanh này sẽ nhanh chóng bị phá vỡ ngưỡng chi phí.
Các gói lập trình của OpenAI và Anthropic nhắm đến các khách hàng doanh nghiệp có giá trị cao—những khách hàng lớn như Cursor, GitHub Copilot có thể mang lại cho Anthropic doanh thu 1,4 tỷ USD mỗi năm.
Với sự hỗ trợ của sức mạnh tính toán cao, mô hình kinh doanh này về bản chất là đổi “phí hàng tháng cố định” lấy “khách hàng dài hạn”, chất lượng khách hàng cao và ARPU tương đối cao, giúp phân bổ chi phí đều.
So sánh với đó, dù trong nước có những ông lớn về điện toán đám mây như Alibaba, nhưng vấn đề là: Biên EBITA điều chỉnh của Alibaba Cloud trong năm tài chính 2026 chỉ đạt 7,5%; dù nhóm điện toán thông minh có tốc độ tăng trưởng doanh thu nhanh, nhưng lợi nhuận không cao.
Hơn nữa, các nhà cung cấp đám mây truyền thống dám bán “máy chủ đám mây không giới hạn lượng” vì người dùng không vận hành ở tải tối đa 24/7. Một máy chủ ECS, mức sử dụng CPU thực tế có thể chỉ khoảng 10%, nhờ đó nhà cung cấp đám mây có thể bán vượt mức một máy chủ vật lý cho mười người.
Nhưng suy luận mô hình lớn thì khác: mỗi khi một token được đưa vào, phải tiêu tốn thực sự một lượng tính toán GPU. Nếu người dùng liên tục truy cập 24/7, chi phí cho bộ nhớ HBM, lõi GPU và điện năng của nhà cung cấp đám mây đều là chi phí cố định, không có bất kỳ khả năng bán vượt công suất nào.
Mô hình "Tam giác vàng" của 03
Ngoài yếu tố giá cả, lý do rõ ràng để các nhà phát triển trong nước chọn Codex, Claude Code là hiệu năng lập trình mạnh mẽ của chúng.
Tuy nhiên, về mặt hiệu suất, các mô hình trong nước cũng không giống như một số định kiến nhất định.
Sau khi trao đổi với nhiều nhà phát triển, tác giả nhận thấy một quan điểm khá phổ biến là: các mô hình lớn trong nước, đặc biệt là các mô hình mới nhất như GLM-5.2, hiện đã có thể đảm nhận một số nhiệm vụ hỗ trợ và thứ yếu, chẳng hạn như kiểm thử và sửa lỗi.
Tuy nhiên, đối với các tác vụ bất đồng bộ phức tạp và kéo dài, các mô hình trong nước hiện vẫn còn khoảng cách lớn so với các mô hình hàng đầu như GPT, Claude.
Nhà phát triển Tiểu Trương, vào tháng 3 năm nay đã sử dụng một mô hình trong nước để lập trình, so sánh cùng một nhiệm vụ với GLM, Qwen và GPT, chỉ có GPT hoàn thành và đáp ứng yêu cầu trang web, đó là một dự án so sánh nội dung đa cấp, đa cột và tạo kết quả.
Một nhà phát triển khác, Tiểu Vi, cho biết theo trải nghiệm của cô, hiệu năng của Kimi 2.7 và DouBao 2.1 Pro cũng khá ổn, nhưng nhìn chung vẫn yếu hơn một bậc (thuộc nhóm thứ hai), tuy nhiên về tổng thể vẫn vượt trội hơn Claude Sonnet 4.6.
Hiện tại, sự đồng thuận phổ biến trong cộng đồng nhà phát triển là: GLM-5.2 là mô hình nội địa đầu tiên đạt đến cấp độ Opus.
Nó có sẵn và chiếm được vị trí trong việc thực hiện các tác vụ bất đồng bộ thực tế, phức tạp và kéo dài.
Mặc dù vẫn còn khoảng cách lớn so với mô hình Opus thật sự ở nhiều khía cạnh, chẳng hạn như kiến thức thế giới, điều này không ngăn cản nó trở thành một cột mốc mới cho các mô hình trong nước.
Nhưng thực tế là: những người "giỏi nhất" mới chỉ bắt đầu nổi bật, nhưng lại bị các yếu tố khác không liên quan đến hiệu suất kéo xuống.
Cụ thể, các yếu tố này bao gồm hiệu suất bộ nhớ đệm không cao, vẫn bị giới hạn lưu lượng trong giờ cao điểm, khiến trải nghiệm thực tế của nhà phát triển rất tệ.
Điều này dẫn đến một chiều cạnh khác trong việc so sánh các mô hình hiện tại: độ ổn định.
Trong trải nghiệm của các nhà phát triển và lập trình viên hàng đầu, việc lựa chọn mô hình đã không còn là sự so sánh hiệu suất đơn giản, mà là—
Tam giác vàng về hiệu suất—giá cả—độ ổn định.
Trong ba chiều này, các mô hình trong nước chỉ mới giành được một phần chỉ số của chiều đầu tiên.
Gần đây, Kimi của Trung Quốc đã ra mắt mô hình flagman mới nhất của mình, K3: đây là một mô hình flagman có trọng số mở với 2,8 nghìn tỷ tham số, đa phương tiện bản địa và ngữ cảnh 1 triệu Token, tập trung vào lập trình dài hạn, công việc tri thức và suy luận sâu.

Trong nhiều bài đánh giá, chỉ số trí tuệ của nó trên Artificial Analysis là 57 điểm, xếp thứ ba toàn cầu; đứng đầu bảng lập trình frontend của Arena với 1679 điểm, thậm chí còn có tin đồn rằng hiệu năng của nó đã có thể sánh ngang Claude Fable 5.
Tuy nhiên, đằng sau những điểm số và thứ hạng nổi bật, điều các nhà phát triển quan tâm nhất vẫn là một từ: hiệu quả chi phí.
Sau khi K3 được ra mắt, nhiều nhà phát triển cho biết, hiện tại Kimi vẫn còn đắt, không có tính cạnh tranh về giá so với Codex, và hạn mức sử dụng không đủ; chỉ xét riêng giá API, K3 cũng không thể gọi là “giá rẻ”: mỗi triệu Token cho bộ nhớ đệm/đầu vào/đầu ra lần lượt là 2/20/100 nhân dân tệ; GPT-5.6 Sol là 0,5/5/30 đô la Mỹ, K3 tuy thấp hơn Sol nhưng rõ ràng cao hơn GPT-5.6 Luna ở mức 0,1/1/6 đô la Mỹ.
Trong quá trình sử dụng K3, các nhà phát triển cho biết đã xảy ra tình trạng API bị ngắt kết nối, thậm chí ngắt suốt cả buổi sáng.
Hiện tại, các nhà phát triển trong nước không phải không muốn trả tiền cho các mô hình trong nước, mà là do các mô hình trong nước hiện nay do thiếu năng lực tính toán và chi phí cao, nên không thể mở các gói dịch vụ có tính chi phí hiệu quả như Codex, mà chỉ có thể mở các gói “đánh giá đại chúng” trông giống như buffet nhưng thực chất có giới hạn (tương tự như Kế hoạch Coding của Zhipu).
Việc trải nghiệm gói dịch vụ không ổn định và tỷ lệ giá trị trên chi phí không rõ ràng khiến người dùng khó duy trì sau khi đã sử dụng. Về bản chất, đây là lựa chọn hợp lý của người dùng trong bối cảnh chi phí nền tảng tính toán hiện nay vẫn còn cao.
Những điều trên không phải chúng tôi muốn bơm hơi cho người khác, làm giảm tinh thần của chính mình, mà chỉ muốn nhắc nhở về một rủi ro.
Hiện tại, trong quá trình đuổi theo GPT và Claude, các mô hình trong nước rất coi trọng hiệu năng, nhưng từ giai đoạn phát triển đến ứng dụng, các mô hình lớn trong nước cần vượt qua còn xa mới chỉ là ngọn núi hiệu năng này.
Chúng ta cần chờ đợi cho đến khi nền tảng tính toán trong nước được sản xuất hàng loạt quy mô lớn, khi đó, về mặt công nghệ, giá cả và độ ổn định, chúng sẽ tạo thành sức mạnh tổng hợp, giúp sản phẩm của chúng ta đáp ứng được kỳ vọng của người dùng.
