MiniMax báo cáo tăng trưởng doanh thu 283,1%, tuyên bố đạt đột phá AI hiệu quả chi phí

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
MiniMax báo cáo tăng trưởng doanh thu 283,1% trong nửa đầu năm, do nhu cầu tin tức về AI và tiền điện tử. Doanh thu nửa năm đạt 1,5 lần dự báo năm 2025, với mức tăng lợi nhuận gộp 464,8%. ARR vượt mốc 800 triệu USD vào tháng Tám, trong đó 80% đến từ B2B. Lượng sử dụng token tăng 20 lần vào tháng Bảy. Người sáng lập Yan Junjie nhấn mạnh những đột phá AI hiệu quả về chi phí, sử dụng kiến trúc MSA để giảm chi phí tính toán văn bản dài xuống còn 1/20 so với các mô hình truyền thống. Sự phát triển của hệ sinh thái rõ rệt khi việc áp dụng B2B đang tăng tốc.
MiniMax công bố báo cáo bán niên đầu tiên sau khi niêm yết trên thị trường chứng khoán Hồng Kông, doanh thu tăng 283,1% so với cùng kỳ năm trước, đạt 1,5 lần tổng doanh thu cả năm 2025; lợi nhuận gộp tăng 464,8%. Tháng 8, ARR vượt mốc 800 triệu USD, doanh thu từ phân khúc B chiếm 80%, lượng Token tiêu thụ tháng 7 đạt 20 lần so với tháng 1. Người sáng lập Nghiêm Tuấn Kiệt đề xuất chiến lược công nghệ “tối thiểu hóa chi phí suy luận, tối đa hóa trí tuệ”, thông qua kiến trúc MSA tự phát triển, giảm chi phí tính toán Token cho văn bản dài hàng triệu chữ xuống khoảng 1/20 so với cơ chế chú ý toàn phần truyền thống, đạt được sự cân bằng giữa trí tuệ và chi phí trong điều kiện năng lực tính toán hạn chế, mở ra con đường mới cho các mô hình lớn trong nước tham gia cạnh tranh toàn cầu.

Tác giả bài viết, nguồn: Trí Đông Tây

Ngày 26 tháng 8, doanh nghiệp hàng đầu Trung Quốc trong lĩnh vực mô hình AI lớn MiniMax (Xiyu Technology) đã công bố báo cáo bán niên đầu tiên kể từ khi niêm yết trên thị trường chứng khoán Hồng Kông.

Báo cáo tài chính cho thấy doanh thu của MiniMax tăng 283,1% so với cùng kỳ năm trước, doanh thu sáu tháng đã đạt 1,5 lần so với doanh thu cả năm 2025; lợi nhuận gộp tăng 464,8% so với cùng kỳ.

Hình ảnh

Tại cuộc họp báo cáo tài chính, Diêm Tuấn Kiệt, người sáng lập, Chủ tịch Hội đồng quản trị, CEO và CTO của MiniMax, tiết lộ rằng vào tháng 8, ARR của MiniMax đã vượt quá 800 triệu USD, tỷ lệ doanh thu từ doanh nghiệp đạt 80%, và lượng Token tiêu thụ trong tháng 7 gấp 20 lần so với tháng 1.

Ngoài dữ liệu, điều thu hút sự chú ý của tôi còn là câu nói của Nghiêm Tuấn Kiệt trong buổi họp báo hiệu suất tối qua. Anh ấy nói: “Chỉ khi tối thiểu hóa chi phí thông minh trên đơn vị, mới có thể tối đa hóa mức độ thông minh.”

Cần biết rằng, trong hai năm qua, các mô hình lớn cơ bản chỉ có hai con đường: либо tích lũy tham số theo định luật Scaling để tăng trí thông minh, với chi phí cao; либо giảm hiệu suất để phổ cập, nhưng mức độ trí thông minh vẫn luôn thiếu một chút.

Ngành dường như mặc định đây là hai điều không thể đồng thời có được.

Tại sao MiniMax lại chọn một con đường trái với trực giác của ngành? Liệu con đường này có thể đi được không?

Sự thông minh và chi phí, tại sao khó có thể cân bằng?

Định luật quy mô đã thúc đẩy câu chuyện về AI trong vài năm qua: tham số càng lớn, trí thông minh càng cao.

Theo Luật Quy mô, hiện nay tham số của mô hình đã được nâng lên mức 2-3T, trí thông minh của mô hình cũng theo đó tăng cao, khiến mọi người đều kêu lên rằng AGI sắp đến.

Đằng sau sự thịnh vượng, quy tắc này cũng ẩn chứa một nguy cơ: khi mô hình đạt đến quy mô hàng nghìn tỷ tham số, chi phí suy luận bắt đầu trở nên không thể bỏ qua.

CEO của NVIDIA, Huang Renxun, đã đưa ra nhận định tại hội nghị GTC 2026: “Thời đại chi phí đào tạo là yếu tố chính thúc đẩy chi phí đã kết thúc.推理 hiện là tải công việc chính và đang mở rộng nhanh chóng.”

Chi phí suy luận gia tăng, cùng với sự trỗi dậy của tải công việc Agent, AI đang chuyển từ mô hình hỏi-đáp đơn lẻ sang thực hiện tự chủ nhiều bước. Một yêu cầu của người dùng có thể đi kèm với hàng chục甚至 hàng trăm lần gọi mô hình, khiến hóa đơn năng lực tính toán của toàn ngành tăng theo cấp số nhân.

Kết quả là ngành dần chia thành hai phe:

Một bên là các mô hình nhỏ với tốc độ nhanh và chi phí thấp, nhưng hiệu suất trí tuệ ở mức trung bình.

Google là đại diện tiêu biểu cho con đường này. Từ tháng 7 đến tháng 8 năm 2026, Google đã đồng thời ra mắt ba mô hình nhẹ: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber.

Hình ảnh

3.5 Flash-Lite là mô hình nhanh nhất và chi phí thấp nhất trong dòng 3.5, được thiết kế đặc biệt cho các tải công việc có độ thông lượng cao và các tác vụ nhỏ trong hệ thống đại lý AI quy mô lớn. Lượng Token đầu ra của Gemini 3.6 Flash giảm 17% so với thế hệ trước.

Nhưng giá phải trả cũng rất rõ ràng. Google cho đến nay vẫn chưa ra mắt mô hình hàng đầu Gemini 3.5 Pro, sản phẩm dự kiến được công bố tại sự kiện I/O tháng 5 nhưng vẫn chưa xuất hiện.

Ở phía bên kia là các mô hình lớn có trí thông minh cao nhưng chi phí triển khai đắt đỏ và chi phí bắt đầu tăng lên.

Các nhà sản xuất mô hình lớn trong nước đang chạy nước rút trên con đường này. Vào tháng 7 năm 2026, Yue Zhi An Mian đã ra mắt Kimi K3 với quy mô tham số đạt khoảng 2,8 nghìn tỷ, là mô hình mã nguồn mở có quy mô tham số lớn nhất thế giới hiện nay.

Alibaba ngay sau đó ra mắt Qwen3.8 Max với khoảng 2,4 nghìn tỷ tham số; Baidu Wenxin 5.0 cũng đạt 2,4 nghìn tỷ tham số; DeepSeek V4-Pro có 1,6 nghìn tỷ tham số.

Sự cải thiện trí tuệ do quy mô tham số mang lại là rõ ràng. Kimi K3 vượt qua Claude Fable 5 và GPT-5.6 Sol trên nhiều bảng xếp hạng Agent. Qwen3.8 Max được mô tả là “một trong những mô hình mã nguồn mở có quy mô tham số lớn nhất và hiệu năng mạnh nhất”.

But costs have also risen accordingly.

Giá API của Kimi K3, chi phí đầu vào không được lưu bộ nhớ đệm tăng từ 6,5 nhân dân tệ mỗi triệu token lên 20 nhân dân tệ, đầu ra tăng từ 27 nhân dân tệ lên 100 nhân dân tệ, tương ứng tăng 208% và 270%. Nhà phát hành khuyến nghị triển khai siêu nút bằng cách sử dụng ít nhất 64 card tăng tốc.

Chỉ hai ngày sau khi ra mắt, Moonlight đã thông báo tạm dừng đăng ký người dùng cuối (C-end) và chuyển toàn bộ công suất tính toán để đảm bảo cho người dùng hiện có.

Càng tiên tiến về trí tuệ nhân tạo, tham số mô hình càng lớn, chi phí gọi dùng càng cao, rào cản triển khai càng cao, năng lực tính toán càng khan hiếm… dường như đây là một nút thắt khó giải.

MiniMax, không lựa chọn

Đối với bài toán khó lựa chọn giữa chi phí và trí tuệ, lựa chọn của MiniMax là: tôi muốn tất cả.

Yan Junjie đã làm rõ toàn bộ logic của MiniMax trong cuộc họp báo cáo tài chính:

Tính toán là hữu hạn đối với mỗi công ty. Chúng tôi mong muốn thông qua “Tối thiểu hóa chi phí suy luận, Tối đa hóa trí tuệ” để đạt được “Trí tuệ dành cho mọi người”. Đây là con đường công nghệ chúng tôi luôn kiên trì theo đuổi, cũng là tâm nguyện ban đầu khi khởi nghiệp.

“Minimize the Inference Cost, Maximize the Intelligence” có nghĩa là “Tối thiểu hóa chi phí suy luận, tối đa hóa trí tuệ”. MiniMax đặt việc giảm chi phí và nâng cao trí tuệ vào cùng một khung叙事.

Tại sao hai việc này có thể được nhắc đến cùng nhau? Vì MiniMax có cách hiểu khác biệt về “suy luận”:

Đầu tiên, suy luận là tư liệu sản xuất của trí tuệ thế hệ tiếp theo.

Trước đây, người ta cho rằng suy luận là “sử dụng mô hình”, còn huấn luyện là “tạo mô hình”. Nhưng hiện nay, các khâu cốt lõi như dữ liệu tổng hợp, Rollout trong học tăng cường, đánh giá và xác minh mô hình, tương tác giữa Agent và môi trường… đều về bản chất đang chạy tải suy luận.

Tỷ trọng của giai đoạn sau huấn luyện trong tổng công suất huấn luyện ngày càng tăng. Suy luận không còn là khối lượng công việc chỉ xuất hiện sau khi huấn luyện kết thúc, mà là sự tiêu tốn xuyên suốt toàn bộ quá trình huấn luyện.

Vì vậy, hiệu suất suy luận không chỉ quyết định không gian định giá của API, mà còn xác định mức độ có thể huấn luyện của mô hình thế hệ tiếp theo.

Thứ hai, tối ưu hóa chi phí suy luận là điều kiện cần thiết cho việc lặp lại thông minh.

Công suất tính toán có giới hạn vật lý, trong khi quy mô mô hình tiếp tục mở rộng. Nếu chi phí suy luận không giảm xuống, về sau chi phí sẽ ngày càng siết chặt cổ họng của sự tiến bộ trí tuệ.

Trong ngân sách tính toán hạn chế, khả năng chuyển đổi từng đồng tiền thành sản phẩm trí tuệ hiệu quả sẽ quyết định mô hình có thể tiến xa đến đâu.

Thứ ba, sử dụng chi phí thông minh thấp nhất để theo đuổi mức độ thông minh cao nhất—hai điều này là hai mặt của cùng một mục tiêu.

Ngành công nghiệp trước đây thường coi “ưu tiên trí tuệ” và “ưu tiên chi phí” là hai con đường khác nhau. Nhưng nếu chi phí suy luận không giảm xuống, thì trí tuệ cao đến đâu cũng không thể triển khai được.

Hiểu một cách đơn giản, tư duy của MiniMax là coi việc tối ưu chi phí và nâng cấp trí tuệ là một việc duy nhất. Ngay từ ngày đầu thiết kế mô hình, hiệu suất suy luận đã được coi là chỉ số cốt lõi và xuyên suốt toàn bộ chu kỳ phát triển.

Theo lời của Nhan Tuấn Kiệt: “MiniMax không theo đuổi sự đánh đổi giữa trí tuệ và chi phí. Mục tiêu là theo đuổi trí tuệ ở cấp độ cao hơn, và phương tiện để đạt được hiệu quả chi phí cao hơn là liên tục tối ưu hóa chi phí và hiệu suất suy luận.”

Chi phí tính toán giảm xuống 1/20, MiniMax đã tạo thành vòng lặp kỹ thuật "giảm chi phí, tăng trí tuệ"

MiniMax luôn tuân thủ tâm nguyện này để xây dựng một nền tảng công nghệ.

Quan trọng nhất là kiến trúc MSA (Sparse Attention) do tự phát triển. Nói một cách đơn giản, nó đã giảm chi phí tính toán mỗi Token cho văn bản dài hàng triệu từ xuống còn khoảng 1/20 so với cơ chế chú ý đầy đủ truyền thống, nghĩa là M3 chỉ tiêu tốn 1/20 lượng tính toán mỗi Token so với thế hệ trước khi xử lý ngữ cảnh 1M.

Hình ảnh

Chìa khóa của sự đột phá này là: tổng số tham số xác định giới hạn dung lượng kiến thức của mô hình, nhưng số tham số được kích hoạt xác định chi phí suy luận trên từng Token. Hai yếu tố này có thể tách rời nhau: việc mở rộng quy mô tham số không nhất thiết dẫn đến việc chi phí suy luận tăng tỷ lệ tương ứng.

Vì vậy, M3 có thể nâng cao mức độ thông minh mà không thay đổi giá cả, trong khi M3 Pro có thể đạt quy mô tham số khoảng 3T đồng thời thúc đẩy việc huấn luyện học tăng cường và các nhiệm vụ dài hạn.

Ở cấp độ cơ sở hạ tầng, tỷ lệ thời gian đào tạo hiệu quả (ETTR) của MiniMax đạt 97%, là một trong những công ty mô hình lớn độc lập đầu tiên tại Trung Quốc xây dựng hệ thống tính toán quy mô lớn và ổn định lâu dài.

Đã xây dựng mạng lưới cung cấp năng lực tính toán thông qua sự kết hợp giữa cụm tự chủ, nhà cung cấp đám mây và TokenFactory; năng lực tính toán hiện có và đang lên kế hoạch đã có thể hỗ trợ việc lặp lại liên tục các mô hình văn bản và video cấp 3T.

Kết luận: Không có lợi thế về sức mạnh tính toán, mô hình trong nước dựa vào gì để theo kịp?

Mỗi khi nói đến khoảng cách giữa các mô hình lớn của Trung Quốc và Mỹ, phần cứng luôn là chủ đề không thể bỏ qua.

Trước đây, mọi người đều cho rằng ai có quy trình sản xuất chip tiên tiến hơn và sức mạnh tính toán cao hơn thì sẽ tạo ra mô hình tốt hơn. Theo logic này, AI của Trung Quốc dường như sẽ luôn cách xa AI của Mỹ từ vài tháng đến nửa năm.

Chỉ có thể như vậy sao?

MiniMax đã đưa ra một con đường mới: Giảm thiểu chi phí suy luận, Tối đa hóa trí tuệ.

Giảm chi phí trên mỗi đơn vị trí tuệ cũng đồng thời nâng cao giới hạn tối đa của trí tuệ. Bởi vì các phương pháp như huấn luyện sau, dữ liệu tổng hợp và học tăng cường ngày nay đều chủ yếu chạy tải suy luận. Hiệu suất suy luận càng cao, thì trong cùng một lượng tài nguyên tính toán, bạn có thể thực hiện nhiều thí nghiệm hơn, từ đó nâng cao trần trí tuệ.

Người nào có thể tạo ra trí tuệ cao hơn với chi phí thấp hơn sẽ có thể mở rộng ranh giới xa hơn trong phạm vi tính toán hạn chế, từ đó đưa trí tuệ cao hơn vào cuộc sống rộng lớn hơn.

Đây có lẽ là con đường đầy hứa hẹn nhất để các mô hình lớn trong nước tham gia vào cuộc cạnh tranh toàn cầu. Và MiniMax đã bắt đầu xác minh điều này.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.