Việc ra mắt Kimi K3 gây ra "phép ngắt mạch" do nhu cầu vượt quá kỳ vọng

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
Sự gia tăng mạnh mẽ về nhu cầu đối với Kimi K3 của Moonshot AI đã kích hoạt cơ chế "circuit breaker" trong vòng 48 giờ, buộc đội ngũ phải tạm dừng đăng ký người dùng mới. Mô hình 2,8 nghìn tỷ tham số này sử dụng cơ chế chú ý tuyến tính lai KDA, giảm bộ nhớ đệm KV đi 75% và tăng tốc độ xử lý lên sáu lần ở độ dài ngữ cảnh 1 triệu. Kimi K3 đạt 57/60 điểm trong các bài kiểm tra AI toàn cầu, xếp thứ ba sau Claude Fable 5 và GPT-5.6. Sự ra mắt này đã khiến vốn hóa thị trường của NVIDIA giảm 111 tỷ USD và nâng định giá của Moonshot lên 31,5 tỷ USD trong sáu tháng. Các altcoin cần theo dõi có thể hưởng lợi khi chỉ số nỗi sợ và tham lam phản ứng với những biến động thị trường do AI gây ra.
Trong vòng 48 giờ kể từ khi ra mắt, Kimi K3 của Mặt tối của Mặt trăng đã phải tạm dừng đăng ký người dùng mới do lượng yêu cầu từ người dùng vượt xa dự kiến, buộc phải thực hiện “cắt giảm năng lực tính toán”. K3 có tổng quy mô tham số đạt 2,8 nghìn tỷ, sử dụng cơ chế chú ý tuyến tính hỗn hợp KDA, giảm độ phức tạp tính toán của các lớp chú ý từ cấp độ bình phương xuống tuyến tính, giảm tối đa 75% bộ nhớ đệm KV, tăng gấp 6 lần thông lượng giải mã ở độ dài ngữ cảnh 1 triệu. Kiến trúc này được xem là sự thực tiễn của “Định luật Tao” trong lĩnh vực AI, đạt được bước nhảy vọt về hiệu năng thông qua đổi mới kiến trúc hệ thống. K3 đạt điểm tổng hợp 57 trong các bài đánh giá mô hình AI toàn cầu, xếp thứ ba, sau Claude Fable 5 và GPT-5.6. Trên thị trường vốn, ngay ngày K3 ra mắt, vốn hóa thị trường của NVIDIA đã giảm khoảng 111,1 tỷ USD, trong khi định giá của Mặt tối của Mặt trăng tăng từ 4,3 tỷ USD lên 31,5 tỷ USD chỉ trong sáu tháng.

Tác giả bài viết, nguồn: 36氪

Kimi cũng có “định luật韬” riêng của mình.

K3 đang rất nóng, nhưng Kimi buộc phải tạm dừng.

Vào đêm ngày 19 tháng 7, đội ngũ Kimi của Moonshot đã công bố rằng do lượng yêu cầu của người dùng trong vòng 48 giờ kể từ khi Kimi K3 ra mắt đã vượt xa dự kiến, do thiếu hụt tài nguyên tính toán, họ đã tạm dừng việc mở đăng ký cho người dùng mới và ưu tiên phân bổ tài nguyên tính toán hạn chế cho các người dùng đã đăng ký hiện tại.

Hệ thống thành viên được chia thành quyền lợi Kimi và quyền lợi Code để phân bổ tài nguyên một cách chính xác. Từ phản hồi chính thức sau đó, Kimi không điều chỉnh hệ thống thành viên, mà chỉ tái cân bằng trải nghiệm người dùng dưới giới hạn năng lực tính toán.

K3 đã kích hoạt cơ chế “ngắt công suất”, chỉ có thể từ chối khách hàng mới và tập trung phục vụ khách hàng hiện tại.

Định luật Tao của Kimi

Hiện nay, các nhà phát triển mô hình đều đang nỗ lực mở rộng quy mô người dùng bằng các biện pháp như miễn phí, giảm giá và các chiến lược giá trị tốt. So với đó, hành động ngược lại của Kimi lại trông có vẻ hơi “phô trương”.

Tuy nhiên, mô hình càng mạnh, ngữ cảnh càng dài và người dùng gọi càng thường xuyên, thì tiêu thụ năng lực suy luận càng cao. Trong tình huống “lượng yêu cầu K3 đang tiến gần đến giới hạn chịu đựng của cụm tính toán hiện tại”, Kimi cũng gặp phải nỗi lo tương tự như “DouBao”: càng nhiều người dùng cuối, đóng góp doanh thu càng không rõ rệt, nhưng GPU không chịu nổi.

Là mô hình MoE đầu tiên của Moonshot với quy mô tham số 3 nghìn tỷ, K3 có tổng quy mô tham số đạt 2,8 nghìn tỷ. Theo hiểu thông thường, mô hình có quy mô này sẽ tiêu tốn năng lực tính toán ở mức độ cấp số nhân mỗi lần tạo đầu ra. Tuy nhiên, nhờ vào kiến trúc lõi độc đáo của nó, K3 đạt được hiệu ứng tương tự “Định luật Tao” mà Huawei đã đề xuất trong lĩnh vực chip.

Kiến trúc này cũng được xem như một động cơ siêu mạnh, triển khai ba công nghệ then chốt: KDA (Kimi Delta Attention) - sự chú ý tuyến tính hỗn hợp, phần dư chú ý (Attention Residuals) và MoE độ thưa cao, đẩy hiệu quả chuyển hóa từng đơn vị tính toán thành hiệu suất mô hình lên mức tối đa.

Trong thời gian dài, ngành bán dẫn đã dựa vào Định luật Moore để nâng cao hiệu suất bằng cách thu nhỏ kích thước transistor. Tuy nhiên, khi các quy trình tiên tiến tiếp cận giới hạn vật lý và chi phí tăng vọt, mô hình tăng trưởng chỉ dựa vào việc tích lũy phần cứng cũng đã chạm vào ngưỡng giới hạn.

Hua Wei năm nay đề xuất "định luật Tao", thoát khỏi tư duy truyền thống về "thu nhỏ không gian", chuyển sang "thu nhỏ thời gian": thông qua gập logic, xếp chồng ba chiều và tối ưu hóa kiến trúc toàn chuỗi, giảm độ trễ truyền tín hiệu và giảm lượng dữ liệu dư thừa được di chuyển, đạt được bước nhảy hiệu suất năng lượng ngang với quy trình tiên tiến trên quy trình trưởng thành.

Phương pháp luận cốt lõi của nó là: thông qua sáng tạo kiến trúc hệ thống, đạt được bước nhảy vọt về hiệu suất trong điều kiện hạn chế về phần cứng hoặc ràng buộc chi phí.

Theo tôi, cơ chế chú ý hỗn hợp tuyến tính KDA mà K3 sử dụng chính là sự thực tiễn của "Định luật Tao" trong lĩnh vực AI.

Cần lưu ý rằng kiến trúc Transformer tiêu tốn nhiều tài nguyên tính toán nhất ở cơ chế chú ý. Cơ chế chú ý tiêu chuẩn tăng theo cấp bậc bình phương theo độ dài chuỗi, và trong các tác vụ ngữ cảnh hàng triệu, phần lớn tài nguyên tính toán được tiêu tốn để duy trì ma trận chú ý chuỗi dài. Cơ chế KDA giảm độ phức tạp tính toán của hầu hết các lớp chú ý từ cấp bậc bình phương xuống tuyến tính.

Theo báo cáo kỹ thuật do Yue Zhi An Mian công bố trước đó, khi sử dụng tỷ lệ pha trộn KDA và MLA trên mô hình thí nghiệm, việc sử dụng bộ nhớ đệm KV đã giảm tối đa 75%, và thông lượng giải mã với độ dài ngữ cảnh 1 triệu đã tăng lên 6 lần so với trước đây. Kết hợp với kỹ thuật dư lượng chú ý và MoE độ thưa cao, hiệu suất huấn luyện được cải thiện khoảng 25%, với chi phí bổ sung dưới 2%.

Đây là sự tái cấu trúc của “hiệu suất sản xuất mô hình”. Nếu tuyến đường Transformer phổ biến ở Thung lũng Silicon là chiếc xe chạy xăng với chiến lược “dùng sức mạnh để tạo kỳ tích”, thì KDA giống như động cơ lai hướng tới “hiệu suất nhiệt tối ưu”.

Báo cáo của SemiAnalysis chỉ ra rằng KDA tăng tốc độ suy luận lên 300%, đồng thời duy trì hiệu suất gần với Transformer trong xử lý ngữ cảnh dài. Điều này có nghĩa là với cùng một mức đầu tư về sức mạnh tính toán, K3 có thể tạo ra nhiều trí tuệ hiệu quả hơn.

Phản hồi thực tế từ cộng đồng nhà phát triển cho thấy K3 nổi bật trong các tác vụ Agent dài và sinh mã, có khả năng cạnh tranh với các mô hình hàng đầu quốc tế.

Về cơ bản, K3 vẫn tuân theo Định luật Tăng quy mô (Scaling Law), nhưng hướng tới loại bỏ sự lãng phí trong các thuật toán thô sơ. Khi các doanh nghiệp AI ở Thung lũng Silicon vẫn liên tục tích trữ chip và tích lũy sức mạnh tính toán, Kimi đã tái cấu trúc chuỗi thuật toán và tối giản sự dư thừa tính toán, đạt được sự cân bằng giữa hiệu năng và hiệu quả trong điều kiện sức mạnh tính toán hạn chế, mở ra một con đường tối đa hóa “sản lượng trí tuệ trên mỗi watt”.

Điều này khiến các nhà quan sát và nhà đầu tư phố Wall bất ngờ, khi họ một lần nữa đặt câu hỏi liệu các khoản đầu tư hàng trăm tỷ đô la Mỹ của Thung lũng Silicon vào AI có mang lại lợi ích tương xứng hay không, và lợi thế dẫn đầu của Mỹ trong lĩnh vực AI có đang bị suy yếu hay không.

Đồng thời, các doanh nghiệp và nhà phát triển cũng bắt đầu quan tâm đến chi phí sử dụng AI. Một số nhà phát triển đã bắt đầu sử dụng dịch vụ “định tuyến mô hình” (Model Routing), tự động lựa chọn mô hình AI có chi phí thấp nhất và hiệu quả cao nhất dựa trên từng nhiệm vụ, trong đó bao gồm các mô hình Trung Quốc như Kimi.

Yang ZhiLin chạm cao

Nhìn lại, việc năng lực tính toán của Kimi bị vượt quá là hệ quả phụ của thành công kỹ thuật: sự cải thiện hiệu quả mô hình đã làm giảm chi phí mỗi lần sử dụng, ngược lại lại kích thích nhu cầu tổng thể tăng vọt.

Đáng chú ý, vào ngày 11 tháng 7, nhà sáng lập Zhipu Tang Jie đã công bố "Kế hoạch Touch High", thẳng thắn tuyên bố "không lên đến đỉnh cao thì chính là thất bại", đồng thời khẳng định rõ ràng trong hai năm tới sẽ không theo đuổi lợi nhuận ngắn hạn từ các ứng dụng, mà sẽ tập trung nguồn lực vào bốn hướng cốt lõi của AGI, đồng thời lên kế hoạch huy động vốn để đầu tư nguồn lực ở quy mô hàng tỷ để đột phá công nghệ tính giải thích được của máy móc.

Nếu nói rằng Trí Phổ "đột phá lên cao" là cuộc chiến sống còn sau khi niêm yết, thì công ty kỳ vọng thông qua việc đột phá giới hạn công nghệ để củng cố câu chuyện "công ty mô hình lớn đầu tiên toàn cầu" và giảm bớt nỗi lo thực tế.

Tôi cũng thấy Kimi đạt được sự “vươn cao” ở ba khía cạnh trong quyết định của Dương Trí Lân:

Thứ nhất, tối ưu hóa sức mạnh tính toán, chuyển từ tư duy lưu lượng sang tư duy giá trị. Các thông tin công khai cho thấy tỷ trọng kinh doanh API của Kimi đã vượt quá 70%, khác biệt lớn so với mô hình đăng ký người dùng cuối trước đây. Giữ chân người dùng hiện tại, từ chối khách hàng mới thực chất là ưu tiên phân bổ sức mạnh tính toán hạn chế vào các kịch bản có giá trị cao, tránh để lưu lượng người dùng cuối tràn lan chiếm dụng quota kinh doanh B2B vốn đã là trụ cột doanh thu.

Chi phí của điều này cũng rõ ràng. Ví dụ: tiêu chuẩn thực thi “ưu tiên bảo vệ người dùng hiện có” không minh bạch; những yêu cầu nào được ưu tiên xử lý, những yêu cầu nào bị hạ cấp, nếu xử lý sai lầm, đều sẽ làm suy giảm niềm tin của người dùng.

Trong dài hạn, để hoàn thành sự chuyển đổi từ một ngôi sao công nghệ thành một doanh nghiệp AI hàng đầu trưởng thành, Kimi phải củng cố các cơ sở hạ tầng như hồ tính toán linh hoạt, cơ chế phản hồi phân cấp và khả năng điều phối động.

Thứ hai là thử thách giá cả ở mức cao nhất, Kimi đang thực hiện bài kiểm tra áp lực từ bữa ăn tự chọn giá rẻ đến phân tầng giá trị. Việc đề cập đến "tách quyền lợi chính của Kimi và quyền lợi Code" trong thông báo vừa là sự điều chỉnh ngắn hạn để ứng phó với tình trạng thiếu hụt năng lực tính toán, vừa có thể là dấu hiệu mở đầu cho sự tái cấu trúc hệ thống định giá của nó.

Trước đây, bất kể người dùng viết mã, tra cứu tài liệu hay trò chuyện vui vẻ, họ đều trả cùng một mức phí và tiêu thụ cùng một lượng tính toán. Khi tỷ lệ người dùng Code tiêu thụ nhiều tính toán tăng lên, mô hình này tất yếu dẫn đến sự không phù hợp về cấu trúc.

Kimi nhân dịp này tách rời quyền lợi thành viên và định giá lại theo ngữ cảnh sử dụng: người dùng nhẹ nhàng được hưởng dịch vụ cơ bản, người dùng nặng ký trả thêm phí cho các tính năng giá trị cao.

Đây là nỗ lực tranh giành quyền định giá sản phẩm mô hình thông qua phân tầng người dùng theo giá trị. Hiện tại, mức phí của K3 đã đạt 2,3 USD mỗi triệu Token, dù thấp hơn các mô hình hàng đầu nước ngoài, nhưng đã lập kỷ lục mới cho các mô hình trong nước.

Có lẽ Kimi cũng muốn từ bỏ mô hình giá rẻ và truyền tải một thông điệp: các mô hình hiệu năng cao có khả năng định giá. Tiếp theo, cuộc cạnh tranh giữa các mô hình lớn sẽ chuyển từ “đấu thông số” sang “đấu hạ tầng” và “đấu chi phí định giá”.

Bước này khó hơn cả việc leo lên bảng xếp hạng, và cũng gần với bản chất kinh doanh hơn.

Thứ ba, vị thế được nâng cao, Kimi đã chuyển đổi từ yếu tố địa chính trị thành điểm định giá.

Sau khi ra mắt, K3 đã nhanh chóng thu hút sự chú ý toàn cầu. Trong chỉ số thông minh (Intelligence Index) mới nhất do tổ chức đánh giá mô hình AI độc lập Artificial Analysis công bố, điểm tổng thể của nó đạt 57 điểm, xếp thứ ba toàn cầu, sau Claude Fable 5 (60 điểm) và GPT-5.6 Sol (59 điểm), vượt qua Claude Opus 4.8 (56 điểm).

Thành tích này cũng vô tình phá vỡ nhận thức phổ biến trong ngành rằng “mã nguồn mở tụt hậu so với mã nguồn đóng một thế hệ”.

Đồng thời, ảnh hưởng của K3 đã lan ra ngoài cộng đồng công nghệ. Các tổ chức đầu tư công nghệ Mỹ coi đây là “điểm ngoặt” trong phát triển AI, cho rằng các mô hình nguồn mở chất lượng cao đang thúc đẩy sự lan tỏa năng lực; giáo sư khoa học máy tính tại Đại học California, Berkeley tuyên bố rằng K3 đã thu hẹp khoảng cách giữa các mô hình nguồn mở Trung Quốc và các mô hình tiên tiến của Mỹ xuống còn 2 đến 3 tháng.

Phản ứng của thị trường vốn cũng rất mạnh mẽ; trong ngày giao dịch đầu tiên của K3, giá trị thị trường của NVIDIA đã giảm khoảng 111,1 tỷ USD trong một ngày; các chuyên gia chiến lược của JPMorgan đã trực tiếp gọi đây là “DeepSeek 2.0” trong báo cáo của họ.

Chính sự tăng tốc này mới là thứ thay đổi logic định giá.

Ngoài ra, ARR (doanh thu hàng năm) của Yue Zhi An Mian đã gần đạt 300 triệu USD vào tháng Sáu, tốc độ tăng trưởng ở nước ngoài là 400%, và sau khi tăng giá 60%, doanh thu lại tăng lên; ba dữ liệu này kết hợp cho thấy mô hình “mở nguồn + hiệu quả” của Kimi có thể thương mại hóa quy mô lớn.

Thêm vào đó, có thông tin tiết lộ rằng Moonshot đang tìm cách niêm yết tại Hồng Kông trong vòng sáu tháng nhanh nhất, với định giá tăng từ 4,3 tỷ USD lên 31,5 tỷ USD trong sáu tháng, tăng hơn 7 lần.

Đây đều là những dấu hiệu từ thị trường vốn xác nhận một con đường phi truyền thống ngoài Thung lũng Silicon. Khi họ đặt cược vào những mô hình kinh tế đơn vị tiên tiến nhất có thể vận hành hiệu quả, điều này cũng cho thấy Kimi đã có một logic định giá độc lập, không còn cần phải so sánh với OpenAI hay Anthropic để chứng minh giá trị của mình.

Phía tối của Mặt Trăng Nguồn hình ảnh: Tài liệu mạng

Tuy nhiên, K3 vẫn còn một chặng đường dài phía trước so với AGI. Ví dụ về điểm số, dù K3 chỉ kém Fable 5 có 3 điểm, nhưng thực chất vẫn là khoảng cách đáng kể.

Ngoài ra, Kimi còn thừa nhận trong báo cáo kỹ thuật hai khuyết điểm ở cấp độ triển khai: thứ nhất, K3 giữ lại toàn bộ lịch sử suy nghĩ (thinking history) trong quá trình huấn luyện; nếu bên gọi không truyền lại chính xác quá trình suy luận trước đó, hoặc chuyển từ mô hình khác sang K3 trong phiên giao tiếp, chất lượng đầu ra sẽ giảm rõ rệt;

Thứ hai, K3 sẽ “chủ động quá mức” khi nhiệm vụ không rõ ràng, có xu hướng tự quyết định thay cho người dùng. Hành vi “tự ý hành động” này trong các quy trình kỹ thuật yêu cầu thực thi chính xác dễ gây ra lỗi dây chuyền.

Một vấn đề dễ bị bỏ qua nhưng cực kỳ quan trọng: ảo giác. Artificial Analysis đặc biệt chỉ ra rằng tỷ lệ ảo giác của K3 lại tăng so với thế hệ trước K2.6.

Ở một mức độ nào đó, sự rực rỡ và những mối lo ngại của K3 là hình ảnh thu nhỏ của sự mất cân bằng cung - cầu về năng lực tính toán trong toàn ngành, đồng thời cũng là nỗi đau tập thể của ngành AI Trung Quốc dưới áp lực lớn từ việc bị khống chế về năng lực tính toán, thương mại hóa chưa hoàn chỉnh và kỳ vọng người dùng quá cao.

Mỗi lần quá tải, mỗi lần “cắt điện” của các nhà sản xuất AI này đều là những trở ngại mà AI Trung Quốc phải vượt qua để vươn cao. Có thể khẳng định rằng, một chu kỳ cạnh tranh mới đã bắt đầu, các mô hình lớn sẽ từ cạnh tranh về năng lực chuyển sang cạnh tranh về sức mạnh tính toán.

Ai có thể xây dựng lợi thế trên các cơ sở hạ tầng như thuật toán và dự trữ năng lực tính toán, người đó mới có thể chiến thắng cuối cùng và định nghĩa tiêu chuẩn sinh tồn cho các công ty AI thế hệ tiếp theo.

Tài liệu tham khảo:

Bảng chữ cái, K3 ra mắt trong 48 giờ

Jin Duan, "Đều do Kimi"

Bài viết này đến từ tài khoản chính thức WeChat “Tang Chen Tong Học”, tác giả: Tang Chen, được cấp phép đăng tải bởi 36Kr.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.