Kimi K3 xếp hạng là mô hình AI tốt thứ ba thế giới, thách thức Anthropic và OpenAI

iconTechFlow
Chia sẻ
AI summary iconTóm tắt
Kimi K3 của Moonshot xếp thứ ba toàn cầu, sau Fable của Anthropic và Soul 5.6 của OpenAI. Với 2,8 nghìn tỷ tham số và chi phí 3/15 trên mỗi triệu token, nó tương đương mức giá của Sonnet. Dữ liệu trên chuỗi cho thấy sự chấp nhận mạnh mẽ, trong khi chỉ số nỗi sợ và tham lam phản ánh sự gia tăng niềm tin của thị trường. Các chuyên gia phân tích lưu ý rằng hiệu suất của Kimi K3 có thể tăng lợi nhuận cho các phòng thí nghiệm AI so với các mô hình SaaS. Các hạn chế xuất khẩu của Hoa Kỳ có thể đang thu hẹp khoảng cách giữa các mô hình Trung Quốc và Mỹ.

Sắp xếp & biên dịch: Shenchao TechFlow

Khách mời: Jordan và Max, chuyên gia phân tích từ SemiAnalysis

Người dẫn chương trình: Jordan (Cuộc trò chuyện nội bộ của SemiAnalysis)

Nguồn podcast: SemiAnalysis

Tiêu đề gốc: [Tập khẩn cấp] Kimi K3 của Moonshot đã ra mắt! Trung Quốc có mô hình tiên phong

Ngày phát sóng: 18 tháng 7 năm 2026

Tóm tắt điểm chính

Moonshot (Thái Âm Diện) đã ra mắt Kimi K3, vượt trội hơn Google và Meta trên nhiều benchmark tổng hợp, trở thành mô hình tốt thứ ba thế giới, chỉ sau Fable của Anthropic và Soul 5.6 của OpenAI. Hai nhà phân tích của SemiAnalysis là Jordan và Max đã phân tích ý nghĩa của đợt ra mắt này trong một chương trình khẩn cấp: Mô hình 2,8T tham số cung cấp dịch vụ với mức giá tương đương Sonnet (3/15 mỗi triệu token), nếu nó có quy mô tương đương các mô hình đóng cửa tiên tiến, thì lợi nhuận 10/50 mà Anthropic thu được có thể ở mức đáng kinh ngạc.

Phán đoán sắc sảo hơn đến từ Jordan: khoảng cách dẫn đầu đang thu hẹp, ông cho rằng do chính phủ Mỹ hạn chế Anthropic/OpenAI công bố các mô hình mạnh nhất, vô tình tạo ra khoảng thời gian cho các đối thủ theo kịp. Mô hình mã nguồn mở chưa thực sự bắt kịp. Đồng thời, cộng đồng mã nguồn mở phương Tây hoàn toàn trống rỗng, không có mô hình mã nguồn mở nào của công ty Mỹ nào có thể sánh ngang với mô hình tốt thứ năm của Trung Quốc. Cuộc cạnh tranh mô hình đang chuyển thành cuộc cạnh tranh về công cụ sử dụng và địa chính trị.

Tóm tắt các quan điểm thú vị

Về định vị của Kimi K3

  • Nếu bạn xem xếp hạng tổng hợp của tất cả các benchmark chính, hôm nay có một top ba rất rõ ràng: Fable, Soul 5.6 và Kimi K3. Chúng luôn đứng trên tất cả những người khác, bao gồm cả DeepSeek, cũng như Google, Meta và xAI.
  • Google nên cảm thấy rất xấu hổ. Vào tháng 11 và tháng 12 năm 2025, mọi người vẫn cho rằng ba ông lớn AI là Google, Anthropic và OpenAI. Hôm nay nói chuyện với một số "người cũ", họ vẫn nghĩ vậy, nhưng rõ ràng đã không còn như vậy nữa.
  • Nó có thể là mô hình tốt thứ hai thế giới, vì mỗi lần tôi dùng Fable làm việc nghiêm túc đều bị từ chối và bị đẩy về Opus. Dù không chắc nó có tốt hơn Opus không, nhưng ít nhất nó không bị từ chối.

Về lợi nhuận của các mô hình tiên tiến

  • Nếu Kimi rất có khả năng không bán K3 ở mức giá 3/15 với lỗ, thì Fable có quy mô tương đương nhưng lại thu 10/50, điều này nên xóa tan mọi lo ngại rằng các phòng thí nghiệm AI là ngành kinh doanh không sinh lời. Bán token tính theo giá API có thể còn lãi hơn cả SaaS.
  • Giá từ K2.7 đến K3 đã tăng hơn 3 lần, từ 0.95/4 lên 3/15. Nhưng tôi không nghĩ họ còn nhiều không gian để tăng giá nữa, vì nhiều nhiệm vụ chỉ cần dùng GLM hoặc MiniMax M3 là đủ.

Về chính phủ Hoa Kỳ và khoảng cách

  • Tôi tin rằng khoảng cách này thu hẹp là do chính phủ Mỹ hạn chế Anthropic, khiến chúng tôi không thể tiếp cận được những mô hình mạnh nhất thực sự của các công ty này. Họ đã cố ý đuổi kịp.
  • Chúng ta chỉ có thể tiếp cận nó khi trí tuệ tiên tiến được phép. Điều này thực sự là một cơ hội cho những người chơi ở vị trí thứ tư, năm, sáu và bảy tiếp theo.

Về vacuum nguồn mở phương Tây

  • Tôi rất ngạc nhiên khi toàn bộ thị trường vẫn còn kém hiệu quả đến mức chúng ta không có một công ty Mỹ nào có thể ít nhất sánh ngang với công ty tốt thứ năm của Trung Quốc.
  • Ngay cả khi chính phủ không cấm các mô hình mã nguồn mở của Trung Quốc, các doanh nghiệp lớn thông thường của Mỹ cũng không muốn cung cấp dữ liệu độc quyền cho các mô hình mã nguồn mở Trung Quốc. Ngay cả khi bạn tải trọng số vào trung tâm dữ liệu cách ly, CCP không thể nhìn thấy dữ liệu của bạn, nhưng các nhà quản lý cấp cao cũng sẽ không đồng ý.

Về Harness

  • 测试 Kimi K3 让我第一次认真审视 Open Code、Hermes 和 Pi。Harness 完全还是产品的一部分。
  • Một vài thứ đơn giản có thể khiến tôi chọn mô hình này thay vì mô hình kia: liệu có thể cài đặt trên máy chủ SSH từ xa không? Phím tắt có dễ sử dụng không? Những chi tiết nhỏ trong các harness này thực sự ảnh hưởng đến nơi tôi gửi token, tức là nơi tôi phân bổ ngân sách.

Về việc "vẫn còn quá sớm"

  • Tôi đã đi ICML vào tuần trước, và tuần trước nữa là hội nghị AI Engineer. Đây là hội nghị AI chính thức, hơn 80% số người không bao giờ nghe đến SemiAnalysis. Bạn tự xưng là làm trong ngành AI nhưng chưa từng đọc SemiAnalysis? Chúng ta vẫn còn quá sớm.

Kimi K3 có phải là mô hình tốt thứ ba thế giới không?

Jordan: Bình luận nhanh, Kimi K3 hiện đã là mô hình tốt thứ ba thế giới chưa?

Max: Câu trả lời là “có” một cách rõ ràng. Mọi người đều thích phàn nàn về benchmark, và benchmark thực sự có vấn đề, nhưng nếu bạn xem xếp hạng tổng hợp của tất cả các benchmark chính, thì hướng đi của chúng luôn đúng. Hôm nay có một top ba rất rõ ràng: Fable, Soul 5.6 và Kimi K3, luôn đứng trên tất cả những người khác, bao gồm cả các đối thủ open source như DeepSeek, và rõ ràng vượt xa Google, Meta và xAI. Đây là thành tựu cực kỳ ấn tượng đối với đội ngũ Moonshot.

Google nên cảm thấy rất xấu hổ. Vào tháng 11 và tháng 12 năm 2025, mọi người vẫn cho rằng ba ông lớn AI là Google, Anthropic và OpenAI. Hôm nay nói chuyện với một số "người cũ", họ vẫn nghĩ như vậy, nhưng rõ ràng đã không còn như vậy nữa.

Nhìn chung, tôi vẫn cảm thấy nó thua kém Fable và Soul 5.6. Điều hơi buồn cười là họ cũng đã rõ ràng nêu điều này trong bài đăng blog về mô hình của mình. Có thể là sự khiêm tốn theo phong cách Trung Quốc truyền thống, hoặc có thể là để tránh sự giám sát của chính phủ Mỹ, bởi vì việc ra mắt Fable 5.6 lúc đó cũng đã có một số sự chậm trễ. Nhưng dù sao đi nữa, điều này rất ấn tượng.

Jordan: Họ viết trong phần hạn chế của blog: "Mặc dù K3 nhìn chung là một mô hình có tính cạnh tranh cao, nhưng vẫn còn khoảng cách rõ rệt về trải nghiệm người dùng so với Fable 5 và GPT 5.6." Trải nghiệm cá nhân của tôi là nó thực sự tốt, nhưng rất chậm, điều này rất phiền toái. Nó đã khiến tôi lần đầu tiên có động lực thử harness mã nguồn mở. Nói thật, tôi cảm thấy mình học được nhiều về harness hơn là về mô hình, vì tất cả các mô hình này đều đủ tốt để thực hiện những công việc cơ bản mà tôi đang làm, và tôi khó tìm ra những nhiệm vụ phức tạp mà nó không thể làm được.

Đây có thể là mô hình tốt thứ hai trên thế giới đối với tôi, vì mỗi lần tôi dùng Fable để làm việc nghiêm túc đều bị từ chối và bị đẩy về Opus. Dù không chắc nó có tốt hơn Opus hay không, nhưng ít nhất việc không bị từ chối đã khiến tôi bớt phiền toái hơn. Tuy nhiên, khi dùng API key trả phí theo mức sử dụng thì không bao giờ bị từ chối, chỉ khi dùng web console hoặc deep research mới chạm giới hạn. Rõ ràng họ không có đủ GPU để đáp ứng nhu cầu từ mô hình này. Trước đây, vấn đề này đã được giải quyết bằng chiến lược mã nguồn mở, bằng cách công bố trọng số để người khác tự phục vụ. Nhưng lần này họ vẫn chưa công bố trọng số, và nói rằng sẽ phát hành sau 10 ngày.

Tại sao lại trì hoãn 10 ngày mới mở nguồn trọng số?

Jordan: Bạn nghĩ chiến lược trì hoãn này là gì?

Max: Nói rõ ràng đây chỉ là những suy đoán thuần túy của tôi. Một lý do lớn có thể là họ cần dành đủ thời gian cho các nhóm phát triển các engine suy luận như vLLM và SGLang để đảm bảo có thể phục vụ mô hình này với hiệu suất cao. Nếu hôm nay họ phát hành trọng số ngay lập tức, mọi người đều sẽ cố gắng phục vụ nhưng chỉ đạt được 20 token/giây, điều này sẽ rất tệ cho việc xây dựng thương hiệu của họ. Hiện tại, họ có một cơ hội tuyệt vời để thu hút lượng PR và sự áp dụng lớn, nhưng nếu ngay khi ra mắt đã bị hiệu suất kìm hãm, thì ngược lại sẽ làm suy yếu đà tăng trưởng.

Một khả năng khác là họ đang đàm phán hợp tác cấp phép với các nhà cung cấp dịch vụ suy luận như Together AI, Fireworks, Nebius, Groq để sử dụng các chip mới nhất như GB300 phục vụ dung lượng tăng thêm. Hai yếu tố này có lẽ là nguyên nhân chính khiến việc trì hoãn kéo dài 10 ngày.

Lợi nhuận khổng lồ từ các mô hình tiên tiến

Jordan: Hãy nói về kiến trúc mô hình. Mô hình này có 2,8T tham số, không thể chứa trong B200; bạn cần B300, GB300 hoặc AMD MI355X để phục vụ mô hình này trên một máy chủ HGX 8 card đơn lẻ. Tất nhiên, bạn có thể thực hiện pipeline parallelism giữa các nút, nhưng điều đó sẽ ảnh hưởng nghiêm trọng đến hiệu suất. Do đó, chỉ những người sở hữu chip mới nhất mới có thể phục vụ mô hình này.

Trở lại chủ đề Google bạn vừa nói, mô hình này đã đạt được khả năng cạnh tranh hàng đầu với 2,8T tham số, điều này thực sự cho chúng ta một số manh mối về quy mô của các mô hình hàng đầu đóng cửa. Nếu họ dùng mô hình 10T tham số để so sánh với cái này, thì còn đáng xấu hổ hơn nữa. Chúng ta phải giả định nó cùng cấp độ với Soul và Fable.

Max: Đúng vậy, bạn nói đúng. Tôi vẫn tin vào năng lực và sự nhạy bén của đội ngũ nghiên cứu Anthropic. Nếu có ai đó trên Twitter nói rằng các mô hình đóng hiện tại có 10T tham số, nếu điều đó là thật, thì anh bạn ấy nên gói đồ đi thôi, cổ phiếu NVIDIA sẽ giảm 50% vào ngày mai và mọi thứ sẽ kết thúc.

Tôi khá chắc chắn rằng Kimi K3 không nhỏ hơn đáng kể so với các mô hình đóng nguồn dẫn đầu hiện tại, thậm chí có thể lớn hơn một chút. Nếu điều này đúng, nó càng củng cố một quan điểm mà chúng tôi luôn nhấn mạnh tại SemiAnalysis: lợi nhuận của các phòng thí nghiệm đóng nguồn này thực sự ở mức khiến người ta kinh ngạc. Nếu Kimi rất có khả năng không đang bán K3 với giá 3/15 dưới giá vốn — giống như định giá của Sonnet — trong khi Fable có quy mô tương đương nhưng lại thu 10/50, thì hoàn toàn nên xua tan mọi lo ngại về việc các phòng thí nghiệm AI không kiếm được tiền. Bán token tính theo giá API, hiện tại có thể còn lãi hơn cả SaaS.

Jordan: Không có chi phí nhân sự, chỉ có GPU. Vậy so với mức giá trước đó thì sao? Bạn nói ngày 3/15, nhưng phiên bản Moonshot trước đó định giá trực tiếp là 0,95/4, nên từ K2,7 lên K3, giá đã tăng hơn 3 lần. Họ còn bao nhiêu không gian để tăng giá?

Max: Tôi không nghĩ họ còn nhiều không gian để đẩy giá lên cao hơn. Ngay cả ở mức giá 3/15, cũng sẽ có nhiều người cho rằng nó quá đắt. Nhiệm vụ của họ dùng GLM hoặc MiniMax M3 là đủ rồi. Có một sự phân nhánh thú vị ở đây: những người như SemiAnalysis của chúng tôi, không quan tâm đến việc tiêu tốn token của Dylan, sẽ tiếp tục dùng Fable để làm hầu hết mọi việc; còn những bên cực kỳ nhạy cảm với chi phí, như Tesla, Uber – chỉ dùng $200 token mỗi tuần – sẽ chọn mức giá GLM. Vậy thì người dùng thực sự sẽ chuyển sang Kimi K3 là ai? Có lẽ chỉ là nhóm những người yêu thích open source về mặt triết học và muốn hỗ trợ mô hình mới. Liệu các doanh nghiệp lớn có thực sự áp dụng mô hình này không? Tôi sẽ không ngạc nhiên nếu câu trả lời là không.

Kiến trúc mới và các bước tiếp theo

Jordan: Đây là kiến trúc hoàn toàn mới. 2.8T tham số, có delta attention của Kimi, potential residuals, stable latent, cơ bản là phiên bản mở rộng của mô hình trước đó, khoảng gấp đôi kích thước. Trước đây với K2.5, chúng ta thấy Cursor sử dụng nó làm composer, dựa trên continued pre-training và MRL, sau đó ra các checkpoint 2.5, 2.6, 2.6.7, v.v. Đây là base model mới, nhưng đã khá hoàn chỉnh khi sử dụng, không xuất hiện các cạnh thô ráp thường thấy ở mô hình gốc. Bước tiếp theo là gì? 3.1 sẽ ra khi nào? Giá sẽ thay đổi không? Sẽ có composer dựa trên K3 không?

Max: Có lẽ sẽ không có composer dựa trên K3, vì nhóm Cursor đã quyết định huấn luyện mô hình của riêng họ từ đầu. Về các phiên bản K3.1, K3.2, dự kiến trong một đến hai tháng tới sẽ có hai đến ba bản cập nhật tiếp tục thực hiện post-training. Tôi cho rằng giá sẽ giữ nguyên, vì trong hai đến ba tháng tới họ không thể chạy trên phần cứng mới, nên không có sự cải thiện throughput để giảm giá. Có thể sẽ có kỹ sư kernel xuất sắc nào đó giảm chi phí xuống mức của DeepSeek V4, nhưng tôi nghi ngờ rằng một mô hình 3T tham số có thể làm được điều đó. Hiện tại, giá của GLM và MiniMax có lẽ đã là giới hạn tối đa mà các mô hình 1T đến 1.5T có thể cung cấp.

Mã nguồn mở có theo kịp mã nguồn đóng không?

Max: Câu hỏi thú vị hơn là khoảng cách giữa open source và closed source có tiếp tục thu hẹp không, và liệu open source có thực sự đạt được mức độ ngang bằng với trình độ tiên tiến không. Nếu điều này xảy ra, nó sẽ ảnh hưởng rất lớn đến toàn bộ ngành của chúng ta. Bạn nghĩ sao?

Jordan: Quan điểm của tôi là khoảng cách hiện đã thu hẹp, nguyên nhân hoàn toàn do chính phủ Mỹ hạn chế Anthropic, khiến chúng ta không thể tiếp cận được những mô hình mạnh nhất thực sự của các công ty này. Họ đang bị đuổi kịp một cách nhân tạo.

Chúng ta có thể thấy sự so sánh giữa Mythos và Fable. Tôi không thể sử dụng Mythos, còn Fable thì tôi phải cố gắng rất nhiều mới đôi khi được dùng. 5.6 Soul, nội bộ chúng tôi đánh giá nó không phải là mô hình lớn nhất được OpenAI huấn luyện, và không lớn bằng 4.5. Họ đang sở hữu một mô hình lớn hơn. Kết quả là, chúng tôi chỉ có thể tiếp cận nó khi trí tuệ tiên tiến đó được chính phủ cho phép.

Đối với những người chơi ở vị trí thứ tư, năm, sáu và bảy, đây thực sự là một cơ hội để thả lỏng mọi thứ trong một giới hạn nhất định và bắt đầu giành lấy thị phần người dùng, nhưng sẽ không bao giờ chạm tới được frontier thực sự. Tôi cho rằng frontier có thể tiến thêm một bước lớn vào cuối mùa hè này, hoặc có thể xu hướng chính trị thay đổi chút ít. Cũng có thể chúng ta bắt đầu tìm ra các modalities ngoài mã hóa, để họ thực sự khám phá những lĩnh vực đó.

Nhân tiện, hãy nhắc đến việc ra mắt Inkling của Thinking Machines, tôi thấy đầu vào âm thanh bản địa rất thú vị và là tín hiệu của tương lai.

Max: Về Inkling, phương Tây thực sự thiếu cực kỳ cực kỳ cực kỳ một mô hình nguồn mở không tệ. Thị trường vẫn còn kém hiệu quả đến mức chúng ta không có một công ty Mỹ nào dù chỉ có thể theo kịp mô hình tốt thứ năm của Trung Quốc, điều này khiến tôi kinh ngạc. Một mặt, việc chính phủ Mỹ cấm toàn diện các mô hình nguồn mở Trung Quốc có lẽ chỉ là vấn đề thời gian. Mặt khác, ngay cả khi không cấm, các doanh nghiệp lớn thông thường của Mỹ cũng không muốn cung cấp dữ liệu độc quyền cho các mô hình nguồn mở Trung Quốc. Ngay cả khi bạn tải trọng số vào trung tâm dữ liệu cách ly, CCP không thể thấy dữ liệu của bạn, nhưng các nhà quản lý cấp cao vẫn sẽ không đồng ý. Nhiều doanh nghiệp quan tâm đến ngân sách token và chỉ muốn chạy các mô hình phương Tây hoặc mô hình không phải của Trung Quốc. Inkling là mô hình OSS phương Tây tốt nhất mà chúng ta có thể tiếp cận hiện nay, nhưng vẫn còn rất xa so với ranh giới nguồn mở, điều này khiến tôi kinh ngạc.

Jordan: Trước đây là Neotron, bây giờ là Inkling. Tôi cho rằng chiến lược của Inkling có hai cơ hội: thứ nhất, họ phải tốt hơn phần lớn các mô hình mã nguồn mở của Trung Quốc mới có thể gia nhập thị trường. Thứ hai, họ còn phải tốt hơn các mô hình cấp hai, cấp ba của các phòng thí nghiệm tiên tiến, tốt hơn Sonnet, vì bạn có thể dùng Bedrock hoặc Foundry để tiếp cận trí tuệ gần như tiên tiến, đồng thời tiết kiệm chi phí bằng cách dùng các mô hình cấp hai đóng cửa. Tôi luôn không hiểu rõ góc nhìn “giúp người ta tiết kiệm chi phí” của các mô hình mã nguồn mở phương Tây. Việc thúc đẩy mô hình vào các hệ sinh thái như Fireworks, Together, Base10 chắc chắn là điều tốt, nhưng phần lớn thị trường nằm ở cấp độ chính phủ.

Được tạo ra dành cho các bộ tăng tốc trong nước của Trung Quốc

Jordan: Một điểm khác đáng để nói, bài viết trên blog K3 đề cập rằng ở giai đoạn SFT đã thực hiện định lượng, sử dụng native MXFP4 và MXFP8 cho trọng số và kích hoạt, với lý do chính thức là "tương thích phần cứng rộng rãi". Bạn nghĩ Moonshot còn quan tâm đến phần cứng nào khác không?

Max: Tôi có một danh sách 11 nhà tăng tốc Trung Quốc, bạn nên đăng ký mô hình nhà tăng tốc của SemiAnalysis để tìm hiểu thêm. Huawei Ascend, Baidu Kunlun, Cambricon, Moore Threads, nhiều loại chip khác nhau đều xuất hiện trong các bài báo và mã nguồn. Chạy các mô hình tiên tiến trên các bộ tăng tốc trong nước đã trở thành ưu tiên quốc gia của Trung Quốc. Nếu đến cuối năm 2025 chúng ta vẫn nói Google là phòng thí nghiệm tiên tiến, thì bây giờ cũng phải gọi Moonshot là phòng thí nghiệm tiên tiến.

Jordan: Nói thêm một chút, bố tôi đang công tác ở Trung Quốc, ông ấy nói các khách sạn đều đầy hết vì Tập Cận Bình sắp đến khu vực đó để phát biểu về AI là ưu tiên hàng đầu của Trung Quốc. Bạn nói rất nhiều điều đúng.

Harness mới là sản phẩm thực sự

Jordan: Điều tôi cảm nhận lớn nhất khi sử dụng các mô hình này là, thứ nhất, ngày càng khó phân biệt sự khác biệt giữa việc sử dụng mô hình tiên tiến nhất kết hợp chế độ max thinking và việc sử dụng nỗ lực trung bình. Trong các nhiệm vụ hàng ngày, tôi thực sự không tìm ra việc gì mà các mô hình này không thể làm được. Hành vi mặc định của tôi là luôn bật chế độ mạnh nhất và khó nhất, vì tôi không quan tâm đến ngân sách của Dylan.

Nhưng có một khía cạnh là harness chính là một phần của sản phẩm. Việc thử Kimi K3 đã khiến tôi lần đầu tiên nghiêm túc xem xét Open Code, Hermes và Pi. Harness hoàn toàn vẫn là một phần của sản phẩm. Một số chi tiết đơn giản đã khiến tôi chọn mô hình này thay vì mô hình kia: liệu có thể cài đặt trên máy chủ SSH từ xa không? Phím tắt có dễ dùng không? Có thể chỉnh sửa các lệnh trước đó không? Những chi tiết nhỏ trong harness thực sự ảnh hưởng đến việc tôi gửi token đến đâu, tức là gửi ngân sách đến đâu.

Max: Nhiều người nói về ngân sách token, nhưng từ mô tả quy trình làm việc của bạn, ngay cả những nhiệm vụ mà GLM có thể xử lý, bạn vẫn sẵn sàng chuyển cho Fable sử dụng max intelligence vì ROI vẫn xứng đáng với mức giá đó. Các bài kiểm tra hiệu năng cho thấy nhiều nhiệm vụ có thể chuyển sang GLM, nhưng bạn vẫn thích ở lại trên các mô hình của Anthropic hoặc OpenAI.

Jordan: Về cơ bản là vậy. Nhưng tôi sử dụng rất nhiều Slack bot, và tôi không biết mô hình nào chạy phía sau. Ví dụ, tích hợp Slack của Perplexity, nếu nó bắt đầu định tuyến đến K3, đến GLM, đến Sonnet, thì thực ra tôi không quan tâm. Trước đây, khi xem lượng sử dụng, tôi mới phát hiện ra mô hình của OpenAI chiếm bao nhiêu phần trăm, vì đó là quyết định do chính nó đưa ra. Phần giải thích đó là do harness đưa ra.

Max: Đây chính là một điểm tiếp cận cho mô hình định giá dựa trên kết quả. Nếu một phòng thí nghiệm áp dụng định giá dựa trên kết quả, họ có thể đạt lợi nhuận gộp trên 95%, vì những nhiệm vụ mà bạn sẵn sàng trả giá ổn định, hôm nay thực tế chỉ cần chi một khoản rất nhỏ là có thể xử lý xong.

Jordan: Điểm thứ hai, tôi không nghĩ những phòng thí nghiệm này đã cạn kiệt ý tưởng. Họ có thể tiếp tục huấn luyện những mô hình đáng kinh ngạc để đánh RSI phía mã hóa, nhưng không chia sẻ cho chúng ta, duy trì vị thế “giai cấp底层 vĩnh viễn” của họ. Họ có thể tiếp tục tinh luyện, cho chúng ta nếm thử một chút, đồng thời tiếp tục khám phá các ứng dụng khác như sinh video, chuyển đổi âm thanh sang âm thanh, nghiên cứu sâu, những thứ không giống với mã hóa. Robot học và mô hình thế giới là một hướng đơn giản; nếu Anthropic chuyển mục tiêu từ công việc trí tuệ sang lao động thể chất thì sao? Tôi không tin rằng họ không thể xây dựng một doanh nghiệp có ROI bền vững bằng công nghệ vĩ đại nhất thế giới.

Chúng ta vẫn còn quá sớm

Max: Ngay cả khi không nói đến những điều này, tôi sử dụng các mô hình này rất nhiều mỗi ngày, những người bạn của tôi làm kỹ sư phần mềm sử dụng ít hơn tôi mười lần và chi ít hơn mười lần. Một người dùng Fable và một người dùng Sonnet sử dụng với tần suất như nhau, nhưng người dùng Fable chi nhiều gấp mười lần, lợi nhuận gộp 90%, đảm nhận phần lớn kinh doanh. Khi những người đó bắt đầu sử dụng các mô hình lớn hơn và sử dụng nhiều hơn, nhu cầu sẽ chỉ tăng lên, ngay cả khi các mô hình không cần trở nên tốt hơn. Sau đó, tôi còn phải nói chuyện với những hàng xóm không liên quan đến công nghệ; trong số họ, tôi chắc chắn là 0,1% hoặc thậm chí 0,01%, và có thể còn có không gian tăng trưởng gấp 1000 lần. Trở lại với “đường cong chỉ số ngỗng vàng” của Masa-san (Son Masayoshi).

Jordan: Cô ấy nói “vẫn còn quá sớm” là hoàn toàn đúng, và đó cũng là lý do tại sao tôi tin rằng Kimi K3 sẽ không làm chậm tốc độ tăng ARR ròng của Anthropic và OpenAI. Ngay cả khi một phần người dùng hiện tại dùng Fable và 5.6 chuyển sang Kimi K3 một cách không thể thuyết phục, thì nhóm người này sẽ bị lấn át hoàn toàn bởi những người chưa thực sự thử nghiệm công nghệ này. Những người đó mỗi ngày đều phát hiện ra những trường hợp sử dụng mới có ROI cao, và họ vẫn sẽ mặc định dùng 5.6 Soul hoặc Fable 5 để mở khóa những kịch bản mới này. Bạn sẽ không thấy tốc độ tăng ARR chậm lại.

Max: Bạn nghĩ xem còn bao nhiêu người chưa đăng ký podcast này, chưa theo dõi SemiAnalysis. Tuần trước tôi đã đến ICML, tuần trước nữa là hội nghị AI Engineer, đây là hội nghị AI chính thức, hơn 80% số người chưa từng nghe đến SemiAnalysis. Bạn tự nhận mình làm trong ngành AI, nhưng lại chưa từng đọc SemiAnalysis? Chúng ta vẫn còn quá sớm.

Jordan: Đây là cách để bạn tự kiểm tra cái tôi của mình, Max, hãy bình tĩnh lại.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.