Meta công bố Muse Spark 1.3, vượt trội hơn các đối thủ trong bảng xếp hạng AI

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Meta đã ra mắt Muse Spark 1.3, một mô hình AI vượt trội hơn Gemini 3.8 Flash và GPT-5.6 Sol trong các bài kiểm tra chính. Được phát triển bởi Phòng thí nghiệm Siêu Trí tuệ của Meta, mô hình này đạt điểm 75.4 trên DeepSWE v1.1 với lượng token sử dụng và giá cả thấp hơn. Alexandr Wang, Giám đốc AI của Meta, gọi đây là bước tiến quan trọng hướng tới các tác nhân AI 24/7. Bản cập nhật tin tức AI + tiền điện tử này nhấn mạnh tiềm năng niêm yết token mới khi các lợi ích về hiệu suất thúc đẩy sự chấp nhận.

Quá cạnh tranh rồi.

Chỉ mới qua 3 ngày của tháng Chín, đã có năm mô hình tiên tiến được ra mắt!

Fable 5.1 và Mythos 5.1 của Anthropic, Gemini 3.8 Flash và Cyber của Google, cùng Muse Spark1.3 của Meta... RSI chắc chắn đã đến.

Chính vào tối qua, khi Gemini 3.8 Flash của Google vừa trở thành ông vua nhẹ, Meta đã đến thách thức.

Zuckerberg chính thức công bố trên X: Muse Spark 1.3 đã chính thức ra mắt hôm nay, mang đến trải nghiệm gần như rẻ đến mức không cần tính toán nhờ hiệu năng tiên tiến. Đây là bước nhảy vọt lớn nhất chúng tôi đạt được trong lập trình và công việc của các tác nhân cho đến nay!

Agent

Alexandr Wang, người điều hành Phòng thí nghiệm Siêu trí tuệ của Meta, cũng đã đăng ba bài viết liên tiếp trên X, hé lộ vũ khí chủ chốt của đòn “vũ khí hạt nhân” này.

Anh ấy cho biết, so với Muse Spark 1.2, Muse Spark 1.3 đã giảm các vòng lặp không hiệu quả, giảm ~20% số lần gọi công cụ, giảm ~25% lượng token tiêu thụ, và duy trì tốt hơn nhu cầu trong các nhiệm vụ dài hạn, “người dùng sẽ rõ ràng cảm nhận được bước nhảy vọt này”.

Agent

Ngay sau khi Muse Spark 1.3 ra mắt, Gemini 3.8 Flash vừa được phát hành tối qua đã trở nên hơi lúng túng.

The performance metrics show that this upgrade to Muse Spark 1.3 is even greater.

Nó không chỉ vượt mặt GPT-5.6 Sol và Fable 5 về điểm số, mà chỉ số trí tuệ Artificial Analysis dưới cường độ suy luận Max đã đạt 62 điểm, chắc chắn lọt vào nhóm đầu hiện tại.

Agent

Trong năm tháng, Meta đã không ngừng cập nhật 4 phiên bản Muse Spark.

Alexander the Great mocks Google: "Breathe the fumes of other models"

Gần đây, nhóm đầu về AI thực sự rất đông đúc. GPT-5.6 đang nắm giữ ngai vàng, Fable 5.1 đang bứt phá sau, còn Gemini 3.8 Flash đang vượt lên từ phía sau.

Sự ra đời của Muse Spark 1.3 đã làm xáo trộn hoàn toàn mọi thứ.

Trong bài kiểm tra chuẩn DeepSWE v1.1, nơi thể hiện rõ nhất khả năng lập trình tầm xa thực sự của mô hình, Muse Spark 1.3 đã trực tiếp vượt qua Opus 5 và GPT-5.6 Sol, đồng thời bỏ xa Gemini 3.8 Flash vừa được phát hành, giành điểm cao nhất hiện nay.

Muse Spark 1.3: 75.4 điểm

Claude Opus 5: 74.0 điểm

GPT-5.6 Sol: 73.0 điểm

Agent

不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。

Trong SWEAtlas CodeBase QnA, nó đạt 59,4 điểm, vượt qua GPT-5.6 Sol và Opus 5.

Trên Terminal-Bench 2.1, nó đạt 88.8 điểm.

Trên MRCR 512K-1M, nó đạt điểm đáng kinh ngạc 98,1! (Để so sánh, GPT-5.6 Sol chỉ đạt 73,8 điểm trên cùng chỉ số, vượt trội hoàn toàn).

Agent

Về khả năng của Agent, nó gần như theo kịp mức độ tiên tiến nhất, chỉ cách Opus 5 vài phần trăm trong các bài kiểm tra như JobBench và OSWorld.

Agent

Trên Artificial Analysis, Muse Spark 1.3 đã vượt xa Gemini 3.8 Flash.

On the Smart Index, it scored 62, tying with Claude Fable 5 and entering the top tier.

Agent

Về chi phí được các nhà phát triển quan tâm nhất, chi phí đầu vào của Muse thấp hơn 8 lần so với Fable 5, chi phí đầu ra thấp hơn gần 12 lần, mang lại hiệu suất chi phí tối ưu.

Trước thành tích nổi bật như vậy, Giám đốc AI của Meta, Alexandr Wang, đã nói một cách mỉa mai: “Trên chỉ số trí tuệ nhân tạo Artificial Analysis, Gemini chẳng là gì cả, chỉ có thể hít khói thải từ các mô hình khác.”

Google thật sự đã rơi vào cảnh khốn khó.

Agent

Có người đùa rằng: “Google vất vả bốn tháng mới ra bốn phiên bản Gemini Flash, trong khi Meta chỉ trong năm tháng đã liên tục nâng cấp bốn phiên bản Muse Spark⁺. Nhưng vừa mới dẫn đầu vài giờ, Google đã bị Meta vượt mặt, cốt truyện thật quá hấp dẫn.”

Agent

Ít hơn là Nhiều hơn: Siêu máy chạy 2 giờ chỉ với 1 USD

Hiệu suất cao tuy tuyệt vời, nhưng trong cộng đồng AI hiện nay, điều luôn khiến các nhà phát triển hào hứng vẫn là công cụ dễ sử dụng và giá rẻ.

Muse Spark 1.3 được gọi là vua về khả năng chi tiêu thông minh vì nó không chỉ chạy nhanh mà còn đặc biệt tiết kiệm chi phí.

Như Alexandr Wang đã nói, Muse Spark 1.3 “rẻ đến mức không đáng kể”, “hiệu năng tiên tiến, chi phí chỉ là con số nhỏ”.

Agent

Agent

Nó đã đi theo một con đường hoàn toàn khác với cách tiếp cận trước đây của các mô hình lớn: “dùng sức mạnh để tạo kỳ tích, tích lũy tham số một cách điên cuồng” — đó là thực hiện phép trừ.

Muse Spark 1.3 đã được huấn luyện đặc biệt để cải thiện khả năng lập trình chu kỳ dài và tuân thủ lệnh tốt hơn, giúp giảm số vòng tương tác không cần thiết và làm cho đầu ra ngắn gọn hơn.

Agent

Nó trở nên thông minh và gọn gàng hơn, phong cách mã sạch sẽ hơn, ít lời thừa hơn.

Và hệ quả trực tiếp của phép trừ này là chi phí giảm mạnh đột ngột.

Dưới đây là một trường hợp thực tế rất ấn tượng.

Nhà phát triển @SPAC89 đã so sánh Muse Spark 1.3 Ultra Contributor mode với Fable 5.1 xHigh.

Agent

Prompt mà anh ấy đưa ra bao gồm một quy tắc tự cải tiến nghiêm ngặt: nếu điểm số của giám khảo độc lập dưới 9,5/10, tác nhân phải tiếp tục cải tiến mã và thử lại.

Cả hai mô hình đều chạy khoảng 2 giờ, kết quả thật đáng kinh ngạc.

Muse Spark 1.3 giống như một nhân viên siêu năng lượng không biết mệt, nó không ngừng nghỉ, thực hiện đầy đủ 20 chu kỳ tự cải tiến, mỗi lần khởi động 3 tác nhân—tương đương với việc chạy hơn 60 lần tác nhân trong vòng 2 giờ.

Và tổng chi phí để hoàn thành nhiệm vụ suy luận dài hạn cực kỳ lớn và phức tạp này chỉ dưới 1 USD!

Agent

Developer này thốt lên: “Điều này hoàn toàn vượt quá kỳ vọng của tôi, thứ này thực sự là một tác phẩm nghệ thuật!”

Về định giá vĩ mô, Meta đã thể hiện sự chân thành lớn lao. Mô hình mới tăng dung lượng nhưng không tăng giá, duy trì mức định giá 1,25 USD cho mỗi triệu token đầu vào và 4,25 USD cho mỗi triệu token đầu ra.

Agent

Về mặt định giá, phiên bản đóng góp của Muse Spark 1.3, “muse-spark-1.3-contributor”, còn thấp hơn mức giá sàn của các mô hình nước ngoài. (Đổi lại, bạn phải cho phép sử dụng dữ liệu để cải tiến sản phẩm của Meta.)

Agent

Người sáng lập và nhà phát triển Codedamn, Mehul Mohan, trực tiếp nói:

Mức giá lớp đóng góp của Muse Spark 1.3 thật sự phi thực tế, đó chính là của các phòng thí nghiệm AI Mỹ DeepSeek Thời điểm định giá.

Agent

Theo thống kê của Artificial Analysis, trong số các mô hình có trình độ trí tuệ tương đương (điểm trên 59), chi phí cho mỗi tác vụ của Muse Spark 1.3 chỉ là 0,55 USD, là giải pháp tối ưu tuyệt đối.

Để so sánh, Grok 4.6 với cùng mức trí tuệ (61 điểm) có chi phí là 0,94 USD, GPT-5.6 Sol cần 0,95 USD, trong khi Claude Opus 5 còn cao hơn, lên tới 1,23 USD.

Ngay cả khi, nhà phát triển Kartik chỉ ra rằng Muse Spark 1.3 dường như sở hữu khả năng suy luận "độ sâu vòng lặp" tương tự như Sol và Fable.

Nó không tạo ra câu trả lời trong chớp mắt, mà biết thực hiện suy luận logic bên trong, giúp hiệu suất token của nó cao một cách đáng kinh ngạc.

Agent

Sự bùng nổ của Alexandr Wang, tham vọng cuối cùng của tiểu tằng

Sự ra đời của Muse Spark 1.3 không thể tách rời khỏi những người điều hành đằng sau nó.

Tháng 7 năm nay, Meta đã ra mắt Muse Spark 1.1, nổi bật với ngữ cảnh siêu dài 1M và thao tác máy tính.

Chỉ trong chưa đầy hai tháng, phiên bản 1.3 đã nâng khả năng mã hóa tầm xa lên mức tương đương GPT-5.6.

Sự lặp lại nhanh chóng này chính là kết quả mang lại sau khi Alexandr Wang tiếp quản Phòng thí nghiệm Siêu trí tuệ của Meta.

Mục tiêu cuối cùng của họ là gì? Như Mark Zuckerberg và Alexandr Wang đã nhấn mạnh lặp đi lặp lại hai từ: “agent” và “rẻ đến mức không đáng kể”.

Nói cách khác, Meta đang nhìn vào cơ hội tiếp theo của ASI – “Kỹ thuật tác nhân”.

Alexandr Wang, người đứng đầu Meta AI, đã khẳng định rõ ràng trong cuộc phỏng vấn với Axios rằng mọi cải tiến về khả năng sử dụng đều nhằm phục vụ tầm nhìn lớn mà Mark Zuckerberg đã nhiều lần nhắc đến — xây dựng các tác nhân cá nhân hoạt động 24/7.

Agent

Để một tác nhân có thể xử lý email, viết mã và phân tích dữ liệu giúp bạn 24/7, nó phải đáp ứng hai điều kiện.

1. Cực kỳ thông minh và ổn định: Nó cần duy trì các chuỗi hội thoại kéo dài (dài), đồng thời có thể xử lý song song nhiều luồng công việc.

Khi lệnh mơ hồ, nó phải chủ động đặt câu hỏi; khi gặp trở ngại, nó phải biết nhờ sự giúp đỡ của con người; trước khi thực hiện các thao tác quan trọng, nó phải xác nhận. Quan trọng nhất, không tạo ra ảo giác.

2. Rất rẻ: Nếu chi phí chạy một tác nhân cá nhân trong một ngày lên tới vài chục đô la, thì nó sẽ mãi chỉ là đồ chơi của một số ít người.

Sự ra đời của Muse Spark 1.3 về bản chất là mở đường cho các tác nhân cá nhân 7×24 giờ.

Nó giống như một kỹ sư kỳ cựu và am hiểu, bạn đưa ra một mục tiêu, nó sẽ tự lập kế hoạch, tự sửa lỗi và tự hoàn thành.

Để làm điều này, Tôn Chi Thanh, cựu sinh viên Đại học Bắc Kinh và nhà nghiên cứu của Meta, tiết lộ rằng nhóm Meta đã tiến hành huấn luyện lại mô hình avocado trước đó, đạt được hiệu suất mở rộng tốt hơn trong các bài kiểm tra.

Agent

Sau những cuộc ăn mừng: Chúng ta đã bị lừa bởi việc “gian lận bảng xếp hạng”?

However, Muse Spark 1.3 has also been questioned.

Cơ quan AI nổi tiếng BridgeMind đã đăng một đoạn lời nói đầy suy ngẫm:

Gemini 3.8 Flash và Muse Spark 1.3 được phát hành cùng ngày hôm nay. Cả hai đều cho hiệu suất nổi bật trong các bài kiểm tra chuẩn.

Muse Spark 1.3 hiện đang đồng hạng với Fable 5 trên chỉ số thông minh… Tôi nên cảm thấy hào hứng. Nhưng tôi thì không.

Vì tháng này, các bản phát hành AI đều giống nhau, điểm số tăng vọt, nhưng trải nghiệm thực tế lại không có tiến bộ nào.

Điều này thật khiến nản lòng. Sự tin tưởng của tôi vào các bài kiểm tra hiệu năng mỗi tuần một giảm dần, và đối với những phòng thí nghiệm chơi trò chơi với các bài kiểm tra này, tôi gần như không còn chút tin tưởng nào.

Agent

Câu này đã chính xác chạm vào điểm đau của ngành mô hình lớn hiện nay.

Một số người dùng đã thực hiện bài kiểm tra áp lực đối với Muse Spark 1.3 và Gemini Flash 3.8z dưới ràng buộc 3D cấp nền tảng, và kết quả đã phơi bày điểm yếu của cả hai mô hình:

Muse Spark 1.4 không tốt như vậy, trong khi Gemini Flash 3.5 chỉ đang cố gắng leo bảng xếp hạng.

Agent

Hiện nay, các phòng thí nghiệm đang rơi vào vòng luẩn quẩn "đào tạo chỉ để đạt điểm số cao". Mỗi khi một mô hình được ra mắt, chắc chắn sẽ đi kèm với vài biểu đồ radar và ảnh chụp bảng xếp hạng cho thấy nó "đánh bại" đối thủ.

DeepSWE, Tau3-Bench, GPQA đã trở thành những mục tiêu mà các công ty đang đua nhau "luyện đề".

Và Muse Spark 1.3 cũng đã lộ ra sơ hở.

Trong báo cáo chi tiết của Artificial Analysis, chúng ta cũng có thể thấy một chút dấu hiệu lùi bước.

Ví dụ, trong bài kiểm tra AA-Omniscience, cả phiên bản xhigh và max đều giảm. Lý do là tỷ lệ từ chối trả lời của nó tăng lên — khi không chắc chắn, nó có xu hướng không trả lời thay vì bịa đặt.

Điều này đã giảm tỷ lệ ảo giác, nhưng cũng cho thấy gián tiếp rằng kho tri thức tuyệt đối của nó không tăng lên nhiều như mức cải thiện trong điểm số.

Agent

Ở hiệp hai của mô hình lớn, so sánh điều gì?

Hôm nay, việc ra mắt Muse Spark 1.3 và Gemini 3.8 Flash cho phép chúng ta đưa ra một số phán đoán sau.

Trước hết, "lợi thế tham số" của mô hình nền tảng đang đạt đỉnh.

Con đường tăng cường trí tuệ chỉ bằng cách mở rộng quy mô tham số đang ngày càng giảm hiệu quả biên.

Trong tương lai, ai có thể giới thiệu cơ chế suy luận tương tự “độ sâu lặp lại” trong kiến trúc hệ thống và thực hiện sự “giảm thiểu” cực hạn trong gọi công cụ, người đó sẽ đạt được bước nhảy vọt về trải nghiệm.

Ngoài ra, "kỹ thuật tác nhân" mới là yếu tố quyết định thắng thua.

Cuộc cạnh tranh giữa các mô hình lớn đã chuyển từ “ai nói giỏi hơn” sang “ai làm việc giỏi hơn”.

Rào cản cốt lõi trong tương lai không phải là điểm số đơn lẻ, mà là khả năng triển khai thực tế các nhiệm vụ dài hạn với chi phí cực thấp.

Các mô hình như Muse Spark 1.3, có thể thực hiện 60 chu kỳ thử nghiệm với chi phí chưa đến 1 USD, sẽ hoàn toàn thay đổi mô hình kinh doanh.

Tài liệu tham khảo:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

Bài viết này đến từ tài khoản WeChat “Xin Trí Nguyên”, tác giả: ASI Khải Huyền

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.