Anthropic ra mắt Claude Sonnet 5.5 với tốc độ đầu ra nhanh hơn 30% và giảm chi phí

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
Anthropic đã công bố ra mắt Claude Sonnet 5.5, một dự án token mới được tối ưu hóa cho các tác vụ tần suất cao. Mô hình này cung cấp đầu ra nhanh hơn 30% và chi phí mỗi tác vụ giảm tới 30% so với Sonnet 5. Tin tức trên chuỗi cho thấy nó đạt 70,6% trên Terminal-Bench 4.0, vượt trội hơn cả Sonnet 5 và Opus 5.5. Tuy nhiên, khi xử lý ở mức lý luận tối đa, nó sử dụng nhiều token hơn và chi phí cao hơn tới 50%. Anthropic khuyến nghị sử dụng Sonnet 5.5 cho các tác vụ được xác định rõ ràng, trong khi Opus xử lý các công việc phức tạp.
Anthropic đã phát hành Claude Sonnet 5.5, nỗ lực nén khả năng gần với mô hình đỉnh cao Opus 5.5 vào một mô hình Agent hàng ngày có giá thấp hơn và phù hợp để gọi lặp lại thường xuyên. Giá đơn vị API vẫn là 2 USD và 10 USD mỗi triệu Token đầu vào/đầu ra, nhưng công ty tuyên bố tốc độ đầu ra tăng hơn 30%, số Token cần thiết để hoàn thành các tác vụ điển hình giảm xuống, giúp giảm chi phí cho từng tác vụ lên đến 30%. Trong các bài kiểm tra chính thức, Sonnet 5.5 đạt 70,6% trên Terminal‑Bench 4.0, cao hơn 10,3% của Sonnet 5 và 66,4% của Opus 5.5; đồng thời đạt 1844 Elo trên nhiệm vụ chuyên nghiệp GDPval‑AA, gần với 1846 của Opus. Tuy nhiên, “Opus nửa giá” không phải là kết luận đầy đủ: Artificial Analysis phát hiện rằng, ở mức độ suy luận cao nhất, Sonnet 5.5 trung bình tạo ra khoảng 193.000 Token đầu ra cho mỗi câu hỏi, là cấu hình tốn Token nhất mà họ từng kiểm tra, khiến chi phí mỗi câu hỏi cao hơn khoảng 50% so với Sonnet 5; các bài kiểm tra đánh giá mã thực tế của CodeRabbit cũng cho thấy, mặc dù Sonnet 5.5 nhanh hơn khoảng hai lần so với thế hệ trước, nó vẫn bỏ sót các vấn đề khó mà Opus có thể phát hiện. Do đó, nó giống như một mô hình chủ lực mới phù hợp cho các tác vụ rõ ràng và lặp lại, chứ không phải sự thay thế toàn diện cho Opus.

Tác giả bài viết, nguồn: Anthropic

Anthropic tái định vị Sonnet làm nền tảng Agent hàng ngày

Sonnet 5.5 là mô hình thứ hai trong chuỗi Claude 5.5. Khác với Opus 5.5 được phát hành cách đây một tuần, nhắm vào các nhiệm vụ mở rộng và phức tạp, Anthropic định vị Sonnet 5.5 để xử lý các công việc thường ngày có ranh giới rõ ràng và yêu cầu thực hiện lặp lại nhiều lần: sửa lỗi chương trình, xem xét mã nguồn, điều tra tài liệu, cũng như tạo tài liệu, bài thuyết trình và bảng tính.

Mô hình hỗ trợ đầu vào văn bản và hình ảnh, cung cấp ngữ cảnh 1 triệu Token, có thể sử dụng trên trang web và ứng dụng di động của Claude, Anthropic API, AWS, Google Cloud và Microsoft Azure. Tên API làclaude-sonnet-5-5. Anthropic chưa công bố số lượng tham số, kiến trúc mô hình, dữ liệu huấn luyện và sức mạnh tính toán dùng để huấn luyện, do đó không thể xác định sự cải thiện cụ thể đến từ việc huấn luyện cơ bản, huấn luyện sau, chiến lược suy luận hay tối ưu hóa chuỗi công cụ Agent.

Sự khác biệt giữa nó và Opus không chỉ đơn thuần là “hiệu năng yếu hơn và giá rẻ hơn”. Anthropic mong muốn tạo ra sự phân công mô hình mới: Opus đảm nhận các nhiệm vụ phức tạp với định nghĩa vấn đề chưa đầy đủ và cần đánh giá liên tục; Sonnet thì thực hiện nhanh các công việc đã được xác định rõ ràng và mở rộng số lần gọi với chi phí thấp hơn.

70,6% so với 10,3%, là dữ liệu nổi bật nhất và cần được hiểu một cách cẩn trọng

Sonnet 5.5 đạt 70,6% trong bài kiểm tra Terminal‑Bench 4.0 do Anthropic công bố, trong khi Sonnet 5 chỉ đạt 10,3%, thậm chí còn cao hơn Opus 5.5 với 66,4%. Bài kiểm tra này yêu cầu Agent hoàn thành các nhiệm vụ chuyên môn nhiều bước trong môi trường dòng lệnh, phản ánh sự phối hợp giữa lập trình mã, thao tác terminal và sử dụng công cụ.

Các cải tiến cho các dự án khác không quá nổi bật nhưng vẫn rõ rệt. CursorBench 4.0 tăng từ 34,1% của Sonnet 5 lên 55,5%, cách Opus 5.5 ở mức 57,8% khoảng hai phần trăm; Humanity’s Last Exam với công cụ tăng từ 54,9% lên 64,5%; OSWorld 2.1 thao tác máy tính tăng từ 57,0% lên 80,1%, gần với mức 81,8% của Opus.

Trong nhiệm vụ chuyên môn GDPval-AA, Sonnet 5.5 đạt 1844 Elo, Opus 5.5 đạt 1846; trong bài đánh giá công việc kiến thức dài hạn AA-Briefcase, hai mô hình lần lượt đạt 1811 và 1822. Anthropic cho rằng, một số công việc chuyên môn có ranh giới rõ ràng đã không còn cần phải mặc định gọi đến mô hình hàng đầu.

Tuy nhiên, những con số này không thể đơn giản gộp lại thành “Sonnet đã vượt qua Opus”. Các dự án khác nhau sử dụng cường độ suy luận không hoàn toàn giống nhau, và Anthropic đã rõ ràng cho biết rằng trong các nhiệm vụ yêu cầu duy trì phán đoán lâu dài và xử lý mục tiêu mở, Opus vẫn rõ ràng mạnh hơn.

Một ví dụ ngược lại thú vị đến từ FrontierCode. Sonnet 5.5 đạt 52,1% ở mức độ suy luận Xhigh, nhưng khi tăng lên Max lại giảm xuống còn 46,2%. Anthropic giải thích rằng mô hình trong chế độ Max thường xuyên khởi động nhiều sub-Agent kiểm tra mã hơn, hai lần bị hết thời gian hoặc sửa đổi mã ngoài phạm vi nhiệm vụ, cuối cùng bị đánh giá là thất bại.

Kết quả này cho thấy, việc tăng thêm suy luận và nhiều Agent hơn không nhất thiết mang lại câu trả lời tốt hơn. Mô hình có thể bị trừ điểm do kiểm tra quá mức, mở rộng phạm vi nhiệm vụ hoặc hết ngân sách thời gian.

Mỗi Token không giảm giá, tại sao phía chính thức lại nói chi phí nhiệm vụ giảm 30%?

Giá công khai của Sonnet 5.5 giống với Sonnet 5: 2 USD mỗi triệu token đầu vào, 10 USD mỗi triệu token đầu ra, 2.5 USD cho ghi bộ nhớ đệm và 0.2 USD cho đọc bộ nhớ đệm, tương đương một nửa giá của Opus 5.5 cho các mục tương ứng.

Anthropic所说的“单任务成本最多降低30%”,并非指API价格表下调,而是指模型完成同一任务时所需的步骤和Token更少。官方称其生成速度提升了30%以上;Slack在内部测试中观察到输出Token减少了约14%;Atlassian表示Agent速度最多提升了30%;Lovable则报告工具调用减少了约三分之一,Shell运行次数减少近半。

Khi được thử nghiệm trên 2.441 nhiệm vụ tài chính liên quan đến câu hỏi-đáp, trích xuất, phân tích và dự đoán, Sonnet 5.5 trung bình sử dụng khoảng 121.000 Token mỗi nhiệm vụ, trong khi Sonnet 5 là 497.000. Vì đây đều là các bài kiểm tra riêng tư của đối tác, nên bên ngoài không thể kiểm tra độ khó của nhiệm vụ, lời nhắc và đầu ra đầy đủ, nhưng kết quả chung cho thấy một sự thay đổi: mô hình mới ít phải tìm kiếm lặp lại, đọc lại tài liệu hoặc thực hiện suy luận nội bộ kéo dài.

Điều này đặc biệt quan trọng đối với Agent. Trong các cuộc trò chuyện truyền thống, việc đầu ra hàng trăm token cùng một lúc có ảnh hưởng hạn chế; nhưng đối với Agent dài hạn, việc lặp lại đọc ngữ cảnh, gọi công cụ và sửa kết quả có thể khiến một bước dư thừa sau vài chục vòng lặp trở thành sự khác biệt đáng kể về thời gian và chi phí.

Sức mạnh suy luận cao nhất tiết lộ một sự thật chi phí khác

Bài kiểm tra độc lập của Artificial Analysis đã trao cho Sonnet 5.5 với cấu hình suy luận cao nhất điểm 56, chỉ kém 2 điểm so với Opus 5.5 ở chỉ số trí tuệ tổng hợp.

Tuy nhiên, để đạt được thành tích này, chi phí rất cao: Sonnet 5.5 trung bình tạo ra khoảng 193.000 token đầu ra cho mỗi bài kiểm tra, mức cao nhất mà tổ chức này từng đo lường, cao hơn khoảng 60% so với Opus 5.5 Max và Sonnet 5 Max, và gấp bảy lần GPT‑6 Astra Max. Chi phí ước tính cho mỗi câu hỏi đạt mức 7,60 đô la, cao hơn khoảng 50% so với Sonnet 5.

Điều này không mâu thuẫn trực tiếp với tuyên bố của Anthropic rằng “chi phí nhiệm vụ có thể giảm tới 30%”. Kết luận chính thức chủ yếu mô tả các tải công việc điển hình và mức độ suy luận thấp; Artificial Analysis đo lường trong trường hợp kích hoạt Max để đạt đến giới hạn khả năng.

Hai kết quả này cùng cho thấy cường độ suy luận đã trở thành một phần của sản phẩm mô hình. Sonnet 5.5 ở chế độ Low hoặc Medium có thể mang lại hiệu suất chi phí cực cao; nếu tăng cường độ suy luận lên Max để theo kịp Opus, dù mỗi Token rẻ hơn, nó có thể mất lợi thế chi phí do tạo ra quá nhiều nội dung.

Artificial Analysis cũng phát hiện rằng độ chính xác về kiến thức sự thật của Sonnet 5.5 khoảng 54%, thấp hơn 66% của Opus; các dự án suy luận khoa học cũng kém khoảng sáu phần trăm. Việc gọi là “gần bằng Opus” chủ yếu dựa trên thao tác đầu cuối của Agent và một số công việc kiến thức, không thể suy rộng ra tất cả các khả năng.

Trong các cuộc kiểm tra mã thực tế, lợi thế về tốc độ vẫn tồn tại và khoảng cách giữa các sản phẩm cao cấp cũng vẫn còn.

CodeRabbit đã thực hiện một loạt bài kiểm tra ngày phát hành bằng các lỗi đã biết từ các dự án mã nguồn mở thực tế.

Trong 13 trường hợp kiểm tra mã khó, Sonnet 5.5 với tính năng suy luận phát hiện được 6 vấn đề, cao hơn Sonnet 5 với 4 vấn đề; độ chính xác của các nhận xét hiệu quả lần lượt là 41,2% và 40,0%. Tuy nhiên, Opus 5.5 ở chế độ tiêu chuẩn phát hiện được 8 vấn đề, chế độ Max phát hiện được 10 vấn đề, cho thấy khoảng cách vẫn rõ rệt trong các nhiệm vụ kiểm tra phức tạp.

Trong một bộ thử nghiệm khác bao gồm 44 Pull Request thực tế, Sonnet 5.5 trung bình mất 6 phút 33 giây mỗi lần đánh giá, trong khi Sonnet 5 mất 13 phút 31 giây. Phiên bản trước tạo ra ít bình luận hơn 24% và chỉ có khoảng một phần ba ý kiến vụn vặt so với thế hệ trước; tính theo giá công khai, chi phí trung bình cho mỗi lần gọi mô hình lõi khoảng 0,46 đô la, trong khi Sonnet 5 là khoảng 1,16 đô la.

Tuy nhiên, điểm số bao phủ lỗi đầy đủ của bộ 44 PR này vẫn chưa được hoàn thành khi bài viết được đăng, do đó hiện tại chỉ có thể xác nhận rằng nó nhanh hơn và đầu ra ít hơn, nhưng chưa thể xác định liệu các bình luận được viết ngắn hơn có bỏ sót thêm nhiều vấn đề thực tế hay không. Mẫu gồm 13 trường hợp khó cũng rất nhỏ; CodeRabbit tự nhắc nhở rằng điều này đủ để quan sát xu hướng, nhưng chưa đủ để xác định thứ hạng phổ biến.

Phân công mô hình hợp lý hơn là: Sonnet 5.5 chịu trách nhiệm thực hiện đánh giá nhanh và thông thường cho từng PR; các thay đổi liên quan đến bảo mật, kiến trúc cốt lõi hoặc có chi phí cao nếu bỏ sót lỗi sẽ được nâng cấp lên Opus hoặc chuyên gia con người.

Thiết kế trực quan đang bắt đầu trở thành điểm bán của mô hình công việc phổ biến

Anthropic cũng đặc biệt nhấn mạnh khả năng thiết kế hình ảnh của Sonnet 5.5. Trong bản trình diễn chính thức, Sonnet 5 và 5.5 được yêu cầu tạo ra các hình ảnh bao gồm 400 con sáo bay thành đàn, các đụn cát được tạo hình bởi gió và một chiếc đồng hồ lớn gồm 24 chiếc chuông nhỏ, tất cả đều trong một tệp HTML duy nhất. Mô hình mới có tốc độ tạo nhanh hơn, đồng thời hoàn thiện hơn về hoạt ảnh, lớp và giao diện.

Nó còn có thể tạo bài thuyết trình dựa trên mẫu. Trong một bài kiểm tra nội bộ, Anthropic đã cung cấp tài liệu báo cáo quý của một công ty niêm yết, bản ghi cuộc gọi và mẫu slide mười trang, và hai chuyên gia cho rằng phiên bản đầu tiên của Sonnet 5.5 có thể gửi trực tiếp.

Những điều này vẫn thuộc về các ví dụ minh họa do nhà sản xuất lựa chọn và không thể đại diện cho khả năng mô hình hiểu ổn định mọi mẫu doanh nghiệp. Độ chính xác của dữ liệu trong biểu đồ phức tạp, quy chuẩn thương hiệu và nguồn trích dẫn vẫn cần được kiểm tra thủ công, nhưng nó phản ánh hướng đi mới trong cạnh tranh của mô hình: không chỉ tạo ra nội dung chính xác, mà còn cố gắng cung cấp giao diện và tài liệu gần như hoàn chỉnh.

Việc nâng cao năng lực bảo mật cũng có nghĩa là một số yêu cầu sẽ được mô hình cũ xử lý

Sonnet 5.5 là mô hình Sonnet đầu tiên được phát hành với bảo vệ an ninh mạng cấp cao nhất. Anthropic cho biết khả năng an ninh mạng của nó đã gần bằng Opus 5, do đó các bản vá lỗ hổng thông thường vẫn có thể được thực hiện bình thường, nhưng các yêu cầu an ninh mạng có rủi ro cao hơn sẽ được chuyển minh bạch sang Sonnet 5.

Công ty cũng đã kiểm tra các hành vi như lừa dối người dùng, đi ngược lợi ích người dùng, hỗ trợ lạm dụng rủi ro cao và vượt qua ranh giới môi trường trong khoảng 1.850 tình huống. Công ty cho biết mô hình mới có hiệu suất tương đương hoặc vượt trội hơn Sonnet 5 trên hầu hết các chỉ số, đồng thời là mô hình Claude ít chủ động thử nghiệm ranh giới container nhất.

Tuy nhiên, những đánh giá này chủ yếu là tự động hóa nội bộ của Anthropic và không thể coi là bằng chứng đầy đủ về rủi ro trong môi trường thực tế. Công ty cũng tự thừa nhận rằng không có bộ kiểm tra nào có thể phát hiện ra tất cả các mô hình thất bại.

Sonnet 5.5 là phiên bản đầu tiên của Sonnet tích hợp bộ phân loại chống khai thác, đồng thời mở rộng cơ chế “giữ lại nội dung suy luận” để ngăn chặn việc chuyển giao ngữ cảnh suy luận giữa các tài khoản. Ảnh hưởng đến các nhà phát triển thông thường là hạn chế, nhưng một số quy trình làm việc di chuyển cuộc hội thoại Claude Code giữa các tài khoản cần được điều chỉnh.

Sự thay đổi thực sự không phải là vị trí số một trên bảng xếp hạng, mà là “mô hình đủ mạnh” bắt đầu trở thành lựa chọn mặc định

Sonnet 5.5 không công bố kiến trúc mô hình mới nào, cũng không vượt trội toàn diện so với Opus. Ý nghĩa quan trọng hơn của nó là chuyển nhiều công việc trước đây cần mô hình cao cấp xử lý sang các mô hình trung cấp, nhanh hơn và giá mỗi Token giảm một nửa.

Đối với các hệ thống chạy hàng ngàn lần mỗi ngày như hỗ trợ khách hàng, xem xét mã, điều tra tài liệu và sản xuất tài liệu, quyết định có nên triển khai hay không thường không dựa trên điểm số cao nhất của một nhiệm vụ duy nhất, mà là số bước cần thiết cho mỗi nhiệm vụ, bao nhiêu Token, thời gian chờ đợi là bao lâu, và liệu lỗi có thể được nâng cấp xử lý hay không. Giá trị của Sonnet 5.5 chính xác tập trung vào các chỉ số này.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụng và Tiết lộ rủi ro của chúng tôi.