Anthropic ra mắt Claude Opus 5.5 với giảm 40% chi phí và tập trung vào độ tin cậy khi thực hiện tác vụ dài

icon币界网
Chia sẻ
AI summary iconTóm tắt
Anthropic đã ra mắt Claude Opus 5.5 vào ngày 22 tháng 9 năm 2026, với mức giảm chi phí 40% so với phiên bản trước đó. Mô hình hỗ trợ đầu tư dài hạn bằng cách cải thiện độ tin cậy cho các tác vụ kéo dài. Nó xử lý mã hóa và nghiên cứu phức tạp, bao gồm việc di chuyển 680.000 dòng mã trong chưa đầy một ngày. Bản cập nhật thêm tính năng bảo vệ chống tiêm prompt và tập trung vào kiểm tra an toàn trong môi trường thực tế. Tiết kiệm chi phí thay đổi tùy theo độ phức tạp của tác vụ và việc sử dụng công cụ.
Bijie.com báo cáo:

Anthropic đã phát hành Claude Opus 5.5 vào ngày 22 tháng 9, đây là mô hình đầu tiên trong chuỗi Claude 5.5. Điểm bán hàng chính mà công ty đưa ra rất trực tiếp: đạt mức hiệu suất tương đương Claude Fable 5.1 trong hầu hết các tác vụ, đồng thời giảm 40% chi phí vận hành so với thế hệ trước là Opus 5. Nhưng điều đáng chú ý thực sự trong đợt phát hành này không chỉ là giá cả và bảng xếp hạng, mà còn là việc Anthropic đã chuyển trọng tâm kiểm tra sang các nhiệm vụ kéo dài, các thao tác không thể hoàn tác và khả năng phòng chống tiêm prompt.

The official statement indicates that Opus 5.5 shows significant improvements in complex encoding, research, and expert-level tasks. Among early testers, one team completed the migration of approximately 680,000 lines of code in less than a day; Anthropic also emphasized that the model can maintain longer context and plan continuity. While these cases demonstrate the upper limits of capability, they should not be considered the average delivery time for all projects. Codebase structure, test coverage, and human review will all affect the outcomes.

Giảm chi phí không có nghĩa là “phiên bản giá rẻ của thiết bị cao cấp”, mà là tái định nghĩa ranh giới sử dụng mô hình

Trước đây, Opus thường chỉ được dành cho những nhiệm vụ phức tạp và đắt đỏ nhất, trong khi các công việc thường ngày được giao cho các mẫu có tốc độ nhanh hơn. Nếu Opus 5.5 thực sự có thể tiếp cận mức độ của Fable 5.1 với chi phí thấp hơn, các doanh nghiệp có thể sử dụng mô hình cao cấp này cho số lượng lớn các quy trình như kiểm tra mã, phân tích tài liệu và nghiên cứu, thay vì chỉ gọi đến trong một số ít yêu cầu có giá trị cao.

Việc giảm 40% chi phí là tuyên bố chính thức của Anthropic so với Opus 5, không có nghĩa là hóa đơn của mọi doanh nghiệp sẽ giảm đúng 40%. Chi phí thực tế phụ thuộc vào độ dài đầu vào và đầu ra, bộ nhớ đệm, số lần gọi công cụ và liệu nhiệm vụ có cần thử lại hay không. Các mô hình mạnh hơn cũng có thể tiêu tốn nhiều Token tổng thể hơn do được giao các nhiệm vụ dài hơn. Người mua cần tự kiểm tra “tổng chi phí để hoàn thành một nhiệm vụ” bằng tải công việc của mình, thay vì chỉ so sánh giá đơn vị.

Khả năng xử lý nhiệm vụ dài cũng phải được đánh giá dựa trên chất lượng hoàn thành. Một lần di chuyển mã lớn có thể tạo ra nhiều thay đổi trông có vẻ hợp lý, nhưng chi phí thực sự bao gồm kiểm thử hồi quy, xung đột phụ thuộc, triển khai và hoàn tác. Nếu mô hình yêu cầu kỹ sư dành vài ngày để sửa các vấn đề biên, lợi thế về tốc độ sẽ bị giảm sút. Đánh giá có giá trị nhất nên ghi lại cả tỷ lệ thành công, số lần can thiệp của con người và lỗi không thể phục hồi, thay vì chỉ ghi lại số lượng mã đã tạo ra.

Anthropic cho biết Opus 5.5 đã trải qua các bài kiểm tra trước khi phát hành bởi các đánh giá viên bên ngoài như Frontier Design và METR. Sự tham gia của bên ngoài giúp tăng độ tin cậy, nhưng không đồng nghĩa với việc tất cả báo cáo, dữ liệu gốc và môi trường kiểm tra đã được công khai hoàn toàn. Người dùng vẫn nên phân biệt giữa kết quả do công ty tự báo cáo, kết quả đánh giá độc lập và kết quả tái tạo trong môi trường của chính họ.

Bài kiểm tra bảo mật bắt đầu tập trung vào các tình huống sự cố thực tế, thay vì chỉ tỷ lệ từ chối trả lời câu hỏi ngắn.

Anthropic cho biết, Opus 5.5 đã đạt thành tích tốt nhất của công ty trong các cuộc kiểm tra tự động hóa hành vi. Các bài kiểm tra bao gồm hàng ngàn tình huống mô phỏng, tập trung vào việc mô hình có thực hiện các hành động khó thu hồi, có vượt quá ranh giới do người dùng xác định, và có duy trì nhiệm vụ gốc khi đối mặt với việc tiêm prompt hay không. Công ty cũng bổ sung các nhiệm vụ không thể thực hiện, các nhiệm vụ kéo dài hơn và các tình huống được thiết kế dựa trên sự cố thực tế vào đánh giá.

Đây là bài học bắt buộc phải bổ sung sau khi AI đại diện được triển khai vào môi trường sản xuất. Các bài kiểm tra bảo mật truyền thống thường hỏi liệu mô hình có trả lời các câu hỏi nhạy cảm hay không, nhưng các đại diện có thể duyệt web, gọi terminal và chỉnh sửa tệp tin thì rủi ro đến từ chuỗi hành động: nó có thể tiếp tục thực thi dựa trên tiền đề sai lầm, hoặc coi văn bản độc hại trên trang web là lệnh. Một cú nhấp sai hoặc mở rộng quyền hạn sẽ khó khắc phục hơn nhiều so với một câu trả lời không phù hợp.

“Ít vi phạm hơn” vẫn không có nghĩa là “không bao giờ vi phạm”. Anthropic đã công nhận rõ ràng rằng mô hình có những hạn chế. Khi triển khai doanh nghiệp, vẫn cần áp dụng quyền tối thiểu, xác nhận thao tác, nhật ký có thể theo dõi, sandbox và cơ chế rollback. Đặc biệt, đối với các thay đổi cơ sở dữ liệu sản xuất, thanh toán và hạ tầng, không nên hủy bỏ sự phê duyệt của con người chỉ vì điểm an toàn của mô hình đã tăng lên.

Đây là mô hình đầu tiên được phát hành sau khi Anthropic đưa ra khái niệm “giảm tốc độ tiến bộ前沿”. Công ty đang cố gắng truyền tải thông điệp rằng: tiếp tục nâng cao năng lực, đồng thời đưa các đánh giá bên ngoài và các bài kiểm tra an toàn gần với tình huống thực tế vào quy trình phát hành. Tuy nhiên, để đánh giá liệu cam kết này có thực sự được thực hiện hay không, cần xem liệu có liên tục công khai các trường hợp thất bại, phương pháp kiểm tra và hiệu quả khắc phục trong tương lai hay không, chứ không chỉ dựa vào điểm số cao nhất trong một lần phát hành.

Đối với người dùng, điều đáng thử nhất ở Opus 5.5 không phải là câu trả lời trò chuyện có đẹp hơn không, mà là liệu nó có thể duy trì sự kiểm soát trong các nhiệm vụ kéo dài hàng giờ, sử dụng nhiều công cụ và nhiều bước, đồng thời biết dừng lại khi thông tin không đầy đủ. Cạnh tranh trên thị trường mô hình đang chuyển từ “ai trả lời thông minh hơn” sang “ai có thể hoàn thành công việc phức tạp với chi phí kiểm soát được”. Giá giảm giúp nhiều người có cơ hội thử nghiệm, nhưng an toàn và kỷ luật kỹ thuật mới là yếu tố quyết định liệu những thử nghiệm này có thực sự được đưa vào sản xuất hay không.

Trong quá trình dùng thử, doanh nghiệp có thể thiết lập một bộ tiêu chí so sánh đơn giản nhưng nghiêm ngặt: dùng cùng một tập hợp nhiệm vụ thực tế để so sánh Opus 5, Opus 5.5 và các mô hình chi phí thấp hơn, ghi lại thời gian hoàn thành, tổng chi phí, tỷ lệ vượt bài kiểm tra, lượng chỉnh sửa thủ công và số lần hành động rủi ro cao. Chỉ khi tất cả các chỉ số này đồng thời được cải thiện, việc nâng cấp mới mang ý nghĩa kinh doanh. Bài trình diễn vào ngày ra mắt phù hợp để phát hiện khả năng, nhưng đánh giá nội bộ liên tục trong nhiều tuần mới phù hợp để quyết định quyền hạn và ngân sách.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.