Thời đại chưng cất lớn lao đang sắp kết thúc!
Vào ngày 2 tháng 9, Anthropic đã tung một đòn mạnh, trực tiếp thay đổi quy tắc API, cắt đứt hoàn toàn con đường của các mô hình bao bọc và người tinh luyện.

Trước đây, vô số công ty đã chọn cách sử dụng API để lấy quá trình suy luận từ các mô hình hàng đầu, sau đó dùng những dữ liệu này để huấn luyện các «mô hình nhỏ» của riêng mình, nhằm tiết kiệm chi phí tính toán khổng lồ và thời gian huấn luyện kéo dài.
But from today onward, this possibility no longer exists.
Claude Fable 5.1 cấm chỉnh sửa "khối suy nghĩ"
Anthropic vừa phát hành Fable 5.1, giới thiệu cơ chế chống tinh luyện nghiêm ngặt nhất từ trước đến nay.
Hành động cốt lõi là khóa chặt “khối suy nghĩ”.
“思考块” là gì?
Nói một cách đơn giản, đó là quá trình CoT mà AI thực hiện trong đầu trước khi đưa ra câu trả lời cuối cùng.

Claude khi thực hiện tính nhẩm, các con đường tư duy phức tạp và song song
Trong các lệnh gọi API, Claude sẽ trả về các bước suy luận này dưới dạng các “khối suy nghĩ” cho người dùng.
Trong các cuộc hội thoại đa vòng bình thường, các nhà phát triển sẽ gửi lại các khối suy nghĩ này cùng với các lời nhắc hệ thống, công cụ và tin nhắn lịch sử đến Claude để mô hình ghi nhớ ngữ cảnh và duy trì tính liên tục của cuộc hội thoại.
Nhưng chính cơ chế này lại trở thành cơ hội cho những người chưng cất.
Họ đã phát hiện ra một lỗ hổng lớn: chỉ cần trong các cuộc hội thoại nhiều vòng, tinh vi thay đổi ngữ cảnh xung quanh khối suy nghĩ (ví dụ: sửa đổi các lời nhắc hệ thống hoặc tin nhắn lịch sử từ sớm), có thể phá vỡ cơ chế phòng thủ của Claude, thậm chí lừa Claude tiết lộ logic suy luận nền tảng mà nó vốn giấu kín!


Để đối phó với tình trạng hỗn loạn này, Anthropic đã mạnh tay triển khai quy định mới “Xác thực tính nhất quán ngữ cảnh” trong Fable 5.1.
1. Trở về đường cũ, không thay đổi một chữ: API hiện sẽ nghiêm ngặt xác minh liệu “khối suy nghĩ” do khách hàng gửi lại có hoàn toàn giống với lời nhắc hệ thống, công cụ và tin nhắn lịch sử ban đầu tạo ra nó hay không.
2. Đã bị can thiệp? Báo lỗi ngay! Chỉ cần hệ thống phát hiện ngữ cảnh bị thay đổi, dù chỉ một Click Tất cả sẽ không khớp, API sẽ trả về thông báo lỗi trực tiếp và từ chối dịch vụ.
Hơn nữa, để phục vụ những nhà phát triển hợp pháp thực sự cần chỉnh sửa ngữ cảnh (ví dụ: cần nén độ dài ngữ cảnh để tiết kiệm chi phí), Anthropic cung cấp chế độ “không nghiêm ngặt”.
Trong chế độ này, yêu cầu của bạn sẽ được chấp nhận, nhưng hệ thống sẽ xóa hoàn toàn các khối suy nghĩ! Mô hình sẽ phải đưa ra câu trả lời mà không hề nhìn thấy quá trình suy luận trước đó.
Đây thực sự là cách triệt nguồn gốc vấn đề.

Khi Claude được hỏi một câu hỏi đơn giản và một câu hỏi khó hơn, ví dụ về suy luận trung thực và suy luận mang động cơ (không trung thực)
Chưng cất công nghiệp, thực sự điên rồ đến mức nào?
Tại sao Anthropic lại tức giận đến mức đặt ra những hạn chế nghiêm ngặt như vậy?
Câu trả lời là: Về phần, và cực kỳ cần thiết.
Do việc chưng cất bất hợp pháp hiện nay đã phát triển quy mô công nghiệp.
Trong năm qua, nhóm an ninh của Anthropic đã ghi nhận những hiện tượng lạm dụng đáng báo động.
Những chuyên gia "hacker chưng cất" này không chỉ dùng một tài khoản để hỏi vài câu hỏi mỗi ngày, mà sử dụng hàng ngàn tài khoản giả mạo, thông qua các script tự động, liên tục khai thác lợi ích một cách điên cuồng qua API ngày đêm.

Các phương pháp hoạt động của họ có tính ẩn danh và tấn công cao.
Như đã nói ở trên, mặc dù Anthropic đã mã hóa các khối suy nghĩ cốt lõi của Claude từ lâu, nhưng các tin tặc đã sử dụng các kỹ thuật “tiêm ngữ cảnh” và “ghi lại cuộc hội thoại”.
Hành động này giống như đang “gây mê” cho Claude, khiến nó trong trạng thái logic hỗn loạn tự động giải mã và in ra quá trình suy luận đã được mã hóa của chính nó.
Do đó, nhiều mô hình tham số nhỏ đã không trải qua quá trình tích lũy sức mạnh tính toán và đổi mới thuật toán từ đầu, mà chỉ cần ghi nhớ cách tiếp cận câu trả lời của các AI hàng đầu, đã đạt được hiệu năng ngang ngửa.
Đáng sợ hơn, hành động này trực tiếp chạm vào đường ranh giới đỏ, dẫn đến sự sụp đổ của an ninh.
Nguy cơ lớn nhất của AI mất kiểm soát
Nếu tổn thất lợi ích kinh doanh chỉ khiến Anthropic “đau lòng”, thì sự tách rời giữa năng lực và an toàn lại khiến toàn bộ cộng đồng an toàn AI cảm thấy sợ hãi.
Đây cũng là động lực cốt lõi khiến Anthropic quyết định ra tay quyết liệt.
Như đã biết, các mô hình lớn như Claude, GPT-4, ngoài việc sở hữu trí thông minh cực cao, còn được đào tạo nghiêm ngặt về việc “căn chỉnh giá trị” và an toàn. Chúng biết không được dạy cách chế tạo bom, không được viết phần mềm tống tiền độc hại, và không được đưa ra các phát ngôn thù hận.
Sự kết hợp kép “khả năng + hàng rào an toàn” này là kết quả của các công ty AI lớn đã đầu tư hàng chục triệu đô la vào RLHF và các cuộc đối kháng đỏ-xanh.

Tuy nhiên, mô hình tinh luyện đã hoàn toàn tránh được lưới an toàn này!
Khi những người tinh luyện thay đổi ngữ cảnh để ép buộc Claude tiết lộ các “khối suy nghĩ” của nó, họ chỉ trích xuất được phần “khả năng suy luận” thông minh cao đó, nhưng hoàn toàn không thể kế thừa các biện pháp bảo mật nền tảng.
Giống như một tổ chức ác ý đã sao chép trí thông minh của Einstein nhưng không sao chép được đạo đức và sự đồng cảm của ông.
Hệ thống được huấn luyện bằng phương pháp chưng cất bất hợp pháp này sẽ vô cớ kế thừa những khả năng logic và mã nâng cao mà chúng vốn không nên có.
Tuy nhiên, do bản thân chúng là các mô hình nền tảng có “mức độ bảo vệ thấp và hàng rào yếu”, chúng sẽ không ngần ngại thực hiện yêu cầu của tin tặc để tạo ra các kịch bản tấn công mạng hoặc hỗ trợ phát triển vũ khí sinh học.
Việc tách rời năng lực và an toàn là rủi ro lớn nhất hiện nay trong AI.
Quy định mới có hiệu lực: Ai bị ảnh hưởng?
Lần tấn công này có ảnh hưởng đến các nhà phát triển chính đáng không?
Đừng lo, Anthropic đã áp dụng chiến lược "thực hiện từng giai đoạn" chính xác nhằm giảm thiểu tối đa tác động không mong muốn.
Đầu tiên là « tài khoản mới ».
Theo tài liệu chính thức, hạn chế này ban đầu được áp dụng cho các tài khoản mới có hành vi lạm dụng nhiều nhất. Đối với mô hình Fable 5.1, bản cập nhật này chỉ áp dụng cho các tài khoản API được tạo sau 12:00:00 AM UTC ngày 31 tháng 8 năm 2026.
Những người sau có thể hoàn toàn yên tâm, bạn hoàn toàn không bị ảnh hưởng.
1. Tài khoản API hiện có: Các tài khoản cũ hiện tại không bị ảnh hưởng trên Fable 5.1. Điều này cung cấp đủ thời gian cho các nhà phát triển hợp pháp để điều chỉnh.
2. Người dùng cuối thông thường: Nếu bạn chỉ đang sử dụng phiên bản web của Claude.ai, hoặc là người dùng cuối của các sản phẩm chính thức như Claude Code, Claude Cowork, hoặc đang trò chuyện bình thường qua các sản phẩm bên thứ ba đóng gói, bạn sẽ không bị ảnh hưởng bởi bất kỳ sự can thiệp nào.

Đối với các nhà phát triển API bị ảnh hưởng, bạn cần lưu ý điều gì?
Nếu trong tích hợp ứng dụng trước đây của bạn, bạn đã sử dụng kỹ thuật “ghi đè các vòng lặp sớm trong cuộc hội thoại” (ví dụ: để tiết kiệm chi phí bằng cách nén ngữ cảnh, hoặc ép buộc chèn thông báo hệ thống mới giữa chừng cuộc hội thoại), bạn cần bắt đầu điều chỉnh logic mã của mình ngay lập tức.

Để đáp ứng sự thay đổi này, Anthropic đã cung cấp hướng dẫn di chuyển toàn diện. Các nhà phát triển có hai lựa chọn.
Chọn một: Giữ nguyên hoàn toàn ngữ cảnh. Trả lại chính xác các khối suy nghĩ, lời nhắc hệ thống và công cụ như nguyên bản.
Tùy chọn hai: Chọn tham gia "chế độ không nghiêm ngặt" trong yêu cầu API. Trong chế độ này, ngay cả khi bạn thay đổi ngữ cảnh, API sẽ không báo lỗi hoặc dừng lại, mà sẽ tự động và lặng lẽ xóa các khối suy nghĩ bị ảnh hưởng trong yêu cầu.
Mặc dù điều này sẽ khiến mô hình “quên” các quá trình suy luận cụ thể trước đó trong cuộc hội thoại tiếp theo, nhưng ít nhất nó đảm bảo cuộc hội thoại hoặc nhiệm vụ của bạn không bị gián đoạn.
Cần lưu ý: Mặc dù hiện tại quy định này đang trong thời gian miễn trừ, Anthropic đã khẳng định rõ ràng — cơ chế "Giữ lại suy nghĩ" sẽ được áp dụng cho tất cả tài khoản trong các phiên bản mô hình tương lai!
Thời gian đệm hiện tại cũng có hạn.
Sự bất ngờ thú vị: Mang lại lợi ích cho những người chân thành
Và sau quy định mới này, còn ẩn chứa một lợi ích dành cho các nhà phát triển hợp pháp – chi phí giảm đáng kể và tốc độ phản hồi tăng vọt.
Làm thế nào để làm được điều này?
The core lies in "contextual consistency."
Trước đây, do các nhà phát triển có thể thay đổi ngữ cảnh tùy ý, khiến mô hình nhận được mỗi yêu cầu đều là “mới hoàn toàn”. Điều này không chỉ tốn nhiều sức mạnh tính toán mà còn cực kỳ chậm.
Hiện tại, quy định mới buộc tất cả mọi người phải giữ nguyên hoàn toàn “Thinking Block” cùng các thông báo hệ thống và tin nhắn lịch sử xung quanh nó, không được sửa đổi.
Điều này về mặt kỹ thuật tạo ra một điều kiện hoàn hảo: bộ nhớ đệm từ khóa có thể đạt tỷ lệ hit cực kỳ cao!
Hiện tại, máy chủ API có thể dễ dàng lưu bộ nhớ đệm trực tiếp ngữ cảnh cuộc trò chuyện trước đó. Khi yêu cầu cuộc trò chuyện tiếp theo đến, hệ thống sẽ truy xuất dữ liệu trực tiếp từ bộ nhớ đệm và hoàn tất việc khớp ngay lập tức.
Kết quả là: thời gian phản hồi của API được rút ngắn đáng kể, độ trễ giảm mạnh, đồng thời chi phí gọi API của nhà phát triển cũng giảm đáng kể!
Chiêu thức “vô tình trồng cây” này có thể nói là đã hỗ trợ trực tiếp bằng tiền thật cho các nhà phát triển chân chính.
Tóm lại, quy định mới này chắc chắn là một mốc phân nước đối với toàn bộ ngành AI.
Câu chuyện về việc mô hình nhỏ đánh bại mô hình lớn có lẽ sẽ ít đi nhiều.
Sau khi thủy triều rút đi, ai đang khỏa thân bơi?
Tài liệu tham khảo:
https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F
Biên tập: Aeneas
Bài viết này đến từ tài khoản WeChat “Tân Trí Nguyên” (ID: AI_era), tác giả: ASI Khải Huyền
