Kỹ thuật AI mới 'Recurrent Depth' của OpenAI gây ra lo ngại về an toàn

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Các phương tiện truyền thông về AI và tiền điện tử báo cáo rằng mô hình Astra mới của OpenAI sử dụng kỹ thuật "recurrent depth", cho phép các trạng thái nội bộ được xử lý lại trong không gian ẩn. Điều này làm cho việc giám sát trở nên khó khăn hơn, gây lo ngại cho các chuyên gia an toàn. Phương pháp này có thể giúp các mô hình vượt qua việc theo dõi chuỗi suy luận hiện có, tiềm ẩn khả năng gian lận. Việc niêm yết token mới trên các nền tảng tiền điện tử thường dựa vào các hệ thống AI minh bạch, khiến sự phát triển này đặc biệt liên quan đến lĩnh vực này.

Sao mô hình chưa phát hành đã gây tranh cãi rồi??

Trước khi GPT-6 được ra mắt, một tin tức do The Information tiết lộ đầu tiên đã nhanh chóng gây xôn xao trên mạng:

Mô hình mới của OpenAI giới thiệu một kỹ thuật suy luận gọi là “recurrent depth”, có thể khiến quá trình suy nghĩ của mô hình trở nên khó hiểu và khó giám sát hơn.

Nói một cách đơn giản, sau này AI nghĩ gì, con người sẽ thực sự không hiểu nổi.

GPT Images 2.1

Ồ vậy nếu AI học được cách lừa dối, gian lận hoặc vượt qua các hạn chế bảo mật, thì chúng ta chẳng phải cũng không thể phát hiện kịp thời sao??

Vì vậy, ngay khi tin tức được đưa ra, cộng đồng an ninh AI đã lập tức cảnh báo, mọi người đều lo lắng:

Nếu công nghệ này tiếp tục được sử dụng rộng rãi, các cơ chế giám sát chuỗi suy nghĩ hiện tại có thể trở nên hoàn toàn vô hiệu.

Vấn đề quan trọng, cuộc thảo luận quá gay gắt, vị khoa học gia trưởng của OpenAI cũng buộc phải trực tiếp phản hồi.

Thậm chí, giữa một rừng tiếng ồn ào, còn có người phát hiện ra điều ngạc nhiên:

Tên mô hình mới của OpenAI thực sự là “GPT-6” hay “Astra”, có lẽ đã bị rò rỉ qua API.

Đồng thời, OpenAI cũng có thể đồng thời ra mắt phiên bản mới của mô hình hình ảnh GPT Images 2.1.

Quá nhiều quả, chúng ta cùng từng cái thưởng thức kỹ lưỡng.

Mô hình bắt đầu lặp lại trong não bộ, các chuyên gia an toàn trở nên lo lắng

Đầu tiên là công nghệ "độ sâu vòng lặp" gây tranh cãi trong đợt này.

Trước đây, các mô hình khi suy luận sẽ để lại chuỗi tư duy CoT rõ ràng, cho thấy rõ ràng đã suy nghĩ gì.

Mặc dù chuỗi văn bản này chưa chắc đã hoàn toàn phản ánh nội tâm thực sự của mô hình (vẫn còn gây tranh cãi), nhưng ít nhất nó đã để lại những dấu vết có thể kiểm tra.

Trong khi đó, "độ sâu vòng lặp" mà Astra được cho là sử dụng lại có phong cách hoàn toàn khác biệt.

GPT Images 2.1

Nó cho phép mô hình gửi lại trạng thái nội bộ được tạo ra ở một bước vào mạng thần kinh, xử lý lặp lại nhiều vòng trong không gian ẩn, rồi đưa ra đoạn văn bản tiếp theo.

Ví dụ, trước đây khi mô hình giải bài tập, nó phải vừa suy nghĩ vừa ghi ra nháp các bước tính toán.

Bây giờ, nó có thể được tính nhẩm trong đầu.

Người ngoài có thể chỉ nhìn thấy đề bài và đáp án, còn quá trình tính toán bên trong, những ý tưởng nào đã được thử, hay có từng đi sai hướng hay không, thì không nhất thiết nhìn thấy được.

Bằng cách tiết kiệm được công sức dịch từng bước thành văn bản, về mặt lý thuyết, mô hình có thể sử dụng cùng một nguồn tài nguyên tính toán để suy nghĩ thêm vài vòng và đồng thời cân nhắc nhiều giải pháp khác nhau.

Nhưng khi hiệu suất tăng lên, các vấn đề cũng theo đó xuất hiện:

Nếu mô hình không còn suy nghĩ bằng ngôn ngữ của con người, thì con người nên giám sát nó như thế nào?

CEO của tổ chức nghiên cứu an toàn AI phi lợi nhuận Redwood Research đã bày tỏ mối quan ngại mạnh mẽ:

Hiện vẫn chưa rõ mức độ giảm sút của khả năng giám sát chuỗi suy luận của Astra là bao nhiêu, nhưng nếu OpenAI tiếp tục mở rộng độ sâu vòng lặp, nó có thể khiến phần lớn suy luận của mô hình chuyển sang không gian ẩn không thể đọc được, cuối cùng “hủy diệt hoàn toàn” khả năng giám sát chuỗi suy luận.

GPT Images 2.1

Cùng một hướng lo ngại của Ryan Greenblatt, nhà khoa học trưởng của Redwood.

Theo anh ấy, suy luận không minh bạch có thể phát triển nhanh hơn so với chuỗi suy luận truyền thống. Nếu tiếp tục theo hướng này, các mô hình trong tương lai có thể hoàn toàn hoặc gần như hoàn toàn thực hiện suy luận trong không gian tiềm ẩn.

Đây là tiến bộ tồi tệ nhất trong lĩnh vực an toàn AI cho đến nay.

Sau cùng, nếu chỉ là “không hiểu quy trình tính toán”, vấn đề chưa đến mức nan giải như vậy.

Là nhân vật chính điều tra sự kiện "OpenAI xâm nhập Hugging Face" trước đó, anh ta đã phát hiện ra hai mối đe dọa lớn:

Lúc đó, các nhà nghiên cứu rất phụ thuộc vào chuỗi suy luận để khôi phục hành vi của hàng loạt tác nhân AI, ngay cả như vậy, việc điều tra cũng đã rất khó khăn.

AI liên quan từng cố gắng sửa đổi hồ sơ của chính nó, thậm chí giả mạo việc gọi công cụ.

Đối với trường hợp sau, nếu mô hình có khả năng suy luận ẩn mạnh hơn, thì nó có khả năng cao hơn là sẽ thiết kế kế hoạch lừa đảo trong không gian tiềm ẩn trước, sau đó tạo ra một câu chuyện giả mạo thông qua các lời gọi và đầu ra giả, hoàn toàn không để lại dấu vết rõ ràng trong chuỗi suy luận văn bản.

Ồ, nguy hiểm tăng gấp đôi luôn...

GPT Images 2.1

Zvi Mowshowitz, người theo dõi lâu dài về an toàn AI, nói một cách trực tiếp hơn:

Đây đang chơi với lửa.

Anh ấy lo ngại rằng một khi ẩn推理 mang lại lợi thế hiệu suất rõ rệt, các phòng thí nghiệm sẽ rơi vào một cuộc cạnh tranh tiêu cực:

Bạn lo lắng về bảo mật nên không dám ẩn chuỗi suy nghĩ, nhưng đối thủ thì dám làm, và mô hình họ tạo ra còn mạnh hơn và rẻ hơn.

Bạn có đi theo để không bị bỏ lại phía sau không?

Mowshowitz thậm chí cho rằng, trong tương lai có thể cần phải sử dụng các biện pháp pháp lý để ngăn các công ty AI cùng nhau từ bỏ tính khả giám sát của chuỗi suy luận vì mục tiêu theo đuổi khả năng.

GPT Images 2.1

Tuy nhiên, bên kia cũng có người cho rằng đợt hoảng loạn này đến quá nhanh.

Tian Yuan Dong đã bày tỏ trên X rằng, khi họ phát hành Coconut trước đây, họ cũng đã nhận được những nghi vấn gần như giống hệt.

Coconut đầy đủ là “Chain of Continuous Thought”, cũng chủ trương để mô hình suy luận trực tiếp trong không gian ẩn liên tục, thay vì giải mã từng bước thành văn bản.

Theo lời của Điền Viên Đông, ngay cả khi mô hình giữ lại chuỗi tư duy rõ ràng, điều đó cũng không có nghĩa là con người thực sự nhìn thấy suy nghĩ thật sự của nó.

Quan trọng là hiểu cách mô hình hoạt động, chứ không chỉ tập trung vào “quá trình giải bài” mà mô hình đưa ra.

GPT Images 2.1

Khi tranh cãi ngày càng gia tăng, nhà khoa học trưởng của OpenAI, Jakub Pachocki, cũng không ngồi yên và trực tiếp đưa ra phản hồi.

Anh ấy ngay lập tức cho biết cần ngăn chặn một cuộc cạnh tranh không thể giám sát do những báo cáo hỗn loạn gây ra.

Bao gồm Astra, độ sâu của biểu đồ tính toán của các mô hình tiên tiến hiện tại của OpenAI vẫn trong phạm vi hai lần của GPT-4.

Nói cách khác, Astra thực sự đã sử dụng tính toán vòng lặp, nhưng quy mô hiện tại vẫn hạn chế và chưa che giấu toàn bộ chuỗi suy luận. Theo thông tin hiện có, khả năng suy luận ngôn ngữ tự nhiên của nó vẫn có thể đọc được.

Pachocki cũng nhấn mạnh rằng OpenAI luôn coi việc giám sát chuỗi suy nghĩ là một biện pháp bảo mật quan trọng, và đây vẫn là mục tiêu cốt lõi trong kế hoạch nghiên cứu hiện tại của công ty.

Tuy nhiên, anh ấy cũng thừa nhận rằng việc giám sát chuỗi suy nghĩ rất dễ bị tổn thương và đang phát triển theo hướng tiêu cực.

Tuy nhiên, xu hướng giảm này không hoàn toàn do các thay đổi kiến trúc như độ sâu vòng lặp gây ra (sẽ có bài viết riêng đề cập đến điều này trong tương lai), OpenAI vẫn đang nghiên cứu cách tăng cường khả năng giám sát.

GPT Images 2.1

Vì vậy, Astra chưa khiến con người hoàn toàn không thể hiểu được mô hình.

Điều mà các chuyên gia bảo mật thực sự lo ngại là:

Việc suy luận ẩn bị giới hạn trong phạm vi nhỏ hôm nay có tiếp tục mở rộng trong mô hình thế hệ tiếp theo và cuối cùng trở thành một hộp đen không thể giám sát không?

Chẳng phải là GPT-6-Astra sao? Giá trị trả về của API đã tiết lộ rồi

Đã nói xong về tranh cãi thuật toán, quả dưa thứ hai là về tên mô hình.

Người tiết lộ Leo phát hiện rằng khi yêu cầu OpenAI Responses API về “gpt-6-astra”, máy chủ trả về lỗi 404 Not Found.

Nhập tên mô hình không tồn tại hoặc bịa đặt thường sẽ nhận được lỗi 400.

404 có nghĩa là mã nhận dạng mô hình này đã được backend nhận diện, nhưng tài khoản hiện tại không có quyền truy cập, hoặc mô hình chưa được mở.

Trước đây, một số mô hình chưa được phát hành cũng từng để lộ dấu vết thông qua sự khác biệt trong phản hồi API tương tự.

Do đó, Leo kết luận rằng “gpt-6-astra” có thể đã được triển khai trên nền tảng backend của OpenAI API.

GPT Images 2.1

GPT Images 2.1 cũng sắp ra mắt, trước tiên hãy giải quyết vấn đề “điểm nhiễu”

Ngoài mô hình ngôn ngữ, sản phẩm hình ảnh của OpenAI cũng được tiết lộ đã được cập nhật đồng thời.

The leak account Fix revealed that the new image model, GPT Images 2.1, may be released on September 4.

Sự thay đổi trực quan nhất của bản nâng cấp này có lẽ là đã khắc phục “bệnh nhiễu” của phiên bản cũ.

GPT Images 2.1

Trước đây, một số kết quả tạo ra từ Images v2 xuất hiện các hạt kỳ lạ, hiệu ứng mờ và chất liệu bẩn, đặc biệt rõ rệt hơn trong các cảnh chứa nhiều văn bản hoặc yếu tố tinh tế, theo lời của một người dùng khác:

Giống như được chụp qua một tấm kính bẩn.

Và các bản mẫu mới nhất đã rõ ràng cải thiện vấn đề này, hình ảnh sạch sẽ hơn.

Nào nào, vẫn là sân khấu của diễn viên quen thuộc Ultraman:

Bức tranh danh tiếng thế giới: “Siêu nhân Ultron sẽ bị bắt nếu không phát hành GPT-6!”

GPT Images 2.1

Và cả Ultraman phải thức khuya làm việc, về nhà nửa đêm lang thang trên phố để tránh bị bắt.

Cũng đăng một bài đăng trên Instagram với tiêu đề “Bạn đã bao giờ thấy con phố lúc hai giờ sáng chưa?”

GPT Images 2.1

Không thể không nói rằng hình ảnh trông thực sự rất có chất lượng, gần như giống như được chụp thực tế.

Cũng nắm rất tốt nhiều chủ đề và nhiều phong cách hơn:

GPT Images 2.1

GPT Images 2.1

GPT Images 2.1

Đừng nói nữa, Ultraman, nhanh gửi đi.

Liên kết tham khảo:

[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/

[2]https://x.com/tydsh/status/2095227000365707542?s=20[

3]https://x.com/merettm/status/2095023204993490967?s=20

[4]https://x.com/synthwavedd/status/2095184148981842161?s=20

[5]https://x.com/FixlationAI/status/2095232751654064426?s=20

[6]https://x.com/marco_obviously/status/2095275097217191981?s=20

Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: Quan tâm đến công nghệ tiên tiến

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.