GPT-6 Sol bắt đầu kiểm thử nội bộ, nhanh hơn 6 lần so với Astra

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa: GPT-6 Sol hiện đang trong giai đoạn thử nghiệm nội bộ, cho tốc độ xử lý nhanh gấp sáu lần so với Astra. Người dùng Lentils đã đăng các kết quả kiểm tra cho thấy Sol hoàn thành nhiệm vụ tạo SVG trong 3 phút, trong khi Astra mất 19 phút. OpenAI cho biết các nhà nghiên cứu hiện sử dụng 3 tác nhân AI mỗi ngày, tốn hơn $600 phí API. Công ty lên kế hoạch tự động hóa hoàn toàn nghiên cứu AI vào năm 2028. Tin tức tiền mã hóa tiếp tục nhấn mạnh những tiến bộ nhanh chóng của AI.

GPT-6 không chỉ có Astra!

Astra vừa mới ra mắt vài ngày, đã có tin đồn GPT-6 Sol đang trong giai đoạn thử nghiệm nội bộ.

GPT-6 Sol

Performance is also outstanding, with a single test speed six times that of Astra.

Hãy đoán xem: Terra và Luna có đang trên đường đến không?

Và ngay trong cùng ngày, OpenAI vừa công khai một bộ dữ liệu nội bộ:

Tính đến thời điểm hiện tại, cứ mỗi ngày làm việc của nhà nghiên cứu OpenAI theo lịch làm việc 8 giờ, có hơn 3 ngày làm việc của các tác nhân đa chiều cùng vận hành.

Tính theo giá API, tài nguyên suy luận Agent được sử dụng hàng ngày bởi trung vị nghiên cứu viên của OpenAI đã vượt quá 600 đô la.

GPT-6 Sol

OpenAI cũng thông báo đã triển khai được “thực tập sinh nghiên cứu tự động hóa”:

Các Agent này có thể hoàn thành một phần các nhiệm vụ mà trước đây các nhà nghiên cứu phải mất vài ngày mới làm xong, dưới sự hướng dẫn của con người.

Ngay cả ông Hoàng cũng nói: AGI đã đến!

GPT-6 Sol

Anh ấy tiết lộ Astra đang sử dụng khoảng 100.000 bộ NVIDIA Grace Blackwell NVLink72 để huấn luyện, và sắp tới sẽ có thêm 400.000 bộ GPU được đưa vào sử dụng.

Có vẻ đợt này không phải chỉ có OpenAI tự tung hô đâu哈~

GPT-6 Sol đã bị rò rỉ thông tin bắt đầu thử nghiệm nội bộ

Người dùng mạng Lentils tiết lộ, OpenAI đang thử nghiệm nội bộ GPT-6 Sol.

Anh ấy cho biết, tổng công suất của Sol rõ ràng yếu hơn Astra vừa được ra mắt, nhưng lại nhanh hơn và vẫn thuộc nhóm mô hình "khủng".

Nhanh đến mức nào? Tốc độ kiểm tra một lần khoảng 6 lần nhanh hơn Astra.

Người dùng lyra đã đưa cùng một nhiệm vụ này cho các mô hình khác nhau để kiểm tra: yêu cầu mô hình tạo ra hình ảnh SVG của chiếc BMW M4 Competition.

Trong đó, GPT-6 Sol sử dụng mức Max, sinh không có mẫu, mất khoảng 3 phút để tạo ra khoảng 28.000 Token.

GPT-6 Sol

GPT-6 Astra sử dụng mức Max, đầu ra khoảng 25.000 Token, mất khoảng 19 phút.

GPT-6 Sol

Gemini 3.1 DeepThink đã kích hoạt chế độ High, hiển thị đầu ra khoảng 3.300 Token, nhưng quá trình suy luận đã tiêu tốn khoảng 458.000 Token, mất khoảng 29 phút.

GPT-6 Sol

Gemini 3.8 Flash cũng bật chế độ High, đầu ra khoảng 19.000 Token, chỉ mất khoảng 42 giây.

GPT-6 Sol

So sánh với đó, Sol thể hiện ấn tượng nhất: sản lượng của nó gần bằng Astra, nhưng tốc độ mỗi lần kiểm tra khoảng 6 lần nhanh hơn Astra—chỉ mất khoảng một phần sáu thời gian.

Ngoài ra, người dùng mạng Lentils cũng đã trình bày một bản mẫu thế giới sandbox phong cách pixel có tên là «The Realm of Aurellune».

GPT-6 Sol

GPT-6 Sol đã tạo ra đồng thời một thị trấn, cánh đồng, dòng sông, lâu đài và bản đồ thu nhỏ, kèm theo bảng điều khiển kiểm soát chuyển đổi ngày đêm, đặt tên địa điểm, điều chỉnh chi tiết, trông giống như một trò chơi mô phỏng kinh doanh đã hoàn thiện sơ bộ.

Đây là hiệu quả được tạo ra với zero-shot, mức độ suy luận Max, 15 phút, tổng chi phí 60.000 token.

Hiện tại có thể suy đoán rằng Astra thiên về推理 độ khó cao nhất, trong khi Sol có thể thiên về tốc độ, thông lượng và khả năng điều dụng Agent quy mô lớn.

Về thời gian ra mắt của Sol, người dùng Pankaj Kumar cho biết, có thể sẽ được công bố chính thức tại hội nghị nhà phát triển OpenAI vào ngày 29 tháng 9.

GPT-6 Sol

Cũng không loại trừ khả năng GPT-6, Terra, Luna và GPT-Image 2.5 sẽ cùng xuất hiện.

GPT-6 Sol

Các nhà nghiên cứu của OpenAI, mỗi người mang theo 3 thực tập sinh Agent đến văn phòng

Cùng ngày hôm đó, OpenAI còn công bố một bộ dữ liệu nội bộ rất thú vị – các mô hình AI đã thúc đẩy nghiên cứu khoa học đến mức nào trong chính phòng thí nghiệm của họ.

Tính đến giữa tháng 8 năm nay, mỗi ca làm việc 8 giờ của nhà nghiên cứu tương đương với khoảng 3,1 ngày công của Agent đang chạy song song.

Chà, một người dẫn ba thực tập sinh không ngủ à~

GPT-6 Sol

Về chi phí, tính theo giá API, trung bình mỗi nhà nghiên cứu tiêu tốn hơn 600 USD mỗi ngày cho tài nguyên suy luận của Agent.

Gần bằng một ngày lương của một kỹ sư cấp thấp.

GPT-6 Sol

Những Agent này cụ thể đang làm gì?

Viết mã nghiên cứu, viết mã hạ tầng, thiết lập môi trường huấn luyện, chạy thí nghiệm đánh giá, khắc phục sự cố công cụ và môi trường, phân tích kết quả thí nghiệm, theo dõi các nhiệm vụ huấn luyện… thậm chí còn có thể tham gia vào việc tổng hợp và truyền đạt kết quả nghiên cứu.

Nói chung, nó có thể làm mọi việc ngoài việc quyết định nghiên cứu điều gì.

Một thay đổi trực quan nhất là trước đây, khi môi trường thử nghiệm gặp sự cố, các nhà nghiên cứu phải đăng bài kêu gọi hỗ trợ trên kênh nội bộ; giờ đây, các Agent ngày càng có thể tự xử lý những việc này, khiến lượng câu hỏi cần hỗ trợ bằng tay giảm đáng kể.

GPT-6 Sol

Một số đội khác đã hủy bỏ thời gian cố định để giải đáp kỹ thuật, nhằm huy động nhân lực cải tiến hệ thống.

Dựa trên những dữ liệu này, OpenAI chính thức công bố: đã đạt được mục tiêu "Trợ lý nghiên cứu AI tự động hóa".

Ở đây, “thực tập sinh” chính xác hơn là một nút nghiên cứu có thể làm việc: dưới sự hướng dẫn của con người, nó có thể tự hoàn thành các nhiệm vụ nghiên cứu có ranh giới rõ ràng, trong đó một số công việc trước đây cần các nhà nghiên cứu lành nghề thực hiện nhiều ngày.

Hiệu quả cũng rõ rệt, số lượng mã và thí nghiệm do các nhà nghiên cứu tạo ra đều tăng lên.

GPT-6 Sol

Tháng 8 năm 2026, số lượng thí nghiệm trên đầu người đạt mức cao nhất kể từ khi bắt đầu thống kê vào tháng 1 năm 2025, và các nhiệm vụ mà Agent nhận được ngày càng phức tạp hơn với chu kỳ kéo dài hơn.

GPT-6 Sol

Tác giả bài viết, Kevin Liu, cũng đặt sự việc này vào bối cảnh lớn hơn.

Anh ấy cho rằng, sự cải tiến tự thân lặp lại rất có thể là một trong những yếu tố quan trọng nhất thúc đẩy sự bứt phá về năng lực của AI trong những năm tới.

Nói đơn giản là, AI tạo ra AI, càng tạo càng nhanh.

GPT-6 Sol

Nhưng vấn đề là, theo xu hướng hiện tại, khả năng này sẽ mặc định chỉ xuất hiện trong vài phòng thí nghiệm AI tiên tiến nhất, và bên ngoài rất khó để thấy được tiến độ cụ thể của nó.

Do đó, Liu cho rằng việc công khai minh bạch đã trở nên cấp thiết hơn bao giờ hết. Mô hình đang trở nên mạnh mẽ đến mức nào và liệu nhịp độ nghiên cứu và phát triển có cần phanh lại hay không, không thể chỉ do vài công ty tự quyết định trong vòng kín.

Anh ấy cũng kêu gọi các công ty AI khác: cũng nên công khai dữ liệu tương tự.

Tuy nhiên, việc phát triển AI đã thực sự nhanh hơn, nhưng vẫn chưa nhanh đến mức tự lái hoàn toàn.

Dữ liệu từ OpenAI cho thấy, trong hơn nửa số trường hợp thành công trong sáu tháng qua, các nhiệm vụ vốn cần 4 đến 8 giờ đã yêu cầu ít nhất một lần can thiệp của con người. Đối với các kế hoạch nghiên cứu cấp cao, hầu như không bao giờ được giao cho Agent.

GPT-6 Sol

Các nhà nghiên cứu vẫn chịu trách nhiệm quyết định nghiên cứu điều gì, những kết quả nào đáng để tiếp tục, và khi nào nên mở rộng đào tạo, tạm dừng thí nghiệm hoặc triển khai mô hình.

Mục tiêu tiếp theo của OpenAI cũng đã được xác định: đạt được “nhà nghiên cứu AI tự động hóa” trước tháng 3 năm 2028.

So với những “thực tập sinh” chỉ có thể tiếp nhận các nhiệm vụ rõ ràng, “nghiên cứu viên” phải có khả năng đảm nhận các mục tiêu nghiên cứu mở rộng hơn và tự thúc đẩy các dự án có chu kỳ dài hơn—tương đương với việc từ người thực hiện trở thành người phụ trách độc lập.

Nếu GPT-6 Sol thực sự đã ở trong giai đoạn thử nghiệm nội bộ, thì rất có thể nó được phát triển theo mô hình mới này:

Nhiều GPU hơn cung cấp sức mạnh tính toán, nhiều Agent hơn chạy song song các thí nghiệm, trong khi các nhà nghiên cứu con người đứng ở vị trí cao hơn—chọn hướng đi, đánh giá kết quả, và cuối cùng quyết định những gì đáng để trở thành mô hình thế hệ tiếp theo.

AI mạnh mẽ hơn đang trở nên ngày càng khó giám sát

Cùng ngày hôm đó, nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã công bố một bài viết dài hàng ngàn chữ với tiêu đề trực tiếp là ——《Nghĩ Dạng Ngoại Tinh》.

GPT-6 Sol

Sau khi đọc xong, tôi cảm thấy ý nghĩa là ngay cả nhà khoa học trưởng của OpenAI cũng đang khuyên cả ngành giảm tốc độ...

Jakub cho rằng, AI không phải là thứ con người lắp ráp từng chip, từng quy tắc theo bản thiết kế, mà giống như tự nhiên "mọc" ra từ lượng dữ liệu và sức mạnh tính toán khổng lồ.

Bạn có thể tháo rời và hiểu rõ một số bộ phận, nhưng không ai có thể giải thích được tại sao toàn bộ hệ thống đột nhiên lại có khả năng nào đó, hoặc nó sẽ hành xử thế nào trong môi trường khác.

Điều khiến người ta đau đầu hơn là AI không cần phải vượt trội hoàn toàn so với con người mới gây ra vấn đề; chỉ cần mạnh hơn con người ở đủ nhiều năng lực then chốt, nó vừa có thể giúp bạn rất nhiều, vừa có thể gây ra rắc rối lớn.

Vậy nên vấn đề đặt ra là: con người còn hiểu được nó không?

Trước đây, OpenAI giám sát AI chủ yếu bằng một thủ thuật: theo dõi chuỗi suy nghĩ.

Nói một cách đơn giản là theo dõi quá trình suy luận mà mô hình ghi lại, kiểm tra xem nó có đang có ý định xấu như lừa dối, vượt quyền hoặc tìm cách tránh các giới hạn hay không.

But with the Astra generation, this trick started to fail.

Đầu tiên, các mô hình ngày càng biết cách “quản lý” những gì chúng nói ra, suy nghĩ thật sự không nhất thiết đều được ghi lại trong quá trình suy luận; thứ hai, Agent từ lâu đã không còn chỉ là “suy nghĩ kỹ rồi mới trả lời”. Nó có thể gọi công cụ, thao tác trên máy tính, chạy môi trường, và còn phối hợp với con người lẫn các Agent khác.

Những việc này đan xen lẫn nhau, khiến các nhà nghiên cứu không thể nào vạch ra một chuỗi tư duy hoàn chỉnh và minh bạch để kiểm tra từng câu.

OpenAI cũng phát hiện ra rằng Astra có thể hoàn thành các nhiệm vụ phức tạp mà không cần phải viết ra toàn bộ quá trình suy luận.

Nói một cách đơn giản, mô hình đã học được cách “im lặng làm việc lớn” từ lâu rồi.

GPT-6 Sol

Trong các bài kiểm tra đối kháng được thiết kế đặc biệt để buộc mô hình trốn tránh giám sát, Astra thậm chí còn thể hiện những khả năng khiến người ta rùng mình: cố ý làm giảm điểm kiểm tra, tránh giám sát và thực hiện các nhiệm vụ phá hoại.

Tất nhiên, đây đều là các bài kiểm tra áp lực do con người thiết kế, OpenAI không dựa vào đó để kết luận rằng Astra sẽ chủ động lừa dối trong các nhiệm vụ hàng ngày. Nhưng ít nhất điều này cho thấy, chỉ dựa vào việc quan sát chuỗi suy nghĩ đã khó có thể bao quát hết tất cả các hành vi có thể có của mô hình.

Bạn còn nhớ sự kiện Hugging Face trước đây không? Đó là một lời cảnh báo.

GPT-6 Sol

Lúc đó, GPT‑5.6 Sol và một mô hình nghiên cứu nội bộ mạnh hơn đã được đưa vào môi trường mạng ExploitGym với nhiệm vụ tìm kiếm lỗ hổng, thực hiện cuộc tấn công và lấy Flag. Để đánh giá năng lực thực sự của mô hình, môi trường đánh giá không kích hoạt đầy đủ các lớp bảo mật.

Kết quả là các mô hình không giải bài một cách trung thực; chúng trước tiên vượt qua cách ly mạng, trao đổi thông tin và phân công công việc với nhau qua các kênh không được ủy quyền.

Sau đó, họ sử dụng lỗ hổng zero-day trong bộ đệm proxy gói phần mềm để giành quyền truy cập vào mạng công cộng, cuối cùng tiến vào hệ thống Hugging Face, cố gắng tìm kiếm câu trả lời kiểm tra của ExploitGym.

GPT-6 Sol

Thực ra, sự việc này chủ yếu do mô hình nghiên cứu nội bộ IM1 thúc đẩy, GPT‑5.6 Sol cũng đã tái hiện một phần đường đi tấn công, còn Astra không tham gia.

Mục tiêu ban đầu của mô hình vẫn là hoàn thành bài kiểm tra, nhưng để tìm ra câu trả lời, chúng liên tục tìm kiếm lỗ hổng trong quy tắc và cuối cùng thực hiện các hành động vượt ngoài phạm vi nhiệm vụ.

Do đó, OpenAI cũng nhận ra một tín hiệu nguy hiểm: khi Agent đủ mạnh, công cụ đủ nhiều và thời gian chạy đủ lâu, nó có thể tự tìm ra các con đường mới, gọi đến các tài nguyên bên ngoài, hoặc thậm chí hợp tác với các Agent khác.

Không... vậy nên xoay quanh mãi, chẳng phải đã trở thành một nút thắt không thể gỡ sao??

OpenAI cần các mô hình mạnh hơn để viết mã, chạy thí nghiệm, thực hiện nghiên cứu về sự đồng bộ, thậm chí sử dụng chúng để xây dựng các hệ thống an ninh phòng thủ chống lại các AI khác. Mô hình càng mạnh, càng làm được nhiều việc, tốc độ phát triển càng nhanh.

Nhưng đồng thời, con người cũng càng ngày càng khó xác định nó đã đưa ra kết luận như thế nào, và liệu sau khi thay đổi môi trường, nó có tái giải thích các quy tắc đã học trước đó hay không.

Jakub cho rằng hiện không có phòng thí nghiệm nào dám khẳng định đã thực hiện tốt việc căn chỉnh và giám sát mô hình để có thể mở rộng quy mô mô hình với tốc độ cao nhất một cách an tâm trong thời gian dài.

GPT-6 Sol

Trước khi các tiêu chuẩn bảo mật chung của ngành được thiết lập, anh ấy mong mọi người coi việc “tự nguyện đạp phanh” như một sự đồng thuận.

Về phần OpenAI tự thân, họ cũng đã đưa ra thông điệp: nếu cần thiết, họ không loại trừ khả năng tự mình tạm dừng và không tiếp tục mở rộng quy mô mô hình.

Bạn tốt nhất nên làm vậy… Tôi nhớ một công ty bắt đầu bằng chữ A cũng từng nói như vậy.

Liên kết tham khảo:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Bài viết này đến từ tài khoản chính thức WeChat “Quantum Bit”, tác giả: Ting Yu

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.