GPT-6 Astra đạt điểm gần 100% trong bài kiểm tra ARC-AGI-3, gây sự chú ý. Mô hình này tạo ra các “mô hình thế giới ký hiệu” hiệu quả, trừu tượng hóa thế giới thực thành các ký hiệu logic và mã nhân quả, tự tạo hệ thống ký hiệu đại số DSL để ghi lại quy tắc môi trường trong các trò chơi đồ họa mới lạ, xây dựng “bộ cát ảo” để mô phỏng và suy luận trước khi hành động. Tuy nhiên, điểm số cao đi kèm chi phí tính toán đắt đỏ—360 đô la Mỹ mỗi câu hỏi, tổng chi phí cho toàn bộ bài kiểm tra lên tới 18.000 đô la Mỹ. Ông Greg Kamradt, Chủ tịch Quỹ ARC Prize, chỉ ra rằng điểm số cao phụ thuộc vào khung bên ngoài Harness, không phải là bước đột phá thực sự về AGI, mà chỉ chứng minh rằng AI đang trở nên thông minh hơn.Tác giả bài viết, nguồn: LeFeng.com

Mỗi câu hỏi tốn 360 USD, GPT-6 đã thực sự vượt qua AGI?
Mô hình mạnh nhất của OpenAI, GPT-6 Astra, cuối cùng đã ra mắt, mang đến những bước đột phá đáng kinh ngạc trong thao tác máy tính, nghiên cứu khoa học và phòng thủ an ninh. Trong số nhiều thành tích nổi bật, điều gây tranh luận nhiều nhất trong công chúng là kết quả của nó trong bài kiểm tra ARC-AGI-3, gần đạt 100%.

ARC-AGI-3 là gì? Đây là bảng xếp hạng đánh giá "chỉ số thông minh" của AI được công nhận trên toàn cầu trong giới công nghệ hiện nay, bạn có thể hiểu nó như một kỳ thi tuyển vào câu lạc bộ Mensa của lĩnh vực AI.
Bài kiểm tra này hoàn toàn gồm các câu hỏi về quy luật hình ảnh thay đổi liên tục, hoàn toàn không thể luyện tập trước; AI phải giống con người, khám phá môi trường, suy luận mục tiêu, và dựa vào phản ứng tức thời cùng khả năng suy luận để tìm ra quy luật. Đây là một cấp độ cao hơn trong các bài đánh giá, giúp kiểm tra xem AI thực sự chỉ là một công cụ hay sở hữu trí thông minh thật sự.
Trong khi đó, GPT-6 Astra đã vượt qua bài kiểm tra này, hãy nhớ rằng mô hình trước đó, GPT-5.6 Sol, chỉ đạt 38,3%, đây thực sự là một bước nhảy vọt lớn. Trí tuệ này thậm chí còn vượt trội hơn con người, ở 96% cấp độ, nó hiệu quả hơn con người trong thao tác, trung bình ít hơn 51,7% bước hành động so với con người.
Nếu một AI thực sự có khả năng xây dựng quy luật logic và giải quyết vấn đề trong một môi trường hoàn toàn mới lạ, chúng ta có thể tưởng tượng rằng, trong tương lai, nó có thể đưa ra lựa chọn đúng đắn trong các tình huống lái xe tự hành chưa từng thấy, hoặc nhanh chóng suy diễn ra cấu trúc phân tử của loại thuốc đặc hiệu khi một loại virus hoàn toàn mới bùng phát.
Để tìm hiểu tại sao GPT-6 Astra lại thông minh như vậy, ban tổ chức ARC Prize đã tự mình phân tích lại hồ sơ nền tảng của nó và phát hiện ra rằng khi chơi game, nó tạo ra các “mô hình thế giới ký hiệu” hiệu quả.

Mô hình ký hiệu thế giới là sản phẩm nâng cao của “mô hình thế giới”. Khi mô hình thế giới dự đoán tương lai bằng hình ảnh như một nghệ sĩ, thì mô hình ký hiệu thế giới tức thì lại giống một nhà toán học, trừu tượng hóa thế giới thực thành các ký hiệu logic và mã nhân quả.
Công nghệ này được công nhận là con đường bắt buộc để AI tiến tới khả năng suy luận nâng cao.
Symbol World Model là gì?
Trước đây, một trong những lý do chính khiến nhiều mô hình lớn không đạt điểm cao trong các bài kiểm tra bộ chuẩn ARC-AGI là do chúng quen với cách tiếp cận “thử và sai một cách bạo lực”. AI sẽ chia màn hình trò chơi thành các khối pixel, sau đó bấm ngẫu nhiên một chỗ, nếu không đúng thì đổi hướng khác, dựa vào may mắn để vượt qua.
Trong chế độ này, ngay cả khi có một số điểm số được phá vỡ, AI cũng không thực sự hiểu và nắm vững các quy tắc trò chơi.
Symbol World Model có thể kiểm soát toàn bộ tình hình chính vì nó hiểu đầy đủ các quy luật vật lý và mối quan hệ nhân quả xung quanh, sau đó đưa ra lựa chọn thông qua tính toán tinh vi.
Trong các bài kiểm tra thực tế, khi GPT-6 Astra bước vào một trò chơi đồ họa mới lạ, nó sẽ bắt đầu ghi chú chi tiết về môi trường quan sát được bằng một DSL tự chế, một hệ thống ký hiệu đại số độc quyền. Ví dụ, nó ghi lại chính xác các quy tắc ẩn tiềm ẩn trong trò chơi, chuỗi lệnh sắp được thực thi, thậm chí còn ánh xạ chính xác quỹ đạo chuyển động của từng pixel vào hệ tọa độ.
Cách ghi chép đại số này mang lại trạng thái thế giới duy nhất và xác định, so với các mô hình trước đây sử dụng tương tác bằng ngôn ngữ tự nhiên gây ra sự mơ hồ, cách biểu đạt ký hiệu này sẽ mang lại bước nhảy vọt chưa từng có về độ chính xác.
Sau đó, nó sẽ viết trước một logic mã Python trong đầu: “Nếu tôi nhấn A, biểu đồ sẽ rẽ trái 90 độ”.
Sau đó, nó sẽ tạo một “bộ mô phỏng ảo” trong não, mô phỏng các kế hoạch tiếp theo. Sau khi xác minh rằng logic khép kín và chính xác hoàn toàn, nó mới thực hiện bước đầu tiên trong trò chơi thực tế. Đó là lý do tại sao hiệu suất hoạt động của nó cao hơn nhiều so với con người.
Để khám phá giới hạn năng lực của GPT-6 Astra, nền tảng kiểm tra đỏ PRO‑LONG đã đưa nó vào môi trường cát săn, cho phép AI tự viết và chạy mã tùy chỉnh.
Kết quả, GPT-6 Astra bắt đầu “tùy chỉnh” công cụ cho từng trò chơi. Ví dụ, trong một trò chơi mê cung phức tạp với các vệ sĩ tuần tra, GPT-6 Astra tự viết một hệ thống điều hướng, sau đó thêm các quy tắc chiến đấu và mô phỏng lộ trình tuần tra của vệ sĩ, cuối cùng sử dụng chuỗi công cụ tự chế này để dự đoán và xác minh kết quả một cách hoàn hảo.
Vài năm trước, khả năng suy luận ký hiệu và tự tạo công cụ này hoàn toàn phụ thuộc vào các khung ngoại vi Harness bên ngoài. Các ngoại vi này giúp mô hình chuyển đổi hình ảnh, ghi lại trạng thái và xác minh kết quả, nhưng nhược điểm rất rõ ràng: việc truyền dữ liệu qua lại giữa mô hình và ngoại vi gây ra độ trễ cao; năng lực kỹ thuật của ngoại vi hoàn toàn tách biệt với quá trình huấn luyện trọng số của mô hình lớn; do phụ thuộc nặng nề vào môi trường tính toán trên đám mây và các script bên ngoài, các khả năng cấp cao này rất khó được triển khai trên các thiết bị biên đầu cuối.
Trong khi đó, GPT-6 Astra hiện đã tích hợp nhiều khả năng thuộc về Harness trực tiếp vào trọng số của mô hình. Nhà nghiên cứu hàng đầu luôn ủng hộ mô hình thế giới ký hiệu, Gary Marcus, không khỏi khen ngợi GPT-6 Astra là một chiến thắng lớn trên con đường này.
Trong hai năm gần đây, học thuật và ngành công nghiệp đã xuất hiện một lượng lớn thành tựu cốt lõi trong hướng này, từ Harvard, MIT đến Google DeepMind, tất cả đều đang đầu tư vào “mô hình thế giới ký hiệu”. Trước vô số ngã rẽ trên con đường hướng tới AGI, ngành công nghiệp đang đạt được một sự đồng thuận kỹ thuật cơ bản.
Điểm số cao như vậy, AGI đã chắc chắn rồi sao?
Người ra đề trực tiếp dội nước lạnh
Điều thú vị là khi toàn mạng đang sôi sục vì thành tích xếp hạng này, nhiều người đã chia sẻ câu nói của Chủ tịch OpenAI, Greg Brockman: “AGI đã đến”, thì ngay lúc đó, Chủ tịch Quỹ ARC Prize, Greg Kamradt, đã trực tiếp hạ nhiệt.
Anh ấy là nhân vật cốt lõi trong nhóm ra đề, người có quyền phát biểu nhiều nhất về cách thiết kế tiêu chuẩn và cách diễn giải điểm số. Từ góc độ đánh giá, anh ấy cho rằng điểm số tuy là thật, nhưng vẫn còn cách xa AGI một khoảng cách rất lớn.
Cho đến nay, anh ấy đã chứng kiến nhiều đội nhóm đạt hơn 90% trên ARC-AGI-3 bằng cách sử dụng Agent Harness, chẳng hạn như PRO-LONG với khả năng ghi nhớ siêu mạnh, Tycho chuyên về suy luận sâu sắc và Prime Agent có thể tự tiến hóa môi trường lập trình của mình.
Các sản phẩm đạt điểm cao này đều có công thức kỹ thuật chung, bao gồm năm thành phần chính: bộ nhớ không mất dữ liệu, phân tích lập trình, kiểm định giả thuyết rõ ràng, trạng thái bền vững và tính toán nội bộ chi phí thấp.
Trong đó, bộ nhớ không mất dữ liệu chịu trách nhiệm ghi nhớ, phân tích chương trình hóa chịu trách nhiệm logic, kiểm định giả thuyết rõ ràng chịu trách nhiệm suy diễn, trạng thái bền vững chịu trách nhiệm bối cảnh của các tương tác đa vòng, và tính toán nội bộ chi phí thấp chịu trách nhiệm cung cấp sức mạnh tính toán nội bộ giá rẻ, giúp AI có thể thử nghiệm sai sót một cách điên cuồng trong môi trường ảo trước khi đưa ra câu trả lời chính xác. Những yếu tố này cùng nhau tạo thành một Harness vô địch, bù đắp những điểm yếu của mô hình.
GPT-6 Astra đạt gần 100% điểm số, cũng sử dụng một bộ Harness cao cấp, nó tận dụng “nền tảng bộ điều hợp nhà cung cấp” được tùy chỉnh đặc biệt, sử dụng hội thoại liên tục và nén ngữ cảnh để hỗ trợ chuỗi logic của nó; mỗi lần chạy một ván trò chơi, chi phí tính toán đắt đỏ lên tới 360 đô la Mỹ. Nếu chạy hoàn tất toàn bộ bài kiểm tra, tổng chi phí tính toán sẽ lên tới con số đáng kinh ngạc 18.000 đô la Mỹ (tương đương khoảng 135.000 nhân dân tệ)!
Con người có thể giải một câu đố hình ảnh chỉ trong vài phút, tính theo công suất chuyển hóa 20W của não bộ, chi phí điện năng chưa đến nửa xu; ngay cả khi tính luôn khoản phụ cấp lương giờ thực tế trả cho người tham gia, mỗi lượt chỉ tốn 12,78 USD, trong khi AI phải tốn 360 USD. Thành tích đạt được bằng “sức mạnh tiền bạc” này liệu có thực sự trở thành AGI dễ tiếp cận với người bình thường?
Tất nhiên, GPT-6 Astra đã bắt đầu dần nội hóa khả năng của Harness; nếu tiếp tục phát triển, tiềm năng tính toán bên trong mô hình sẽ ngày càng mạnh mẽ hơn. Tuy nhiên, do quá trình suy luận của nó bắt đầu trở nên không minh bạch, các nhà phát triển không biết liệu AI thực sự đã hiểu hay chỉ tìm ra cách gian lận hiệu quả hơn.
Trở lại câu hỏi trên, GPT-6 Astra có phải là AGI không?
Đối với câu hỏi này, Greg Kamradt đã đưa ra một câu trả lời đầy triết lý ở cuối bài viết dài của mình. Con người vì sao có thể được coi là “trí thông minh phổ quát”? Bởi vì con người có thể thích nghi với bất kỳ thế giới nào chưa biết, ngay cả khi một em bé thời cổ đại được đưa đến hiện đại, em ấy vẫn có thể học cách đi tàu điện ngầm và dùng điện thoại di động. Trí thông minh này đã được duy trì suốt hàng ngàn năm, không ngừng thúc đẩy tiến bộ khoa học công nghệ. Nhưng cuộc kiểm tra mà giới công nghệ hiện nay phải chi tiền để vượt qua, chỉ là một bài thi “trò chơi ghép hình” dành riêng cho AI.
Đây chỉ là bằng chứng cho thấy AI đang trở nên thông minh hơn, nhưng hoàn toàn không phải là bằng chứng cho sự ra đời của AGI.
