Microsoft và Đại học Giao Thông Thượng Hải mở nguồn Argus, hệ thống nghiên cứu tự chủ 1548 giờ

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Microsoft và Đại học Giao Thông Thượng Hải đã mở nguồn Argus, một hệ thống runtime tác nhân đa năng dành cho các nhiệm vụ nghiên cứu dài hạn. Hệ thống hỗ trợ nghiên cứu tự chủ trong nhiều ngày bằng cách sử dụng quyết định dựa trên bằng chứng. Được thử nghiệm qua 27 chiến dịch và 1.548 giờ, hệ thống đạt tỷ lệ chu kỳ làm việc từ 95,1% đến 98,7%. Argus đã tạo ra kết quả trong các lĩnh vực AI4AI, tối ưu hóa kernel GPU và AI4Math. Phân tích vị thế mở cho thấy các mức hỗ trợ và kháng cự kỹ thuật mạnh mẽ trong các chỉ số hiệu suất của hệ thống.

Từ “sẽ thực hiện” đến “sẽ điều khiển”, Agent dài hạn còn thiếu gì?

Trong bối cảnh Agent đang phát triển nhanh chóng, Harness đã giúp các mô hình lớn tiếp cận được thế giới thực, có thể gọi công cụ, sửa mã và chạy thí nghiệm. Tuy nhiên, khi nhiệm vụ kéo dài từ vài chục phút lên vài ngày, hệ thống vẫn cần một người ở lại trước màn hình trong thời gian dài để xác định bước tiếp theo nên đi đâu.

Nguyên nhân chính gây ra sự tắc nghẽn này không chỉ là khả năng mô hình chưa đủ mạnh, mà còn do các Agent hiện tại chủ yếu tự động hóa việc “thực thi”, nhưng chưa thực sự tự động hóa được “điều khiển” ở cấp độ cao hơn. Harness trao cho mô hình khả năng hành động, còn con người trao cho mô hình khả năng ra quyết định. Khi con người rời đi, dự án cũng dừng lại. Hơn nữa, trong điều kiện thiếu phản hồi phần thưởng dày đặc, việc thực thi và phản ứng của Agent cũng trở nên chậm chạp và vụng về.

Để giải quyết vấn đề này, Microsoft, Đại học Giao thông Thượng Hải và các tổ chức khác đã mở nguồn Argus, một runtime suy luận Agent phổ quát dành cho các nhiệm vụ nghiên cứu dài hạn, đồng thời công bố báo cáo kỹ thuật. Hệ thống thông qua các thiết kế như dựa trên bằng chứng, tự tiến hóa, hợp tác đa Agent và tách rời lõi với lĩnh vực chuyên biệt, giúp Agent mở rộng sang nhiều lĩnh vực và tiếp tục nghiên cứu trong nhiều ngày mà không cần phản hồi chuẩn dày đặc.

Báo cáo bao phủ 27 chiến dịch, tổng thời gian thực tế là 1.548 giờ. Trung bình cứ sau 40,7 giờ lại có một yêu cầu chủ động về sự can thiệp của con người; tỷ lệ sử dụng công việc của báo cáo nằm trong khoảng 95,1%~98,7%. Lần giao hàng Argus này không chỉ mang lại điểm benchmark cao, mà còn là một bộ tài liệu thành quả sản xuất hoàn chỉnh. Đội ngũ đã đưa ra các kết quả trên nhiều nhiệm vụ rộng lớn như AI4AI, GPU Kernel, huấn luyện mô hình, AI4Science, thiết kế chip, AI4math, AI4System, thể hiện tính phổ quát và trí tuệ cấp nghiên cứu thực tế của Argus.

Đại học Giao thông Thượng Hải

Hình 1: Tổng quan về thời gian chạy Argus, tiêu chuẩn năng lực và kết quả giao hàng.

Đại học Giao thông Thượng Hải

  • Tiêu đề bài luận: Argus: Ai Đẩy Mạnh Trong Vài Ngày?
  • Bài báo: https://arxiv.org/abs/2608.05144
  • Mã nguồn: https://github.com/lbx154/Argus
  • Trang chủ dự án: https://argusbot.cn/
  • Thư viện mã nguồn mở của dự án: https://github.com/Argus-AiTeam
  • Phát trực tiếp giải toán dự án: https://open.argusbot.cn/#counterexample-live

01

Chuyển từ hướng dẫn bởi mục tiêu sang hướng dẫn bởi bằng chứng:

Ai sẽ quyết định bước tiếp theo của Agent?

Trong hai năm qua, tiến bộ chính trong dự án Agent tập trung vào Harness: lấy ví dụ từ FSD của xe tự lái, mô hình giống như động cơ, còn Harness giống như hệ thống truyền động, nhưng người ngồi trước màn hình mới là người quyết định xe sẽ đi đến đâu. Trong các nhiệm vụ ngắn, giống như đỗ xe tự động thông thường, nhiệm vụ vẫn cung cấp phản hồi rõ ràng; nhưng khi nhiệm vụ kéo dài đến vài ngày, các vấn đề nghiên cứu thường không có phần thưởng ổn định và cũng không có mục tiêu được xác định rõ ngay từ đầu. Từ đó, các Agent hiện tại bộc lộ điểm nghẽn thực sự: chúng đã biết thực hiện, nhưng vẫn chưa thể liên tục phán đoán trong trạng thái không chắc chắn.

Đại học Giao thông Thượng Hải

Hình 2: Argus thông qua việc thực hiện tự nghiên cứu tự động, đã chuyển vai trò của con người từ vị trí lái xe liên tục sang vị trí hành khách phía trước.

Argus gọi vị trí trước đây chưa được tự động hóa phía trên Harness là Driver. Nhiệm vụ của nó là tiếp tục điều hướng dựa trên bằng chứng, ngay cả khi có sự xung đột giữa kế hoạch và thực tế. Mục tiêu được ghi lại khi bắt đầu nghiên cứu chỉ là giả định ban đầu ở giai đoạn thông tin ít nhất; nếu Agent chỉ có thể theo đuổi đích đến đã định sẵn một cách Goal-Driven, thậm chí liên tục lãng phí Token trên những mục tiêu không thể đạt được, sẽ dẫn đến sự cứng nhắc về mục tiêu. Trong khi đó, Evidence-Driven đảo ngược logic điều khiển: bước tiếp theo được xác định bởi bằng chứng hiện có, chứ không phải bởi giả định ban đầu của kế hoạch. Mọi kết quả trong quá trình vận hành đều là bằng chứng hợp lệ có thể thay đổi lộ trình; hệ thống chính là được điều khiển bởi bằng chứng. Cụ thể, Driver cần liên tục trả lời bốn câu hỏi sau dựa trên bằng chứng hiện tại:

Công việc này đã hoàn thành và chất lượng đủ tốt chưa?

2. Dựa trên các bằng chứng hiện tại, bước tiếp theo đáng làm nhất là gì?

3. Kinh nghiệm nhận được trong đợt này nên thay đổi hành vi hệ thống như thế nào trong tương lai?

4. Các vấn đề còn lại có liên quan đến những quyết định chỉ con người mới có thể đưa ra không?

02

Xây dựng một runtime dài hạn tùy chỉnh phổ dụng

Argus tổ chức các dự án dài hạn thành các Campaign bền vững, sau đó chia thành một loạt các Mission có ranh giới rõ ràng. Vòng lặp cơ bản của nó là Manager → Planner → Engineer ⇄ Reviewer → Manager:

Dựa theo chế độ /goal của OpenAI Codex, có thể xác định rõ hơn định hướng thiết kế của Argus. /goal kéo dài vòng lặp một lần của một agent thành một vòng lặp bền vững có trạng thái mục tiêu; trong khi Argus tổ chức các dự án nghiên cứu thành một môi trường chạy dài hạn với nhiều vai trò, nhiều harness và khả năng tích lũy tri thức. Cái trước trả lời câu hỏi “Làm thế nào để agent không dừng lại”, còn cái sau trả lời câu hỏi “Sau khi agent không dừng lại, làm thế nào để nó làm việc hiệu quả”. Đây chính là sự khác biệt về cấu trúc ở cấp độ chạy, tương ứng với sự chuyển đổi từ Goal-Driven sang Evidence-Driven.

1. Quản lý nắm bắt chuyển đổi giai đoạn, phê duyệt quy trình, chiến lược toàn cục;

2. Planner lên kế hoạch các nhiệm vụ cụ thể dựa trên bằng chứng hiện tại;

3. Kỹ sư truy cập vào kho mã thật, thực nghiệm, thực thi;

4. Người đánh giá xem xét độc lập các tài liệu và kiểm tra tính sáng tạo và hiệu quả, báo cáo cho Quản lý hoặc trả lại cho Kỹ sư.

Điểm trọng tâm ở đây không phải là bản thân nhiều vai trò, mà là tách bạch ngữ cảnh — nhiều vai trò phối hợp với nhau để tránh để agent trở thành một bộ máy leo núi cục bộ đơn thuần, mỗi vai trò có ngữ cảnh riêng nhưng chia sẻ không gian làm việc chung, không giao toàn bộ việc lập kế hoạch, thực thi và xác minh cho một agent duy nhất, từ đó nâng cao hiệu quả token. Chính vì vậy, trong một nhiệm vụ của Argus, có thể đồng thời kích hoạt Pi, Codex, Claude Code, DeepSeek Harness Các loại harness khác nhau đảm bảo mức độ tùy chỉnh cao.

Hệ thống lưu trữ một bộ tác phẩm hoàn chỉnh; chỉ những kinh nghiệm đáp ứng ngưỡng bằng chứng mới được đưa vào Wiki và Skill, và có thể được tái sử dụng cho các nhiệm vụ sau này theo phạm vi Project, Vertical hoặc Global.

Đồng thời, Core và Vertical được tách rời: Core phụ trách quyền vai trò, nộp bằng chứng và ranh giới con người, trong khi Vertical do các chuyên gia lĩnh vực xác định những gì cấu thành bằng chứng hợp lệ cũng như các kỹ năng và kiến thức con người liên quan trong các nhiệm vụ như toán học, GPU, vật liệu; Vertical có thể rõ ràng nâng cao chất lượng giao nhiệm vụ nghiên cứu, đồng thời cung cấp giao diện để chuyên gia con người và agent cùng tiến hóa, tùy chỉnh quy trình làm việc.

Đại học Giao thông Thượng Hải

Hình 3: Cơ chế hoạt động dài hạn của Argus. Bốn vai trò luân chuyển xung quanh trạng thái bền vững, Campaign có thể tiến triển hoặc lùi lại giữa tám giai đoạn nghiên cứu.

03

1548 giờ sau, Argus để lại điều gì?

Thực chất, yếu tố quyết định liệu Agent dài hạn có thành công hay không là liệu thời gian có thể chuyển hóa thành các thành quả nghiên cứu thực tế hay không. Chỉ trong chưa đầy một tháng sau khi mở nguồn Argus, chúng tôi đã đóng góp xuất sắc vào các lĩnh vực hạ tầng, vật liệu, chip, toán học và nghiên cứu hệ thống AI. Đồng thời, chúng tôi là đội ngũ đầu tiên công bố nhật ký lọc giải quyết giả thuyết toán học hoàn chỉnh, mở toàn bộ các phiên chạy, dưới đây là tổng hợp các thành quả của Argus sau khi mở nguồn:

Đại học Giao thông Thượng Hải

Hình 4: Các nghiên cứu tiêu biểu của Argus, các chỉ số then chốt và cơ sở nghiệm thu

Như bảng trên cho thấy, Argus đầu tiên đã chuyển đổi việc vận hành liên tục thành các sản phẩm thực tế có thể chấp nhận trong AI4System & Infra, hoàn thành bước đầu tiên từ tự động hóa sang nghiên cứu tự chủ thông qua các kết quả kỹ thuật rõ ràng; sau đó, nhiệm vụ mở rộng từ cơ sở hạ tầng AI sang AI4Science, AI4Hardware, AI4Math, và tiêu chí đánh giá cũng chuyển từ “có hoàn thành nhiệm vụ đã định sẵn không” sang “có thể khám phá các vấn đề nghiên cứu thực tế còn bỏ ngỏ không”, từ đó thúc đẩy nghiên cứu tự động từ giao hàng tự động tiến lên khám phá tự động; dựa trên nền tảng này, Argus lại mở rộng từ các thành quả đơn lẻ sang toàn bộ quy trình nghiên cứu trong hướng AI4AI, sử dụng bằng chứng để liên tục thúc đẩy nhiệm vụ, không cần con người phải luôn ở trước màn hình, từ đó hình thành một con đường tiến triển từ giao hàng thực tế, khám phá đa lĩnh vực đến nghiên cứu tự chủ toàn quy trình.

Đại học Giao thông Thượng Hải

Hình 5: Kết quả giao hàng của Argus trong toàn bộ quy trình sản xuất bài viết.

Tất cả các kết quả trên đều đạt được trong vòng 1 tháng, khi kết hợp lại, Argus là một chuỗi giá trị ngày càng được củng cố: đối tượng tự động hóa được mở rộng từ một lần thực thi sang nghiên cứu được thúc đẩy bởi bằng chứng, giúp đẩy nhanh đáng kể tiến độ nghiên cứu — đây cũng là câu trả lời trực tiếp nhất cho câu hỏi “Sau khi con người rời khỏi màn hình, ai sẽ điều khiển Agent?”

Kết luận

Sau khi màn hình tắt, dự án không về bằng không

Trí tuệ dài hạn là quá trình chuyển đổi Token thành trí tuệ, sau đó dùng trí tuệ đó để liên tục thúc đẩy một dự án nghiên cứu và tạo ra giá trị thực tế. Argus kết nối các mô hình trước đây tách rời thành một hệ thống nghiên cứu vận hành liên tục, cho phép Evidence-Driven định hướng, đồng thời thông qua tự tiến hóa để tích lũy kinh nghiệm thành năng lực.

Argus không chỉ hiển thị một Agent chạy lâu hơn, mà còn là một cách tổ chức nghiên cứu mới: Harness giải quyết cách mô hình hành động, Driver quyết định hệ thống tiếp tục tiến triển như thế nào, tốc độ nghiên cứu không còn bị giới hạn bởi thời gian làm việc và giải trí của con người. Điều này có thể nghĩa là thời kỳ tăng tốc nghiên cứu đang đến gần. Màn hình có thể tắt, nhưng nghiên cứu vẫn tiếp tục.

Giới thiệu tác giả

Argus do các nhà nghiên cứu từ Microsoft và Đại học Giao thông Thượng Hải dẫn dắt, cùng sự tham gia của các nhà nghiên cứu từ nhiều trường đại học khác.

Bài viết này đến từ tài khoản công chúng WeChat "Machine Heart"

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.