GitHub vừa đưa ra một lập luận thuyết phục rằng trợ lý mã hóa AI tốt nhất không phải là một mô hình đơn lẻ, mà là một cảnh sát giao thông biết nên gọi mô hình nào và khi nào.
Công ty đã công bố Dự án HydraFusion vào ngày 4 tháng 9 năm 2026 như một bản xem trước nghiên cứu trong GitHub Copilot. Hệ thống là một lớp điều phối đa mô hình, tự động lựa chọn các mô hình thực thi AI khác nhau để tối ưu hóa chất lượng, chi phí và tốc độ.
HydraFusion hoạt động như thế nào
Về cốt lõi, HydraFusion hoạt động theo ba mô hình thực thi: Single, Cascade và Critique. Mô hình Single chuyển nhiệm vụ đến một mô hình duy nhất. Mô hình Cascade nối tiếp nhiều mô hình với nhau, tăng độ phức tạp khi cần thiết. Mô hình Critique thêm một bước đánh giá độc lập, trong đó một mô hình khác đánh giá đầu ra của mô hình trước khi triển khai.
Điều này xây dựng trên tính năng chọn mô hình tự động trước đây của GitHub, cho phép Copilot chọn mô hình cho người dùng. Sự khác biệt là Auto đưa ra các lựa chọn tĩnh. HydraFusion là động, điều chỉnh cách tiếp cận của nó giữa chừng nếu tình huống yêu cầu.
GitHub đã đưa ra bốn nguyên tắc thiết kế điều hành hệ thống: kế toán đầy đủ chi phí (theo dõi chi phí thực sự của mỗi quyết định định tuyến), thực thi có giới hạn (ngăn chặn việc sử dụng tài nguyên tính toán quá mức), các bước xem xét tách biệt (giữ riêng biệt việc phê bình với quá trình tạo ra), và ứng dụng thay đổi an toàn (đảm bảo các chỉnh sửa mã không gây ra sự suy giảm).
Các con số tham chiếu
GitHub đã thử nghiệm HydraFusion trên Claude Opus 5 qua ba bộ kiểm tra: TerminalBench 2.1, DeepSWE và CheckpointBench.
Trên TerminalBench 2.1, HydraFusion vượt trội hơn Opus 5 với +4.9 điểm chất lượng trong khi chi phí giảm khoảng 67%. Trên DeepSWE, HydraFusion đạt thấp hơn Opus 5 1.5 điểm, nhưng giảm 36% chi phí. Trên CheckpointBench, khoảng cách chỉ là 0.1 điểm sau Opus 5, với chi phí giảm 65%.
Cần lưu ý: đây là kết quả kiểm tra do GitHub tự thực hiện trên hệ thống của họ. Việc xác minh độc lập từ các bên thứ ba sẽ củng cố đáng kể các tuyên bố này. Nhưng các bộ kiểm tra chính—TerminalBench 2.1, DeepSWE và CheckpointBench—are các khung đánh giá được công nhận trong lĩnh vực AI lập trình.
Sự đồng thuận ngày càng tăng trong ngành
GitHub không hoạt động trong một môi trường cô lập. OpenRouter đã phát triển các bộ định tuyến Auto và Pareto, cũng nhằm cân bằng chất lượng và chi phí trên nhiều nhà cung cấp mô hình. Nvidia đã công bố các bản thiết kế LLM Router như một phần trong bộ công cụ AI doanh nghiệp của họ.
Các thông báo chính thức của GitHub không tuyên bố bất kỳ mối quan hệ đối tác hoặc sự ủng hộ trực tiếp nào từ Nvidia hoặc OpenRouter liên quan đến HydraFusion.
Điều này có nghĩa gì đối với các nhà phát triển và thị trường mã hóa AI
HydraFusion hiện đang ở giai đoạn bản xem trước nghiên cứu, chỉ dành cho một nhóm người dùng hạn chế để cung cấp phản hồi trước khi triển khai rộng rãi hơn. GitHub đang chủ động thu thập ý kiến từ các nhà phát triển để cải thiện cách hệ thống xử lý các quy trình làm việc lập trình thực tế.
Trong bối cảnh cạnh tranh, lợi thế 4,9 điểm trên TerminalBench 2.1, đạt được với chi phí chỉ bằng một phần nhỏ, là kết quả khiến các đội ngũ mua sắm phải xem xét lại lựa chọn nhà cung cấp của họ. Các đối thủ chỉ sử dụng một mô hình đang chịu áp lực phải either đạt được hiệu suất tương đương hoặc chứng minh được lợi thế về chất lượng đủ lớn để bù đắp cho phí.
