GitHub baru sahaja membuat kes yang meyakinkan bahawa pembantu pengkodean AI terbaik bukanlah satu model tunggal. Ia adalah seorang pengawas lalu lintas yang tahu model mana yang perlu dipanggil dan bila.
Syarikat mengumumkan Projek HydraFusion pada 4 September 2026 sebagai pra-pandangan penyelidikan di dalam GitHub Copilot. Sistem ini adalah lapisan orkestrasi pelbagai model yang secara dinamik memilih daripada pelbagai corak eksekusi AI untuk mengoptimumkan kualiti, kos, dan kelajuan.
Bagaimana HydraFusion berfungsi sebenarnya
Pada intinya, HydraFusion beroperasi melalui tiga corak pelaksanaan: Single, Cascade, dan Critique. Corak Single menghantar tugas kepada satu model. Corak Cascade menghubungkan beberapa model secara berurutan, meningkatkan kompleksiti sebagaimana diperlukan. Corak Critique menambahkan langkah ulasan terpisah di mana satu model lain menilai output model lain sebelum menghantarnya.
Ini membangun ciri pemilihan model automatik sebelumnya GitHub, yang membenarkan Copilot memilih model untuk pengguna. Perbezaannya ialah Auto membuat pilihan statik. HydraFusion adalah dinamik, menyesuaikan pendekatannya semasa tugas jika situasi memerlukannya.
GitHub menetapkan empat prinsip reka bentuk yang mengendalikan sistem ini: perakaunan kos penuh (mengesan kos sebenar setiap keputusan penghalaan), pelaksanaan terbatas (mencegah pengkomputeran yang tidak terkawal), langkah ulasan terpisah (mengekalkan kritikan berasingan daripada penghasilan), dan aplikasi perubahan selamat (memastikan modifikasi kod tidak memperkenalkan regresi).
Nombor tolok
GitHub menguji HydraFusion terhadap Claude Opus 5 melalui tiga ujian: TerminalBench 2.1, DeepSWE, dan CheckpointBench.
Di TerminalBench 2.1, HydraFusion mengungguli Opus 5 dengan +4.9 poin kualiti sambil mengekalkan kos yang dianggarkan 67% lebih rendah. Di DeepSWE, HydraFusion mencatat 1.5 poin di bawah Opus 5, tetapi dengan pengurangan kos 36%. Di CheckpointBench, jurangnya hanya 0.1 poin di belakang Opus 5, dengan kos dipotong sebanyak 65%.
Perlu diperhatikan: ini adalah hasil ujian patokan GitHub sendiri pada sistem mereka. Pengesahan bebas daripada pihak ketiga akan memperkuat dakwaan tersebut secara ketara. Tetapi ujian patokan itu sendiri—TerminalBench 2.1, DeepSWE, dan CheckpointBench—adalah kerangka penilaian yang diiktiraf dalam ruang AI pengkodean.
Konsensus industri yang semakin berkembang
GitHub tidak berfungsi dalam kekosongan. OpenRouter telah membangun router Auto dan Pareto mereka, yang juga bertujuan untuk menyeimbangkan kualiti dan kos di antara pelbagai penyedia model. Nvidia telah menerbitkan kerangka kerja LLM Router sebagai sebahagian daripada toolkit AI perniagaan mereka.
Komunikasi rasmi GitHub tidak mengklaim sebarang kemitraan atau sokongan terus daripada Nvidia atau OpenRouter berkenaan HydraFusion.
Apakah ini bermaksud untuk pembangun dan pasaran pengkodean AI
HydraFusion kini merupakan pra-pandangan penyelidikan, tersedia kepada kalangan terhad untuk mendapatkan maklum balas sebelum pelancaran yang lebih luas. GitHub secara eksplisit meminta masukan daripada pembangun untuk menyempurnakan cara sistem ini menangani alur kerja pengkodean dunia nyata.
Untuk lanskap persaingan, kelebihan 4.9 mata pada TerminalBench 2.1, yang dicapai pada sebahagian kecil kos, adalah jenis keputusan yang membuat pasukan pengadaan mempertimbangkan semula pilihan vendor mereka. Pesaing model tunggal menghadapi tekanan untuk sama ada menyesuaikan kecekapan itu atau menunjukkan kelebihan kualiti yang cukup besar untuk membenarkan premium.
