Google baru sahaja melancarkan dua model AI baharu ke pasaran yang sudah bergerak dengan laju luar biasa. Gemini 3.6 Flash dan 3.5 Flash-Lite dilancarkan pada 21 Julai 2026, melalui Gemini API, Google AI Studio, dan platform berkaitan, memberikan para pembangun lagi satu sebab untuk mempertimbangkan semula tatanan AI mereka.
Gemini 3.6 Flash menghantar kecerdasan yang digambarkan oleh Google sebagai serupa dengan pendahulunya, tetapi dengan kelajuan yang jauh lebih pantas dan kos yang lebih rendah. Nombor utama ialah pengurangan 17% dalam token output berbanding model 3.5 Flash dalam beberapa ujian tertentu. Dalam bahasa Inggeris: model ini menyelesaikan tugas yang sama sambil menggunakan sumber komputasi yang lebih sedikit, yang secara langsung menerjemahkan kepada bil API yang lebih murah untuk pembangun.
Model Flash-Lite 3.5 mengambil pendekatan yang berbeza. Ia dibina untuk throughput mentah, mampu menghasilkan sehingga 350 token per saat. Ini menjadikannya model paling pantas dalam keseluruhan keluarga 3.5. Perkompromian adalah harga: Flash-Lite lebih mahal daripada model Flash asas dalam konfigurasi tertentu, ditujukan untuk kes penggunaan agen dan volum tinggi di mana kelajuan merupakan bottleneck, bukan kos.
Untuk konteks harga, model 3.5 Flash (sehingga 19 Mei 2026) berjalan pada $1.50 per juta token input dan $9 per juta token output. Varian Flash-Lite berada pada premium terhadap itu dalam beberapa senario, menjadikannya sebagai alat khusus bukan pengganti serba guna.
Pengurangan 17% dalam penggunaan token bukan sekadar nombor yang bagus pada slaid benchmark. Bagi projek kripto yang menjalankan jutaan panggilan API setiap hari untuk membenarkan agen perdagangan autonomi atau sistem pemantauan risiko masa nyata, itu adalah pengurangan bermakna kepada perbelanjaan operasi.
Throughput 350 token-per-second pada Flash-Lite sangat relevan untuk kes penggunaan AI agen. Ini adalah sistem autonom yang tidak hanya merespons arahan, tetapi juga mengambil tindakan berturut-turut, seperti memantau kolam likuiditi, menganalisis keadaan pasaran, dan melaksanakan perdagangan. Kelajuan sangat penting di sini. Model yang boleh berfikir lebih cepat boleh bertindak lebih cepat, dan di pasaran kripto, bertindak lebih cepat seringkali merupakan perbezaan antara keuntungan dan dihadapi front-run.
Strategi Google dengan tier Flash kelihatan dirancang untuk menangkap segmen pasaran yang mempunyai volum tinggi dan peka terhadap kos. Flash 3.6 menargetkan pembangun yang menginginkan nisbah harga-kinerja terbaik. Flash-Lite 3.5 menargetkan mereka yang memerlukan kelajuan mentah dan bersedia membayarnya. Bersama-sama, keduanya merangkumi pelbagai kes penggunaan tanpa merosakkan tawaran model yang lebih kuat (dan lebih mahal) Google.
