Bago lang ng ilabas ng Google ang dalawang bagong AI model sa isang merkado na nasa mabilis na galaw. Ang Gemini 3.6 Flash at 3.5 Flash-Lite ay naging live noong July 21, 2026, sa pamamagitan ng Gemini API, Google AI Studio, at mga kaugnay na platform, nagbibigay pa ng isa pang dahilan para muling isipin ng mga developer ang kanilang AI stack.
Ang Gemini 3.6 Flash ay nagdadala ng parehong intelihensya na ilarawan ng Google sa kanyang naunang bersyon, ngunit may mas malaking bilis at mas mababang gastos. Ang pangunahing numero ay isang 17% pagbawas sa output tokens kumpara sa 3.5 Flash model sa ilang benchmark. Sa Ingles: ang model ay nakakatapos ng parehong gawain habang ginagamit ang mas kaunting computational resources, na direktang nangangahulugan ng mas mababang API bills para sa mga developer.
Ang 3.5 Flash-Lite model ay gumagamit ng ibang pagkakataon. Ito ay disenyo para sa raw throughput, kaya ito ay makakapag-output ng hanggang 350 tokens bawat segundo. Ito ang pinakamabilis na model sa buong pamilya ng 3.5. Ang kompromiso ay ang presyo: mas mahal ang Flash-Lite kaysa sa base Flash models sa ilang konfigurasyon, at ito ay nakatuon sa agentic at high-volume na paggamit kung saan ang bilis ang bottleneck, hindi ang gastos.
Para sa konteksto sa pagpapresyo, ang 3.5 Flash model (tungkol sa Mayo 19, 2026) ay nagkakahalaga ng $1.50 bawat milyong input tokens at $9 bawat milyong output tokens. Ang Flash-Lite variant ay nasa premium sa ilang mga skenaryo, nagpapakita nito bilang isang espesyalisadong kasangkapan kaysa isang pangkalahatang pagpapalit.
Hindi lang isang magandang numero sa isang slide ng benchmark ang 17% pagbawas sa paggamit ng token. Para sa isang crypto project na nagpapatakbo ng milyon-milyon na API calls araw-araw upang magbigay-pwersa sa isang autonomous trading agent o isang real-time risk monitoring system, iyon ay isang makabuluhang pagbawas sa operating expenses.
Ang 350 tokens-per-second throughput sa Flash-Lite ay partikular na mahalaga para sa mga agentic AI use cases. Ito ay ang mga autonomous system na hindi lang tumutugon sa mga prompt kundi gumagawa ng mga sunod-sunod na aksyon, tulad ng pagmonito sa liquidity pool, pagsusuri sa mga kondisyon ng merkado, at pagpapatupad ng trade. Ang bilis ay napakalaking mahalaga dito. Ang isang model na makakaisip nang mas mabilis ay makakagawa nang mas mabilis, at sa crypto markets, ang pagkilos nang mabilis ay madalas ang pagkakaiba sa pagitan ng kita at pagiging front-run.
Ang estratehiya ni Google sa Flash tier ay tila disenyo upang makakuha ng high-volume, cost-sensitive na segmen ng merkado. Ang 3.6 Flash ay nakatuon sa mga developer na naghahanap ng pinakamabuting price-performance ratio. Ang 3.5 Flash-Lite naman ay nakatuon sa mga nangangailangan ng raw speed at handang magbayad para dito. Kasama nila, sila ay nakakapag-coverage sa isang malawak na hanay ng mga use case nang hindi pinapawi ang mas makapangyarihan (at mas mahal) na mga modelong tawag ng Google.
