Google vừa ra mắt hai mô hình AI mới vào một thị trường đang vận hành với tốc độ chóng mặt. Gemini 3.6 Flash và 3.5 Flash-Lite đã chính thức ra mắt vào ngày 21 tháng 7 năm 2026 thông qua Gemini API, Google AI Studio và các nền tảng liên quan, mang đến cho các nhà phát triển thêm một lý do để xem xét lại cơ sở AI của họ.
Gemini 3.6 Flash mang lại trí tuệ tương tự như tiền nhiệm, nhưng với tốc độ nhanh hơn đáng kể và chi phí thấp hơn. Con số nổi bật là giảm 17% số token đầu ra so với mô hình 3.5 Flash trong một số bài kiểm tra. Bằng tiếng Anh: mô hình hoàn thành cùng một nhiệm vụ trong khi tiêu tốn ít tài nguyên tính toán hơn, điều này trực tiếp giúp giảm hóa đơn API cho các nhà phát triển.
Mô hình 3.5 Flash-Lite tiếp cận theo cách khác. Nó được xây dựng để tối ưu thông lượng, có khả năng tạo ra lên đến 350 token mỗi giây, giúp nó trở thành mô hình nhanh nhất trong toàn bộ dòng 3.5. Sự đánh đổi là giá cả: Flash-Lite có chi phí cao hơn các mô hình Flash cơ bản trong một số cấu hình, nhắm đến các trường hợp sử dụng agent và khối lượng cao, nơi tốc độ là điểm nghẽn, chứ không phải chi phí.
Để tham khảo về giá cả, mô hình 3.5 Flash (tính đến ngày 19 tháng 5 năm 2026) có giá $1,50 mỗi triệu token đầu vào và $9 mỗi triệu token đầu ra. Phiên bản Flash-Lite có phí cao hơn trong một số trường hợp, định vị nó như một công cụ chuyên biệt thay vì thay thế đa năng.
Việc giảm 17% lượng token sử dụng không chỉ là một con số đẹp trên slide đánh giá. Đối với một dự án tiền điện tử thực hiện hàng triệu cuộc gọi API mỗi ngày để vận hành một đại lý giao dịch tự động hoặc hệ thống giám sát rủi ro theo thời gian thực, đó là khoản tiết kiệm đáng kể cho chi phí vận hành.
Thông suất 350 token mỗi giây trên Flash-Lite đặc biệt quan trọng đối với các trường hợp sử dụng AI agentic. Đây là các hệ thống tự chủ không chỉ phản hồi các lệnh mà còn thực hiện các hành động tuần tự, như theo dõi hồ sơ thanh khoản, phân tích điều kiện thị trường và thực hiện giao dịch. Tốc độ cực kỳ quan trọng ở đây. Một mô hình có thể suy nghĩ nhanh hơn sẽ hành động nhanh hơn, và trong các thị trường tiền điện tử, hành động nhanh hơn thường là sự khác biệt giữa lợi nhuận và bị front-run.
Chiến lược của Google với phân khúc Flash dường như được thiết kế để thu hút phân khúc thị trường có khối lượng giao dịch cao và nhạy cảm với chi phí. Flash 3.6 nhắm đến các nhà phát triển muốn đạt tỷ lệ hiệu năng trên chi phí tốt nhất. Flash-Lite 3.5 nhắm đến những người cần tốc độ thuần túy và sẵn sàng trả thêm chi phí. Cùng nhau, chúng bao phủ một phạm vi rộng các trường hợp sử dụng mà không làm giảm doanh thu từ các sản phẩm mô hình mạnh mẽ và đắt tiền hơn của Google.
