Google đã phát hành Gemini 3.8 Flash và 3.8 Flash Cyber dành cho phòng thủ mạng vào ngày 2 tháng 9. Chỉ ba tuần sau khi ra mắt 3.7 Flash, đây là lần cập nhật thứ ba trong chuỗi Flash trong vòng sáu tuần. Google định vị 3.8 là mô hình Flash mạnh nhất hiện nay về suy luận và mã hóa; phiên bản thông thường đã có sẵn trên Gemini API, Google AI Studio, Android Studio, Gemini Enterprise và một số sản phẩm người tiêu dùng; phiên bản Cyber chỉ được cấp quyền truy cập ưu tiên thông qua Fairwind Program mới cho các cơ quan chính phủ đáng tin cậy, người vận hành cơ sở hạ tầng then chốt và người duy trì phần mềm. Cả hai phiên bản đều chia sẻ trí tuệ nền tảng, nhưng quyền triển khai và bảo mật không giống nhau.
Giá giới thiệu của普通3.8 Flash vẫn là 0,75 USD mỗi triệu token đầu vào và 3,75 USD đầu ra, giống như 3.7. Tuy nhiên, mức giá này chỉ áp dụng đến ngày 31 tháng 12 năm 2026; từ ngày 1 tháng 1 năm 2027, giá niêm yết chính thức sẽ tăng lên 1,50 USD cho đầu vào và 7,50 USD cho đầu ra. Điều dễ bị bỏ qua là mô hình sẽ thực hiện nhiều bước suy luận hơn và gọi lặp lại các công cụ khi xử lý các nhiệm vụ phức tạp; Google đã cảnh báo rõ ràng rằng mức nỗ lực cao có thể tiêu tốn nhiều token hơn. Việc đơn giá không tăng không có nghĩa là tổng chi phí cho một nhiệm vụ sẽ không thay đổi.
Flash bắt đầu cạnh tranh nhiệm vụ dài, ngoài tốc độ còn chú trọng tỷ lệ hoàn thành
Bằng chứng do Google đưa ra bao gồm mã hóa chu kỳ dài, phân tích chuyên sâu và suy luận đa bước. Flash vượt trội hơn hầu hết các mô hình tiên tiến lớn hơn trong đánh giá phần mềm chu kỳ dài DeepSWE v1.1; đạt 54,9% trên HLE-Verified. Công ty còn trích dẫn các bộ chuẩn về đại lý tài chính và đại lý pháp lý để cho thấy họ đang nỗ lực chuyển đổi Flash từ mô hình trả lời câu hỏi độ trễ thấp thành mô hình làm việc có khả năng lập kế hoạch liên tục, gọi công cụ và giao kết quả hoàn chỉnh. Các minh họa như trực quan hóa phân tích phần cứng, tạo bản đồ DOS và trò chơi 3D chỉ với một prompt, nhấn mạnh rằng mô hình không chỉ đầu ra các đoạn mã, mà còn có thể liên tục kiểm tra và chỉnh sửa sản phẩm trong vòng lặp.
Tuy nhiên, điểm chuẩn không thể trực tiếp chuyển đổi thành năng suất doanh nghiệp. Tỷ lệ thành công của các tác vụ dài thường bị ảnh hưởng bởi quy mô kho mã, môi trường phụ thuộc, chất lượng bài kiểm tra, quyền truy cập công cụ và ngân sách thử lại. Khi chiến lược “cố gắng hơn” ở mức 3.8 tăng tỷ lệ hoàn thành, nó cũng làm tăng thời gian thực thi và lượng Token sử dụng. Các nhóm phát triển cần ghi lại giá mỗi lần gọi, tổng số Token cho một tác vụ, số lần gọi công cụ, số lần thử lại trước khi thành công và thời gian tái xử lý thủ công mới có thể xác định liệu việc nâng cấp có thực sự tiết kiệm chi phí hơn hay không. Đối với các tải công việc ưu tiên độ trễ hoặc ngân sách, Google vẫn khuyên giảm mức độ nỗ lực hoặc tiếp tục sử dụng 3.7 Flash; các phiên bản cũ không bị ngừng hỗ trợ ngay lập tức sau khi ra mắt sản phẩm mới.
Bản phổ thông đã sẵn sàng cho nhà phát triển và doanh nghiệp, đồng thời người dùng Google AI Pro và Ultra cũng có thể sử dụng trong ứng dụng Gemini, chế độ AI của Tìm kiếm và Gemini trong Sheets. Các tính năng, hạn mức và phạm vi triển khai theo khu vực có thể khác nhau giữa các cổng truy cập, do đó không nên diễn giải “mô hình đã được phát hành” là tất cả người dùng và tất cả sản phẩm đều có cùng khả năng hoàn toàn. Đặc biệt, các quy trình làm việc có công cụ tự trị còn phụ thuộc vào việc ứng dụng có cung cấp công cụ, quyền và môi trường thực thi có thể phục hồi tương ứng cho mô hình hay không.
Bản Cyber mạnh mẽ và hẹp hơn, 47,2% không phải là cam kết tự sửa chữa
Gemini 3.8 Flash Cyber tập trung vào việc phát hiện lỗ hổng và tạo bản vá. Google cho biết, trong các bài đánh giá nội bộ phát hiện lỗ hổng bao phủ 20 ngôn ngữ lập trình, tỷ lệ thành công vượt quá 70%; trong bài đánh giá bản vá bên ngoài CWE-Bench, pass@1 đạt 47,2%, gần với mức 47,8% của mô hình tiên tiến hàng đầu, nhưng chi phí thấp hơn. Kết quả sử dụng nội bộ từ nhóm bảo mật Chrome cho thấy số lượng bản vá lỗ hổng chính xác do 3.8 Flash Cyber tạo ra cao gấp 2,6 lần so với mô hình thương mại lớn tốt nhất. Wiz cũng báo cáo rằng tỷ lệ hồi quy trên tiêu chuẩn kiểm thử xâm nhập nội bộ tăng từ 7,5 đến 9,7 điểm phần trăm, với chi phí thấp hơn từ 2,3 đến 5,2 lần.
Các con số này có giá trị tham khảo, nhưng cũng có giới hạn; các mẫu, gợi ý và phương pháp đánh giá thủ công cho cơ sở nội bộ không được trình bày đầy đủ trong thông báo; 47,2% pass@1 đồng nghĩa với việc một lần tạo không đảm bảo hơn một nửa các vấn đề đều được sửa chữa đúng. Google ưu tiên “sửa chữa” hơn “khai thác” và thêm các biện pháp phòng ngừa lạm dụng hóa học, sinh học, phóng xạ, hạt nhân và mạng cho phiên bản phổ thông 3.8. Phiên bản Cyber, nhằm đáp ứng nhu cầu phòng thủ chuyên nghiệp, áp dụng các hạn chế an ninh mạng lỏng lẻo hơn, do đó không được công khai toàn diện, mà chỉ cung cấp cho các nhà phòng thủ đáng tin cậy trong chương trình Fairwind.
Điều thực sự thay đổi trong đợt phát hành này là sự đánh đổi trong dòng Flash: thay vì chỉ dựa vào giá thấp và tốc độ để thu hút các yêu cầu hàng loạt, giờ đây nó theo đuổi tỷ lệ hoàn thành nhiệm vụ phức tạp thông qua các chu kỳ suy luận dài hơn. Doanh nghiệp nếu thay trực tiếp 3.7 bằng 3.8 sẽ dễ mắc sai lầm khi chỉ so sánh giá theo triệu Token. Cách tiếp cận an toàn hơn là kiểm thử phân tầng theo nhiệm vụ thực tế: giới hạn mức nỗ lực cho các yêu cầu đơn giản, cho phép nhiều chu kỳ hơn với nhiệm vụ dài, và duy trì phê duyệt thủ công cùng môi trường cô lập cho các nhiệm vụ an toàn. Flash 3.8 đã sẵn sàng, Cyber cũng đã bước vào chương trình giới hạn; liệu nó có thể hoàn thành nhiều nhiệm vụ sản xuất hơn với tổng chi phí thấp hơn hay không, vẫn cần được các đội ngũ riêng lẻ trả lời bằng dữ liệu end-to-end của chính họ.
