Tác giả: Google DeepMind
Biên dịch: Deep潮 TechFlow
DeepChao dẫn nhập: Ba mô hình mà Google vừa phát hành đều tập trung giải quyết những điểm đau thực tế trong thương mại hóa AI Agent – chi phí và tốc độ. 3.6 Flash tiết kiệm 17% token so với thế hệ trước, giá thấp hơn nhưng chất lượng tốt hơn; 3.5 Flash-Lite đạt tốc độ 350 token/giây, là mô hình nhanh nhất trong dòng 3.5 hiện nay; còn mô hình chuyên biệt về an ninh mạng Flash Cyber nhắm vào thị trường thiết yếu là sửa lỗi mã nguồn. Đây không phải là cuộc thi chạy điểm hiệu năng, mà là đang xây dựng nền tảng cho việc triển khai quy mô lớn AI Agent.
Google DeepMind hôm nay ra mắt ba mô hình Gemini mới: 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Các mô hình này được thiết kế đặc biệt để đáp ứng yêu cầu về hiệu suất, độ trễ và độ tin cậy khi xây dựng AI Agent quy mô lớn.
Gemini 3.6 Flash: Hiệu quả hơn, chất lượng hơn
3.6 Flash được cải tiến dựa trên phản hồi của các nhà phát triển về 3.5 Flash. Không chỉ tiến bộ hơn trong mã hóa và công việc tri thức, nó còn tăng đáng kể hiệu quả token. Theo Artificial Analysis Index, 3.6 Flash giảm 17% lượng token đầu ra so với 3.5 Flash. Trong một số bài kiểm tra hiệu năng như Datacurve DeepSWE, mức giảm lên tới 65%. Số bước suy luận và gọi công cụ cần thiết để hoàn thành các luồng công việc đa bước cũng ít hơn.
Sự cải thiện hiệu suất này đi kèm với mức giá thấp hơn. Với mức giá 1,5 USD cho mỗi triệu token đầu vào và 7,5 USD cho mỗi triệu token đầu ra, 3.6 Flash đã giảm tổng chi phí cho mỗi tác vụ Agent, giúp việc xây dựng và chạy Agent trở nên kinh tế hơn.
Dù hiệu quả hơn, 3.6 Flash vẫn có hiệu suất vượt trội hơn 3.5 Flash trong mọi trường hợp sử dụng:
Chỉnh sửa mã chính xác hơn, giảm thiểu các thay đổi và vòng lặp không cần thiết, đạt 49% trên DeepSWE (3.5 Flash là 37%) và tăng đáng kể lên 63,9% trên bộ chuẩn nghiên cứu học máy MLE Bench (3.5 Flash là 49,7%)
Kỹ năng thao tác máy tính được cải thiện, điểm OSWorld-Verified là 83,0% (3,5 Flash là 78,4%). Thao tác máy tính hiện đã được cung cấp thông qua Gemini API và Gemini Enterprise như một công cụ khách hàng tích hợp
Hiệu suất công việc tri thức tốt hơn, chẳng hạn như điểm chuẩn GDPval-AA v2 là 1421 (3.5 Flash là 1349). Các khách hàng như Hebbia và Harvey nhận thấy nó đặc biệt xuất sắc trong các tác vụ đa mô hình như phân tích tài liệu, biểu đồ và phân tích dữ liệu, soạn thảo báo cáo.
Phản hồi của khách hàng: 3.6 Flash là bước tiến về chi phí và chất lượng, cân bằng hiệu quả token, độ chính xác và tốc độ trong các quy trình phức tạp và nhiệm vụ chuyên môn.
Thiết kế bảo mật
3.6 Flash được trang bị các biện pháp bảo mật tiên tiến được nâng cao, bao gồm các lĩnh vực hóa học, sinh học, phóng xạ và hạt nhân (CBRN) cũng như lạm dụng tấn công mạng. Các biện pháp bảo mật này giúp mô hình tăng cường đáng kể khả năng chống lại các cuộc tấn công thoát khỏi giới hạn. Đồng thời, mô hình đã được huấn luyện để giảm thiểu việc từ chối các mục đích hữu ích.
Gemini 3.5 Flash-Lite: Được tạo ra để mở rộng quy mô quy trình Agent
3.5 Flash-Lite được thiết kế cho các tác vụ độ trễ thấp và các tình huống phát triển yêu cầu thông lượng cao, như tìm kiếm Agent và xử lý tài liệu.
3.5 Flash-Lite là mô hình nhanh nhất trong dòng 3.5. Theo đo lường của Artificial Analysis, tốc độ chạy đạt 350 token đầu ra mỗi giây. Giá cả là 0,3 USD mỗi triệu token đầu vào và 2,5 USD mỗi triệu token đầu ra, đồng thời chất lượng vượt trội đáng kể so với 3.1 Flash-Lite, mang lại hiệu quả chi phí tuyệt vời cho các nhà phát triển và khách hàng thực hiện các tác vụ sản xuất có lưu lượng lớn.
3.5 Flash-Lite hỗ trợ mở rộng hiệu quả hệ thống Agent. Ở mọi cấp độ suy nghĩ, mô hình này vượt trội đáng kể so với 3.1 Flash-Lite. Các nhà phát triển có thể cấu hình mô hình theo tải công việc: sử dụng cấp độ suy nghĩ tối thiểu và thấp cho các tác vụ hàng loạt, ưu tiên thực thi độ trễ thấp và chi phí thấp; hoặc kích hoạt cấp độ suy nghĩ cao hơn để xử lý các tải công việc Agent đa bước. Mô hình hiện cũng tích hợp thao tác máy tính như một công cụ tích hợp, hỗ trợ đáng tin cậy các tác vụ Agent xuyên giao diện.
Nó cho thấy sự cải thiện đáng kể trong mã hóa và nhiệm vụ Agent, chẳng hạn như điểm Terminal-Bench 2.1 là 54% (3.1 Flash-Lite là 31%), ngữ cảnh dài như GDM-MRCR v2 đạt 72,2% (3.1 Flash-Lite là 60,1%), và thực thi nhiệm vụ thực tế như GDPval-AA v2 đạt 1140 (3.1 Flash-Lite là 642).
Thực tế, trong nhiều bài đánh giá Agent và mã hóa, 3.5 Flash-Lite thậm chí còn vượt trội hơn 3 Flash, bao gồm SWE-Bench Pro (54,2% so với 49,6%) và OSWorld-Verified (74,0% so với 65,1%), trở thành lựa chọn nhanh hơn và mạnh mẽ hơn cho các tải công việc của 2.5 và 3 Flash.
Khách hàng sớm nhấn mạnh sự kết hợp độc đáo về tốc độ, trí tuệ và hiệu quả chi phí của 3.5 Flash-Lite trong việc mở rộng luồng công việc Agent và các nhiệm vụ xử lý dữ liệu.
Gemini 3.5 Flash Cyber trong CodeMender: Phát hiện và sửa lỗi hiệu quả
Các mô hình AI phát hiện lỗ hổng bảo mật nhanh hơn tốc độ sửa chữa chúng của các hệ thống hiện tại. Để đối phó với mối đe dọa ngày càng nghiêm trọng này, cần một phương pháp bảo mật phần mềm vừa hiệu quả vừa mạnh mẽ.
Hiệu suất và hiệu quả của Flash khiến nó trở thành nền tảng lý tưởng để phát hiện, xác minh và vá các vấn đề bảo mật mã nguồn quy mô lớn. Gemini 3.5 Flash Cyber được xây dựng dựa trên 3.5 Flash, được tinh chỉnh đặc biệt để phát hiện và khắc phục lỗ hổng bảo mật mạng, với chi phí mỗi token thấp hơn các mô hình lớn.
Trong CodeMender, nhiều 3.5 Flash Cyber Agent hoạt động phối hợp để tạo ra một báo cáo tổng hợp duy nhất, đạt mức cạnh tranh tiên tiến trên bộ chuẩn phổ biến CyberGym.
Do tính chất hai mặt của công nghệ này, chúng tôi đã áp dụng cách tiếp cận triển khai thận trọng. Mô hình này sẽ sớm được cung cấp độc quyền cho chính phủ và các đối tác đáng tin cậy thông qua CodeMender dưới dạng dự án thí điểm với quyền truy cập hạn chế. Điều này sẽ giúp các nhà phòng thủ tuyến đầu phát hiện và khắc phục các lỗ hổng quan trọng trước khi chúng bị khai thác, đồng thời giảm thiểu rủi ro lạm dụng rộng rãi hơn.
Bắt đầu ngay
3.6 Flash và 3.5 Flash-Lite đã có sẵn kể từ hôm nay:
Các nhà phát triển có thể sử dụng thông qua Gemini API của Google AI Studio và Android Studio. 3.6 Flash cũng có sẵn trên Google Antigravity
Doanh nghiệp có thể sử dụng trong nền tảng Gemini Enterprise Agent. 3.6 Flash cũng có thể sử dụng trong ứng dụng Gemini Enterprise.
Đều có thể sử dụng qua ứng dụng Gemini. 3.5 Flash-Lite cũng đang được triển khai trên Google Tìm kiếm.
Vui lòng cung cấp phản hồi để cải thiện các mô hình Gemini trong tương lai, chúng tôi mong đợi sẽ sớm ra mắt 3.5 Pro.
