Google ra mắt ba mô hình Gemini mới để cải thiện hiệu suất và tốc độ của tác nhân AI

iconTechFlow
Chia sẻ
AI summary iconTóm tắt
Google đã ra mắt ba mô hình Gemini mới—3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber—để tăng hiệu suất của AI Agent. Mô hình 3.6 Flash giảm 17% lượng token sử dụng và cải thiện các tác vụ lập trình và kiến thức. Mô hình 3.5 Flash-Lite đạt tốc độ 350 token mỗi giây, nhanh nhất trong loạt sản phẩm này. Mô hình 3.5 Flash Cyber tập trung vào việc phát hiện và giải quyết các vấn đề an ninh mạng trong mã nguồn. Những cập nhật này phù hợp với tin tức AI + crypto và có thể ảnh hưởng đến việc niêm yết các token mới trong lĩnh vực này.

Tác giả: Google DeepMind

Biên dịch: Deep潮 TechFlow

DeepChao dẫn nhập: Ba mô hình mà Google vừa phát hành đều tập trung giải quyết những điểm đau thực tế trong thương mại hóa AI Agent – chi phí và tốc độ. 3.6 Flash tiết kiệm 17% token so với thế hệ trước, giá thấp hơn nhưng chất lượng tốt hơn; 3.5 Flash-Lite đạt tốc độ 350 token/giây, là mô hình nhanh nhất trong dòng 3.5 hiện nay; còn mô hình chuyên biệt về an ninh mạng Flash Cyber nhắm vào thị trường thiết yếu là sửa lỗi mã nguồn. Đây không phải là cuộc thi chạy điểm hiệu năng, mà là đang xây dựng nền tảng cho việc triển khai quy mô lớn AI Agent.

Google DeepMind hôm nay ra mắt ba mô hình Gemini mới: 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Các mô hình này được thiết kế đặc biệt để đáp ứng yêu cầu về hiệu suất, độ trễ và độ tin cậy khi xây dựng AI Agent quy mô lớn.

Gemini 3.6 Flash: Hiệu quả hơn, chất lượng hơn

3.6 Flash được cải tiến dựa trên phản hồi của các nhà phát triển về 3.5 Flash. Không chỉ tiến bộ hơn trong mã hóa và công việc tri thức, nó còn tăng đáng kể hiệu quả token. Theo Artificial Analysis Index, 3.6 Flash giảm 17% lượng token đầu ra so với 3.5 Flash. Trong một số bài kiểm tra hiệu năng như Datacurve DeepSWE, mức giảm lên tới 65%. Số bước suy luận và gọi công cụ cần thiết để hoàn thành các luồng công việc đa bước cũng ít hơn.

Sự cải thiện hiệu suất này đi kèm với mức giá thấp hơn. Với mức giá 1,5 USD cho mỗi triệu token đầu vào và 7,5 USD cho mỗi triệu token đầu ra, 3.6 Flash đã giảm tổng chi phí cho mỗi tác vụ Agent, giúp việc xây dựng và chạy Agent trở nên kinh tế hơn.

Dù hiệu quả hơn, 3.6 Flash vẫn có hiệu suất vượt trội hơn 3.5 Flash trong mọi trường hợp sử dụng:

Chỉnh sửa mã chính xác hơn, giảm thiểu các thay đổi và vòng lặp không cần thiết, đạt 49% trên DeepSWE (3.5 Flash là 37%) và tăng đáng kể lên 63,9% trên bộ chuẩn nghiên cứu học máy MLE Bench (3.5 Flash là 49,7%)

Kỹ năng thao tác máy tính được cải thiện, điểm OSWorld-Verified là 83,0% (3,5 Flash là 78,4%). Thao tác máy tính hiện đã được cung cấp thông qua Gemini API và Gemini Enterprise như một công cụ khách hàng tích hợp

Hiệu suất công việc tri thức tốt hơn, chẳng hạn như điểm chuẩn GDPval-AA v2 là 1421 (3.5 Flash là 1349). Các khách hàng như Hebbia và Harvey nhận thấy nó đặc biệt xuất sắc trong các tác vụ đa mô hình như phân tích tài liệu, biểu đồ và phân tích dữ liệu, soạn thảo báo cáo.

Phản hồi của khách hàng: 3.6 Flash là bước tiến về chi phí và chất lượng, cân bằng hiệu quả token, độ chính xác và tốc độ trong các quy trình phức tạp và nhiệm vụ chuyên môn.

Thiết kế bảo mật

3.6 Flash được trang bị các biện pháp bảo mật tiên tiến được nâng cao, bao gồm các lĩnh vực hóa học, sinh học, phóng xạ và hạt nhân (CBRN) cũng như lạm dụng tấn công mạng. Các biện pháp bảo mật này giúp mô hình tăng cường đáng kể khả năng chống lại các cuộc tấn công thoát khỏi giới hạn. Đồng thời, mô hình đã được huấn luyện để giảm thiểu việc từ chối các mục đích hữu ích.

Gemini 3.5 Flash-Lite: Được tạo ra để mở rộng quy mô quy trình Agent

3.5 Flash-Lite được thiết kế cho các tác vụ độ trễ thấp và các tình huống phát triển yêu cầu thông lượng cao, như tìm kiếm Agent và xử lý tài liệu.

3.5 Flash-Lite là mô hình nhanh nhất trong dòng 3.5. Theo đo lường của Artificial Analysis, tốc độ chạy đạt 350 token đầu ra mỗi giây. Giá cả là 0,3 USD mỗi triệu token đầu vào và 2,5 USD mỗi triệu token đầu ra, đồng thời chất lượng vượt trội đáng kể so với 3.1 Flash-Lite, mang lại hiệu quả chi phí tuyệt vời cho các nhà phát triển và khách hàng thực hiện các tác vụ sản xuất có lưu lượng lớn.

3.5 Flash-Lite hỗ trợ mở rộng hiệu quả hệ thống Agent. Ở mọi cấp độ suy nghĩ, mô hình này vượt trội đáng kể so với 3.1 Flash-Lite. Các nhà phát triển có thể cấu hình mô hình theo tải công việc: sử dụng cấp độ suy nghĩ tối thiểu và thấp cho các tác vụ hàng loạt, ưu tiên thực thi độ trễ thấp và chi phí thấp; hoặc kích hoạt cấp độ suy nghĩ cao hơn để xử lý các tải công việc Agent đa bước. Mô hình hiện cũng tích hợp thao tác máy tính như một công cụ tích hợp, hỗ trợ đáng tin cậy các tác vụ Agent xuyên giao diện.

Nó cho thấy sự cải thiện đáng kể trong mã hóa và nhiệm vụ Agent, chẳng hạn như điểm Terminal-Bench 2.1 là 54% (3.1 Flash-Lite là 31%), ngữ cảnh dài như GDM-MRCR v2 đạt 72,2% (3.1 Flash-Lite là 60,1%), và thực thi nhiệm vụ thực tế như GDPval-AA v2 đạt 1140 (3.1 Flash-Lite là 642).

Thực tế, trong nhiều bài đánh giá Agent và mã hóa, 3.5 Flash-Lite thậm chí còn vượt trội hơn 3 Flash, bao gồm SWE-Bench Pro (54,2% so với 49,6%) và OSWorld-Verified (74,0% so với 65,1%), trở thành lựa chọn nhanh hơn và mạnh mẽ hơn cho các tải công việc của 2.5 và 3 Flash.

Khách hàng sớm nhấn mạnh sự kết hợp độc đáo về tốc độ, trí tuệ và hiệu quả chi phí của 3.5 Flash-Lite trong việc mở rộng luồng công việc Agent và các nhiệm vụ xử lý dữ liệu.

Gemini 3.5 Flash Cyber trong CodeMender: Phát hiện và sửa lỗi hiệu quả

Các mô hình AI phát hiện lỗ hổng bảo mật nhanh hơn tốc độ sửa chữa chúng của các hệ thống hiện tại. Để đối phó với mối đe dọa ngày càng nghiêm trọng này, cần một phương pháp bảo mật phần mềm vừa hiệu quả vừa mạnh mẽ.

Hiệu suất và hiệu quả của Flash khiến nó trở thành nền tảng lý tưởng để phát hiện, xác minh và vá các vấn đề bảo mật mã nguồn quy mô lớn. Gemini 3.5 Flash Cyber được xây dựng dựa trên 3.5 Flash, được tinh chỉnh đặc biệt để phát hiện và khắc phục lỗ hổng bảo mật mạng, với chi phí mỗi token thấp hơn các mô hình lớn.

Trong CodeMender, nhiều 3.5 Flash Cyber Agent hoạt động phối hợp để tạo ra một báo cáo tổng hợp duy nhất, đạt mức cạnh tranh tiên tiến trên bộ chuẩn phổ biến CyberGym.

Do tính chất hai mặt của công nghệ này, chúng tôi đã áp dụng cách tiếp cận triển khai thận trọng. Mô hình này sẽ sớm được cung cấp độc quyền cho chính phủ và các đối tác đáng tin cậy thông qua CodeMender dưới dạng dự án thí điểm với quyền truy cập hạn chế. Điều này sẽ giúp các nhà phòng thủ tuyến đầu phát hiện và khắc phục các lỗ hổng quan trọng trước khi chúng bị khai thác, đồng thời giảm thiểu rủi ro lạm dụng rộng rãi hơn.

Bắt đầu ngay

3.6 Flash và 3.5 Flash-Lite đã có sẵn kể từ hôm nay:

Các nhà phát triển có thể sử dụng thông qua Gemini API của Google AI Studio và Android Studio. 3.6 Flash cũng có sẵn trên Google Antigravity

Doanh nghiệp có thể sử dụng trong nền tảng Gemini Enterprise Agent. 3.6 Flash cũng có thể sử dụng trong ứng dụng Gemini Enterprise.

Đều có thể sử dụng qua ứng dụng Gemini. 3.5 Flash-Lite cũng đang được triển khai trên Google Tìm kiếm.

Vui lòng cung cấp phản hồi để cải thiện các mô hình Gemini trong tương lai, chúng tôi mong đợi sẽ sớm ra mắt 3.5 Pro.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.