Google ra mắt Gemini 3.8 Flash, thu hẹp khoảng cách hiệu năng với các mô hình chủ lực

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
Google đã công bố Gemini 3.8 Flash và phiên bản an ninh mạng của nó, Gemini 3.8 Flash Cyber, vào ngày 2 tháng 9 năm 2026, như một phần của tin tức chuỗi mới nhất. Mô hình tiêu chuẩn hỗ trợ 1 triệu token và đạt 73,7% trong DeepSWE v1.1, gần bằng Claude Opus 5. Phiên bản Cyber tự động phát hiện và vá lỗ hổng, đạt hơn 70% thành công ở 20 ngôn ngữ. Cả hai mô hình hiện đã có sẵn thông qua Gemini API và Google AI Studio, với tiềm năng cho các danh mục token mới.
Google công bố Gemini 3.8 Flash và Gemini 3.8 Flash Cyber dành cho các tổ chức phòng thủ mạng đáng tin cậy vào ngày 2 tháng 9 năm 2026. Bản thông thường có ngữ cảnh 1 triệu token, tập trung vào lập trình, Agent và các công việc chuyên môn; trong các bài kiểm tra do Google công bố, hiệu suất kỹ thuật phần mềm dài hạn đạt 73,7%, gần với 74,0% của Claude Opus 5, đồng thời dẫn đầu các mô hình được kiểm tra về Agent tài chính, Agent pháp lý và một số kết quả suy luận tổng hợp. Bản Cyber có khả năng tự động phát hiện lỗ hổng và tạo bản vá: tỷ lệ thành công trong các bài kiểm tra nội bộ của Google trên 20 ngôn ngữ lập trình vượt quá 70%, nhóm Chrome nhận được số bản vá chính xác gấp 2,6 lần so với các mô hình thương mại lớn. Giá ưu đãi API hiện tại là 0,75 USD mỗi triệu token đầu vào và 3,75 USD mỗi triệu token đầu ra, nhưng mô hình sẽ đổi lấy hiệu suất thông qua nhiều bước suy luận và gọi công cụ hơn, các đánh giá độc lập cho thấy chi phí cho một nhiệm vụ đơn lẻ cao hơn khoảng 40% so với 3.7 Flash. Tín hiệu quan trọng của đợt ra mắt này là khả năng Agent, trước đây chủ yếu thuộc về các mô hình cao cấp đắt tiền, đang bước vào nhóm “mô hình làm việc” giá rẻ và có thể triển khai quy mô lớn, tuy nhiên dữ liệu năng lực vẫn chủ yếu dựa trên các bài kiểm tra của Google và các đối tác, phiên bản Cyber cũng không khả dụng cho người dùng phổ thông.

Tác giả bài viết, nguồn: DeepMind

Sau ba lần cập nhật trong sáu tuần, Google đã biến Flash thành mô hình chính.

Gemini 3.8 Flash chỉ cách phiên bản 3.7 Flash ba tuần và là phiên bản Flash thứ ba mà Google ra mắt trong sáu tuần.

Trước đây, “Flash” thường có nghĩa là tốc độ nhanh và chi phí thấp, nhưng khả năng rõ ràng yếu hơn các mô hình cao cấp. Vị trí của Gemini 3.8 đang thay đổi: Google vẫn gọi nó là “mô hình làm việc” phù hợp để triển khai quy mô lớn, nhưng giờ đây tập trung vào các khả năng chính như lập trình chu kỳ dài, gọi công cụ liên tục và phân tích chuyên sâu, thay vì chỉ giao cho nó các nhiệm vụ nhẹ như trò chuyện hoặc tóm tắt.

Mô hình mới hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và PDF, với ngữ cảnh 1.000.000 Token và đầu ra tối đa 64.000 Token, có thể gọi các công cụ tìm kiếm, hàm và thao tác máy tính. Mô hình đã chính thức được phát hành, không còn ở chế độ thử nghiệm hoặc xem trước, và có thể sử dụng qua Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, ứng dụng Gemini, chế độ AI tìm kiếm và Google Sheets.

Google cũng đã mặc định sử dụng 3.8 Flash cho Agent được lưu trữ của mình. Điều này cho thấy mô hình này thực sự nhắm đến các Agent cần lập kế hoạch lặp đi lặp lại, gọi công cụ, kiểm tra kết quả và liên tục điều chỉnh, chứ không phải chỉ dành cho các câu hỏi-đáp một lần.

The programming performance is now approaching that of expensive flagship models.

Trong bài kiểm tra kỹ thuật phần mềm chu kỳ dài DeepSWE v1.1 do Google công bố, Gemini 3.8 Flash đạt 73,7%, cao hơn 65,3% của 3.7 Flash và 72,7% của GPT‑5.6 Sol, chỉ kém 0,3 điểm phần trăm so với Claude Opus 5 ở mức 74,0%.

Loại kiểm tra này yêu cầu mô hình truy cập vào kho mã thật, hiểu mối quan hệ giữa nhiều tệp, xác định vấn đề và thực hiện các thay đổi có thể vượt qua bài kiểm tra. Nó gần với công việc của tác giả lập trình thực tế hơn là chỉ tạo một hàm độc lập.

Trong Vals Finance Agent v2, 3.8 Flash đạt 61,4%, trong khi các mô hình được thử nghiệm là 3.7 Flash, Claude Opus 5 và GPT‑5.6 Sol lần lượt đạt 59,0%, 58,6% và 53,8%.

Trong bài kiểm tra Harvey Legal Agent, Flash 3.8 đạt 10,0%, cao hơn Flash 3.7 ở mức 8,8%, Claude Opus 5 ở mức 6,7% và GPT-5.6 Sol ở mức 2,5%. Tuy nhiên, tất cả các mô hình đều có điểm số tuyệt đối rất thấp trong bài đánh giá này; việc xếp hạng số một không có nghĩa là đã có thể xử lý đáng tin cậy các công việc pháp lý phức tạp.

Trong bài kiểm tra suy luận đa ngành HLE-Verified, 3.8 Flash đạt 54,9%, GPT‑5.6 Sol và Claude Opus 5 lần lượt đạt 54,5% và 54,4%, sự khác biệt giữa ba mô hình này rất nhỏ, không đủ để chứng minh mô hình nào có lợi thế toàn diện ổn định.

Các kết quả này chủ yếu do Google công bố theo cấu hình riêng của họ. Các yếu tố như mô hình, khung Agent, cường độ suy luận, quyền truy cập công cụ và ngân sách kiểm tra đều ảnh hưởng đến kết quả cuối cùng, do đó, kết luận hợp lý hơn là: các mô hình cấp Flash đã gần với một số mô hình cao cấp đắt tiền, chứ không phải Gemini đã dẫn đầu toàn diện trên mọi nhiệm vụ.

“Cố gắng hơn” có nghĩa là thông minh hơn, cũng có thể nghĩa là đắt hơn

Google đã gán sự cải thiện khả năng Flash 3.8 cho một lựa chọn thiết kế trực tiếp: khiến mô hình “nỗ lực hơn”.

Khi đối mặt với các nhiệm vụ phức tạp, nó sẽ sử dụng nhiều bước suy luận trung gian hơn, gọi lặp lại các công cụ và chủ động kiểm tra các công việc đã hoàn thành. Các nhà phát triển có thể chọn ba cấp độ suy nghĩ: thấp, trung bình và cao, với cấp độ trung bình là thiết lập mặc định; cấp độ cao phù hợp với lập trình khó và suy luận nhiều bước, trong khi cấp độ thấp phù hợp với trò chuyện thời gian thực, tạo bản nháp và các nhiệm vụ nhạy cảm với độ trễ.

Điều này có thể giảm xác suất Agent dừng sớm, bỏ sót bước hoặc hoàn toàn lệch khỏi mục tiêu sau khi một lần gọi công cụ thất bại, nhưng cũng sẽ tiêu tốn nhiều Token hơn.

Trong các bài kiểm tra độc lập của Artificial Analysis, 3.8 Flash đạt điểm trí tuệ 59 ở cấp độ suy nghĩ cao, tăng 3 điểm so với 3.7 Flash và ở mức tương đương với cấu hình suy luận không cao nhất của GPT‑5.6 Sol. Tốc độ đầu ra trung bình của nó khoảng 300 token mỗi giây, trung bình mất 2,5 phút để hoàn thành một bài kiểm tra đơn lẻ.

Tuy nhiên, lượng Token đầu ra trung bình của 3.8 Flash tăng khoảng 30%, và số vòng thực thi trong đánh giá Agent cũng nhiều hơn. Mặc dù giá mỗi Token không tăng, chi phí trung bình mỗi nhiệm vụ khoảng 0,58 USD, cao hơn khoảng 40% so với 0,40 USD của 3.7 Flash.

Do đó, “giá thấp” không có nghĩa là “mỗi nhiệm vụ chắc chắn sẽ rẻ hơn”. Nếu nhiệm vụ bản thân không yêu cầu suy luận phức tạp, việc cho 3.8 Flash chạy ở cường độ cao có thể chỉ làm tăng thời gian và chi phí. Google cũng khuyến nghị ưu tiên các luồng công việc hiệu quả hơn bằng cách giảm cấp độ suy nghĩ, hoặc tiếp tục sử dụng 3.7 Flash vẫn được hỗ trợ.

Giá hiện tại chỉ là ưu đãi có thời hạn

Tính đến ngày 31 tháng 12 năm 2026, giá ưu đãi của Gemini 3.8 Flash là 0,75 USD mỗi triệu Token đầu vào và 3,75 USD mỗi triệu Token đầu ra, giống với giá hiện tại của 3.7 Flash.

Từ ngày 1 tháng 1 năm 2027, giá tiêu chuẩn sẽ trở thành 1,50 USD cho mỗi triệu Token đầu vào và 7,50 USD cho mỗi triệu Token đầu ra, đúng bằng gấp đôi. Các nhà phát triển khi đánh giá chi phí dài hạn không nên coi giá trong giai đoạn ra mắt là mức giá vĩnh viễn.

Ngay cả khi tính theo giá tiêu chuẩn trong tương lai, nó vẫn thấp hơn một số mô hình cao cấp; tuy nhiên, đối với các Agent cần tạo ra hàng chục nghìn Token và thực hiện hàng chục lượt gọi công cụ, nên so sánh chi phí toàn bộ nhiệm vụ, chứ không chỉ so sánh con số mỗi triệu Token trên bảng giá.

Mục tiêu của bản Cyber không phải là giải thích lỗ hổng, mà là cung cấp bản vá trực tiếp

Google đồng thời phát hành Gemini 3.8 Flash Cyber. Nó chia sẻ các khả năng cơ bản với phiên bản thông thường, nhưng được huấn luyện tập trung hơn về an ninh mạng và áp dụng các hạn chế an ninh mạng lỏng lẻo hơn, giúp nó có thể thực hiện các phân tích lỗ hổng mà mô hình thông thường có thể từ chối.

Trong bộ chuẩn phát hiện lỗ hổng CyberGym, Google cho biết họ đã đạt đến trình độ tiên tiến. Do CyberGym chủ yếu tập trung vào các dự án C và C++, công ty đã thiết kế một bộ kiểm tra nội bộ bao gồm 20 ngôn ngữ lập trình và các thư viện mã thực tế phức tạp, với tỷ lệ thành công trong việc phát hiện lỗ hổng của 3.8 Flash Cyber vượt quá 70%.

Việc phát hiện lỗ hổng chỉ là bước đầu tiên. Google đặc biệt nhấn mạnh rằng trọng tâm huấn luyện của Cyber là sửa chữa vấn đề, chứ không phải tạo ra các chương trình khai thác tấn công.

Trong bài kiểm tra patch CWE-Bench do Collinear vận hành, tỷ lệ vượt qua lần đầu tiên của Flash Cyber là 47,2%, trong khi mô hình chủ lực hàng đầu được so sánh là 47,8%. Cả hai kết quả gần bằng nhau, nhưng Google cho biết chi phí vận hành của Flash Cyber thấp hơn.

Điều này đại diện cho việc mục tiêu của Agent an ninh mạng đang chuyển từ “thông báo cho kỹ sư rằng có thể có vấn đề tại đây” sang việc hiểu các lỗ hổng, viết bản vá, chạy kiểm tra và xác minh các thay đổi. Nếu kết quả đủ đáng tin cậy, nó có thể rút ngắn thời gian mà nhóm an ninh cần để từ khi phát hiện lỗ hổng đến khi triển khai bản sửa lỗi.

Chrome nhận được bản vá đúng 2.6 lần, nhưng vẫn đang trong giai đoạn thử nghiệm của nhà sản xuất và đối tác

Google đã sử dụng Flash Cyber cho các công việc bảo mật mã nội bộ.

Đội ngũ bảo mật Chrome cho biết số lượng bản vá lỗ hổng chính xác mà nó tạo ra cao gấp 2,6 lần so với các mô hình thương mại lớn hơn. Công ty an ninh mạng Wiz cho biết, trong bộ tiêu chuẩn kiểm tra xâm nhập của mình, tỷ lệ phát hiện lỗ hổng của Flash Cyber cao hơn các mô hình tiên tiến khác từ 7,5 đến 9,7 điểm phần trăm, với chi phí thấp hơn từ 2,3 đến 5,2 lần.

Nhóm nghiên cứu lỗ hổng của Google Cloud cũng cho biết, mô hình này đã phát hiện ra một lỗ hổng nền tảng quan trọng trong chưa đầy hai giờ, trong khi các nghiên cứu tương tự thường có thể kéo dài nhiều tháng.

Các kết quả này có giá trị tham khảo thực tế, nhưng không thể coi là đánh giá công khai độc lập và có thể lặp lại. Google chưa công bố chi tiết về lỗ hổng then chốt đó, danh sách các mô hình so sánh và toàn bộ quy trình chạy; dữ liệu Chrome đến từ bên trong Google và Wiz cũng là đối tác của Fairwind. Do đó, chúng chứng minh rằng các mô hình đã có thể tham gia vào các công việc bảo mật thực tế, nhưng chưa chứng minh được rằng chúng ổn định đạt được hiệu quả tương đương trên mọi kho mã và loại lỗ hổng.

Khả năng bảo mật mạng mạnh nhất chỉ được mở cho các tổ chức đáng tin cậy

Flash Cyber được cung cấp thông qua Chương trình Fairwind mới của Google, hiện có hơn 650 người tham gia, chủ yếu bao gồm các cơ quan an ninh mạng chính phủ, các bên vận hành hạ tầng then chốt, người duy trì phần mềm và các doanh nghiệp an ninh lớn.

Các tổ chức tham gia cần giới hạn phạm vi người dùng truy cập nội bộ và áp dụng các biện pháp bảo mật như xác thực đa yếu tố. Sau khi tích hợp với CodeMender Agent, mô hình có thể tìm kiếm, xác minh và sửa chữa lỗ hổng trong môi trường đám mây riêng của tổ chức.

Khách hàng Google Cloud thông thường vẫn có thể sử dụng CodeMender cùng mô hình Gemini phiên bản công khai, nhưng không thể truy cập trực tiếp vào toàn bộ khả năng của Flash Cyber.

Cách phát hành “một mô hình cơ sở, hai cấp độ quyền hạn” này rất gần với chiến lược trước đây của Anthropic khi phân chia Claude thành Fable và Mythos: các khả năng lập trình và phân tích phổ quát được mở ra cho thị trường, trong khi các tính năng an ninh mạng dễ dàng chuyển hóa thành khả năng tấn công sẽ được bảo vệ thông qua xác thực danh tính, kiểm soát truy cập và giám sát liên tục.

Security has not seen significant upgrades, but some non-English performances have regressed.

Bản thông thường 3.8 Flash bao gồm các hạn chế an toàn liên quan đến hóa chất, sinh học, phóng xạ, hạt nhân và các cuộc tấn công mạng; phiên bản Cyber có các hạn chế an ninh mạng lỏng lẻo hơn để thực hiện các nhiệm vụ phòng thủ chuyên nghiệp, do đó chỉ dành cho các tổ chức đã được phê duyệt.

Thẻ mô hình của Google cho rằng, so với 3.7 Flash, 3.8 Flash không có khả năng mới đáng kể trong các lĩnh vực rủi ro cao được quan tâm bởi khung an ninh前沿 của công ty, do đó không kích hoạt cấp độ rủi ro cao hơn. Nó cũng đã cải thiện khả năng phòng vệ trong bài kiểm tra tiêm nhắc gián tiếp Gray Swan.

Tuy nhiên, thẻ mô hình cũng tiết lộ rằng 3.8 Flash đã tụt giảm 5,4 điểm phần trăm so với 3.7 Flash trong các bài kiểm tra an toàn đa ngôn ngữ tự động hóa. Sau khi kiểm tra thủ công, Google cho biết phần lớn sự khác biệt là các báo cáo sai hoặc nội dung không nghiêm trọng, nhưng dữ liệu mẫu đầy đủ và dữ liệu theo từng ngôn ngữ chưa được công bố.

Mô hình vẫn giữ các vấn đề phổ biến của các mô hình ngôn ngữ lớn, bao gồm ảo giác, phản hồi thỉnh thoảng chậm hoặc hết thời gian, cũng như sử dụng quá nhiều token để cải thiện hiệu suất. Thời điểm kết thúc kiến thức được ghi là tháng 3 năm 2026, nhưng Google cho biết, kiến thức đáng tin cậy trong một số lĩnh vực có thể vẫn chỉ được cập nhật đến khoảng tháng 1 năm 2025; khi liên quan đến thông tin mới nhất, vẫn cần xác minh trực tuyến.

Sự cạnh tranh thực sự đang chuyển từ “ai thông minh nhất” sang “ai có thể được sử dụng rộng rãi”

Điều đáng chú ý nhất về Gemini 3.8 Flash không phải là việc nó dẫn đầu một số chỉ số benchmark vài phần trăm, mà là Google đang đưa các khả năng lập trình chu kỳ dài, phân tích chuyên sâu và gọi công cụ tự chủ vào mức giá của Flash.

Các mô hình cao cấp phù hợp với các nhiệm vụ khó, có giá trị cao nhưng tần suất thấp; trong khi đó, các Agent thực sự được triển khai trong dịch vụ khách hàng doanh nghiệp, đường ống lập trình, phân tích tài chính và quét bảo mật có thể xử lý hàng triệu lần gọi mỗi ngày. Trong những kịch bản này, tốc độ, chi phí mỗi lần gọi và tỷ lệ thành công trên mỗi nhiệm vụ thường quan trọng hơn cả vị trí số một trên bảng xếp hạng.

3.8 Flash cũng cho thấy mâu thuẫn trong con đường này: mô hình càng giỏi trong việc kiểm tra lại và làm việc liên tục, thì càng có khả năng tạo ra nhiều Token hơn, làm tăng chi phí cho mỗi tác vụ của các “mô hình rẻ hơn”. Do đó, trọng tâm của cuộc cạnh tranh trong tương lai giữa các Agent không chỉ là ai trả lời tốt nhất, mà còn bao gồm ai có thể xác định được khi nào nên tiếp tục suy nghĩ, khi nào sử dụng công cụ, và khi nào nên dừng lại.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.