Gemini 3.8 Flash của Google thách thức các mô hình AI hàng đầu với chi phí thấp và hiệu suất cao

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Tin tức altcoin nổi bật khi Google ra mắt Gemini 3.8 Flash và phiên bản an ninh mạng của nó, Gemini 3.8 Flash Cyber. Mô hình này có giá 0,58 USD mỗi triệu token cho tác vụ đơn lẻ và 0,75 USD cho đầu vào, vượt trội hoặc ngang bằng GPT-5.6 Sol và Grok 4.6. Gemini 3.8 Flash Cyber đạt 86,2% trong các bài kiểm tra CyberGym và phát hiện các lỗ hổng nghiêm trọng trong hai giờ. Sự tập trung của Google vào tốc độ, chi phí thấp và suy luận lặp đi lặp lại đang làm thay đổi cảnh quan tin tức AI + crypto, thách thức mô hình “càng lớn càng tốt”.

Vừa mới đây, Google đã quay trở lại!

Đêm nay, Google chính thức ra mắt Gemini 3.8 Flash và Gemini 3.8 Flash Cyber chuyên về an ninh mạng.

Đây là phiên bản Flash thứ ba mà Google phát hành liên tiếp trong vòng sáu tuần.

Hai lần cập nhật trước chỉ như là khởi động, vì lần này, Google đã trực tiếp đưa giá trị lợi ích lên hàng đầu—

Chi phí cho mỗi nhiệm vụ là 0,58 USD! Nhập chỉ 0,75 USD/ triệu Tokens!

Chính là một mô hình nhỏ với giá “rẻ như bèo” này, đã vượt qua ngưỡng của các mô hình hàng đầu thế giới Opus 5, GPT-5.6 Sol và Grok 4.6 trong nhiều bài kiểm tra tiêu chuẩn cốt lõi.

Chuyên gia của Google DeepMind, Yao Shunyu, đánh giá: Đối với mô hình, đây chỉ là một bước nhỏ; nhưng đối với RSI, đây là một bước nhảy vọt lớn.

Google

Trên X, các nhà phát triển đã bùng nổ.

Sau khi thử nghiệm thực tế, một người dùng đặt câu hỏi sâu sắc: “Trời ơi, Google có giao nhầm hàng không? Đây không phải chính là Gemini 3.5 Pro mà vẫn chưa được phát hành sao? Giá bằng Flash nhưng lại làm công việc của Pro!”

Google

Google

Trong đội ngũ DeepMind, có lẽ đã có người không ngủ từ tháng Bảy.

Trong khi mọi người vẫn đang hấp thụ Fable 5.1, Google lại một lần nữa lật bàn cờ.

Google "vua cuộn" đã trở lại: Vua giá trị tuyệt vời

Google, sau một thời gian dài im lặng, đã công bố với thế giới bằng cách cực kỳ cạnh tranh rằng: vị ác ma đã trở lại.

Google

Để hiểu được sự ấn tượng mà Gemini 3.8 Flash mang lại, chúng ta cần xem xét bối cảnh thị trường AI hiện tại.

Trong thử nghiệm Artificial Analysis, một rào cản cực kỳ nghiêm ngặt đã được hình thành. Để sở hữu trí tuệ cấp cao (Chỉ số Trí tuệ khoảng 60 điểm), bạn phải trả một chi phí Token rất cao.

Kết quả là, Gemini 3.8 Flash giống như một sát thủ, hoàn toàn không theo đạo nghĩa.

Trong chế độ suy luận cao của Artificial Analysis, chỉ số thông minh của Gemini 3.8 Flash đã tăng vọt lên 59 điểm!

Google

Đây là khái niệm gì? Nó chỉ cách xa GPT-5.6 Sol và Grok 4.6 một bước, thậm chí còn vượt trội hơn Claude Opus 5 ở một số khía cạnh!

Và chi phí để thực hiện tất cả những điều này là bao nhiêu? Chi phí cho mỗi tác vụ chỉ là 0,58 đô la.

Cụ thể, chi phí đầu vào duy trì ở mức 0,75 USD/million Tokens, đầu ra là 3,75 USD/million Tokens.

Google đã tạo một biểu đồ: Trên ranh giới Pareto giữa trí tuệ và chi phí, chấm xanh đại diện cho Gemini 3.8 Flash nằm ở góc trên bên phải của bộ tiêu chuẩn phần mềm DeepSWE, bỏ xa vị trí thứ hai một khoảng cách lớn.

Google

Gemini 3.8 Flash không chỉ thông minh mà còn nhanh đến mức kinh ngạc. Tốc độ tạo ra của nó đạt mức ấn tượng 305 tokens/giây, trong khi mô hình kế tiếp chỉ đạt được 154 tokens/giây.

Một mô hình nhanh, thông minh và rẻ như không mất tiền—đó mới là mô hình mà con người thực sự có thể dùng hàng ngày.

Google

Đặc biệt trên bộ cơ sở dữ liệu kỹ thuật phần mềm chu kỳ dài (DeepSWE v1.1), 3.8 Flash đạt thành tích ấn tượng 73,7%.

Trong bài kiểm tra yêu cầu AI tự giải quyết các vấn đề kỹ thuật phức tạp và viết mã端到端, nó không chỉ vượt trội hơn hầu hết các mô hình lớn tiên tiến đắt tiền, mà chi phí chỉ bằng một phần nhỏ của chúng.

Hãy nhớ rằng, đây chỉ là phiên bản «Flash», không phải «Pro», càng không phải «Ultra».

Lần này, Google lại một lần nữa để các mô hình nhỏ lấy mất cơ hội của các mô hình cao cấp.

Một người đã tự kiểm nghiệm Gemini 3.8 Flash và Opus 5 thực hiện cùng một nhiệm vụ.

Google

Sự tăng vọt đáng kể về khả năng lập trình này không phải là ngẫu nhiên.

Google

Sự tăng vọt đáng kể về khả năng lập trình này không phải là ngẫu nhiên.

Theo báo cáo, trong các bài kiểm tra công cụ mã nguồn nội bộ của Google mang tên Jetski, các kỹ sư của Google thậm chí còn ưa thích sử dụng 3.8 Flash hơn là mô hình Opus của Anthropic.

Google

Đằng sau điều này là Google đã đầu tư mạnh nguồn lực vào học tăng cường từ đầu năm — giai đoạn “tinh chỉnh cuối cùng” trong đào tạo mô hình, giúp mô hình thực sự học cách làm việc thông qua thử và sai.

Google DeepMind đã thành lập một đội đặc nhiệm mã nguồn, tập trung vào việc nâng cao khả năng của các mô hình lập trình, đội này do CTO của DeepMind dẫn đầu và được đồng sáng lập Sergey Brin giám sát trực tiếp.

Mục tiêu của họ là ép buộc sự tự tiến hóa lặp lại, buộc mô hình lập trình phải chuyển đổi thành một nhà nghiên cứu AI tự động hoàn toàn,打通 toàn bộ chu kỳ nghiên cứu và phát triển.

Google

Trong memo nội bộ, Google đã nói trực tiếp:

Để giành chiến thắng trong đợt nước rút cuối cùng, chúng ta phải khẩn trương thu hẹp khoảng cách trong thực thi tác nhân và biến mô hình của mình thành nhà phát triển chính.

Google

Ngoài ra, Google còn thu hút Barret Zoph – đồng sáng lập Thinking Machines Lab, cựu trưởng bộ phận hậu huấn luyện tại OpenAI, hiện đảm nhiệm vị trí Phó chủ tịch nghiên cứu, phụ trách lĩnh vực học tăng cường và hậu huấn luyện. Động thái này rõ ràng cho thấy họ quyết tâm theo đuổi đến cùng.

Tháng trước, đồng sáng lập và người đoạt giải Nobel Demis Hassabis đã rời vị trí CEO, và người kế nhiệm Koray Kavukcuoglu ngay lập tức tuyên bố: Tăng tốc, tăng tốc, và lại tăng tốc.

Cơ sở "bơm nước", hay thực lực vượt trội?

Tuy nhiên, trong tiếng reo hò, Google thường bị chỉ trích vì đã mở champagne quá sớm, vui mừng quá sớm.

Google

Điều khiến bạn khó chịu nhất là Meta——

Meta’s Muse Spark 1.3 và Gemini 3.8 Flash gặp nhau, với Muse Spark 1.3 đạt 62 điểm trên chỉ số trí tuệ của Artificial Analysis, ngang bằng với Claude Fable 5, lọt vào nhóm hàng đầu.

Trong khi đó, chi phí đầu vào của Muse thấp hơn 8 lần so với Fable 5, chi phí đầu ra thấp hơn gần 12 lần, mang lại hiệu quả chi phí tối ưu.

Alexandr Wang, Cố vấn AI hàng đầu của Meta, trực tiếp chế giễu: Trên chỉ số trí tuệ nhân tạo Artificial Analysis, Gemini chẳng là gì cả, chỉ có thể hít khói thải từ các mô hình khác.

Google

Google

Muse Spark 1.3 đạt điểm cao hơn GPT-5.6 Sol, Grok 4.6 và Gemini 3.8 Flash, nhưng hiện chỉ ở chế độ xem trước hạn chế.

Có người chỉ ra rằng, mặc dù biểu đồ kiểm tra hiệu năng của 3.8 Flash trông đẹp mắt, nhưng trong thực tế thì chưa chắc đã như vậy.

Đúng vậy, Gemini 3.8 Flash đã vượt qua GPT-5.6 Sol và Opus 5 trong các bài kiểm tra Terminal-Bench 2.1, HLE, nhưng khoảng cách điểm số lớn giữa TBench 2.1 và TBench 4 cho thấy có thể tồn tại một phần nào đó của việc “thao túng bảng xếp hạng”.

Nói cách khác, khi đối mặt với các thách thức Zero-shot thực tế mới mẻ và chưa được bao gồm trong bộ dữ liệu huấn luyện, 3.8 Flash rất có thể vẫn thua kém các mô hình khổng lồ như Opus 5.

Nhưng giải pháp của Google cực kỳ thông minh – cần cù bù thông minh.

Như Google đã nêu trong blog chính thức: “Những cải tiến hiệu suất này xuất phát từ các lựa chọn thiết kế cốt lõi: 3.8 Flash làm việc chăm chỉ hơn.”

Khi đối mặt với các nhiệm vụ phức tạp, 3.8 Flash được thiết kế để thực hiện các bước suy luận bổ sung và liên tục lặp lại việc gọi công cụ. Khi gặp câu hỏi không hiểu, nó không hề bỏ cuộc, mà thay vào đó sẽ tiêu tốn thêm Token để thực hiện việc tự xác minh và phản tư nhanh chóng bên trong.

Mặc dù nó tiêu tốn nhiều Token hơn do thực hiện nhiều vòng suy nghĩ, nhưng do giá cơ bản quá rẻ (0,75 USD/million tokens), tính tổng chi phí thì nó vẫn rẻ hơn nhiều so với việc bạn gọi trực tiếp GPT-5.6!

Chiến lược này đã trực tiếp phá vỡ cuộc cạnh tranh một chiều trước đây cho rằng "tham số lớn = khả năng mạnh".

Nó chứng minh rằng: trong một chu trình Agent hoàn hảo, tốc độ và chi phí suy luận cực thấp chính là một dạng trí tuệ mạnh mẽ.

Tại sao lại phát Flash? Bản Pro "bị hủy bỏ"

Lần này, Google có thực sự giao đúng hàng không?

Gemini 3.5 Pro đến nay vẫn chưa xuất hiện. Gemini 4 thế hệ tiếp theo, dù dữ liệu tiền huấn luyện khá ấn tượng, nhưng giai đoạn huấn luyện sau vẫn chưa hoàn tất.

Google

Thực tế, việc Google trì hoãn phát hành phiên bản Pro đằng sau là một câu chuyện đầy khó khăn.

Pǐ Chái từng tự hứa vào tháng 5 năm nay rằng sẽ ra mắt dòng Pro mạnh mẽ hơn vào "tháng tới", nhưng mãi vẫn chưa thực hiện.

Thực tế, bên trong Google ban đầu có vài mô hình ứng cử viên cho 3.5 Pro, nhưng tất cả đều bị loại bỏ một cách vô tình — vì chúng không vượt trội hơn đáng kể so với dòng Flash hiện tại!

Đồng thời, thế hệ sản phẩm chủ lực tiếp theo được mong đợi chờ đợi, Gemini 4, dù có biểu hiện tốt trong đánh giá tiền huấn luyện, hiện vẫn đang bị kẹt ở giai đoạn hậu huấn luyện quan trọng nhất.

Tóm lại, mọi thứ đã vô tình tạo nên sự cải tiến điên cuồng của dòng Flash.

Phát hiện lỗ hổng mất vài tháng chỉ trong 2 giờ: Đỉnh cao trong lĩnh vực an ninh mạng

Lần này, Google chỉ đang đẩy giá trong các nhiệm vụ thông thường với 3.8 Flash?

Far beyond that.

Vũ khí thực sự của buổi ra mắt này chính là người anh em song sinh của nó—Gemini 3.8 Flash Cyber.

Các nhà phát triển cũng phải thốt lên: “Rốt cuộc là nhiệm vụ bảo mật nào lại đáng để Google tạo ra một phiên bản chuyên biệt Cyber riêng cho Flash?”

Câu trả lời của Google là: Để chống lại các tin tặc AI trong tương lai.

Trên nền tảng kiểm tra CyberGym nơi lỗ hổng được phát hiện, 3.8 Flash Cyber đạt điểm 86,2%, dẫn đầu tuyệt đối và vượt xa các mô hình lớn trước đó.

Hơn nữa, mã trong thế giới thực không chỉ có C/C++.

Trong các bài kiểm tra tổng hợp trên kho mã phức tạp trải dài 20 ngôn ngữ lập trình bên trong Google, mô hình này đã đạt tỷ lệ thành công hơn 70% trong việc phát hiện các lỗ hổng rộng rãi.

Điều đáng kinh ngạc hơn là thành tích thực chiến của nó trong thế giới thực.

Đội ngũ bảo mật Chrome đã sử dụng nó để thử nghiệm và phát hiện rằng số lượng bản vá sửa lỗi chính xác mà nó tạo ra nhiều gấp 2,6 lần so với mô hình thương mại tốt nhất trước đây trên thị trường, vốn có kích thước lớn hơn nhiều.

Công ty bảo mật Wiz phát hiện rằng tỷ lệ phát hiện trong bài kiểm tra xâm nhập của họ đã tăng 7,5-9,7%, trong khi chi phí giảm từ 2,3 đến 5,2 lần.

Điều đáng ngạc nhiên nhất là nhóm nghiên cứu lỗ hổng của Google Cloud đã sử dụng nó để phát hiện một lỗ hổng nền tảng then chốt chỉ trong vòng 2 giờ — trong khi trước đây, các chuyên gia hàng đầu con người thường mất vài tháng để tìm ra lỗ hổng như vậy!

Trong CWE-Bench (kiểm tra khả năng vá lỗi), tỷ lệ vượt qua lần đầu của 3.8 Flash Cyber đạt 47,2%, gần ngang với các mô hình lớn tiên tiến nhất (47,8%), nhưng giá thành chỉ bằng một phần nhỏ.

Google

Chính vì khả năng phá hoại trong các cuộc tấn công và phòng thủ mạng của 3.8 Flash Cyber quá đáng kinh ngạc, Google đã không chọn cách mở nguồn hoàn toàn, mà thay vào đó chỉ mở cho các tổ chức đáng tin cậy thông qua chương trình Fairwind hoàn toàn mới.

OpenAI, Anthropic và Google: Cuộc chiến ba cường quốc mô hình lớn bước vào ngưỡng phân hóa

Thông qua việc ra mắt Gemini 3.8 Flash, có thể thấy ba ông lớn AI hiện nay đã đi theo ba con đường phát triển hoàn toàn khác biệt.

Anthropic (họ Claude) tập trung vào "độ tin cậy và ổn định của kiến thức".

Trong các bài kiểm tra ưu tiên phạm vi kiến thức và độ chính xác sự thật (như AA-Omniscience), Claude vẫn là sự áp đảo hoàn toàn.

Bảy vị trí đầu đều là các mô hình thuộc dòng Claude, hiện tại họ rõ ràng đang tăng cường khả năng không mắc lỗi trong các nhiệm vụ doanh nghiệp, hướng tới đầu ra ổn định.

OpenAI (họ GPT), đặt cược vào “suy luận sâu và sự thức tỉnh”.

Trong bài kiểm tra CritPt thiên về vật lý và suy luận toán học, GPT-5.6 Sol dẫn đầu một cách vượt trội.

OpenAI đang theo đuổi một sự trỗi dậy trí tuệ thuần túy, yêu cầu mô hình tự mình “suy nghĩ” ra câu trả lời mà không cần ai chỉ dẫn, giống như một nhà khoa học.

Google (dòng Gemini) đang xây dựng “người lao động siêu tốc với chu trình vô tận”.

Lần này, Google đưa ra câu trả lời thứ ba: Có lẽ tôi không thể giải ngay được bài toán vật lý khó nhất, nhưng tôi phản ứng cực nhanh và chi phí cực thấp.

Trong thời đại của Agent, tôi có thể suy nghĩ 100 lần trong một giây, viết mã, chạy, gặp lỗi, sửa đổi, dùng phương pháp lặp lại thô bạo với chi phí cực thấp để ép ra kết quả chính xác.

Agen gặp khó khăn trong thực tế, cần thử và sai nhiều lần, gọi công cụ và điều chỉnh linh hoạt.

Và Gemini 3.8 Flash thực sự được thiết kế riêng cho các "luồng công việc dài hạn" như thế này.

Bạn có thể chỉ cần dùng một từ khóa kèm lệnh lặp trong Google Antigravity để 3.8 Flash tự động tạo ra một trò chơi đầy đủ bao gồm câu đố, bản đồ môi trường và cấp độ 3D.

Bạn có thể dùng nó để tạo bản đồ Google phiên bản DOS với hình ảnh đường phố và định hướng chỉ với một cú nhấp.

Rõ ràng, tính dễ sử dụng và chi phí của Gemini 3.8 Flash đã vượt qua một điểm kỳ dị.

Sự ra đời của Gemini 3.8 Flash giống như một thông điệp của Google gửi đến toàn ngành: các mô hình lớn đang thoát khỏi trạng thái “chỉ có các ông lớn mới dùng được” và lao vào cuộc đua phổ cập năng lực tính toán.

Những nhiệm vụ agent trước đây cần chi vài chục nghìn USD và chạy vài ngày đêm, giờ đây chỉ cần vài cốc cà phê và vài phút là xong.

Thời đại của những cá nhân siêu việt thuộc về người bình thường đã thực sự đến.

Đây là thời khắc thức tỉnh của các mô hình nhỏ.

Tài liệu tham khảo:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Biên tập: Aeneas David

Bài viết này đến từ tài khoản WeChat “Xin Trí Nguyên”, tác giả: ASI Khải Huyền

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.