Claude 5.1 vừa ra mắt, phía bên kia OpenAI Astra đã lập tức xuất hiện.
Bây giờ, ngay cả Google cũng có động thái mới. Tin đồn mới nhất cho biết Gemini 3.8 Flash sẽ ra mắt vào ngày mai.


Có vẻ như cộng đồng AI lại đang "đón Tết" rồi.
Gemini 3.5 Pro đã bị hủy, phiên bản lớn tiếp theo là 4.0
So sánh với việc ra mắt Gemini 3.8 Flash, nhiều người vẫn tò mò hơn: Gemini 3.5 Pro sẽ đến khi nào?!
Xin lỗi, đừng chờ nữa, Google đã từ bỏ...

Kể từ khi được thông báo tại hội nghị I/O tháng 5 năm nay, đã trôi qua gần 4 tháng, nhưng sự tiến hóa của Gemini 3.5 Pro còn kém xa cả Flash.
Google cũng buộc phải trực tiếp "hy sinh quân cờ".
May mắn thay, Gemini 4.0 đã đánh giá xuất sắc trong giai đoạn tiền huấn luyện, và quá trình huấn luyện sau đang diễn ra suôn sẻ.


Bài độc quyền từ WSJ còn dự báo mạnh mẽ về khả năng lập trình ấn tượng của Gemini 3.8 Flash (mã hiệu "Skimaki").
Theo tuyên bố, trong các bài kiểm tra so sánh công cụ mã hóa nội bộ của Google là Jetski, 3.8 Flash đã áp đảo hoàn toàn mô hình Opus.
Moreover, this model has been under development for months, even before the "earthquake" at Google's leadership.
Hassabis nhường vị trí, Jeff Dean, nhà khoa học trưởng, rời đi, khiến nhiều người lo lắng về tương lai của Gemini.

Tuy nhiên, hiện tại mọi thứ dường như đang diễn ra một cách trật tự trong nội bộ.
Hiện tại, Google lên kế hoạch ra mắt Gemini 3.8 Flash trước vì mô hình này có tham số nhỏ, yêu cầu tính toán ít hơn và dễ dàng đạt được kết quả hơn.
Theo thông tin từ những người trong cuộc, kể từ đầu năm nay, Google đã tăng cường nhân lực và sức mạnh tính toán chuyên dụng để nâng cao khả năng viết mã của Gemini.
Đặc biệt, đã tăng cường đầu tư vào "học tăng cường", giúp AI học được những kỹ năng mới thông qua việc thử và sai liên tục.
Hơn nữa, Google DeepMind và các phòng thí nghiệm khác đang đồng thời thúc đẩy nhiều dự án, vì vậy ngay cả khi dự án này không thành công, một dự án khác vẫn có thể thay thế.
Gemini 3.5 Pro không đạt kỳ vọng, nhưng Gemini 4.0 vẫn chưa ra mắt.
Hiện nay, hai "đại gia" của Thung lũng Silicon là OpenAI và Anthropic đã rất nổi bật trong các mô hình tiên tiến và Agent lập trình.
Information cho biết, thế hệ tiếp theo của OpenAI, Astra, còn sử dụng một phương pháp suy luận mới gọi là “độ sâu tuần hoàn” (recurrent depth), giúp giảm số lượng token suy nghĩ đồng thời tăng đáng kể hiệu suất.
这张王牌,即将在本周揭晓。

And right now, Google has to deliver something.
Sau khi劈柴 đưa ra cam kết, trong vài tháng qua, ngoài việc ra mắt một mô hình 3.7 Flash, họ chưa tung ra bất kỳ mô hình nào khiến cộng đồng AI hào hứng.
Có thể ngay tối nay, Gemini 3.8 Flash sẽ ra mắt.

Gemini lần đầu tiên, đã biết tự xem video
Trước khi phát hành chính thức, hôm nay Google đã tạo sự chuẩn bị trước bằng cách bổ sung một tính năng mới cho Gemini—
Hiểu video bằng tác nhân
Tính năng này thật sự rất tuyệt vời.
Tải lên một đoạn video từ sự kiện I/O, cùng một mô hình Gemini 3.7 Flash, lượng token tiêu thụ giảm trực tiếp 88%.

Google cho biết trên blog chính thức rằng ba mô hình Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite đều có khả năng hiểu video theo phương pháp agentic, có thể truy cập thông qua Google AI Studio và Gemini Enterprise Agent Platform.
Bật công tắc này trên các tiêu chuẩn phân tích video chuẩn, lượng token tiêu thụ giảm tối đa 88%, chi phí phân tích giảm tối đa 66%, và độ chính xác lại tăng lên tối đa 7%.

Và không thu thêm một xu nào, vẫn sử dụng định giá token theo API tiêu chuẩn. Tiết kiệm tiền và độ chính xác thường xung đột với nhau, nhưng lần này thì không xảy ra xung đột.

Vì Gemini đã học được cách "kéo thanh tiến độ".
Cách xử lý trước đây được gọi là xử lý "tĩnh", mô hình tiếp nhận dòng hình ảnh với khung hình cố định một cách bị động, tốc độ khung hình được xác định cứng bởi tham số API, mô hình không có quyền quyết định.
Bây giờ, mô hình tự đưa ra quyết định xem nên xem đoạn nào, tốc độ bao nhiêu, xem hình ảnh, nghe âm thanh hay đọc trực tiếp bản chuyển văn bản.

Đây không phải lần đầu tiên Google làm điều này.
Tầm nhìn agentic trước đây đã kết hợp thực thi mã với khả năng hiểu hình ảnh bản địa của Gemini, cho phép mô hình tự viết mã để phóng to, cắt xén và so sánh một bức ảnh.
Lần này đến lượt video, ý tưởng tương tự, chỉ thay công cụ bằng công cụ video gốc.
Bốn công việc trước đây rất khó làm
Các kịch bản ứng dụng khó khăn cũng được liệt kê trong blog chính thức.
Tìm kiếm đoạn ngắn dưới một giây. Trước đây, mô hình “xem” video, một giây chỉ trích xuất một khung hình. Vấn đề là, nhiều thứ chỉ lướt qua trong chưa đầy một giây.
Bây giờ có thể xác định chính xác những khoảnh khắc này trong thời gian chưa đầy một giây.
Điều này có nghĩa là việc "cắt tự động" lần đầu tiên trở nên thực sự khả thi: trước đây, các biên tập viên phải tự mình dò tìm trên đường thời gian, từng khung hình một để xác định điểm cắt phù hợp, giờ đây có thể để mô hình quét qua trước, đánh dấu các điểm cắt tiềm năng, sau đó con người chỉ cần chọn lọc.

Tìm kim trong đống rơm dài. Đặt một câu hỏi phức tạp trong hàng giờ tài liệu, không cần tiêu tốn hàng triệu token.
Phát hiện bất thường. Sau khi mô hình xác định một khung thời gian cụ thể, có thể tăng tỷ lệ khung hình và lấy mẫu lại đoạn đó để làm rõ chuyển động nhanh và các khuyết điểm hình ảnh tinh vi. Các ứng dụng kiểm tra chất lượng trên dây chuyền sản xuất và giám sát an ninh đặc biệt cần đến điều này, vì bất thường thường chỉ xảy ra trong vài giây đó.
Đếm. Những câu hỏi như một hành động lặp lại bao nhiêu lần, trong khung hình có bao nhiêu vật thể khác nhau, mô hình trước đây luôn sai một cách ổn định, và lý do rất đơn giản: những khung hình bị bỏ sót đúng lúc có vật thể.

Agent cuối cùng cũng xem video rồi
Video has always been the most expensive among all modalities.
Văn bản rẻ, hình ảnh thì ổn, nhưng video lại lớn và dài, chỉ một phút đã tiêu tốn token tương đương một cuốn sách.
Vì vậy, trong hai năm qua, mọi người khi nói về Agent, chủ yếu vẫn đang nói về khả năng đọc, viết và sử dụng công cụ của nó.
Vấn đề là, một tác nhân chủ yếu dựa vào văn bản để hiểu thế giới, thực ra chỉ nhìn thấy một thế giới đã bị người khác “kể lại”.
Nó không biết gì về những thứ được quay bởi camera, ghi lại trong cuộc họp hay trôi qua trên dây chuyền sản xuất—những thứ không ai muốn bỏ thời gian chuyển thành văn bản.
Bây giờ, đường chi phí này đã bị cắt giảm đáng kể.
Một Agent nếu có thể tự mình xử lý hàng giờ giám sát, hàng chục giờ khóa học, hàng trăm tài liệu mà vẫn không làm cạn ngân sách, thì cách nó tiếp cận thế giới đã thay đổi.
Nó không còn phải chờ người ta mô tả lại hình ảnh dưới dạng văn bản để cung cấp cho nó, cũng không còn phải lựa chọn giữa “nhìn thấy” và “nhận diện chính xác”.
Google đã trở thành người phá vỡ thế bế tắc này.
Cuộc chiến AI, vòng tiếp theo
Trong những ngày qua, lịch phát hành của bốn bên gần như trùng nhau.
Claude 5.1 vừa đến, OpenAI Astra đã ở ngay cửa, còn Google đã nín nhịn vài tháng và cuối cùng cũng tung ra Gemini 3.8 Flash để đối đầu.
Sau bản cập nhật này, Claude hiện tập trung vào hai lĩnh vực chính: lập trình và nghiên cứu khoa học.
Astra thế hệ tiếp theo sẽ trở thành một “đối tượng liên tục”, theo lời của Ultraman, khả năng sử dụng máy tính của nó đã đạt mức ngang bằng con người.

Gemini 3.8 Flash cũng sẽ có bước nhảy vọt lớn hơn trong lĩnh vực lập trình.
Hiện tại, OpenAI, Anthropic, Google và SpaceXAI đã cùng nhau tăng tốc tối đa.

Musk dự kiến ra mắt Grok 4.7 sau 10 ngày
Cuộc hỗn chiến này mới chỉ bước vào giai đoạn khốc liệt nhất.
Tài liệu tham khảo:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Bài viết này đến từ tài khoản WeChat “Xin Trí Nguyên”, tác giả: ASI Khải Huyền
