Iilunsad ng Google ang Gemini 3.8 Flash bukas, nakatuon sa coding at pag-unawa sa video

icon MarsBit
I-share
AI summary iconSummary
Lumulunsad ang Google ng Gemini 3.8 Flash bukas, isang malaking balita sa paglunsad ng token sa larangan ng AI. Ang modelo, na may code name na 'Skimaki,' ay nagpapabuti sa coding at pag-unawa sa video habang binabawasan ang paggamit ng token hanggang 88%. Ang Gemini 3.5 Pro ay nakansela, at ang pag-unlad ay nailipat sa Gemini 4.0. Ipinaliliwanag ng on-chain na balita na ginagawa rin ng Google ang agentic video understanding para sa dinamikong pag-analisa ng nilalaman.

Kasalukuyang ipinakilala si Claude 5.1, habang agad nang dumating ang OpenAI Astra.

Ngayon, kahit ang Google ay may bagong galaw. Ang pinakabagong lekso, ang Gemini 3.8 Flash ay magde-debut bukas.

Google

Google

Mukhang ang AI community ay magkakaroon ng 'Bagong Taon' muli.

Nasuspens ng Gemini 3.5 Pro, ang susunod na malaking bersyon ay 4.0

Kaysa sa paglalabas ng Gemini 3.8 Flash, mas naiisip ng marami: Kailan ba talaga darating ang Gemini 3.5 Pro?!

Pasensya na, huwag nang maghintay, nagpapahinto na ang Google...

Google

Mula nang ipinahayag ang I/O Conference noong Mayo ng taong ito, nakalipas na ang halos 4 na buwan, at ang pag-unlad ng Gemini 3.5 Pro ay hindi kahit paano katulad ng Flash.

Ang Google ay mayroon ding walang pagpipilian, direktang「iniiwan ang pawn」.

Mas mainam, ang Gemini 4.0 ay nagpakita ng mahusay na pagganap sa pre-training, at ang post-training ay patuloy na umaabot sa tamang landas.

Google

Google

Ang eksklusibong ulat mula sa WSJ ay nagpapahayag din ng malakas na kakayahan sa pagprograma ng Gemini 3.8 Flash (kode: «Skimaki»).

Ayon sa mga ulat, sa mga paghahambing na pagsusulit sa loob ng Google gamit ang Jetski, direktang lalong nagsikat ang 3.8 Flash sa harap ng Opus model.

At ang modelo na ito ay ginawa nang ilang buwan, bago pa ang "malaking pagbabago" sa pamamahala ng Google.

Inalis ni Hassabis ang kanyang posisyon, at umalis si Jeff Dean, ang Chief Scientist, na nagdulot ng pag-aalala sa marami tungkol sa kinabukasan ng Gemini.

Google

Gayunpaman, sa kasalukuyan, tila lahat ay nasa magandang pagkakasunod-sunod sa loob.

Kasalukuyan, plano ng Google na unang ilunsad ang Gemini 3.8 Flash dahil mas maliit ang parametrong ito, mas kaunti ang kinakailangang kompyutasyon, at mas madaling makamit ang mga resulta.

Ayon sa mga loob, simula sa simula ng taong ito, inilagay ng Google ang mas maraming tao at computing power para lalo pang mapabuti ang kakayahan ng Gemini sa pagsulat ng code.

Lalo na ang pagpapalakas ng pagsisikap sa «reinforcement learning», upang matutunan ng AI ang mga bagong kasanayan sa pamamagitan ng patuloy na pagsubok at pagkakamali.

At ang Google DeepMind at iba pang mga laboratorio, pinapagana ang maraming proyekto nang sabay-sabay, kaya kahit hindi umabot ang isa, may iba pang maaaring magtuloy.

Hindi nakamit ng Gemini 3.5 Pro ang mga inaasahan, ngunit ang Gemini 4.0 ay hindi pa nabuo.

Ngayon, ang dalawang pangunahing kompanya sa Silicon Valley, ang OpenAI at Anthropic, ay napakasigla na sa mga pinakamoderno na modelo at programming Agent.

Ayon sa Information, ang susunod na henerasyon ng OpenAI na Astra ay gumagamit din ng isang bagong paraan ng pag-iisip na tinatawag na “recurrent depth,” na nagpapabawas sa bilang ng thinking token habang pinapalakas ang performance.

Ang card na ito ay mababalewala sa linggong ito.

Google

At ngayon, kailangan ng Google na ipakita ang ilang bagay.

Sa katotohanan, mula noong ipinangako ni劈柴, wala nang ibinigay na modelo na nakapagpapalakas ng interes sa AI community kundi ang isang 3.7 Flash.

Maaaring mag-debut ngayong gabi ang Gemini 3.8 Flash.

Google

Gemini, una nito, nakakakita na ng mga video

Bago ang pagpapalabas, nagbigay ang Google ng isang pagpapalakas ngayon sa araw na ito, nagdagdag ng isang bagong kakayahan sa Gemini—

Pagsusuri sa Video ng Agente

Ang tampok na ito, talagang nagdala ng malaking puntos.

I-upload ang isang video mula sa I/O conference, parehong modelong Gemini 3.7 Flash, bumaba nang 88% ang paggamit ng tokens.

Google

Sinabi ng Google sa kanilang opisyal na blog na ang tatlong modelong Gemini 3.7 Flash, 3.6 Flash, at 3.5 Flash-Lite ay may kakayahang agentic na pag-unawa sa video, at ang entry point ay nasa Google AI Studio at Gemini Enterprise Agent Platform.

I-open ang switch sa standard video analysis benchmark, bawasan ng hanggang 88% ang token consumption, bawasan ng hanggang 66% ang analysis cost, at tumaas nang hanggang 7% ang accuracy.

Google

At walang dagdag na bayad, patuloy pa rin ang standard API na presyo ng token. Ang pag-save at pagiging akurat ay karaniwang nagtatampukan. Ngayon, hindi nag-away.

Google

Dahil natutunan ng Gemini ang "drag progress bar".

Ang dating paraan ng pagtrato ay tinatawag na "statik" na pagtrato, kung saan ang modelo ay pasibong tumatanggap ng stream ng mga frame na may fixed frame rate, na nakakabit sa API parameter, at walang awtoridad ang modelo.

Ngayon, ang modelo ang magdedesisyon kung anong bahagi ang sasabihin, gaano kalakas ang pagtingin, kung tingnan ang larawan, marinig ang audio, o basahin nang direkta ang transkripsyon.

Google

Hindi ito ang unang beses na ginawa ng Google.

Noong una, ang agentic vision ay nagpagsama ng code execution at native image understanding ng Gemini, kaya ang modelo ay nakakasulat ng sariling code para i-zoom in, i-crop, at i-compare ang isang larawan.

Ngayon naman ang video, parehong ideya, ngunit ang gamit ay nalipat sa native video tool.

Apat na mga gawain na dati ay mahirap gawin

Ang opisyal na blog ay naglalista rin ng ilang mga aplikasyon na may mataas na antas ng kahirapan.

Sub-second fragment retrieval. Sa nakaraang mga modelo, “nakikita” ng model ang video at nag-aangkat ng isang frame bawat segundo. Ang problema ay, maraming bagay na lumalabas nang higit sa isang segundo.

Ngayon ay maaari nating matukoy ang mga sandaling ito sa mas maliit sa isang segundo.

Ibig sabihin nito na ang "auto-cutting" ay unang maaaring gawin nang totoo: dati, kailangan ng mga editor na magtrabaho sa timeline, frame by frame, upang makita kung saan dapat gawin ang cut; ngayon, maaari muna nilang hayaan ang model na basahin ang buong video at markahan ang mga posibleng cut points, at pagkatapos ay piliin lamang ng tao.

Google

Tulad ng paghahanap ng karayom sa isang mahabang video. Magtanong ng isang kumplikadong tanong sa mga oras ng materyal, nang hindi kailangang sunugin ang mga milyon na token.

Deteksyon ng anomali. Pagkatapos suriin ng modelo ang isang tiyak na oras na window, maaari itong pataasin ang frame rate para muling samplahin ang bahaging iyon, upang maingat na makita ang mabilis na galaw at mga maliit na kapansanan sa imahe. Ang pagsusuri sa linya ng produksyon at seguridad ay nangangailangan nito, dahil ang anomali ay nangyayari lamang sa ilang segundo.

Bilangin. Ang mga tanong tulad ng ilang beses paulit-ulit ang isang galaw, ilang iba’t ibang bagay ang nasa screen, ay dating mali nang patuloy, at ang dahilan ay simpleng: ang ilang frames na hindi nasamahan ay may mga bagay.

Google

Ang agent ay nag-start na ng video

Ang video ay laging pinakamahal sa lahat ng modalities.

Mura ang teksto, sapat ang imahe, pero malaki at mahaba ang video—isang minuto lang ay maaaring magamit ang token ng isang aklat.

Kaya sa loob ng dalawang taon na ito, ang lahat ng tao ay nag-uusap tungkol sa Agent, karamihan ay tungkol sa kanyang kakayahang basahin, sumulat, at gamitin ang mga kasangkapan.

Ang problema ay, ang isang Agent na batay sa pag-unawa sa teksto ay nakikita lamang ang isang mundo na "binabahagi" na ng iba.

Hindi alam nito ang anumang bagay na natanggap sa pamamagitan ng camera, tala ng pagpupulong, o sa produksyon na hindi gustong i-convert sa teksto ng sinuman.

Ngayon, binawasan ng malaki ang cost curve na ito.

Kung isang agent ay kayang mag-translate ng sarili nito sa ilang oras ng pagmamasid, ilang pulo oras ng klase, at daan-daang materyales nang hindi mabubulok ang budget, ang paraan nito sa pagkakaroon ng pagkakataon sa mundo ay nagbabago.

Hindi na ito kailangang maghintay na ikuwento ng tao ang imahe bilang teksto para sa iyo, at hindi na kailangang pumili sa pagitan ng “makita” at “makita nang tama”.

Google, ang unang nagbukas ng daan.

AI battle, next round

Sa mga araw na ito, ang mga jadwal ng paglalabas ng apat na kompanya ay halos nagkakasalungat.

Kasalukuyang dumating si Claude 5.1, ang OpenAI Astra ay nasa pinto na, at ang Google ay naghintay ng ilang buwan at naglabas na rin ng Gemini 3.8 Flash para makipaglaban.

Pagkatapos ng pag-update na ito, ang pangunahing layunin ng Claude ay ang dalawang larangan: paggawa ng code at siyentipikong pananaliksik.

Ang susunod na henerasyon ng Astra ay magiging isang “continuous agent,” at ayon sa mga salita ni Ultraman, ang kanyang kakayahan sa paggamit ng kompyuter ay nasa antas ng tao.

Google

Ang Gemini 3.8 Flash ay magkakaroon din ng mas malaking paglago sa pagprograma.

Ngayon, ang OpenAI, Anthropic, Google, at SpaceXAI ay parehong nagpapatakbo nang buong lakas.

Google

Inaasahan ni Musk ang paglalabas ng Grok 4.7 sa loob ng sampung araw

Ang gulo na ito ay just entering the most intense part.

Mga sanggunian:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Ang artikulong ito ay galing sa WeChat public account na “New Intelligence Yuan”, may-akda: ASI Revelation

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.