Ang Gemini 3.8 Flash ng Google ay nagtatalo sa mga pinakamataas na AI model sa mababang gastos at mataas na performance

icon MarsBit
I-share
AI summary iconSummary
Nakakabulalas ang pinakamataas na altcoin news habang ipinakilala ng Google ang Gemini 3.8 Flash at ang kanyang bersyon sa cybersecurity, Gemini 3.8 Flash Cyber. Ang modelo ay nagtatagpo ng $0.58 bawat milyong token para sa isang gawain at $0.75 para sa input, na lumalampas o tumutugma sa GPT-5.6 Sol at Grok 4.6. Ang Gemini 3.8 Flash Cyber ay nakakuha ng 86.2% sa mga pagsubok sa CyberGym at nakakatuklas ng mga kritikal na kamalian sa loob ng dalawang oras. Ang pagkakaroon ng pansin ng Google sa bilis, mababang gastos, at iteratibong pag-iisip ay nagbabago sa larangan ng AI + crypto news, na tinatapos ang modelo na “mas malaki ay mas mabuti”.

Just now, Google made a comeback!

Ngayong gabi, ipinakilala ng Google ang Gemini 3.8 Flash at ang Gemini 3.8 Flash Cyber na espesyalisado sa cybersecurity.

Ito ang ikatlong bersyon ng Flash na inilabas ng Google sa loob ng anim na linggo.

Ang dalawang nakaraang update ay tila lamang paghahanda, dahil sa pagkakataong ito, direktang isinampa ng Google ang value-for-money sa pinakamataas na antas—

Pera sa isang gawain: $0.58! Pagsasalin lamang: $0.75/milyong Tokens!

Isang maliit na modelo na may "presyo ng repolyo" lamang, nakamit nito ang antas ng mga pinakamalakas na flagship sa mundo—Opus 5, GPT-5.6 Sol, at Grok 4.6—sa maraming pangunahing benchmark test.

Ipinahayag ni姚顺宇 mula sa Google DeepMind: Para sa modelo, ito ay isang maliit na hakbang lamang; ngunit para sa RSI, ito ay isang malaking paglalakbay.

Google

Sa X, ang mga developer ay nagsabog.

Pagkatapos ng pagsusuri ng isang tao, isinampa niya ang isang malalim na tanong: “Oh my gosh, baka nagkamali ang Google sa pagpapadala? Ito ba ay ang Gemini 3.5 Pro na hindi pa ipinakita? Nagbabayad ng presyo ng Flash, ngunit gumagawa ng trabaho ng Pro!”

Google

Google

Sa loob ng team ng DeepMind, may ilan na siguro ay hindi nakatulog mula noong Hulyo.

Habang patuloy pa ang pagdedevelop ng lahat ng Fable 5.1, sinira ulit ng Google ang mesa.

Umulit ang “king of competition” ng Google: Ang hari ng value for money

Matagal nang walang gawaing Google, gamit ang napakadramatikong paraan, ay nagpahayag sa mundo: bumalik na ang malaking demon.

Google

Upang maunawaan ang pagkakaiba ng Gemini 3.8 Flash, kailangan nating tingnan muna ang kasalukuyang kalagayan ng merkado ng AI.

Sa orihinal na Artifisyal na Pagsusuri, nabuo na ang napakamatigas na hadlang. Upang makamit ang pinakamataas na antas ng katalinuhan (Intelligence Index na halos 60 puntos), kailangan mong magbayad ng mataas na gastos sa Token.

Ang resulta, ang Gemini 3.8 Flash ay parang isang assassin, talagang walang pagsunod sa mga alituntunin.

Sa mataas na mode ng pag-iisip ng Artificial Analysis, tumaas ang IQ ng Gemini 3.8 Flash hanggang 59 puntos!

Google

Ano ang konseptong ito? Ito ay isang hakbang lamang mula sa pinakamataas na GPT-5.6 Sol at Grok 4.6, at kahit na lumalampas sa ilang aspeto ang Claude Opus 5!

Ano naman ang gastos para sa lahat ng ito? Ang tanging gastos para sa isang task ay lamang $0.58.

Sa partikular, ang input cost ay nananatili sa $0.75/milyong Tokens, at ang output ay $3.75/milyong Tokens.

Ginawa ng Google isang graph: Sa Pareto frontier ng intelihensya at gastos, ang blue dot na kumakatawan sa “pinakaepeksiyon” na Gemini 3.8 Flash ay nasa kanang itaas ng software engineering benchmark na DeepSWE, at naiwan ng malayo ang pangalawang lugar.

Google

Ang Gemini 3.8 Flash ay hindi lamang matalino kundi pati na rin sobrang mabilis. Ang bilis ng pagbuo nito ay umabot sa nakakagulat na 305 tokens/s, habang ang susunod na antas ng modelo ay kumikinabang lamang sa 154 tokens/s.

Mabilis, matalino, at mura pa tulad ng libre—ito ang tunay na modelo na maaaring gamitin ng tao araw-araw.

Google

Lalo na sa DeepSWE v1.1, nakamit ng 3.8 Flash ang nakakagulat na marka ng 73.7%.

Sa pagsusulit na nangangailangan ng AI na malutas ang mga kumplikadong inhinyeriyang problema at isulat ang code nang end-to-end, ito ay hindi lamang lumampas sa karamihan sa mga mahal na pinakabagong malalaking modelo, kundi ang gastos ay tanging bahagya lamang ng kanilang gastos.

Alamin na, ito ay ang bersyon na «Flash» lamang, hindi ang «Pro», at mas hindi ang «Ultra».

Sa pagkakataong ito, bumagsak muli ang Google sa kamay ng maliit na modelo.

Sinubukan ng isang tao ang Gemini 3.8 Flash at Opus 5 sa parehong gawain.

Google

Ang malaking pagtaas sa kakayahan sa pag-program ay hindi nagaganap nang walang dahilan.

Google

Ang malaking pagtaas sa kakayahan sa pag-program ay hindi nagaganap nang walang dahilan.

Ayon sa mga ulat, sa mga pagsubok ng mga kagamitan sa code na Jetski sa loob ng Google, mas pinipili ng mga inhinyero ng Google ang 3.8 Flash kaysa sa modelong Opus ng Anthropic.

Google

Sa likod nito ay ang Google ay nagbigay ng malaking pondo sa reinforcement learning simula sa simula ng taon—o ang "huling pagpapabuti" sa pagtratrabaho ng model, kung saan natututo ang model sa pamamagitan ng pagsubok at pagkakamali.

Nagbuo ang Google DeepMind ng isang code strike team na nakatuon sa pagpapabuti ng kakayahan ng mga programming model, na pinamumunuan ng DeepMind CTO at direkta na pinagmamasdan ng co-founder Sergey Brin.

Ang kanilang layunin ay pilitin ang recursive self-evolution, at piliting baguhin ang programming model sa isang全自动 AI researcher, at buuin nang buo ang buong R&D loop.

Google

Sa internal memo, sinabi nang direkta ng Google:

Upang manalo sa huling pagpapabilis, kailangan nating agad na sagutin ang mga pagkakaiba sa pagpapatupad ng mga agent at gawin ang aming mga modelo bilang pangunahing developer.

Google

Bukod dito, kinuha rin ng Google si Barret Zoph—co-founder ng Thinking Machines Lab, dating head ng post-training sa OpenAI, at ngayon ay nagsisilbing vice president for research na namamahala sa reinforcement learning at post-training. Ang mga hakbang na ito ay malinaw na nagpapakita ng kanilang pagkakaroon ng determinasyon na ipagpatuloy.

Noong nakaraang buwan, ang co-founder at Nobel laureate na si Demis Hassabis ay umalis bilang CEO, at ang kanyang tagapagpaganap na si Koray Kavukcuoglu ay agad nagbigay ng mensahe: bilis, bilis, at muli ang bilis.

Base "watering", o talagang may kakayahan?

Gayunpaman, sa gitna ng mga pagsisigaw ng pagmamalaki, pinagmumuni-muni ng mga tao na agad na nagbukas ng champagne ang Google at nasisiyahan nang sobra.

Google

Ang pinakamalungkot ay ang Meta—

Ang Muse Spark 1.3 ng Meta at ang Gemini 3.8 Flash ay nakasalubong, at nakakuha ang unang ito ng 62 puntos sa Artificial Analysis Intelligence Index, na pareho na sa Claude Fable 5 at nasa pinakamataas na antas.

Mas mababa ang input cost ng Muse ng 8 beses at ang output cost nito ng halos 12 beses kaysa sa Fable 5, nagtataglay ito ng pinakamataas na halaga.

Direktang sinira ni Alexandr Wang, Chief AI Officer ng Meta: Sa Artificial Analysis Intelligent Index, wala lang ang Gemini at nagtatampok lamang ng hangin ng ibang modelo.

Google

Google

Mas mataas ang score ng Muse Spark 1.3 kaysa sa GPT-5.6 Sol, Grok 4.6, at Gemini 3.8 Flash, ngunit kasalukuyang limitadong preview lamang ito.

Ibinigay ng ilan na habang ang benchmark graph ng 3.8 Flash ay maganda, sa praktikal na paggamit, ay hindi laging ganun.

Totoo, ang Gemini 3.8 Flash ay lumampas sa GPT-5.6 Sol at Opus 5 sa mga pagsubok tulad ng Terminal-Bench 2.1 at HLE, ngunit ang malaking pagkakaiba sa puntos sa pagitan ng TBench 2.1 at TBench 4 ay nagpapakita na maaaring mayroong ilang “pagpapalit ng listahan” dito.

Ibig sabihin, kapag nakikibagay sa mga bagong hamon sa totoong mundo na Zero-shot na hindi kasama sa training set, mas malamang na mas mababa ang performance ng 3.8 Flash kumpara sa mga malalaking modelo tulad ng Opus 5.

Ngunit ang solusyon ng Google ay napakatalino—ang pagsisikap ay nakakapalit sa kakulangan.

Tulad ng sinabi ng Google sa kanilang opisyal na blog: "Ang mga pagpapabuti sa performance ay nagmumula sa pangunahing mga desisyon sa disenyo: 3.8 Flash ay gumagawa nang mas maraming pagsisikap."

Sa pagharap sa mga kumplikadong gawain, ang 3.8 Flash ay disenyo upang mag-execute ng karagdagang mga hakbang sa pag-iisip at paulit-ulit na mag-call ng mga kasangkapan. Kapag nakakatagpo ng isang tanong na hindi ito nauunawaan, hindi ito iiwan nang walang gawain, kundi gumagamit ng mas maraming Token upang magkaroon ng mabilis na self-validation at pagsusuri sa loob.

Kahit na ito ay gumagamit ng higit pang mga token dahil sa maraming pag-uulit ng pag-iisip, dahil sa sobrang mababang presyo nito (0.75 dolyar/milyong token), sa kabuuan, mas mura pa ito kaysa sa direkta mong paggamit ng isang beses na GPT-5.6!

Ang estratehiyang ito ay direktang nagbreak sa nakaraang isang dimensyon na kompetisyon na ang 'malaking parameter = malakas na kakayahan'.

Napatunayan nito: Sa isang perpektong Agent cycle, ang bilis at sobrang mababang gastos sa pag-iisip ay isang malakas na talino.

Bakit isinampa ang Flash? Ang "nasira" na Pro version

Totoo ba na hindi nagkamali ang Google sa pagpapadala nito?

Ang Gemini 3.5 Pro ay hindi pa rin nakikita hanggang ngayon. Ang susunod na henerasyon na pangunahing produkto, ang Gemini 4, ay may magandang pre-training data, ngunit ang post-training phase ay hindi pa natatapos.

Google

Sa totoo lang, ang pagkakaroon ng matagal na paghihintay ng Google para sa bersyon ng Pro ay may isang makapanghihikayat na kasaysayan.

Noong Mayo ng taong ito, sinabi ni Pi Chai na "bukas na buwan" ay ipapalabas ang mas makapangyarihang Pro series, ngunit patuloy pa ring pinaghintay.

Sa katotohanan, may ilang candidate models na 3.5 Pro sa loob ng Google, ngunit lahat ay pinatay nang walang awa—dahil hindi sila mas malakas kaysa sa kasalukuyang Flash series!

Sambil naghhintay ang lahat sa susunod na flagship na Gemini 4, na nagpakita ng magandang pagganap sa pre-training assessment, ngayon ay nakakapit pa sa pinakamahalagang yugto ng post-training.

Sa kabuuan, ang lahat ng pagkakamali ay nagresulta sa pagsisikap na i-iterate ang Flash series.

2 oras lang upang makahanap ng butas na kailangan ng ilang buwan para makita: Naka-topping na sa cybersecurity

Sa pagkakataong ito ng Google, bale-wala lang ba ito sa pagpapahalaga sa 3.8 Flash sa karaniwang mga gawain?

Higit pa sa iyon.

Ang totoong pangunahing sandata sa pagpapahayag na ito ay ang kanyang dual na kapatid—Gemini 3.8 Flash Cyber.

Kahit ang mga developer ay nagkakaroon ng pagkagulat: “Ano ba talaga ang seguridad na gawain na nagdudulot ng Google na lumikha ng isang espesyal na bersyon ng Cyber para sa Flash?”

Ang sagot ng Google ay: Upang labanan ang mga AI hacker sa hinaharap.

Sa CyberGym benchmark kung saan natuklasan ang vulnerability, nagkaroon ang 3.8 Flash Cyber ng skor na 86.2%, direktang nagsagawa ng dominance at pinaglaban ang mga nakaraang malalaking modelo.

Hindi lang C/C++ ang mga code sa totoong mundo.

Sa isang komprehensibong pagsubok sa loob ng Google na sumasaklaw sa 20 mga wika ng programming, nakakamit ng modelong ito ng higit sa 70% ang tagumpay sa paghahanap ng malawakang mga butas.

Higit pa rito, ang kanyang mga patotoo sa totoong mundo.

Ginamit ng Chrome Security Team ito para sa pagsubok at natuklasan nila na ang bilang ng tama at maiayos na patch na ito ay 2.6 beses ang dami kumpara sa pinakamahusay na komersyal na modelo sa merkado na mas malaki ang laki.

Ang pagsubok ng Wiz Security ay nagpakita na ang recall rate nito ay tumataas ng 7.5–9.7% sa penetration testing, habang bumaba ang gastos ng 2.3 hanggang 5.2 beses.

Ang pinakamasalot ay ang Google Cloud Vulnerability Research Team ay nagamit ito upang makahanap ng isang mahalagang pangunahing vulnerability sa loob ng dalawang oras lamang—kung saan sa nakaraan, kailangan ng mga eksperto na tao ng ilang buwan upang makahanap ng ganitong uri ng vulnerability!

Sa CWE-Bench (pagsubok sa kakayahan sa pagpapabuti), ang first-pass rate ng 3.8 Flash Cyber ay umabot sa 47.2%, na halos katumbas ng pinakamalikhaing malalaking modelo (47.8%), ngunit ang presyo nito ay lamang isang maliit na bahagi lamang.

Google

Dahil sa sobrang lakas ng pagsalakay at pagtatanggol ng 3.8 Flash Cyber, hindi pinili ng Google na buksan ito nang buong-buo, kundi ipinakilala ito sa pamamagitan ng bagong Fairwind Program, na nagbibigay ng access lamang sa mga tiwalaan.

OpenAI, Anthropic, at Google: Ang pagbabalangkas ng三大模型 ay pumasok sa isang mahalagang punto

Sa pamamagitan ng paglalabas ng Gemini 3.8 Flash, makikita na ang mga pangunahing tigre sa AI ay nasa tatlong iba’t ibang landas ng evolusyon.

Ang Anthropic (Claude series) ay nakatuon sa "kakayahang maging mapagkakatiwalaan at matatag sa kaalaman".

Sa mga pagsubok na nakatuon sa sakop ng kaalaman at akurasyon ng mga katotohanan (tulad ng AA-Omniscience), patuloy pa ring nagtataglay si Claude ng mas mataas na antas ng pagganap.

Ang mga nangunguna sa pitong unang lugar ay lahat ay Claude series; ngayon ay mas pinapalakas nila ang kakayahan na hindi makakamali sa mga enterprise-level na gawain, na naglalayon ng matatag na output.

OpenAI (GPT series), nagtataya sa "malalim na pag-iisip at pagkakaroon ng pagkakaunawa."

Sa CritPt test na nakatuon sa pisikal at matematikal na pagdedebate, ang GPT-5.6 Sol ay nangunguna nang malaki.

Ang OpenAI ay tila naglalayong makamit ang isang malinaw na pagkabuo ng katalinuhan, kung saan hinahangad ng modelo na makamit ang sagot nang walang pagsasabi sa kanya, tulad ng isang siyentipiko na "nag-iisip" nang sarili nito.

Google (Gemini series), nagbuo ng "walang katapusan na siklo ng sobrang mabilis na manggagawa".

Ibinigay ng Google ang ikatlong sagot: Maaaring hindi ko mabuo agad ang pinakamahirap na physics problem, ngunit sobrang mabilis at mura ang aking reaksyon.

Sa panahon ng Agent, maaari kong isipin nang 100 beses sa isang segundo, isulat ang code, patakbuhin, mag-error, at baguhin, gamit ang sobrang mababang gastos na pagpapalit na pagsisikap upang makuha ang tamang resulta.

Ang mga problema na kinakaharap ng Agen sa totoong buhay ay nangangailangan ng paulit-ulit na pagsubok at pagkakamali, paggamit ng mga kasangkapan, at dinamikong pagpapalit.

Ang Gemini 3.8 Flash ay partikular na disenyo para sa ganitong "mahabang workflow".

Sa Google Antigravity, maaari mong gamitin ang isang prompt na may loop instruction upang pagsamahin ang 3.8 Flash sa paggawa ng isang buong laro na may puzzle, environment textures, at 3D level.

Maaari mong gamitin ito upang mag-generate ng isang DOS version ng Google Maps na may Street View at navigation.

Malinaw na, ang pagiging madaling gamitin at gastos ng Gemini 3.8 Flash ay nalampasan na ang isang point ng pagbabago.

Ang pagdating ng Gemini 3.8 Flash ay parang isang pahayag ng Google sa buong industriya: ang mga malalaking modelo ay naglalayong lumabas sa "tanging para sa mga malalaking kumpanya lamang" at nagmamadali patungo sa pagiging makabuluhan sa paggamit ng computing power.

Ang mga gawain ng agent na dati ay nangangailangan ng ilang libo dolyar at paglalakbay ng ilang araw at gabi, ay ngayon ay maaaring tapusin sa ilang kape lamang at sa ilang minuto.

Totoo na ang panahon ng mga super individual para sa karaniwang tao.

Ito ang sandaling pagkabangon ng maliit na modelo.

Mga sanggunian:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

Ipinag-ayos ni Aeneas David

Nakuha mula sa WeChat public account na "Xin Zhi Yuan", may-akda: ASI Revelation

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.