Ipinaglunsad ng Google ang Gemini 3.8 Flash, Ipinagkatotoo ang Pagkakaiba sa Pagganap sa mga Pangunahing Model

iconMetaEra
I-share
AI summary iconSummary
Ipinakilala ng Google ang Gemini 3.8 Flash at ang kanyang bersyon para sa cybersecurity, ang Gemini 3.8 Flash Cyber, noong Setyembre 2, 2026, bilang bahagi ng pinakabagong on-chain na balita. Ang standard na model ay sumusuporta sa 1 milyong token at nakakuha ng 73.7% sa DeepSWE v1.1, halos katumbas ng Claude Opus 5. Ang bersyon para sa cybersecurity ay awtomatikong natutukoy at pinapagawa ang mga vulnerabilities, nakakamit ng higit sa 70% na tagumpay sa 20 wika. Ang parehong mga model ay abot-kamay na sa Gemini API at Google AI Studio, kasama ang potensyal para sa bagong listing ng token.
Ipinahayag ng Google ang Gemini 3.8 Flash at ang Gemini 3.8 Flash Cyber para sa mga organisasyon ng tiwala sa cyber defense noong Setyembre 2, 2026. Ang karaniwang bersyon ay may 1 milyong Token na konteksto, na nakatuon sa programming, Agent, at mga gawain na may espesyalisadong kaalaman; sa mga pagsusuri na inilahad ng Google, nakamit nito ang 73.7% sa mahabang panahong software engineering, malapit sa 74.0% ng Claude Opus 5, at mas mataas ang performance nito sa financial agent, legal agent, at ilang komprehensibong pag-iisip kumpara sa iba pang mga modelo. Ang Cyber version ay kayang maghanap nang sarili ng mga vulnerabilities at gumawa ng patches: higit sa 70% ang tagumpay sa panloob na pagsusuri ng Google sa 20 iba’t ibang programming language, at ang Chrome team ay nakatanggap ng 2.6 beses na higit sa bilang ng tamang patches na ibinigay ng malalaking komersyal na modelo. Kasalukuyang ang presyo ng API ay $0.75 bawat milyong input token at $3.75 bawat milyong output token, ngunit ang modelo ay gumagamit ng higit pang mga hakbang sa pag-iisip at pagtawag sa mga tool upang mapabuti ang performance, at ayon sa mga independiyenteng pagsusuri, mas mataas ang gastos sa isang task nito ng halos 40% kumpara sa 3.7 Flash. Ang pangunahing mensahe ng pagpapalabas na ito ay ang pagpasok ng Agent capabilities—na dati ay eksklusibo sa mga mahal at flagship na modelo—sa mas mura at scalable na “work models,” ngunit ang mga datos sa kakayahan ay batay pa rin sa pagsusuri ng Google at mga kasosyo lamang, at hindi pa available ang Cyber version sa karaniwang gumagamit.

May-akda ng artikulo, pinagkukunan: DeepMind

Tatlong beses na na-update sa loob ng anim na linggo, ginawa ng Google ang Flash bilang pangunahing modelo

Ang Gemini 3.8 Flash ay ipinakilala lamang tatlong linggo pagkatapos ng Gemini 3.7 Flash, at ito ang ikatlong Flash version na inilabas ng Google sa loob ng anim na linggo.

Noong nakaraan, ang “Flash” ay karaniwang nangangahulugan ng mabilis at mura, ngunit ang kakayahan nito ay malinaw na mas mahina kaysa sa flagship model. Ang posisyon ng Gemini 3.8 ay nagbabago: patuloy pa ring tinatawag ng Google ito bilang “work model” na angkop para sa malawakang pag-deploy, ngunit isinasaalang-alang na ang mahabang panahon na pag-program, tuloy-tuloy na pagtawag sa mga tool, at propesyonal na analisis bilang pangunahing kakayahan, at hindi na lamang paggawa ng mga gawain tulad ng pag-uusap at pag-summarize.

Ang bagong modelo ay sumusuporta sa mga input ng teksto, imahe, audio, video, at PDF, may 1 milyong Token na konteksto at 64,000 Token na maksimong output, at makapagpapatakbo ng mga tool para sa paghahanap, mga punsiyon, at pag-operate sa computer. Ito ay opisyal nang ipinakilala, hindi na sa pagsusuri o preview, at maaaring gamitin sa Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, Gemini app, Search AI Mode, at Google Sheets.

Ang托管 Agent Antigravity ng Google ay nagsimula na ring gamitin ang 3.8 Flash. Ito ay nagpapakita na ang modelo ay talagang nakatuon sa mga Agent na nangangailangan ng paulit-ulit na pagpaplano, paggamit ng mga kasangkapan, pagsusuri ng mga resulta, at patuloy na pagpapabuti.

Ang performance ng programming ay malapit na sa mga mahal na flagship model

Sa DeepSWE v1.1 long-term software engineering test na inilabas ng Google, nakakuha ang Gemini 3.8 Flash ng 73.7%, na mas mataas kaysa sa 65.3% ng 3.7 Flash at 72.7% ng GPT-5.6 Sol, at 0.3 percentage points lamang ang pagkakaiba sa Claude Opus 5 na may 74.0%.

Ang mga pagsusulit na ito ay nangangailangan ng pagpasok ng modelo sa totoong codebase, pag-unawa sa ugnayan ng maraming file, pagtatatag ng problema, at paggawa ng mga pagbabago na makakapasa sa mga pagsusulit. Mas malapit ito sa tunay na trabaho ng programming agent kaysa sa pagbuo ng isang ок function nang hiwalay.

Sa Vals Finance Agent v2, ang 3.8 Flash ay nakakuha ng 61.4%, habang ang 3.7 Flash, Claude Opus 5, at GPT‑5.6 Sol ay nakakuha ng 59.0%, 58.6%, at 53.8% ayon sa pagkakasunod-sunod.

Sa pagsubok ng Harvey Legal Agent, ang 3.8 Flash ay may 10.0%, na mas mataas kaysa sa 8.8% ng 3.7 Flash, 6.7% ng Claude Opus 5, at 2.5% ng GPT‑5.6 Sol. Gayunpaman, ang lahat ng modelo ay may mababang absolute score sa pagsubok na ito, at ang “nakauna sa pwesto 1” ay hindi nangangahulugan na kaya nang maaasahan ang pagtrato sa mga kumplikadong legal na gawain.

Sa HLE-Verified Multi-Disciplinary Reasoning Test, ang 3.8 Flash ay nakakuha ng 54.9%, habang ang GPT‑5.6 Sol at Claude Opus 5 ay nakakuha ng 54.5% at 54.4% nang magkasunod; ang pagkakaiba sa pagitan ng tatlo ay maliit lamang at hindi sapat upang patunayan na mayroon ang isang modelo sa matatag na pangkabuuang kapakanan.

Ang mga resultang ito ay pangunahing ipinapahayag ng Google ayon sa kanilang sariling konfigurasyon. Ang modelo, framework ng Agent, lakas ng pag-iisip, kapangyarihan ng mga kasangkapan, at budget para sa pagsubok ay magkakaroon ng epekto sa final na resulta, kaya ang mas makatotohanang konklusyon ay: ang mga modelo ng Flash ay malapit na sa ilang mahal na flagship na modelo, at hindi na ang Gemini ay nangunguna sa lahat ng gawain.

Mas mabuting magtrabaho nang mas mabuti, at maaari ring ibig sabihin ay mas mahal

Ipinapaliwanag ng Google ang pagpapabuti ng kakayahan sa 3.8 Flash bilang isang direkta na desisyon sa disenyo: upang gawing “mas masipag” ang modelo.

Kapag nakikibahagi sa mga kumplikadong gawain, ito ay gumagamit ng higit pang mga hakbang sa pag-iisip, paulit-ulit na gumagamit ng mga kasangkapan, at aktibong sinusuri ang mga naiakcomplish na trabaho. Maaari ng mga developer piliin ang tatlong antas ng pag-iisip: mababa, katamtaman, at mataas; ang katamtaman ang default setting; ang mataas na antas ay angkop para sa mahirap na pagprograma at maraming hakbang na pag-iisip, habang ang mababang antas ay angkop para sa real-time na usapan, pagbuo ng draft, at mga gawain na sensitibo sa pagkaantala.

Nakakatulong ito upang bawasan ang posibilidad na masyadong maaga ang paghinto ng Agent, mawala ang mga hakbang, o lubos na maliitin ang layunin pagkatapos ng isang pagkabigo sa pagtawag ng kasangkapan, ngunit magiging mas maraming Token ang ginagamit.

Sa sariling pagsubok ng Artificial Analysis, ang 3.8 Flash ay may inteligenteng marka na 59 sa mataas na antas ng pag-iisip, na 3 puntos ang pagtaas kumpara sa 3.7 Flash, at nasa parehong antas ng non-top inference configuration ng GPT‑5.6 Sol. Ang average na bilis ng output nito ay humigit-kumulang 300 Token bawat segundo, at kumukuha ng 2.5 minuto ang average na oras para makumpleto ang isang pagsusulit.

Ngunit ang average na output ng Token sa 3.8 Flash ay tumataas ng halos 30%, at mas maraming execution rounds sa agent evaluation. Bagaman hindi tumaas ang presyo bawat Token, ang average na gastos bawat task ay umabot sa halos $0.58, na mas mataas ng halos 40% kumpara sa $0.40 ng 3.7 Flash.

Kaya, ang “mababang presyo” ay hindi katumbas ng “mas mura ang bawat gawain”. Kung ang gawain ay hindi nangangailangan ng komplikadong pag-iisip, ang pagpapatakbo ng 3.8 Flash sa mataas na antas ay maaaring magdulot ng dagdag na oras at gastos. Iminumungkahi rin ng Google ang paggamit ng mga workflow na nagpaprioritize sa efficiency, pagbaba ng antas ng pag-iisip, o pagpapatuloy sa paggamit ng 3.7 Flash na patuloy na suportahan.

Ang kasalukuyang mababang presyo ay isang panahon-lamang na promo

Hanggang Disyembre 31, 2026, ang promo price ng Gemini 3.8 Flash ay $0.75 bawat milyong input Token at $3.75 bawat milyong output Token, pareho na ang presyo sa kasalukuyang presyo ng 3.7 Flash.

Mula sa Enero 1, 2027, ang standard price ay magiging $1.50 bawat milyong input Token at $7.50 bawat output Token, na tila nagdobleng halaga. Ang mga developer ay hindi dapat ituring ang presyo sa panahon ng pagpapalabas bilang permanenteng pricing kapag tinataya ang matagalang gastos.

Kahit isinasaalang-alang ang hinaharap na presyo, mas mababa pa rin ito kaysa sa ilang mga flagship model; ngunit para sa mga Agent na nangangailangan ng pag-generate ng mga libo-libong Token at pagpapatakbo ng mga dekada ng tool calls, dapat i-compare ang kabuuang gastos ng task, hindi lamang ang bawat milyong Token na numero sa price list.

Ang layunin ng Cyber version ay hindi ipaliwanag ang vulnerabilities, kundi direktang magbigay ng patch

Pinarating ng Google ang Gemini 3.8 Flash Cyber. Kasama nito ang mga pangunahing kakayahan ng karaniwang bersyon, ngunit tinuruan ito ng mas nakatuon na pagtuturo sa cybersecurity at ginamit ang mas maluwag na pagtatakda sa cybersecurity, na nagpapahintulot sa ito na matapos ang mga pag-aaral ng vulnerabilities na maaaring tanggihan ng karaniwang modelo.

Sa CyberGym Vulnerability Discovery Benchmark, sinabi ng Google na ito ay nasa unahan ng teknolohiya. Dahil nakatuon ang CyberGym sa mga proyektong C at C++, nilikha ng kumpanya ang isang loob na pagsubok na sumasaklaw sa 20 mga wika ng pagprograma at naglalaman ng mga kumplikadong totoong codebases, at ang tagumpay na rate ng Flash Cyber sa paghahanap ng mga vulnerability ay higit sa 70%.

Ang pagkakakita ng vulnerability ay only ang unang hakbang. Ipinahalagahan ng Google na ang pagtuturo ng Cyber ay nakatuon sa pagpapabuti ng problema, hindi sa paggawa ng mga exploit.

Sa CWE-Bench patch test na pinapatakbo ng Collinear, ang unang submission ng 3.8 Flash Cyber ay may pass rate na 47.2%, habang ang pinakamalalaking model na kinukumpara ay may 47.8%. Malapit ang parehong resulta, ngunit sinabi ng Google na mas mababa ang operating cost ng Flash Cyber.

Ito ay nangangahulugan na ang layunin ng网络安全Agent ay nagbabago mula sa “pagpapaalam sa mga inhinyero kung saan posibleng may problema” patungo sa pag-unawa sa mga vulnerability, pagsusulat ng patch, pagpapatakbo ng mga pagsubok, at pag-verify ng mga pagbabago. Kung sapat ang kumpiyansa sa resulta, maaari itong mapabilis ang panahon ng security team mula sa pagkakakita ng vulnerability hanggang sa pag-deploy ng pag-aayos.

Kumakuha ang Chrome ng 2.6x na tamang patch, ngunit patuloy pa ring pagsusuri ng manufacturer at mga kooperado.

Ginamit na ng Google ang Flash Cyber para sa mga gawain sa seguridad ng code.

Sinabi ng Chrome Security Team na ang bilang ng tama ng mga patch ng vulnerabilities na ito ay 2.6 beses ang dami kaysa sa mga malalaking komersyal na modelo. Sinabi naman ng cybersecurity company na Wiz na sa kanilang penetration testing benchmark, ang Flash Cyber ay may 7.5 hanggang 9.7 puntos na mas mataas na recall rate sa vulnerabilities kumpara sa iba pang mga advanced model, at 2.3 hanggang 5.2 beses na mas mababa ang gastos.

Kinabigyan din ng Google Cloud Vulnerability Research Team na natuklasan ng modelo ang isang mahalagang pangunahing vulnerability sa loob ng higit sa dalawang oras, habang ang mga katulad na pag-aaral ay karaniwang maaaring magtrabaho nang ilang buwan.

Ang mga resultang ito ay may praktikal na halaga, ngunit hindi ito itinuturing na independiyenteng, muling maiuulit na pampublikong pagsusuri. Hindi inilabas ng Google ang detalye ng mahalagang butas, ang listahan ng mga modelong ihahambing, at ang buong trace ng pagpapatakbo; ang Chrome data ay galing sa loob ng Google, at ang Wiz ay isang kasapi ng Fairwind. Kaya, patunay nito na ang mga modelong ito ay nakakapag-ambag sa totoong seguridad, ngunit hindi ito patunay na ito ay patuloy na nagtataglay ng parehong epekto sa lahat ng codebases at uri ng mga butas.

Ang pinakamalakas na kakayahan sa网络安全 ay nagawa lamang para sa mga tiwalaang institusyon

Ang Flash Cyber ay ipinapagkaloob sa pamamagitan ng bagong Fairwind Program ng Google, at kasalukuyang may higit sa 650 na miyembro, na pangunahin ay mga ahensya ng cybersecurity ng gobyerno, mga operator ng mahalagang infrastruktura, mga tagapagpanatili ng software, at mga malalaking kumpanya sa seguridad.

Kailangan ng mga organisasyon na limitahan ang bilang ng mga taong may internal access at gamitin ang mga pagsasalig sa seguridad tulad ng multi-factor authentication. Pagkatapos ay maaaring magkakasama ang model at ang CodeMender Agent upang hanapin, i-verify, at ayusin ang mga vulnerability sa sariling cloud environment ng organisasyon.

Ang mga karaniwang customer ng Google Cloud ay maaari pa ring gamitin ang CodeMender kasama ang publiko version ng Gemini model, ngunit hindi sila makakakuha ng buong kakayahan ng Flash Cyber.

Ang paraan ng paglalabas na “isang pangunahing modelo, dalawang antas ng pahintulot” ay malapit sa dating estratehiya ni Anthropic na hinati ang Claude sa Fable at Mythos: ang pangkalahatang kakayahan sa pagprograma at pagsusuri ay inilalabas sa merkado, habang ang mga tampok sa网络安全 na mas madaling maibawas bilang pagsalakay ay binibigyan ng pagpapatotoo ng pagkakakilanlan, kontrol sa pag-access, at patuloy na pagmamasid.

Hindi nagkaroon ng malinaw na pagpapabuti sa kaligtasan, ngunit may pagbaba sa ilang non-English na pagkakataon.

Ang ordinaryong bersyon 3.8 Flash ay may mga seguridad na limitasyon para sa mga kaugnay na paksa sa kimika, biyolohiya, radioaktibo, nukleyar, at mga cyber attack; ang Cyber version, dahil kailangan nito na matupad ang mga propesyonal na misyon sa depensa, ay may mas maliwanag na mga limitasyon sa网络安全, kaya't ito ay nakalimita lamang sa mga nasusuri na institusyon.

Ang Google Model Card ay nagtataya na ang 3.8 Flash ay walang makabuluhang bagong kakayahan sa mga mataas na panganib na aspeto na tinutugunan ng corporate frontier security framework kumpara sa 3.7 Flash, kaya't hindi ito nag-trigger ng mas mataas na antas ng panganib. Ang proteksyon nito sa Gray Swan indirect prompt injection test ay mas nag-improve rin.

Gayunpaman, ang model card ay naglalabas na bumaba ang 3.8 Flash ng 5.4 puntos porsyento sa automated multilingual security testing kumpara sa 3.7 Flash. Ayon sa Google sa kanilang manual review, ang karamihan sa mga pagkakaiba ay mga false positive o hindi seriyosong nilalaman, ngunit hindi ipinakita ang buong sample at data per wika.

Ang modelo ay nagpapanatili pa rin ng karaniwang problema ng malalaking modelo sa wika, kabilang ang mga halusinasyon, pagkakaroon ng pagkakatigil o timeout sa pagkakasagot, at paggamit ng sobrang bilang ng mga token upang mapabuti ang pagganap. Ang huling petsa ng kaalaman ay nakalagay bilang Marso 2026, ngunit sinasabi ng Google na ang ilang mga larangan ay maaaring may tiyak na kaalaman na lamang hanggang sa galing sa Enero 2025; kailangan pa rin ng pag-verify online kapag may kinalaman sa pinakabagong impormasyon.

Ang totoong kompetisyon ay nagmumula sa "sino ang pinakamatalino" patungo sa "sino ang maaaring gamitin sa malaking iskala"

Ang pinakamahalagang bagay sa Gemini 3.8 Flash ay hindi ang pagiging nangunguna sa isang partikular na benchmark ng ilang puntos, kundi ang pagpapakilala ng Google ng mga kakayahan sa pag-program sa mahabang panahon, propesyonal na pagsusuri, at paggamit ng sariling mga kasangkapan sa presyong interval ng Flash.

Ang flagship model ay angkop para sa mga mahirap na gawain na may mataas na halaga at mababang frekwensiya; ang mga Agent na talagang tumatakbo sa enterprise customer service, programming pipelines, financial analysis, at security scanning ay maaaring magproseso ng milyon-milyon na pagtawag araw-araw. Sa mga skenaryong ito, ang bilis, presyo bawat unit, at rate ng tagumpay bawat task ay madalas na mas mahalaga kaysa sa pagkakaroon ng numero isa sa leaderboard.

3.8 Ang Flash ay nagpapakita rin ng kontradiksyon sa ruta na ito: mas matalino ang modelo sa pag-uulit ng pagsusuri at patuloy na paggawa, mas malaki ang posibilidad na ito ay magbuo ng higit pang mga Token, na nagpapataas sa gastos sa isang task para sa “mura na modelo.” Kaya, ang pangunahing kompetisyon sa hinaharap para sa mga Agent ay hindi lamang kung sino ang nagbibigay ng pinakamahusay na sagot, kundi kung sino ang makakapag-decide kung kailan ipagpatuloy ang pag-iisip, kailan gamitin ang mga kasangkapan, at kailan dapat huminto.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.