Debrief.
Startsidan  /  AI
AI · Modell

Gemini 3.8 Flash hittar sårbarheter och skriver patchar

Googles nya Flash-modell arbetar i längre agentloopar, medan Cyber-versionen begränsas till betrodda försvarare.

5 september 2026·3 min läsning
Googles officiella CWE-Bench-graf jämför andelen korrekta patchar med kostnaden per körning: Gemini 3.8 Flash Cyber nådde 47,2 procent pass@1 mot 47,8 procent för den jämförda ledande modellen. Grafik och källa: Google, publicerad den 2 september 2026. Användningsgrund: officiell produktgrafik i redaktionell rapportering. Debrief-bearbetning: ingen; grafen är oförändrad.

Google har lanserat Gemini 3.8 Flash, en modell som ska orka arbeta längre i kodprojekt och andra agentuppgifter. Samtidigt kommer Gemini 3.8 Flash Cyber, en säkerhetsvariant som får leta efter sårbarheter och ta fram patchar. Det intressanta är därför mindre modellnumret och mer att Google försöker flytta automatiserad kodgranskning från förslag till testade ändringar.

Båda modellerna använder enligt Googles lansering längre agentloopar med fler resonemangssteg och upprepade verktygsanrop. Den vanliga Flash-modellen är inriktad på mjukvaruutveckling, flerstegsresonemang och generella agentuppgifter. Cyber-versionen bygger på samma grund, men är eftertränad för offensivt och defensivt säkerhetsarbete.

Googles stapeldiagram visar Gemini 3.8 Flash Cyber på 71,0 procent i ett internt test av sårbarhetsupptäckt över 20 programmeringsspråk.
Googles stapeldiagram visar Gemini 3.8 Flash Cyber på 71,0 procent i ett internt test av sårbarhetsupptäckt över 20 programmeringsspråk.

I CWE-Bench, ett test där modeller ska skapa fungerande patchar för verkliga sårbarheter, nådde Flash Cyber 47,2 procent pass@1. Googles jämförda ledande modell låg på 47,8 procent. På ett internt test med sårbar kod i 20 programmeringsspråk uppger Google 71,0 procent. Chrome Security ska dessutom ha fått 2,6 gånger fler korrekta patchar än med de bästa jämförda kommersiella modellerna.

Siffrorna behöver läsas med viss försiktighet. Flera resultat kommer från Googles egna tester och Flash Cyber släpps inte öppet. Tillgången går via säkerhetsprogrammet Fairwind och begränsas till betrodda försvarare. Ars Technica konstaterar också att lyften från Gemini 3.7 Flash är störst inom kodning, medan andra benchmarkförbättringar är mindre.

Den vanliga Gemini 3.8 Flash finns däremot via Gemini API, AI Studio och flera av Googles utvecklarverktyg. Introduktionspriset är 0,75 dollar per miljon indatatokens och 3,75 dollar per miljon utdatatokens till den 31 december 2026. Därefter fördubblas priserna. Google varnar samtidigt för att de längre agentlooparna kan förbruka fler tokens och rekommenderar lägre resonemangsnivå när kostnad och svarstid väger tyngre.

Debrief
Vad hände?

Google släppte Gemini 3.8 Flash för långvariga kod- och agentuppgifter samt den begränsade säkerhetsmodellen Flash Cyber. Cyber-modellen kan kombinera sökning, verifiering och patchning i samma arbetsloop.

Varför spelar det roll?

Kodagenter har hittills varit bättre på att föreslå en ändring än på att bevisa att den fungerar. Om modellen kan hålla ihop fler verktygsanrop och tester blir den mer användbar för kontinuerlig sårbarhetsjakt och underhåll av stora kodbaser.

Vår analys

Det verkliga steget är inte ännu en Flash-version, utan specialiseringen mot ett komplett säkerhetsjobb. Benchmarkresultatet visar att automatisk patchning närmar sig de starkaste modellerna, men Googles egna tester och den stängda tillgången gör att oberoende verifiering saknas. För utvecklare blir därför vanliga 3.8 Flash den mätbara produkten nu; Cyber är framför allt en signal om vart kodagenterna är på väg.

Källkoll
Så vet vi det här
GooglePrimärkälla
Ars TechnicaMedieuppgift
Nästa artikel · AI
Claude formaliserade Fermats stora sats i Lean på elva dagar
Relaterat