Debrief.
Startsidan  /  AI
AI · Ny förmåga

Gemini väljer själv vilka delar av videon som ska granskas

Gemini kan söka i en videotidslinje och bara granska de ögonblick, bildrutor och ljudspår som frågan kräver.

5 september 2026·3 min läsning
En filmremsa där två av sex bildrutor har valts ut, tillsammans med Googles rapporterade maxvärden: 88 procent färre tokens, 66 procent lägre analyskostnad och 7 procent högre kvalitet. Källa: Google DeepMind. Grafik: Debrief. Bearbetning: egen faktagrafik med deterministiskt satta siffror och etiketter; ingen generativ bildmodell använd.

Google har gett Gemini ett nytt sätt att analysera video: modellen avgör själv vilka delar av tidslinjen den behöver granska, i vilken takt och genom vilken kanal. I stället för att på förhand mata in bildrutor med en fast frekvens kan den söka efter relevanta ögonblick, växla mellan bild, ljud och transkript och gå tillbaka för en närmare kontroll.

Från fast sampling till aktivt tittande

I statisk videobearbetning samplas videon normalt med en bestämd bildfrekvens. Det är förutsägbart, men dyrt för långa inspelningar och riskerar att missa mycket korta händelser mellan de valda bildrutorna.

Med agentisk videoförståelse får Gemini i stället ett internt verktyg för att ladda utvalda delar av videon. Modellen kan först göra en grov sökning, zooma in på ett intressant tidsfönster och öka bildfrekvensen där något händer snabbt. Den kan också välja ljud eller transkript när frågan inte kräver fler bilder.

Processgrafik som visar hur Gemini söker i en videotidslinje, granskar bildrutor, ljud och transkript och återvänder till relevanta ögonblick.
Förenklad processgraf över Geminis agentiska videoanalys

Gemini söker i tidslinjen och granskar valda bildrutor, ljud och transkript. Källa: Google DeepMind. Grafik: Debrief. Bearbetning: förenklad egen processgrafik utifrån Googles beskrivning; ingen generativ bildmodell använd.

Lägre kostnad enligt Googles tester

Google DeepMind uppger att läget minskar tokenanvändningen med upp till 88 procent och analyskostnaden med upp till 66 procent, samtidigt som kvaliteten förbättras med upp till 7 procent i bolagets videobenchmarks. Det är maxvärden från Googles egna tester, inte ett löfte för varje video eller fråga.

Funktionen finns nu för uppladdade videor och YouTube-klipp via Gemini API i Google AI Studio och Gemini Enterprise Agent Platform. Den stöds vid lanseringen av Gemini 3.7 Flash, 3.6 Flash och 3.5 Flash-Lite och använder den vanliga tokenprissättningen utan separat funktionsavgift.

Vad modellen väljer bort blir viktigt

Ett tidigare test av WIRED visade varför bättre visuell kontroll behövs. Den dåvarande Gemini-versionen kunde sammanfatta tal och transkript men missade bland annat namn som visades i bild och nyanser i ett sportklipp.

Den nya metoden är byggd för att söka efter just sådana visuella ögonblick. Men selektiviteten skapar också en ny granskningsfråga: om modellen väljer vad den ska se behöver utvecklaren kunna förstå vad den aldrig tittade på. För videoredigering, övervakning och avvikelsedetektering är den uteblivna inspektionen minst lika viktig som svaret.

Google säger att tekniken ska nå Gemini-appen snart och funktionen Ask YouTube under de kommande månaderna. De konsumentdelarna är alltså ännu inte allmänt lanserade.

Debrief
Vad hände?

Gemini kan nu söka i en video och själv välja vilka bildrutor, ljudsegment och transkriptstycken som behöver granskas.

Varför spelar det roll?

Långa videor kan analyseras med betydligt färre tokens när modellen inte måste läsa in en fast sampling av hela tidslinjen.

Vår analys

Det här flyttar videoförståelse från passiv inmatning till aktiv undersökning. Nästa viktiga steg är spårbarhet: ett bra svar räcker inte om ingen kan se vilka ögonblick modellen valde bort.

Källkoll
Så vet vi det här
Google DeepMindPrimärkälla
WIREDMedieuppgift
Nästa artikel · AI
Claude formaliserade Fermats stora sats i Lean på elva dagar
Relaterat