AI · Modeller

Inception släpper Mercury 2.5 för AI-flöden med kort svarstid

Mercury 2.5 kombinerar 260 000 tokens kontext med hög genereringshastighet, ett upplägg som främst ska minska väntan när agenter gör många modellanrop efter varandra.

Ett illustrerat agentflöde visar hur små modellfördröjningar kan summeras när flera steg körs efter varandra. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.
Ett illustrerat agentflöde visar hur små modellfördröjningar kan summeras när flera steg körs efter varandra. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.

Inception har släppt Mercury 2.5, en diffusionsbaserad språkmodell med 260 000 tokens kontext, parallella verktygsanrop och JSON-svar som kan följa ett angivet schema. Modellen finns i företagets API och via Baseten och OpenRouter.

Till skillnad från en vanlig autoregressiv språkmodell, som skriver ett token i taget, arbetar en diffusionsmodell med flera delar av svaret under samma process. Inception bygger sitt erbjudande kring att det ska ge kortare väntan, särskilt när en AI-agent behöver kalla på en modell många gånger under en och samma uppgift.

Företaget uppger 1 107 genererade token per sekund på allmänt tillgängliga Nvidia-GPU:er. I den publicerade jämförelsen anges 321 för Gemini 3.5 Flash-Lite, 127 för Claude Haiku 4.5 och 99 för GPT-5.6 Luna med låg resonemangsnivå.

Inceptions hastighetsdiagram anger 1 107 token per sekund för Mercury 2.5 och lägre värden för tre jämförelsemodeller.
Inceptions hastighetsdiagram anger 1 107 token per sekund för Mercury 2.5 och lägre värden för tre jämförelsemodeller.

Många små väntetider blir en lång

En sökagent kan planera, skriva om frågor, rangordna träffar, strukturera fakta och kontrollera svaret. Kodagenter använder på liknande sätt separata modellanrop för bland annat sökning, verktygsval, routing och komprimering av kontext. Då kan även små skillnader per anrop bli märkbara för användaren.

Inception lyfter två kundexempel. OpenCall uppger en median på nära 170 millisekunder för modellsvaret i sin telefonitjänst. Augment Code säger att kontextkomprimering gick från omkring 150 till 27 sekunder och blev 90 procent billigare. Siffrorna publiceras av leverantören och kunderna; de är inte oberoende tester och deras fullständiga arbetslaster redovisas inte.

Kvaliteten är den öppna frågan

Inception säger att Mercury 2.5 ger 40 procent högre “intelligens” än Mercury 2 och placerar modellen nära kostnadsoptimerade modeller från Google, Anthropic och OpenAI. Det är ett sammansatt benchmarkpåstående, inte en generell kvalitetsökning. Debrief har inte kört modellen, och bloggen ger inte tillräcklig metodinformation för att återskapa hastighetsdiagrammet.

Ordinarie API-pris anges till 0,20 dollar per miljon inmatade token och 0,75 dollar per miljon utmatade. Lanseringspriset är tillfälligt 0,04 respektive 0,15 dollar. Nya konton får enligt både bloggen och dokumentationen 100 miljoner provtoken.

Mercury Voice och Mercury Router presenterades samtidigt, men bara som förhandsvisningar. De ska därför inte blandas ihop med den nu tillgängliga Mercury 2.5-modellen.

Debrief
Vad hände?

Inception släppte Mercury 2.5 med större kontext, verktygsanrop och en uppgiven hastighet på 1 107 token per sekund.

Varför spelar det roll?

Kortare modellväntan kan göra störst skillnad i sök-, röst- och kodagenter där många anrop staplas i samma användarflöde.

Vår analys

Mercury 2.5 är intressant som en byggsten för snabba deluppgifter, men hastigheten räcker inte som kvalitetsbevis. Oberoende tester behöver visa om modellen behåller noggrannheten i verkliga agentflöden och hur kostnaden ser ut efter lanseringsrabatten.

Källkoll
Så vet vi det här
Inception: Introducing Mercury 2.5Primärkälla
Inception Platform: Quick StartPrimärkälla
Nästa artikel · AI
AlphaGenome Atlas gör nio miljarder DNA-varianter sökbara för forskare

Relaterat