Debrief.
Startsidan  /  AI
AI-infrastruktur · Nyhet

OpenAI:s Jalapeño kör AI-modeller snabbare med mindre energi

De första testerna visar högre genomströmning per watt och lägre latens, men chipet når bara små volymer i år.

26 augusti 2026·Uppdaterad 27 aug. 11:59·4 min läsning
OpenAI:s Jalapeño-accelerator i den verkliga testhårdvaran. Källa: OpenAI.

OpenAI har publicerat de första uppmätta resultaten för Jalapeño, bolagets egen accelerator för AI-inferens. I bolagets tester på den publika benchmarksviten InferenceX levererade systemet 1,5–1,9 gånger mer modellarbete per watt vid högsta genomströmning och 1,7–3,6 gånger lägre total svarslatens än jämförelsesystemen.

Testerna körde tre öppna modeller med olika belastning: GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 med en biljon parametrar. På DeepSeek R1 uppger OpenAI exempelvis 1,7 gånger högre topprestanda per kilowatt och 3,6 gånger lägre latens än ett Nvidia GB300-system.

Närbild av Jalapeño-acceleratorn och anslutningarna på kretskortet
Detalj av Jalapeño-kortets accelerator och anslutningar. Källa: OpenAI.

Byggd för agenternas väntetid

Jalapeño är konstruerad för hela förloppet från prompt till sista token. OpenAI försöker hålla modellens KV-cache lokal och aktivera rätt blandning av beräkning, minne och nätverk för varje fas, i stället för att flytta data mellan specialiserade system. Det är särskilt relevant för agenter, där väntetiden läggs på för varje verktygsanrop och varje nytt resonemangssteg.

Bolaget använde också AI i utvecklingen. Enligt OpenAI:s tekniska redogörelse hjälpte tidigare modeller till med chipdesignen, medan Codex med GPT-Astra optimerade programvaran för tre öppna modellfamiljer på två månader. På utvalda attention- och mixture-of-experts-block blev de AI-genererade implementationerna 1,5–1,8 gånger snabbare än tidigare expertkod. Det resultatet gäller enskilda block, inte hela modellen.

Försprånget är ännu ett labbresultat

InferenceX är en öppen och reproducerbar testmetod, men själva Jalapeño-körningarna är fortfarande OpenAI:s. Chipet säljs inte externt och kan därför inte testas fritt av oberoende laboratorier. TechCrunch noterar dessutom att jämförelsen görs mot dagens Nvidia Blackwell-system och att Jalapeño väntas nå mycket små volymer först i slutet av 2026.

För användare i Norden är konsekvensen indirekt: chipet ska köras i OpenAI:s egen infrastruktur, inte i lokala datorer eller som en hyrbar molninstans. Nästa verifierbara hållpunkt blir därför produktionstrafik och större utrullning under 2027, när lägre latens och energianvändning kan mätas utanför ett förberett benchmarkscenario.

Debrief
Vad hände?

OpenAI:s första mätningar visar att Jalapeño kan ge både högre genomströmning per watt och lägre latens än de jämförda Nvidia-systemen. Resultaten gäller tre öppna stora språkmodeller på den publika benchmarksviten InferenceX.

Varför spelar det roll?

Snabbare inferens märks extra tydligt i agenter som måste göra många steg i följd. Om resultaten håller i produktion kan samma energibudget ge fler och mer responsiva agentkörningar.

Vår analys

Det intressanta är att OpenAI angriper agenternas väntetid som ett sammanhängande systemproblem, från chip och minne till nätverk och kod. Men Jalapeño är fortfarande ett slutet chip med bolagets egna mätningar; först produktionstrafik kan visa om försprånget överlever verkliga arbetslaster.

Källkoll
Så vet vi det här
OpenAI – Jalapeño’s first results show industry-leading speed and efficiency in AI inferencePrimärkälla
InferenceX by SemiAnalysisRapport
TechCrunch – OpenAI’s Jalapeño chip is built for fast inference at scaleMedieuppgift
ServeTheHome – OpenAI Jalapeno Custom AI ASIC at Hot Chips 2026Medieuppgift
Nästa artikel · AI
Claude formaliserade Fermats stora sats i Lean på elva dagar
Relaterat