AI · Inferens

Nytt test visar när Googles TPU kan ge billigare AI-inferens

SemiAnalysis får Googles Ironwood att slå Nvidia B200 och B300 i modellerad kostnad vid flera svarshastigheter – men resultatet gäller en särskild modell, körning och kostnadskalkyl.

En illustrerad balansvåg kopplar samman kostnad, svarstid och beräkningskapacitet i AI-inferens. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.
En illustrerad balansvåg kopplar samman kostnad, svarstid och beräkningskapacitet i AI-inferens. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.

SemiAnalysis har kört språkmodellen Qwen3.5-397B på Googles nya Ironwood-TPU och jämfört resultatet med Nvidias B200 och B300. Vid en svarshastighet på 100 token per sekund och användare landar den modellerade kostnaden på 0,181 dollar per miljon token för Ironwood. Motsvarande nivå är 0,222 dollar för B200 och 0,276 dollar för B300.

Det gör Ironwood cirka 19 procent billigare än B200 och 34 procent billigare än B300 i just den punkten. Testet gäller FP8, 8 000 inmatade och 1 000 genererade token, aggregerad inferens och utan spekulativ avkodning.

SemiAnalysis diagram över modellerad kostnad per miljon token vid olika användarhastigheter för Ironwood, B200 och B300.
SemiAnalysis diagram över modellerad kostnad per miljon token vid olika användarhastigheter för Ironwood, B200 och B300.

Billigare är inte samma sak som snabbast

Kurvan visar varför ett enkelt vinnarpåstående blir missvisande. Ironwood har inte högst rå genomströmning över större delen av jämförelsen. Kostnadsfördelen uppstår när SemiAnalysis väger prestandan mot en beräknad total ägandekostnad, TCO, på 1,21 dollar per TPU-timme. Nvidia-korten räknas till 1,73 respektive 2,26 dollar per GPU-timme.

Det är alltså inte ett publikt molnpris. Den fullständiga kalkylmodellen ligger dessutom i SemiAnalysis betaltjänst och har inte kunnat granskas här.

Latensen flyttar också resultatet. Vid 20 sekunders median för hela svaret beräknas Ironwood kosta 0,098 dollar per miljon token, åtta procent under B200 och 25 procent under B300. Runt 30 sekunder leder däremot B200 på en mindre del av samma kurva. Vid hög samtidighet får TPU-systemet större kostnadsfördel, men tiden till första token blir 5,41 sekunder, mot 3,75 för B200 och 2,40 för B300.

Mjukvaran är fortfarande på väg ut

Testet bygger på TorchTPU, Googles försök att låta vanliga PyTorch-tensorer köras direkt på TPU. Koden kompileras fortfarande via StableHLO och XLA, och hårdvaruanpassade kärnor behövs för hög prestanda. Det är därför inte en automatisk portabilitetslösning.

SemiAnalysis har arbetat tillsammans med Google och Inferact kring optimeringarna. Resultatet är därmed ett externt publicerat benchmark, men inte ett blint oberoende test. Verktygen ligger ännu i privat beta. Planen är öppen källkod omkring mitten av oktober, medan tester av fler modeller och agentarbetslaster återstår.

Debrief
Vad hände?

SemiAnalysis visade att Googles Ironwood-TPU kan ge lägre modellerad kostnad per token än Nvidia B200 och B300 i en avgränsad Qwen3.5-körning.

Varför spelar det roll?

Om TorchTPU blir publikt och resultatet håller för fler modeller får AI-utvecklare ett mer praktiskt alternativ till Nvidias inferensstack.

Vår analys

Det intressanta är inte att en TPU “vinner”, utan att kostnadskurvan skiftar med svarshastighet, latens och hårdvarupris. Ironwood ser konkurrenskraftigt ut, men koden, TCO-modellen och bredare reproduktion måste bli offentliga innan slutsatsen kan generaliseras.

Källkoll
Så vet vi det här
SemiAnalysis InferenceX: TPU Inference Externalization Full Steam AheadRapport
Google Developers Blog: TorchTPU – Running PyTorch natively on TPUs at Google scalePrimärkälla
Nästa artikel · AI
AlphaGenome Atlas gör nio miljarder DNA-varianter sökbara för forskare

Relaterat