AI · Förträning

Magic redovisar effektivare förträning i egna modelltester

Magic säger sig nå samma nivå som DeepSeek V4 Pro Base med omkring 50 gånger mindre beräkning, men jämförelsen mäter basmodellers textprediktion på företagets egna testdata.

Två illustrerade träningsmaskiner når samma mål med mycket olika mängd beräkningskapacitet. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.
Två illustrerade träningsmaskiner når samma mål med mycket olika mängd beräkningskapacitet. Illustration: Debrief / OpenAI. Bearbetning: AI-genererad originalillustration, JPEG-komprimerad till 1 254 × 1 254 pixlar.

AI-labbet Magic uppger att dess senaste förträningsmetod når samma resultat som DeepSeek V4 Pro Base med omkring 50 gånger mindre beräkning. Jämförelsen bygger på en mindre egen modell som uppskattas ha använt 1,58 × 10²³ beräkningsoperationer, mot 9,67 × 10²⁴ för DeepSeek-modellen.

Magic översätter den mindre körningen till ungefär en halv miljon dollar på Nvidia GB200. Företaget skalade därefter upp träningen tio gånger, till ett uppskattat hårdvarupris på omkring fyra miljoner dollar, och säger att den större modellen slog alla testade öppna basmodeller.

Beloppen är inte uppmätta totalkostnader. De inkluderar inte utveckling, misslyckade körningar, personal eller datainsamling.

Magics kurva för bits per byte på privata kodarkiv jämförd med fyra öppna basmodeller vid olika uppskattad träningsberäkning.
Magics kurva för bits per byte på privata kodarkiv jämförd med fyra öppna basmodeller vid olika uppskattad träningsberäkning.

Kurvan mäter textprediktion

Resultatet kommer från bits per byte, ett mått på hur väl en basmodell förutser nästa del av en text oberoende av tokenizer. Lägre värde är bättre. Magic har testat privata kodarkiv, nyare forskningsartiklar och syntetiska steg-för-steg-lösningar till privata matematikproblem.

Företaget beskriver kontroller mot dataläckage, bland annat textmatchning mot träningsmaterialet. Men varken testdata, rådata eller de egna modellerna är offentliga. Kunskapstesterna använder dessutom innehåll som avsiktligt kan likna sådant som finns i träningsdata.

Även beräkningsmängden är en uppskattning. Magic använder formeln 6 × aktiva parametrar × antal träningstoken. Den fångar inte alla kostnader i långa sekvenser. För Magics modeller anges varken parameterantal eller datamängd i tabellen, vilket gör resultatet svårt att reproducera.

Ingen färdig kodagent ännu

En basmodell har ännu inte gått igenom förstärkningsinlärning, instruktionsträning eller annan efterträning. Låg förlust på text säger därför inte direkt hur bra modellen blir på att skriva kod, använda verktyg eller arbeta självständigt.

Fireworks hjälpte Magic att kontrollera jämförelsemodellernas loggsannolikheter i en separat inferensmotor. Det ger en extra kontroll av baslinjerna, men är ingen oberoende bekräftelse av Magics modeller eller kostnadspåstående.

Magic tillskriver förbättringen tiotals ändringar i arkitektur, optimerare, träningsmål och datakurering. Detaljerna räcker ännu inte för extern reproduktion. Företaget säger att det ser fram emot att släppa modellen, men någon offentlig modellrelease finns inte i beskedet.

Debrief
Vad hände?

Magic redovisade egna tester där en basmodell matchar DeepSeek V4 Pro Base med omkring 50 gånger mindre uppskattad träningsberäkning.

Varför spelar det roll?

Om effektiviteten kan reproduceras skulle mindre team kunna träna starkare basmodeller utan samma hårdvarubudget som de största labben.

Vår analys

Påståendet är tekniskt intressant men smalare än rubriksiffran antyder. Det gäller textprediktion på Magics testdata, inte en färdig kodagent, och både modellerna och den fullständiga metoden måste bli offentliga innan effektiviteten kan bedömas oberoende.

Källkoll
Så vet vi det här
Magic: >10x More Efficient PretrainingPrimärkälla
DeepSeek V4 Pro Base på Hugging FacePrimärkälla
Nästa artikel · AI
AlphaGenome Atlas gör nio miljarder DNA-varianter sökbara för forskare

Relaterat