AI · Forskning

Småskaligt experiment visar datans stora roll i AI-träning

Ett begränsat försök skiljer dataförbättringar från modellrecept – och pekar på att träningsmaterialet gav den klart större effektivitetsvinsten.

Illustration: En handvevad kvarn tar emot en oordnad hög datapapper och matar ut en ren stapel – en metafor för hur datakurering kan påverka AI-träningens effektivitet. Källa och kredit: Debrief. Bearbetning: AI-genererad originalillustration, nedskalad till 1 400 × 1 400 pixlar och JPEG-komprimerad före uppladdning; inga faktaetiketter eller källdata har lagts till.
Illustration: En handvevad kvarn tar emot en oordnad hög datapapper och matar ut en ren stapel – en metafor för hur datakurering kan påverka AI-träningens effektivitet. Källa och kredit: Debrief. Bearbetning: AI-genererad originalillustration, nedskalad till 1 400 × 1 400 pixlar och JPEG-komprimerad före uppladdning; inga faktaetiketter eller källdata har lagts till.

Ett kontrollerat försök av Dwarkesh Patel och Jerry Han pekar på att valet av träningsdata kan ha haft större betydelse än själva modellreceptet för hur effektiv förträningen blivit. Men försöket är litet, och resultatet säger mindre om dagens största modeller än rubriksiffrorna först antyder.

Forskarna kombinerade årsrepresentativa öppna modellrecept och datakorpusar från 2019 till 2025. Modellerna tränades från grunden vid fem beräkningsbudgetar, upp till 10^19 FLOP, med samma GPT-2-tokenizer och en kontextlängd på 2 048 token.

Eftersom datamängderna skilde sig gick modellerna inte att jämföra rättvist med förträningsförlust mot en gemensam datamängd. I stället använde forskarna OLMES, ett öppet och reproducerbart utvärderingsupplägg som samlar tio relativt enkla uppgifter, främst flervalsfrågor.

Vid den högsta beräkningsbudgeten motsvarade bytet från 2019 års data till 2025 års data en 12-faldig förbättring av beräkningseffektiviteten. Motsvarande byte av modellrecept gav 3,7 gånger bättre effektivitet. I just detta upplägg stod dataförbättringarna alltså för 3,24 gånger större effekt än modellförbättringarna.

Linjediagram över OLMES-resultat vid fem träningsbudgetar för kombinationer av 2019 och 2025 års modellrecept och data.
Skalningskurvor för fyra kombinationer av 2019 och 2025 års modellrecept och träningsdata.

Författarnas skalningskurvor visar OLMES-resultat vid fem träningsbudgetar. Källa och kredit: Jerry Han och Dwarkesh Patel via Datawrapper. Debrief har återgett det publicerade diagrammet utan att ändra data, axlar eller etiketter.

Det betyder inte att modellerna blev tolv gånger intelligentare. Multiplikatorn beskriver hur mycket mindre nominell träningsberäkning som krävdes för att nå samma OLMES-resultat jämfört med baslinjen.

Ett tydligt resultat med stora brasklappar

Författarna beskriver själva försöket som genomfört i mycket liten skala. Punkterna i skalningskurvorna bygger på minst tre oberoende träningskörningar, men den fulla 7×7-matrisen med kombinationer vid 3,16 × 10^18 FLOP kördes bara en gång per kombination. Vissa multiplikatorer bygger dessutom på extrapolering, och hyperparameterjusteringen var begränsad.

Mätningen fångar inte heller allt modellarbete bidrar med. Arkitekturer, optimerare och systemteknik kan framför allt göra större träningskörningar möjliga och stabila – en effekt som inte syns fullt ut när små modeller jämförs vid fasta budgetar. Studien omfattar inte efterträning med förstärkningsinlärning eller syntetiska data.

Att datakurering kan ge stora vinster i kontrollerade upplägg har också visats i DataComp-LM, där träningskoden hålls fast medan deltagarna förbättrar datamängden. Det stöder den bredare idén att data är en central utvecklingsyta, men bekräftar inte Patel och Hans exakta fördelning mellan data och modellrecept.

Debrief
Vad hände?

I ett småskaligt försök gav nyare träningsdata större förbättring av beräkningseffektiviteten än nyare modellrecept: 12,0 gånger jämfört med 3,7 gånger vid `10^19` FLOP.

Varför spelar det roll?

Resultatet flyttar upp datakurering från en stödprocess till en möjlig huvudkomponent i modellutvecklingen. Det ger också ett konkret sätt att mäta dataarbete mot arkitekturförändringar i samma experiment.

Vår analys

Det här är en stark hypotes, inte ett facit för all AI-utveckling. Den praktiska lärdomen är att modellbyggare bör mäta och redovisa dataval lika systematiskt som arkitektur och träningskod. Nästa avgörande test är om försprånget finns kvar i större modeller och med dagens efterträning.

Källkoll
Så vet vi det här
Dwarkesh Patel och Jerry Han – Pretraining progress is mostly coming from dataPrimärkälla
Allen Institute for AI – OLMES: A Standard for Language Model EvaluationsRapport
DataComp-LM: In search of the next generation of training sets for language modelsRapport
Allen Institute for AI – OLMES kodarkivPrimärkälla
Nästa artikel · AI
AlphaGenome Atlas gör nio miljarder DNA-varianter sökbara för forskare

Relaterat