Experiment kör Kimi K3 på en MacBook genom att läsa modellen från SSD
Deltafin strömmar Kimi K3:s experter från fyra SSD-enheter till en MacBook och når omkring en token per sekund – men en längre prompt väntar drygt sex minuter på första svaret.
Ett experiment från Argonaut Labs kör hela expertbanken i Moonshot AI:s Kimi K3 på en MacBook Pro. Tricket är att bara hålla modellens stam i datorns minne och läsa de expertblock som behövs från fyra SSD-enheter.
Det betyder inte att en vanlig bärbar dator plötsligt ersätter ett GPU-kluster. Utvecklarnas publicerade test når ungefär en token per sekund när svaret väl genereras. Med en prompt på 512 token tar det samtidigt omkring 375 sekunder innan den första token kommer.
Experterna ligger på lagring
Kimi K3 är en mixture-of-experts-modell med totalt 2,8 biljoner parametrar. För varje token väljs 16 av 896 experter. Deltafin låter därför modellens minnesresidenta delar ligga i datorns 128 GB enhetliga minne och hämtar de valda experterna från SSD.
Testriggen består av en MacBook Pro med M5 Max, intern SSD och tre externa NVMe-enheter. Expertfilerna upptar omkring 1,44 TB. En liten Qwen-modell får föreslå kommande token, men K3 kontrollerar varje förslag innan det godtas.
Projektet behåller expertvikterna i Moonshots MXFP4-format. Den minnesresidenta modellstammen har däremot kvantiserats till int8. Samtliga experter används, men utvecklarna gör inget anspråk på att hela körningen är bit- eller viktidentisk med en BF16-version.

I standardtestet var medianen 1,0015 token per sekund under stadig avkodning för två kalla körningar med 512 genererade token och den lilla förslagsmodellen aktiverad. Genomströmningen räknad från processens start, inklusive modellstart och promptbearbetning, var 0,9849 token per sekund.
Testet kördes som greedy råtextkomplettering, inte med modellens chattmall. På mer allmänna chattprompter uppger projektet 0,64–0,74 token per sekund i den aktuella konfigurationen. Resultaten kommer från utvecklarna; Debrief har inte kört eller oberoende reproducerat dem.
Sex minuter visar nästa flaskhals
Analysen av den långa prompten visar att 76 procent av tiden före första token gick åt till att vänta på expertläsningar. Motorn läste ungefär nio terabyte från lagringen för en expertbank på 1,44 TB, eftersom prompten behandlades i åtta pass som återläste delar av varje lager.
Det är alltså en kostnad i den nuvarande schemaläggningen, inte ett bevis på en ofrånkomlig SSD-gräns. Projektet beskriver en fix, men den är ännu inte byggd.
Argonaut Labs har publicerat en Deltafin-fork som strömmar Kimi K3:s expertblock från fyra SSD-enheter till en MacBook Pro med M5 Max och 128 GB minne. Utvecklarnas test når cirka en token per sekund i stadig avkodning, medan en prompt på 512 token väntar drygt sex minuter på första token.
Försöket visar att snabb lagring kan ersätta en del av arbetsminnet när en gles modell bara behöver ett urval av experter för varje token. Det öppnar en teknisk väg för att köra mycket större modeller lokalt, även om användarupplevelsen ännu är långt från en vanlig chattjänst.
Det verkliga framsteget är inte att K3 blivit praktisk på en bärbar dator, utan att gränsen mellan minne och lagring blivit förhandlingsbar. Nästa avgörande steg är att sluta läsa samma expertdata flera gånger under promptbearbetningen; utan det förblir demonstrationen imponerande men tålamodskrävande.




