Cohere släpper inferensmotor som minskar väntan på GPU:n
Cohere samlar ett helt avkodningssteg i en persistent CUDA-kärna och höjer genomströmningen på H100 – men dagens version fungerar bara för en modell och ett smalt serverläge.
Cohere har släppt en experimentell inferensmotor som samlar ett helt avkodningssteg i en enda, långlivad CUDA-kärna. Målet är att hålla H100-processorns beräkningsenheter sysselsatta i stället för att låta dem vänta mellan många små GPU-program.
Motorn heter Cohere Megakernel och är byggd specifikt för bolagets kodmodell North Mini Code. Den finns som öppen källkod, men är ännu mer forskningsprototyp än generell servermjukvara.
Ett arbetsschema inne i GPU:n
Vanliga inferensmotorer startar separata CUDA-kärnor för exempelvis attention, normalisering och modellens expertlager. Varje gräns innebär synkronisering: de snabbaste delarna måste vänta tills den långsammaste är klar innan nästa program kan börja.
Cohere flyttar i stället in ett finkornigt arbetsschema i en persistent megakärna. Operationerna delas upp i små uppgifter som läggs i en gemensam graf. När en av GPU:ns multiprocessorer blir klar kan den ta nästa färdiga uppgift, samtidigt som räknarbaserade barriärer håller ordningen korrekt.

I Cohere-testet för enbart avkodning, med batchstorlek ett och syntetisk KV-cache, producerade megakärnan 292 token per sekund. vLLM 0.24 nådde 185 token per sekund på samma H100. Det är 1,58 gånger högre genomströmning i just det avgränsade testet, utan promptbearbetning.
I kompletta serverkörningar med batchstorlek åtta rapporterar Cohere 1,25–1,41 gånger högre genomsnittlig avkodningshastighet beroende på benchmark. Resultaten är leverantörens egna och har inte oberoende reproducerats av Debrief.
Genomströmning är dessutom inte samma sak som kortare total tid. I LiveCodeBench nådde megakärnan 803 token per sekund mot vLLM:s 625, men körningen tog längre tid eftersom den genererade omkring 4,93 miljoner token jämfört med 3,39 miljoner. Olika svarslängd gör därför en rak tidsjämförelse missvisande.
Fortfarande en smal motor
Den nuvarande versionen stöder en enda H100, BF16, högst åtta samtidiga sekvenser och bara North Mini Code. Promptbearbetningen körs separat i PyTorch och pausar avkodningen. Cohere har bara redovisat jämförbar kvalitet för SciCode och LiveCodeBench, inte för hela benchmarksviten.
Idén har föregångare. Forskare vid Stanford-projektet Hazy Research visade 2025 hur en megakärna kunde minska liknande väntetid för Llama 3.2 1B. Cohere tar nu principen till en större mixture-of-experts-modell och ett OpenAI-kompatibelt servergränssnitt.
Cohere har öppnat en experimentell inferensmotor för North Mini Code som kör avkodningen i en persistent CUDA-kärna. I bolagets H100-tester ökade den genomsnittliga avkodningshastigheten jämfört med vLLM 0.24, men omfattningen är ännu snäv.
Modellservering handlar inte bara om snabbare chip eller mindre modeller. Ett bättre arbetsschema kan frigöra mer kapacitet ur befintlig hårdvara och göra fler samtidiga agentsvar möjliga utan att själva modellen ändras.
Det intressanta är inte en enskild siffra, utan att inferensstacken blir en egen optimeringsfront. Cohere visar en lovande riktning, men först stöd för fler modeller, promptbearbetning och flera GPU:er avgör om megakärnan blir en praktisk motor eller stannar som en snabb speciallösning.




