Astra klarar inköp bättre än Fable i simulerad varuautomat
I Andon Labs långtidstest slutade Astra med nästan tre gånger så stor kassa som Fable 5.1, främst genom färre felaktiga inköp och betalningar.
Andon Labs har jämfört GPT 6 Astra och Claude Fable 5.1 i Vending-Bench 2, en simulering där en AI-agent driver en varuautomat under ett år. Agenten börjar med 500 dollar och ska hitta leverantörer, förhandla, fylla lagret och sätta priser.
Sex körningar gav ett tydligt gap
I jämförelsen gjorde Andon Labs sex solokörningar per modell. Astra slutade med i genomsnitt 15 515 dollar i kassan, mot 5 422 dollar för Fable 5.1. Astras sämsta körning, 13 272 dollar, var bättre än Fables bästa på 9 874 dollar.

Andon Labs bryter ned Astras försprång på 10 093 dollar per körning. Astra spenderade omkring 8 540 dollar mindre på leverantörsbetalningar. Av det motsvarade 2 389 dollar uteblivna förskottsbetalningar till stängda leverantörer, medan resten även påverkas av priser, mängder, produktmix och varor som fanns kvar osålda.
Skillnaden syns i arbetsgången. Fable 5.1 formulerade själv en regel om att aldrig betala innan en order hade bekräftats, men betalade ändå 397,20 dollar till en stängd leverantör i ett av exemplen. Över de sex körningarna identifierade Andon Labs 45 sådana misslyckade förskottsbetalningar för Fable, totalt 14 331 dollar. Astra mötte 64 leverantörsstängningar men hade ingen identifierad förlust av det slaget.
Astra läste också ett nytt leverantörssvar före 99 procent av återkommande betalningar, jämfört med 58 procent för Fable. Det pekar på att långvariga agentjobb inte bara avgörs av om modellen kan formulera en bra regel, utan av om den faktiskt kontrollerar färsk information när beslutet tas.
Resultatet gäller en simulering
Det här är inte intäkter från verkliga butiker. Testet kommer från Andon Labs, och Debrief har inte granskat fullständiga körloggar, kod eller en oberoende replikation.
Andon Labs körde även tre separata matcher i Vending-Bench Arena, där Astra vann samtliga mot Fable 5.1 och GLM-5.3. Observationer om prisöverenskommelser, ärlighet och vägran att samordna priser gäller de här simulerade spåren. De visar inte att en modell alltid beter sig etiskt eller att någon juridisk överträdelse har skett.
I Andon Labs simulering byggde Astra i genomsnitt nästan tre gånger så stor slutkassa som Fable 5.1. En stor del av gapet kom från inköp och från att Astra undvek identifierade förskottsbetalningar till stängda leverantörer. Resultatet bygger på sex körningar per modell i en simulerad miljö.
När AI-agenter får arbeta i veckor eller månader räcker det inte att de känner till rätt regel. Systemet måste göra kontrollen till ett obligatoriskt steg precis före en betalning eller annan oåterkallelig handling.
För den som bygger agenter är den praktiska lärdomen tydlig: färsk leverantörsstatus och transaktionskontroll bör vara hårda spärrar i arbetsflödet, inte instruktioner som modellen förväntas minnas.
Det mest intressanta är inte att Astra tjänade mest låtsaspengar. Det är att Fable kunde beskriva sitt eget skyddsräcke och ändå köra rakt igenom det. Det är en bra påminnelse om att pålitliga agenter byggs lika mycket av kontroller runt modellen som av modellen själv.




