Naar de inhoud
NLEN

Token-economie augustus 2026: wat je moet loggen

De week van 15 tot 22 augustus 2026 leverde twee prijsbewegingen op die elkaar tegenspreken. OpenAI verlaagde de ontwikkelaarsprijs van zijn frontiermodel GPT-5.6 Sol met ruim twintig procent (Reuters). Vrijwel gelijktijdig stelde Artificial Analysis vast dat DeepSeek V4 Pro 0813 wel hoger scoort dan zijn voorganger, maar 3,6 keer zoveel kost (@ArtificialAnlys).

Wie zijn modelkeuze op een prijslijst baseert, kiest deze week dus twee keer verkeerd. De vraag is niet wat een miljoen tokens kost, maar wat een afgeronde taak kost — en of je dat überhaupt meet.

Prijs per taak is de enige bruikbare eenheid

Op r/SideProject verscheen een realtime prijsvergelijker die providertarieven vertaalt naar scenario's, bijvoorbeeld tienduizend verzoeken per dag (r/SideProject). Dat is precies de juiste omkering. Promptlengte, outputlengte, cache-hitratio en volume bepalen samen welk model goedkoper is; het tarief per token is daar hooguit één van de vier variabelen in.

Bij redeneermodellen wordt dat verschil extreem. Een model dat honderden interne redeneertokens produceert vóór het antwoord kan bij een lager inputtarief alsnog duurder uitvallen dan een "duurder" model dat direct antwoordt. Het enige eerlijke antwoord komt uit een meting op je eigen workload.

De stille kostenpost: een cache die zomaar verdwijnt

Het scherpste signaal van deze week is een bugmelding en geen persbericht. Een OpenCode-gebruiker zag zijn resterende quotum in ongeveer twintig minuten verdampen nadat de cache-reads voor DeepSeek V4 Flash plotseling op nul kwamen te staan (anomalyco/opencode#42935).

Dat is het scenario waar de meeste zelfbouwstacks blind voor zijn. Je logt tokens en kosten, ziet een normaal verbruikspatroon, en mist dat je cache-hitratio is ingestort — terwijl juist die ratio het verschil maakt tussen een betaalbare en een onbetaalbare agentloop. Cache-hits, cache-misses en resterend quotum horen als afzonderlijke metrics in je monitoring, met een alarm op een plotselinge daling.

Aan de aanbodkant beweegt hetzelfde thema. LiteLLM werkt aan Prometheus-metingen voor team- en modelspecifieke token- en requestlimieten (BerriAI/litellm#37215), zodat je quota-uitputting ziet aankomen in plaats van achteraf te reconstrueren.

Uurquota passen niet bij agentwerk

Zowel op r/openrouter als op r/DeepSeek loopt dezelfde discussie: gebruikers vragen om dagbudgetten in plaats van strakke uurlimieten (r/openrouter, r/DeepSeek).

De reden is structureel. Een homelab draait niet gelijkmatig. Een indexeerslag, een refactor of een nachtelijke researchronde vreet in twintig minuten wat er de rest van de dag niet gebruikt wordt. Een uurlimiet knipt precies die piek door; een dagbudget met burstruimte niet. In dezelfde draden komt een tweede voorkeur naar boven: voorspelbaarheid weegt zwaarder dan "onbeperkt". Vaste maandprijzen, vergelijkbare bundels en goedkope batchcapaciteit op daluren zijn waardevoller dan een onbeperkt aanbod met onduidelijke throttling.

Voor wie plant op een Mac Mini plus NAS is de vertaling simpel: zet bulkwerk in de daluren of lokaal, en bewaar betaalde API-capaciteit voor stappen waar snelheid of modelkwaliteit doorslaggevend is.

Aan de serverkant wordt caching serieus werk

Twee vLLM-bijdragen laten zien waar de winst technisch vandaan komt. Een wijziging voegt interne prefill-checkpoints toe voor Mamba-prefixcaching en rapporteert 9 tot 25 procent verbetering in time-to-first-token (vllm-project/vllm#52789). Een RFC bij de router stelt exacte sessie-affiniteit voor, zodat opeenvolgende chatbeurten landen bij de worker die de bijbehorende prefix al in zijn KV-cache heeft (vllm-project/router#219).

Dat tweede punt is belangrijker dan het klinkt. Zodra je meerdere modelworkers achter één router hangt — lokaal, extern, of gemengd — verlies je zonder affiniteit precies het voordeel waar je de router voor bouwde: je betaalt de prefill twee keer. Wie een eigen routerlaag draait, doet er goed aan de cid- of sessiesleutel niet alleen te loggen maar ook te gebruiken bij de workerkeuze.

En dan koopt Stripe misschien de gateway

Boven op dit alles kwam het bericht dat Stripe AI-gateway OpenRouter voor meer dan zeven miljard dollar zou willen overnemen (r/hermesagent). Of de deal doorgaat is voor een indie-developer minder relevant dan wat het signaleert: de routerlaag is waardevol genoeg om miljarden voor te betalen, en dus waardevol genoeg om aan prijs, voorwaarden en modelaanbod te sleutelen.

Dat is een argument voor een eigen, provider-onafhankelijke router met een lokale fallback — niet uit principe, maar omdat de kosten van een gedwongen migratie hoger liggen dan de kosten van een dag configuratiewerk vooraf.

Wat je deze week concreet kunt doen