KennisbankAI

Tokens uitgelegd: wat een LLM-aanroep echt kost

22 september 20266 min leestijd

Bij een taalmodel-API betaal je per token, en de meeste discussies over wat AI kost stranden op dat woord. Een token is geen woord en geen teken, maar een stukje tekst zoals de tokenizer van het model dat knipt: een kort woord is vaak één token, een langer woord twee of drie. Wie wil weten wat een aanroep kost, moet dus eerst weten hoeveel tokens erin gaan en eruit komen. Dat bouwt voort op wat inference is: elke aanroep stuurt de volledige inhoud mee, en voor die inhoud wordt afgerekend.

Een rekenvoorbeeld met een Nederlandse prompt

Neem een alledaagse opdracht: "Vat dit klantgesprek samen in drie punten en stel een vervolgafspraak voor." Dat zijn twaalf woorden. Als indicatie kost Nederlands 1,3 tot 1,6 tokens per woord, dus deze zin alleen is zo'n 16 tot 19 tokens. Dat is niet waar het geld zit.

Het klantgesprek zelf gaat namelijk mee. Een transcript van 800 woorden is 1.000 tot 1.300 tokens. Daarbovenop komt de systeemprompt waarin je het model vertelt wie het is en hoe het moet antwoorden, zeg 100 woorden, nog eens 130 tot 160 tokens. De input van deze ene aanroep ligt daarmee rond de 1.200 tot 1.500 tokens. Het antwoord, drie punten en een voorstel, is misschien 150 woorden: 200 tot 240 tokens output.

De verhouding is dus grofweg zes op één. Dat is typisch: in de meeste toepassingen is de input vele malen groter dan de output, omdat je context meestuurt en een kort antwoord terugkrijgt.

Input en output hebben twee prijzen

Aanbieders rekenen voor input-tokens een andere prijs dan voor output-tokens, en dat is geen marketing maar techniek. De input gaat in één keer door het model, de prefill. De output komt token voor token tot stand, de decode, en elke volgende token moet opnieuw door alle gewichten. Per token kost output daardoor veel meer rekentijd dan input.

Om een gevoel voor de orde van grootte te krijgen (marktindicatie, geen prijs van ons): een Europese aanbieder rekent voor een middelgroot open model ongeveer € 0,15 per miljoen input-tokens en € 0,35 per miljoen output-tokens. Voor het voorbeeld hierboven, 1.400 tokens in en 220 uit, is dat rond € 0,0003 per aanroep. Bij 10.000 van zulke aanroepen per dag kom je op ongeveer € 3 per dag, zo'n € 80 tot 90 per maand.

Dat is weinig, en dat is ook het punt: per token is bijna altijd de goedkoopste start. De kosten lopen pas op door wat je in dit sommetje nog niet ziet.

Waar het sommetje misgaat

  • Chatgeschiedenis — een model heeft geen geheugen tussen aanroepen. Bij elke beurt gaat de volledige geschiedenis opnieuw mee. Een gesprek van twintig beurten stuurt zijn eerste vraag twintig keer, en de twintigste aanroep draagt het hele gesprek als input. Lange chats zijn daardoor kwadratisch duurder dan je op grond van de losse berichten verwacht.
  • RAG en agents — een pipeline die eerst zoekt, dan vijf documentfragmenten meestuurt en dan genereert, heeft per gebruikersvraag al snel 3.000 tot 6.000 input-tokens. Een agent die per taak tien tot honderd keer het model raadpleegt, vermenigvuldigt dat nog eens.
  • Nederlands — tokenizers zijn overwegend op Engels getraind. Een samenstelling als "vervolgafspraak" wordt in stukjes geknipt waar het Engelse "follow-up" er twee kost. Dezelfde tekst kost in het Nederlands als indicatie tien tot twintig procent meer tokens dan in het Engels, en dat verschil betaal je bij elke aanroep.

De praktische les: meet je tokens voordat je iets belooft. Elke OpenAI-compatibele API geeft per antwoord terug hoeveel input- en output-tokens de aanroep kostte. Een week loggen zegt meer dan elke schatting, net zoals bij stroom een week meten meer zegt dan het typeplaatje.

Gedeeld per token of dedicated per maand

Per token betaal je alleen wat je gebruikt, en je deelt de GPU met anderen. Dedicated betekent dat een kaart, of een set kaarten, van jou is: je betaalt een vast bedrag per maand, of het ding nu rekent of stilstaat. Als marktindicatie kost een high-end datacenterkaart in Europa ergens tussen € 2,70 en € 4,50 per uur, dus ruwweg € 2.000 tot € 3.300 per maand.

Zet dat naast het voorbeeld van € 80 tot 90 per maand en het omslagpunt ligt ver weg: je moet een factor twintig tot veertig meer verwerken voordat dedicated puur op kosten wint. Dat is een continu belaste kaart, geen kantoorurenpatroon. Wie 's nachts en in het weekend niets doet, betaalt bij dedicated voor lucht.

Toch kiezen mensen eerder voor dedicated, meestal om andere redenen dan de tokenprijs:

  • Voorspelbaarheid — een vast bedrag in plaats van een factuur die meegroeit met een campagne of een enthousiaste afdeling.
  • Isolatie — geen buren op dezelfde kaart, dus geen wisselende antwoordtijden als iemand anders een batch draait.
  • Modelkeuze — een model dat de gedeelde dienst niet aanbiedt, of een eigen fine-tune.
  • Batchwerk — wie de kaart toch heeft, kan 's nachts een archief verwerken. Batching maakt inference per token ook aanzienlijk zuiniger: in een gepubliceerde meting scheelde het ongeveer een factor tien in energie per token tussen kleine en grote batches.

Het eerlijke antwoord op "wanneer slaat het om" is daarom: begin per token, log je verbruik, en reken na een maand uit of een eigen kaart meer dan de helft van de tijd bezig zou zijn. Zo niet, blijf delen.

Tokens bij Xyphen IT

Onze AI-inference is vanaf dag één op beide manieren af te nemen: gedeeld per token via een OpenAI-compatibele API, of dedicated met vaste kaarten per maand. Hoe de API tokens terugmeldt en welke modellen er draaien, staat op de technische pagina. Wie zijn eigen GPU-servers naast het model wil zetten, vindt de stroom- en koelingskant bij GPU-colocatie, en wie een vectordatabase of applicatie in hetzelfde gebouw wil, bij colocatie bij BIT. Twijfel je tussen gedeeld en dedicated? Vraag een voorstel aan; dan rekenen we het met je werkelijke tokens door.

Veelgestelde vragen

Veelgestelde vragen

Waarom zijn output-tokens duurder dan input-tokens?

Omdat ze anders verwerkt worden. De input gaat in één keer door het model (prefill), de output komt token voor token tot stand (decode), en elke stap moet opnieuw door de gewichten. Per token kost output daardoor veel meer rekentijd, en daarom hanteren aanbieders twee prijzen.

Betaal ik in een chat alleen voor mijn nieuwe bericht?

Nee. Een model heeft geen geheugen tussen aanroepen; bij elke beurt gaat de volledige geschiedenis opnieuw mee als input. Een gesprek van twintig beurten stuurt zijn eerste vraag dus twintig keer. Daarom lopen de kosten van lange chats sneller op dan je op grond van de losse berichten verwacht.

Kost Nederlands echt meer tokens dan Engels?

Ja, als indicatie zo'n tien tot twintig procent meer per woord, met verschillen per tokenizer. Tokenizers zijn vooral op Engels getraind; Nederlandse samenstellingen en verbuigingen worden daardoor vaker in stukjes geknipt. Dezelfde tekst in het Nederlands kost dus meer tokens dan de Engelse vertaling.

Antwoord niet gevonden?

Stel je vraag direct aan een engineer — we reageren doorgaans binnen één werkdag.