Kort antwoord
Reken in drie stappen: tel de tokens van een document of gesprek, splits ze in verse invoer, cache-invoer en uitvoer, en vermenigvuldig elke soort met het eigen tarief per miljoen. In onze eigen meting telde een Nederlandse inkoopfactuur 2,65 tokens per woord en een klantgesprek 1,27 — dezelfde vuistregel werkt dus niet op beide. Een document van 10.000 tokens invoer en 800 uitvoer kost daarmee circa 3 dollarcent op een middenklassemodel, en een gesprek van acht beurten met caching ongeveer 6,5 dollarcent.
Van lezen naar doen.
Onze meting van vorige week: een Nederlandse inkoopfactuur van 146 woorden telde 387 tokens, een klantgesprek van 175 woorden telde er 223. Dezelfde taal, bijna hetzelfde aantal woorden, meer dan anderhalf keer zoveel tokens.
Dat is de reden dat een prijs per miljoen tokens je nog niets vertelt. Je koopt geen miljoenen tokens, je verwerkt facturen, mails, contracten en gesprekken.
Deze pagina is het rekenrecept dat daartussen zit. Wat de leveranciers per miljoen tokens rekenen, staat op de tariefpagina's voor de Claude API en de OpenAI API; welke modellen er zijn, staat in onze index over AI-modellen vergelijken.
Vier soorten tokens, vier tarieven
Elke AI-factuur bestaat uit dezelfde vier posten, bij elke leverancier, met een eigen prijs per stuk.
- Verse invoer: alles wat je meestuurt en wat het model nog niet kort geleden zag.
- Cache-invoer: een stuk prompt dat het model al verwerkte en dat tegen een fractie van het inputtarief terugkomt.
- Uitvoer: het antwoord zelf, plus de redeneertokens die een model intern produceert voordat het iets zegt.
- Batch: dezelfde tokens, asynchroon ingeleverd, bij Anthropic en OpenAI voor de helft van de prijs.
Die vier posten verschillen onderling een factor 5 tot 50. Op Claude Sonnet 5 kost een cache-hit $0,20 per miljoen en een outputtoken $10 per miljoen, vijftig keer zoveel (Anthropic-prijspagina, 18 september 2026).
Wie zijn kosten wil begrijpen, telt dus niet "tokens" maar vier keer iets anders. Dat is stap nul van het recept hieronder.
Hoeveel tokens zit er in een Nederlandse tekst? Onze meting
Een token is een tekstfragment: soms een heel woord, vaker een lettergreep, een cijferreeks of een leesteken. Anthropic houdt als ruwe schatting aan dat een token ongeveer vier tekens of 0,75 Engelse woorden is (prijspagina, FAQ).
Voor Nederlands klopt dat niet zomaar, en voor gestructureerde documenten helemaal niet. Daarom hebben we het gemeten in plaats van geschat.
Op 18 september 2026 hebben we drie realistische Nederlandse voorbeeldteksten door de open-source tokenizer van OpenAI gehaald (tiktoken, encoding o200k_base, de encoding die OpenAI voor de GPT-4o-familie documenteert in de tiktoken-cookbook).
| Voorbeeldtekst | Woorden | Tekens | Tokens | Tokens per woord | Tekens per token |
|---|---|---|---|---|---|
| Inkoopfactuur met artikelnummers, bedragen en btw | 146 | 1.144 | 387 | 2,65 | 2,96 |
| Klantgesprek servicedesk, spreektaal | 175 | 999 | 223 | 1,27 | 4,48 |
| Beleidstekst met lange samenstellingen | 144 | 1.270 | 237 | 1,65 | 5,36 |
| Totaal | 465 | 3.413 | 847 | 1,82 | 4,03 |
Eigen meting, 18 september 2026, tiktoken o200k_base. De teksten zijn zelfgeschreven voorbeelden, geen klantdocumenten.
Drie conclusies die je businesscase raken. Een factuur kost per woord twee keer zoveel als een gesprek, omdat artikelnummers, bedragen en IBAN-reeksen in losse stukjes breken.
Lange Nederlandse samenstellingen zijn juist gunstig per teken: de beleidstekst haalde 5,36 tekens per token, de factuur 2,96. En het gemiddelde over alle drie, 1,82 token per woord, ligt fors boven de vuistregel van circa 1,4 die wij in offertes gebruiken.
Die vuistregel houdt dus stand voor lopende tekst en breekt op gestructureerde documenten. Tel daarom per documenttype, niet per organisatie.
Reken in tekens als je snel wilt schatten. Duizend woorden lopende Nederlandse tekst is grofweg 1.300 tot 1.700 tokens; duizend woorden factuurregels is er ruim 2.600.
Eén tekst, twee tellingen
Er is een addertje dat je met geen enkele vuistregel oplost: dezelfde tekst telt niet op elk model hetzelfde.
Anthropic schrijft dat modellen vanaf Claude Opus 4.7 een nieuwere tokenizer gebruiken die ongeveer 30 procent meer tokens voor dezelfde tekst produceert dan de eerdere modellen (token counting). Claude Sonnet 4.6 en ouder gebruiken de vorige tokenizer.
De praktische regel die daaruit volgt: tel je prompt met het model waarop je gaat draaien, niet met het model waarop je vorig jaar rekende. Anthropic biedt daar een gratis endpoint voor, waarover verderop meer.
Het rekenrecept in acht stappen
Dit is de volgorde die wij aanhouden als we een AI-functie in software begroten.
- Kies de eenheid die je bedrijf kent: één factuur, één klantgesprek, één aflezing, één dossier.
- Tel de tokens van één zo'n eenheid met de tokenizer of het telendpoint van de leverancier.
- Splits de invoer in vers, cache-write en cache-read.
- Tel de uitvoer apart; schat hem op de langste variant, niet op de kortste.
- Tel de vaste opslag per verzoek erbij: systeemprompt, tool-definities, opgehaalde kennisbankfragmenten.
- Vermenigvuldig elke soort met het eigen tarief per miljoen tokens en tel op.
- Vermenigvuldig met het maandvolume en reken om naar euro met een koersmarge.
- Deel terug naar de eenheid uit stap 1, zodat het bedrag bespreekbaar wordt.
De formule achter stap 6, voor wie hem in een spreadsheet zet: kosten = (vers × P_in + cachewrite × P_cw + cacheread × P_cr + uit × P_uit) ÷ 1.000.000.
Stap 4 is de stap die in de praktijk het vaakst misgaat. Uitvoer is bij vrijwel elk model vijf tot zes keer duurder dan invoer, dus een taak die veel tekst teruggeeft loopt harder op dan een taak die veel tekst leest.
Het rekenblad: vier documenttypen, drie modellen, in euro
Hieronder onze eigen werkblad-tabel. De tokenaantallen komen uit de meting hierboven, de tarieven van de leverancierspagina's van 18 september 2026, en de euro's van de dollarkoers van de ECB, peildatum 18 september 2026: 1,1460 dollar voor een euro.
Alle bedragen zijn euro per duizend stuks, exclusief btw, zonder caching en zonder batchkorting.
| Eenheid | Tokens in | Tokens uit | Claude Sonnet 5 | GPT-5.6 Terra | Gemini 3.8 Flash |
|---|---|---|---|---|---|
| Inkoopfactuur uitlezen naar velden | 400 | 150 | € 2,01 | € 2,27 | € 0,75 |
| Klantmail lezen en beantwoorden | 320 | 250 | € 2,74 | € 3,18 | € 1,03 |
| Contract van 20 pagina's samenvatten | 13.200 | 800 | € 30,02 | € 31,41 | € 11,26 |
| Meterfoto van 1000×1000 px aflezen | 1.496 | 60 | € 3,13 | € 3,24 | € 1,18 |
Tarieven per miljoen tokens: Sonnet 5 $2 / $10 (Anthropic), GPT-5.6 Terra $2 / $12 (OpenAI), Gemini 3.8 Flash $0,75 / $3,75 (Google).
Vier dingen die je bij deze tabel moet weten voordat je hem overneemt.
De tokenaantallen zijn gemeten met de OpenAI-tokenizer. Op Claude-modellen vanaf 4.7 ligt de telling volgens Anthropic circa dertig procent hoger, dus de contractrij wordt daar eerder € 36,93 dan € 30,02.
De rij met de meterfoto rekent met 1.296 visuele tokens, het aantal dat Anthropic voor een afbeelding van 1000×1000 pixels noemt (vision-documentatie). OpenAI en Google tellen beeld anders, dus in die rij zijn de laatste twee kolommen een indicatie.
Het Gemini-tarief is een promotieprijs die volgens Google geldt "through December 31, 2026"; per 1 januari 2027 verdubbelt het naar $1,50 / $7,50. Een businesscase voor 2027 op de linkerkolom is dus geen businesscase.
En bij alle drie halveert de Batch API beide kolommen: Gemini 3.8 Flash zakt daarmee tot en met 31 december 2026 naar $0,375 en $1,875 per miljoen.
Rekenvoorbeeld 1: één document van 10.000 tokens
De bedragen hieronder zijn gerekend op de tarieven uit de vorige sectie; er is geen project bij gemeten. We nemen per document 10.000 tokens aan de invoerkant en 800 aan de uitvoerkant, zodat dit naast de twee tariefpagina's te leggen is.
| Model | Per document | Per 1.000 stuks | In euro | Via batch, in euro |
|---|---|---|---|---|
| Claude Sonnet 5 | $0,0280 | $28,00 | € 24,43 | € 12,22 |
| GPT-5.6 Terra | $0,0296 | $29,60 | € 25,83 | € 12,91 |
| Gemini 3.8 Flash | $0,0105 | $10,50 | € 9,16 | € 4,58 |
De rekenwijze op Sonnet 5, zodat je hem kunt naspelen: 10.000 × $2 ÷ 1.000.000 = $0,020 voor de invoer, plus 800 × $10 ÷ 1.000.000 = $0,008 voor de uitvoer.
Let op wat hier níet gebeurt. Het duurste model in deze rij is nog geen drie keer het goedkoopste, terwijl de kwaliteitsverschillen op een slecht gescande factuur veel groter zijn dan drie keer.
Bij duizend documenten per maand praat je over het verschil tussen negen en zesentwintig euro. Die discussie is de vergadering niet waard; de vraag welk model minder velden verkeerd overneemt, wel.
Rekenvoorbeeld 2: één gesprek van acht beurten
Een gesprek rekent anders dan een document, want elke beurt stuurt de hele voorgeschiedenis opnieuw mee. Onze aannames, gelijk aan die op de twee tariefpagina's: acht beurten lang, een vast voorstuk van 6.000 tokens in de cache, per beurt 100 tokens vraag en 250 tokens antwoord.
Optellen levert dan: 10.600 tokens verse invoer over het hele gesprek, één cache write van 6.000 tokens, zeven cache reads van 6.000 (42.000 tokens) en 2.000 tokens uitvoer.
| Model | Zonder caching | Met caching | Per 1.000 gesprekken, zonder caching |
|---|---|---|---|
| Claude Sonnet 5 | $0,1372 | $0,0646 | € 119,72 |
| GPT-5.6 Terra | $0,1412 | lager, eigen cachetarief | € 123,21 |
| Gemini 3.8 Flash | $0,0515 | lager, eigen cachetarief | € 44,90 |
Rekenwijze op Sonnet 5 met caching: cache write 6.000 × $2,50, cache reads 42.000 × $0,20, verse invoer 10.600 × $2 en uitvoer 2.000 × $10, alles gedeeld door een miljoen. Dat is $0,0646, oftewel € 56,37 per duizend gesprekken.
Eén cache write, zeven cache reads. Acht beurten betekent niet acht cache reads: de eerste beurt schrijft het voorstuk weg, de zeven daarna lezen het terug. Reken je er acht, dan zit je er bijna twee procent naast — vervelender is dat dezelfde denkfout in een groot volume wél zichtbaar wordt.
Caching halveert dit gesprek op Claude. Anthropic rekent daarvoor met vaste vermenigvuldigers: een cache write van vijf minuten kost 1,25 keer het inputtarief, een write van een uur 2 keer, en een cache-hit een tiende — op Fable 5.1 zelfs een veertigste.
De voorwaarde staat in dezelfde documentatie: de cache van vijf minuten is terugverdiend na één read, die van een uur na twee. Antwoordt je klant pas na een kwartier, dan betaal je de write twee keer en verdien je niets terug.
Voor de tarieven per model per leverancier verwijzen we naar de twee tariefpagina's; voor Gemini en Mistral verschijnen die pagina's later in deze reeks.
Waarom beurt acht meer kost dan beurt één
In het voorbeeld hierboven is beurt één een verzoek van 6.100 tokens en beurt acht een verzoek van 8.550. Dezelfde vraag, dezelfde klant, veertig procent meer invoer.
Dat komt doordat een taalmodel geen geheugen heeft tussen verzoeken. Wat het "weet" van eerder in het gesprek, stuur je elke keer opnieuw mee.
De groei is lineair per beurt, maar de kosten over een heel gesprek lopen sneller op dan het aantal beurten. Een gesprek van zestien beurten kost in dit voorbeeld ruim twee keer een gesprek van acht; het vaste voorstuk van 6.000 tokens dempt die versnelling, de groeiende geschiedenis jaagt hem aan.
Drie ontwerpknoppen die dat temmen:
- Zet het vaste deel vooraan (instructies, productinformatie, tooldefinities) zodat er een gedeeld voorstuk is om te cachen.
- Kap de geschiedenis af na een vast aantal beurten, of vat hem samen in een kort blok.
- Zet een maximum op de uitvoer per antwoord; dat is meteen je kostenplafond per aanroep.
Bij Anthropic heeft die laatste knop geen nadeel aan de limietkant: de parameter voor het maximum aantal uitvoertokens telt niet mee in de berekening van de output-limiet per minuut (rate limits).
Wat dit betekent voor een agent die tientallen beurten loopt, staat in onze pagina over de Claude API koppelen aan eigen software.
Tool-calls: de opslag die je niet ziet
Zodra je model gereedschap krijgt (een agenda lezen, een order opzoeken), betaal je voor de beschrijving van dat gereedschap. Bij elke beurt opnieuw.
Anthropic laat de orde van grootte zien in twee voorbeelden uit dezelfde documentatie. Een begroeting met een korte systeemprompt telt 14 invoertokens; een vraag over het weer mét één weer-tool erbij telt er 403 (token counting).
Bovenop de tooldefinities zelf komt een vaste systeemprompt voor tool-gebruik. Die is per model gedocumenteerd: 354 tokens op Sonnet 5, 286 op Opus 5, 496 op Haiku 4.5, en 92 tot 120 meer zodra je het model dwingt een tool te kiezen.
| Wat je toevoegt | Extra invoertokens |
|---|---|
| Systeemprompt voor tool-gebruik (Sonnet 5) | 354 |
| Bash-tool (Opus 5) | 325 |
| Teksteditor-tool | 700 |
| Computer-toolset, standaard | circa 4.500 |
| Browser-toolset, standaard | circa 6.600 |
Bron: Anthropic-prijspagina, tool use pricing, 18 september 2026.
Reken dat door voor een agent met een browser-toolset en twintig beurten: 6.600 tokens die twintig keer meegaan is 132.000 tokens per sessie, nog voordat de klant iets gevraagd heeft. Op Sonnet 5 is dat $0,26 per sessie, tenzij je het voorstuk cachet.
Sommige tools kosten daarnaast geld buiten tokens om. Een websearch via de Claude API kost $10 per duizend zoekopdrachten, bovenop de tokens van wat de zoekmachine terugstuurt.
Beeld telt anders: van meterfoto naar tokens
Beeld gaat niet per woord maar per vlak. Claude verwerkt een afbeelding in blokjes van 28 bij 28 pixels, dus een foto kost ⌈breedte ÷ 28⌉ × ⌈hoogte ÷ 28⌉ visuele tokens.
Praktisch: 1000×1000 pixels is 1.296 tokens, 1920×1080 is 1.560 tokens op de standaardmodellen en 2.691 op de hoge-resolutiemodellen vanaf Claude 4.7. Grotere beelden worden vóór verwerking verkleind, wat de rekening afvlakt maar ook detail kost.
In onze case meterstanden automatisch uitlezen met AI-beeldherkenning zit precies dat ontwerpvraagstuk. Daar wordt elke aangesloten meter automatisch afgelezen in een cyclus van vijftien tot dertig minuten, fotografeert één gedeelde camera de hele meterkast, en snijdt de server per meter een crop uit die ene foto.
Dat laatste is een kostenfeit, geen detail. Het aantal aanroepen volgt het aantal meters, niet het aantal foto's.
Een rekenvoorbeeld op onze eigen aannames, geen meting uit dat project: vier meters per kast, een cyclus van dertig minuten en een crop van 1000×1000 pixels geeft 192 aflezingen per dag. Met 200 tokens instructie per aflezing en 60 tokens antwoord is dat op Claude Haiku 4.5 ongeveer $0,34 per dag, circa € 9 per maand per meterkast.
Eén detail uit die case verdient aparte aandacht in je begroting: onleesbaar levert daar expliciet null met confidence 0 op, nooit een gok. Een mislukte aflezing is inhoudelijk het juiste antwoord en kost evenveel tokens als een geslaagde.
Je factuur teruglezen: welk veld telt wat
Als de eerste rekening binnen is, wil je hem kunnen narekenen. Dat lukt alleen als je weet dat het veld met invoertokens in het antwoord niet je volledige invoer is.
Anthropic legt het expliciet uit: het invoerveld bevat alleen de tokens ná je laatste cache-breekpunt. De totale invoer is de som van cache-reads, cache-writes en dat veld (rate limits).
Bij een gecachet document van 200.000 tokens en een vraag van 50 tokens zie je dus 50 staan, terwijl je 200.050 tokens verstuurde. Wie op het verkeerde veld begroot, komt een factor duizend tekort.
Nog een verschil dat op je factuur en op je limieten anders uitpakt: cache-reads worden wél in rekening gebracht, maar tellen bij de meeste Claude-modellen níet mee voor je invoerlimiet per minuut. Caching verhoogt je effectieve doorvoer dus zonder dat je een limietverhoging hoeft aan te vragen.
Budgetbewaking: drie grenzen die je vóór de bouw zet
Een tokenrekening die ongemerkt oploopt, is een van de risico's die we bij AI-software expliciet benoemen: vast aan één AI-leverancier, terwijl de tokenrekening ongemerkt oploopt. Drie grenzen houden dat tegen.
1. Een harde uitgavenlimiet in de console. Anthropic hanteert per tier een maandplafond — $500 op Start, $1.000 op Build, $200.000 op Scale — en je kunt daaronder je eigen limiet zetten op de factuurpagina.
Weet wel wat er gebeurt als je hem raakt. Bij het tierplafond geeft de API een 429 met foutcode enforced_spend_limit_reached en blijft dat zo tot 00:00 UTC op de eerste dag van de volgende maand; bij je eigen limiet krijg je een 400.
Dat is geen theoretisch scenario maar een ontwerpeis: je applicatie moet een nette terugvalroute hebben, want opnieuw proberen helpt niet.
2. Een aparte werkruimte per functie. Anthropic laat je per workspace een eigen uitgaven- en snelheidslimiet zetten, onder het plafond van de organisatie, dat altijd blijft gelden.
Wij meten modelkosten daarom per functie: dan kun je bijsturen, of van model wisselen zonder de boel opnieuw te bouwen. Eén werkruimte voor de chatbot, één voor de documentverwerking: dan zie je in de eerste maand welke functie het geld opeet.
3. Doorlopende meting in plaats van een jaarlijkse schrik. Onze Managed AI-retainers zijn hier expliciet op ingericht: monitoring en meetpunten, met bewaking op fouten, steekproeven op output en een nulmeting voor de rapportages.
Die retainers lopen van € 500 per maand voor Basis tot € 1.500 tot € 2.500 voor Premium. Voor wie zelf meet: de verbruikspagina van Anthropic toont ook je cache-hitratio, en dat is het eerste cijfer dat zakt als iemand de volgorde van een prompt verandert.
Wat het bouwen eromheen kost
De tokenrekening is bijna nooit de grootste post. Bij ons begint een ingebouwde AI-feature op € 8.500 en begint zoeken op je eigen data met RAG op € 12.500.
Het onderhoud daarna start op € 750 per maand, met de modelkosten daarbovenop.
Zet dat naast de rekenvoorbeelden hierboven en de verhouding wordt duidelijk. Duizend documenten per maand op een middenklassemodel kost ongeveer vijfentwintig euro; het bouwen en beproeven van de pipeline eromheen kost het honderdvoudige, eenmalig.
Voor het complete AI-budget zet de pagina wat AI kost voor bedrijven alle posten op een rij. Wil je de berekening voor jouw documenten en volumes samen doornemen, bel dan 085 016 0118 of stel je vraag via contact.
Het antwoord in één alinea
Tel de tokens van één eenheid werk, splits ze in vers, gecachet en uitvoer, vermenigvuldig met het tarief per soort en pas daarna met je maandvolume. Doe de telling op het model waarop je gaat draaien en op je eigen documenten, want een factuur en een klantmail verschillen in onze meting een factor twee per woord.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










