Ga naar hoofdinhoud
Terug naar AI Modellen Vergelijken
13 min lezen19 september 2026Gecontroleerd op 19 september 2026

AI-API-kosten berekenen per document en per gesprek: zo werkt het (2026)

Van factuurregel naar eurobedrag in acht stappen: tokens tellen, input en output splitsen, caching en tool-opslag meerekenen, en een budgetgrens zetten.

Bram DokmanOprichter & AI-specialist

Oprichter van CleverTech AI, met 12+ jaar ervaring in software development, online marketing en cloud-infrastructuur. BSc Science & Innovation Management (Universiteit Utrecht).

Deze pagina is gecontroleerd op

Een uitgeprinte pagina in papieren stroken geknipt en in rijen op een bureau gelegd, met één elektrisch blauwe strook, naast een schaar en een rekenmachine
AI Modellen Vergelijken

Kort antwoord

Reken in drie stappen: tel de tokens van een document of gesprek, splits ze in verse invoer, cache-invoer en uitvoer, en vermenigvuldig elke soort met het eigen tarief per miljoen. In onze eigen meting telde een Nederlandse inkoopfactuur 2,65 tokens per woord en een klantgesprek 1,27 — dezelfde vuistregel werkt dus niet op beide. Een document van 10.000 tokens invoer en 800 uitvoer kost daarmee circa 3 dollarcent op een middenklassemodel, en een gesprek van acht beurten met caching ongeveer 6,5 dollarcent.

Onze meting van vorige week: een Nederlandse inkoopfactuur van 146 woorden telde 387 tokens, een klantgesprek van 175 woorden telde er 223. Dezelfde taal, bijna hetzelfde aantal woorden, meer dan anderhalf keer zoveel tokens.

Dat is de reden dat een prijs per miljoen tokens je nog niets vertelt. Je koopt geen miljoenen tokens, je verwerkt facturen, mails, contracten en gesprekken.

Deze pagina is het rekenrecept dat daartussen zit. Wat de leveranciers per miljoen tokens rekenen, staat op de tariefpagina's voor de Claude API en de OpenAI API; welke modellen er zijn, staat in onze index over AI-modellen vergelijken.

Vier soorten tokens, vier tarieven

Elke AI-factuur bestaat uit dezelfde vier posten, bij elke leverancier, met een eigen prijs per stuk.

  • Verse invoer: alles wat je meestuurt en wat het model nog niet kort geleden zag.
  • Cache-invoer: een stuk prompt dat het model al verwerkte en dat tegen een fractie van het inputtarief terugkomt.
  • Uitvoer: het antwoord zelf, plus de redeneertokens die een model intern produceert voordat het iets zegt.
  • Batch: dezelfde tokens, asynchroon ingeleverd, bij Anthropic en OpenAI voor de helft van de prijs.

Die vier posten verschillen onderling een factor 5 tot 50. Op Claude Sonnet 5 kost een cache-hit $0,20 per miljoen en een outputtoken $10 per miljoen, vijftig keer zoveel (Anthropic-prijspagina, 18 september 2026).

Wie zijn kosten wil begrijpen, telt dus niet "tokens" maar vier keer iets anders. Dat is stap nul van het recept hieronder.

Hoeveel tokens zit er in een Nederlandse tekst? Onze meting

Een token is een tekstfragment: soms een heel woord, vaker een lettergreep, een cijferreeks of een leesteken. Anthropic houdt als ruwe schatting aan dat een token ongeveer vier tekens of 0,75 Engelse woorden is (prijspagina, FAQ).

Voor Nederlands klopt dat niet zomaar, en voor gestructureerde documenten helemaal niet. Daarom hebben we het gemeten in plaats van geschat.

Op 18 september 2026 hebben we drie realistische Nederlandse voorbeeldteksten door de open-source tokenizer van OpenAI gehaald (tiktoken, encoding o200k_base, de encoding die OpenAI voor de GPT-4o-familie documenteert in de tiktoken-cookbook).

Voorbeeldtekst Woorden Tekens Tokens Tokens per woord Tekens per token
Inkoopfactuur met artikelnummers, bedragen en btw 146 1.144 387 2,65 2,96
Klantgesprek servicedesk, spreektaal 175 999 223 1,27 4,48
Beleidstekst met lange samenstellingen 144 1.270 237 1,65 5,36
Totaal 465 3.413 847 1,82 4,03

Eigen meting, 18 september 2026, tiktoken o200k_base. De teksten zijn zelfgeschreven voorbeelden, geen klantdocumenten.

Drie conclusies die je businesscase raken. Een factuur kost per woord twee keer zoveel als een gesprek, omdat artikelnummers, bedragen en IBAN-reeksen in losse stukjes breken.

Lange Nederlandse samenstellingen zijn juist gunstig per teken: de beleidstekst haalde 5,36 tekens per token, de factuur 2,96. En het gemiddelde over alle drie, 1,82 token per woord, ligt fors boven de vuistregel van circa 1,4 die wij in offertes gebruiken.

Die vuistregel houdt dus stand voor lopende tekst en breekt op gestructureerde documenten. Tel daarom per documenttype, niet per organisatie.

Reken in tekens als je snel wilt schatten. Duizend woorden lopende Nederlandse tekst is grofweg 1.300 tot 1.700 tokens; duizend woorden factuurregels is er ruim 2.600.

Eén tekst, twee tellingen

Er is een addertje dat je met geen enkele vuistregel oplost: dezelfde tekst telt niet op elk model hetzelfde.

Anthropic schrijft dat modellen vanaf Claude Opus 4.7 een nieuwere tokenizer gebruiken die ongeveer 30 procent meer tokens voor dezelfde tekst produceert dan de eerdere modellen (token counting). Claude Sonnet 4.6 en ouder gebruiken de vorige tokenizer.

De praktische regel die daaruit volgt: tel je prompt met het model waarop je gaat draaien, niet met het model waarop je vorig jaar rekende. Anthropic biedt daar een gratis endpoint voor, waarover verderop meer.

Het rekenrecept in acht stappen

Dit is de volgorde die wij aanhouden als we een AI-functie in software begroten.

  1. Kies de eenheid die je bedrijf kent: één factuur, één klantgesprek, één aflezing, één dossier.
  2. Tel de tokens van één zo'n eenheid met de tokenizer of het telendpoint van de leverancier.
  3. Splits de invoer in vers, cache-write en cache-read.
  4. Tel de uitvoer apart; schat hem op de langste variant, niet op de kortste.
  5. Tel de vaste opslag per verzoek erbij: systeemprompt, tool-definities, opgehaalde kennisbankfragmenten.
  6. Vermenigvuldig elke soort met het eigen tarief per miljoen tokens en tel op.
  7. Vermenigvuldig met het maandvolume en reken om naar euro met een koersmarge.
  8. Deel terug naar de eenheid uit stap 1, zodat het bedrag bespreekbaar wordt.

De formule achter stap 6, voor wie hem in een spreadsheet zet: kosten = (vers × P_in + cachewrite × P_cw + cacheread × P_cr + uit × P_uit) ÷ 1.000.000.

Stap 4 is de stap die in de praktijk het vaakst misgaat. Uitvoer is bij vrijwel elk model vijf tot zes keer duurder dan invoer, dus een taak die veel tekst teruggeeft loopt harder op dan een taak die veel tekst leest.

Het rekenblad: vier documenttypen, drie modellen, in euro

Hieronder onze eigen werkblad-tabel. De tokenaantallen komen uit de meting hierboven, de tarieven van de leverancierspagina's van 18 september 2026, en de euro's van de dollarkoers van de ECB, peildatum 18 september 2026: 1,1460 dollar voor een euro.

Alle bedragen zijn euro per duizend stuks, exclusief btw, zonder caching en zonder batchkorting.

Eenheid Tokens in Tokens uit Claude Sonnet 5 GPT-5.6 Terra Gemini 3.8 Flash
Inkoopfactuur uitlezen naar velden 400 150 € 2,01 € 2,27 € 0,75
Klantmail lezen en beantwoorden 320 250 € 2,74 € 3,18 € 1,03
Contract van 20 pagina's samenvatten 13.200 800 € 30,02 € 31,41 € 11,26
Meterfoto van 1000×1000 px aflezen 1.496 60 € 3,13 € 3,24 € 1,18

Tarieven per miljoen tokens: Sonnet 5 $2 / $10 (Anthropic), GPT-5.6 Terra $2 / $12 (OpenAI), Gemini 3.8 Flash $0,75 / $3,75 (Google).

Vier dingen die je bij deze tabel moet weten voordat je hem overneemt.

De tokenaantallen zijn gemeten met de OpenAI-tokenizer. Op Claude-modellen vanaf 4.7 ligt de telling volgens Anthropic circa dertig procent hoger, dus de contractrij wordt daar eerder € 36,93 dan € 30,02.

De rij met de meterfoto rekent met 1.296 visuele tokens, het aantal dat Anthropic voor een afbeelding van 1000×1000 pixels noemt (vision-documentatie). OpenAI en Google tellen beeld anders, dus in die rij zijn de laatste twee kolommen een indicatie.

Het Gemini-tarief is een promotieprijs die volgens Google geldt "through December 31, 2026"; per 1 januari 2027 verdubbelt het naar $1,50 / $7,50. Een businesscase voor 2027 op de linkerkolom is dus geen businesscase.

En bij alle drie halveert de Batch API beide kolommen: Gemini 3.8 Flash zakt daarmee tot en met 31 december 2026 naar $0,375 en $1,875 per miljoen.

Rekenvoorbeeld 1: één document van 10.000 tokens

De bedragen hieronder zijn gerekend op de tarieven uit de vorige sectie; er is geen project bij gemeten. We nemen per document 10.000 tokens aan de invoerkant en 800 aan de uitvoerkant, zodat dit naast de twee tariefpagina's te leggen is.

Model Per document Per 1.000 stuks In euro Via batch, in euro
Claude Sonnet 5 $0,0280 $28,00 € 24,43 € 12,22
GPT-5.6 Terra $0,0296 $29,60 € 25,83 € 12,91
Gemini 3.8 Flash $0,0105 $10,50 € 9,16 € 4,58

De rekenwijze op Sonnet 5, zodat je hem kunt naspelen: 10.000 × $2 ÷ 1.000.000 = $0,020 voor de invoer, plus 800 × $10 ÷ 1.000.000 = $0,008 voor de uitvoer.

Let op wat hier níet gebeurt. Het duurste model in deze rij is nog geen drie keer het goedkoopste, terwijl de kwaliteitsverschillen op een slecht gescande factuur veel groter zijn dan drie keer.

Bij duizend documenten per maand praat je over het verschil tussen negen en zesentwintig euro. Die discussie is de vergadering niet waard; de vraag welk model minder velden verkeerd overneemt, wel.

Rekenvoorbeeld 2: één gesprek van acht beurten

Een gesprek rekent anders dan een document, want elke beurt stuurt de hele voorgeschiedenis opnieuw mee. Onze aannames, gelijk aan die op de twee tariefpagina's: acht beurten lang, een vast voorstuk van 6.000 tokens in de cache, per beurt 100 tokens vraag en 250 tokens antwoord.

Optellen levert dan: 10.600 tokens verse invoer over het hele gesprek, één cache write van 6.000 tokens, zeven cache reads van 6.000 (42.000 tokens) en 2.000 tokens uitvoer.

Model Zonder caching Met caching Per 1.000 gesprekken, zonder caching
Claude Sonnet 5 $0,1372 $0,0646 € 119,72
GPT-5.6 Terra $0,1412 lager, eigen cachetarief € 123,21
Gemini 3.8 Flash $0,0515 lager, eigen cachetarief € 44,90

Rekenwijze op Sonnet 5 met caching: cache write 6.000 × $2,50, cache reads 42.000 × $0,20, verse invoer 10.600 × $2 en uitvoer 2.000 × $10, alles gedeeld door een miljoen. Dat is $0,0646, oftewel € 56,37 per duizend gesprekken.

Eén cache write, zeven cache reads. Acht beurten betekent niet acht cache reads: de eerste beurt schrijft het voorstuk weg, de zeven daarna lezen het terug. Reken je er acht, dan zit je er bijna twee procent naast — vervelender is dat dezelfde denkfout in een groot volume wél zichtbaar wordt.

Caching halveert dit gesprek op Claude. Anthropic rekent daarvoor met vaste vermenigvuldigers: een cache write van vijf minuten kost 1,25 keer het inputtarief, een write van een uur 2 keer, en een cache-hit een tiende — op Fable 5.1 zelfs een veertigste.

De voorwaarde staat in dezelfde documentatie: de cache van vijf minuten is terugverdiend na één read, die van een uur na twee. Antwoordt je klant pas na een kwartier, dan betaal je de write twee keer en verdien je niets terug.

Voor de tarieven per model per leverancier verwijzen we naar de twee tariefpagina's; voor Gemini en Mistral verschijnen die pagina's later in deze reeks.

Waarom beurt acht meer kost dan beurt één

In het voorbeeld hierboven is beurt één een verzoek van 6.100 tokens en beurt acht een verzoek van 8.550. Dezelfde vraag, dezelfde klant, veertig procent meer invoer.

Dat komt doordat een taalmodel geen geheugen heeft tussen verzoeken. Wat het "weet" van eerder in het gesprek, stuur je elke keer opnieuw mee.

De groei is lineair per beurt, maar de kosten over een heel gesprek lopen sneller op dan het aantal beurten. Een gesprek van zestien beurten kost in dit voorbeeld ruim twee keer een gesprek van acht; het vaste voorstuk van 6.000 tokens dempt die versnelling, de groeiende geschiedenis jaagt hem aan.

Drie ontwerpknoppen die dat temmen:

  • Zet het vaste deel vooraan (instructies, productinformatie, tooldefinities) zodat er een gedeeld voorstuk is om te cachen.
  • Kap de geschiedenis af na een vast aantal beurten, of vat hem samen in een kort blok.
  • Zet een maximum op de uitvoer per antwoord; dat is meteen je kostenplafond per aanroep.

Bij Anthropic heeft die laatste knop geen nadeel aan de limietkant: de parameter voor het maximum aantal uitvoertokens telt niet mee in de berekening van de output-limiet per minuut (rate limits).

Wat dit betekent voor een agent die tientallen beurten loopt, staat in onze pagina over de Claude API koppelen aan eigen software.

Tool-calls: de opslag die je niet ziet

Zodra je model gereedschap krijgt (een agenda lezen, een order opzoeken), betaal je voor de beschrijving van dat gereedschap. Bij elke beurt opnieuw.

Anthropic laat de orde van grootte zien in twee voorbeelden uit dezelfde documentatie. Een begroeting met een korte systeemprompt telt 14 invoertokens; een vraag over het weer mét één weer-tool erbij telt er 403 (token counting).

Bovenop de tooldefinities zelf komt een vaste systeemprompt voor tool-gebruik. Die is per model gedocumenteerd: 354 tokens op Sonnet 5, 286 op Opus 5, 496 op Haiku 4.5, en 92 tot 120 meer zodra je het model dwingt een tool te kiezen.

Wat je toevoegt Extra invoertokens
Systeemprompt voor tool-gebruik (Sonnet 5) 354
Bash-tool (Opus 5) 325
Teksteditor-tool 700
Computer-toolset, standaard circa 4.500
Browser-toolset, standaard circa 6.600

Bron: Anthropic-prijspagina, tool use pricing, 18 september 2026.

Reken dat door voor een agent met een browser-toolset en twintig beurten: 6.600 tokens die twintig keer meegaan is 132.000 tokens per sessie, nog voordat de klant iets gevraagd heeft. Op Sonnet 5 is dat $0,26 per sessie, tenzij je het voorstuk cachet.

Sommige tools kosten daarnaast geld buiten tokens om. Een websearch via de Claude API kost $10 per duizend zoekopdrachten, bovenop de tokens van wat de zoekmachine terugstuurt.

Beeld telt anders: van meterfoto naar tokens

Beeld gaat niet per woord maar per vlak. Claude verwerkt een afbeelding in blokjes van 28 bij 28 pixels, dus een foto kost ⌈breedte ÷ 28⌉ × ⌈hoogte ÷ 28⌉ visuele tokens.

Praktisch: 1000×1000 pixels is 1.296 tokens, 1920×1080 is 1.560 tokens op de standaardmodellen en 2.691 op de hoge-resolutiemodellen vanaf Claude 4.7. Grotere beelden worden vóór verwerking verkleind, wat de rekening afvlakt maar ook detail kost.

In onze case meterstanden automatisch uitlezen met AI-beeldherkenning zit precies dat ontwerpvraagstuk. Daar wordt elke aangesloten meter automatisch afgelezen in een cyclus van vijftien tot dertig minuten, fotografeert één gedeelde camera de hele meterkast, en snijdt de server per meter een crop uit die ene foto.

Dat laatste is een kostenfeit, geen detail. Het aantal aanroepen volgt het aantal meters, niet het aantal foto's.

Een rekenvoorbeeld op onze eigen aannames, geen meting uit dat project: vier meters per kast, een cyclus van dertig minuten en een crop van 1000×1000 pixels geeft 192 aflezingen per dag. Met 200 tokens instructie per aflezing en 60 tokens antwoord is dat op Claude Haiku 4.5 ongeveer $0,34 per dag, circa € 9 per maand per meterkast.

Eén detail uit die case verdient aparte aandacht in je begroting: onleesbaar levert daar expliciet null met confidence 0 op, nooit een gok. Een mislukte aflezing is inhoudelijk het juiste antwoord en kost evenveel tokens als een geslaagde.

Je factuur teruglezen: welk veld telt wat

Als de eerste rekening binnen is, wil je hem kunnen narekenen. Dat lukt alleen als je weet dat het veld met invoertokens in het antwoord niet je volledige invoer is.

Anthropic legt het expliciet uit: het invoerveld bevat alleen de tokens ná je laatste cache-breekpunt. De totale invoer is de som van cache-reads, cache-writes en dat veld (rate limits).

Bij een gecachet document van 200.000 tokens en een vraag van 50 tokens zie je dus 50 staan, terwijl je 200.050 tokens verstuurde. Wie op het verkeerde veld begroot, komt een factor duizend tekort.

Nog een verschil dat op je factuur en op je limieten anders uitpakt: cache-reads worden wél in rekening gebracht, maar tellen bij de meeste Claude-modellen níet mee voor je invoerlimiet per minuut. Caching verhoogt je effectieve doorvoer dus zonder dat je een limietverhoging hoeft aan te vragen.

Budgetbewaking: drie grenzen die je vóór de bouw zet

Een tokenrekening die ongemerkt oploopt, is een van de risico's die we bij AI-software expliciet benoemen: vast aan één AI-leverancier, terwijl de tokenrekening ongemerkt oploopt. Drie grenzen houden dat tegen.

1. Een harde uitgavenlimiet in de console. Anthropic hanteert per tier een maandplafond — $500 op Start, $1.000 op Build, $200.000 op Scale — en je kunt daaronder je eigen limiet zetten op de factuurpagina.

Weet wel wat er gebeurt als je hem raakt. Bij het tierplafond geeft de API een 429 met foutcode enforced_spend_limit_reached en blijft dat zo tot 00:00 UTC op de eerste dag van de volgende maand; bij je eigen limiet krijg je een 400.

Dat is geen theoretisch scenario maar een ontwerpeis: je applicatie moet een nette terugvalroute hebben, want opnieuw proberen helpt niet.

2. Een aparte werkruimte per functie. Anthropic laat je per workspace een eigen uitgaven- en snelheidslimiet zetten, onder het plafond van de organisatie, dat altijd blijft gelden.

Wij meten modelkosten daarom per functie: dan kun je bijsturen, of van model wisselen zonder de boel opnieuw te bouwen. Eén werkruimte voor de chatbot, één voor de documentverwerking: dan zie je in de eerste maand welke functie het geld opeet.

3. Doorlopende meting in plaats van een jaarlijkse schrik. Onze Managed AI-retainers zijn hier expliciet op ingericht: monitoring en meetpunten, met bewaking op fouten, steekproeven op output en een nulmeting voor de rapportages.

Die retainers lopen van € 500 per maand voor Basis tot € 1.500 tot € 2.500 voor Premium. Voor wie zelf meet: de verbruikspagina van Anthropic toont ook je cache-hitratio, en dat is het eerste cijfer dat zakt als iemand de volgorde van een prompt verandert.

Wat het bouwen eromheen kost

De tokenrekening is bijna nooit de grootste post. Bij ons begint een ingebouwde AI-feature op € 8.500 en begint zoeken op je eigen data met RAG op € 12.500.

Het onderhoud daarna start op € 750 per maand, met de modelkosten daarbovenop.

Zet dat naast de rekenvoorbeelden hierboven en de verhouding wordt duidelijk. Duizend documenten per maand op een middenklassemodel kost ongeveer vijfentwintig euro; het bouwen en beproeven van de pipeline eromheen kost het honderdvoudige, eenmalig.

Voor het complete AI-budget zet de pagina wat AI kost voor bedrijven alle posten op een rij. Wil je de berekening voor jouw documenten en volumes samen doornemen, bel dan 085 016 0118 of stel je vraag via contact.

Het antwoord in één alinea

Tel de tokens van één eenheid werk, splits ze in vers, gecachet en uitvoer, vermenigvuldig met het tarief per soort en pas daarna met je maandvolume. Doe de telling op het model waarop je gaat draaien en op je eigen documenten, want een factuur en een klantmail verschillen in onze meting een factor twee per woord.

Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.

Tags:#API#AI kosten#AI tools#MKB
Delen:
Veelgestelde vragen

Antwoorden over dit artikel

Wat is een token en waarom reken je daarin af?

Een token is het stukje tekst waarin een model rekent: soms een heel woord, vaker een lettergreep, een getal of een leesteken. Omdat het model in die stukjes werkt, factureert de leverancier er ook in. Anthropic noemt als ruwe schatting vier tekens of 0,75 Engelse woorden per token.

Hoeveel tokens is één Nederlands woord?

Dat hangt sterk af van het soort tekst. In onze eigen meting van 18 september 2026 telde een Nederlandse inkoopfactuur 2,65 tokens per woord, een klantgesprek 1,27 en een formele beleidstekst 1,65. Gebruik voor lopende tekst circa 1,4 als vuistregel en tel gestructureerde documenten altijd zelf na.

Hoe tel ik de tokens van mijn eigen documenten?

Voor Claude gebruik je het endpoint voor token counting, dat gratis is en dezelfde invoer accepteert als een gewoon verzoek, inclusief systeemprompt, tools, afbeeldingen en PDF-bestanden. Voor OpenAI-modellen gebruik je de open-source tokenizer tiktoken. Tel altijd met het model waarop je gaat draaien.

Kost het geld om tokens te tellen?

Bij Anthropic niet: het telendpoint is gratis, met een eigen limiet per minuut die losstaat van de limiet op gewone verzoeken. Die limiet loopt van 5.000 verzoeken per minuut op het instaptier tot 20.000 op het hoogste standaardtier.

Waarom kost dezelfde tekst op het ene model meer tokens dan op het andere?

Elk model heeft zijn eigen tokenizer. Anthropic meldt dat modellen vanaf Claude Opus 4.7 een nieuwere tokenizer gebruiken die ongeveer dertig procent meer tokens produceert voor dezelfde tekst dan de eerdere modellen. Hergebruik dus geen tellingen van een oud model als je overstapt.

Wat is het verschil tussen input, output, cached en batch?

Input is alles wat je meestuurt, output is wat het model teruggeeft, cached input is een eerder verwerkt stuk prompt dat tegen een fractie van de prijs terugkomt, en batch is dezelfde verwerking asynchroon. Bij Anthropic en OpenAI halveert batch zowel de invoer- als de uitvoerprijs. Output is bij vrijwel elk model vijf tot zes keer duurder dan input.

Waarom kost beurt acht in een gesprek meer dan beurt één?

Een taalmodel onthoudt niets tussen verzoeken, dus je stuurt de hele voorgeschiedenis elke beurt opnieuw mee. In ons rekenvoorbeeld groeit een verzoek van 6.100 tokens in beurt één naar 8.550 in beurt acht. Over een heel gesprek loopt de rekening daardoor sneller op dan het aantal beurten.

Hoeveel scheelt prompt caching in de praktijk?

In ons rekenvoorbeeld van acht beurten met een voorstuk van 6.000 tokens halveert caching de prijs van het gesprek op Claude Sonnet 5, van $0,137 naar $0,065. De voorwaarde is dat het voorstuk binnen de levensduur van de cache terugkomt: een cache van vijf minuten is terugverdiend na één hergebruik, een cache van een uur na twee.

Tellen tool-definities mee in de kosten?

Ja, en meer dan mensen verwachten. Anthropic toont twee voorbeelden: een begroeting met een korte systeemprompt telt 14 invoertokens, terwijl een andere vraag, over het weer, mét één tool erbij 403 telt. Dat verschil zit in de toolbeschrijving plus een vaste systeemprompt voor tool-gebruik, en die opslag gaat bij elke beurt opnieuw mee, dus cache hem.

Hoe reken ik de kosten van een afbeelding of scan?

Beeld telt per vlak, niet per woord. Claude verwerkt een afbeelding in blokjes van 28 bij 28 pixels, dus een foto kost breedte gedeeld door 28 maal hoogte gedeeld door 28 visuele tokens, naar boven afgerond. Een afbeelding van 1000 bij 1000 pixels is daarmee 1.296 tokens.

Wat kost het verwerken van duizend documenten per maand?

Bij 10.000 tokens invoer en 800 tokens uitvoer per document kost dat op Claude Sonnet 5 circa € 24 per duizend documenten, op GPT-5.6 Terra circa € 26 en op Gemini 3.8 Flash circa € 9, exclusief btw en zonder caching. Via de Batch API halveren die bedragen bij Anthropic en OpenAI. Peildatum 18 september 2026, koers 1 euro = 1,1460 dollar.

Reken ik in dollars of in euro?

De grote leveranciers factureren in dollars, dus je eurobedrag beweegt mee met de koers. Wij rekenen om op de ECB-referentiekoers van de dag en houden in een businesscase tien procent koersmarge aan. De btw is voor een btw-plichtige onderneming meestal aftrekbaar, dus reken met de bedragen exclusief btw.

Hoe voorkom ik dat mijn AI-rekening ontspoort?

Zet drie grenzen voordat je live gaat: een eigen uitgavenlimiet in de console van de leverancier, een aparte werkruimte per functie met eigen limieten, en een maximum aantal uitvoertokens per aanroep. Anthropic hanteert daarnaast een maandplafond per tier, van $500 op Start tot $200.000 op Scale.

Wat gebeurt er als ik mijn uitgavenlimiet bereik?

Bij het maandplafond van je tier geeft de Claude API een 429-fout met de code enforced_spend_limit_reached, zonder retry-after-header, en blijft het verkeer stilstaan tot 00:00 UTC op de eerste dag van de volgende maand. Bij een limiet die je zelf hebt ingesteld krijg je een 400-fout. Bouw daarom een terugvalroute in je applicatie.

Waarom klopt het aantal invoertokens op mijn factuur niet met mijn eigen telling?

Het invoerveld in het antwoord bevat alleen de tokens na je laatste cache-breekpunt. Je totale invoer is de som van cache-reads, cache-writes en dat veld. Bij een gecachet document van 200.000 tokens en een vraag van 50 tokens zie je dus 50 staan, terwijl je ruim 200.000 tokens verstuurde.

Tellen gecachete tokens mee voor mijn limiet per minuut?

Bij de meeste Claude-modellen niet: alleen ongecachete invoer en cache-writes tellen mee voor de invoerlimiet per minuut, cache-reads niet. Betalen doe je er wel voor, tegen het cache-tarief. Caching verhoogt je effectieve doorvoer dus zonder dat je een limietverhoging hoeft aan te vragen.

Is een goedkoper model altijd de betere keuze?

Zelden. In ons rekenvoorbeeld per document scheelt het duurste model nog geen factor drie met het goedkoopste, terwijl één verkeerd overgenomen factuurbedrag meer kost dan het hele maandverschil. Kies op foutkans voor jouw documenttype en gebruik het goedkope model voor het routinewerk eronder.

Wanneer is de API goedkoper dan een abonnement per gebruiker?

De API rekent per verbruikt token en past bij software die geautomatiseerd verzoeken doet. Een abonnement is een vaste prijs per medewerker en past bij mensen die zelf typen. Bij een handvol medewerkers wint het abonnement bijna altijd; bij duizenden geautomatiseerde verwerkingen per dag de API.

Wat kost het bouwen van de software eromheen?

Een ingebouwde AI-feature begint bij CleverTech AI op € 8.500 en RAG op je eigen data op € 12.500, met een vaste prijs zodra de scoping rond is. Het onderhoud start daarna op € 750 per maand, met de modelkosten daarbovenop. In vrijwel elk MKB-project is dat de grootste post, niet de tokenrekening.

Volgende stap

Wat dit in jouw situatie betekent, weet je snel

Je legt je vraag voor, wij zeggen wat haalbaar is, wat het ongeveer kost en wat de slimste eerste stap is. Ook als dat betekent: nog even niet bouwen.

Liever eerst schriftelijk? Stel je vraag via het formulier.
Liever eerst zelf checken? Download de AI Readiness Checklist.
5,0op Google
  • Zeer fijne samenwerking! Professioneel, deskundig en vooral erg oplossingsgericht. Ze denken goed mee, communiceren duidelijk en leveren kwaliteit. Een betrouwbare en innovatieve techpartner die ik zeker kan aanbevelen!

    Spark O.

  • Heel goed geholpen duidelijke uitleg en werken heel hard voor je en denken heel goed mee wat belangrijk is. Duidelijk heel veel kennis van zaken. Echt een aanrader.

    Maarten B.

Blijf op de hoogte

Ontvang praktische AI-inzichten in je inbox. Geen spam, alleen waardevolle content.

Geen spam · max 2x per maand · altijd opzegbaar

Je gegevens worden alleen gebruikt voor het verzenden van de nieuwsbrief. Uitschrijven kan op elk moment.

Van kennis naar resultaat

Wat betekent dit voor jouw bedrijf?

We denken vrijblijvend mee over wat dit concreet zou opleveren — vaste prijs, vaste deadline.