Kort antwoord
De Claude API kost in september 2026 per miljoen tokens $1 / $5 (Haiku 4.5), $2 / $10 (Sonnet 5), $5 / $25 (Opus 5) en $10 / $50 (Fable 5.1) voor input / output; omgerekend is dat circa €0,87 tot €43 per miljoen, exclusief btw. Een cache read kost 10% van de inputprijs (2,5% op Fable 5.1) en de Batch API halveert input én output. In de praktijk betekent dat: één document van tien duizend tokens samenvatten kost op Sonnet 5 ongeveer 3 dollarcent, één klantgesprek van acht beurten met caching ongeveer 7 dollarcent.
Van lezen naar doen.
Een miljoen tokens is een eenheid die nergens in je bedrijf voorkomt. Je hebt documenten, klantgesprekken en orderregels, en de prijslijst van Anthropic praat in iets anders.
Deze pagina doet de vertaling. Eerst de volledige tokentabel van september 2026 in dollars en in euro, dan twee rekenvoorbeelden die je zelf kunt naspelen, en daarna de posten die níet in het lijsttarief zitten maar wél op je factuur landen.
Wie de modelkeuze in de breedte wil zien, begint bij onze index over AI-modellen vergelijken. Hier gaat het uitsluitend om de API-rekening.
De tokentabel: alle Claude-modellen in september 2026
Dit is onze eigen samenvatting van de prijspagina van Anthropic, opgehaald op 18 september 2026. Alle bedragen zijn dollars per miljoen tokens (MTok), exclusief btw.
| Model | Input | Output | Cache write 5 min | Cache write 1 uur | Cache read | Batch input | Batch output |
|---|---|---|---|---|---|---|---|
| Claude Fable 5.1 | $10 | $50 | $12,50 | $20 | $0,25 | $5 | $25 |
| Claude Fable 5 | $10 | $50 | $12,50 | $20 | $1,00 | $5 | $25 |
| Claude Opus 5 | $5 | $25 | $6,25 | $10 | $0,50 | $2,50 | $12,50 |
| Claude Opus 4.5 t/m 4.8 | $5 | $25 | $6,25 | $10 | $0,50 | $2,50 | $12,50 |
| Claude Sonnet 5 | $2 | $10 | $2,50 | $4 | $0,20 | $1 | $5 |
| Claude Sonnet 4.5 en 4.6 | $3 | $15 | $3,75 | $6 | $0,30 | $1,50 | $7,50 |
| Claude Haiku 4.5 | $1 | $5 | $1,25 | $2 | $0,10 | $0,50 | $2,50 |
Drie dingen in die tabel zijn nieuw of makkelijk te missen.
Sonnet 5 blijft op $2 / $10. Dat tarief was bij de lancering aangekondigd als introductieprijs tot en met 31 augustus 2026, met een verhoging naar $3 / $15 op 1 september; Anthropic schrijft nu dat die verhoging "will not occur" en dat $2 / $10 de standaardprijs is.
Fable 5.1 heeft een afwijkende cache read. Alle modellen rekenen 10% van de inputprijs voor een cache hit, behalve Fable 5.1 en Mythos 5.1: daar is het 2,5%, oftewel $0,25 per miljoen. Wat dat voor een agent-workload betekent, staat op onze pagina over Claude Fable 5.1; hier houden we het bij de tarieven.
Opus 4 en 4.1, Sonnet 4 en Haiku 3.5 zijn uitgefaseerd op de Claude API en bestaan alleen nog op Bedrock en Google Cloud (Opus 4 uitsluitend op Google Cloud). Ze staan daarom niet in de tabel; hun tarieven staan nog wel op de prijspagina.
Het goedkoopste model heeft de kortste garantie. Anthropic belooft Haiku 4.5 niet vóór 15 oktober 2026 uit te faseren, tegen 30 juni 2027 voor Sonnet 5, 24 juli 2027 voor Opus 5 en 1 september 2027 voor Fable 5.1 (modeloverzicht). Wie een pipeline op Haiku begroot, plant dus een modelwissel mee.
Dezelfde tabel in euro
Anthropic factureert uitsluitend in dollars. Voor de omrekening gebruiken we de ECB-referentiekoers van 16 september 2026: 1,1537 dollar per euro.
| Model | Input (circa € excl. btw) | Output (circa € excl. btw) | Input (circa € incl. 21% btw) | Output (circa € incl. 21% btw) |
|---|---|---|---|---|
| Claude Fable 5.1 | €8,67 | €43,34 | €10,49 | €52,44 |
| Claude Opus 5 | €4,33 | €21,67 | €5,24 | €26,22 |
| Claude Sonnet 5 | €1,73 | €8,67 | €2,10 | €10,49 |
| Claude Sonnet 4.6 | €2,60 | €13,00 | €3,15 | €15,73 |
| Claude Haiku 4.5 | €0,87 | €4,33 | €1,05 | €5,24 |
De btw-kolom is er voor wie de rekening netto wil zien; een btw-plichtig bedrijf verrekent die post gewoon. Je creditcardmaatschappij of bank rekent daarbovenop een eigen wisselkoersmarge, en die staat niet op de factuur van Anthropic.
Wat één miljoen tokens is in documenten
Anthropic geeft zelf twee ijkpunten. Eén token is grofweg vier tekens of 0,75 Engels woord (prijspagina), en op de huidige tokenizer past er "roughly 555k words" in een venster van 1 miljoen tokens (modeloverzicht Anthropic).
Voor bestanden geeft de prijspagina deze richtwaarden: een gemiddelde webpagina van 10 kB is ongeveer 2.500 tokens, een documentatiepagina van 100 kB ongeveer 25.000, een onderzoeksartikel als PDF van 500 kB ongeveer 125.000.
Die schattingen zijn voor Engels. Voor Nederlandse teksten tel je niet in je hoofd maar met het count_tokens-endpoint, dat volgens de documentatie "free to use" is en dezelfde invoer accepteert als een gewoon bericht, inclusief PDF's en tools.
De tokenizer-valkuil bij een modelwissel
Sinds Claude Opus 4.7 gebruikt Anthropic een nieuwe tokenizer, en die "produces approximately 30% more tokens for the same text". Sonnet 4.6 en eerder tellen nog met de oude.
Dat maakt een prijsvergelijking tussen generaties misleidend als je alleen naar de tabel kijkt. Sonnet 5 is per token een derde goedkoper dan Sonnet 4.6, maar per stuk tekst is het verschil veel kleiner.
Reken het na met de twee woordtellingen uit het modeloverzicht: 1 miljoen tokens is 555.000 woorden op de nieuwe tokenizer en 750.000 woorden op de oude.
| Per 1.000 woorden Engelse invoer | Tokens (afgerond) | Inputkosten | Outputkosten (zelfde lengte) |
|---|---|---|---|
| Claude Sonnet 4.6 (oude tokenizer, $3 / $15) | circa 1.333 | $0,0040 | $0,020 |
| Claude Sonnet 5 (nieuwe tokenizer, $2 / $10) | circa 1.802 | $0,0036 | $0,018 |
Per woord scheelt het dus ongeveer 10%, niet 33%. Dat is onze eigen afleiding uit de twee getallen van Anthropic; meet hem voor jouw prompts door dezelfde tekst twee keer te tellen, één keer per model-ID.
Rekenvoorbeeld 1: wat kost één document?
Stel dat je inkomende documenten laat samenvatten en structureren: contracten, offertes, rapporten. Dit is een rekenvoorbeeld op de tabel hierboven, geen meting uit een project.
Aannames: 10.000 tokens invoer per document (grofweg vijftien A4 Engels; Nederlands telt hoger) en 800 tokens uitvoer voor een gestructureerde samenvatting.
| Model | Per document | Per 1.000 documenten | Per 1.000 via Batch API | Per 1.000 in euro (batch, circa) |
|---|---|---|---|---|
| Claude Haiku 4.5 | $0,014 | $14 | $7 | €6 |
| Claude Sonnet 5 | $0,028 | $28 | $14 | €12 |
| Claude Opus 5 | $0,070 | $70 | $35 | €30 |
| Claude Fable 5.1 | $0,140 | $140 | $70 | €61 |
Rekenwijze per document op Sonnet 5: 10.000 × $2 / 1.000.000 = $0,020 invoer plus 800 × $10 / 1.000.000 = $0,008 uitvoer.
De conclusie die hieruit volgt is ongemakkelijk voor wie op modelkosten stuurt: op duizend documenten per maand zit het hele verschil tussen het goedkoopste en het duurste model onder de 130 dollar. De vraag welk model minder fouten maakt in jouw documenten weegt zwaarder dan die factor tien.
Wat een document-pipeline werkelijk kost, zit in het bouwen en beproeven ervan. Daarover verderop, bij onze prijsband.
Rekenvoorbeeld 2: wat kost één klantgesprek?
Een chatgesprek rekent anders dan een document, omdat elke beurt de hele voorgeschiedenis opnieuw meestuurt. Precies daar verdient prompt caching zijn geld.
Aannames voor dit rekenvoorbeeld: een vast deel van 6.000 tokens (systeemprompt plus productinformatie) dat gecachet wordt, acht beurten, per beurt 100 tokens van de klant en 250 tokens antwoord.
Per gesprek loopt de ongecachete invoer op tot 10.600 tokens (de groeiende geschiedenis), staan er 48.000 tokens aan cache reads, één cache write van 6.000 tokens en 2.000 tokens uitvoer.
| Model | Per gesprek, met caching | Per gesprek, zonder caching | Per 1.000 gesprekken, met caching |
|---|---|---|---|
| Claude Haiku 4.5 | $0,033 | $0,069 | $33 |
| Claude Sonnet 5 | $0,066 | $0,137 | $66 |
| Claude Opus 5 | $0,165 | $0,343 | $165 |
| Claude Fable 5.1 | $0,293 | $0,686 | $293 |
Rekenwijze op Sonnet 5: cache write 6.000 × $2,50 = $0,015, cache reads 48.000 × $0,20 = $0,0096, ongecachete invoer 10.600 × $2 = $0,0212, uitvoer 2.000 × $10 = $0,020, alles per miljoen.
Caching halveert de gespreksprijs in dit voorbeeld op elk model. In de praktijk valt hij nog lager uit, omdat de vaste prefix bij drukte warm blijft tussen gesprekken en Anthropics automatische caching ook de groeiende geschiedenis meeneemt.
Eén voorwaarde bepaalt of je dit haalt: de klant moet binnen de cache-levensduur antwoorden. Daarover nu.
Prompt caching: de vier multipliers
Caching werkt met vaste vermenigvuldigers op de inputprijs, volgens de prijspagina:
- Cache write van 5 minuten: 1,25 × de inputprijs.
- Cache write van 1 uur: 2 × de inputprijs.
- Cache read: 0,1 × de inputprijs (0,025 × op Fable 5.1 en Mythos 5.1).
- Batch en dataresidentie stapelen hier bovenop.
Anthropic rekent zelf het omslagpunt voor: een 5-minutencache is terugverdiend na één read, een 1-uurcache na twee reads. Elke read verlengt de cache bovendien gratis.
De levensduur loopt vanaf de start van het verzoek dat schrijft of leest, niet vanaf het einde van het antwoord (caching-documentatie). Een antwoord dat vier minuten streamt, laat dus nog ongeveer één minuut over voor de volgende beurt.
Twee kostenvalkuilen die geen foutmelding geven:
- Onder de minimale promptlengte cachet er niets: 512 tokens op Fable 5.1 en Opus 5, 1.024 op Sonnet 5, 4.096 op Haiku 4.5.
- Een gewijzigde
effortop verzoekniveau maakt de cache ongeldig; alleen Fable 5.1, Mythos 5.1 en Opus 5 kunnen effort per bericht wijzigen met behoud van cache (effort-documentatie).
Controleer het in de usage van elke response: staan cache_creation_input_tokens en cache_read_input_tokens op nul, dan betaal je vol tarief.
Batch API: de helft, met drie voorwaarden
De Message Batches API rekent 50% van het standaardtarief op input én output, en dat geldt voor alle modellen in de tabel. De voorwaarden staan in de batch-documentatie:
- Een batch bevat maximaal 100.000 verzoeken of 256 MB, wat het eerst bereikt wordt.
- De meeste batches zijn binnen een uur klaar; na 24 uur vervallen onverwerkte verzoeken, en die worden niet gefactureerd.
- Caching werkt binnen een batch, maar "on a best-effort basis", met hitrates die Anthropic tussen 30% en 98% plaatst.
Voor documentverwerking, nachtelijke classificatie en het verrijken van data is dit de grootste knop die er is. Voor een chatgesprek is hij per definitie onbruikbaar.
Het contextvenster van 1 miljoen tokens kost geen toeslag
Fable 5.1, Opus 5 en Sonnet 5 hebben een venster van 1 miljoen tokens en een maximale uitvoer van 128.000; Haiku 4.5 zit op 200.000 en 64.000 (modeloverzicht).
Over dat hele venster geldt het standaardtarief: "A 900k-token request is billed at the same per-token rate as a 9k-token request", en caching en batch blijven werken over de volle lengte.
Een verzoek van 300.000 tokens kost dus $0,60 aan invoer op Sonnet 5, $1,50 op Opus 5 en $3,00 op Fable 5.1, plus de uitvoer. Dat is betaalbaar voor een eenmalige analyse, en onbetaalbaar als elke vraag van elke gebruiker het volledige archief meestuurt.
Waarom RAG de rekening kantelt
Voor een assistent op eigen documenten stuur je niet het archief mee, maar de passages die bij de vraag horen. Zo bouwden we Bijbel Assistent, een eigen product: PostgreSQL met pgvector haalt de relevante passages op en de Claude API redeneert als laag daarbovenop, met bronvermelding in het antwoord.
Op de tabel hierboven scheelt dat een factor honderd per vraag: 3.000 opgehaalde tokens tegen 300.000 tokens archief. Die uitkomst is rekenkundig, geen meting uit de case.
De les uit dat project is een andere. De kosten van zo'n assistent zitten vóór het chatvenster: het corpus opschonen, embeddings bijhouden en toetsen of de juiste passage wordt opgehaald, zelden bij het taalmodel.
Wat er bovenop het tokentarief komt
Zes posten staan niet in de tokentabel en wel op de factuur. Alle zes komen van de prijspagina, tenzij anders vermeld.
Denktokens zijn uitvoertokens. De thinking-documentatie is er expliciet over: redeneertokens "are billed as output tokens, even when the thinking text isn't returned to you". Op Fable 5.1 tegen $50 per miljoen is dat de duurste regel die je hebt.
Effort staat standaard op high. De niveaus lopen van low tot max, en high "produces exactly the same behavior as omitting the effort parameter". Wie nooit iets instelt, betaalt dus voor de middelste van vijf standen, ook voor een classificatie van drie regels.
Server-tools. Web search kost $10 per 1.000 zoekopdrachten bovenop de tokens; web fetch is gratis buiten de tokens; code execution geeft 1.550 gratis containeruren per maand en rekent daarna $0,05 per uur, met een minimum van vijf minuten per run.
Tool-definities kosten tokens. Zodra je één tool meegeeft, voegt de API een systeemprompt toe: 286 tokens op Opus 5, 354 op Sonnet 5 en 496 op Haiku 4.5 bij tool_choice: auto, plus de tokens van je eigen toolbeschrijvingen.
Regio kost 10%. US-only inferentie via inference_geo: "us" rekent 1,1 × op alle tokencategorieën; wereldwijde routering (de standaard) is het lijsttarief. Regionale en multi-regionale endpoints op Amazon Bedrock en Google Cloud dragen dezelfde toeslag van 10%.
Fast mode. Snellere uitvoer op Opus 5 en Opus 4.8 kost $10 / $50, het dubbele van het normale Opus-tarief, alleen op de Claude API zelf en niet in combinatie met batch.
Facturatie loopt volledig in dollars, per creditcard of op factuur, en nieuwe accounts krijgen "a small amount of free credits" om te testen. Volumekortingen worden per geval onderhandeld.
Zo controleer je de rekening per functie
Elke response van de API draagt een usage-object met vier tellers: input_tokens, output_tokens, cache_creation_input_tokens en cache_read_input_tokens. Server-tools voegen daar een eigen teller aan toe, zoals web_search_requests.
Vermenigvuldig die vier met de kolommen uit de tokentabel en je hebt de prijs van precies dat ene verzoek. Log ze per functie (samenvatten, classificeren, chat) in plaats van per account, anders zie je pas aan het einde van de maand welke functie de rekening maakte.
In onze eigen projecten meten we modelkosten per functie, zodat een klant kan bijsturen of van model wisselen zonder herbouw. Het is ook de eerste controle die we doen als een factuur onverwacht hoog uitvalt: bijna altijd blijkt de cache-read-teller op nul te staan.
Wat het bouwen eromheen kost
De tokenrekening is bij vrijwel elk MKB-project de kleinste post. Daarom noemen we onze eigen prijsband erbij, zodat je de verhouding ziet.
Bij AI-software op maat start één ingebouwde AI-feature bij €8.500, RAG-zoeken op eigen data vanaf €12.500 en een volledig AI-platform loopt tot €75.000 of meer, tegen een vaste prijs na scoping. Onderhoud kost daarna vanaf €750 per maand, plus de modelkosten die met je gebruik meebewegen.
Draait je oplossing al en wil je alleen het beheer uitbesteden, dan zit Managed AI tussen €500 en €2.500 per maand. Daarin zit ook het bewaken van precies de posten hierboven: cache-hitrate, effort-instellingen en tokenverbruik per functie.
Zet die bedragen naast rekenvoorbeeld 1. Duizend documenten per maand op Sonnet 5 via batch kosten circa €12 aan tokens; de pipeline die ze correct verwerkt, kost het honderdvoudige om te bouwen.
Een indicatie voor jouw situatie haal je uit de prijsindicatie. Waar de totale kosten van AI in een bedrijf uit bestaan, van abonnementen tot beheer, staat in ons overzicht van AI-kosten voor bedrijven.
Wil je een berekening voor je eigen volume? Bel 085 016 0118 of laat je gegevens achter via contact; we rekenen het met je door op basis van jouw documenten en gesprekken.
Wanneer de API niet de goedkoopste route is
De API is bedoeld voor software die Claude aanroept. Voor mensen die zelf met Claude werken is een abonnement vrijwel altijd goedkoper: wat Claude Pro, Team en Enterprise per gebruiker kosten en waar de grens met de API ligt, staat op wat kost Claude, en de zakelijke keuze tussen Pro en Team, inclusief de verwerkersovereenkomst, op Claude zakelijk inzetten.
Wie de tarieven van OpenAI ernaast wil leggen, vindt de tegenhanger van deze tabel op OpenAI API-kosten; de prijsstructuur verschilt daar op precies de punten die deze pagina uitlicht, zoals lange context en cache reads.
Onze default is Claude-first: we bouwen op de Claude API tenzij een klantsituatie iets anders vraagt. Dat zeggen we erbij, zodat je deze tabel leest als wat hij is: de rekening van het model dat wij zelf het meest gebruiken.
De architectuurvragen die erbij horen, staan hier bewust niet. Hoe je de API koppelt aan je eigen software, welke limieten je dan raakt en hoe de EU-vraag ligt, lees je in Claude API koppelen aan je eigen software.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










