Kort antwoord
De OpenAI API kost in september 2026 $10 per miljoen inputtokens en $50 per miljoen outputtokens voor GPT-6 Astra (circa €8,71 en €43,55 exclusief btw). Daaronder staan GPT-5.6 Sol ($4/$20), Terra ($2/$12) en Luna ($0,20/$1,20); cached input kost een tiende van het inputtarief en de Batch API halveert alle prijzen. Een klantenservicegesprek van 3.100 tokens kost daarmee 2,5 dollarcent op Astra en 0,06 dollarcent op Luna.
Van lezen naar doen.
Tussen het inputtarief van GPT-5.6 Luna en het outputtarief van GPT-6 Astra zit een factor 250: $0,20 tegen $50 per miljoen tokens, en met het goedkoopste model op de lijst, GPT-5-nano op $0,05, wordt het een factor 1.000. Dat is de eerste les van elke OpenAI-factuur: niet het aantal gesprekken bepaalt het bedrag, maar welk model je kiest en hoeveel tekst het teruggeeft.
De tweede les is dat "$10 en $50" één cel is uit een tabel met twaalf. Elk model heeft vier tarieven (input, cached input, cache write, output), elk tarief bestaat in meerdere verwerkingssnelheden, en boven 272.000 inputtokens verandert het hele verzoek van prijs.
Hieronder staat de volledige prijslijst zoals OpenAI die op 18 september 2026 publiceert, omgerekend naar euro op de ECB-koers van de dag ervoor. Daarna drie rekenvoorbeelden: een klantgesprek, een contract van twintig pagina's en een kennisbank van tienduizend documenten.
Deze pagina gaat over de API, dus over software die jij bouwt of laat bouwen. Wat de ChatGPT-abonnementen kosten voor mensen die zelf typen, staat op de pagina over wat ChatGPT kost; de plaats van OpenAI naast Claude, Gemini en Mistral staat in ons overzicht van AI-modellen voor zakelijk gebruik.
De tarieftabel: alle actuele OpenAI-tekstmodellen per miljoen tokens
Alle bedragen in dollar per miljoen tokens, standaardverwerking, exclusief btw. Bron: OpenAI API pricing, peildatum 18 september 2026.
| Model | Input | Cached input | Output | Batch of Flex (input / output) | Boven 272K input (input / output) |
|---|---|---|---|---|---|
| GPT-6 Astra | $10,00 | $1,00 | $50,00 | $5,00 / $25,00 | $20,00 / $75,00 |
| GPT-5.6 Sol | $4,00 | $0,40 | $20,00 | $2,00 / $10,00 | $8,00 / $30,00 |
| GPT-5.6 Terra | $2,00 | $0,20 | $12,00 | $1,00 / $6,00 | $4,00 / $18,00 |
| GPT-5.6 Luna | $0,20 | $0,02 | $1,20 | $0,10 / $0,60 | $0,40 / $1,80 |
| GPT-5.5 | $5,00 | $0,50 | $30,00 | $2,50 / $15,00 | $10,00 / $45,00 |
| GPT-5.4 | $2,50 | $0,25 | $15,00 | $1,25 / $7,50 | $5,00 / $22,50 |
| GPT-5.4-mini | $0,75 | $0,075 | $4,50 | $0,375 / $2,25 | n.v.t. |
| GPT-5.4-nano | $0,20 | $0,02 | $1,25 | $0,10 / $0,625 | n.v.t. |
| GPT-5-mini | $0,25 | $0,025 | $2,00 | $0,125 / $1,00 | n.v.t. |
| GPT-5-nano | $0,05 | $0,005 | $0,40 | $0,025 / $0,20 | n.v.t. |
Drie dingen die de tabel niet zegt. Er bestaat op de prijslijst geen GPT-6 mini of GPT-6 nano naast het Astra-model dat OpenAI op 3 september 2026 aankondigde: de kleine varianten van OpenAI heten nu Luna, mini en nano in de 5.x-lijn, en wie "GPT-6 nano" zoekt komt bij GPT-5.6 Luna of GPT-5.4-nano uit.
Het tarief van GPT-5.6 Sol is een promotieprijs die OpenAI garandeert "at least through November 21, 2026". Een businesscase voor 2027 op $4/$20 rust dus op een aanname.
En GPT-6 Astra kent naast cached input ook een cache write van $12,50 per miljoen tokens, 1,25 keer het inputtarief (OpenAI-modelpagina GPT-6 Astra). Die regel staat hieronder apart uitgelegd, want hij maakt caching bij eenmalig gebruik duurder in plaats van goedkoper.
De prijslijst telt daarnaast nog ruim twintig oudere modellen, van GPT-4.1 tot GPT-3.5-turbo. Die laten we hier weg: voor nieuwe software kies je uit de tabel hierboven, en wat er breekt als je van Sol naar Astra gaat, staat op onze pagina over GPT-6 Astra.
Hoeveel tokens zitten er in een Nederlandse tekst?
Een token is een stuk tekst van gemiddeld een paar tekens: een kort woord, een deel van een lang woord, een leesteken. In onze projecten zien we dat Nederlandse samenstellingen vaker in stukken breken dan Engelse woorden, waardoor een Nederlandse tekst per woord wat meer tokens verbruikt.
Onze vuistregel voor offertes: circa 1,4 token per Nederlands woord en circa 600 tokens per volle A4. Dat is een werkaanname uit onze eigen projecten, geen leverancierscijfer; meet je eigen documenten na in de tokenizer op platform.openai.com voordat je een budget vastlegt.
Met die vuistregel wordt de tabel tastbaar. Een miljoen inputtokens op Astra ($10) is ruim 1.600 A4 aan tekst lezen; een miljoen outputtokens ($50) is ruim 1.600 A4 laten schrijven.
Vier prijzen per model: input, cached input, cache write en output
Input is alles wat je naar het model stuurt: systeemprompt, toolbeschrijvingen, gespreksgeschiedenis, het document, de vraag. Output is wat het model teruggeeft, inclusief de redeneertokens die het intern verbruikt voordat het antwoordt.
Output is bij elk OpenAI-model in de tabel vijf tot acht keer duurder dan input. Een taak die veel tekst teruggeeft (samenvatten, herschrijven, code genereren) kost dus structureel meer dan een taak die weinig teruggeeft (classificeren, extraheren, routeren), ook bij hetzelfde model.
Cached input is het tarief voor tokens die het model kort geleden al verwerkte, bijvoorbeeld een systeemprompt die in elk gesprek vooraan staat. Volgens de prompt-caching-documentatie staat caching standaard aan, geldt hij vanaf 1.024 tokens, kost een cache-hit een tiende van het inputtarief en blijft een cache bij GPT-5.6 en later minstens 30 minuten na het laatste gebruik in leven.
Cache write is de nieuwe regel sinds GPT-5.6: het wegschrijven van een cachebaar prefix kost 1,25 keer het inputtarief. Bij Astra is dat $12,50 per miljoen tokens in plaats van $10.
De rekensom die daaruit volgt: caching loont vanaf de tweede keer dat hetzelfde prefix binnen een half uur terugkomt. Eén keer schrijven ($12,50) plus één keer lezen ($1,00) is $13,50 tegen $20 zonder cache; een prefix dat maar één keer voorkomt, kost juist 25 procent extra.
Praktisch betekent dit dat de volgorde van je prompt geld waard is. Zet het vaste deel (instructies, toolbeschrijvingen, kennisbankfragmenten die niet wisselen) vooraan en het wisselende deel (de vraag van de klant) achteraan, anders is er geen gedeeld prefix om te cachen.
Batch, Flex en fast mode: dezelfde tokens, drie prijzen
OpenAI verkoopt de meeste modellen in meer dan één verwerkingssnelheid. Het tarief in de tabel hierboven is "standaard"; de andere vermenigvuldigen dat tarief, en bij fast mode verschilt de factor per model.
| Verwerking | Prijs | Levertijd | Wanneer |
|---|---|---|---|
| Standaard | 1x | Direct | Chat, agents, alles waar iemand op wacht |
| Batch API | 0,5x | Binnen 24 uur, vaak sneller | Nachtelijke documentverwerking, classificatie van een backlog, rapportages |
| Flex | 0,5x | Tragere respons; bij drukte een 429-weigering, die je niets kost | Achtergrondtaken die een antwoord in dezelfde sessie willen, maar geen garantie nodig hebben |
| Fast mode | 2x bij GPT-6 Astra en de GPT-5.6-lijn, 2,5x bij GPT-5.5, 1,8x bij GPT-5-mini; geen fast mode voor de nano-modellen | Sneller dan standaard | Interactief werk waar seconden tellen; niet beschikbaar met EU-dataresidentie bij Astra |
Bron: OpenAI API pricing, de Batch API-documentatie en de Flex-documentatie, 18 september 2026.
De Batch API heeft twee voorwaarden die je in een ontwerp moet meenemen. Eén batch bevat maximaal 50.000 verzoeken en een invoerbestand maximaal 200 MB, en tokens van verzoeken die wél afgerond zijn worden ook in rekening gebracht als de batch als geheel verloopt.
Fast mode is de dure kant van dezelfde knop. Bij Astra en de 5.6-lijn twee keer het standaardtarief op input én output, dus $20/$100 voor Astra, en bij GPT-5.5 zelfs tweeënhalf keer ($12,50/$75); wie dat "voor de zekerheid" aanzet, verdubbelt zijn factuur zonder dat de kwaliteit verandert.
De 272K-drempel: één tarief over het hele verzoek
Boven 272.000 inputtokens in één verzoek rekent OpenAI het long-contexttarief: het dubbele voor input en cache, anderhalf keer voor output, over het complete verzoek en niet alleen over het deel boven de drempel (OpenAI-modelpagina).
Dat maakt opknippen goedkoper dan bundelen. Eén verzoek van 300.000 inputtokens op Astra kost $6,00 aan input; drie verzoeken van 100.000 tokens kosten samen $3,00 voor exact dezelfde tekst.
Voor het MKB is dit vooral een ontwerpregel voor documentverwerking: houd één verzoek onder de drempel, ook al past er technisch 1.050.000 tokens in het venster van Astra. Op de pagina over GPT-6 Astra staat wat de drempel doet met een agent die zijn gespreksgeschiedenis laat groeien.
Omgerekend naar euro, met en zonder btw
OpenAI factureert in dollar. De eurobedragen hieronder zijn circa-bedragen op de ECB-referentiekoers van 17 september 2026: 1 euro = 1,1481 dollar.
| Model | Input ex btw | Output ex btw | Input incl. 21% btw | Output incl. 21% btw |
|---|---|---|---|---|
| GPT-6 Astra | circa €8,71 | circa €43,55 | circa €10,54 | circa €52,70 |
| GPT-5.6 Sol | circa €3,48 | circa €17,42 | circa €4,21 | circa €21,08 |
| GPT-5.6 Terra | circa €1,74 | circa €10,45 | circa €2,11 | circa €12,64 |
| GPT-5.6 Luna | circa €0,17 | circa €1,05 | circa €0,21 | circa €1,27 |
Alle bedragen per miljoen tokens. Voor een btw-plichtig bedrijf is de btw doorgaans aftrekbaar, dus de kolom "ex btw" is de werkelijke kostprijs; de kolom "incl." is voor wie de btw niet kan terugvragen.
Reken in een businesscase met een koersmarge. Tien procent koersbeweging in een jaar is niets bijzonders, en die tien procent komt bovenop alles wat hieronder staat.
Rekenvoorbeeld 1: een klantenservicegesprek
Dit is een rekenvoorbeeld op de bronprijzen hierboven, geen meting. Stel een gesprek met een systeemprompt van 2.000 tokens (na de eerste beurt uit de cache), 800 tokens verse input (geschiedenis plus vraag) en een antwoord van 300 tokens.
| Model | Cached (2.000) | Input (800) | Output (300) | Per gesprek | Per 10.000 gesprekken |
|---|---|---|---|---|---|
| GPT-6 Astra | $0,0020 | $0,0080 | $0,0150 | $0,0250 | $250 (circa €218) |
| GPT-5.6 Sol | $0,0008 | $0,0032 | $0,0060 | $0,0100 | $100 (circa €87) |
| GPT-5.6 Terra | $0,0004 | $0,0016 | $0,0036 | $0,0056 | $56 (circa €49) |
| GPT-5.6 Luna | $0,00004 | $0,00016 | $0,00036 | $0,00056 | $5,60 (circa €4,88) |
Zonder caching zou hetzelfde gesprek op Astra $0,043 kosten, $430 per 10.000 gesprekken. De cache is in dit voorbeeld dus $180 per maand waard, alleen door de systeemprompt vooraan te zetten.
Het grotere verschil zit in de modelkeuze: een factor 45 tussen Astra en Luna voor exact hetzelfde gesprek. Voor een AI-chatbot die veelgestelde vragen afhandelt is Luna of Terra de logische keuze, en pas als het gesprek een echte beslissing vraagt, schakel je op naar Sol of Astra.
Wat hier ontbreekt is de outputkant van redeneren. Bij een hoge reasoning-effort verbruikt Astra intern extra outputtokens voordat het antwoordt, en die tellen tegen $50; in een klantgesprek zet je die instelling dus laag.
Rekenvoorbeeld 2: een contract van twintig pagina's samenvatten
Stel een contract van twintig A4, met onze vuistregel circa 12.000 tokens, plus 500 tokens instructie en een samenvatting van 800 tokens. Eén document, geen cache, want elk contract is anders.
| Model | Input (12.500) | Output (800) | Per document | Per 1.000 documenten | Idem via Batch API |
|---|---|---|---|---|---|
| GPT-6 Astra | $0,125 | $0,040 | $0,165 | $165 (circa €144) | $82,50 (circa €72) |
| GPT-5.6 Sol | $0,050 | $0,016 | $0,066 | $66 (circa €57) | $33 (circa €29) |
| GPT-5.6 Terra | $0,025 | $0,0096 | $0,0346 | $34,60 (circa €30) | $17,30 (circa €15) |
| GPT-5.6 Luna | $0,0025 | $0,00096 | $0,00346 | $3,46 (circa €3) | $1,73 (circa €1,50) |
Documentwerk is inputzwaar, en input is het goedkope tarief. Daarom kost duizend contracten op Astra minder dan de meeste MKB-bedrijven verwachten, en daarom is de Batch API hier de grootste hefboom: wie de samenvattingen niet binnen een minuut nodig heeft, betaalt de helft.
De vraag die telt is niet "wat kost een document" maar "welk model haalt de fout eruit". Bij een contract waar één gemiste clausule geld kost, is $0,165 op Astra goedkoop; bij een inkomende factuur die alleen een kenmerk en een bedrag hoeft af te geven, is Luna ruim voldoende en 48 keer goedkoper.
Rekenvoorbeeld 3: embeddings voor een eigen kennisbank
Wie een assistent op eigen documenten bouwt (RAG), zet die documenten eerst om in vectoren met een embeddingmodel. Dat is een aparte, eenmalige post op de factuur, en hij is klein.
| Embeddingmodel | Prijs per miljoen tokens | 10.000 documenten van 5.000 tokens (50 miljoen tokens) |
|---|---|---|
| text-embedding-3-small | $0,02 | $1,00 |
| text-embedding-3-large | $0,13 | $6,50 |
| text-embedding-ada-002 | $0,10 | $5,00 |
Bron: OpenAI API pricing, 18 september 2026. Een zoekvraag van vijftig tokens embedden kost daarna een duizendste cent.
De kosten van een kennisbank zitten dus niet in de embeddings maar in het generatiemodel dat de gevonden fragmenten leest, en in de bouw. Onze AI-software op maat met RAG op eigen data start bij €12.500 tegen een vaste prijs, en we meten de modelkosten per functie, zodat je een duur model kunt vervangen zonder de rest te herbouwen.
Eén waarschuwing bij embeddings: vectoren van model A zijn onbruikbaar naast vectoren van model B. Stap je later over op een nieuwer embeddingmodel, dan embed je de hele kennisbank opnieuw; bij $1 tot $6,50 per tienduizend documenten is dat gelukkig geen reden om de keuze uit te stellen.
Tools en audio: wat er naast tokens op de factuur staat
De Responses API kan zelf zoeken, in bestanden lezen en code draaien. Die ingebouwde tools hebben een eigen prijs, bovenop de tokens die het zoekresultaat als input oplevert (OpenAI API pricing).
| Tool | Prijs |
|---|---|
| Web search | $10 per 1.000 aanroepen, plus de zoekinhoud als inputtokens tegen modeltarief |
| File search | $2,50 per 1.000 aanroepen, plus opslag $0,10 per GB per dag (eerste GB gratis) |
| Code interpreter (hosted shell, 1 GB) | $0,03 per sessie van 20 minuten |
Een agent die per klantvraag twee keer het web raadpleegt, voegt daarmee $0,02 per gesprek toe, bijna evenveel als het hele Astra-gesprek uit rekenvoorbeeld 1. Tel tools dus mee als eigen regel in je begroting.
Spraak rekent OpenAI af per audiotoken, en die zijn fors duurder dan tekst: gpt-realtime-2.1 kost $32 per miljoen audio-inputtokens en $64 per miljoen audio-outputtokens, de mini-variant $10 en $20. Transcriptie achteraf is goedkoper en gaat per minuut: gpt-transcribe $0,0045, whisper $0,006.
Voor een voice agent die de telefoon opneemt is dat het verschil tussen een gesprek van enkele centen (transcriberen en met tekst antwoorden) en enkele dubbeltjes (volledig realtime). Welke van de twee past hangt af van hoe natuurlijk het gesprek moet klinken, niet van het budget alleen.
De EU-route: dataresidentie kost 10 procent extra
De OpenAI API verwerkt standaard in de Verenigde Staten. Wie Europese verwerking wil, zet per project een regio aan; Europa (EER plus Zwitserland) is een van de regio's met volledige verwerking, niet alleen opslag (OpenAI, data residency).
Dat kost geld: "Data residency endpoints are charged a 10% uplift for models released on or after March 5, 2026." GPT-6 Astra en de GPT-5.6-lijn (uitgebracht op 9 juli 2026) vallen daaronder, dus in een EU-project kost Astra $11/$55 en Sol $4,40/$22 per miljoen tokens.
Twee beperkingen horen erbij. Fast mode is bij Astra niet beschikbaar met EU-dataresidentie, en ook met residentie bewaart OpenAI logs voor misbruikmonitoring tot 30 dagen, tenzij je Zero Data Retention aanvraagt voor de endpoints die dat toestaan.
De tweede EU-route loopt via Microsoft. In Microsoft Foundry kost GPT-6 Astra bij Global-verwerking exact hetzelfde als bij OpenAI ($10/$1/$12,50/$50), en de US Data Zone rekent tien procent meer; een EU Data Zone voor Astra noemt Microsoft in de aankondiging van 3 september 2026 niet.
Wanneer Azure OpenAI duurder of goedkoper uitpakt dan de OpenAI API, inclusief de vaste capaciteit via Provisioned Throughput, krijgt een eigen pagina in deze kennisbank. Als Microsoft-reseller via Pax8 kunnen we die route ook leveren, wat niet wegneemt dat Claude onze standaardkeuze is; de OpenAI API zetten we in waar hij aantoonbaar beter of goedkoper is voor de taak.
Wat de API kost naast de tokens: bouwen en beheren
De tokens zijn zelden de grootste post. Rekenvoorbeeld 2 laat duizend contracten per maand voor $66 op Sol verwerken; de software die de contracten ophaalt, het model aanstuurt, de uitkomst controleert en in je systeem wegschrijft, kost een veelvoud daarvan.
Onze eigen prijsband als ijkpunt: één ingebouwde AI-feature start bij €8.500, RAG op eigen data bij €12.500, tegen een vaste prijs na scoping, met onderhoud vanaf €750 per maand plus modelkosten. Een AI-agent die één proces afhandelt, bijvoorbeeld orders of facturen, kost €2.500 setup en €350 per maand.
Zet die bedragen naast de tokens en de verhouding is duidelijk. Bij 10.000 gesprekken per maand op Sol ($100) is de modelfactuur in jaar één minder dan een tiende van de bouw- en beheerkosten; pas rond de 150.000 gesprekken per maand keert dat om.
De kostenposten van AI in bredere zin, van abonnement tot maatwerk, staan op onze pagina wat AI kost voor bedrijven. Wil je één bedrag voor jouw proces, dan is de prijsindicatie de snelste weg, of bel 085 016 0118 via onze contactpagina voor een inschatting van het tokenverbruik van jouw documenten.
Wanneer de OpenAI API niet de goedkoopste keuze is
De tarieftabel geeft OpenAI niet automatisch gelijk. Drie situaties waarin je beter elders kijkt, of anders kijkt.
Zwaar hergebruik van dezelfde context. Een agent die vijftig beurten lang dezelfde toolbeschrijvingen meesleept, betaalt vooral cache-reads; bij Astra $1,00 per miljoen, bij Claude Fable 5.1 $0,25. Hoe die verhouding uitpakt staat op de pagina over de kosten van de Claude API, met de tokentabel van Anthropic ernaast.
Weinig volume, veel mensen. Als tien medewerkers zelf vragen typen en niemand software bouwt, is een abonnement per stoel goedkoper en eenvoudiger dan een API-integratie; de pagina over ChatGPT zakelijk inzetten zet die plannen naast elkaar.
Het duurste model uit gewoonte. Astra is het beste model van OpenAI op agentisch werk, en tegelijk 45 keer duurder dan Luna voor een gesprek dat geen redeneervermogen vraagt. De goedkoopste OpenAI-factuur ontstaat door per taak te kiezen, en dat is precies wat een modelrouter in je eigen software doet.
Ons eigen standpunt daarin is niet neutraal en dat zeggen we liever hardop: Claude is bij CleverTech AI de standaardkeuze, en de pagina over Claude Fable 5.1 laat zien dat ook die factuur twee kanten heeft. Voor veel MKB-werk wint uiteindelijk het model dat de taak in één keer goed doet, ongeacht het logo.
Zo houd je de OpenAI-factuur onder controle
- Kies het model per taak, niet per project: Luna of nano voor volume, Sol of Astra voor beslissingen.
- Zet het vaste deel van de prompt vooraan, zodat caching vanaf de tweede aanroep werkt.
- Gebruik de Batch API voor alles wat een nacht kan wachten; dat halveert het tarief.
- Houd één verzoek onder 272.000 inputtokens, ook als het contextvenster meer toelaat.
- Beperk de outputlengte en de reasoning-effort per taak; output is het dure tarief.
- Tel tools (web search, file search) en audio als aparte regels in je begroting.
- Reken een koersmarge van tien procent in elke businesscase in euro.
Wie een bestaande implementatie draait en wil weten welk model waar echt nodig is, laat het meten in plaats van schatten. Bij AI-software op maat meten we de modelkosten per functie; onder Managed AI hoort een maandrapportage over wat het systeem heeft afgehandeld, welke aanpassingen zijn gedaan en wat er is blijven liggen.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










