Ga naar hoofdinhoud
Terug naar AI Modellen Vergelijken
13 min lezen19 september 2026Gecontroleerd op 19 september 2026

Wat kost de OpenAI API (GPT-6 Astra) per miljoen tokens in 2026?

De OpenAI API rekent per miljoen tokens: van $0,20 voor Luna-input tot $50 voor Astra-output. Alle prijzen van september 2026 in euro, met rekenvoorbeelden.

Bram DokmanOprichter & AI-specialist

Oprichter van CleverTech AI, met 12+ jaar ervaring in software development, online marketing en cloud-infrastructuur. BSc Science & Innovation Management (Universiteit Utrecht).

Deze pagina is gecontroleerd op

Een ontwikkelaar bekijkt een verbruiksgrafiek met tokenkosten op een laptop, naast een uitgeprinte prijslijst met potloodaantekeningen
AI Modellen Vergelijken

Kort antwoord

De OpenAI API kost in september 2026 $10 per miljoen inputtokens en $50 per miljoen outputtokens voor GPT-6 Astra (circa €8,71 en €43,55 exclusief btw). Daaronder staan GPT-5.6 Sol ($4/$20), Terra ($2/$12) en Luna ($0,20/$1,20); cached input kost een tiende van het inputtarief en de Batch API halveert alle prijzen. Een klantenservicegesprek van 3.100 tokens kost daarmee 2,5 dollarcent op Astra en 0,06 dollarcent op Luna.

Tussen het inputtarief van GPT-5.6 Luna en het outputtarief van GPT-6 Astra zit een factor 250: $0,20 tegen $50 per miljoen tokens, en met het goedkoopste model op de lijst, GPT-5-nano op $0,05, wordt het een factor 1.000. Dat is de eerste les van elke OpenAI-factuur: niet het aantal gesprekken bepaalt het bedrag, maar welk model je kiest en hoeveel tekst het teruggeeft.

De tweede les is dat "$10 en $50" één cel is uit een tabel met twaalf. Elk model heeft vier tarieven (input, cached input, cache write, output), elk tarief bestaat in meerdere verwerkingssnelheden, en boven 272.000 inputtokens verandert het hele verzoek van prijs.

Hieronder staat de volledige prijslijst zoals OpenAI die op 18 september 2026 publiceert, omgerekend naar euro op de ECB-koers van de dag ervoor. Daarna drie rekenvoorbeelden: een klantgesprek, een contract van twintig pagina's en een kennisbank van tienduizend documenten.

Deze pagina gaat over de API, dus over software die jij bouwt of laat bouwen. Wat de ChatGPT-abonnementen kosten voor mensen die zelf typen, staat op de pagina over wat ChatGPT kost; de plaats van OpenAI naast Claude, Gemini en Mistral staat in ons overzicht van AI-modellen voor zakelijk gebruik.

De tarieftabel: alle actuele OpenAI-tekstmodellen per miljoen tokens

Alle bedragen in dollar per miljoen tokens, standaardverwerking, exclusief btw. Bron: OpenAI API pricing, peildatum 18 september 2026.

Model Input Cached input Output Batch of Flex (input / output) Boven 272K input (input / output)
GPT-6 Astra $10,00 $1,00 $50,00 $5,00 / $25,00 $20,00 / $75,00
GPT-5.6 Sol $4,00 $0,40 $20,00 $2,00 / $10,00 $8,00 / $30,00
GPT-5.6 Terra $2,00 $0,20 $12,00 $1,00 / $6,00 $4,00 / $18,00
GPT-5.6 Luna $0,20 $0,02 $1,20 $0,10 / $0,60 $0,40 / $1,80
GPT-5.5 $5,00 $0,50 $30,00 $2,50 / $15,00 $10,00 / $45,00
GPT-5.4 $2,50 $0,25 $15,00 $1,25 / $7,50 $5,00 / $22,50
GPT-5.4-mini $0,75 $0,075 $4,50 $0,375 / $2,25 n.v.t.
GPT-5.4-nano $0,20 $0,02 $1,25 $0,10 / $0,625 n.v.t.
GPT-5-mini $0,25 $0,025 $2,00 $0,125 / $1,00 n.v.t.
GPT-5-nano $0,05 $0,005 $0,40 $0,025 / $0,20 n.v.t.

Drie dingen die de tabel niet zegt. Er bestaat op de prijslijst geen GPT-6 mini of GPT-6 nano naast het Astra-model dat OpenAI op 3 september 2026 aankondigde: de kleine varianten van OpenAI heten nu Luna, mini en nano in de 5.x-lijn, en wie "GPT-6 nano" zoekt komt bij GPT-5.6 Luna of GPT-5.4-nano uit.

Het tarief van GPT-5.6 Sol is een promotieprijs die OpenAI garandeert "at least through November 21, 2026". Een businesscase voor 2027 op $4/$20 rust dus op een aanname.

En GPT-6 Astra kent naast cached input ook een cache write van $12,50 per miljoen tokens, 1,25 keer het inputtarief (OpenAI-modelpagina GPT-6 Astra). Die regel staat hieronder apart uitgelegd, want hij maakt caching bij eenmalig gebruik duurder in plaats van goedkoper.

De prijslijst telt daarnaast nog ruim twintig oudere modellen, van GPT-4.1 tot GPT-3.5-turbo. Die laten we hier weg: voor nieuwe software kies je uit de tabel hierboven, en wat er breekt als je van Sol naar Astra gaat, staat op onze pagina over GPT-6 Astra.

Hoeveel tokens zitten er in een Nederlandse tekst?

Een token is een stuk tekst van gemiddeld een paar tekens: een kort woord, een deel van een lang woord, een leesteken. In onze projecten zien we dat Nederlandse samenstellingen vaker in stukken breken dan Engelse woorden, waardoor een Nederlandse tekst per woord wat meer tokens verbruikt.

Onze vuistregel voor offertes: circa 1,4 token per Nederlands woord en circa 600 tokens per volle A4. Dat is een werkaanname uit onze eigen projecten, geen leverancierscijfer; meet je eigen documenten na in de tokenizer op platform.openai.com voordat je een budget vastlegt.

Met die vuistregel wordt de tabel tastbaar. Een miljoen inputtokens op Astra ($10) is ruim 1.600 A4 aan tekst lezen; een miljoen outputtokens ($50) is ruim 1.600 A4 laten schrijven.

Vier prijzen per model: input, cached input, cache write en output

Input is alles wat je naar het model stuurt: systeemprompt, toolbeschrijvingen, gespreksgeschiedenis, het document, de vraag. Output is wat het model teruggeeft, inclusief de redeneertokens die het intern verbruikt voordat het antwoordt.

Output is bij elk OpenAI-model in de tabel vijf tot acht keer duurder dan input. Een taak die veel tekst teruggeeft (samenvatten, herschrijven, code genereren) kost dus structureel meer dan een taak die weinig teruggeeft (classificeren, extraheren, routeren), ook bij hetzelfde model.

Cached input is het tarief voor tokens die het model kort geleden al verwerkte, bijvoorbeeld een systeemprompt die in elk gesprek vooraan staat. Volgens de prompt-caching-documentatie staat caching standaard aan, geldt hij vanaf 1.024 tokens, kost een cache-hit een tiende van het inputtarief en blijft een cache bij GPT-5.6 en later minstens 30 minuten na het laatste gebruik in leven.

Cache write is de nieuwe regel sinds GPT-5.6: het wegschrijven van een cachebaar prefix kost 1,25 keer het inputtarief. Bij Astra is dat $12,50 per miljoen tokens in plaats van $10.

De rekensom die daaruit volgt: caching loont vanaf de tweede keer dat hetzelfde prefix binnen een half uur terugkomt. Eén keer schrijven ($12,50) plus één keer lezen ($1,00) is $13,50 tegen $20 zonder cache; een prefix dat maar één keer voorkomt, kost juist 25 procent extra.

Praktisch betekent dit dat de volgorde van je prompt geld waard is. Zet het vaste deel (instructies, toolbeschrijvingen, kennisbankfragmenten die niet wisselen) vooraan en het wisselende deel (de vraag van de klant) achteraan, anders is er geen gedeeld prefix om te cachen.

Batch, Flex en fast mode: dezelfde tokens, drie prijzen

OpenAI verkoopt de meeste modellen in meer dan één verwerkingssnelheid. Het tarief in de tabel hierboven is "standaard"; de andere vermenigvuldigen dat tarief, en bij fast mode verschilt de factor per model.

Verwerking Prijs Levertijd Wanneer
Standaard 1x Direct Chat, agents, alles waar iemand op wacht
Batch API 0,5x Binnen 24 uur, vaak sneller Nachtelijke documentverwerking, classificatie van een backlog, rapportages
Flex 0,5x Tragere respons; bij drukte een 429-weigering, die je niets kost Achtergrondtaken die een antwoord in dezelfde sessie willen, maar geen garantie nodig hebben
Fast mode 2x bij GPT-6 Astra en de GPT-5.6-lijn, 2,5x bij GPT-5.5, 1,8x bij GPT-5-mini; geen fast mode voor de nano-modellen Sneller dan standaard Interactief werk waar seconden tellen; niet beschikbaar met EU-dataresidentie bij Astra

Bron: OpenAI API pricing, de Batch API-documentatie en de Flex-documentatie, 18 september 2026.

De Batch API heeft twee voorwaarden die je in een ontwerp moet meenemen. Eén batch bevat maximaal 50.000 verzoeken en een invoerbestand maximaal 200 MB, en tokens van verzoeken die wél afgerond zijn worden ook in rekening gebracht als de batch als geheel verloopt.

Fast mode is de dure kant van dezelfde knop. Bij Astra en de 5.6-lijn twee keer het standaardtarief op input én output, dus $20/$100 voor Astra, en bij GPT-5.5 zelfs tweeënhalf keer ($12,50/$75); wie dat "voor de zekerheid" aanzet, verdubbelt zijn factuur zonder dat de kwaliteit verandert.

De 272K-drempel: één tarief over het hele verzoek

Boven 272.000 inputtokens in één verzoek rekent OpenAI het long-contexttarief: het dubbele voor input en cache, anderhalf keer voor output, over het complete verzoek en niet alleen over het deel boven de drempel (OpenAI-modelpagina).

Dat maakt opknippen goedkoper dan bundelen. Eén verzoek van 300.000 inputtokens op Astra kost $6,00 aan input; drie verzoeken van 100.000 tokens kosten samen $3,00 voor exact dezelfde tekst.

Voor het MKB is dit vooral een ontwerpregel voor documentverwerking: houd één verzoek onder de drempel, ook al past er technisch 1.050.000 tokens in het venster van Astra. Op de pagina over GPT-6 Astra staat wat de drempel doet met een agent die zijn gespreksgeschiedenis laat groeien.

Omgerekend naar euro, met en zonder btw

OpenAI factureert in dollar. De eurobedragen hieronder zijn circa-bedragen op de ECB-referentiekoers van 17 september 2026: 1 euro = 1,1481 dollar.

Model Input ex btw Output ex btw Input incl. 21% btw Output incl. 21% btw
GPT-6 Astra circa €8,71 circa €43,55 circa €10,54 circa €52,70
GPT-5.6 Sol circa €3,48 circa €17,42 circa €4,21 circa €21,08
GPT-5.6 Terra circa €1,74 circa €10,45 circa €2,11 circa €12,64
GPT-5.6 Luna circa €0,17 circa €1,05 circa €0,21 circa €1,27

Alle bedragen per miljoen tokens. Voor een btw-plichtig bedrijf is de btw doorgaans aftrekbaar, dus de kolom "ex btw" is de werkelijke kostprijs; de kolom "incl." is voor wie de btw niet kan terugvragen.

Reken in een businesscase met een koersmarge. Tien procent koersbeweging in een jaar is niets bijzonders, en die tien procent komt bovenop alles wat hieronder staat.

Rekenvoorbeeld 1: een klantenservicegesprek

Dit is een rekenvoorbeeld op de bronprijzen hierboven, geen meting. Stel een gesprek met een systeemprompt van 2.000 tokens (na de eerste beurt uit de cache), 800 tokens verse input (geschiedenis plus vraag) en een antwoord van 300 tokens.

Model Cached (2.000) Input (800) Output (300) Per gesprek Per 10.000 gesprekken
GPT-6 Astra $0,0020 $0,0080 $0,0150 $0,0250 $250 (circa €218)
GPT-5.6 Sol $0,0008 $0,0032 $0,0060 $0,0100 $100 (circa €87)
GPT-5.6 Terra $0,0004 $0,0016 $0,0036 $0,0056 $56 (circa €49)
GPT-5.6 Luna $0,00004 $0,00016 $0,00036 $0,00056 $5,60 (circa €4,88)

Zonder caching zou hetzelfde gesprek op Astra $0,043 kosten, $430 per 10.000 gesprekken. De cache is in dit voorbeeld dus $180 per maand waard, alleen door de systeemprompt vooraan te zetten.

Het grotere verschil zit in de modelkeuze: een factor 45 tussen Astra en Luna voor exact hetzelfde gesprek. Voor een AI-chatbot die veelgestelde vragen afhandelt is Luna of Terra de logische keuze, en pas als het gesprek een echte beslissing vraagt, schakel je op naar Sol of Astra.

Wat hier ontbreekt is de outputkant van redeneren. Bij een hoge reasoning-effort verbruikt Astra intern extra outputtokens voordat het antwoordt, en die tellen tegen $50; in een klantgesprek zet je die instelling dus laag.

Rekenvoorbeeld 2: een contract van twintig pagina's samenvatten

Stel een contract van twintig A4, met onze vuistregel circa 12.000 tokens, plus 500 tokens instructie en een samenvatting van 800 tokens. Eén document, geen cache, want elk contract is anders.

Model Input (12.500) Output (800) Per document Per 1.000 documenten Idem via Batch API
GPT-6 Astra $0,125 $0,040 $0,165 $165 (circa €144) $82,50 (circa €72)
GPT-5.6 Sol $0,050 $0,016 $0,066 $66 (circa €57) $33 (circa €29)
GPT-5.6 Terra $0,025 $0,0096 $0,0346 $34,60 (circa €30) $17,30 (circa €15)
GPT-5.6 Luna $0,0025 $0,00096 $0,00346 $3,46 (circa €3) $1,73 (circa €1,50)

Documentwerk is inputzwaar, en input is het goedkope tarief. Daarom kost duizend contracten op Astra minder dan de meeste MKB-bedrijven verwachten, en daarom is de Batch API hier de grootste hefboom: wie de samenvattingen niet binnen een minuut nodig heeft, betaalt de helft.

De vraag die telt is niet "wat kost een document" maar "welk model haalt de fout eruit". Bij een contract waar één gemiste clausule geld kost, is $0,165 op Astra goedkoop; bij een inkomende factuur die alleen een kenmerk en een bedrag hoeft af te geven, is Luna ruim voldoende en 48 keer goedkoper.

Rekenvoorbeeld 3: embeddings voor een eigen kennisbank

Wie een assistent op eigen documenten bouwt (RAG), zet die documenten eerst om in vectoren met een embeddingmodel. Dat is een aparte, eenmalige post op de factuur, en hij is klein.

Embeddingmodel Prijs per miljoen tokens 10.000 documenten van 5.000 tokens (50 miljoen tokens)
text-embedding-3-small $0,02 $1,00
text-embedding-3-large $0,13 $6,50
text-embedding-ada-002 $0,10 $5,00

Bron: OpenAI API pricing, 18 september 2026. Een zoekvraag van vijftig tokens embedden kost daarna een duizendste cent.

De kosten van een kennisbank zitten dus niet in de embeddings maar in het generatiemodel dat de gevonden fragmenten leest, en in de bouw. Onze AI-software op maat met RAG op eigen data start bij €12.500 tegen een vaste prijs, en we meten de modelkosten per functie, zodat je een duur model kunt vervangen zonder de rest te herbouwen.

Eén waarschuwing bij embeddings: vectoren van model A zijn onbruikbaar naast vectoren van model B. Stap je later over op een nieuwer embeddingmodel, dan embed je de hele kennisbank opnieuw; bij $1 tot $6,50 per tienduizend documenten is dat gelukkig geen reden om de keuze uit te stellen.

Tools en audio: wat er naast tokens op de factuur staat

De Responses API kan zelf zoeken, in bestanden lezen en code draaien. Die ingebouwde tools hebben een eigen prijs, bovenop de tokens die het zoekresultaat als input oplevert (OpenAI API pricing).

Tool Prijs
Web search $10 per 1.000 aanroepen, plus de zoekinhoud als inputtokens tegen modeltarief
File search $2,50 per 1.000 aanroepen, plus opslag $0,10 per GB per dag (eerste GB gratis)
Code interpreter (hosted shell, 1 GB) $0,03 per sessie van 20 minuten

Een agent die per klantvraag twee keer het web raadpleegt, voegt daarmee $0,02 per gesprek toe, bijna evenveel als het hele Astra-gesprek uit rekenvoorbeeld 1. Tel tools dus mee als eigen regel in je begroting.

Spraak rekent OpenAI af per audiotoken, en die zijn fors duurder dan tekst: gpt-realtime-2.1 kost $32 per miljoen audio-inputtokens en $64 per miljoen audio-outputtokens, de mini-variant $10 en $20. Transcriptie achteraf is goedkoper en gaat per minuut: gpt-transcribe $0,0045, whisper $0,006.

Voor een voice agent die de telefoon opneemt is dat het verschil tussen een gesprek van enkele centen (transcriberen en met tekst antwoorden) en enkele dubbeltjes (volledig realtime). Welke van de twee past hangt af van hoe natuurlijk het gesprek moet klinken, niet van het budget alleen.

De EU-route: dataresidentie kost 10 procent extra

De OpenAI API verwerkt standaard in de Verenigde Staten. Wie Europese verwerking wil, zet per project een regio aan; Europa (EER plus Zwitserland) is een van de regio's met volledige verwerking, niet alleen opslag (OpenAI, data residency).

Dat kost geld: "Data residency endpoints are charged a 10% uplift for models released on or after March 5, 2026." GPT-6 Astra en de GPT-5.6-lijn (uitgebracht op 9 juli 2026) vallen daaronder, dus in een EU-project kost Astra $11/$55 en Sol $4,40/$22 per miljoen tokens.

Twee beperkingen horen erbij. Fast mode is bij Astra niet beschikbaar met EU-dataresidentie, en ook met residentie bewaart OpenAI logs voor misbruikmonitoring tot 30 dagen, tenzij je Zero Data Retention aanvraagt voor de endpoints die dat toestaan.

De tweede EU-route loopt via Microsoft. In Microsoft Foundry kost GPT-6 Astra bij Global-verwerking exact hetzelfde als bij OpenAI ($10/$1/$12,50/$50), en de US Data Zone rekent tien procent meer; een EU Data Zone voor Astra noemt Microsoft in de aankondiging van 3 september 2026 niet.

Wanneer Azure OpenAI duurder of goedkoper uitpakt dan de OpenAI API, inclusief de vaste capaciteit via Provisioned Throughput, krijgt een eigen pagina in deze kennisbank. Als Microsoft-reseller via Pax8 kunnen we die route ook leveren, wat niet wegneemt dat Claude onze standaardkeuze is; de OpenAI API zetten we in waar hij aantoonbaar beter of goedkoper is voor de taak.

Wat de API kost naast de tokens: bouwen en beheren

De tokens zijn zelden de grootste post. Rekenvoorbeeld 2 laat duizend contracten per maand voor $66 op Sol verwerken; de software die de contracten ophaalt, het model aanstuurt, de uitkomst controleert en in je systeem wegschrijft, kost een veelvoud daarvan.

Onze eigen prijsband als ijkpunt: één ingebouwde AI-feature start bij €8.500, RAG op eigen data bij €12.500, tegen een vaste prijs na scoping, met onderhoud vanaf €750 per maand plus modelkosten. Een AI-agent die één proces afhandelt, bijvoorbeeld orders of facturen, kost €2.500 setup en €350 per maand.

Zet die bedragen naast de tokens en de verhouding is duidelijk. Bij 10.000 gesprekken per maand op Sol ($100) is de modelfactuur in jaar één minder dan een tiende van de bouw- en beheerkosten; pas rond de 150.000 gesprekken per maand keert dat om.

De kostenposten van AI in bredere zin, van abonnement tot maatwerk, staan op onze pagina wat AI kost voor bedrijven. Wil je één bedrag voor jouw proces, dan is de prijsindicatie de snelste weg, of bel 085 016 0118 via onze contactpagina voor een inschatting van het tokenverbruik van jouw documenten.

Wanneer de OpenAI API niet de goedkoopste keuze is

De tarieftabel geeft OpenAI niet automatisch gelijk. Drie situaties waarin je beter elders kijkt, of anders kijkt.

Zwaar hergebruik van dezelfde context. Een agent die vijftig beurten lang dezelfde toolbeschrijvingen meesleept, betaalt vooral cache-reads; bij Astra $1,00 per miljoen, bij Claude Fable 5.1 $0,25. Hoe die verhouding uitpakt staat op de pagina over de kosten van de Claude API, met de tokentabel van Anthropic ernaast.

Weinig volume, veel mensen. Als tien medewerkers zelf vragen typen en niemand software bouwt, is een abonnement per stoel goedkoper en eenvoudiger dan een API-integratie; de pagina over ChatGPT zakelijk inzetten zet die plannen naast elkaar.

Het duurste model uit gewoonte. Astra is het beste model van OpenAI op agentisch werk, en tegelijk 45 keer duurder dan Luna voor een gesprek dat geen redeneervermogen vraagt. De goedkoopste OpenAI-factuur ontstaat door per taak te kiezen, en dat is precies wat een modelrouter in je eigen software doet.

Ons eigen standpunt daarin is niet neutraal en dat zeggen we liever hardop: Claude is bij CleverTech AI de standaardkeuze, en de pagina over Claude Fable 5.1 laat zien dat ook die factuur twee kanten heeft. Voor veel MKB-werk wint uiteindelijk het model dat de taak in één keer goed doet, ongeacht het logo.

Zo houd je de OpenAI-factuur onder controle

  • Kies het model per taak, niet per project: Luna of nano voor volume, Sol of Astra voor beslissingen.
  • Zet het vaste deel van de prompt vooraan, zodat caching vanaf de tweede aanroep werkt.
  • Gebruik de Batch API voor alles wat een nacht kan wachten; dat halveert het tarief.
  • Houd één verzoek onder 272.000 inputtokens, ook als het contextvenster meer toelaat.
  • Beperk de outputlengte en de reasoning-effort per taak; output is het dure tarief.
  • Tel tools (web search, file search) en audio als aparte regels in je begroting.
  • Reken een koersmarge van tien procent in elke businesscase in euro.

Wie een bestaande implementatie draait en wil weten welk model waar echt nodig is, laat het meten in plaats van schatten. Bij AI-software op maat meten we de modelkosten per functie; onder Managed AI hoort een maandrapportage over wat het systeem heeft afgehandeld, welke aanpassingen zijn gedaan en wat er is blijven liggen.

Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.

Tags:#ChatGPT#AI kosten#AI tools#API#MKB
Delen:
Veelgestelde vragen

Antwoorden over dit artikel

Wat kost de OpenAI API per miljoen tokens in 2026?

GPT-6 Astra kost $10 per miljoen inputtokens en $50 per miljoen outputtokens, cached input $1. GPT-5.6 Sol kost $4/$20, Terra $2/$12 en Luna $0,20/$1,20. De Batch API en Flex halveren die tarieven; fast mode verdubbelt ze bij Astra en de 5.6-lijn. Peildatum 18 september 2026, bron developers.openai.com/api/docs/pricing.

Wat is het verschil tussen de OpenAI API en een ChatGPT-abonnement?

Een ChatGPT-abonnement is een vaste prijs per gebruiker per maand voor mensen die zelf met het model chatten. De API rekent per verbruikt token en is bedoeld voor software die je zelf bouwt of laat bouwen, zoals een chatbot, een documentverwerker of een agent. Bij tien medewerkers die zelf typen is een abonnement meestal goedkoper; bij duizenden geautomatiseerde verzoeken per dag is de API dat.

Bestaat er een GPT-6 mini of GPT-6 nano?

Nee, niet op de OpenAI-prijslijst van 18 september 2026. De kleine en goedkope modellen van OpenAI zitten in de 5.x-lijn: GPT-5.6 Luna ($0,20/$1,20), GPT-5.4-mini ($0,75/$4,50), GPT-5.4-nano ($0,20/$1,25) en GPT-5-nano ($0,05/$0,40). Wie een goedkoop model naast Astra zoekt, kiest daaruit.

Hoeveel kost een klantenservicegesprek via de OpenAI API?

Als rekenvoorbeeld: een gesprek met 2.000 tokens gecachte systeemprompt, 800 tokens verse input en 300 tokens antwoord kost $0,025 op GPT-6 Astra, $0,010 op Sol, $0,0056 op Terra en $0,00056 op Luna. Per 10.000 gesprekken is dat $250 tegenover $5,60. Het model bepaalt de prijs, niet het aantal gesprekken.

Wat kost het samenvatten van een document met GPT-6 Astra?

Een contract van twintig pagina’s (circa 12.500 inputtokens inclusief instructie) met een samenvatting van 800 tokens kost als rekenvoorbeeld $0,165 op Astra, $0,066 op Sol en $0,0035 op Luna. Via de Batch API halveert dat, mits je een levertijd tot 24 uur accepteert. Documentwerk is inputzwaar en input is het goedkope tarief.

Hoe werkt prompt caching bij OpenAI en wat bespaart het?

Caching staat standaard aan vanaf 1.024 tokens en geldt voor het vaste begin van je prompt, zoals de systeemprompt. Een cache-hit kost een tiende van het inputtarief; bij GPT-5.6 en later kost het wegschrijven 1,25 keer het inputtarief en blijft de cache minstens 30 minuten leven. Caching loont dus vanaf de tweede aanroep met hetzelfde prefix binnen dat half uur.

Wat is de Batch API en hoeveel korting geeft die?

De Batch API verwerkt een bestand met maximaal 50.000 verzoeken binnen 24 uur tegen de helft van het standaardtarief, op input, cached input en output. Hij is geschikt voor documentverwerking, classificatie en rapportages die niet direct hoeven. Verzoeken die zijn afgerond worden ook in rekening gebracht als de batch als geheel verloopt.

Wat gebeurt er boven 272.000 inputtokens?

Dan rekent OpenAI het long-contexttarief over het hele verzoek: het dubbele voor input en cache, anderhalf keer voor output. Voor Astra betekent dat $20/$75 in plaats van $10/$50. Eén verzoek van 300.000 tokens kost daardoor twee keer zoveel als drie verzoeken van 100.000 tokens.

Kan ik de OpenAI API in de EU laten verwerken en wat kost dat?

Ja, dataresidentie is een projectinstelling; Europa (EER plus Zwitserland) is een regio met volledige verwerking. Voor modellen die op of na 5 maart 2026 verschenen, waaronder GPT-6 Astra en GPT-5.6, rekent OpenAI 10 procent extra, dus Astra kost dan $11/$55. Fast mode is bij Astra niet beschikbaar met EU-residentie en misbruiklogs blijven tot 30 dagen bewaard, tenzij je Zero Data Retention aanvraagt.

Is Azure OpenAI goedkoper dan de OpenAI API?

Bij Global-verwerking in Microsoft Foundry kost GPT-6 Astra hetzelfde als bij OpenAI: $10 input, $1 cached, $12,50 cache write en $50 output per miljoen tokens. De US Data Zone rekent 10 procent meer, een EU Data Zone voor Astra noemde Microsoft bij de lancering op 3 september 2026 niet. Het verschil zit in de bijkomende Azure-diensten en in vaste capaciteit via Provisioned Throughput, niet in het tokentarief.

Wat kosten embeddings voor een eigen kennisbank?

text-embedding-3-small kost $0,02 per miljoen tokens, text-embedding-3-large $0,13. Tienduizend documenten van 5.000 tokens embedden kost daarmee $1 tot $6,50 eenmalig. De echte kosten van een kennisbank zitten in het generatiemodel dat de gevonden fragmenten leest en in de bouw van de software.

Wat kost web search of file search via de OpenAI API?

Web search kost $10 per 1.000 aanroepen plus de zoekinhoud als inputtokens tegen modeltarief. File search kost $2,50 per 1.000 aanroepen plus $0,10 per GB per dag opslag, waarvan de eerste GB gratis is. Een agent die per gesprek twee keer zoekt, voegt zo $0,02 per gesprek toe.

Hoeveel kost spraak via de OpenAI API?

Realtime spraak rekent per audiotoken: gpt-realtime-2.1 kost $32 per miljoen audio-inputtokens en $64 per miljoen audio-outputtokens, de mini-variant $10 en $20. Transcriptie achteraf gaat per minuut: gpt-transcribe $0,0045 en whisper $0,006. Een voice agent die transcribeert en met tekst antwoordt is daardoor een orde goedkoper dan volledig realtime.

Hoeveel tokens is een Nederlandse pagina tekst?

Onze vuistregel is circa 1,4 token per Nederlands woord en circa 600 tokens per volle A4; Nederlandse samenstellingen splitsen vaker dan Engelse woorden. Het is een werkaanname uit onze projecten, geen leverancierscijfer. Meet je eigen documenten na in de tokenizer van OpenAI voordat je een budget vastlegt.

Hoe lang blijft de promotieprijs van GPT-5.6 Sol gelden?

OpenAI garandeert het tarief van $4 input en $20 output per miljoen tokens "at least through November 21, 2026". Wat daarna gebeurt is niet aangekondigd. Een businesscase voor 2027 op dit tarief rust dus op een aanname; reken een scenario door waarin Sol naar het niveau van GPT-5.5 ($5/$30) terugkeert.

Wat kost het bouwen van software op de OpenAI API bij CleverTech AI?

Eén ingebouwde AI-feature start bij €8.500 en RAG op eigen data bij €12.500, tegen een vaste prijs na scoping, met onderhoud vanaf €750 per maand plus de modelkosten. Een AI-agent die één proces afhandelt kost €2.500 setup en €350 per maand. De tokens zijn daarnaast meestal een tiende van de totale kosten in jaar één.

Volgende stap

Wat dit in jouw situatie betekent, weet je snel

Je legt je vraag voor, wij zeggen wat haalbaar is, wat het ongeveer kost en wat de slimste eerste stap is. Ook als dat betekent: nog even niet bouwen.

Liever eerst schriftelijk? Stel je vraag via het formulier.
Liever eerst zelf checken? Download de AI Readiness Checklist.
5,0op Google
  • Zeer fijne samenwerking! Professioneel, deskundig en vooral erg oplossingsgericht. Ze denken goed mee, communiceren duidelijk en leveren kwaliteit. Een betrouwbare en innovatieve techpartner die ik zeker kan aanbevelen!

    Spark O.

  • Heel goed geholpen duidelijke uitleg en werken heel hard voor je en denken heel goed mee wat belangrijk is. Duidelijk heel veel kennis van zaken. Echt een aanrader.

    Maarten B.

Blijf op de hoogte

Ontvang praktische AI-inzichten in je inbox. Geen spam, alleen waardevolle content.

Geen spam · max 2x per maand · altijd opzegbaar

Je gegevens worden alleen gebruikt voor het verzenden van de nieuwsbrief. Uitschrijven kan op elk moment.

Van kennis naar resultaat

Wat betekent dit voor jouw bedrijf?

We denken vrijblijvend mee over wat dit concreet zou opleveren — vaste prijs, vaste deadline.