Kort antwoord
De Gemini API rekent per miljoen tokens: Gemini 3.8 Flash kost $0,75 invoer en $3,75 uitvoer tot en met 31 december 2026 en daarna $1,50 en $7,50; Gemini 3.1 Pro kost $2 en $12 onder de 200.000 tokens en $4 en $18 daarboven. Omgerekend is dat circa €0,65 tot €15,71 per miljoen tokens, exclusief btw. Een gratis laag bestaat, maar niet voor Gemini 3.1 Pro, niet voor batchverwerking, en volgens Googles eigen voorwaarden niet voor software die je beschikbaar stelt aan gebruikers in de Europese Economische Ruimte. De exacte limieten per minuut en per dag publiceert Google sinds september 2026 niet meer in de documentatie, alleen nog in je eigen AI Studio-project.
Van lezen naar doen.
Er is een zin in de Gemini API-voorwaarden die de gratis laag voor een Nederlands bedrijf meteen afsluit: "You may use only Paid Services when making API Clients available to users in the European Economic Area, Switzerland, or the United Kingdom" (Gemini API Additional Terms of Service).
Testen op de gratis sleutel mag dus wel. Er een klantportaal, chatbot of verwerkingsstraat op bouwen die Europese gebruikers bedient: niet.
Daarmee is de echte kostenvraag niet "wat kost gratis", maar wat de betaalde laag doet met jouw volume. Hieronder staat de volledige tarieftabel van september 2026, omgerekend naar euro, gevolgd door de gratis laag zoals hij werkelijk is afgebakend en twee rekenvoorbeelden die je kunt naspelen.
Gaat het je om wat medewerkers per stoel betalen in plaats van om software, dan is wat Gemini kost voor bedrijven de pagina die je zoekt; daar staan de Workspace-edities. De plaats van Google naast de andere aanbieders staat in onze index over AI-modellen vergelijken.
De tokentabel: alle Gemini-modellen van september 2026
Onderstaande tabel hebben we zelf opgebouwd uit de prijspagina van de Gemini API, afgelezen op 18 september 2026. Bedragen in dollars per miljoen tokens, standaardverwerking, exclusief btw.
| Model | Gratis laag | Invoer | Uitvoer | Cache-invoer | Batch (in / uit) |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | Ja | $0,75 | $3,75 | $0,075 | $0,375 / $1,875 |
| Gemini 3.7 Flash | Ja | $0,75 | $3,75 | $0,075 | $0,375 / $1,875 |
| Gemini 3.6 Flash | Ja | $0,75 | $3,75 | $0,075 | $0,375 / $1,875 |
| Gemini 3.5 Flash | Ja | $1,50 | $9,00 | $0,15 | $0,75 / $4,50 |
| Gemini 3.5 Flash-Lite | Ja | $0,30 | $2,50 | $0,03 | $0,15 / $1,25 |
| Gemini 3.1 Flash-Lite | Ja | $0,25 (tekst, beeld, video); $0,50 (audio) | $1,50 | $0,025 tot $0,05 | $0,125 / $0,75 |
| Gemini 3.1 Pro Preview | Nee | $2,00 tot 200K; $4,00 daarboven | $12,00 tot 200K; $18,00 daarboven | $0,20 / $0,40 | $1,00 / $6,00 |
| Gemini 2.5 Pro | Ja, cache niet | $1,25 tot 200K; $2,50 daarboven | $10,00 tot 200K; $15,00 daarboven | $0,125 / $0,25 | $0,625 / $5,00 |
| Gemini Embedding 2 | Ja | $0,20 (tekst) | n.v.t. | n.v.t. | $0,10 |
Vier dingen in die tabel bepalen je begroting, en drie ervan staan niet in de kolommen.
De Flash-prijs is een introductieprijs. Google schrijft bij 3.8, 3.7 en 3.6 Flash letterlijk "$0.75 through December 31, 2026" en "$1.50 starting January 1, 2027". Je modelkosten verdubbelen dus op nieuwjaarsdag, tenzij Google dat besluit terugdraait.
De uitvoerprijs telt ook het denkwerk. De regel heet in Googles tabellen "Output price (including thinking tokens)": wat het model intern redeneert, factureert het als uitvoer.
Boven 200.000 tokens verandert het hele verzoek van prijs. Bij 3.1 Pro en 2.5 Pro geldt dan een dubbel tarief, en volgens de voetnoot op de Cloud-prijspagina worden "all tokens (input and output) charged at long context rates" — niet alleen de tokens boven de grens.
Preview betekent betalen. Gemini 3.1 Pro Preview heeft als enige tekstmodel in de tabel geen gratis laag; wie het wil proberen, zet eerst een factureringsaccount aan.
Dezelfde tarieven in euro
Google factureert in dollars, tenzij je via Google Cloud in een andere valuta betaalt. Voor de omrekening gebruiken we de ECB-referentiekoers van 18 september 2026: 1 euro is 1,1460 dollar.
| Model | Invoer (circa €, excl. btw) | Uitvoer (circa €, excl. btw) | Invoer (incl. 21% btw) | Uitvoer (incl. 21% btw) |
|---|---|---|---|---|
| Gemini 3.8 Flash | €0,65 | €3,27 | €0,79 | €3,96 |
| Gemini 3.5 Flash | €1,31 | €7,85 | €1,58 | €9,50 |
| Gemini 3.5 Flash-Lite | €0,26 | €2,18 | €0,32 | €2,64 |
| Gemini 3.1 Pro (tot 200K) | €1,75 | €10,47 | €2,11 | €12,67 |
| Gemini 3.1 Pro (boven 200K) | €3,49 | €15,71 | €4,22 | €19,01 |
| Gemini 2.5 Pro (tot 200K) | €1,09 | €8,73 | €1,32 | €10,56 |
De btw-kolommen staan er voor wie de brutorekening wil zien; een btw-plichtig bedrijf verrekent die post. Je bank rekent daarnaast een eigen wisselkoersopslag die niet op Googles factuur verschijnt.
De gratis laag: wat je krijgt en wat je betaalt met iets anders
Google beschrijft de gratis laag op de prijspagina in vier regels: "Limited access to certain models", "Free input & output tokens", "Google AI Studio access" en "Content used to improve our products".
Die laatste regel is de prijs. In de voorwaarden staat dat Google inhoud uit de onbetaalde diensten gebruikt om "products and services and machine learning technologies" te verbeteren, en dat menselijke beoordelaars je invoer en uitvoer mogen lezen en annoteren.
Google voegt daar zelf de waarschuwing aan toe: "Do not submit sensitive, confidential, or personal information to the Unpaid Services."
Op de betaalde laag geldt het omgekeerde. Daar gebruikt Google prompts en antwoorden niet om producten te verbeteren en verwerkt het onder de Data Processing Addendum, met logging voor maximaal beperkte tijd tegen misbruik.
De Europese uitzondering die bijna niemand citeert
Voor bedrijven in de EER, Zwitserland en het Verenigd Koninkrijk maakt Google een tweede uitzondering, en die werkt in jouw voordeel.
Zit je in de EER, dan gelden de databepalingen van de betaalde diensten "to all Services, including Google AI Studio and unpaid quota in the Gemini API, even though they are offered free of charge".
Een Nederlandse ontwikkelaar die op de gratis sleutel test, levert zijn prompts dus niet aan de modeltraining. De tabelregel "Used to improve our products: Yes" bij de gratis laag is voor Europa door die clausule overschreven.
Wat blijft staan is de eerste regel: zodra de applicatie beschikbaar is voor gebruikers in de EER, is de betaalde laag verplicht. Gratis is in Europa een testomgeving, geen productieomgeving.
Wat de gratis laag niet kan
De verschillen tussen gratis en betaald zitten niet alleen in het aantal verzoeken.
- Batchverwerking en Priority staan in elke modeltabel op "Not available" voor de gratis laag.
- Gemini 3.1 Pro Preview, de beeldmodellen, Veo en Lyria hebben helemaal geen gratis laag.
- Contextcaching is bij 3.8, 3.7, 3.6 en 3.5 Flash wél gratis in de gratis laag, maar bij de Flash-Lites, 2.5 Pro en 3.1 Pro "Not available".
- Grounding met Google Zoeken geeft gratis 500 verzoeken per dag, gedeeld tussen Flash en Flash-Lite, en werkt niet op Pro-modellen.
Die derde regel is een aardigheidje voor wie een prototype bouwt: op 3.8 Flash kun je caching gratis uitproberen voordat je er in productie voor betaalt.
Waar de gratis limieten liggen, en waarom je ze niet meer kunt opzoeken
Hier wijkt de werkelijkheid af van wat vrijwel elk Nederlands overzicht nog schrijft. De limietenpagina van Google noemt sinds de herziening van 2 september 2026 geen RPM-, TPM- of RPD-getal per model meer.
Wat er wel staat: limieten worden gemeten in verzoeken per minuut (RPM), invoertokens per minuut (TPM) en verzoeken per dag (RPD), ze gelden "per project, not per API key", en de dagteller loopt leeg om middernacht in de Amerikaanse Pacific-tijdzone.
Voor de getallen verwijst Google naar je eigen project: "Rate limits depend on a variety of factors (such as your usage tier) and can be viewed in Google AI Studio", met de waarschuwing dat "specified rate limits are not guaranteed".
Dat betekent praktisch: elk blog dat je vandaag "15 verzoeken per minuut en 1.500 per dag" belooft, citeert een pagina die niet meer bestaat. Kijk in AI Studio bij je eigen project, en reken in je ontwerp op een limiet die kan bewegen.
Eén limiet publiceert Google wél, en die verrast mensen: een uitgavenlimiet per tien minuten.
| Tier | Voorwaarde | Uitgavenlimiet per 10 minuten | Facturatieplafond |
|---|---|---|---|
| Gratis | Actief project of proefperiode | n.v.t. | n.v.t. |
| Tier 1 | Gekoppeld, actief factureringsaccount | $10 | $250 |
| Tier 2 | $100 betaald plus 3 dagen sinds de eerste betaling | $50 | $2.000 |
| Tier 3 | $1.000 betaald plus 30 dagen sinds de eerste betaling | $200 | $20.000 tot $100.000+ |
Bron: Rate limits, 18 september 2026. Overschrijd je de uitgavenlimiet, dan geeft de API een 429 RESOURCE_EXHAUSTED.
Voor een documentverwerking die in één nacht duizenden bestanden wegwerkt, is dat de limiet die je als eerste raakt. Op Tier 1 zit je na ongeveer 340 documenten uit de documentberekening hieronder al aan die tien dollar, als je ze op Gemini 3.1 Pro laat lopen.
Batchverwerking heeft daarnaast eigen grenzen: honderd gelijktijdige batchtaken, een invoerbestand van maximaal 2 GB, 20 GB opslag, en per model een maximum aan tokens in de wachtrij dat met je tier meegroeit — bij Gemini 3.8 Flash van 3 miljoen op Tier 1 tot 1 miljard op Tier 3.
Wat kost het verwerken van duizend documenten?
Wat volgt is een berekening op de tarieven hierboven, geen meting uit een project; de rekenmethode erachter staat op AI-API-kosten berekenen per document en per gesprek. We houden bewust dezelfde volumes aan als op onze pagina over de kosten van de Claude API, zodat de aanbieders naast elkaar te leggen zijn: per document 10.000 invoertokens en 800 uitvoertokens voor een samenvatting met vaste velden.
| Model | Eén document | Duizend documenten | Duizend in batch | Duizend in batch (circa €) |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0,0050 | $5,00 | $2,50 | €2,18 |
| Gemini 3.8 Flash | $0,0105 | $10,50 | $5,25 | €4,58 |
| Gemini 2.5 Pro | $0,0205 | $20,50 | $10,25 | €8,94 |
| Gemini 3.5 Flash | $0,0222 | $22,20 | $11,10 | €9,69 |
| Gemini 3.1 Pro | $0,0296 | $29,60 | $14,80 | €12,91 |
Rekenwijze op 3.8 Flash: 10.000 × $0,75 gedeeld door een miljoen is $0,0075 invoer, plus 800 × $3,75 gedeeld door een miljoen is $0,0030 uitvoer.
Zet dat naast de $28 die duizend dezelfde documenten op Claude Sonnet 5 kosten en de rangorde is duidelijk: Google is op documentwerk de goedkoopste van de drie grote aanbieders, met een factor twee tot drie verschil.
Let wel op de datum. Vanaf 1 januari 2027 kost diezelfde duizend documenten op 3.8 Flash $21,00 in plaats van $10,50, en verdwijnt dat voordeel grotendeels.
PDF's rekenen bovendien anders af dan platte tekst: tokens van de modaliteit DOCUMENT worden volgens Googles voetnoot gefactureerd tegen het beeldtarief. Meet een echte PDF na voordat je een offerte op een woordentelling baseert.
Wat kost een klantgesprek van acht beurten?
Een gesprek rekent anders af dan een document, omdat elke beurt de voorgeschiedenis opnieuw meestuurt. Opnieuw de volumes van de Claude-pagina: acht beurten, een gecachet voorstuk van 6.000 tokens, en per beurt een vraag van 100 tokens met een antwoord van 250.
Dat levert per gesprek 48.000 gecachete tokens op, 10.600 verse invoertokens door de groeiende geschiedenis en 2.000 uitvoertokens.
| Model | Eén gesprek met cache | Eén gesprek zonder cache | Duizend gesprekken | Duizend gesprekken (circa €) |
|---|---|---|---|---|
| Gemini 3.8 Flash | $0,0191 | $0,0515 | $19,05 | €16,62 |
| Gemini 2.5 Pro | $0,0393 | $0,0933 | $39,25 | €34,25 |
| Gemini 3.5 Flash | $0,0411 | $0,1059 | $41,10 | €35,86 |
| Gemini 3.1 Pro | $0,0548 | $0,1412 | $54,80 | €47,82 |
Rekenwijze op 3.8 Flash: 48.000 gecachete tokens tegen $0,075, 10.600 verse tokens tegen $0,75 en 2.000 uitvoertokens tegen $3,75, alles per miljoen.
Caching haalt hier ruim 60% van de rekening af, en anders dan bij de concurrentie kost het vullen van die cache niets. Daarover hieronder meer, want dit is het punt waarop de drie aanbieders het meest van elkaar verschillen.
Caching bij Google werkt anders dan bij Anthropic
Bij Anthropic betaal je voor het schrijven van een cache 1,25 tot 2 keer het invoertarief. Bij Google is die post er niet: impliciete caching staat "enabled by default for all Gemini 2.5 and newer models" en Google geeft de korting automatisch door wanneer een verzoek een cache raakt.
De prijs die je betaalt is alleen het lagere cache-invoertarief, doorgaans een tiende van het gewone invoertarief.
Daar staat één harde drempel tegenover, en die is hoger dan bij de concurrentie.
| Model | Minimum invoertokens voor caching |
|---|---|
| Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash, 3.5 Flash | 4.096 |
| Gemini 3.1 Pro Preview | 4.096 |
| Gemini 2.5 Flash, 2.5 Pro | 2.048 |
Bron: Context caching, 18 september 2026. Onder die drempel cachet er niets, zonder foutmelding.
Een systeemprompt van 3.000 tokens valt dus buiten de boot terwijl hij dat op Claude Sonnet 5 niet zou doen; daar ligt de drempel op 1.024 tokens. Wie zijn prompt net onder de 4.096 heeft staan, verdient het geld terug door hem aan te vullen in plaats van in te korten.
Wil je de cache zelf beheren in plaats van hem automatisch te laten ontstaan, dan bestaat expliciete caching. Die rekent bovenop het tokentarief een opslagprijs per uur: $0,50 per miljoen tokens per uur tot en met 2026 en $1,00 daarna voor 3.8, 3.7 en 3.6 Flash, $1,00 voor 3.5 Flash en de Flash-Lites, $4,50 voor 3.1 Pro en 2.5 Pro.
Reken die post na voordat je hem aanzet. Een cache van 200.000 tokens die een werkdag lang openstaat, kost op 3.1 Pro ongeveer $7,20 aan opslag, los van elk verzoek dat hem gebruikt.
Controleer of het werkt in het antwoordobject: het veld usage.total_cached_tokens telt de tokens die uit de cache kwamen.
Batch, Flex en Priority: drie snelheden, drie prijzen
Elk Gemini-model heeft naast het standaardtarief drie andere verwerkingsvormen, en het prijsverschil daartussen is groter dan het verschil tussen twee modelgeneraties.
| Verwerkingsvorm | Prijs ten opzichte van standaard | Waarvoor |
|---|---|---|
| Batch | 50% | Werk dat mag wachten: classificatie, verrijking, nachtelijke verwerking |
| Flex | 50% | Achtergrondwerk zonder harde doorlooptijd |
| Standaard | 100% | Normale interactieve verzoeken |
| Priority | 180% | Verzoeken waarbij een gebruiker op het antwoord wacht |
Priority kost op 3.8 Flash $1,35 invoer en $6,75 uitvoer, tegen $0,75 en $3,75 standaard. Google geeft er bovendien een eigen limiet aan mee: standaard 0,3 keer het gewone limiet per model en tier.
Voor een documentstraat is batch daarmee de grootste knop die je hebt. Voor een chatvenster is hij per definitie onbruikbaar.
Wat er naast de tokens op je factuur staat
Vijf posten vallen buiten de tarieftabel en verschijnen wel op de rekening. Vier komen van de prijspagina van 18 september 2026; de regel over functiedeclaraties komt van Agent Platform pricing.
Grounding met Google Zoeken. Op de Gemini 3-modellen zijn 5.000 zoekverzoeken per maand inbegrepen, gedeeld over alle 3.x-modellen, daarna kost het $14 per 1.000 verzoeken. Op de 2.5-modellen is het 1.500 per dag gratis en daarna $35 per 1.000.
File search. De dienst zelf is gratis, de embeddings kosten $0,15 per miljoen tokens en de opgehaalde documenttokens tellen als gewone invoer.
Code execution en URL context. Beide kosten geen eigen tarief; je betaalt de tokens die ze produceren of ophalen, en gegenereerde code telt als uitvoer zodra het model hem terugleest als invoer.
Functiedeclaraties. Sinds Gemini 3.5 tellen functiedeclaraties mee in het aantal invoertokens. Een agent met twintig tools betaalt die beschrijvingen dus bij elke beurt.
Agentische lussen. Bij de managed agents en de Deep Research-agent rekent Google alle tussenliggende redeneer- en invoertokens tegen het gewone tarief; alleen de rekencapaciteit van de sandbox is tijdens de previewperiode gratis.
De EU-route: dezelfde modellen, 10% duurder
De Gemini API via ai.google.dev kent geen regiokeuze. Wil je Europese verwerking, dan loopt de route via Google Cloud, op het platform dat inmiddels Agent Platform heet en tot voor kort Vertex AI.
Daar staan de prijzen per endpoint in de tabel, en het verschil is precies tien procent: Gemini 3.8 Flash kost op het globale endpoint $0,75 invoer en $3,75 uitvoer, op een niet-globaal endpoint $0,825 en $4,125.
Die toeslag geldt volgens de voetnoot voor "the Generally available Gemini 3 and later families of all Google models" sinds 1 juli 2026. Gemini 3.1 Pro Preview staat er alleen met een globale prijs, en dus niet met een EU-endpoint.
Twee details van die route zijn in het voordeel van de klant. Google rekent op Agent Platform alleen voor verzoeken die een 200-antwoord teruggeven, en de prijzen op de Cloud-pagina kunnen afwijken van die op ai.google.dev, dus vergelijk ze allebei voordat je begroot.
Welke modellen bij welke aanbieder daadwerkelijk binnen de EU blijven, en wat "EU" per route dekt, staat in onze vergelijking van AI-modellen met EU-hosting. Hoe de Google Cloud-route zich verhoudt tot Azure OpenAI en AWS Bedrock, leggen we naast elkaar in Azure OpenAI, Bedrock of Vertex.
De software eromheen is de grote post
Tokens vormen zelden het grootste bedrag in een MKB-project. Daarom zetten we onze eigen tarieven er als ijkpunt naast.
Voor AI-software op maat rekenen we €8.500 als startpunt voor één ingebouwde AI-functie, €12.500 voor zoeken op je eigen data met RAG, en €75.000 of meer voor een compleet platform; de prijs ligt vast zodra de scope rond is. Daarna komt onderhoud erbij vanaf €750 per maand, bovenop het verbruik dat je hierboven uitrekent.
Is de bouw al achter de rug en zoek je iemand die het draaiend houdt? Managed AI loopt van €500 per maand (Basis) via €1.000 (Standaard) naar €1.500 tot €2.500 (Premium), inclusief bewaking van cachetreffers, tierlimieten en verbruik per functie.
Leg dat naast de eerste berekening hierboven. Duizend documenten per maand via batch op 3.8 Flash komen uit op circa €4,58 aan tokens, tegenover een bouwsom in de tienduizenden euro.
Alle kostenposten op een rij, van seats tot implementatie en beheer, staan in ons overzicht van AI-kosten voor bedrijven. Een richtbedrag voor je eigen project levert de prijsindicatie in een paar minuten.
Benieuwd wat jouw volumes werkelijk aan tokens opleveren? Stel je vraag via contact of bel 085 016 0118, dan maken we de som met je eigen aantallen.
Wanneer de Gemini API de juiste keuze is, en wanneer niet
De tarieftabel geeft Google niet automatisch gelijk. Drie situaties waarin het antwoord anders uitpakt.
Veel documenten, weinig redeneerwerk. Hier wint Google op prijs, zeker via batch, en is 3.8 Flash of 3.5 Flash-Lite de logische keuze.
Zwaar agentisch werk met veel hergebruikte context. Dan wegen de cacheprijzen zwaarder dan het lijsttarief, en loont het om de tabellen naast elkaar te leggen met de kosten van de OpenAI API en die van Claude.
Een begroting die verder reikt dan dit jaar. Met de verdubbeling op 1 januari 2027 in het vooruitzicht is een businesscase op $0,75 per miljoen tokens een aanname, geen feit.
Voor de goede orde: Anthropic is bij ons de standaardkeuze en Google niet. Dat kleurt deze pagina, en daarom staat bij elk cijfer hierboven een bron.
Bij documentverwerking op volume is Google aantoonbaar voordeliger, en dan bouwen we daarop.
Welke aanbieders er verder zijn en waar ze elkaar ontlopen, staat in ons overzicht van welke AI-modellen er zijn.
Zo houd je de Gemini-rekening voorspelbaar
- Kies per taak: Flash-Lite voor volume, Flash voor gewoon werk, Pro alleen waar het redeneren verschil maakt.
- Zet je vaste voorstuk boven de 4.096 tokens, anders cachet er niets.
- Draai alles wat mag wachten via batch: exact de helft.
- Houd verzoeken onder de 200.000 tokens als je Pro gebruikt, anders verdubbelt het hele verzoek.
- Zet nu al een scenario met de tarieven van 2027 naast je begroting.
- Log tokens per functie in plaats van per project, zodat je ziet welke functie de rekening maakt.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










