Kort antwoord
AI op je eigen data (RAG) kost bij CleverTech AI vanaf €7.500 eenmalig voor een RAG-laag rond één kennisbron, vanaf €12.500 voor RAG-zoeken over meerdere bronnen en vanaf €25.000 als onderdeel van een volledige AI-applicatie, plus onderhoud vanaf €500 tot €750 per maand. De lopende techniekkosten zijn klein: hosting van de vectoropslag circa €10 tot €42 per maand, embeddings enkele euro’s per jaar en modeltokens circa €14 tot €280 per maand bij 1.000 tot 20.000 vragen. In ons rekenvoorbeeld komt jaar één daarmee uit op circa €13.800 (500 documenten) tot €49.900 (50.000 documenten), exclusief btw, en jaar twee op circa €6.300 tot €24.900.
Van lezen naar doen.
Van elke euro die AI op je eigen data in het eerste jaar kost, gaat in het rekenvoorbeeld op deze pagina tussen de 1 en 7 cent naar het taalmodel. De rest zit in bouwen, hosten en vooral in het onderhoud en de controle of het systeem de juiste passage blijft vinden.
Dat staat haaks op hoe de meeste offertes voor een RAG-systeem worden gelezen. De tokenprijs krijgt alle aandacht, terwijl de posten die de rekening bepalen nauwelijks worden begroot.
Hieronder staat de complete kostenopbouw: onze eigen prijsbanden, de lopende kosten per onderdeel met leveranciersprijzen van 18 september 2026, en een rekenvoorbeeld voor drie corpusgroottes over twee jaar. Wat RAG technisch doet en wanneer je het überhaupt nodig hebt, lees je op de zusterpagina wat is RAG en wanneer heeft je bedrijf het nodig; hier gaat het alleen om het geld.
Vijf kostenposten, één daarvan is groot
Een RAG-systeem heeft vijf kostenposten. Ze gedragen zich totaal verschillend, en dat is de reden dat een tokenprijs alleen niets zegt.
- Bouw. Eenmalig: bronnen aansluiten, documenten opschonen en opdelen, de zoeklaag, het antwoordmodel, bronvermelding, toegangsregels, evaluatieset.
- Hosting. Maandelijks: de database met vectoren, de applicatie zelf en de back-ups.
- Embeddings. Eenmalig bij indexeren en daarna bij elke wijziging in de documenten.
- Tokens per vraag. Variabel: elke vraag stuurt opgehaalde passages naar het model en krijgt een antwoord terug.
- Evaluatie en onderhoud. Maandelijks: controleren of de juiste passages nog bovenkomen, prompts bijstellen, modelwissels opvangen, bronnen bijhouden.
De vijfde post is in elke variant van ons rekenvoorbeeld groter dan de posten twee tot en met vier bij elkaar. Wie dat vooraf weet, begroot anders en kiest een andere leverancier.
Onze prijsbanden voor AI op eigen data
De bandbreedtes hieronder zijn onze eigen prijslijst, niet een marktgemiddelde. Ze staan op de dienstpagina AI software laten maken en op Managed AI; alles exclusief btw.
| Vorm | Wat je krijgt | Onze prijs | Doorlooptijd |
|---|---|---|---|
| RAG-laag rond één afgebakende kennisbron | Eén bron (bijvoorbeeld een handleidingenmap of SharePoint-bibliotheek), zoeken plus antwoorden met bronvermelding | Vanaf €7.500 eenmalig, plus doorgaans €150-€600 per maand voor hosting en modelgebruik | 2-4 weken |
| RAG-zoeken als zelfstandige dienst | Meerdere bronnen, toegangsregels per rol, evaluatieset, eigen interface of koppeling | Vanaf €12.500, vaste prijs na scoping | 4-6 weken |
| AI-feature binnen een bredere applicatie | Zoeken op eigen data als één functie in software die we toch al bouwen | Vanaf €8.500 | 3-5 weken |
| Volledige AI-webapplicatie | Portaal of app waarin RAG de kern is: accounts, rollen, workflows, rapportage | Vanaf €25.000 | 8-12 weken |
| Software-onderhoud | Hosting, monitoring, security-patches, bugfixes | €500-€750 per maand | Doorlopend |
| Onderhoud van een AI-applicatie | Idem, plus modelkosten als aparte post | Vanaf €750 per maand plus modelkosten | Doorlopend |
| Managed AI | Beheer van het AI-systeem zelf: kennisbank, prompts, modelkeuze, kwaliteit, maandrapportage | Basis €500, Standaard €1.000, Premium €1.500-€2.500 per maand | Doorlopend |
Vaste prijs na scoping betekent dat je het bedrag kent voordat we beginnen. Broncode, prompts en de evaluatieset zijn van jou.
Wat de prijs binnen de band omhoog duwt
Het verschil tussen €7.500 en €12.500 zit zelden in het aantal documenten. Het zit in de vragen hieronder.
- Aantal en soort bronnen. Eén nette map met PDF's is iets anders dan SharePoint, een mailbox en gescande formulieren samen.
- Toegangsregels. Mag iedereen alles zien, of moet de assistent per rol andere passages ophalen?
- Hosting-eis. Gedeelde EU-cloud is standaard; on-premise of een eigen VPC vraagt extra inrichting.
- Bronvermelding als harde eis. Elk antwoord herleidbaar naar een passage is een ontwerpkeuze vanaf dag één, geen instelling achteraf.
- Wijzigingsfrequentie. Documenten die dagelijks veranderen vragen om een automatische herindexering, niet om een handmatige upload.
Twijfel je in welke band jouw situatie valt, dan geeft de prijsindicatie binnen een paar vragen een eerste bandbreedte.
Hosting: pgvector op een VPS of een beheerde dienst
Voor de vectoropslag zijn er drie routes. Onze default is de eerste: PostgreSQL met de pgvector-extensie, waardoor tekst, vectoren en gebruikersgegevens één database en één back-up delen.
Zo hebben we het ook gebouwd in ons eigen product Bijbel Assistent, waar PostgreSQL met pgvector de vector-database is en Redis de caching opvangt (case). Een aparte vectordienst voegde daar alleen infrastructuur toe.
Alle bedragen hieronder zijn op 18 september 2026 van de leverancierssites afgelezen. Voor de euro's gebruiken we de ECB-koers van diezelfde dag, 1,1460 dollar per euro, afgerond en zonder btw.
| Route | Geschikt voor | Prijs per maand | Bron |
|---|---|---|---|
| pgvector op een VPS, 1 vCPU / 2 GiB, Amsterdam (AMS3) | Tot circa 25.000 passages | $12 (circa €10) | DigitalOcean droplet-prijzen, regio's |
| pgvector op een VPS, 2 vCPU / 4 GiB | Tot circa 100.000 passages | $24 (circa €21) | DigitalOcean droplet-prijzen |
| pgvector op een VPS, 4 vCPU / 8 GiB | Tot circa 250.000 passages, index in het geheugen | $48 (circa €42) | DigitalOcean droplet-prijzen |
| Beheerde PostgreSQL met pgvector (Supabase Pro, Frankfurt eu-central-1) | Wie geen server wil beheren | $25 inclusief Micro-instance (1 GB RAM) en 8 GB schijf; Small +$15, Large +$110, met $10 compute-tegoed (circa €22 tot €109) | Supabase pricing, regio's |
| Losse vectordatabase (Pinecone Standard) | Volumes waar PostgreSQL het niet meer trekt | Minimaal $50 verbruik (circa €44), opslag $0,33 per GB, lees-eenheden $16-$18 en schrijf-eenheden $4-$4,50 per miljoen; EU-regio's beschikbaar | Pinecone pricing |
Een vuistregel voor de maat: een embedding van 1.536 dimensies is circa 6 KB. Bij 250.000 passages is dat circa 1,5 GB aan vectoren, plus de index en de tekst zelf, en dan wil je 8 GB werkgeheugen.
Het gratis Pinecone Starter-plan draait alleen in AWS us-east-1 en het gratis Supabase-plan pauzeert projecten na een week inactiviteit. Beide zijn bruikbaar om te testen, niet om op te draaien.
De applicatie zelf (API, interface, achtergrondtaken) draait bij kleine corpora op dezelfde VPS. Vanaf enkele duizenden gebruikers zet je hem apart, wat de hostingpost grofweg verdubbelt.
Embeddings: de post die je bijna kunt negeren
Embeddings zijn de getallenreeksen waarmee de database zoekt. Je betaalt ze bij het indexeren en daarna alleen voor wat verandert.
Rekenbasis: een gemiddeld zakelijk document is circa 2.000 tokens, ongeveer vijf pagina's. 500 documenten zijn dan 1 miljoen tokens, 5.000 documenten 10 miljoen en 50.000 documenten 100 miljoen.
| Embeddingmodel | Prijs per miljoen tokens | 1 mln tokens | 10 mln tokens | 100 mln tokens | Bron |
|---|---|---|---|---|---|
| OpenAI text-embedding-3-small | $0,02 | $0,02 | $0,20 | $2,00 (circa €1,75) | OpenAI pricing |
| OpenAI text-embedding-3-large | $0,13 | $0,13 | $1,30 | $13,00 (circa €11,34) | OpenAI pricing |
| Voyage voyage-4 | $0,06, eerste 200 miljoen tokens gratis | $0 | $0 | $0 | Voyage pricing |
| Google Gemini Embedding 2 | $0,20 standaard, $0,10 batch | $0,20 | $2,00 | $20,00 (circa €17,45), batch $10,00 | Google AI pricing |
| Optioneel: contextuele chunks (Anthropic) | $1,02 per miljoen documenttokens, met prompt caching | $1,02 | $10,20 | $102 (circa €89) | Anthropic, contextual retrieval |
Zelfs 100 miljoen tokens door het duurste model kost minder dan één uur ontwikkelwerk. Verandert 10 procent van het corpus per maand, dan kost de maandelijkse herindexering bij text-embedding-3-small twee dollarcent per miljoen gewijzigde tokens.
Het enige scenario waarin embeddings opvallen op de factuur: je wisselt van embeddingmodel en moet het hele corpus opnieuw indexeren. Ook dan blijft het bij tientallen euro's.
Wat hier wél geld kost, zijn de uren vóór de API-call: PDF's parsen, tabellen intact houden, dubbele versies eruit halen en een chunkgrootte kiezen. Dat zit in de bouwprijs, niet in de embeddingprijs.
Tokens per vraag: drie modellen naast elkaar
Bij elke vraag gaan de opgehaalde passages plus instructies naar het model. Ons rekenvoorbeeld gaat uit van 6.000 inputtokens per vraag (tien passages van 500 tokens plus vraag en instructies) en 400 outputtokens.
De prijzen zijn van 18 september 2026. Claude Sonnet 5 kost $2 input en $10 output per miljoen tokens; Anthropic meldt dat dit introductietarief het standaardtarief is geworden en de aangekondigde verhoging naar $3/$15 per 1 september niet doorgaat (Anthropic pricing).
| Antwoordmodel | Input / output per miljoen | Per vraag | 1.000 vragen per maand | 5.000 vragen | 20.000 vragen | Bron |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | $2 / $10 | $0,016 (circa €0,014) | $16 (circa €14) | $80 (circa €70) | $320 (circa €279) | Anthropic pricing |
| OpenAI GPT-5.6 Terra | $2 / $12 | $0,017 (circa €0,015) | $16,80 (circa €15) | $84 (circa €73) | $336 (circa €293) | OpenAI pricing |
| Google Gemini 3.8 Flash | $0,75 / $3,75 t/m 31-12-2026, daarna $1,50 / $7,50 | $0,006 (circa €0,005) | $6 (circa €5) | $30 (circa €26) | $120 (circa €105) | Google AI pricing |
| Claude Haiku 4.5 (budgetvariant) | $1 / $5 | $0,008 (circa €0,007) | $8 (circa €7) | $40 (circa €35) | $160 (circa €140) | Anthropic pricing |
Twee posten die je hier nog bovenop kunt zetten, maar die klein blijven:
- Herrangschikken (reranker). Voyage rerank-2.5 kost $0,05 per miljoen tokens; twintig kandidaat-passages per vraag zijn circa 10.000 tokens, dus circa $10 per maand bij 20.000 vragen (Voyage pricing).
- De vraag zelf embedden. 20.000 vragen van 50 tokens is 1 miljoen tokens: twee dollarcent bij text-embedding-3-small.
Prompt caching drukt de rekening verder. De vaste instructies en het uitvoerformaat staan in elke aanroep; bij Claude kost een cache-hit 10 procent van de inputprijs, bij Sonnet 5 dus $0,20 per miljoen (Anthropic pricing).
Wil je de tokenprijzen per model verder uitdiepen, dan staan die op de zusterpagina's over de Claude API-kosten en de OpenAI API-kosten; voor de Gemini API volgt in deze golf een eigen kostenpagina. Deze pagina rekent alleen met wat een RAG-vraag typisch verbruikt.
Evaluatie en onderhoud: de post die de rekening bepaalt
Bij Bijbel Assistent, ons eigen RAG-product, ligt het zwaartepunt vóór het chatvenster: het corpus opschonen en opdelen, embeddings actueel houden en, het meest onderschat, controleren of de assistent de juiste passage ophaalt (case). Dat is geen eenmalige klus.
Wat er maandelijks gebeurt in een RAG-systeem dat goed blijft werken:
- Evaluatieset opnieuw draaien. Een vaste set vragen met het juiste bronfragment; meten of dat fragment nog in de top-k zit na elke wijziging in corpus, prompt of model.
- Modelwissels opvangen. Leveranciers halen modellen uit de lucht; Anthropic markeert op zijn prijspagina meerdere modellen als retired (Anthropic pricing). Elke wissel vraagt een nieuwe evaluatieronde.
- Bronnen bijhouden. Nieuwe mappen, verwijderde documenten, gewijzigde toegangsregels.
- Prompts bijstellen. Op basis van vragen waar het antwoord naast zat of te lang was.
- Monitoring en kosten. Tokenverbruik per functie, foutpercentages, latentie.
In onze prijslijst zit dat werk in het onderhoud vanaf €750 per maand plus modelkosten, of in Managed AI vanaf €500 (Basis) tot €2.500 (Premium) per maand, waar kennisbank-beheer en modelkeuze expliciet onder vallen.
Dat is de post die in ons rekenvoorbeeld circa 40 tot 44 procent van jaar één uitmaakt en in jaar twee tussen de 84 en 96 procent. Wie hem schrapt, houdt een systeem over dat langzaam slechter wordt zonder dat iemand het merkt.
Rekenvoorbeeld: drie groottes over twee jaar
Wat volgt is een rekenvoorbeeld, opgebouwd uit de leveranciersprijzen van deze pagina; er zit geen klantmeting in. De uitgangspunten:
- Documenten van gemiddeld 2.000 tokens; 10 procent van het corpus wijzigt per maand.
- Embeddings via OpenAI text-embedding-3-small; vectoropslag in pgvector op een VPS in Amsterdam.
- Antwoordmodel Claude Sonnet 5, 6.000 input- en 400 outputtokens per vraag, zonder caching of reranker.
- Bouw op de onderkant van onze band voor die vorm; onderhoud op onze band.
- Euro's circa, tegen de ECB-koers van 18 september 2026, exclusief btw; totalen afgerond op honderden.
| Post | Klein: 500 documenten, 1.000 vragen per maand | Middel: 5.000 documenten, 5.000 vragen per maand | Groot: 50.000 documenten, 20.000 vragen per maand |
|---|---|---|---|
| Bouw (eenmalig) | €7.500 (RAG-laag rond één bron) | €12.500 (RAG-zoeken, meerdere bronnen) | €25.000 (RAG als kern van een AI-webapplicatie) |
| Hosting vectoropslag | 1 vCPU / 2 GiB: circa €10 per maand | 2 vCPU / 4 GiB: circa €21 per maand | 4 vCPU / 8 GiB: circa €42 per maand |
| Embeddings indexeren (eenmalig) | $0,02 | $0,20 | $2,00 (circa €1,75) |
| Embeddings herindexeren (maandelijks) | Minder dan €0,01 | Circa €0,02 | Circa €0,17 |
| Tokens per vraag (Sonnet 5) | Circa €14 per maand | Circa €70 per maand | Circa €279 per maand |
| Evaluatie en onderhoud | €500 per maand (software-onderhoud) | €750 per maand (onderhoud AI-applicatie) | €750 onderhoud plus €1.000 Managed AI Standaard per maand |
| Jaar 1 | Circa €13.800 | Circa €22.600 | Circa €49.900 |
| Jaar 2 | Circa €6.300 | Circa €10.100 | Circa €24.900 |
| Aandeel modeltokens in jaar 1 | Circa 1,2 procent | Circa 3,7 procent | Circa 6,7 procent |
Bronnen per rij: onze prijsbanden op AI software laten maken en Managed AI, DigitalOcean, OpenAI, Anthropic en de ECB-koers.
Wat het rekenvoorbeeld laat zien
- De bouw domineert jaar één, het onderhoud jaar twee. Techniekkosten (hosting, embeddings, tokens) blijven in elke variant onder de 10 procent.
- Tien keer meer documenten kost geen tien keer meer. Van klein naar middel stijgt jaar één met circa 64 procent, terwijl het corpus vertienvoudigt.
- Het model wisselen verandert de uitkomst nauwelijks. Met Gemini 3.8 Flash in plaats van Sonnet 5 zakt jaar één van de grote variant van circa €49.900 naar circa €47.800, minder dan 5 procent.
Wie op de tokenprijs een leverancier kiest, optimaliseert dus de kleinste post. De vraag die er toe doet is wat de bouw en het onderhoud kosten, en of de evaluatieset erin zit.
Waar je wél op bespaart, en waar niet
Bezuinigen kan, maar niet overal met hetzelfde effect.
Wel:
- Een lichter model voor eenvoudige vragen. Haiku 4.5 halveert de tokenpost ten opzichte van Sonnet 5; Gemini 3.8 Flash deelt hem door bijna drie zolang het promotietarief loopt.
- Prompt caching op de vaste instructies. Cache-hits kosten bij Claude 10 procent van de inputprijs.
- Batch-embeddings bij Google. Halveert de embeddingpost, die toch al klein is.
- Het gratis Voyage-tegoed. 200 miljoen tokens is ruim voldoende voor 50.000 documenten en meerdere herindexeringen.
- pgvector in plaats van een losse vectordienst. Scheelt minimaal $50 per maand aan verplicht verbruik en een extra leverancier.
Niet:
- De evaluatieset. Zonder testset weet je niet of het systeem na een modelwissel nog dezelfde passages vindt.
- Bronvermelding vanaf dag één. Achteraf inbouwen betekent de ophaallaag opnieuw ontwerpen.
- Documentvoorbereiding. Slechte parsing van PDF's en tabellen is de meest voorkomende oorzaak van foute antwoorden, en geen model repareert dat.
- Toegangsregels. Een assistent die iedereen alles laat zien, gaat na de eerste vraag over salarissen uit.
RAG-kosten naast de alternatieven
RAG is één manier om AI op eigen data te krijgen. De kostenstructuur van de alternatieven is anders, niet per se lager.
- Een zakelijk abonnement met bedrijfsdata. ChatGPT Enterprise, Copilot of Claude Enterprise rekenen per gebruiker per maand; bij tientallen gebruikers loopt dat op tot bedragen die vergelijkbaar zijn met het onderhoud van een eigen systeem, zonder eigen ophaallaag of evaluatieset. De afweging staat in ChatGPT Enterprise versus private AI.
- Fine-tuning. Hoge kosten vooraf en bij elke inhoudelijke wijziging, lage kosten per vraag; zinvol voor stijl en formaat, niet voor feitenkennis die verandert. Zie RAG versus fine-tuning.
- Een koppeling via MCP. Gaat het om live cijfers uit je boekhouding, CRM of WMS in plaats van documenten, dan is een MCP-server de betere route; die kostenopbouw staat op wat kost een MCP-server.
- Alles in de prompt. Onder circa 200.000 tokens aan kennis heb je geen RAG nodig; dan betaal je alleen tokens, met caching.
Het bredere overzicht van alle vormen, van chatbot tot AI-platform, staat op wat kost AI voor bedrijven. De index AI-modellen vergelijken zet alle kostenpagina's van dit cluster bij elkaar.
Wat we nodig hebben voor een vaste prijs
Een vaste prijs vraagt zes antwoorden. Meer niet.
- Welke bronnen, hoeveel documenten en in welke vorm (PDF, SharePoint, mail, scans)?
- Hoe vaak verandert de inhoud?
- Hoeveel gebruikers en hoeveel vragen per maand verwacht je?
- Wie mag wat zien?
- Waar moet het draaien: EU-cloud, eigen VPC of on-premise?
- Moet elk antwoord naar een bron verwijzen?
Onze default voor de antwoordlaag is Claude, met een Nederlands of Europees alternatief als de hosting-eis daarom vraagt; welk model het wordt, leggen we in de scoping vast en zie je terug in de modelkostenpost.
Wil je die zes vragen samen doorlopen? Via de contactpagina of telefonisch op 085 016 0118 weet je binnen een dag in welke band je zit.
Liever eerst zelf rekenen? De prijsindicatie doet dat in een paar minuten.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










