Ga naar hoofdinhoud
Terug naar AI Modellen Vergelijken
14 min lezen19 september 2026Gecontroleerd op 19 september 2026

Wat kost AI op je eigen data (RAG) in 2026?

Bouw, hosting, embeddings, tokens en onderhoud: wat AI op je eigen data werkelijk kost in jaar één en jaar twee, doorgerekend voor 500, 5.000 en 50.000 documenten.

Bram DokmanOprichter & AI-specialist

Oprichter van CleverTech AI, met 12+ jaar ervaring in software development, online marketing en cloud-infrastructuur. BSc Science & Innovation Management (Universiteit Utrecht).

Deze pagina is gecontroleerd op

Twee collega’s in een archiefruimte met stapels dozen: een van hen houdt een laptop met een zoekvenster, de ander noteert kosten op een klembord
AI Modellen Vergelijken

Kort antwoord

AI op je eigen data (RAG) kost bij CleverTech AI vanaf €7.500 eenmalig voor een RAG-laag rond één kennisbron, vanaf €12.500 voor RAG-zoeken over meerdere bronnen en vanaf €25.000 als onderdeel van een volledige AI-applicatie, plus onderhoud vanaf €500 tot €750 per maand. De lopende techniekkosten zijn klein: hosting van de vectoropslag circa €10 tot €42 per maand, embeddings enkele euro’s per jaar en modeltokens circa €14 tot €280 per maand bij 1.000 tot 20.000 vragen. In ons rekenvoorbeeld komt jaar één daarmee uit op circa €13.800 (500 documenten) tot €49.900 (50.000 documenten), exclusief btw, en jaar twee op circa €6.300 tot €24.900.

Van elke euro die AI op je eigen data in het eerste jaar kost, gaat in het rekenvoorbeeld op deze pagina tussen de 1 en 7 cent naar het taalmodel. De rest zit in bouwen, hosten en vooral in het onderhoud en de controle of het systeem de juiste passage blijft vinden.

Dat staat haaks op hoe de meeste offertes voor een RAG-systeem worden gelezen. De tokenprijs krijgt alle aandacht, terwijl de posten die de rekening bepalen nauwelijks worden begroot.

Hieronder staat de complete kostenopbouw: onze eigen prijsbanden, de lopende kosten per onderdeel met leveranciersprijzen van 18 september 2026, en een rekenvoorbeeld voor drie corpusgroottes over twee jaar. Wat RAG technisch doet en wanneer je het überhaupt nodig hebt, lees je op de zusterpagina wat is RAG en wanneer heeft je bedrijf het nodig; hier gaat het alleen om het geld.

Vijf kostenposten, één daarvan is groot

Een RAG-systeem heeft vijf kostenposten. Ze gedragen zich totaal verschillend, en dat is de reden dat een tokenprijs alleen niets zegt.

  1. Bouw. Eenmalig: bronnen aansluiten, documenten opschonen en opdelen, de zoeklaag, het antwoordmodel, bronvermelding, toegangsregels, evaluatieset.
  2. Hosting. Maandelijks: de database met vectoren, de applicatie zelf en de back-ups.
  3. Embeddings. Eenmalig bij indexeren en daarna bij elke wijziging in de documenten.
  4. Tokens per vraag. Variabel: elke vraag stuurt opgehaalde passages naar het model en krijgt een antwoord terug.
  5. Evaluatie en onderhoud. Maandelijks: controleren of de juiste passages nog bovenkomen, prompts bijstellen, modelwissels opvangen, bronnen bijhouden.

De vijfde post is in elke variant van ons rekenvoorbeeld groter dan de posten twee tot en met vier bij elkaar. Wie dat vooraf weet, begroot anders en kiest een andere leverancier.

Onze prijsbanden voor AI op eigen data

De bandbreedtes hieronder zijn onze eigen prijslijst, niet een marktgemiddelde. Ze staan op de dienstpagina AI software laten maken en op Managed AI; alles exclusief btw.

Vorm Wat je krijgt Onze prijs Doorlooptijd
RAG-laag rond één afgebakende kennisbron Eén bron (bijvoorbeeld een handleidingenmap of SharePoint-bibliotheek), zoeken plus antwoorden met bronvermelding Vanaf €7.500 eenmalig, plus doorgaans €150-€600 per maand voor hosting en modelgebruik 2-4 weken
RAG-zoeken als zelfstandige dienst Meerdere bronnen, toegangsregels per rol, evaluatieset, eigen interface of koppeling Vanaf €12.500, vaste prijs na scoping 4-6 weken
AI-feature binnen een bredere applicatie Zoeken op eigen data als één functie in software die we toch al bouwen Vanaf €8.500 3-5 weken
Volledige AI-webapplicatie Portaal of app waarin RAG de kern is: accounts, rollen, workflows, rapportage Vanaf €25.000 8-12 weken
Software-onderhoud Hosting, monitoring, security-patches, bugfixes €500-€750 per maand Doorlopend
Onderhoud van een AI-applicatie Idem, plus modelkosten als aparte post Vanaf €750 per maand plus modelkosten Doorlopend
Managed AI Beheer van het AI-systeem zelf: kennisbank, prompts, modelkeuze, kwaliteit, maandrapportage Basis €500, Standaard €1.000, Premium €1.500-€2.500 per maand Doorlopend

Vaste prijs na scoping betekent dat je het bedrag kent voordat we beginnen. Broncode, prompts en de evaluatieset zijn van jou.

Wat de prijs binnen de band omhoog duwt

Het verschil tussen €7.500 en €12.500 zit zelden in het aantal documenten. Het zit in de vragen hieronder.

  • Aantal en soort bronnen. Eén nette map met PDF's is iets anders dan SharePoint, een mailbox en gescande formulieren samen.
  • Toegangsregels. Mag iedereen alles zien, of moet de assistent per rol andere passages ophalen?
  • Hosting-eis. Gedeelde EU-cloud is standaard; on-premise of een eigen VPC vraagt extra inrichting.
  • Bronvermelding als harde eis. Elk antwoord herleidbaar naar een passage is een ontwerpkeuze vanaf dag één, geen instelling achteraf.
  • Wijzigingsfrequentie. Documenten die dagelijks veranderen vragen om een automatische herindexering, niet om een handmatige upload.

Twijfel je in welke band jouw situatie valt, dan geeft de prijsindicatie binnen een paar vragen een eerste bandbreedte.

Hosting: pgvector op een VPS of een beheerde dienst

Voor de vectoropslag zijn er drie routes. Onze default is de eerste: PostgreSQL met de pgvector-extensie, waardoor tekst, vectoren en gebruikersgegevens één database en één back-up delen.

Zo hebben we het ook gebouwd in ons eigen product Bijbel Assistent, waar PostgreSQL met pgvector de vector-database is en Redis de caching opvangt (case). Een aparte vectordienst voegde daar alleen infrastructuur toe.

Alle bedragen hieronder zijn op 18 september 2026 van de leverancierssites afgelezen. Voor de euro's gebruiken we de ECB-koers van diezelfde dag, 1,1460 dollar per euro, afgerond en zonder btw.

Route Geschikt voor Prijs per maand Bron
pgvector op een VPS, 1 vCPU / 2 GiB, Amsterdam (AMS3) Tot circa 25.000 passages $12 (circa €10) DigitalOcean droplet-prijzen, regio's
pgvector op een VPS, 2 vCPU / 4 GiB Tot circa 100.000 passages $24 (circa €21) DigitalOcean droplet-prijzen
pgvector op een VPS, 4 vCPU / 8 GiB Tot circa 250.000 passages, index in het geheugen $48 (circa €42) DigitalOcean droplet-prijzen
Beheerde PostgreSQL met pgvector (Supabase Pro, Frankfurt eu-central-1) Wie geen server wil beheren $25 inclusief Micro-instance (1 GB RAM) en 8 GB schijf; Small +$15, Large +$110, met $10 compute-tegoed (circa €22 tot €109) Supabase pricing, regio's
Losse vectordatabase (Pinecone Standard) Volumes waar PostgreSQL het niet meer trekt Minimaal $50 verbruik (circa €44), opslag $0,33 per GB, lees-eenheden $16-$18 en schrijf-eenheden $4-$4,50 per miljoen; EU-regio's beschikbaar Pinecone pricing

Een vuistregel voor de maat: een embedding van 1.536 dimensies is circa 6 KB. Bij 250.000 passages is dat circa 1,5 GB aan vectoren, plus de index en de tekst zelf, en dan wil je 8 GB werkgeheugen.

Het gratis Pinecone Starter-plan draait alleen in AWS us-east-1 en het gratis Supabase-plan pauzeert projecten na een week inactiviteit. Beide zijn bruikbaar om te testen, niet om op te draaien.

De applicatie zelf (API, interface, achtergrondtaken) draait bij kleine corpora op dezelfde VPS. Vanaf enkele duizenden gebruikers zet je hem apart, wat de hostingpost grofweg verdubbelt.

Embeddings: de post die je bijna kunt negeren

Embeddings zijn de getallenreeksen waarmee de database zoekt. Je betaalt ze bij het indexeren en daarna alleen voor wat verandert.

Rekenbasis: een gemiddeld zakelijk document is circa 2.000 tokens, ongeveer vijf pagina's. 500 documenten zijn dan 1 miljoen tokens, 5.000 documenten 10 miljoen en 50.000 documenten 100 miljoen.

Embeddingmodel Prijs per miljoen tokens 1 mln tokens 10 mln tokens 100 mln tokens Bron
OpenAI text-embedding-3-small $0,02 $0,02 $0,20 $2,00 (circa €1,75) OpenAI pricing
OpenAI text-embedding-3-large $0,13 $0,13 $1,30 $13,00 (circa €11,34) OpenAI pricing
Voyage voyage-4 $0,06, eerste 200 miljoen tokens gratis $0 $0 $0 Voyage pricing
Google Gemini Embedding 2 $0,20 standaard, $0,10 batch $0,20 $2,00 $20,00 (circa €17,45), batch $10,00 Google AI pricing
Optioneel: contextuele chunks (Anthropic) $1,02 per miljoen documenttokens, met prompt caching $1,02 $10,20 $102 (circa €89) Anthropic, contextual retrieval

Zelfs 100 miljoen tokens door het duurste model kost minder dan één uur ontwikkelwerk. Verandert 10 procent van het corpus per maand, dan kost de maandelijkse herindexering bij text-embedding-3-small twee dollarcent per miljoen gewijzigde tokens.

Het enige scenario waarin embeddings opvallen op de factuur: je wisselt van embeddingmodel en moet het hele corpus opnieuw indexeren. Ook dan blijft het bij tientallen euro's.

Wat hier wél geld kost, zijn de uren vóór de API-call: PDF's parsen, tabellen intact houden, dubbele versies eruit halen en een chunkgrootte kiezen. Dat zit in de bouwprijs, niet in de embeddingprijs.

Tokens per vraag: drie modellen naast elkaar

Bij elke vraag gaan de opgehaalde passages plus instructies naar het model. Ons rekenvoorbeeld gaat uit van 6.000 inputtokens per vraag (tien passages van 500 tokens plus vraag en instructies) en 400 outputtokens.

De prijzen zijn van 18 september 2026. Claude Sonnet 5 kost $2 input en $10 output per miljoen tokens; Anthropic meldt dat dit introductietarief het standaardtarief is geworden en de aangekondigde verhoging naar $3/$15 per 1 september niet doorgaat (Anthropic pricing).

Antwoordmodel Input / output per miljoen Per vraag 1.000 vragen per maand 5.000 vragen 20.000 vragen Bron
Claude Sonnet 5 $2 / $10 $0,016 (circa €0,014) $16 (circa €14) $80 (circa €70) $320 (circa €279) Anthropic pricing
OpenAI GPT-5.6 Terra $2 / $12 $0,017 (circa €0,015) $16,80 (circa €15) $84 (circa €73) $336 (circa €293) OpenAI pricing
Google Gemini 3.8 Flash $0,75 / $3,75 t/m 31-12-2026, daarna $1,50 / $7,50 $0,006 (circa €0,005) $6 (circa €5) $30 (circa €26) $120 (circa €105) Google AI pricing
Claude Haiku 4.5 (budgetvariant) $1 / $5 $0,008 (circa €0,007) $8 (circa €7) $40 (circa €35) $160 (circa €140) Anthropic pricing

Twee posten die je hier nog bovenop kunt zetten, maar die klein blijven:

  • Herrangschikken (reranker). Voyage rerank-2.5 kost $0,05 per miljoen tokens; twintig kandidaat-passages per vraag zijn circa 10.000 tokens, dus circa $10 per maand bij 20.000 vragen (Voyage pricing).
  • De vraag zelf embedden. 20.000 vragen van 50 tokens is 1 miljoen tokens: twee dollarcent bij text-embedding-3-small.

Prompt caching drukt de rekening verder. De vaste instructies en het uitvoerformaat staan in elke aanroep; bij Claude kost een cache-hit 10 procent van de inputprijs, bij Sonnet 5 dus $0,20 per miljoen (Anthropic pricing).

Wil je de tokenprijzen per model verder uitdiepen, dan staan die op de zusterpagina's over de Claude API-kosten en de OpenAI API-kosten; voor de Gemini API volgt in deze golf een eigen kostenpagina. Deze pagina rekent alleen met wat een RAG-vraag typisch verbruikt.

Evaluatie en onderhoud: de post die de rekening bepaalt

Bij Bijbel Assistent, ons eigen RAG-product, ligt het zwaartepunt vóór het chatvenster: het corpus opschonen en opdelen, embeddings actueel houden en, het meest onderschat, controleren of de assistent de juiste passage ophaalt (case). Dat is geen eenmalige klus.

Wat er maandelijks gebeurt in een RAG-systeem dat goed blijft werken:

  • Evaluatieset opnieuw draaien. Een vaste set vragen met het juiste bronfragment; meten of dat fragment nog in de top-k zit na elke wijziging in corpus, prompt of model.
  • Modelwissels opvangen. Leveranciers halen modellen uit de lucht; Anthropic markeert op zijn prijspagina meerdere modellen als retired (Anthropic pricing). Elke wissel vraagt een nieuwe evaluatieronde.
  • Bronnen bijhouden. Nieuwe mappen, verwijderde documenten, gewijzigde toegangsregels.
  • Prompts bijstellen. Op basis van vragen waar het antwoord naast zat of te lang was.
  • Monitoring en kosten. Tokenverbruik per functie, foutpercentages, latentie.

In onze prijslijst zit dat werk in het onderhoud vanaf €750 per maand plus modelkosten, of in Managed AI vanaf €500 (Basis) tot €2.500 (Premium) per maand, waar kennisbank-beheer en modelkeuze expliciet onder vallen.

Dat is de post die in ons rekenvoorbeeld circa 40 tot 44 procent van jaar één uitmaakt en in jaar twee tussen de 84 en 96 procent. Wie hem schrapt, houdt een systeem over dat langzaam slechter wordt zonder dat iemand het merkt.

Rekenvoorbeeld: drie groottes over twee jaar

Wat volgt is een rekenvoorbeeld, opgebouwd uit de leveranciersprijzen van deze pagina; er zit geen klantmeting in. De uitgangspunten:

  • Documenten van gemiddeld 2.000 tokens; 10 procent van het corpus wijzigt per maand.
  • Embeddings via OpenAI text-embedding-3-small; vectoropslag in pgvector op een VPS in Amsterdam.
  • Antwoordmodel Claude Sonnet 5, 6.000 input- en 400 outputtokens per vraag, zonder caching of reranker.
  • Bouw op de onderkant van onze band voor die vorm; onderhoud op onze band.
  • Euro's circa, tegen de ECB-koers van 18 september 2026, exclusief btw; totalen afgerond op honderden.
Post Klein: 500 documenten, 1.000 vragen per maand Middel: 5.000 documenten, 5.000 vragen per maand Groot: 50.000 documenten, 20.000 vragen per maand
Bouw (eenmalig) €7.500 (RAG-laag rond één bron) €12.500 (RAG-zoeken, meerdere bronnen) €25.000 (RAG als kern van een AI-webapplicatie)
Hosting vectoropslag 1 vCPU / 2 GiB: circa €10 per maand 2 vCPU / 4 GiB: circa €21 per maand 4 vCPU / 8 GiB: circa €42 per maand
Embeddings indexeren (eenmalig) $0,02 $0,20 $2,00 (circa €1,75)
Embeddings herindexeren (maandelijks) Minder dan €0,01 Circa €0,02 Circa €0,17
Tokens per vraag (Sonnet 5) Circa €14 per maand Circa €70 per maand Circa €279 per maand
Evaluatie en onderhoud €500 per maand (software-onderhoud) €750 per maand (onderhoud AI-applicatie) €750 onderhoud plus €1.000 Managed AI Standaard per maand
Jaar 1 Circa €13.800 Circa €22.600 Circa €49.900
Jaar 2 Circa €6.300 Circa €10.100 Circa €24.900
Aandeel modeltokens in jaar 1 Circa 1,2 procent Circa 3,7 procent Circa 6,7 procent

Bronnen per rij: onze prijsbanden op AI software laten maken en Managed AI, DigitalOcean, OpenAI, Anthropic en de ECB-koers.

Wat het rekenvoorbeeld laat zien

  • De bouw domineert jaar één, het onderhoud jaar twee. Techniekkosten (hosting, embeddings, tokens) blijven in elke variant onder de 10 procent.
  • Tien keer meer documenten kost geen tien keer meer. Van klein naar middel stijgt jaar één met circa 64 procent, terwijl het corpus vertienvoudigt.
  • Het model wisselen verandert de uitkomst nauwelijks. Met Gemini 3.8 Flash in plaats van Sonnet 5 zakt jaar één van de grote variant van circa €49.900 naar circa €47.800, minder dan 5 procent.

Wie op de tokenprijs een leverancier kiest, optimaliseert dus de kleinste post. De vraag die er toe doet is wat de bouw en het onderhoud kosten, en of de evaluatieset erin zit.

Waar je wél op bespaart, en waar niet

Bezuinigen kan, maar niet overal met hetzelfde effect.

Wel:

  • Een lichter model voor eenvoudige vragen. Haiku 4.5 halveert de tokenpost ten opzichte van Sonnet 5; Gemini 3.8 Flash deelt hem door bijna drie zolang het promotietarief loopt.
  • Prompt caching op de vaste instructies. Cache-hits kosten bij Claude 10 procent van de inputprijs.
  • Batch-embeddings bij Google. Halveert de embeddingpost, die toch al klein is.
  • Het gratis Voyage-tegoed. 200 miljoen tokens is ruim voldoende voor 50.000 documenten en meerdere herindexeringen.
  • pgvector in plaats van een losse vectordienst. Scheelt minimaal $50 per maand aan verplicht verbruik en een extra leverancier.

Niet:

  • De evaluatieset. Zonder testset weet je niet of het systeem na een modelwissel nog dezelfde passages vindt.
  • Bronvermelding vanaf dag één. Achteraf inbouwen betekent de ophaallaag opnieuw ontwerpen.
  • Documentvoorbereiding. Slechte parsing van PDF's en tabellen is de meest voorkomende oorzaak van foute antwoorden, en geen model repareert dat.
  • Toegangsregels. Een assistent die iedereen alles laat zien, gaat na de eerste vraag over salarissen uit.

RAG-kosten naast de alternatieven

RAG is één manier om AI op eigen data te krijgen. De kostenstructuur van de alternatieven is anders, niet per se lager.

  • Een zakelijk abonnement met bedrijfsdata. ChatGPT Enterprise, Copilot of Claude Enterprise rekenen per gebruiker per maand; bij tientallen gebruikers loopt dat op tot bedragen die vergelijkbaar zijn met het onderhoud van een eigen systeem, zonder eigen ophaallaag of evaluatieset. De afweging staat in ChatGPT Enterprise versus private AI.
  • Fine-tuning. Hoge kosten vooraf en bij elke inhoudelijke wijziging, lage kosten per vraag; zinvol voor stijl en formaat, niet voor feitenkennis die verandert. Zie RAG versus fine-tuning.
  • Een koppeling via MCP. Gaat het om live cijfers uit je boekhouding, CRM of WMS in plaats van documenten, dan is een MCP-server de betere route; die kostenopbouw staat op wat kost een MCP-server.
  • Alles in de prompt. Onder circa 200.000 tokens aan kennis heb je geen RAG nodig; dan betaal je alleen tokens, met caching.

Het bredere overzicht van alle vormen, van chatbot tot AI-platform, staat op wat kost AI voor bedrijven. De index AI-modellen vergelijken zet alle kostenpagina's van dit cluster bij elkaar.

Wat we nodig hebben voor een vaste prijs

Een vaste prijs vraagt zes antwoorden. Meer niet.

  1. Welke bronnen, hoeveel documenten en in welke vorm (PDF, SharePoint, mail, scans)?
  2. Hoe vaak verandert de inhoud?
  3. Hoeveel gebruikers en hoeveel vragen per maand verwacht je?
  4. Wie mag wat zien?
  5. Waar moet het draaien: EU-cloud, eigen VPC of on-premise?
  6. Moet elk antwoord naar een bron verwijzen?

Onze default voor de antwoordlaag is Claude, met een Nederlands of Europees alternatief als de hosting-eis daarom vraagt; welk model het wordt, leggen we in de scoping vast en zie je terug in de modelkostenpost.

Wil je die zes vragen samen doorlopen? Via de contactpagina of telefonisch op 085 016 0118 weet je binnen een dag in welke band je zit.

Liever eerst zelf rekenen? De prijsindicatie doet dat in een paar minuten.

Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.

Tags:#RAG#Kosten#LLM#MKB
Delen:
Veelgestelde vragen

Antwoorden over dit artikel

Wat kost een RAG-chatbot op eigen documenten minimaal?

Bij CleverTech AI begint een RAG-laag rond één afgebakende kennisbron bij €7.500 eenmalig; hosting en modelgebruik komen daar met doorgaans €150 tot €600 per maand bovenop. Meerdere bronnen, toegangsregels en een evaluatieset brengen je in de band vanaf €12.500. Onderhoud komt daar los bij, vanaf €500 tot €750 per maand.

Waarom zijn de modelkosten zo klein in het rekenvoorbeeld?

Een RAG-vraag stuurt alleen de opgehaalde passages naar het model, geen hele documenten. Bij 6.000 input- en 400 outputtokens kost een vraag op Claude Sonnet 5 circa anderhalve dollarcent. Zelfs bij 20.000 vragen per maand blijft dat onder de €300, tegenover €750 of meer per maand aan onderhoud.

Wat kost het hosten van een vectordatabase?

Met pgvector in PostgreSQL op een VPS in Amsterdam kost de database $12 tot $48 per maand, afhankelijk van het geheugen dat de index nodig heeft. Een beheerde PostgreSQL met pgvector bij Supabase in Frankfurt begint bij $25 per maand. Een losse vectordienst als Pinecone Standard rekent minimaal $50 verbruik per maand plus opslag en lees- en schrijfeenheden.

Wat kosten embeddings voor 50.000 documenten?

Bij documenten van gemiddeld 2.000 tokens is dat 100 miljoen tokens. OpenAI text-embedding-3-small rekent daar $2 voor, text-embedding-3-large $13 en Google Gemini Embedding 2 $20, of $10 in batch. Bij Voyage vallen die 100 miljoen tokens binnen het gratis tegoed van 200 miljoen.

Hoeveel kost het bijwerken van de index als documenten veranderen?

Je betaalt alleen voor de gewijzigde tokens. Verandert 10 procent van een corpus van 100 miljoen tokens per maand, dan kost de herindexering bij text-embedding-3-small twintig dollarcent. De echte kosten van bijwerken zitten in de automatisering ervan en in het opnieuw draaien van de evaluatieset, en die horen bij het onderhoud.

Is Gemini 3.8 Flash de goedkoopste keuze voor RAG?

Op tokenprijs wel: $0,75 input en $3,75 output per miljoen tokens tot en met 31 december 2026, daarna $1,50 en $7,50. In het rekenvoorbeeld scheelt het op de grote variant minder dan 5 procent van de jaarkosten, omdat tokens hoe dan ook een kleine post zijn. Kies het model op antwoordkwaliteit in jouw taal en domein, niet op de tokenprijs.

Wat zit er in het onderhoud van een RAG-systeem?

De evaluatieset opnieuw draaien na elke wijziging in corpus, prompt of model, modelwissels opvangen als een leverancier een versie uitfaseert, bronnen en toegangsregels bijhouden, prompts bijstellen op basis van foute antwoorden, en monitoring van verbruik en fouten. Bij ons zit dat in onderhoud vanaf €750 per maand plus modelkosten, of in Managed AI vanaf €500 per maand.

Kan ik het onderhoud zelf doen om kosten te besparen?

Ja, de broncode, prompts en evaluatieset zijn van jou en je zit niet aan CleverTech AI vast. Reken wel met de uren: een maandelijkse evaluatieronde, een modelwissel per kwartaal en het bijhouden van bronnen kosten een ontwikkelaar al snel een dag of meer per maand. Software-onderhoud van €500 tot €750 per maand is meestal goedkoper dan die interne uren.

Wat is het verschil in kosten tussen RAG en fine-tuning?

Fine-tuning kost vooraf veel, bij elke inhoudelijke wijziging opnieuw, en daarna weinig per vraag. RAG kost vooraf de bouw van de ophaallaag en daarna een kleine tokenpost per vraag, terwijl een nieuw document direct meetelt. Voor kennis die verandert is RAG vrijwel altijd goedkoper; voor een vaste stijl of een vast uitvoerformaat kan fine-tuning lonen.

Is een ChatGPT Enterprise-abonnement goedkoper dan een eigen RAG-systeem?

Bij een handjevol gebruikers meestal wel, omdat je alleen per seat betaalt en niets bouwt. Bij tientallen gebruikers komen de seatkosten in de buurt van het onderhoud van een eigen systeem, zonder dat je een eigen ophaallaag, bronvermelding, toegangsregels of evaluatieset hebt. De afweging hangt af van het aantal gebruikers en van de eisen aan herleidbaarheid en hosting.

Moet ik een aparte vectordatabase kopen?

Meestal niet. Met de pgvector-extensie zoekt je bestaande PostgreSQL-database zelf op betekenis, dus tekst, vectoren en gebruikersgegevens delen één back-up en één beheerlaag; ons eigen product Bijbel Assistent draait zo. Een aparte vectordienst loont pas als het volume PostgreSQL te boven gaat, en kost bij Pinecone Standard minimaal $50 per maand.

Wat kost het als ik later van AI-model wil wisselen?

Het antwoordmodel wisselen is een configuratiewijziging plus een evaluatieronde, geen herbouw; dat valt binnen het onderhoud. Wisselen van embeddingmodel betekent het hele corpus opnieuw indexeren, wat bij 100 miljoen tokens tussen de $2 en $20 aan API-kosten is. De uren voor de evaluatie zijn in beide gevallen de grootste post.

Blijven mijn documenten in de EU bij een RAG-systeem?

De vectoropslag en de applicatie kun je volledig in de EU draaien: een VPS in Amsterdam of Frankfurt, of een beheerde database in Frankfurt. Het antwoordmodel is de uitzondering: de Claude API en de OpenAI API zijn standaard wereldwijd gerouteerd en een EU-endpoint loopt via een cloudplatform met een toeslag. Welke route past, hangt af van je hosting-eis en leggen we in de scoping vast.

Hoe krijg ik een vaste prijs voor AI op mijn eigen data?

Met zes antwoorden: welke bronnen en hoeveel documenten, hoe vaak de inhoud verandert, hoeveel gebruikers en vragen per maand, wie wat mag zien, waar het moet draaien en of elk antwoord naar een bron moet verwijzen. Daarna volgt een scoping en een vaste prijs. Bel 085 016 0118 of gebruik de prijsindicatie op de site voor een eerste bandbreedte.

Volgende stap

Wat dit in jouw situatie betekent, weet je snel

Je legt je vraag voor, wij zeggen wat haalbaar is, wat het ongeveer kost en wat de slimste eerste stap is. Ook als dat betekent: nog even niet bouwen.

Liever eerst schriftelijk? Stel je vraag via het formulier.
Liever eerst zelf checken? Download de AI Readiness Checklist.
5,0op Google
  • Zeer fijne samenwerking! Professioneel, deskundig en vooral erg oplossingsgericht. Ze denken goed mee, communiceren duidelijk en leveren kwaliteit. Een betrouwbare en innovatieve techpartner die ik zeker kan aanbevelen!

    Spark O.

  • Heel goed geholpen duidelijke uitleg en werken heel hard voor je en denken heel goed mee wat belangrijk is. Duidelijk heel veel kennis van zaken. Echt een aanrader.

    Maarten B.

Blijf op de hoogte

Ontvang praktische AI-inzichten in je inbox. Geen spam, alleen waardevolle content.

Geen spam · max 2x per maand · altijd opzegbaar

Je gegevens worden alleen gebruikt voor het verzenden van de nieuwsbrief. Uitschrijven kan op elk moment.

Van kennis naar resultaat

Wat betekent dit voor jouw bedrijf?

We denken vrijblijvend mee over wat dit concreet zou opleveren — vaste prijs, vaste deadline.