Kort antwoord
Voor een klantenservice-chatbot begin je met een klein, snel model en escaleer je alleen de gesprekken die het nodig hebben: bij ons is dat Claude Haiku 4.5 als eerste laag en Claude Sonnet 5 als tweede. Op één gespreksvolume van acht beurten kost dat circa €29 (Haiku) tot €57 (Sonnet) per 1.000 gesprekken; GPT-5.6 Luna, Gemini 3.8 Flash en Mistral Small 4 zitten daar met €6, €17 en €3 onder, GPT-5.6 Terra met €61 erboven. Het modelverschil is klein tegenover de bouw (bij ons vanaf €2.500 eenmalig of €249 per maand); kies daarom op tool use, toonbeheersing, EU-route en overdracht naar een mens, niet op de tokenprijs alleen.
Van lezen naar doen.
Op hetzelfde gesprek van acht beurten kost het duurste model in deze vergelijking twintig keer zoveel als het goedkoopste: circa €61 tegen €3 per 1.000 gesprekken. En toch is die factor twintig zelden de reden dat een klantenservice-chatbot slaagt of faalt.
Bij 2.000 gesprekken per maand praat je over een modelfactuur van €7 tot €115 exclusief btw. Het maandbedrag voor hosting en support van de bot zelf is groter dan dat.
Deze pagina gaat over de keuze die daaronder ligt: welk model je achter de chatbot zet, op welke criteria, en hoe je twee modellen combineert zodat je zelden het dure nodig hebt. Wil je de bredere afweging voor je hele bedrijf, begin dan bij welk AI-model past bij mijn bedrijf; alle vraagpagina's over modellen staan in de index AI-modellen vergelijken.
De grens met onze dienst: op /diensten/ai-chatbots staat wat het kost om zo'n bot te laten bouwen. Hier staat alleen wat erachter draait.
Vijf kandidaten en waarom juist deze vijf
Een klantenservice-bot heeft geen frontier-model nodig. Het werk is kort, repetitief en sterk gestuurd door een kennisbank, dus de kandidaten zijn de kleine en middelgrote modellen van elke maker.
| Model | Maker | Input / output per miljoen tokens | Cache read / cache write | Tool use (function calling) | EU-route voor verwerking |
|---|---|---|---|---|---|
| Claude Haiku 4.5 | Anthropic | $1 / $5 | $0,10 / $1,25 | Ja | Via Google Cloud Vertex AI of Amazon Bedrock met EU-regio (+10%); Anthropic zelf biedt alleen wereldwijd of US-only |
| Claude Sonnet 5 | Anthropic | $2 / $10 | $0,20 / $2,50 | Ja | Zelfde route als Haiku |
| GPT-5.6 Luna | OpenAI | $0,20 / $1,20 | $0,02 / $0,25 | Ja | Regionaal endpoint met dataresidentie, 10% toeslag |
| GPT-5.6 Terra | OpenAI | $2 / $12 | $0,20 / $2,50 | Ja | Zelfde route als Luna |
| Gemini 3.8 Flash | $0,75 / $3,75 (actietarief tot en met 31 december 2026; vanaf 2027 het dubbele) | $0,075 impliciet | Ja | Via Google Cloud Vertex AI met EU-regio | |
| Mistral Small 4 | Mistral AI (Frankrijk) | $0,15 / $0,60 | tot 90% korting op gecachete input | Ja | Eigen EU-endpoint, 10% toeslag; open-weight (Apache 2.0), dus ook zelf te hosten |
Bronnen per rij: claude.com/pricing voor Haiku 4.5 en Sonnet 5 (inclusief de opmerking dat US-only inferentie 1,1 keer het tarief kost), de OpenAI-prijspagina voor Luna en Terra en de 10% opslag op regionale endpoints, de Gemini API-prijspagina voor 3.8 Flash inclusief de actieprijs tot en met 31 december 2026, de Mistral API-prijspagina voor Small 4 en de cachekorting, en de documentatie over regionale inferentie voor de EU-toeslag van 1,1 keer op input, output, cache reads en cache writes. Alles afgelezen op 18 september 2026, in dollars en exclusief btw.
Tool use staat bij alle vijf in de documentatie: Anthropic, OpenAI, Google en Mistral. Het onderscheid zit niet in óf een model een orderstatus kan opvragen, maar in hoe betrouwbaar het de juiste tool met de juiste parameters kiest bij een slordig getypte vraag.
Niet in de tabel: Claude Fable 5.1, GPT-6 Astra en Gemini 3.1 Pro. Voor een chatbot betaal je daar per token circa drie keer meer (Gemini 3.1 Pro $2 / $12 tegen 3.8 Flash $0,75 / $3,75, Google) tot ruim tachtig keer meer (GPT-6 Astra $50 output, OpenAI, tegen Mistral Small 4 $0,60) voor redeneerkracht die een klant met een retourvraag nooit aanspreekt; het verschil tussen de Claude-klassen staat op Haiku, Sonnet, Opus of Fable.
De acht criteria, in de volgorde waarin ze pijn doen
Wie een model kiest op de prijslijst, kiest op het minst belangrijke criterium. Dit is de volgorde die wij aanhouden bij het bouwen, met per criterium wat je ermee test.
1. Overdracht naar een mens. Elk model hallucineert onder onzekerheid; het verschil zit in hoe goed het model "dit weet ik niet" kan zeggen en of jouw bot daar iets mee doet. Test dit met vijf vragen die bewust buiten de kennisbank vallen.
2. Tool use voor orderstatus en klantgegevens. De bot moet een ordernummer herkennen, de juiste koppeling aanroepen en het antwoord in gewone taal teruggeven. Test met ordernummers met een typefout, twee ordernummers in één bericht en een klant die het nummer niet weet.
3. Toonbeheersing. Een klantenservice-bot moet de huisstijl volgen, geen emoji's uitdelen als jouw merk dat niet doet, en bij een boze klant niet in verontschuldigingen verdrinken. Alle vijf modellen sturen via de systeemprompt; de kleinere modellen houden zich er in onze ervaring minder strak aan bij lange gesprekken.
4. Nederlands. Geen van de makers publiceert een cijfer voor Nederlands; de bronnen daarvoor staan op welk AI-model schrijft het beste Nederlands. De dichtstbijzijnde onafhankelijke meting van een chatbot is die van Smals Research (2026): een RAG-chatbot voor burgervragen waarin het beste model, Gemini, 77% haalde op Frans tegen 72% op Nederlands, en waarin Claude Sonnet bij vergelijkbare nauwkeurigheid soms Engelse termen invoegde, vaker in het Nederlands dan in het Frans.
Onze eigen blinde test (18 september 2026, alleen Claude-modellen, vijf zakelijke teksten) gaf Sonnet 5 92 van de 100 punten en Haiku 4.5 80, met 11 van de 20 op de klachtmail. Voor een chatbot betekent dat: Haiku mag kennisbankvragen beantwoorden, maar een klacht gaat direct naar Sonnet 5.
5. Latency. Een klant wacht hooguit een paar seconden op een eerste woord. Anthropic positioneert Haiku 4.5 als "fastest, most cost-efficient model" (claude.com/pricing); Mistral Small 4 heeft volgens de modelkaart 119 miljard parameters waarvan 6,5 miljard actief per token, wat het licht maakt om te draaien.
Harde milliseconden geven de makers niet, dus meet het op je eigen prompt met streaming aan.
6. Kosten per gesprek. Pas op zes, en dan nog vooral als argument om het kleine model voorop te zetten. De tabel staat hieronder.
7. EU-route en verwerkersovereenkomst. Bij elk van de vijf kun je een verwerkersovereenkomst sluiten; de vraag is waar de tokens verwerkt worden en wat de EU-optie kost. Details per maker staan in de tabel hierboven en op welk AI-model is AVG-proof.
8. Context caching. Een chatbot stuurt bij elke beurt de systeemprompt, de kennisbankpassages en de hele voorgeschiedenis opnieuw mee. Zonder caching betaal je dat elke beurt vol; met caching kost de herhaling een tiende, en dat halveert de gespreksprijs bij alle vijf.
Wat een gesprek kost: vijf modellen op hetzelfde volume
Wat volgt is een rekenvoorbeeld op de leveranciersprijzen uit de eerste tabel; het zijn geen gemeten kosten uit een klantproject. We nemen bewust hetzelfde gespreksvolume als onze pagina over de Claude API-kosten, zodat je de tabellen naast elkaar kunt leggen.
Stel een gesprek van acht beurten: een vast voorstuk van 6.000 tokens (systeemprompt, toolbeschrijvingen, kennisbankpassages) dat na de eerste beurt uit de cache komt, per beurt een klantvraag van 100 tokens en een antwoord van 250 tokens. Opgeteld per gesprek: 10.600 verse inputtokens door de groeiende geschiedenis, 48.000 gecachete tokens, één keer 6.000 tokens wegschrijven naar de cache en 2.000 tokens uitvoer.
| Model | Per gesprek | Per 1.000 gesprekken | Per 1.000 in euro (circa, ex btw) | Per 1.000 in euro (circa, met 21% btw) |
|---|---|---|---|---|
| Mistral Small 4 (wereldwijd endpoint) | $0,0035 | $3,51 | €3,06 | €3,71 |
| Mistral Small 4 (EU-endpoint, +10%) | $0,0039 | $3,86 | €3,37 | €4,08 |
| GPT-5.6 Luna | $0,0070 | $6,98 | €6,09 | €7,37 |
| Gemini 3.8 Flash (actieprijs) | $0,0191 | $19,05 | €16,62 | €20,11 |
| Gemini 3.8 Flash (prijs vanaf 1 januari 2027) | $0,0381 | $38,10 | €33,25 | €40,23 |
| Claude Haiku 4.5 | $0,0329 | $32,90 | €28,71 | €34,74 |
| Claude Sonnet 5 | $0,0658 | $65,80 | €57,42 | €69,48 |
| GPT-5.6 Terra | $0,0698 | $69,80 | €60,91 | €73,70 |
De eurokolommen zijn omgerekend op de ECB-referentiekoers van dezelfde dag, 18 september 2026, toen een euro 1,1460 dollar deed. Bij Gemini rekenen we met impliciete caching zonder schrijfkosten, bij Mistral met de cachekorting op de herhaalde input en zonder schrijfkosten, omdat de prijspagina die niet apart noemt; bij Anthropic en OpenAI telt één cache write per gesprek mee.
Drie dingen vallen op. Terra kost meer dan Sonnet 5 door het hogere outputtarief ($12 tegen $10), terwijl Luna en Small 4 zo goedkoop zijn dat de modelfactuur bij duizenden gesprekken onder de €10 blijft.
Ten tweede: de actieprijs van Gemini 3.8 Flash loopt af op 31 december 2026, en dan verdubbelt de gespreksprijs. Een keuze die op die prijs leunt, moet je in januari opnieuw maken.
Ten derde: het verschil tussen Haiku 4.5 en Sonnet 5 is per 1.000 gesprekken circa €29. Dat is het bedrag dat een routingpatroon je terugverdient, en het is tegelijk het bedrag dat je bespaart op elke honderd gesprekken die niet naar een medewerker hoeven.
Het routingpatroon: klein model eerst, escaleren op signaal
Wij bouwen een klantenservice-bot niet op één model. De eerste laag is een klein, snel model dat elke beurt beantwoordt; een tweede, sterker model komt er alleen bij als de eerste laag een signaal afgeeft.
Zo werkt de trap in de praktijk:
- Laag 1, Claude Haiku 4.5: beantwoordt alles wat in de kennisbank staat en voert de standaard-tools uit (orderstatus, openingstijden, retourbeleid).
- Escalatiesignaal: lage confidence in het eigen antwoord, een vraag die twee of meer tools tegelijk vraagt, elke klacht of boze toon (Haiku scoorde 11 van de 20 op de klachtmail in onze test), of een gesprek dat na drie beurten nog niet is opgelost.
- Laag 2, Claude Sonnet 5: neemt het gesprek over met de volledige geschiedenis en dezelfde tools, en mag langer redeneren.
- Laag 3, een mens: bij elk signaal dat laag 2 niet oplost, of direct bij onderwerpen die je vooraf hebt uitgesloten (annuleringen boven een bedrag, juridische vragen, gevoelige gegevens).
De overdracht naar een mens is geen fallback maar een ontwerpbeslissing. Het transcript, de klantcontext en de reden van overdracht gaan mee; zonder dat begint de medewerker opnieuw en heeft de klant de bot voor niets doorlopen.
Waarom twee Claude-modellen en niet twee makers? Omdat de systeemprompt, de toolbeschrijvingen en de cache tussen Haiku en Sonnet ongewijzigd meegaan.
Combineer je Mistral met Claude, dan onderhoud je twee prompts, twee tool-schema's en twee verwerkersovereenkomsten.
Wie de trap nog een stap verder wil, met een agent die zelf een retour aanmaakt of een afspraak verzet, komt bij de platformkeuze uit: Claude, OpenAI of Copilot voor een bedrijfsagent.
Rekenvoorbeeld: 2.000 gesprekken per maand
Rekenvoorbeeld op de tabel hierboven, geen klantcijfer. Stel een webshop met 2.000 chatgesprekken per maand, elk van het volume uit de tabel.
| Inrichting | Modelkosten per maand (dollar) | Circa in euro, exclusief btw |
|---|---|---|
| Alles op Claude Sonnet 5 | $131,60 | €114,83 |
| Alles op Claude Haiku 4.5 | $65,80 | €57,42 |
| Trap: alles via Haiku 4.5, 20% ook via Sonnet 5 | $92,12 | €80,38 |
| Alles op Gemini 3.8 Flash (actieprijs) | $38,10 | €33,25 |
| Alles op GPT-5.6 Luna | $13,96 | €12,18 |
| Alles op Mistral Small 4 (EU-endpoint) | $7,72 | €6,74 |
In de trap rekenen we de 400 geëscaleerde gesprekken bewust dubbel (volledig op Haiku én volledig op Sonnet); in werkelijkheid neemt Sonnet halverwege over en valt het bedrag lager uit.
Zet dat naast wat de bot zelf kost. Bij CleverTech AI begint een chatbot laten maken bij €2.500 eenmalig voor maatwerk met een RAG-kennisbank, of bij €249 per maand als je de kant-en-klare variant kiest; bij maatwerk komt daar €350 per maand hosting en support bij, en de bot is gekoppeld aan je CRM en de officiële WhatsApp Business API, met overdracht naar een medewerker inclusief transcript en klantcontext (prijsband uit onze dienstpagina, september 2026).
De modelfactuur van €7 tot €115 per maand is dus in elke inrichting kleiner dan de hostingregel. Wie het beheer uitbesteedt, rekent bovendien met Managed AI: Basis kost €500 per maand, Standaard €1.000, en Premium ligt tussen €1.500 en €2.500; het bijhouden van de kennisbank en de modelupdates zitten in die retainer.
Het modelverschil van een paar tientjes verdient daarom nooit een concessie op tool use of overdracht. Andersom wel: één geëscaleerde klacht die goed wordt afgehandeld, is meer waard dan de maandbesparing van het goedkoopste model.
Hallucinaties: het model is de helft, de kennisbank de andere helft
Geen van de vijf modellen "weet" jouw retourtermijn. Zonder kennisbank verzint elk model een plausibel klinkende termijn, en het verschil tussen de modellen zit alleen in hoe overtuigend de fout klinkt.
Vier maatregelen doen meer dan de modelkeuze:
- RAG op eigen bronnen: de bot antwoordt alleen op basis van opgehaalde passages en citeert ze intern; staat het er niet, dan zegt hij dat.
- Tools voor feiten: orderstatus, voorraad en levertijd komen uit een koppeling, nooit uit het model zelf.
- Verboden onderwerpen in de systeemprompt: prijsafspraken, medische of juridische uitspraken, toezeggingen over compensatie.
- Confidence-drempel: onder de drempel geen antwoord maar een overdracht, en dat loggen.
Hoe wij zo'n kennisbank inrichten staat op onze pagina over RAG op eigen data, inclusief de vraag waarom niet elk document in de prompt hoort.
AI Act en verwerkersovereenkomst: wat de modelkeuze wél en niet verandert
Sinds 2 augustus 2026 moet een klant weten dat hij met AI praat, bij de eerste interactie en duidelijk zichtbaar. Dat geldt onafhankelijk van het model; de volledige checklist per chatbotvorm staat op valt mijn chatbot onder de AI Act.
De modelkeuze verandert wel drie dingen op de AVG-kant:
- Waar de tokens verwerkt worden: Mistral en OpenAI bieden een EU-endpoint tegen 10% opslag, Google een EU-regio op Vertex AI, Anthropic een EU-regio uitsluitend via Vertex AI of Bedrock (met dezelfde 10%).
- Met wie je de verwerkersovereenkomst sluit: bij de Claude-route via Google Cloud is dat Google, niet Anthropic; bij een eigen Mistral-server ben je het zelf.
- Wat je moet documenteren: welk model, welke versie, welke datum; een modelwissel is een wijziging in je verwerkingsregister.
Voor een chatbot met alleen openingstijden en retourbeleid is dit een formaliteit. Zodra de bot ordergegevens ophaalt, verwerkt hij persoonsgegevens, en dan telt de EU-route mee in de modelkeuze.
Waar wij staan, en waar Claude niet de keuze is
Wij bouwen Claude-first: Haiku 4.5 voorop voor kennisbankvragen en tools, Sonnet 5 voor klachten, toon en alles wat escaleert. De reden is geen prijs maar de combinatie van tool-betrouwbaarheid, de testscore van Sonnet 5 op Nederlandse zakelijke tekst en één prompt die ongewijzigd meegaat tussen de twee lagen.
Eerlijk erbij: onze Nederlandse test vergeleek alleen Claude-modellen onderling en bewijst niet dat Claude beter Nederlands schrijft dan GPT, Gemini of Mistral.
Vier situaties waarin we een ander model achter de chatbot zetten:
- EU-verwerking is een harde eis en Vertex AI of Bedrock past niet in je landschap: dan Mistral Small 4 op het EU-endpoint, of zelf gehost.
- Zeer hoog volume met eenvoudige vragen (tienduizenden gesprekken per maand over openingstijden en trackingnummers): GPT-5.6 Luna of Mistral Small 4 als eerste laag, met Sonnet 5 als escalatie.
- Je bedrijf draait volledig op Google Workspace en Google Cloud: Gemini 3.8 Flash houdt verwerking, facturatie en verwerkersovereenkomst in één contract, met de kanttekening over de actieprijs.
- De chatbot leeft in Teams of Copilot Studio: dan volgen we de Microsoft-route; wij leveren Microsoft-licenties als reseller via Pax8 en zeggen dat er eerlijk bij.
Eén situatie waarin we geen model kiezen maar afraden: als er geen kennisbank is en niemand tijd heeft die bij te houden. Dan is live chat met een medewerker de betere keuze, ongeacht het model.
Hoe je de keuze in een middag test
Je hoeft niet te geloven wat hier staat. Zet dezelfde twintig gesprekken door twee of drie kandidaten en beoordeel ze op de acht criteria hierboven.
- Vijf gesprekken met een orderstatus-vraag, waarvan twee met een fout ordernummer.
- Vijf gesprekken die buiten de kennisbank vallen (test de overdracht).
- Vijf boze klanten (test de toon).
- Vijf lange gesprekken van tien beurten (test toonvastheid en caching).
Meet per model de fouten, de overdrachten en de tijd tot het eerste woord, en zet daar de gespreksprijs uit de tabel naast. Wil je dat wij die test met je draaien op je eigen kennisbank, bel dan 085 016 0118 of plan een afspraak via contact; de uitkomst is een modeladvies met de prijs per 1.000 gesprekken voor jouw volume.
Wanneer deze tabel verandert
De prijzen in dit artikel zijn van 18 september 2026 en veranderen op drie bekende momenten: de actieprijs van Gemini 3.8 Flash eindigt op 31 december 2026, en bij Anthropic en OpenAI verschijnt doorgaans elk kwartaal een nieuwe versie in de kleine klasse. De tabel op deze pagina houden we bij; de overige prijzen per maker staan op het kostenoverzicht van AI voor bedrijven, en voor de OpenAI-kant op wat kost de OpenAI API.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










