Kort antwoord
Geen enkele modelmaker publiceert een prestatiecijfer voor Nederlands: de meertalige tabellen van Anthropic en OpenAI bevatten allebei veertien talen, en Nederlands zit in geen van beide. De enige meting op échte burgervragen is die van Smals Research (2026), waar Gemini op Nederlands 72 procent haalde tegen 77 procent op Frans; de doorlopende vergelijking tussen aanbieders staat op de Nederlandse EuroEval-leaderboard. In onze eigen blinde test van 18 september 2026 scoorde Claude Fable 5.1 100 van de 100 punten op vijf Nederlandse zakelijke teksten, gevolgd door Opus 5 (97), Sonnet 5 (92) en Haiku 4.5 (80). Die test vergelijkt alleen Claude-modellen onderling en zegt dus niets over ChatGPT, Gemini, Copilot of Mistral.
Van lezen naar doen.
Anthropic publiceert een tabel met meertalige scores voor veertien talen, van Spaans tot Yoruba, uitgedrukt als percentage van het Engelse niveau (Anthropic, 2026). Nederlands staat er niet in.
Bij OpenAI is het hetzelfde beeld. De multilingual-MMLU-set in hun eigen simple-evals-repository telt precies veertien talen, en Nederlands ontbreekt ook daar (OpenAI simple-evals, afgelezen 18 september 2026).
Wie dus wil weten welk model het beste Nederlands schrijft, kan dat bij de makers niet opzoeken. Daarom hebben we het op 18 september 2026 zelf gemeten, met vijf zakelijke teksten die een Nederlands bedrijf werkelijk verstuurt.
Wat de makers wél en niet over Nederlands zeggen
Deze tabel is onze eigen inventarisatie, per rij nagekeken op de pagina van de leverancier op 18 september 2026.
| Maker | Wat er over Nederlands gepubliceerd is | Prestatiecijfer voor Nederlands? | Bron |
|---|---|---|---|
| Anthropic (Claude) | Meertalige tabel met veertien talen, relatief ten opzichte van Engels, op een door mensen vertaalde MMLU | Nee, Nederlands staat niet in de tabel | platform.claude.com |
| OpenAI (GPT) | Multilingual MMLU met veertien talen in de eigen evaluatierepository | Nee, Nederlands zit niet in de set | github.com/openai/simple-evals |
| Mistral AI | Nederlands staat expliciet in de lijst Europese talen, met "strong expected performance" | Nee, de pagina geeft geen cijfers per taal | docs.mistral.ai |
| Microsoft (Copilot) | Geen taalprestatietabel; Copilot is een laag, geen model | Niet van toepassing, zie hieronder | learn.microsoft.com |
Google publiceert wel taallijsten rond de Gemini-API, maar wij vonden op 18 september 2026 geen tabel met prestaties per taal in die documentatie.
Copilot is een apart geval. Microsoft schrijft zelf: "By default, Copilot uses a real-time router to adjust the underlying model it uses based on your prompt" (Microsoft Learn, 2026).
De vraag "schrijft Copilot goed Nederlands" is dus in werkelijkheid de vraag welk model de router die dag koos. Welke modellen daaronder hangen en wat dat voor je EU-route betekent, staat in ons overzicht welke AI-modellen er zijn en wie erachter zit.
Wat onafhankelijke Nederlandse metingen wél laten zien
Er is geen leverancierscijfer, maar er is wel onafhankelijk werk. Drie bronnen, en ze meten alle drie iets anders.
Smals Research, maart 2026. Het onderzoeksteam van Smals, de ICT-organisatie van de Belgische sociale zekerheid, evalueerde een RAG-chatbot voor burgervragen in het Frans en het Nederlands, met GPT-5, Gemini, o3 en Claude Sonnet. In de eindevaluatie haalde de beste score, van Gemini, 77 procent op Frans tegen 72 procent op Nederlands.
Belangrijker dan die vijf punten is hun conclusie. Eerdere ronden lieten veel grotere gaten zien, 95 tegen 82 procent en 82 tegen 69 procent, maar na grondiger onderzoek schrijven ze: "Het prestatieverschil is dus minder groot dan we dachten" (Katy Fokou, Smals Research, 2026).
EuroEval, doorlopend. Dit is wél een lopende vergelijking tussen aanbieders: de Nederlandse leaderboard rangschikt actuele frontier-modellen over negen Nederlandse datasets, van sentiment en named entity recognition tot begrijpend lezen en samenvatten. Op 18 september 2026 stond Gemini 3.7 Flash bovenaan met een rank score van 1,24, vóór GPT-5.6 Sol (1,43) en Claude Sonnet 4.5 (1,55); lager is beter (EuroEval, Dutch leaderboard, afgelezen 18 september 2026).
Het raamwerk heette tot voor kort ScandEval, draait op versie 18.1.0 en wordt onderhouden door Dan Saattrup Smart bij het Alexandra Institute, met financiering uit het EU Horizon-project TrustLLM (EuroEval, 2026).
Nederlandse staatsexamens, november 2024. Een losse test op écht Nederlands examenmateriaal is inmiddels bijna twee jaar oud: twee benchmarkruns van 329 en 104 examenvragen uit VMBO-, HAVO- en VWO-examens Nederlands, met o1-mini op 66,75 procent, GPT-4o op 62,32 procent en Claude 3.5 Sonnet op 61,28 procent (Maarten Sukel, 2024).
Die scores zijn onbruikbaar voor een keuze in 2026, want geen van die modellen is nog actueel. En wat de drie bronnen samen niet meten, is zakelijk schrijfwerk: geen van de negen Nederlandse EuroEval-datasets kijkt of een model een verzendbare offerte of klachtmail oplevert.
Een Nederlands model is overigens geen oplossing voor dat gat. GPT-NL scoorde op de Nederlandse deeltaken onder Mistral Small 3.2 24B en zelfs onder GPT-3.5 Turbo, bijvoorbeeld 2 tegen 62,57 en 42,28 op MMLU-nl en 19 tegen 54,10 en 58,95 op grammaticale correctheid (GoingDutch.ai, 2026).
Onze eigen test: opzet
Wij wilden niet weten welk model het slimst is, maar welk model een Nederlandse zakelijke tekst oplevert die je zonder herschrijven kunt versturen. Dat is een andere vraag, en het is de vraag die een MKB-bedrijf werkelijk stelt.
Uitgevoerd op 18 september 2026, n = 5 prompts per model, beoordeeld door één redacteur.
Getest: claude-fable-5-1, claude-opus-5, claude-sonnet-5 en claude-haiku-4-5-20251001.
Niet getest, en dus nergens gescoord: ChatGPT, Gemini, Copilot en Mistral. Er was op de testdatum geen API-sleutel voor OpenAI of Mistral op de testmachine, en de Gemini-API antwoordde op zowel gemini-3.8-flash als gemini-3.1-pro-preview met 429 RESOURCE_EXHAUSTED — Your project has exceeded its monthly spending cap.
Wij scoren niet wat we niet gedraaid hebben.
De vijf prompts zijn taken uit een gewone werkweek: een formele klachtafhandelingsmail, een begeleidende offertetekst, een samenvatting van artikel 6:233 BW dat letterlijk in de prompt was geplakt, een LinkedIn-post en een interne werkinstructie.
Elke prompt heeft controleerbare eisen: aanspreekvorm, woordlimiet, verplichte elementen en een expliciet verbod om feiten bij te verzinnen. Daardoor is "feitelijke trouw" geen smaakoordeel maar een telbaar ding.
Alle vier de uitvoeren per prompt zijn met een vaste seed gehusseld en als variant A tot en met D weggeschreven. De redacteur heeft alle twintig varianten gescoord vóórdat de sleutel met modelnamen werd geopend.
De rubric
| Criterium | 5 punten | 3 punten | 1 punt |
|---|---|---|---|
| Spelling en grammatica | geen fouten | één echte fout | meer dan drie fouten |
| Register en toon | gevraagde aanspreekvorm consequent, toon past bij het teksttype | één registerwissel of een duidelijk te stijve passage | verkeerde aanspreekvorm |
| Nederlands idioom | leest als origineel Nederlands | één anglicisme, Engelse zinsbouw of AI-cliché | leest als een vertaling uit het Engels |
| Feitelijke trouw | blijft binnen de gegeven feiten en alle eisen | één toevoeging, weglating of overschreden limiet | meerdere verzonnen feiten |
Vier criteria van elk 1 tot 5 punten geven maximaal 20 punten per prompt en 100 punten per model.
De ruwe scores
| Model | Klachtmail | Offerte | Wetsartikel | Instructie | Totaal | |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 | 20 | 20 | 20 | 20 | 20 | 100 |
| Claude Opus 5 | 19 | 18 | 20 | 20 | 20 | 97 |
| Claude Sonnet 5 | 20 | 19 | 19 | 17 | 17 | 92 |
| Claude Haiku 4.5 | 11 | 16 | 18 | 16 | 19 | 80 |
Dezelfde punten, nu per criterium opgeteld over de vijf prompts, met 25 als maximum per cel.
| Model | Spelling | Register | Idioom | Feitelijke trouw |
|---|---|---|---|---|
| Claude Fable 5.1 | 25 | 25 | 25 | 25 |
| Claude Opus 5 | 25 | 24 | 25 | 23 |
| Claude Sonnet 5 | 25 | 25 | 24 | 18 |
| Claude Haiku 4.5 | 24 | 19 | 17 | 20 |
| Alle vier samen (max 100) | 99 | 93 | 91 | 86 |
Die onderste rij is de uitkomst die ertoe doet.
Spelling is het probleem niet
Van de honderd te verdienen punten op spelling en grammatica gingen er negenennegentig naar de modellen. Eén punt van de honderd ging verloren op spelling en grammatica, in de klachtmail van Haiku 4.5.
Waar het wél misgaat, is de onderste rij: feitelijke trouw, met 86 van de 100. Een model dat foutloos Nederlands schrijft, kan intussen rustig iets beloven wat jij nooit hebt gezegd.
Het duidelijkste voorbeeld staat in dezelfde klachtmail. Haiku 4.5 schreef ongevraagd: "Wij hebben hier lering uit getrokken en hebben maatregelen getroffen om dergelijke situaties in de toekomst te voorkomen."
Dat is een toezegging aan een klant die klaagt. De prompt verbood expliciet extra toezeggingen, en dit is precies het soort zin waarop een klant je later vastpint.
Sonnet 5 liet iets soortgelijks zien in de werkinstructie. Het maakte er negen stappen van in plaats van de vier gegeven handelingen, met drie verzonnen stappen erbij, en het invoeren van de order kwam drie keer voor met onderling strijdige voorwaarden.
Dat verklaart waarom Sonnet 5 wel 25 van de 25 haalt op register en 24 op idioom, maar blijft steken op 18 voor feitelijke trouw. De zinnen zijn onberispelijk; de inhoud dwaalt af.
Waar het Nederlands echt hapert
Na feitelijke trouw is idioom de tweede verliespost, 91 van de 100. Van de negen punten die daar verloren gingen, komen er acht van één model.
Haiku 4.5 leverde in de offertetekst "zodat uw inventory altijd actueel blijft" — een Engels leenwoord waar "voorraad" het gewoon doet. In de klachtmail stonden er drie vertaalconstructies achter elkaar: "buiten onze directe controle", "Wij waarderen uw zakendoen" en "aarzel niet contact met ons op te nemen".
Dat laatste is het klassieke patroon: een tekst die grammaticaal klopt maar leest als een vertaling uit het Engels. Je Nederlandse lezer voelt dat binnen twee zinnen, ook zonder te kunnen benoemen waarom.
Fable 5.1, Opus 5 en Sonnet 5 doen dat nauwelijks. In vijftien teksten van die drie modellen stond bij elkaar één idioomaftrek, in een LinkedIn-post van Sonnet 5.
De omgekeerde fout bestaat ook. In de LinkedIn-post schreef Haiku 4.5 "gebeurt er iets bijzonders" als opening en "Werk dat geen waarde toevoegt" als tussenzin, allebei AI-clichés die een Nederlandse lezer meteen als machinetekst herkent.
Wat wij hieruit hebben gehaald
Het verschil tussen de modellen zit in discipline, niet in taal. Alle vier schrijven ze verzendbaar Nederlands; alleen de bovenste twee blijven consequent binnen de opdracht.
Voor tekst naar buiten: Fable 5.1 of Opus 5. Een klachtmail, een offerte en een juridische samenvatting zijn documenten waar een verzonnen zin geld kost. Op die drie prompts scoorden Fable 5.1 en Opus 5 samen 117 van de 120.
Voor tekst naar binnen: Sonnet 5 is ruim voldoende. Voor een werkinstructie of een conceptversie die toch iemand naleest, weegt de prijs zwaarder dan die laatste paar punten; de prijs- en snelheidsverschillen per Claude-model staan in Claude Haiku, Sonnet, Opus of Fable: welk model voor welk werk.
Haiku 4.5 zetten wij niet op klantcorrespondentie. Het is het goedkoopste en snelste model in de lijn en prima voor volumewerk waarvan je de uitkomst controleert, maar 11 van de 20 op een klachtmail is voor die taak simpelweg te laag.
Eerlijk over Claude-first. Wij bouwen standaard op Claude, dus het is geen toeval dat we juist die vier modellen konden draaien. Deze test bewijst daarom níet dat Claude beter Nederlands schrijft dan ChatGPT, Gemini of Mistral.
Voor de Europese vraag verwijzen we naar Mistral of ChatGPT en Claude; de head-to-head staat op Claude vs ChatGPT voor zakelijk gebruik.
Wat de test níet meet
Geen snelheid. Alle twintig aanroepen liepen via één account met een gedeelde rate limit, dus de doorlooptijden zeggen niets over de modellen — de langste aanroep duurde 157,8 seconden en dat was wachten, geen rekenen.
Geen statistiek. Eén beoordelaar, vijf prompts, één testdag, vier modellen van één maker.
Het is een steekproef, geen benchmark, en zo staat hij hier ook.
Geen lange documenten. Alle vijf de teksten zijn kort; hoe een model zich houdt over dertig pagina's is een andere vraag, met een ander antwoord: welk AI-model lange documenten het best leest.
De aanroep liep bovendien via de Claude Code-CLI in een lege werkmap zonder projectinstructies en zonder MCP-servers, met één vaste systeeminstructie voor alle vier de modellen. Dat is niet identiek aan een kale API-aanroep, en dat kan de teksten hebben beïnvloed.
Wil je weten hoe je zulke scores van derden op waarde schat, dan legt AI benchmarks uitleg: zo lees je de scores uit waar publieke benchmarks systematisch tekortschieten.
De prompt doet meer dan het model
Twee ingrepen leverden in onze test meer verschil op dan de sprong van Sonnet naar Opus.
De eerste komt van Anthropic zelf: zet de doeltaal expliciet in de system prompt in plaats van het model te laten raden uit je bericht (Anthropic, 2026).
De tweede staat op dezelfde pagina: vraag om "idiomatic speech as if it were a native speaker". Dat is precies het middel tegen de vertaalconstructies waarop Haiku 4.5 punten verloor.
Daar komt onze eigen les bij: zet de feiten die het model mág gebruiken als lijst in de prompt, met de zin dat het niets anders mag toevoegen. In onze vijf prompts stond die instructie er, en dáár gingen de meeste punten alsnog verloren — zonder die zin wordt het erger, niet beter.
Het patroon is bruikbaar buiten deze test. Wie een model op klantcorrespondentie zet, controleert niet op taal maar op wat er is bijgekomen.
Hoe je dit zelf overdoet
De opzet is expres simpel genoeg om te kopiëren. Neem vijf teksten die jouw bedrijf echt verstuurt, zet er controleerbare eisen bij, laat dezelfde prompt door de modellen lopen die je overweegt, husselt de uitkomsten en scoor ze blind.
Een halve dag werk levert je een antwoord dat op jóuw teksten slaat, en dat is meer waard dan elke algemene ranglijst.
Wil je die test liever samen opzetten, dan doen we dat in een AI-workshop van een halve dag, die bij ons begint vanaf €950; een volledig adviestraject loopt van €3.500 voor een readiness assessment tot €22.500, altijd tegen een vaste projectprijs vooraf (prijsband uit onze dienstpagina AI-advies).
Wat de modellen zelf per maand kosten is een losse vraag: die staat uitgesplitst per plan op wat kost Claude in 2026 en, voor de andere kant, op wat kost ChatGPT in 2026.
Twijfel je welk model bij welk proces hoort, dan is welk AI-model het beste is voor jouw bedrijf de bredere keuzepagina, en verzamelt onze index over AI-modellen vergelijken alle vragen over modellen, kosten en AVG op één plek.
Liever meteen sparren over jouw teksten? Bel 085 016 0118 of laat je vraag achter via contact — stuur twee of drie echte documenten mee, dan draaien we ze door de modellen en laten we zien waar het schuurt.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










