Kort antwoord
Voor de meeste MKB-bedrijven is één leverancier met meerdere modelklassen de beste start: in ons rekenvoorbeeld voor 25 medewerkers kost alles op Claude Sonnet 5 circa €259 per maand en een mix van vier modellen van twee leveranciers €281. Meerdere leveranciers lonen als een taak er meetbaar beter op draait (Nederlands, beeld, een goedkope klasse bij groot volume) of als uitval van één leverancier je bedrijf stillegt. Reken de verborgen kosten mee: een verwerkersovereenkomst per leverancier, prompts en testsets per model en de routinglogica zelf.
Van lezen naar doen.
Stel je zet alles wat 25 medewerkers per maand aan AI-werk doen op één model, Claude Sonnet 5. Dat kost in ons rekenvoorbeeld circa €259 per maand aan tokens.
Verdeel je datzelfde werk over vier modellen van twee leveranciers, elk op de taak waar het het sterkst is, dan kom je op circa €281. De mix is dus niet goedkoper, maar duurder.
Dat botst met het verhaal dat "de beste keuze vaak niet één tool is". Dat verhaal klopt, maar om een andere reden dan kosten, en die reden weegt pas boven een aantal verborgen kosten uit die op geen enkele prijspagina staan.
Deze pagina rekent het uit. Je krijgt een routingtabel per taak, de maandtotalen van vijf opstellingen, de kosten die de tabel niet laat zien, een overzicht van routers die het kiezen voor je doen en één beslistabel: één model als…, meerdere als….
Kies je er maar één, dan helpt de keuzepagina welk AI-model bij jouw bedrijf past; deze pagina is de vervolgvraag binnen het thema "welk model voor welk werk" van de cluster-index AI-modellen vergelijken.
Drie dingen die "meerdere modellen" kunnen betekenen
De vraag wordt vaak gesteld alsof het één keuze is. Het zijn er drie, met heel verschillende gevolgen.
- Meerdere klassen van één leverancier: Haiku, Sonnet en Opus van Anthropic, of Luna, Terra, Sol en Astra van OpenAI. Eén contract, één verwerkersovereenkomst, één factuur.
- Meerdere leveranciers: Claude voor het ene, Gemini voor het andere. Elke leverancier brengt een eigen contract, eigen prompts en een eigen dataroute mee.
- Een router of gateway die kiest: Copilot, ChatGPT, de Model Router van Azure of een eigen laag zoals LiteLLM of OpenRouter. Jij stuurt één verzoek, de laag bepaalt het model.
De eerste vorm is bijna gratis en doen we in elk project; de tweede is de vorm waar deze pagina over gaat.
De derde belooft de tweede zonder het werk, en houdt die belofte maar half.
Hoe je binnen de Claude-familie een trap van drie modellen inricht, staat apart op Claude Haiku, Sonnet, Opus of Fable per taak; de OpenAI-ladder van Luna tot Astra op welk OpenAI-model je kiest. Hier gaat het om de stap over de leveranciersgrens heen.
De routingtabel: vier taken, 25 medewerkers, vier modellen
Alles hieronder is een rekenvoorbeeld. De volumes zijn aannames voor een MKB-bedrijf met 25 medewerkers dat AI in eigen software heeft ingebouwd; de tokenprijzen komen van de prijspagina's van Anthropic, OpenAI en Google, alle drie opgehaald op 18 september 2026.
De dollarbedragen zijn omgezet tegen de ECB-koers van die dag, 18 september 2026: 1,1460 dollar voor één euro. Alle bedragen exclusief btw, tenzij anders vermeld.
De vier taken en hun aannames:
- A Classificatie en extractie: 20.000 items per maand (mails, orders, facturen), 1.500 tokens in en 150 tokens uit per item.
- B Dagelijks schrijfwerk: 7.500 taken per maand (25 mensen, 20 werkdagen, 15 taken per dag), 2.000 tokens in en 600 uit.
- C Redeneerwerk en agents: 600 runs per maand (analyses, meerstaps agent-runs), 40.000 tokens in en 4.000 uit per run.
- D Nederlandstalige chat: 3.000 gesprekken per maand met kennisbankcontext, 6.000 tokens in en 800 uit per gesprek.
| Taak | Tokens per maand (in / uit) | Model | Tarief per miljoen (in / uit) | Per maand | Circa in euro |
|---|---|---|---|---|---|
| A Classificatie en extractie | 30 mln / 3 mln | Claude Haiku 4.5 | $1 / $5 | $45,00 | €39,27 |
| A Classificatie en extractie | 30 mln / 3 mln | GPT-5.6 Luna | $0,20 / $1,20 | $9,60 | €8,38 |
| B Dagelijks schrijfwerk | 15 mln / 4,5 mln | Claude Sonnet 5 | $2 / $10 | $75,00 | €65,45 |
| B Dagelijks schrijfwerk | 15 mln / 4,5 mln | GPT-5.6 Terra | $2 / $12 | $84,00 | €73,30 |
| C Redeneerwerk en agents | 24 mln / 2,4 mln | Claude Opus 5 | $5 / $25 | $180,00 | €157,07 |
| C Redeneerwerk en agents | 24 mln / 2,4 mln | Claude Fable 5.1 of GPT-6 Astra | $10 / $50 | $360,00 | €314,14 |
| C Redeneerwerk en agents | 24 mln / 2,4 mln | Claude Sonnet 5 | $2 / $10 | $72,00 | €62,83 |
| D Nederlandstalige chat | 18 mln / 2,4 mln | Gemini 3.8 Flash (actietarief) | $0,75 / $3,75 | $22,50 | €19,63 |
| D Nederlandstalige chat | 18 mln / 2,4 mln | Claude Haiku 4.5 | $1 / $5 | $30,00 | €26,18 |
Twee kanttekeningen bij de tabel.
- Gemini 3.8 Flash is een actietarief tot en met 31 december 2026; daarna rekent Google $1,50 en $7,50 en wordt rij D $45,00 (circa €39,27).
- GPT-5.6 Sol ($4 / $20, actie tot minstens 21 november 2026) ontbreekt omdat Terra en Astra de taken al afdekken.
Caching en batch zijn weggelaten. Ze verlagen elke rij, maar niet de verhouding ertussen; het rekenrecept met alle vier tokensoorten staat op AI-API-kosten berekenen per token.
Vijf opstellingen, vijf maandtotalen
Dezelfde vier taken, maar nu opgeteld per manier van inrichten.
| Opstelling | Modellen | Leveranciers | Per maand | Circa in euro | Incl. 21% btw |
|---|---|---|---|---|---|
| Alles op Claude Opus 5 | 1 | 1 | $742,50 | €647,91 | €783,97 |
| Alles op Claude Sonnet 5 | 1 | 1 | $297,00 | €259,16 | €313,59 |
| Claude-trap: Haiku (A, D), Sonnet (B), Opus (C) | 3 | 1 | $330,00 | €287,96 | €348,43 |
| Claude-trap plus Gemini Flash voor D | 4 | 2 | $322,50 | €281,41 | €340,51 |
| Goedkoopste per taak: Luna (A), Sonnet (B, C), Flash (D) | 4 | 3 | $179,10 | €156,28 | €189,10 |
Lees de tabel van onder naar boven, want daar zit het verhaal.
De goedkoopste opstelling is inderdaad een mix van drie leveranciers: €156 per maand. Maar het verschil met alles op Sonnet 5 is €103 per maand, ruim €1.200 per jaar, en daar moeten drie contracten, drie promptsets en drie testsets van betaald worden.
De Claude-trap zonder tweede leverancier kost €288, met Gemini Flash voor de chat €281. De tweede leverancier bespaart in dit voorbeeld $7,50 per maand: circa €6,54.
En één model voor alles is alleen duur als dat model Opus 5 is. Zet je het zwaarste model overal in, dan betaal je €648 en is elke vorm van routing direct de moeite waard.
Waar de winst zit, en waar niet
De besparing van routing zit bijna helemaal in één beweging: de dure klasse alleen inzetten waar hij nodig is. Die beweging maak je binnen één leverancier, zonder extra contract.
De tweede leverancier voegt in dit voorbeeld nauwelijks besparing toe. Wat hij wél kan toevoegen, is kwaliteit op een taak waar het andere model aantoonbaar beter is.
Voor Nederlands is dat het duidelijkste geval: de Nederlandse EuroEval-ranglijst had bij onze aflezing van 18 september 2026 Gemini 3.7 Flash als koploper, met GPT-5.6 Sol op de tweede plek en Claude Sonnet 4.5 op de derde. Wat die ranglijst wel en niet meet voor zakelijk schrijfwerk, staat op welk AI-model het beste Nederlands schrijft.
Andere gevallen waar een tweede model zich terugverdient in kwaliteit, niet in tokens:
- Beeld en scans: modellen verschillen in hoe ze foto's en pdf's lezen; zie welk model lange documenten aankan.
- Regionale verwerking: soms is de EU-route van leverancier B wél beschikbaar waar die van A ontbreekt; de routetabel staat op AI-modellen in de EU laten draaien.
- Beschikbaarheid: de tijdelijke opschorting van Claude Fable 5 in juni 2026 liet zien dat een productieproces op één model een enkelvoudig risico draagt.
Wat je níet moet verwachten: dat een tweede leverancier de hallucinaties oplost, de kennisbank vervangt of de prompts overneemt. Die drie blijven jouw werk, per model.
De verborgen kosten van meerdere modellen
Dit zijn de posten die in de maandtotalen hierboven ontbreken. Ze zijn deels eenmalig, deels blijvend, en ze groeien mee met het aantal leveranciers.
Een verwerkersovereenkomst per leverancier. Elke leverancier heeft eigen voorwaarden, een eigen subverwerkerslijst en een eigen doorgiftemechanisme; de details per aanbieder staan op de DPA van Claude, die van ChatGPT en die van Gemini. Elk contract is ook een regel in je verwerkingsregister en een vraag in je volgende audit.
Prompts per model. Een systeemprompt die op Sonnet werkt, geeft op Flash of Terra ander gedrag; toolaanroepen, effort-instellingen en outputformaat verschillen per familie. Elke promptwijziging voer je daarna in tweevoud door.
Een testset per taak, gedraaid per model en per versie. Zonder testset weet je niet of het goedkope model de taak nog goed doet; met twee leveranciers verdubbelt het aantal runs bij elke nieuwe versie. Waarom een puntrelease je tokenverbruik kan veranderen, staat in onze analyse van Claude Fable 5.1.
De routinglogica zelf. Iemand moet bepalen waar de beslissing leeft: vaste regels per taaktype, een classificatiestap vooraf of een gateway. Plus de fallback als een model wegvalt, en de retry-logica die niet dubbel factureert.
Cache die verloren gaat. Prompt-caching is per leverancier en per model: Anthropic rekent een cache-read tegen 0,1 keer de inputprijs, op Fable 5.1 tegen 0,025 keer (Anthropic, prijspagina). Een router die per verzoek van model wisselt, gooit die korting weg.
Tooling en agentlaag. Toolkoppelingen via MCP werken bij meerdere aanbieders, zoals uitgelegd op wat MCP is, maar geheugen, guardrails en observability verschillen per platform; zie welk agentplatform.
Twee facturen, twee dashboards, twee budgetalarmen. Klein, maar het is er elke maand.
Vuistregel uit onze projecten: de tweede leverancier hoort pas op tafel als hij op een taak een meetbaar kwaliteitsverschil laat zien in jouw eigen testset, of als het volume op één taak zo groot is dat de goedkope klasse van die leverancier er honderden euro's per maand uithaalt.
Wanneer een router het voor je doet
Steeds meer producten kiezen zelf het model. Dat neemt het kiezen weg, maar niet alle kosten hierboven.
| Router | Wat hij kiest | Wat hij niet oplost |
|---|---|---|
| Microsoft 365 Copilot | Standaard "a real-time router" die per prompt het onderliggende model bepaalt, in de drie standen Auto, Quick response en Think deeper (Microsoft Learn) | Welk model jouw Nederlands schreef, weet je achteraf niet; keuze alleen per stand |
| ChatGPT | Sinds GPT-5 een "real-time router" die tussen het snelle en het redenerende model kiest op gesprekstype, complexiteit en toolgebruik (OpenAI); op de huidige plannen kies je zelf het denkniveau per abonnement | Werkt alleen binnen de OpenAI-familie; geen tweede leverancier |
| Azure AI Foundry Model Router | Eén deployment die per verzoek "the most suitable large language model" kiest uit de onderliggende modellen (Microsoft Learn) | Cachegedrag hangt af van het gekozen model; de modellenlijst is die van Azure |
| OpenRouter Auto Router | Kiest per taaktype op basis van waar de OpenRouter-gemeenschap in de laatste zeven dagen aan uitgaf, met een instelbare kostenklasse van low tot max en fallbacks (OpenRouter) | Een extra partij in je dataketen, dus een extra verwerkersovereenkomst; de keuze volgt de markt, niet jouw testset |
| LiteLLM Router | Eigen laag met load balancing over meerdere deployments, cooldowns, fallbacks, timeouts en retries (LiteLLM-documentatie) | Jij beheert de laag, de prompts per model en de testsets; het is de multi-model-aanpak met gereedschap, niet zonder werk |
De kortste samenvatting: een router in een abonnement (Copilot, ChatGPT) lost het kiezen op binnen één leverancier, en dat is voor de meeste teams precies genoeg. Een gateway (OpenRouter, LiteLLM) maakt meerdere leveranciers technisch simpel, maar laat de contracten, prompts en testsets bij jou.
Bij OpenRouter komt daar een punt bij dat we vaak over het hoofd zien: je verzoeken lopen via een tussenpartij. Voor persoonsgegevens betekent dat een extra verwerker in het register, ook als het onderliggende model verder hetzelfde is.
De beslistabel: één model als…, meerdere als…
| Criterium | Eén model of één leverancier als… | Meerdere leveranciers als… |
|---|---|---|
| Teamgrootte | Geen eigen ontwikkelaar of data-team dat prompts per model onderhoudt | Een team dat testsets draait en prompts per model bijhoudt |
| Tooling | Je werkt vanuit een abonnement (Claude Team, ChatGPT Business, Copilot) | Je hebt AI in eigen software via de API en beheert die zelf |
| Verwerkersovereenkomsten | Eén DPA en één subverwerkerslijst volstaan voor je register | Je juridische capaciteit trekt twee of drie contracten en een jaarlijkse herbeoordeling |
| Evaluatiedruk | Eén testset per taak is al een stap | Je hebt testsets en draait ze bij elke modelversie opnieuw |
| Vendor lock-in | Je accepteert die en beperkt hem met MCP en overdraagbare prompts | Uitval of een prijsverhoging van één leverancier mag je proces niet raken |
| EU-verwerking | Eén route dekt je eisen (bijvoorbeeld Claude via Vertex in de EU) | Een specifieke taak heeft een EU-route die alleen leverancier B biedt |
| Volume | API-kosten onder een paar honderd euro per maand | Eén taak met zo veel volume dat een goedkope klasse elders honderden euro's scheelt |
| Kwaliteit per taak | Je hebt geen meting die een ander model op een taak beter laat zien | Je eigen testset laat een verschil zien dat de extra kosten dekt |
Scoor je in de linkerkolom op zes of meer regels, dan is de aanpak: één leverancier, meerdere klassen, en een goede modeltrap. Scoor je rechts op volume of kwaliteit én op teamgrootte, dan loont een tweede leverancier voor precies die ene taak.
Wat je in geen van beide gevallen doet, is een derde leverancier toevoegen "voor de zekerheid". Elke leverancier die geen taak wint, is pure onderhoudslast.
Het eerlijke pleidooi voor één leverancier
Het argument voor één leverancier wordt zelden hardop gemaakt, omdat het minder spannend klinkt dan "best of breed". Het is wel het argument dat in de meeste MKB-projecten wint.
- De modeltrap is er al: drie of vier klassen binnen één familie geven je de routingwinst zonder tweede contract.
- Eén promptstijl, één toolformaat: je team leert één manier van werken, en die kennis stapelt.
- Cache en batch werken maximaal: alles wat je herhaalt, blijft bij dezelfde leverancier goedkoop.
- Eén verwerkersovereenkomst, één dataroute: je AVG-verhaal past op één pagina.
- Fallback binnen de familie: valt het topmodel weg, dan vangt de klasse eronder het op, met dezelfde prompts.
Het risico van één leverancier is echt, maar kleiner dan het lijkt. Wie prompts, tools en testsets netjes buiten de leverancierslaag houdt, kan later alsnog overstappen; wie ze door twee leveranciers verweeft, kan dat vaak juist niet meer.
Waar wij staan: Claude-first, met een tweede model waar het meetbaar beter is
Onze default is Claude, als één leverancier met de trap Haiku 4.5, Sonnet 5 en Opus 5, en Fable 5.1 alleen voor werk dat het echt vraagt. Dat is een voorkeur, en we benoemen hem als voorkeur.
Een tweede model nemen we erbij op twee gronden die je hierboven zag: de Nederlandse EuroEval-positie van de Gemini Flash-lijn en het actietarief van Gemini 3.8 Flash voor volumewerk zonder gevoelige data. Dat doen we alleen na een test op de eigen taak, niet omdat een ranglijst het zegt.
Voor organisaties die in Microsoft 365 leven, is Copilot met zijn eigen router een volwaardig één-leverancier-antwoord. CleverTech AI is Microsoft-reseller via Pax8 en levert die licenties ook; de keuze tussen Copilot en een Claude-opstelling maken we op het werk, niet op de marge.
Voor de modelkeuze achter een klantenservice-bot met een eigen escalatieladder verwijzen we naar welk model je achter je chatbot zet; die ladder herhalen we hier niet. Een overzicht van alle families en wie erachter zit, staat op welke AI-modellen er zijn.
Twee pagina's die deze afweging binnenkort aanvullen: de versiepagina van Gemini en de vergelijking Claude of Gemini voor zakelijk gebruik.
Wat het kost om dit te laten uitzoeken
De vraag "één of meerdere" hoort thuis in het AI readiness assessment van AI-advies: €3.500 voor nulmeting, gap-analyse en kansenlijst. Jouw routingtabel, met jouw taken, volumes en de bronprijzen van die maand, is daar een vast onderdeel van.
Wil je de routing daarna in eigen software, inclusief fallback en testsets, dan bouwen we die als AI-software. Wil je eerst je team meenemen, dan is er de halve dag AI-workshop vanaf €950.
Twijfel je of je überhaupt al aan de API-kant zit of nog in abonnementen? Bel 085 016 0118 of plan een gesprek via /contact; we zeggen het ook als één abonnement voorlopig genoeg is.
Zo houd je deze afweging actueel
Drie dingen veranderen deze tabel: een nieuwe versie van een model, een nieuw tarief en een nieuw actietarief dat afloopt. Voor Gemini 3.8 Flash geldt het actietarief tot en met 31 december 2026; dat van GPT-5.6 Sol loopt tot minstens 21 november 2026.
Houd daarom je eigen routingtabel bij als document met een datum en een bron per rij, precies zoals hierboven. Draai bij elke modelversie je testset opnieuw, en herbereken de vijf opstellingen pas als een rij met meer dan 20 procent verschuift.
Verandert de koers, dan verschuiven alle euro-bedragen mee, maar de verhouding tussen de opstellingen niet. De keuze tussen één en meerdere modellen hangt dus vrijwel nooit aan de wisselkoers, en bijna altijd aan wie de prompts en testsets bijhoudt.
Opgesteld met AI-ondersteuning, geredigeerd en inhoudelijk verantwoord door Bram Dokman.










