# Open-weight modellen uit China: de stand van juli 2026

[Naar de inhoud](#lm-inhoud)Netwerk/NL[EN](/en/open-weight-modellen-juli-2026)[Hubhub.llmnet.nlModellen vergelijken op taak, taal, kosten en licentie.](https://hub.llmnet.nl/)[Communitycommunity.llmnet.nlPrompttechnieken, patronen en systeemprompts.](https://community.llmnet.nl/)[APIapi.llmnet.nlLLM's robuust in software: rate limits, routing, structured output.](https://api.llmnet.nl/)[Consultancyconsultancy.llmnet.nlAI invoeren in een organisatie, van pilot tot productie.](https://consultancy.llmnet.nl/)[Nieuwsnieuws.llmnet.nlOntwikkelingen in AI, geduid voor Nederland.](https://nieuws.llmnet.nl/)[Benchmarkbenchmark.llmnet.nlZelf meten wat AI-kwaliteit is, voor jouw taken.](https://benchmark.llmnet.nl/)[Vacaturesvacatures.llmnet.nlAI-rollen, salarissen en carrièrepaden in Nederland.](https://vacatures.llmnet.nl/)[Lerenleren.llmnet.nlAI-concepten in gewoon Nederlands, van beginner tot bouwer.](https://leren.llmnet.nl/)[Gidsgids.llmnet.nlAI privé draaien op eigen Mac, pc, NAS of thuisserver.](https://gids.llmnet.nl/)[Directorydirectory.llmnet.nlHet AI-ecosysteem in kaart: tools, modellen, bedrijven.](https://directory.llmnet.nl/)[Radarradar.llmnet.nlSignalen uit X, onderzoek en communities voor indie developers.](https://radar.llmnet.nl/)[Appsapps.llmnet.nlReviews van AI-apps en open-source repo's, met tips voor wie zelf bouwt.](https://apps.llmnet.nl/)[llmnet.nl — hoofdsite](https://llmnet.nl/)[](https://x.com/intent/post?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026&text=Open-weight%20modellen%20uit%20China%3A%20de%20stand%20van%20juli%202026)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026)[](https://www.reddit.com/submit?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026&title=Open-weight%20modellen%20uit%20China%3A%20de%20stand%20van%20juli%202026)[](#)[](https://x.com/intent/post?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026&text=Open-weight%20modellen%20uit%20China%3A%20de%20stand%20van%20juli%202026)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026)[](https://www.reddit.com/submit?url=https%3A%2F%2Fradar.llmnet.nl%2Fopen-weight-modellen-juli-2026&title=Open-weight%20modellen%20uit%20China%3A%20de%20stand%20van%20juli%202026)[](#)Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini) · Laatst bijgewerkt: 27 juli 2026

 
 
 [← Terug naar AI-Radar](/)
 [Model Routing API](https://api.llmnet.nl/model-routing)
 
 
# Open-weight modellen uit China: de stand van juli 2026

 
 Gepubliceerd op 24 juli 2026 · Door de redactie van AI-Radar
 
 

 
 
 Het landschap van open-weight taalmodellen ontwikkelt zich in de zomer van 2026 in een razend tempo. Met name vanuit China zien we een stroom aan releases die de gevestigde orde uitdagen. Voor indie developers die hun eigen AI-agents bouwen, workflows automatiseren via tools zoals n8n, en een eigen homelab onderhouden, brengt deze golf zowel kansen als infrastructurele uitdagingen met zich mee. 
 

 
 De rode draad van deze maand is helder: de absolute topmodellen worden simpelweg te groot om lokaal te draaien op consumentenhardware of een bescheiden thuisserver. Modellen met parameters in de biljoenen (T) vereisen een strategische verschuiving. In plaats van alles lokaal te willen hosten, verschuift de best practice voor indie-stacks naar het inzetten van een lokale LLM-gateway zoals LiteLLM, gekoppeld aan externe API-providers die deze open-weight giganten tegen zeer scherpe tarieven aanbieden. Hierdoor behoud je de controle over je agent-logica en workflow-orkestratie, terwijl je profiteert van de rekenkracht van de nieuwste frontier-modellen.
 

 
## Belangrijkste releases en signalen

 
 
 [Kimi K3: Open weights release op 27 juli richt zich op coding](https://www.techtimes.com/articles/321499/20260724/kimi-k3-open-weights-drop-july-27-near-frontier-coding-undisclosed-hallucination-risk.htm)
 
 
 Moonshot staat op het punt om op 27 juli de volledige gewichten van Kimi K3 vrij te geven onder de eigen Kimi K3-licentie, die permissief is voor het meeste commerciële gebruik maar eigen voorwaarden kent. Dit model, met maar liefst 2,8 biljoen (T) parameters, heeft de eerste plaats veroverd in de Frontend Code Arena en presteert daarmee boven gevestigde namen zoals GLM-5.2 en GPT-5.6 Sol. 
 

 
 Waarom dit relevant is: Voor ontwikkelaars die coding-agents bouwen, is dit een significante stap voorwaarts. Vanwege de omvang is zelf hosten op een gemiddelde thuisserver onrealistisch. Het model wordt echter direct interessant zodra het beschikbaar komt via API-providers en geïntegreerd kan worden in je lokale gateway.
 

 
 Signaal: hoog
 Actie: watch
 kimi
 moonshot
 coding
 api
 
 

 
 
 [DeepSeek V4-Flash: De nieuwe standaard voor agentic pipelines](https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/)
 
 
 DeepSeek heeft met V4-Flash een MIT-gelicenseerd Mixture-of-Experts (MoE) model uitgebracht. Met in totaal 284 miljard parameters, waarvan er slechts 13 miljard actief zijn per token, en een contextwindow van 1 miljoen tokens, is dit model geoptimaliseerd voor snelheid en efficiëntie. Met een score van 79,0% op SWE-bench Verified is het een van de meest capabele open-weight modellen voor software engineering.
 

 
 Waarom dit relevant is: Dit is momenteel de meest concrete keuze voor actieve agentic pipelines. Dankzij de lage actieve parameter-count zijn de API-kosten van de DeepSeek V4 Pro-variant (peildatum augustus 2026: $0,435 per miljoen inputtokens en $0,87 per miljoen outputtokens bij een cache-miss) extreem laag. Dit maakt het de ideale motor voor complexe, langlopende agent-workflows die je aanstuurt via een lokale gateway.
 

 
 Signaal: hoog
 Actie: build
 deepseek
 mit
 agentic
 litellm
 
 

 
 
 [GLM-5.2: Het efficiënte en geauditeerde MIT-model van Zhipu](https://www.orcarouter.ai/blog/qwen-3-8-vs-glm-5-2)
 
 
 Zhipu heeft met GLM-5.2 een 753B MoE-model (waarvan ~40B actief) onder MIT-licentie op Hugging Face geplaatst. Het model blinkt uit in redeneertaken met een score van 91,2% op GPQA Diamond en 62,1% op SWE-bench Pro. In de community wordt het veelvuldig bestempeld als een van de beste allround open-source LLM's van dit moment.
 

 
 Waarom dit relevant is: Net als DeepSeek V4 zorgt de MoE-architectuur ervoor dat de operationele kosten bij API-providers laag blijven. Het is een uitstekend alternatief of back-up model in je routing-setup voor taken die diepgaand logisch redeneren vereisen.
 

 
 Signaal: middel-hoog
 Actie: idea
 glm
 zhipu
 mit
 litellm
 
 

 
 
 [Qwen 3.8-Max: Alibaba toont 2.4T gigant op WAIC](https://www.yottalabs.ai/post/qwen-3-8-max-release-date-specs-how-to-access-2026)
 
 
 Alibaba heeft op de World Artificial Intelligence Conference (WAIC) in Shanghai een preview gegeven van Qwen 3.8-Max. Dit sparse MoE-model van 2,4 biljoen parameters is volledig multimodaal en presteert volgens de eerste claims vlak onder commerciële giganten zoals Claude Fable 5. Alibaba heeft beloofd de gewichten "binnenkort" vrij te geven.
 

 
 Waarom dit relevant is: Hoewel de prestaties indrukwekkend zijn, zijn de gewichten op dit moment nog niet beschikbaar en is de licentiestructuur onbekend. Dit is een model om nauwgezet te volgen, maar nog niet op te nemen in actieve workflows.
 

 
 Signaal: middel
 Actie: watch
 qwen
 alibaba
 multimodal
 preview
 
 

 
 
 [Qwen 3.6 (27B/35B): Lokaal draaien op Apple Silicon](https://apxml.com/posts/best-local-llms-apple-silicon-mac)
 
 
 Voor wie toch de voorkeur geeft aan een volledig lokale setup zonder afhankelijkheid van externe API's, bieden de kleinere Qwen 3.6-varianten (27B en 35B) uitkomst. Gecorrigeerd voor Apple Silicon via MLX halen deze modellen respectievelijk 16 tot 72 tokens per seconde.
 

 
 Waarom dit relevant is: Dit zijn de weinige recente Chinese modellen die daadwerkelijk lokaal passen op consumentenhardware. Houd er wel rekening mee dat je voor een comfortabele workflow met grotere contexten al snel 64GB+ aan verenigd geheugen nodig hebt. Voor lichtere hardware is lokale inferentie van deze omvang vaak net te zwaar, waardoor de API-route de voorkeur behoudt.
 

 
 Signaal: laag-middel
 Actie: watch
 qwen
 mlx
 self-host
 
 

 
## Wat kun je hiermee?

 
 De trend is onmiskenbaar: de grens tussen 'open-weight' en 'lokaal draaibaar' is definitief vervaagd. De krachtigste open-weight modellen zijn simpelweg te groot voor een standaard homelab. Als indie developer haal je nu het meeste rendement uit je setup door je te focussen op slimme orkestratie in plaats van zware lokale hardware.
 

 
 
- Richt een centrale LLM-gateway in: Gebruik een tool zoals LiteLLM op je thuisserver. Hiermee kun je eenvoudig schakelen tussen lokale modellen (voor privacygevoelige basistaken) en externe API's van DeepSeek V4 of GLM-5.2 voor het zwaardere redeneerwerk.
 
- Optimaliseer je agent-architectuur voor MoE: Omdat modellen zoals DeepSeek V4-Flash en GLM-5.2 gebruikmaken van Mixture-of-Experts, zijn ze bij uitstek geschikt voor taken die veel interactie en context vereisen, zonder dat je budget snel verdampt.
 
- Bereid je voor op Kimi K3: Houd de release van 27 juli in de gaten. Zodra dit model beschikbaar is bij API-routers, kan het een uitstekende upgrade zijn voor je coding- en ontwikkelagents.
 
 

 
 
 Samengesteld op basis van publieke bronnen, juli 2026.
