Illustratie: Open-weight modellen uit China: de stand van juli 2026
Deel:𝕏LinkedInRedditFacebookKopieer link

Samengesteld door de llmnet.nl-redactie met AI-ondersteuning · Laatst bijgewerkt: 27 juli 2026

Open-weight modellen uit China: de stand van juli 2026

Gepubliceerd op 24 juli 2026 · Door de redactie van AI-Radar

Het landschap van open-weight taalmodellen ontwikkelt zich in de zomer van 2026 in een razend tempo. Met name vanuit China zien we een stroom aan releases die de gevestigde orde uitdagen. Voor indie developers die hun eigen AI-agents bouwen, workflows automatiseren via tools zoals n8n, en een eigen homelab onderhouden, brengt deze golf zowel kansen als infrastructurele uitdagingen met zich mee.

De rode draad van deze maand is helder: de absolute topmodellen worden simpelweg te groot om lokaal te draaien op consumentenhardware of een bescheiden thuisserver. Modellen met parameters in de biljoenen (T) vereisen een strategische verschuiving. In plaats van alles lokaal te willen hosten, verschuift de best practice voor indie-stacks naar het inzetten van een lokale LLM-gateway zoals LiteLLM, gekoppeld aan externe API-providers die deze open-weight giganten tegen zeer scherpe tarieven aanbieden. Hierdoor behoud je de controle over je agent-logica en workflow-orkestratie, terwijl je profiteert van de rekenkracht van de nieuwste frontier-modellen.

Belangrijkste releases en signalen

Moonshot staat op het punt om op 27 juli de volledige gewichten van Kimi K3 vrij te geven onder een aangepaste MIT-licentie. Dit model, met maar liefst 2,8 biljoen (T) parameters, heeft de eerste plaats veroverd in de Frontend Code Arena en presteert daarmee boven gevestigde namen zoals GLM-5.2 en GPT-5.6 Sol.

Waarom dit relevant is: Voor ontwikkelaars die coding-agents bouwen, is dit een significante stap voorwaarts. Vanwege de omvang is zelf hosten op een gemiddelde thuisserver onrealistisch. Het model wordt echter direct interessant zodra het beschikbaar komt via API-providers en geïntegreerd kan worden in je lokale gateway.

Signaal: hoog Actie: watch kimi moonshot coding api

DeepSeek heeft met V4-Flash een MIT-gelicenseerd Mixture-of-Experts (MoE) model uitgebracht. Met in totaal 284 miljard parameters, waarvan er slechts 13 miljard actief zijn per token, en een contextwindow van 1 miljoen tokens, is dit model geoptimaliseerd voor snelheid en efficiëntie. Met een score van 79,0% op SWE-bench Verified is het een van de meest capabele open-weight modellen voor software engineering.

Waarom dit relevant is: Dit is momenteel de meest concrete keuze voor actieve agentic pipelines. Dankzij de lage actieve parameter-count zijn de API-kosten (ongeveer $1,74 per miljoen inputtokens en $3,48 per miljoen outputtokens voor de Pro-versie) extreem laag. Dit maakt het de ideale motor voor complexe, langlopende agent-workflows die je aanstuurt via een lokale gateway.

Signaal: hoog Actie: build deepseek mit agentic litellm

Zhipu heeft met GLM-5.2 een 744B MoE-model (waarvan ~40B actief) onder MIT-licentie op Hugging Face geplaatst. Het model blinkt uit in redeneertaken met een score van 91,2% op GPQA Diamond en 62,1% op SWE-bench Pro. In de community wordt het veelvuldig bestempeld als een van de beste allround open-source LLM's van dit moment.

Waarom dit relevant is: Net als DeepSeek V4 zorgt de MoE-architectuur ervoor dat de operationele kosten bij API-providers laag blijven. Het is een uitstekend alternatief of back-up model in je routing-setup voor taken die diepgaand logisch redeneren vereisen.

Signaal: middel-hoog Actie: idea glm zhipu mit litellm

Alibaba heeft op de World Artificial Intelligence Conference (WAIC) in Shanghai een preview gegeven van Qwen 3.8-Max. Dit sparse MoE-model van 2,4 biljoen parameters is volledig multimodaal en presteert volgens de eerste claims vlak onder commerciële giganten zoals Claude Fable 5. Alibaba heeft beloofd de gewichten "binnenkort" vrij te geven.

Waarom dit relevant is: Hoewel de prestaties indrukwekkend zijn, zijn de gewichten op dit moment nog niet beschikbaar en is de licentiestructuur onbekend. Dit is een model om nauwgezet te volgen, maar nog niet op te nemen in actieve workflows.

Signaal: middel Actie: watch qwen alibaba multimodal preview

Voor wie toch de voorkeur geeft aan een volledig lokale setup zonder afhankelijkheid van externe API's, bieden de kleinere Qwen 3.6-varianten (27B en 35B) uitkomst. Gecorrigeerd voor Apple Silicon via MLX halen deze modellen respectievelijk 16 tot 72 tokens per seconde.

Waarom dit relevant is: Dit zijn de weinige recente Chinese modellen die daadwerkelijk lokaal passen op consumentenhardware. Houd er wel rekening mee dat je voor een comfortabele workflow met grotere contexten al snel 64GB+ aan verenigd geheugen nodig hebt. Voor lichtere hardware is lokale inferentie van deze omvang vaak net te zwaar, waardoor de API-route de voorkeur behoudt.

Signaal: laag-middel Actie: watch qwen mlx self-host

Wat kun je hiermee?

De trend is onmiskenbaar: de grens tussen 'open-weight' en 'lokaal draaibaar' is definitief vervaagd. De krachtigste open-weight modellen zijn simpelweg te groot voor een standaard homelab. Als indie developer haal je nu het meeste rendement uit je setup door je te focussen op slimme orkestratie in plaats van zware lokale hardware.