Zelfgehoste agents: de gaten die je pas ziet als je ze draait
De interessantste signalen over zelfgehoste agents komen deze week niet uit aankondigingen, maar uit bugtrackers. Dat is een goed teken: het betekent dat er genoeg mensen zijn die deze dingen echt draaien, lang genoeg om de scherpe randen te vinden.
Een HTTP 200 zegt niets over een geslaagde run
Bij Hermes leverde een modelendpoint netjes een succesvolle HTTP-status en een SSE-stream — maar zonder inhoud en zonder finish_reason. De automatische retries daarna kostten ruim een minuut vertraging (NousResearch/hermes-agent#89836).
Dat is de belangrijkste monitoringles van de week. Een healthcheck die op statuscodes let, meldt hier groen. Wat je werkelijk moet valideren is of er tokens uit kwamen, of er een afrondingssignaal was, hoeveel retries er nodig waren en hoe lang de run totaal duurde. Een agent die stilletjes leeg antwoordt en het drie keer opnieuw probeert, verbrandt budget en tijd zonder ooit een foutmelding te produceren.
Een verwant geval: NInfer biedt een OpenAI-compatibele endpoint, maar gaf de door Hermes gebruikte instelling reasoning_effort niet correct door (Neroued/ninfer#60). "OpenAI-compatibel" betekent dat de route bestaat, niet dat elke parameter aankomt. Controleer of instellingen daadwerkelijk doorwerken en zichtbaar zijn in de logs.
Profielen zijn geen UI-voorkeur
Een Hermes Desktop-update startte een externe backend zonder de vereiste --profile-parameter, waarna sessies uit alle agentprofielen verdwenen (NousResearch/hermes-agent#89675).
De les is breder dan Hermes: startargumenten die bepalen wélke state een proces laadt, horen expliciet vastgelegd in scripts of service-units — niet in een menukeuze die een update kan resetten. En test sessieherstel ná iedere update, niet alleen of het proces start.
Verwijderen is niet hetzelfde als opnieuw beginnen
Een LobeHub-installatie op Synology Docker liet zien dat gewiste herinneringen niet opnieuw geëxtraheerd worden, omdat de onderwerpen intern als "verwerkt" gemarkeerd blijven (lobehub/lobehub#18498).
AI-geheugen bestaat uit meerdere toestanden die niet gelijk opgaan: de inhoud, de verwerkingsvlag, en de afgeleide index. Wie er één wist, houdt de andere twee. Voor een NAS-opstelling betekent dat: back-up van zowel database als volumes vóór elke opschoning, en na afloop verifiëren dat de heropbouw daadwerkelijk plaatsvond.
De bereikbaarheidsvraag
Twee projecten pakken hetzelfde probleem aan vanaf verschillende kanten. Een open-source companion-app maakt een zelfgehoste Hermes-agent bereikbaar vanaf een telefoon, zonder WhatsApp of terminal als tussenlaag (r/vibecoding). OpenClaw kiest de andere route en plaatst de agent ín de software die je al gebruikt — Slack, Teams, en webframeworks als React, Angular en Vue, met menselijke goedkeuring via AG-UI (@ataiiam).
Beide maken hetzelfde mogelijk: de agent draait thuis, de bediening zit waar jij bent. Beide voegen ook hetzelfde risico toe: een extra toegangspunt tot een proces dat toegang heeft tot je bestanden. Een beveiligde tunnel, sterke authenticatie en krappe API-rechten zijn hier geen luxe.
Federatie klinkt beter dan het is (voorlopig)
Syndicate OS experimenteert met een federatie van zelfgehoste Hermes- en OpenClaw-agents onder eigen beheer (Kevin-the-minion/syndicate-os). De architectuur is interessant, maar de rekensom voor een bescheiden homelab is nuchter: elke permanente agent kost geheugen, beheerlast en een extra toegangspunt. Centrale coördinatie loont pas als er genoeg werkelijk parallel werk is om te coördineren.
Dezelfde nuchterheid geldt aan de modelkant. Een Ollama-verzoek vraagt om een officiële Q3_K_M-MLX-quantisatie van Qwen3.8-35B-A3B voor Macs met 16 of 24 GB gedeeld geheugen (ollama/ollama#17869). Op Apple Silicon zijn quantisatie en contextlengte bepalender dan modelgrootte; een kleiner model dat altijd past, is in de praktijk betrouwbaarder dan een groot model dat soms swapt.
De rolverdeling die telkens terugkomt
In vrijwel elk signaal van deze week zit dezelfde verdeling verstopt, en het loont om die expliciet te maken: laat rekenwerk op de machine met de snelste inference draaien, en gebruik de NAS voor wat de NAS goed doet — opslag, modellen, datasets, logs, back-ups en langlopende diensten. Een inventarisatie van zelfhostbare applicaties komt op hetzelfde uit: schrap overlap en houd de set klein (@WunderTech).
En voor agents die zelf code uitvoeren geldt de strengste variant. Een bijna volledig zelfgehoste agentische softwarefabriek combineert autonome ontwikkelprocessen expliciet met sandboxing (jakesaunders.dev). Aparte containers, minimale rechten en tijdelijke werkruimtes horen bij het ontwerp, niet bij de opruimfase.
Wat je deze week kunt inbouwen
- Vervang statuscode-healthchecks door end-to-end checks die tokens,
finish_reason, retries en totale looptijd valideren. - Leg startargumenten zoals profielkeuze vast in scripts of service-units en test sessieherstel na elke update.
- Maak vóór elke geheugen- of database-opschoning een timestamped back-up van database én volumes, en verifieer de heropbouw achteraf.
- Zet mobiele of chat-toegang tot je agent achter een tunnel met sterke authenticatie en krappe rechten.
- Kies modelgrootte op basis van quantisatie en contextlengte, niet op parametercount.


