Dossier

Open models, lokale AI en privacy

Lokale/open modellen als alternatief voor Big Tech-cloud-AI.

Nieuwsitems

Gekoppelde artikelen

206 artikelen

In 2026 is het mogelijk om een volledig functionele AI-assistent te draaien op een Raspberry Pi 5 voor ongeveer 80 dollar, volledig offline en zonder dat er gegevens naar servers worden gestuurd. De gids beschrijft de benodigde hardware (Raspberry Pi 5 met minstens 8 GB RAM, actieve koeling, 27-watt voeding en NVMe SSD), de software (Ollama) en welke modellen het beste werken, zoals Gemma 3 1B voor snelheid en Qwen3 4B voor kwaliteit. Het is een praktisch project dat een privé, altijd-beschikbare assistent oplevert voor lichte taken.

Current AI, een non-profit opgericht tijdens de AI Action Summit in Parijs in februari 2025 met $400 miljoen aan financiering, heeft de Gap Map v0.1 gelanceerd. Deze indexeert de huidige staat van open-source AI met 421 producten, waaronder 266 softwaretools, 85 modellen, 50 datasets en 20 hardwareprojecten van 228 organisaties. De bijbehorende data is beschikbaar onder een MIT-licentie op GitHub en kan worden verkend met Datasette Lite.

Interfaze, een YC-startup, heeft diffusion-gemma-asr-small uitgebracht, een open-source spraakherkenningsmodel dat gebruikmaakt van een diffusiedecoder. Het model kan zes talen transcriberen met één adapter van ongeveer 42M parameters, bovenop een bevroren backbone van 26B parameters. Het is het eerste open-source meertalige diffusie-ASR-model en presteert beter dan andere diffusiemodellen op LibriSpeech met een WER van 6,6%, maar blijft achter bij autoregressieve Whisper. De adapter wordt gedistribueerd onder Apache-2.0, terwijl DiffusionGemma en whisper-small apart geladen worden.

Het artikel legt aan de hand van het open-source model t0-alpha uit hoe tijdreeks-LLM's werken. t0-alpha is een 102M-parameter probabilistische voorspeller die sequenties in patches opdeelt en via een causaal transformer quantielen voorspelt. Op de GIFT-Eval benchmark scoort het model CRPS 0,4941 en MASE 0,7240, waarmee het alle klassieke baselines verslaat. De analyse toont aan dat kleine open modellen inmiddels competitief zijn met veel grotere systemen.

Amerikaanse en Chinese AI-onderzoekers waarschuwen dat de groei van kunstmatige intelligentie zonder wereldwijde samenwerking kan leiden tot een catastrofe, vergelijkbaar met een Tsjernobyl-moment. Ze vrezen onder meer massale werkloosheid, cybersecurityrisico's en misbruik van opensourcemodellen. Techbedrijven zoals Anthropic houden krachtige software achterwege uit angst voor misbruik.

Proton heeft een grote update uitgebracht voor zijn privacyvriendelijke chatbot Lumo, die nu afbeeldingen kan genereren, herkennen, analyseren en bewerken. De update, Lumo 2.0, introduceert ook een nieuwe denkmodus voor complexere taken. Proton gebruikt zero-access-encryptie om de privacy van gebruikers te waarborgen.

AssemblyAI maakt zijn spraakherkenningsmodellen beschikbaar voor zelfhosting op eigen infrastructuur, zowel in de cloud als on-premises. Hiermee kunnen organisaties voldoen aan compliance-eisen en data-soevereiniteit behouden terwijl ze gebruikmaken van dezelfde modellen als de cloud-API. De prijzen zijn sessiegebaseerd zonder extra kosten voor zelfhosting.

Ahmad Osman, oprichter van Osmantic, stelt dat open-source LLM's de kloof met propriëtaire modellen snel dichten. Tijdens zijn workshops op de AI Engineer World's Fair demonstreerde hij dat lokale AI op laptops en werkstations steeds capabeler wordt. Volgens Osman moeten gebruikers niet alleen naar het model kijken, maar ook naar de infrastructuur, zoals zoekmogelijkheden en tools, die bij hosted agents inbegrepen zijn.

OpenClaw, de gratis open source AI-agent, is nu beschikbaar als app op Android en iOS. Gebruikers kunnen hun telefoon koppelen aan de OpenClaw Gateway om agenten vanuit hun broekzak te laten werken. De agent wordt gebruikt voor uiteenlopende taken zoals coderen en maaltijdplanning.

Ontwikkelaars met Qwen3.6-35B-A3B en het Model Context Protocol (MCP) lokale AI-agenten kunnen bouwen die tools zoals GitHub en bestandssystemen kunnen aansturen zonder maatwerkcode. Het beschrijft de architectuur van Qwen3.6, het opzetten van een lokale inferentieserver en het implementeren van een GitHub-ontwikkelaarsassistent die issues leest, code doorzoekt en pull-requests aanmaakt. Het MCP-protocol maakt herbruikbare tooldefinities mogelijk die door elke MCP-compatibele client of model kunnen worden gebruikt.

Een artikel op Towards Data Science beschrijft een hybride lokale-cloud workflow voor LLM-toepassingen. Auteur combineert het lokale model Gemma 4 met GPT-5.4 van OpenAI om privacy te behouden terwijl cloud-rekencapaciteit wordt benut. Het artikel bespreekt vijf hybride patronen en geeft een concrete casestudy over een slimme thuisassistent.

DeepReinforce heeft Ornith-1.0 uitgebracht, een open weights LLM met MIT-licentie. Het model is beschikbaar in varianten van 9B tot 397B parameters en is gebouwd op Gemma 4 en Qwen 3.5. Ornith-1.0 behaalt state-of-the-art prestaties op codeerbenchmarks onder open-source modellen van vergelijkbare grootte. Simon Willison testte het model en rapporteert goede resultaten bij het uitvoeren van agent-taken.

Palantir Technologies en NVIDIA hebben een gezamenlijk initiatief aangekondigd om een AI-engine te ontwikkelen die de inzet van NVIDIA's Nemotron open modellen in soevereine omgevingen mogelijk maakt, gericht op Amerikaanse overheidsinstanties en beheerders van kritieke infrastructuur. Het platform combineert NVIDIA's AI-infrastructuur met Palantir's Artificial Intelligence Platform en biedt mogelijkheden zoals expliciete gegevensautorisatie, klantspecifieke isolatie en veilige perimeterhandhaving. Organisaties kunnen open modellen trainen, implementeren en verbeteren terwijl ze controle houden over hun gegevens en intellectueel eigendom.

Coinbase heeft zijn AI-uitgaven met bijna de helft verminderd door goedkopere standaardmodellen, geautomatiseerde modelroutering en agressief caching. Het bedrijf experimenteert met open-gewichtsmodellen zoals GLM 5.2 en Kimi 2.7 als standaard. De cache-hitrate steeg van 5% naar 60%. Werknemers krijgen meer transparantie in AI-gebruik in plaats van harde limieten.

Liquid AI heeft LFM2.5-230M uitgebracht, het kleinste model van het bedrijf met 230 miljoen parameters. Het model is geoptimaliseerd voor on-device agentische taken zoals data-extractie en toolgebruik, draait met 213 tokens per seconde op een Galaxy S25 Ultra en 42 op een Raspberry Pi 5, en verslaat grotere modellen zoals Qwen3.5-0.8B en Gemma 3 1B op instructievolging en data-extractie. De gewichten zijn open-source beschikbaar op Hugging Face.

Sebastian Raschka legt uit hoe je een volledig lokaal codeeragent opzet met opensource tools en open-weight LLM's zoals Qwen3.6. Het artikel vergelijkt lokale oplossingen met propriëtaire diensten als Codex en Claude Code en geeft een stapsgewijze handleiding. Ook wordt de prestaties van verschillende modellen beoordeeld.

Een blog op Towards Data Science beschrijft een stappenplan om van een lokaal LLM (Gemma 4) via Ollama, OpenAI Agents SDK en Tavily MCP een onderzoeksagent te maken. De agent kan webzoekopdrachten uitvoeren en antwoorden met bronvermeldingen genereren. Het artikel benadrukt dat het patroon ook met andere modellen en tools werkt.

Met MLX, een open-source arraybibliotheek van Apple, kunnen open taalmodellen lokaal op Macs met Apple Silicon worden fijnge... zonder cloud-GPU's. De tutorial behandelt installatie, data voorbereiden in JSONL-formaat, LoRA-training met kwantisatie, testen en het fuseren van de adapter. Het benut de unified memory architectuur voor efficiënte training op apparaten met 16 GB of meer.

Een C++-daemon genaamd VRAM Conductor maakt het mogelijk om drie verschillende LLM's te draaien op een enkele 8 GB NVIDIA GTX 1080 GPU door laag-multiplexing en toelatingscontrole. De daemon gebruikt een VRAM-grootboek en een 90%-cap om geheugenuitputting te voorkomen, gebaseerd op principes uit 5G-netwerken. Het artikel toont dat de aanpak slaagt waar drie afzonderlijke llama-completion-processen falen.

KDnuggets zet vijf open source omni AI-modellen op een rij die tekst, afbeeldingen, audio en video kunnen verwerken. Tot de modellen behoren NVIDIA Nemotron 3 Nano Omni, Google Gemma 4, Qwen3-Omni, DeepSeek Janus-Pro en MiniCPM-o. Deze modellen maken realtime multimodale interactie mogelijk zonder aparte systemen.

Hugging Face heeft een jaarlijkse omzetrunrate van $100 miljoen bereikt, aldus medeoprichter en CEO Clement Delangue. Het bedrijf blijft zijn platform gratis en open-source voor 97% van de gebruikers, terwijl het inkomsten genereert via freemium-abonnementen en enterprise-diensten. Delangue benadrukt de groeiende interesse van bedrijven in open en lokaal ingezette AI-systemen.

De auteur waarschuwt voor het blindelings vertrouwen op benchmarks bij het kiezen van AI-modellen. Hij pleit voor een use-case-gedreven aanpak, waarbij open-weight modellen zoals die van DeepSeek en NVIDIA vaak toereikend zijn voor alledaagse softwareontwikkeling.

Een overzicht van de beste lokale codeermodellen voor AI-ontwikkeling in 2026 belicht zeven modellen, waaronder Qwen3.6 27B MTP, Gemma 4 31B IT QAT en DiffusionGemma 26B A4B. Deze modellen zijn geschikt voor privé AI-codering, snelle GGUF-inferentie, agentische workflows en multimodale ontwikkeling, en kunnen op consumentenhardware worden gedraaid als alternatief voor gehoste assistenten.

Baseten, een AI-infrastructuur-startup uit San Francisco, heeft een API-implementatie van het open-source model GLM-5.2 van Z.ai gebouwd die meer dan 280 tokens per seconde levert. De prestatie wordt bereikt door een reeks inferentie-optimalisaties, waaronder modelkwantisatie, cachebeheer en speculatieve decodering. Het 744-miljard parameter grote mixture-of-experts model van Z.ai presteert volgens Baseten vergelijkbaar met toonaangevende propriëtaire systemen tegen 70–80% lagere kosten per token.

In een driedelige serie worden zes RAG-architecturen vergeleken op een lastig financieel document, volledig lokaal draaiend met open modellen. Deel 1 behandelt de tekstgebaseerde pijplijnen (Naive RAG, Hybrid RAG, en Hybrid RAG met ColBERT reranker) en de uitdaging van het parsen van grafiekrijke PDF's waar data in afbeeldingen staat. Het project is uitgevoerd onder de realistische beperking dat geen externe API's gebruikt mogen worden, zoals gebruikelijk in gereguleerde bankomgevingen.

Datalab heeft lift gelanceerd, een 9B open-gewichten visiemodel dat PDF's en afbeeldingen leest en gestructureerde JSON retourneert op basis van een meegeleverd schema. Het model haalt een veldaccuraatheid van 90,2% op een benchmark van 225 documenten en is het sterkste kleine zelfhostbare model dat het team testte. Lift gebruikt schema-constrained decoding en getrainde onthouding om hallucinaties te voorkomen. De code is Apache 2.0 en de gewichten vallen onder een aangepaste OpenRAIL-M-licentie.

In dit artikel wordt stap voor stap uitgelegd hoe je een lokale AI-codeeragent opzet met Ollama, Gemma 4 en OpenCode. Je leert hoe je Ollama installeert, een lokaal model downloadt en OpenCode configureert om met het model te werken. Alle data blijft volledig lokaal.

India richt zich op het bouwen van eigen funderingsmodellen, maar critici vragen zich af of post-training van open-weight modellen zoals Llama en Mistral niet sneller soevereiniteit oplevert. Techbeleidsonderzoeker Pranesh Prakash stelt dat soevereiniteit gaat over toegang tot open modellen, niet over eigendom. Ondanks experimenten met modellen als Airavata en OpenHathi, blijft massale adoptie uit en vertrouwt India nog sterk op buitenlandse aanbieders als OpenAI en Anthropic.

Een React Native-ingenieur ontwikkelt Wire RN, een open-source SDK voor Generative UI op mobiele platforms. De SDK stelt AI-modellen in staat om interfaces in realtime samen te stellen, in plaats van vooraf vastgelegde schermen. Webplatformen hebben al tools zoals Vercel AI SDK en Google's A2UI, maar mobiel mist native ondersteuning. Wire RN moet die leemte vullen.

Reflection AI betaalt vanaf 1 juli 2026 tot 2029 maandelijks 150 miljoen dollar voor directe toegang tot NVIDIA's nieuwste GB300 AI-chips en ondersteunende hardware in SpaceX's Colossus 2-datacenter in Memphis, Tennessee. De deal is maximaal 6,3 miljard dollar waard en kan na drie maanden met 90 dagen opzegtermijn worden beëindigd.

Sakana AI heeft Fugu gelanceerd, een orkestratietaalmodel dat multi-agent operaties coördineert en de afhankelijkheid van één leverancier vermindert. Het systeem routeert queries intern naar een pool van diverse modellen. Fugu Ultra presteert competitief tegen gesloten modellen en wordt al ingezet voor cybersecurity en code reviews.

Een artikel op Towards AI belicht elf GitHub-repositories die in 2026 opvallen voor AI-ontwikkelaars. De lijst omvat onder meer OpenClaw, een lokale AI-assistent die van 9.000 naar meer dan 200.000 sterren groeide, en pi-mono, een toolkit voor het bouwen van AI-agents. De repositories geven inzicht in de richting van AI-ontwikkeling, met nadruk op lokale uitvoering en praktische toepasbaarheid.

De start-up Squeez Labs heeft een AI-chatbot genaamd CrankGPT gebouwd die volledig offline werkt en wordt aangedreven door een handslinger. De chatbot draait op een Raspberry Pi 5 en gebruikt kleine taalmodellen zoals LFM2 van Liquid AI of Gemma van Google. Het apparaat garandeert privacy en zuinigheid doordat het geen internet of batterij nodig heeft.

Tijdens de G7-top riep Robin Rombach, medeoprichter en CEO van Black Forest Labs, wereldleiders op om open innovatie in AI te omarmen. Hij benadrukte dat open technologieën zoals Stable Diffusion en DeepSeek essentieel zijn voor transparantie en concurrentie, maar erkende ook de risico's van misbruik. Black Forest Labs werkt aan verantwoorde open modellen met minder kwetsbaarheden voor schadelijke content.

Het Indiase Avataar.ai heeft Varya gelanceerd, een AI-videogeneratiemodel dat video's produceert tegen een fractie van de kosten van concurrenten. Het model, ontwikkeld onder de IndiaAI Mission, bouwt voort op Alibaba's open-source Wan 2.2 en genereert video voor ₹0,48 per seconde, tot 27 keer goedkoper dan vergelijkbare modellen. Varya gebruikt een efficiënte distillatietechniek met slechts vier denoising-stappen, waardoor een 720p-video in 45 seconden wordt gegenereerd. Het model is ontworpen om Indiase culturele nuances beter te begrijpen en wordt beschikbaar gesteld via AIKosh.

Zhipu AI heeft zijn GLM-5.2-model open source gemaakt onder een MIT-licentie. Het model is technisch een evenknie van de topmodellen van Anthropic en OpenAI. De aankondiging leidde tot een koersstijging van bijna 50% van het bedrijf aan de beurs van Hong Kong. GLM-5.2 is sterk in coding, agentic workflows en lange context.

Z.ai heeft GLM-5.2 uitgebracht, een open-source model met MIT-licentie dat uitblinkt in coderen en agentische taken. Met 1M tokens context, twee redeneermodi en de IndexShare-technologie voor schaarse aandacht claimt het model topresultaten op diverse benchmarks, waaronder de nummer 1-positie in Design Arena en nummer 2 in Code Arena: Frontend. Het model wordt ondersteund door vele inferentieplatforms en wordt gezien als een belangrijke mijlpaal voor open-source AI.

Lokale AI-modellen zoals Qwen 2.5 32B presteren slecht op bedrijfsspecifieke vragen omdat ze geen toegang hebben tot interne documenten of live systemen. RAG (Retrieval Augmented Generation) en MCP (Model Context Protocol) bieden een oplossing: RAG indexeert documenten voor semantische terugvinding, MCP koppelt de AI aan tools zoals GitHub, databases en Slack. Samen maken ze van een algemene chatbot een AI die uw bedrijf écht kent, zonder data naar externe servers zoals OpenAI te sturen.

Deze handleiding laat zien hoe je een lokale LLM op je Mac Mini kunt draaien met OpenClaw en llama.cpp. Het doel is om maandelijkse API-kosten te vermijden. Het artikel gebruikt het Qwen 3.5-9B model en biedt stapsgewijze instructies voor installatie en configuratie.

De startup Mindbeam AI heeft Litespark-Inference uitgebracht, een open-source framework dat ternary large language models efficiënt laat draaien op standaard consumentenprocessors. Het framework levert volgens benchmarks 17 tot 96 keer hogere doorvoer dan standaard PyTorch-implementaties en reduceert het geheugengebruik met meer dan 80%. De broncode is beschikbaar op GitHub en ondersteunt Apple Silicon, Intel- en AMD-processoren.