Blog · AI & automatisering

AI lokaal draaien: DeepSeek, Mistral en co op je eigen server.

Geen enkele letter die je bedrijf verlaat: dat is de belofte van lokale AI. Met open modellen zoals DeepSeek, Mistral en Gemma en tools als Ollama draai je een taalmodel op je eigen hardware. Wanneer dat zin heeft, wat je nodig hebt en waar je op let.

8 min leestijd 30 september 2026 Gids
De kern

Lokale AI loont voor gevoelige gegevens, vaste taken en grote volumes. Met Ollama draai je een open model op een server met een degelijke GPU, en je gegevens verlaten nooit je netwerk. Verwacht wel niet dat een model dat op betaalbare hardware past, het niveau haalt van de beste cloudmodellen. En wil je DeepSeek gebruiken? Doe het dan lokaal, niet via de app.

Waarom zou je AI lokaal draaien?

Bij een cloud-AI zoals Claude of ChatGPT gaat je vraag, met de documenten die je meestuurt, naar de servers van de aanbieder. Met zakelijke plannen is dat goed geregeld, maar sommige bedrijven willen of mogen dat niet. Lokale AI draait op je eigen hardware, in je eigen netwerk. De voordelen:

  • Privacy: dossiers, contracten of patiënt- en leerlinggegevens verlaten nooit het gebouw.
  • Controle: jij bepaalt welk model draait en wanneer je updatet. Geen verrassingen van een aanbieder.
  • Voorspelbare kosten: een eenmalige investering in hardware in plaats van betalen per gebruik, wat loont bij grote volumes.
  • Geen internet nodig: het model werkt ook als de verbinding wegvalt.

De keerzijde is even eerlijk: je beheert zelf hardware en software, en de modellen die op een betaalbare server passen, zijn doorgaans minder sterk dan de beste cloudmodellen in complex redeneerwerk.

DeepSeek: sterk en open, maar kijk hoe je het gebruikt

DeepSeek is het bekendste open model uit China. De V4-familie van april 2026 is uitgebracht met open gewichten onder de MIT-licentie, en in september 2026 volgde V4.1-Flash. Open gewichten betekent dat je het model zelf mag downloaden en draaien, ook commercieel.

Maar let op het verschil tussen het model en de dienst. Volgens het eigen privacybeleid verwerkt en bewaart DeepSeek de gegevens van de app en de API in China, en kan je invoer gebruikt worden om modellen te trainen. De Italiaanse privacywaakhond blokkeerde de app al in januari 2025, en de Berlijnse toezichthouder meldde ze in juni 2025 bij Apple en Google als onwettig. Draai je de open gewichten zelf, dan gaat er niets naar DeepSeek.

Nog een realiteitscheck: de volledige V4-modellen zijn enorm. Voor V4-Pro rekent DeepSeek zelf op een datacenter-server met vier topklasse-GPU's. Wat wel lokaal draait, zijn de kleinere afgeleide DeepSeek-R1-versies, van 7 tot 70 miljard parameters, met downloads tussen 4,7 en 43 GB.

De beste open modellen voor bedrijven

DeepSeek is niet de enige optie, en voor Europese bedrijven vaak niet de logische eerste keuze. Dit zijn de sterkste open modellen in september 2026:

ModelVanLicentieGoed om te weten
Mistral Small 4, Ministral 3Mistral AI, ParijsApache 2.0Europees bedrijf, van 3 tot 119 miljard parameters
Gemma 4GoogleApache 2.0Van heel compact tot 31 miljard parameters
Qwen3.8AlibabaApache 2.0Onder meer een sterke versie van 27 miljard parameters
gpt-ossOpenAIApache 2.020b draait binnen 16 GB, 120b op één GPU van 80 GB
DeepSeek R1-distillsDeepSeek, ChinaMITEnkel lokaal gebruiken, niet via de app
Llama 4MetaEigen licentieBeperkingen voor bedrijven in de EU op de multimodale versies

Apache 2.0 en MIT zijn ruime licenties die commercieel gebruik toestaan. Bij Llama 4 ligt dat anders: het gebruiksbeleid van Meta onthoudt de rechten op de multimodale Llama 4-modellen aan bedrijven die in de EU gevestigd zijn. Voor een Belgisch bedrijf is dat reden genoeg om voor Mistral, Gemma of Qwen te kiezen.

Welke hardware heb je nodig?

De vuistregel: het model moet in het geheugen passen, idealiter in het geheugen van de GPU. De downloadgrootte in Ollama geeft een goede eerste indicatie, en daarbovenop heb je nog wat ruimte nodig voor je vragen en documenten.

  • Experimenteren: een werkstation met een recente GPU draait modellen van 7 tot 14 miljard parameters vlot, genoeg voor samenvatten, classificeren en eenvoudige vragen.
  • Voor een team: voor modellen rond 30 miljard parameters reken je op een GPU met ongeveer 24 GB geheugen, of kies je gpt-oss-20b, dat binnen 16 GB past.
  • Zwaarder werk: vanaf 70 miljard parameters heb je meerdere GPU's of een professionele kaart nodig, en de allergrootste modellen draaien enkel in een datacenter.

Twijfel je? Begin klein, meet of de kwaliteit volstaat voor jouw taak, en schaal pas daarna op. Een te grote server kopen voor een taak die een klein model ook aankan, is weggegooid geld.

De tools om het te draaien

  • Ollama: de eenvoudigste start. Met één commando download en draai je een model, en het biedt een API die je andere software kan gebruiken. MIT-licentie.
  • LM Studio: een handige desktop-app om modellen te testen. De licentie staat persoonlijk en intern zakelijk gebruik toe, maar geen doorverkoop als dienst.
  • llama.cpp: de motor onder veel lokale tools, licht en efficiënt. MIT-licentie.
  • vLLM: voor een server die veel gebruikers tegelijk bedient. Apache 2.0-licentie.

Lokale AI in je workflows

Een lokaal model wordt pas echt nuttig als het in je processen zit. n8n koppelt standaard met Ollama, en n8n biedt zelfs een starterspakket dat n8n, Ollama, een vectordatabase en PostgreSQL samen op je eigen server zet. Zo bouw je een volledige AI-automatisering, van een binnenkomend document tot een antwoord, zonder dat er één byte je netwerk verlaat. n8n zegt er wel bij dat dat pakket bedoeld is om te testen: voor productie beveilig je het eerst. Hoe je dat met containers aanpakt, lees je in Docker voor bedrijven.

Lokaal, cloud of allebei?

Voor de meeste kmo's is het antwoord: allebei. Laat gevoelige of zeer grote volumes lokaal verwerken, en gebruik voor complex denkwerk een sterk cloudmodel via een zakelijk plan, waar je gegevens niet voor training gebruikt worden. Welk cloudmodel past, lees je in onze gids over de Claude-modellen en in onze vergelijking van ChatGPT, Claude, Gemini en Grok.

Hoe Vonkit helpt

Lokale AI is voor de helft software en voor de helft infrastructuur. We adviseren over de hardware, installeren en beveiligen de server in je netwerk, kiezen en testen het model op jouw taken, en koppelen het aan je workflows. Zelf-gehoste software is ons niet vreemd: onze eigen netwerktool NetSweep draait volledig binnen het netwerk van de klant. Meer over onze aanpak lees je op AI in je software.

Veelgestelde vragen

Is DeepSeek veilig voor bedrijven?

De DeepSeek-app en -API verwerken en bewaren gegevens in China, en de Italiaanse privacywaakhond blokkeerde de app. Draai je de open gewichten van DeepSeek zelf op je eigen server, dan gaat er niets naar DeepSeek. Voor Europese bedrijven zijn Mistral, Gemma of Qwen vaak een logischer keuze.

Wat heb je nodig om een AI-model lokaal te draaien?

Een computer of server met genoeg geheugen, idealiter op de GPU, en een tool zoals Ollama. Modellen van 7 tot 14 miljard parameters draaien op een werkstation met een recente GPU, grotere modellen vragen zwaardere hardware.

Is lokale AI even goed als ChatGPT of Claude?

Meestal niet voor complex redeneerwerk. Modellen die op betaalbare hardware passen, zijn wel sterk genoeg voor samenvatten, classificeren, gegevens uitlezen en vragen over je eigen documenten.

AI binnen je eigen muren

Wil je AI die je netwerk nooit verlaat?

Vertel ons welke gegevens je wil verwerken en hoeveel. Je krijgt binnen één werkdag advies over model, hardware en kost, of een eerlijk advies om toch voor de cloud te kiezen.