- Evalueer elke taak en haar datastromen.
- Neem hardware, energie, beheer en vervanging op in de lokale totale kost (TCO).
- Behoud een hybride optie wanneer taken verschillende eisen hebben.
Beslis taak per taak
Veldextractie, documentzoeken, vertaling, beeldherkenning, beeldgeneratie en algemene assistenten hebben andere noden. Bouw een representatieve testset, leg drempels voor kwaliteit en wachttijd vast en vergelijk dan concrete modellen.
Modelgrootte alleen volstaat niet. Context, geheugen van de grafische kaart (GPU), aantal gelijktijdige gebruikers, compressie van het model (quantisatie) en serversoftware beïnvloeden de prestaties. Hardware volgt pas na die evaluatie.
| Criterium | Vragen |
|---|---|
| Gegevens | Wat komt binnen, waar stroomt het en wat blijft bewaard? |
| Kwaliteit | Welke foutenmarge is aanvaardbaar en wie controleert? |
| Belasting | Hoeveel gebruikers, aanvragen en pieken? |
| Continuïteit | Welke wachttijd en uitval zijn toelaatbaar? |
| Evolutie | Hoe vaak moet het model veranderen? |
Lokaal betekent niet automatisch privé of conform
Een server ter plaatse kan overdrachten verminderen. Toch kunnen gegevens vertrekken via logs, telemetrie, back-ups, updates, gekoppelde tools of supporttoegang. Een clouddienst kan contractuele en technische controles bieden. Breng de echte stroom in kaart.
Ollama biedt een strikt lokale modus en luistert standaard alleen op de lokale interface, maar die instellingen moeten worden beheerd. De AVG blijft passende technische en organisatorische maatregelen eisen. Eigen hardware garandeert privacy noch conformiteit.
- Netwerk, authenticatie en toegangsrollen
- Logs, telemetrie en bewaartermijnen
- Back-ups, versleuteling en getest herstel
- Onderhoudstoegang en externe afhankelijkheden
De lokale kost is meer dan de prijs van de grafische kaart
De lokale totale kost omvat server, de rest van het systeem, energie, koeling, garantie, installatie, beheer, patches, bewaking, back-ups, uitval en vervanging. De totale cloudkost omvat verbruik, opslag, netwerk, beheerde diensten en prijsrisico.
De NVIDIA RTX PRO 6000 Blackwell Workstation Edition met 96 GB GDDR7-geheugen is een duur topvoorbeeld voor bepaalde modellen en professionele toepassingen. Het is geen minimum of standaardkeuze. Tests en budget bepalen de dimensionering.
Hybride is vaak een redelijke architectuur
Gevoelige documenten en stabiele taken kunnen op gecontroleerde infrastructuur blijven, terwijl cloud een piek of een lokaal ontbrekende functie afhandelt. De verdeling moet expliciet zijn: datacategorie, toegestaan model, logboek, terugvaloptie en menselijke controle.
Servers zoals vLLM bieden koppelingen (API’s) die met courante programma’s compatibel zijn, wat een wissel van modelserver eenvoudiger maakt. Compatibel betekent niet uitwisselbaar: test parameters, resultaten, tools en beperkingen per model.
Controleer ook de modellicentie
Open gewichten (open-weight) betekenen niet automatisch open source of onbeperkt commercieel gebruik. Controleer de modelkaart, licentie, gebruiksbeperkingen en herverdelingsplichten voor de exacte versie die u inzet.