- Jede Aufgabe und ihre Datenflüsse bewerten.
- Hardware, Energie, Betrieb und Ersatz in die lokalen Gesamtkosten (TCO) einrechnen.
- Eine hybride Option behalten, wenn Aufgaben unterschiedliche Anforderungen haben.
Aufgabe für Aufgabe entscheiden
Feldextraktion, Dokumentensuche, Übersetzung, Bildverarbeitung, Bildgenerierung und allgemeine Assistenten haben unterschiedliche Anforderungen. Stellen Sie einen repräsentativen Testsatz zusammen, legen Sie Schwellen für Qualität und Latenz fest und vergleichen Sie dann echte Modelle.
Die Modellgröße allein reicht nicht. Kontext, GPU-Speicher, Parallelität, Quantisierung und Serving-Software beeinflussen die Leistung. Die Hardware sollte dieser Bewertung folgen.
| Kriterium | Fragen |
|---|---|
| Daten | Was geht hinein, wohin fließt es und was muss aufbewahrt werden? |
| Qualität | Welche Fehlerquote ist akzeptabel und wer prüft? |
| Last | Wie viele Nutzer, Anfragen und Spitzen? |
| Kontinuität | Welche Latenz und welche Ausfallzeit sind tragbar? |
| Wandel | Wie oft muss das Modell ersetzt werden? |
Lokal heißt nicht automatisch privat oder konform
Ein Server vor Ort kann manche Übertragungen verringern, doch Daten können weiterhin über Protokolle, Telemetrie, Backups, Updates, angebundene Tools oder Supportzugänge abfließen. Auch Cloud-Dienste können nützliche vertragliche und technische Kontrollen bieten. Bilden Sie den tatsächlichen Datenfluss ab.
Ollama bietet einen rein lokalen Modus und lauscht standardmäßig nur auf der lokalen Schnittstelle, aber diese Einstellungen müssen Sie selbst verwalten. Die DSGVO verlangt weiterhin geeignete technische und organisatorische Maßnahmen. Eigene Hardware garantiert weder Datenschutz noch Konformität.
- Netzwerk, Authentifizierung und rollenbasierter Zugriff
- Protokolle, Telemetrie und Aufbewahrungsfristen
- Backups, Verschlüsselung und getestete Wiederherstellung
- Wartungszugänge und externe Abhängigkeiten
Lokale Kosten gehen über den GPU-Preis hinaus
Die lokalen Gesamtkosten umfassen den Server, das übrige System, Energie, Kühlung, Garantie, Installation, Betrieb, Patches, Überwachung, Backups, Ausfälle und Ersatz. Die Cloud-Gesamtkosten umfassen Nutzung, Speicher, Netzwerk, verwaltete Dienste und Preisrisiko.
Die NVIDIA RTX PRO 6000 Blackwell Workstation Edition mit 96 GB GDDR7-Speicher ist eine Oberklasse-Option für manche Modelle und professionelle Lasten. Sie ist weder Mindestanforderung noch Standard. Tests und Budget bestimmen die Dimensionierung.
Hybrid ist oft eine vernünftige Architektur
Sensible Dokumente und stabile Aufgaben können auf kontrollierter Infrastruktur bleiben, während die Cloud Spitzen oder fehlende Fähigkeiten abdeckt. Das Routing muss ausdrücklich geregelt sein: Datenkategorie, erlaubtes Modell, Protokollierung, Ausweichlösung und menschliche Prüfung.
Server wie vLLM stellen APIs bereit, die mit gängigen Clients kompatibel sind, was einen Backend-Wechsel erleichtert. Kompatibel heißt nicht austauschbar: Testen Sie Parameter, Ausgaben, Tools und Grenzen für jedes Modell.
Auch die Modelllizenz prüfen
Offene Gewichte (Open Weight) bedeuten nicht automatisch Open Source oder uneingeschränkte kommerzielle Nutzung. Prüfen Sie Model Card, Lizenz, Nutzungsbeschränkungen und Weitergabepflichten für genau die Version, die Sie einsetzen.