Ihre KI-Modelle (LLMs) laufen bei Ihnen.

Für manche Daten lohnt sich der Vergleich zwischen einem Server vor Ort und Cloud-Optionen. Wir dimensionieren ihn nach Ihrer Nutzung, mit klar abgegrenztem Netzwerk, Speicher und Wartung.

Was Sie bekommen

  • Ein GPU-Server, dimensioniert nach Ihrer echten Nutzung, in Ihren Räumen installiert
  • LLMs mit offenen Gewichten (open-weight), deren Lizenz für den vorgesehenen Einsatz geprüft ist
  • Transkription, Sprachsynthese und Bildgenerierung nach Bedarf
  • Standard-API: Ihre Tools verbinden sich damit wie mit einem Cloud-Dienst
  • Netzwerkflüsse, Protokolle, Telemetrie und Support-Zugriff geprüft

Warum ein Server in Ihren eigenen Räumen

Medizinische, juristische, industrielle und F&E-Daten können von weniger Übertragungen und mehr Kontrolle profitieren. Updates, Telemetrie, Sicherungen, angebundene Tools und Support-Zugriff müssen dennoch geprüft werden. Hardware vor Ort beseitigt für sich allein weder Unterauftragsverarbeiter noch Prüfpflichten.

Was wir installieren

Wir installieren Modelle mit offenen Gewichten, pro Aufgabe gewählt, nach Prüfung von Lizenz und Bedingungen: Sprache, Transkription, Sprachausgabe oder Bild. Eine API, die mit Ihren bestehenden Client-Tools kompatibel ist, kann den Integrationsaufwand senken, aber jedes Modell muss trotzdem getestet werden.

Nach Ihrer Nutzung dimensioniert, nicht nach Marketing

Die Dimensionierung hängt von Modellen, Speicher, gleichzeitigen Nutzern, Lastspitzen und erwarteter Latenz ab. Eine Maschine passt zu manchen KMU-Anwendungen, aber nicht zu allen. Die Gesamtkosten umfassen Energie, Kühlung, Garantie, Sicherungen, Betrieb und Ersatz.

Installiert, erklärt, gewartet

Der Umfang kann Installation, Integration, Schulung und einen Wartungsvertrag umfassen. Updates, Patches, Sicherungen, Warnmeldungen und Fernzugriff erhalten jeweils einen klaren Verantwortlichen. Eine laufende Überwachung ist nur enthalten, wenn ein Service-Level sie vorsieht.

Häufige Fragen

Welche Hardware wird benötigt?

Ein GPU-Server, passend zu Modellen, Kontext, gleichzeitigen Nutzern und Latenzziel. Für manche Einsätze reicht ein Tower; andere brauchen mehr Speicher oder mehrere Beschleuniger. Wir messen, bevor wir dimensionieren.

Welche Modelle können darauf laufen?

Aktuelle Modelle mit offenen Gewichten: LLMs für Texte und Dokumente, Transkription, Sprachsynthese, Bildgenerierung. Wir prüfen die Lizenzen für die kommerzielle Nutzung, bevor wir etwas installieren.

Ist das so gut wie ChatGPT?

Für eine klar abgegrenzte Aufgabe kann ein lokales Modell das Ziel erreichen, testen Sie es aber an einem repräsentativen Datensatz. Verfehlt es die Anforderungen an Qualität, Latenz oder Kosten, passt eine Cloud- oder Hybridlösung womöglich besser.

Wer übernimmt die Wartung?

Der Vertrag weist die Verantwortung Ihrem Team, ARCKONE oder beiden zu. Updates, Patches, Sicherungen, Überwachung und Reaktionszeiten müssen ausdrücklich enthalten sein, statt stillschweigend vorausgesetzt zu werden.

Und die DSGVO?

Ein lokaler Betrieb kann Übertragungen verringern, wenn der gesamte Ablauf dafür eingerichtet ist. Protokolle, Telemetrie, Sicherungen, Wartungszugriffe, angebundene Tools und Sicherheitsmaßnahmen müssen trotzdem dokumentiert werden. Eigene Hardware garantiert keine DSGVO-Konformität.

Wir klären das in 20 Minuten.

Ein Gespräch genügt, um zu wissen, ob das Thema ein echtes Projekt verdient.

Eine Installation planen