Uw AI-modellen (LLM’s) draaien bij u.

Voor sommige gegevens loont het om verwerking ter plaatse af te wegen tegen de cloud. We ontwerpen een inferentieserver op maat, met netwerk, opslag en onderhoud duidelijk afgebakend.

Wat u krijgt

  • Een server met grafische kaart (GPU) op maat van uw gebruik, in uw eigen gebouw
  • Taalmodellen met open gewichten (open-weight) waarvan de licentie voor het beoogde gebruik is gecontroleerd
  • Transcriptie, spraaksynthese en beeldgeneratie volgens uw behoeften
  • Standaardkoppeling (API): uw tools koppelen erop zoals op een clouddienst
  • Netwerkstromen, logs, telemetrie en supporttoegang gecontroleerd

Waarom een server binnen uw muren

Medische, juridische, industriële en R&D-gegevens kunnen baat hebben bij minder overdrachten en meer controle. Updates, telemetrie, back-ups, gekoppelde tools en supporttoegang moet u nog steeds controleren. Eigen hardware schrapt geen verwerkers of auditplicht.

Wat we installeren

Modellen met open gewichten voor taal, transcriptie, spraak of beeld, gekozen na controle van licentie en voorwaarden. Een koppeling (API) die compatibel is met uw bestaande programma’s kan integratiewerk beperken. Mogelijkheden en parameters testen we per model.

Op maat van uw gebruik, niet van de marketing

Dimensionering hangt af van modellen, geheugen, gelijktijdige gebruikers, pieken en gewenste wachttijd. Eén machine volstaat voor sommige kmo-toepassingen, niet voor alle. De totale kost omvat energie, koeling, garantie, back-ups, beheer en vervanging.

Geïnstalleerd, uitgelegd, onderhouden

De opdracht kan installatie, integratie, opleiding en een onderhoudscontract omvatten. Updates, patches, back-ups, waarschuwingen en toegang op afstand krijgen een duidelijke verantwoordelijke. Continue bewaking (monitoring) zit er alleen in als een serviceniveau dat bepaalt.

Veelgestelde vragen

Welke hardware is er nodig?

Een server met grafische kaart (GPU) afgestemd op modellen, context, gelijktijdige gebruikers en wachttijd. Een toren kan volstaan voor sommige toepassingen; andere vragen meer geheugen of meerdere acceleratoren. We meten vóór de dimensionering.

Welke modellen kunnen erop draaien?

Recente modellen met open gewichten: taalmodellen voor tekst en documenten, transcriptie, spraaksynthese, beeldgeneratie. We controleren de licenties voor commercieel gebruik vóór we iets installeren.

Is het even goed als ChatGPT?

Voor een afgebakende taak kan een lokaal model volstaan, maar meet dat op een representatieve testset. Schiet lokaal tekort in kwaliteit, wachttijd of kost, dan past cloud of hybride misschien beter.

Wie staat in voor het onderhoud?

Het contract legt de verantwoordelijkheid bij uw team, ARCKONE of beide. Updates, patches, back-ups, bewaking en interventietijden staan er expliciet in, niet verondersteld.

En de AVG?

Een lokale opstelling kan overdrachten beperken als de hele stroom zo is ingesteld. Logs, telemetrie, back-ups, onderhoudstoegang, gekoppelde tools en beveiliging moet u nog documenteren. Eigen hardware garandeert geen AVG-conformiteit.

We kaderen het in 20 minuten.

Eén gesprek volstaat om te weten of dit een echt project waard is.

Een installatie afbakenen