IA locale ou cloud : choisissez par tâche.

Le lieu d’exécution est un choix d’architecture, pas un label de confidentialité. Partez de la tâche, des données et du niveau de service, puis comparez le coût complet.

Par ARCKONE
  • Évaluez chaque tâche et ses flux de données.
  • Incluez matériel, énergie, exploitation et renouvellement dans le coût local.
  • Gardez une option hybride quand les contraintes diffèrent selon les tâches.

Décidez tâche par tâche

Extraction de champs, recherche documentaire, traduction, vision, génération d’images et assistants n’ont pas les mêmes besoins. Construisez un jeu de tests représentatif, fixez des seuils de qualité et de délai, puis comparez des modèles concrets.

La taille du modèle ne suffit pas. Contexte, mémoire de la carte graphique (GPU), nombre d’utilisateurs simultanés, compression du modèle (quantification) et logiciel de service changent les performances. Choisissez le matériel après cette évaluation.

Décidez tâche par tâche
CritèreQuestions
DonnéesQu’entre-t-il, où circule-t-il, que faut-il conserver ?
QualitéQuel taux d’erreur est acceptable et qui valide ?
ChargeCombien d’utilisateurs, de requêtes et de pics ?
ContinuitéQuel délai et quelle indisponibilité sont tolérables ?
ÉvolutionÀ quelle fréquence faut-il changer de modèle ?

Local ne veut pas automatiquement dire privé ou conforme

Un serveur sur site peut réduire certains transferts. Mais les données peuvent sortir par journaux, télémétrie, sauvegardes, mises à jour, outils connectés ou support. Un cloud peut offrir de bons contrôles contractuels et techniques. Cartographiez le flux réel.

Ollama propose un mode strictement local et n’écoute par défaut que l’interface locale, mais ces réglages restent à configurer. Le RGPD exige toujours des mesures techniques et organisationnelles adaptées. Posséder le matériel ne garantit ni confidentialité ni conformité.

  • Réseau, authentification et droits par rôle
  • Journaux, télémétrie et durées de conservation
  • Sauvegardes, chiffrement et restauration testée
  • Accès de maintenance et dépendances externes

Le coût local dépasse le prix de la carte graphique

Le coût local comprend la machine complète, l’énergie, le refroidissement, la garantie, l’installation, l’exploitation, les correctifs, la surveillance, les sauvegardes, les arrêts et le renouvellement. Le cloud comprend consommation, stockage, réseau, services gérés et risque de variation tarifaire.

La NVIDIA RTX PRO 6000 Blackwell Workstation Edition (96 Go de GDDR7) est un exemple haut de gamme. Elle convient à certains modèles et usages professionnels. Ce n’est ni un minimum ni un choix par défaut. Les tests et le budget décident.

L’hybride est souvent une architecture raisonnable

Documents sensibles et tâches stables peuvent rester sur une infrastructure contrôlée. Un service cloud absorbe alors les pics ou une fonction absente en local. Le routage est explicite : données, modèle autorisé, journalisation, repli, validation humaine.

Des serveurs comme vLLM offrent des connexions (API) compatibles avec les outils courants, ce qui facilite le changement de serveur de modèles. Compatible ne veut pas dire interchangeable : testez paramètres, réponses, outils et limites de chaque modèle.

Vérifiez aussi la licence du modèle

Des poids ouverts (open-weight) ne veulent pas dire logiciel libre (open source) ni usage commercial sans condition. Vérifiez la fiche du modèle, sa licence, ses restrictions d’usage et ses obligations de redistribution pour la version exacte déployée.

Questions fréquentes

Une IA locale protège-t-elle automatiquement les données ?

Non. Elle peut réduire certains transferts si le réseau, les journaux, la télémétrie, les sauvegardes et le support sont correctement configurés. Il faut vérifier l’architecture complète.

Le local coûte-t-il moins cher ?

Cela dépend de la charge, du matériel, de l’énergie, de la maintenance et du rythme de renouvellement. Comparez un coût complet sur la même durée et avec le même niveau de service.

Peut-on garder une API identique ?

Des serveurs locaux proposent des API compatibles avec des standards courants. Cette couche réduit le travail d’intégration, mais chaque modèle et serveur garde ses propres capacités et paramètres.

Passons de l’idée au processus.

ARCKONE peut analyser le processus, tester l’hypothèse et construire une première version mesurable.

Évaluer mon architecture