- Évaluez chaque tâche et ses flux de données.
- Incluez matériel, énergie, exploitation et renouvellement dans le coût local.
- Gardez une option hybride quand les contraintes diffèrent selon les tâches.
Décidez tâche par tâche
Extraction de champs, recherche documentaire, traduction, vision, génération d’images et assistants n’ont pas les mêmes besoins. Construisez un jeu de tests représentatif, fixez des seuils de qualité et de délai, puis comparez des modèles concrets.
La taille du modèle ne suffit pas. Contexte, mémoire de la carte graphique (GPU), nombre d’utilisateurs simultanés, compression du modèle (quantification) et logiciel de service changent les performances. Choisissez le matériel après cette évaluation.
| Critère | Questions |
|---|---|
| Données | Qu’entre-t-il, où circule-t-il, que faut-il conserver ? |
| Qualité | Quel taux d’erreur est acceptable et qui valide ? |
| Charge | Combien d’utilisateurs, de requêtes et de pics ? |
| Continuité | Quel délai et quelle indisponibilité sont tolérables ? |
| Évolution | À quelle fréquence faut-il changer de modèle ? |
Local ne veut pas automatiquement dire privé ou conforme
Un serveur sur site peut réduire certains transferts. Mais les données peuvent sortir par journaux, télémétrie, sauvegardes, mises à jour, outils connectés ou support. Un cloud peut offrir de bons contrôles contractuels et techniques. Cartographiez le flux réel.
Ollama propose un mode strictement local et n’écoute par défaut que l’interface locale, mais ces réglages restent à configurer. Le RGPD exige toujours des mesures techniques et organisationnelles adaptées. Posséder le matériel ne garantit ni confidentialité ni conformité.
- Réseau, authentification et droits par rôle
- Journaux, télémétrie et durées de conservation
- Sauvegardes, chiffrement et restauration testée
- Accès de maintenance et dépendances externes
Le coût local dépasse le prix de la carte graphique
Le coût local comprend la machine complète, l’énergie, le refroidissement, la garantie, l’installation, l’exploitation, les correctifs, la surveillance, les sauvegardes, les arrêts et le renouvellement. Le cloud comprend consommation, stockage, réseau, services gérés et risque de variation tarifaire.
La NVIDIA RTX PRO 6000 Blackwell Workstation Edition (96 Go de GDDR7) est un exemple haut de gamme. Elle convient à certains modèles et usages professionnels. Ce n’est ni un minimum ni un choix par défaut. Les tests et le budget décident.
L’hybride est souvent une architecture raisonnable
Documents sensibles et tâches stables peuvent rester sur une infrastructure contrôlée. Un service cloud absorbe alors les pics ou une fonction absente en local. Le routage est explicite : données, modèle autorisé, journalisation, repli, validation humaine.
Des serveurs comme vLLM offrent des connexions (API) compatibles avec les outils courants, ce qui facilite le changement de serveur de modèles. Compatible ne veut pas dire interchangeable : testez paramètres, réponses, outils et limites de chaque modèle.
Vérifiez aussi la licence du modèle
Des poids ouverts (open-weight) ne veulent pas dire logiciel libre (open source) ni usage commercial sans condition. Vérifiez la fiche du modèle, sa licence, ses restrictions d’usage et ses obligations de redistribution pour la version exacte déployée.