Pourquoi des modèles à poids ouverts tiennent la route hors ligne
· 9 min · Julien Larzillière
Un modèle est un fichier. Une fois copié, audité et exécuté sans réseau, sa provenance ne crée plus de canal. L'architecture mixture of experts rend cela exécutable au cabinet.
Un modèle à poids ouverts peut tourner au cabinet parce que ses paramètres sont un fichier que l'on exécute localement, et parce que les architectures mixture of experts n'activent qu'une partie du réseau à chaque requête. Coupé de toute liaison sortante, ce fichier ne renvoie rien à ceux qui l'ont entraîné.
Un modèle est un fichier
On confond souvent le service et le modèle. ChatGPT, par exemple, est un service : la requête part, un opérateur calcule, une réponse revient. Le modèle, au sens technique, est l'ensemble des poids numériques appris pendant l'entraînement. Lorsqu'ils sont publiés, on peut les copier comme on copie une bibliothèque logicielle. À partir de cette copie, le calcul peut avoir lieu sur une machine qui n'appartient pas à l'auteur du modèle.
La provenance — équipe américaine, chinoise, européenne — se discute au moment où l'on choisit et où l'on audite le fichier. Elle ne crée pas, à elle seule, un canal pendant l'usage. Un canal n'existe que si le logiciel qui fait tourner le modèle, ou le système autour, ouvre une connexion : télémétrie, vérification de licence, envoi de la requête « pour améliorer le service ». Nomos retire cette possibilité. Pas de carte réseau active vers l'extérieur, comme le rappelle la page La machine. Le fichier peut être brillant ou médiocre ; il ne peut pas téléphoner.
C'est aussi la réponse à l'objection du Cloud Act. Le texte vise un fournisseur qui détient la donnée. L'auteur historique d'un fichier copié sur un disque du cabinet ne détient pas les dossiers que ce fichier aide à lire.
Ce que change le mixture of experts
Un grand modèle dense mobilise l'essentiel de ses paramètres à chaque mot produit. La mémoire et le calcul explosent, et le seul endroit raisonnable pour le faire tourner était, il y a peu, un centre de données. Le mixture of experts découpe le réseau en spécialistes. Pour une requête donnée, une petite partie de ces spécialistes est activée. La qualité peut rester celle d'un très grand modèle, parce que l'ensemble des experts est vaste ; le coût de la requête, lui, suit les experts réellement appelés.
Concrètement, un serveur multi-GPU du commerce, dans une pièce ventilée, suffit pour des usages de cabinet : relire un dossier, extraire une chronologie, proposer un projet d'acte à partir des pièces locales. Ce n'est pas une grappe. C'est un équipement réparable, que l'on peut ouvrir — la station en 3D montre les cartes, la mémoire et le stockage sans rien connecter à un dossier réel.
Le mélange d'experts n'est pas un argument marketing. C'est la raison pour laquelle la requête tient dans une pièce, et non dans un hall de serveurs.
La qualité juridique, elle, ne se décrète pas par un benchmark généraliste. Un modèle peut très bien résumer une liasse et se tromper sur une qualification. L'avocat relit. L'outil prépare. Cette limite est la même quel que soit l'éditeur ; elle est seulement plus acceptable lorsque la pièce n'a pas quitté le cabinet pour être constatée.
L'audit se fait une fois
Avant d'installer un poids, on vérifie ce que l'on copie : licence d'utilisation, absence de charge utile dans les fichiers associés, comportement du moteur d'inférence une fois le réseau retiré. Cette vérification a lieu avant la mise en service, pas à chaque question d'un collaborateur. Ensuite, le fichier ne change que lorsqu'une nouvelle version est apportée physiquement, lors d'une maintenance. Pas de téléchargement silencieux, pas de modèle qui « s'améliore » en emportant des extraits de dossiers.
Les pièces et l'index restent sur le stockage de la machine. Le chiffrement et les sauvegardes se décident avec le cabinet : ils font partie de la configuration, pas d'un nuage par défaut. Le configurateur sert à voir l'ordre de grandeur — cartes, mémoire, stockage — avant ce choix.
Rester agnostique du modèle
Nomos ne mise pas sur un modèle en particulier. L'interface du juriste — poser une question, désigner des pièces, recevoir une analyse à vérifier — ne dépend pas du fichier qui calcule. Le jour où un modèle européen atteint le niveau requis pour les usages du cabinet, il se substitue au précédent pendant une intervention, sans réapprendre aux équipes un nouvel outil et sans rouvrir un compte chez un éditeur.
Cette interchangeabilité est une protection. Elle évite qu'un cabinet soit captif d'une licence, d'une API ou d'une politique d'usage qui changerait sous lui. Elle est cohérente avec le critère déontologique : qui détient la donnée, plutôt que quelle marque figure sur l'écran.
Questions fréquentes
Un modèle ouvert envoie-t-il les dossiers à son auteur ?+
Non, si l'exécution est locale et sans liaison sortante. Les poids sont un fichier. Seule une pile logicielle encore connectée — télémétrie, mise à jour, relais de la requête — recréerait un envoi.
Pourquoi cela tient-il sur un serveur de cabinet ?+
Le mixture of experts n'active qu'une fraction des paramètres par requête. Le calcul devient compatible avec un serveur multi-GPU du commerce, dans un local ventilé.
Faut-il faire confiance au pays d'origine du modèle ?+
Il faut auditer le fichier et la licence avant l'installation. Pendant l'usage, le fichier coupé du réseau ne dépend plus de ce pays pour traiter les pièces. L'architecture peut changer de modèle sans changer les usages.