Confidentialité par construction
Modèles, documents, journaux et mémoire restent sur votre matériel. Aucun détour par une API cloud.
0 dépendance cloudIA privée pour données sensibles
Je transforme vos documents et procédures sensibles en assistants IA utilisables sur votre propre matériel : réponses sourcées, actions contrôlées et aucune donnée envoyée à une API cloud.
Simulation : routage de requêtes, budget RAM 80 Go, éviction LRU. Cliquez un organe.
Ce que vos équipes gagnent
La contrainte de confidentialité devient une architecture exploitable, mesurable et transmissible à votre équipe.
Modèles, documents, journaux et mémoire restent sur votre matériel. Aucun détour par une API cloud.
0 dépendance cloudChaque réponse documentaire cite ses sources et refuse de conclure quand les preuves sont insuffisantes.
1,82 M de chunks indexésLecture seule par défaut, périmètres explicites et approbation humaine avant toute écriture sensible.
gates de sécurité en CIPlusieurs modèles partagent un budget mémoire unique, avec supervision et mesures à froid comme à chaud.
80 Go de budget RAMPrésentation vidéo · 31 secondes
Une vue d'ensemble courte de l'architecture, des garde-fous et des preuves déjà mesurées dans l'écosystème Karaibart.
Le constat fondateur
J'ai conçu et mis en production un écosystème d'intelligence artificielle entièrement local : dix-huit applications spécialisées — RAG documentaire, agent de code, synthèse vocale, génération musicale, analyse structurelle de partitions, moteur de lore, indexeur de samples, garde-fou mémoire.
Chacune chargeait ses propres modèles et gérait sa propre mémoire — environ 208 Go de poids redondants sur une machine qui en a 128. La décision d'architecte ne fut pas d'écrire une application de plus, mais de bâtir l'infrastructure qui valorise tout l'existant : un gateway conscient de la RAM, un budget unique, une éviction qui décide.
Depuis, l'écosystème a franchi trois caps : indépendance totale (le dernier runtime tiers a été retiré), durcissement agentique (OWASP ASI Top 10 traduit en contrôles réels, chaîne d'approvisionnement ramenée de 122 CVE à 0) et proactivité (l'assistant observe son propre usage et propose, sous cap dur anti-spam).
Zéro cloud, zéro télémétrie, bind loopback imposé. Vos données ne quittent jamais la machine.
Un gateway conscient de la RAM partage des modèles de dizaines de Go entre toutes les applications, sous un budget unique.
Services supervisés, éval qualité nocturne, abstractions réutilisables. De l'ingénierie, pas du prototype.
Chaque affirmation est mesurée avant d'être écrite : phys_footprint plutôt que ps rss, cosinus vérifié avant migration, latences annoncées à froid comme à chaud.
Le laboratoire
Chaque projet a sa page : ce que c'est, la décision d'architecte, et ce qui a mal tourné. Les post-mortems valent plus que les captures d'écran.
Plan de contrôle
Gateway MLX conscient de la RAM (budget 80 Go, éviction LRU, modèle épinglé), bus mémoire partagé, routeur d'intentions ReAct, journal d'usage et éval nocturne en 10 sections. Le « système nerveux » qui fédère tout l'écosystème.
Foundation model tabulaire
ML tabulaire SOTA 100 % local : classification calibrée + explicabilité SHAP. Recatégorisation de 694 livres appliquée en base, démo médicale hors-ligne.
RAG 100 % local
Réponses sourcées depuis la bibliothèque locale. 25 376 documents, 1,82 million de chunks, base de 20,4 Go, reranking et recherche cross-lingue.
Sécurité & conformité
Un agent qui exécute du code, lit des fichiers et se souvient est une surface d'attaque, pas une démo. Voici les contrôles réellement en place sur mon écosystème — ce sont eux que j'installe chez un client.
Premier passage d'audit sur quatre environnements de production : 122 vulnérabilités connues. Résorbées intégralement — dont la racine réelle, un outil en ligne de commande installé dans l'environnement virtuel d'un service, qui y épinglait des versions périmées. Trois CVE sans correctif amont sont tracées nommément et revues chaque mois. Depuis, une section d'audit nocturne échoue au rouge à la moindre réapparition.
Tout code produit par un modèle s'exécute dans un bac à sable : réseau coupé, écriture confinée à un dossier jetable, lecture des clés SSH, des identifiants cloud et des trousseaux interdite. Une sonde teste la cellule avant chaque exécution — cellule perméable, build rouge.
ASI05Le chemin mémoire → prompt est assaini de bout en bout, agent et synthèse vocale comprises. Une note stockée hier ne peut pas devenir une instruction aujourd'hui.
ASI06Neuf points d'écriture passent par une résolution de chemin résistante aux liens symboliques, bornée à des racines déclarées ; les noms de modèles sont filtrés par liste blanche.
ASI0217 services recensés, tous en boucle locale, un seul identifiant externe dans tout l'écosystème — et il est réductible à la lecture seule par un drapeau.
ASI03Qualité des réponses, code exécuté sous pytest, chaîne d'approvisionnement, posture système, fraîcheur du journal. Le verdict rouge est un signal, pas une décoration : il a déjà déclenché des correctifs réels.
GatesPare-feu actif en mode furtif, chiffrement disque, tous les services liés à 127.0.0.1, télémétrie coupée par défaut, secrets jamais en clair dans les fichiers de service.
PostePrestations
Pour les organisations dont les données ne peuvent pas sortir : santé, juridique, défense, finance, secteur public. Une échelle d'engagement — on commence petit, on continue si ça sert.
Sécurité & fiabilité d'un système LLM ou agentique
Je prends votre système tel qu'il tourne et je cherche par où il casse — pas en théorie, sur votre code.
Lire →Stack LLM on-premise, 100 % locale
L'architecture de référence de ce portfolio, adaptée à votre matériel et à vos contraintes réglementaires.
Lire →Éval continue, gates CI, observabilité
Un système IA se dégrade en silence. Le mien est surveillé toutes les nuits ; le vôtre peut l'être aussi.
Lire →Décrivez le cas d'usage, les données concernées et le matériel disponible. Je réponds personnellement sous 48 h ouvrées.