Ingénierie d'IA · 100 % local · Apple Silicon
Je conçois des écosystèmes d'IA qui tournent entièrement sur votre machine.
Infrastructure d'inférence LLM multi-modèles consciente des ressources, RAG sourcé, agents outillés durcis contre l'OWASP ASI Top 10 — zéro cloud, zéro télémétrie.
Simulation : routage de requêtes, budget RAM 80 Go, éviction LRU. Cliquez un organe.
La vision
L'IA doit vous appartenir. Localement.
J'ai conçu et mis en production un écosystème d'intelligence artificielle entièrement local : neuf applications spécialisées — RAG documentaire, agent de code, synthèse vocale, génération musicale, analyse structurelle de partitions, moteur de lore, dashboard desktop — puis, surtout, le plan de contrôle qui les unifie : Klody Core.
Le constat fondateur : d'excellents organes, mais sans système nerveux. Chacun chargeait ses propres modèles, gérait sa propre mémoire — ~208 Go de poids redondants en RAM. La décision d'architecte ne fut pas d'écrire une app de plus, mais de construire l'infrastructure qui valorise tout l'existant.
Depuis, l'écosystème a franchi trois caps : indépendance totale (dernier runtime tiers retiré — tout passe par MLX et la bibliothèque standard), durcissement agentique (OWASP ASI Top 10 cartographié en contrôles réels, chaîne d'approvisionnement ramenée de 122 CVE à 0) et proactivité (l'assistant observe son propre usage, en tire des habitudes et propose — sous cap dur anti-spam).
- 01
Souveraineté
Zéro cloud, zéro télémétrie, bind loopback imposé. Vos données ne quittent jamais la machine.
- 02
Mutualisation
Un gateway conscient de la RAM partage des modèles de dizaines de Go entre toutes les apps, sous un budget unique.
- 03
Maturité
Services supervisés, éval qualité nocturne, abstractions réutilisables. De l'ingénierie, pas du prototype.
- 04
Preuve, pas promesse
Chaque affirmation est mesurée avant d'être écrite : vmmap plutôt que
ps rss, cosinus vérifié avant migration, latences annoncées à froid comme à chaud.
Savoir-faire
Des compétences, prouvées par le code.
Chaque signal est mappé à une compétence reconnaissable et à un niveau, étayé par l'historique réel.
Créations
Un écosystème, quinze organes.
Du plan de contrôle aux applications spécialisées — tout local, tout en production ou en chantier actif.
Code ouvert, démos cliquables
La majorité des dépôts est privée : ils indexent des données personnelles. Ce qui est généralisable part sur GitHub sous licence MIT — auditable ligne à ligne, pas seulement raconté.
Deux d'entre eux tournent en démo publique, et pas sur mon serveur : le calcul s'exécute dans le navigateur du visiteur, via WebAssembly. Rien n'est téléversé. Le principe que défend ce portfolio, appliqué à sa propre vitrine.
Sécurité & conformité
La sécurité n'est pas une phase de fin de projet.
Un agent qui exécute du code, lit des fichiers et se souvient est une surface d'attaque, pas une démo. Voici les contrôles réellement en place sur mon écosystème — ce sont eux que j'installe chez un client.
Chaîne d'approvisionnement Python : 122 → 0 CVE
Premier passage d'audit sur quatre environnements de production : 122 vulnérabilités connues. Résorbées intégralement — dont la racine réelle (un outil CLI installé dans le venv d'un service, qui y épinglait des versions périmées). Trois CVE sans correctif amont sont tracées nommément et revues chaque mois. Depuis, une section d'audit nocturne échoue au rouge à la moindre réapparition.
Veille réglementaire suivie : obligations de transparence des chatbots au 2 août 2026, marquage des contenus générés par IA au 2 décembre 2026 (AI Act européen).
Prestations
Trois façons de travailler ensemble.
Pour les organisations dont les données ne peuvent pas sortir : santé, juridique, défense, finance, secteur public. Une échelle d'engagement — on commence petit, on continue si ça sert.
Tarification sur devis, établie selon le périmètre réel — pas de grille au forfait aveugle. Mission à distance par défaut, déplacements possibles. Un audit se cadre en un appel de 30 minutes, devis sous 48 h.
Démo live
Le gateway, en mouvement.
Pilotez la simulation : envoyez des requêtes, réservez de la RAM pour l'audio, observez l'éviction LRU décider quel modèle décharger.
Déclencher une requête
Méthodes
Comment je travaille.
Contact
Parlons d'IA locale.
Un système LLM à auditer, une stack souveraine à bâtir, ou simplement une question d'architecte à architecte ? Écrivez — je réponds moi-même. Le dossier technique complet est téléchargeable ; les dépôts privés se visitent en visio.