Aller au contenu
Jawad Boujnane
LinkedIn (nouvel onglet)

Notes d’architecture · · 2 min de lecture

Laisser agir un agent IA : lecture seule par défaut, six conditions pour l’exception

Un agent IA n’est pas une fonctionnalité : c’est un composant d’architecture, avec une identité, des flux et des droits. La décision ADR-006 du dossier : l’agent lit par défaut, n’agit que par exception tracée, et jamais sans six garde-fous.

ADR-006, statut « accepté » le 21 septembre 2026. Cas d’étude générique, aucune donnée client.

Le problème : un agent qui agit hérite de tout ce qu’il touche

Un agent capable d’appeler des outils lit des données, déclenche des actions et écrit vers des services. Sans cadre, il cumule les droits de ses outils et n’en répond devant personne.

Le module M13 de la base pose le principe : l’IA n’est pas un sujet à part, c’est un nouveau composant d’architecture, avec des identités, des flux et des responsabilités. Il se gouverne donc comme les autres : moindre privilège, traçabilité, arrêt possible.

Trois niveaux d’autonomie

  • Lecture seule : l’agent analyse, rédige, propose ; l’humain exécute. Surface d’action nulle, gain déjà élevé. Retenu par défaut pour tout nouvel agent.
  • Action bornée : outils listés, plafonds, validation humaine sur l’irréversible, journal, arrêt d’urgence. Accordée par exception, sur décision tracée.
  • Autonomie complète sur la production : un incident unique peut être irréversible, l’injection indirecte devient une compromission, la responsabilité est difficile à établir. Rejetée.

Six conditions opposables pour l’exception

  • Identité dédiée par agent, jamais partagée avec un humain ni avec un autre agent.
  • Liste blanche d’outils, revue périodiquement : tout outil non listé est refusé, même s’il devient techniquement disponible.
  • Plafonds par agent : volume, cadence, portée de données, et plafond financier lorsqu’une dépense est possible.
  • Validation humaine obligatoire pour l’irréversible : suppression, modification de droits, publication externe, engagement financier, action sur un système industriel.
  • Journal exploitable par action (agent, outil, entrée, sortie, décision), corrélé au SIEM.
  • Arrêt d’urgence testable, avec un délai cible mesuré, exécutable sans dépendre de l’agent lui-même.

Une règle complète l’ensemble : les entrées d’un agent (documents, tickets, courriels, contenus web) sont non fiables. Aucune action sensible ne peut être déclenchée par un contenu non vérifié : c’est la parade de principe à l’injection de prompt indirecte.

Le cas du RAG : la fuite par l’index

Un assistant RAG peut restituer une information à laquelle l’utilisateur n’a pas accès, si l’index agrège des documents au-delà de ses droits. La correction est le cloisonnement des sources par périmètre de droits, pas un filtre après coup.

Pour la mise en production, chaque référentiel a son rôle : l’OWASP Top 10 LLM pour la revue de l’application (injection de prompt, divulgation d’informations sensibles, faiblesses des vecteurs et embeddings), MITRE ATLAS pour le threat model et les scénarios de test, l’AI Act pour classer l’usage.

Sur le terrain

Chez Thales, analyse de risques EBIOS RM d’un poste IA isolé, avec des LLM open source hébergés en local : risques propres à l’IA générative cadrés, mesures de cloisonnement validées en homologation. Les conditions de l’ADR-006 prolongent ce cadrage au cas, plus exposé, d’un agent qui agit.

En discuter sur LinkedIn (nouvel onglet)Toutes les notes