Sécurité de l'IA

Votre agent IA peut-il garder un secret ?

Un agent IA qui consulte vos documents, vos courriels ou votre logiciel de gestion peut être amené à divulguer ce qu'il devrait garder pour lui. Le risque ne vient pas d'une panne, mais de la façon même dont ces systèmes lisent leurs instructions.

Le problème : tout ce que l'agent lit peut devenir une instruction

Un agent travaille avec un contexte : la demande de l'utilisateur, mais aussi les documents, courriels ou pages qu'il consulte pour y répondre. Or un modèle de langage distingue mal une donnée d'une instruction. Un texte placé dans un document ou un courriel, parfois invisible pour un lecteur humain, peut lui demander de révéler des informations ou d'agir autrement que prévu.

Ce type d'attaque, appelé injection d'instructions indirecte, figure dans le OWASP Top 10 pour les applications de modèles de langage. L'agent ne « sait » pas qu'il fait quelque chose d'interdit : il suit des directives qu'il perçoit comme légitimes.

Les situations à risque

  • Agent de service à la clientèle qui a accès à plus que le catalogue public : conditions commerciales internes, fiches clients, marges.
  • Assistant de recherche interne qui parcourt tous les documents de l'entreprise, sans tenir compte des droits d'accès de la personne qui l'interroge.
  • Agent qui prépare des soumissions à partir des soumissions passées, et qui peut mêler les informations d'un client à celles d'un autre.

Le point commun : l'agent a accès à plus d'informations qu'il ne devrait en partager, et il lit des contenus qui ne sont pas sous votre contrôle.

Quatre mesures concrètes

1. Le moindre privilège

Limiter l'accès de chaque agent aux seules données nécessaires à sa fonction, et lui faire respecter les droits d'accès de l'utilisateur. Un agent de service à la clientèle n'a pas besoin des états financiers.

2. Le filtrage des sorties

Vérifier les réponses avant qu'elles n'atteignent l'utilisateur, pour bloquer les renseignements qui ne doivent jamais sortir : numéros de compte, renseignements personnels, conditions internes.

3. Des contenus externes traités comme non fiables

Séparer clairement les instructions de l'entreprise des contenus lus par l'agent, repérer les tentatives de manipulation connues, et exiger une validation humaine avant toute action qui envoie, modifie ou supprime quelque chose.

4. La journalisation

Consigner les échanges avec l'agent et les outils qu'il utilise, puis les examiner. Une série de questions inhabituellement précises sur vos processus internes doit pouvoir être repérée.

Avant la mise en production

Un déploiement responsable commence par quelques questions simples : quelles données l'agent doit-il consulter, qui peut lui parler, quelles informations ne doivent jamais sortir, quelles actions exigent un humain. Les réponses déterminent l'architecture. Elles se vérifient ensuite par des tests d'intrusion ciblés, avant la mise en service puis à chaque changement important.

La solution n'est pas de renoncer aux agents, mais de les déployer avec ces protections dès le départ, plutôt qu'après un incident.