Prompt injection
De Wiki du Numérique Responsable
La prompt injection est une technique d’attaque consistant à manipuler une IA générative en lui transmettant des instructions malveillantes, afin de contourner ses règles, d’orienter ses réponses ou d’obtenir des informations qu’elle ne devait pas divulguer.
Deux formes
- Injection directe
- l’attaquant formule lui-même la requête détournée
- Injection indirecte
- les instructions sont dissimulées dans un contenu que le système va lire : page web, document, courriel, ticket. L’utilisateur légitime déclenche l’attaque sans le savoir.
La seconde forme est la plus préoccupante dès lors qu’un système consulte des sources externes ou traite des documents entrants.
Pourquoi la parade est difficile
Un modèle de langage ne distingue pas structurellement les instructions des données : tout lui parvient comme du texte. Il n’existe donc pas d’équivalent des requêtes préparées qui ont réglé le problème des injections SQL.
Les mesures relèvent de l’architecture plutôt que du filtrage :
- limiter les droits du système aux actions strictement nécessaires ;
- exiger une validation humaine avant toute action irréversible, en particulier pour une IA agentique ;
- cloisonner les sources selon leur niveau de confiance ;
- journaliser les actions pour permettre l’analyse a posteriori.