Publié le 29 décembre 2025 à 20h15. OpenAI a renforcé la sécurité de son agent ChatGPT Atlas, basé sur un navigateur, pour contrer une nouvelle forme d’attaque informatique appelée « injection rapide », qui pourrait permettre à des acteurs malveillants de détourner le comportement de l’IA à des fins frauduleuses.
- OpenAI a déployé des défenses au niveau du modèle et du système pour empêcher les instructions malveillantes de prendre le contrôle de l’agent.
- L’entreprise utilise un système automatisé de « red teaming » basé sur l’apprentissage par renforcement pour identifier et contrer les nouvelles techniques d’injection rapide.
- Des mesures de sécurité opérationnelles sont recommandées aux organisations pour limiter l’accès et les autorisations des agents IA, ainsi que pour surveiller leur comportement.
L’injection rapide représente une nouvelle menace pour la cybersécurité, exploitant la capacité des agents d’intelligence artificielle à interpréter des instructions en langage naturel provenant de diverses sources. Contrairement aux attaques web traditionnelles, elle ne repose pas sur des vulnérabilités logicielles, ce qui la rend plus difficile à détecter et à contrer avec les outils de sécurité classiques.
Selon OpenAI, un attaquant pourrait, par exemple, envoyer un courriel malveillant dans le but de tromper l’agent et de le forcer à transmettre des informations sensibles, telles que des documents fiscaux, à une adresse contrôlée par l’attaquant.
« … un attaquant pourrait envoyer un e-mail malveillant pour tenter de tromper un agent pour qu’il ignore la demande de l’utilisateur et, à la place, transmette des documents fiscaux sensibles à une adresse e-mail contrôlée par l’attaquant. »
OpenAI
Pour anticiper ces attaques, OpenAI a mis en place un système automatisé de équipe rouge, alimenté par l’apprentissage par renforcement. Ce système utilise de grands modèles de langage pour simuler des attaques et découvrir des techniques d’injection rapide sophistiquées, même sur des flux de travail complexes en plusieurs étapes. Lorsqu’une nouvelle vulnérabilité est identifiée, une boucle de rétroaction rapide est déclenchée pour entraîner des modèles d’agents plus résistants et renforcer les défenses au niveau du système.
OpenAI recommande aux organisations d’adopter une approche prudente en considérant les agents d’IA comme des acteurs semi-fiables. Il est crucial de limiter leur accès aux données et aux systèmes, de définir des autorisations minimales pour chaque tâche, et de mettre en place des contrôles opérationnels stricts. Cela inclut l’utilisation d’invites claires et précises, la demande de confirmation pour les actions sensibles, la limitation de l’accès aux sites web et aux outils, ainsi que la surveillance continue du comportement de l’agent.
- Limiter l’accès connecté et restreindre les autorisations des agents afin qu’ils opèrent avec l’autorité minimale requise pour chaque tâche.
- Utiliser des invites explicites et à portée étroite et éviter les instructions générales qui donnent aux agents une grande latitude pour interpréter le contenu non fiable.
- Exiger une confirmation renforcée ou une approbation secondaire pour les actions sensibles telles que le partage de données, les transactions financières ou les modifications du système.
- Limiter l’accès des agents à des sites Web, des outils et des ressources spécifiques par tâche pour réduire l’exposition à des entrées non fiables ou inutiles.
- Surveiller et enregistrer le comportement de l’agent pour détecter la dérive d’intention, les actions anormales ou les écarts par rapport à la demande initiale de l’utilisateur.
- Isoler les agents IA des systèmes centraux et appliquer des limites d’exécution ou des contrôles de débit pour réduire le rayon de souffle si une injection rapide se produit.
L’émergence de l’injection rapide souligne un changement profond dans le paysage de la cybersécurité. Avec l’intégration croissante de l’IA dans les flux de travail quotidiens, les modèles de sécurité traditionnels, basés sur des autorisations statiques et des contrôles de périmètre, deviennent moins efficaces. Les organisations doivent donc repenser leur approche de la confiance, de la vérification et de la surveillance des systèmes basés sur l’IA.
De nombreuses entreprises se tournent vers les principes de confiance zéro pour éliminer la confiance implicite et appliquer une vérification continue dans les flux de travail basés sur l’IA.