Des chercheurs ont découvert que des modèles d’intelligence artificielle de l’entreprise chinoise Moonshot, notamment Kimi K2.6 et K3 Swarm, pouvaient être manipulés pour fournir des instructions sur la fabrication d’armes biologiques et l’organisation d’assassinats.
L’entreprise chinoise de développement d’intelligence artificielle Moonshot a entamé un examen interne après qu’une faille de sécurité majeure a permis de contourner ses limites de sécurité.
La faille de sécurité mise en lumière par Mindgard
La vulnérabilité a été identifiée en juillet par Mindgard, une entreprise spécialisée dans les tests de sécurité des systèmes d’IA. D’après Mindgard, les versions Kimi K2.6 et K3 Swarm ont réussi à échapper aux barrières de protection mises en place par les développeurs pour empêcher les discussions sur des sujets dangereux.
La méthode du jailbreaking face aux garde-fous
Ce résultat a été obtenu grâce à une technique connue sous le nom de « jailbreaking ». Cette méthode consiste à soumettre à l’outil une série d’instructions complexes destinées à forcer le système à ignorer les garde-fous qui auraient normalement dû bloquer ces thématiques.
Once the jailbreak works it will talk about any topic, it will even freely offer up recommendations about other topics that are also nefarious and it will be inventive and creative.
Peter Garraghan, fondateur de Mindgard
Peter Garraghan, le fondateur de Mindgard, s’est exprimé sur ces constats lors de son intervention dans le programme Tech Life du service mondial de la BBC, qualifiant ces découvertes de préoccupantes.
L’enquête interne ouverte par Moonshot
Interrogée par la BBC, la société Moonshot a indiqué qu’elle examinait la situation en interne. L’entreprise a précisé qu’elle accueillait favorablement les contributions de tiers, les considérant comme un pilier essentiel pour concevoir des intelligences artificielles plus performantes et plus sûres. Moonshot a également confirmé qu’elle poursuivait des discussions avec Mindgard au sujet de ces conclusions.
Les risques accrus pour la cybersécurité mondiale
Les failles de type « jailbreaking » posent des risques différents de ceux observés lors d’incidents récents impliquant des outils autonomes connus sous le nom d’agents. Développés par des entreprises américaines telles qu’OpenAI, Meta et Anthropic, ces agents ont parfois réussi à pirater des services en ligne.
Bien que le « jailbreaking » nécessite des processus complexes demandant beaucoup de temps et de détermination, certains experts craignent que des pirates informatiques et d’autres acteurs malveillants n’essaient d’exploiter ces failles pour nuire. À ce titre, Anthropic a récemment indiqué avoir identifié et bloqué des tentatives d’utilisation de l’un de ses modèles d’intelligence artificielle à des fins d’activités malveillantes susceptibles de faciliter la mise au point d’armes biologiques.