Publié le 31 octobre 2025 à 15h05. Cisco lance SecureBERT 2.0, une nouvelle version de son modèle de langage spécialisé dans la cybersécurité, promettant une analyse des menaces plus rapide, plus précise et plus contextuelle grâce à une architecture améliorée et un ensemble de données d’entraînement élargi.
- SecureBERT 2.0, disponible sur Hugging Face et GitHub, surpasse son prédécesseur en termes de performance et d’efficacité.
- Le modèle est conçu pour aider les analystes de sécurité à traiter rapidement les rapports de sécurité, les analyses de logiciels malveillants et les rapports de vulnérabilité.
- SecureBERT 2.0 excelle dans la compréhension du langage technique spécifique à la cybersécurité, y compris le code source et la logique de programmation.
En 2022, Cisco, en collaboration avec des chercheurs de l’Université Carnegie Mellon et de l’UNC Charlotte, avait déjà introduit SecureBERT, un modèle de langage novateur spécifiquement conçu pour répondre aux besoins du domaine de la cybersécurité. Ce premier modèle avait permis de combler un fossé important entre les modèles de traitement du langage naturel (TLN) à usage général, comme BERT, et les exigences pointues des professionnels de la sécurité informatique. Il permettait aux systèmes d’intelligence artificielle de mieux comprendre le langage technique des menaces, des vulnérabilités et des exploits.
SecureBERT a rapidement gagné en popularité, se classant en décembre 2023 parmi les 100 modèles les plus téléchargés sur Hugging Face, une plateforme comptant à l’époque près de 500 000 modèles. Il est aujourd’hui activement utilisé par des organisations de premier plan, telles que le MITRE Threat Report ATT&CK Mapper (TRAM) et le CyberPeace Institute.
SecureBERT 2.0 s’appuie sur ces fondations solides en apportant des améliorations significatives. Le modèle original, bien que précieux, présentait certaines limites. Il avait notamment du mal à gérer des documents longs, comme les rapports détaillés sur les renseignements relatifs aux menaces, et à traiter des données combinant texte et code. De plus, basé sur RoBERTa-base, un encodeur BERT classique, il était relativement lent et gourmand en ressources lors de la formation et de l’inférence. SecureBERT 2.0, quant à lui, repose sur l’architecture ModernBERT, optimisée pour un contexte étendu, un débit plus rapide, une latence réduite et une consommation de mémoire moindre.
L’équipe de Cisco a également considérablement enrichi l’ensemble de données d’entraînement, en l’augmentant de 13 fois. Ce nouveau corpus comprend des articles de sécurité, des blogs techniques, des données de cybersécurité filtrées, des référentiels de vulnérabilités de code et des récits d’incidents. Au total, cet ensemble de données représente 13 milliards de jetons de texte et 53 millions de jetons de code. Un programme de pré-formation au microrecuit permet d’équilibrer qualité et diversité des données, améliorant ainsi la capacité du modèle à capturer les nuances subtiles de la sécurité.
SecureBERT 2.0 se distingue par sa capacité à interpréter et structurer l’information, offrant une inférence plus rapide, des coûts de calcul réduits et un risque d’hallucination minimisé. Contrairement aux grands modèles autorégressifs, tels que GPT-5, qui excellent dans la génération de langage, SecureBERT 2.0 est conçu pour comprendre, représenter et récupérer des informations avec précision, une nécessité cruciale en matière de cybersécurité. Il transforme des entrées entières en représentations denses et sémantiquement riches, capturant les relations, le contexte et la signification sans fabriquer de contenu.
Dans des scénarios concrets, SecureBERT 2.0 peut aider les analystes SOC à enquêter sur des compromissions potentielles de la chaîne d’approvisionnement en corrélant rapidement les renseignements open source, les alertes internes et les rapports de vulnérabilité. Le modèle peut également être utilisé pour la corrélation des renseignements sur les menaces, le triage des incidents, la détection sécurisée du code et des vulnérabilités, ainsi que pour la recherche sémantique et la récupération d’informations contextuelles.
L’architecture de SecureBERT 2.0 repose sur trois piliers : la base ModernBERT, l’extension des données et une approche améliorée de la pré-formation. ModernBERT, un transformateur de nouvelle génération, permet de capturer à la fois la syntaxe fine et la structure globale des documents longs. Le programme de pré-formation au microrecuit affine le modèle en lui apprenant à prédire les actions et entités de sécurité cruciales, renforçant ainsi sa compréhension du domaine.
SecureBERT 2.0 s’inscrit dans l’engagement continu de Cisco à appliquer l’intelligence artificielle de manière responsable dans le domaine de la cybersécurité, aux côtés d’autres modèles tels que Foundation-Sec-8B, développé par l’équipe Foundation AI de Cisco. Le document de recherche complet fournit des détails supplémentaires et une analyse comparative des performances.
Le modèle SecureBERT 2.0 est disponible dès aujourd’hui sur Hugging Face et GitHub. Cisco espère que ce modèle sera adopté par la communauté de la sécurité et qu’il ouvrira la voie à de nouvelles applications innovantes dans le domaine de la cybersécurité. L’avenir de l’IA en matière de cybersécurité est intelligent en toute sécurité.
Sur le même sujet
