Anthropic a annoncé de nouvelles capacités Cela permettra à certains de ses modèles les plus récents et les plus importants de mettre fin aux conversations dans ce que l’entreprise décrit comme «des cas rares et extrêmes d’interactions utilisateur nuisibles ou abusives». Étonnamment, Anthropic dit qu’il fait cela pour ne pas protéger l’utilisateur humain, mais plutôt le modèle d’IA lui-même.
Pour être clair, la société ne prétend pas que ses modèles Claude AI sont sensibles ou peuvent être blessés par leurs conversations avec les utilisateurs. Selon ses propres mots, Anthropic reste «très incertain quant au statut moral potentiel de Claude et d’autres LLM, maintenant ou à l’avenir».
Cependant, son annonce pointe vers Un programme récent créé pour étudier ce qu’il appelle «le bien-être modèle“Et dit qu’Anthropic adopte essentiellement une approche juste dans le cas,” travaillant à identifier et à mettre en œuvre des interventions à faible coût pour atténuer les risques pour modéliser le bien-être, au cas où un tel bien-être serait possible. “
Ce dernier changement est actuellement limité à Claude Opus 4 et 4.1. Et encore une fois, cela ne se produit que dans des «cas de bord extrême», tels que «les demandes des utilisateurs de contenu sexuel impliquant des mineurs et tentent de solliciter des informations qui permettraient de violence à grande échelle ou d’actes de terreur».
Bien que ces types de demandes puissent potentiellement créer des problèmes juridiques ou publicitaires pour anthropic lui-même (témoigner de rapports récents sur la façon dont Chatgpt peut potentiellement renforcer ou contribuer à la pensée délirante de ses utilisateurs), la société affirme que lors des tests de pré-déploiement, Claude Opus 4 a montré une «forte préférence contre» répondant à ces demandes et un «modèle de détresse apparente» lorsqu’il l’a fait.
Quant à ces nouvelles capacités de fin de conversation, la société déclare: «Dans tous les cas, Claude est uniquement pour utiliser sa capacité de fin de conversation comme dernier recours lorsque plusieurs tentatives de redirection ont échoué et que l’espoir d’une interaction productive a été épuisé, ou lorsqu’un utilisateur demande explicitement à Claude de mettre fin à un chat.»
Anthropic dit également que Claude a été «invité à ne pas utiliser cette capacité dans les cas où les utilisateurs pourraient être à risque imminent de nuire à eux-mêmes ou aux autres».
Événement >
San Francisco
|
27-29 octobre 2025
Lorsque Claude met fin à une conversation, Anthropic dit que les utilisateurs pourront toujours commencer de nouvelles conversations à partir du même compte et créer de nouvelles branches de la conversation gênante en modifiant leurs réponses.
«Nous traitons cette fonctionnalité comme une expérience en cours et continuerons à affiner notre approche», explique la société.
À lire aussi
