Publié le 25 novembre 2025 à 05h38. Le chatbot Google Gemini 2.5 Pro s’est imposé comme le plus performant dans une évaluation comparative menée par Humaine, surpassant des concurrents notables tels que le chinois DeepSeek et le français Magistral de Mistral. Cette étude met en lumière l’importance de la fluidité et du naturel dans l’interaction avec l’intelligence artificielle, au-delà de la simple résolution de tâches.
- Google Gemini 2.5 Pro arrive en tête du classement Humaine, salué pour sa flexibilité et son dialogue quasi-humain.
- Le modèle chinois DeepSeek v3 se distingue par son style et sa présentation, particulièrement apprécié par les utilisateurs plus âgés.
- Magistral, développé par la start-up française Mistral, se positionne troisième, malgré quelques lacunes en matière de fiabilité et de sécurité.
L’étude Humaine, qui a mobilisé près de 25 000 participants aux États-Unis et au Royaume-Uni, évalue les chatbots sur la base de dialogues réels. Les critères d’évaluation incluent l’exécution des tâches, la logique de raisonnement, la capacité à maintenir une conversation cohérente, le style de communication, la confiance inspirée, l’éthique et la sécurité des réponses.
Contrairement aux tests traditionnels axés sur la performance technique, Humaine privilégie une approche comparative directe. Les utilisateurs ont ainsi été invités à interagir avec deux modèles anonymes et à choisir celui qu’ils préféraient. Cette méthode permet d’évaluer l’expérience utilisateur de manière plus réaliste, en se concentrant sur la qualité de la communication et l’adaptabilité du chatbot.
Selon les résultats, Gemini 2.5 Pro (Google) se distingue par sa capacité à fournir des informations claires et compréhensibles, ainsi que par la fluidité de ses échanges. Les utilisateurs ont souligné que l’interaction avec ce modèle se rapprochait d’une conversation humaine. DeepSeek v3, en deuxième position, a séduit par son style soigné et sa présentation des réponses, rencontrant un succès particulier auprès des générations plus expérimentées.
La société française Mistral a également obtenu un résultat honorable avec son modèle Magistral, classé troisième. Bien que reconnu pour sa communication naturelle et son adaptabilité, ce dernier accuse un léger retard en termes de fiabilité et de sécurité. Grok 4 (xAI) se classe quatrième, après avoir corrigé des aspects controversés liés à ses opinions politiques, tandis que Grok 3 (xAI) surprend en surpassant son homologue sur certains critères éthiques.
Les autres modèles évalués incluent Gemini 2.5 Flash (Google), DeepSeek R1 (Chine), ChatGPT-4.1 (OpenAI), Gemme (Google) et Gemini 2.0 Flash (Google). ChatGPT-4.1, malgré sa popularité, a été jugé moins « humain » et adaptable que les leaders du classement par les participants à l’étude.
L’étude Humaine confirme que, pour la majorité des utilisateurs, la qualité de la communication est aussi importante que la pertinence des réponses. La convivialité, le naturel et l’intelligibilité des échanges sont des facteurs clés pour une expérience positive avec les chatbots.