Publié le 18 décembre 2025 à 15h49. La course à l’intelligence artificielle générative d’images s’intensifie avec le lancement de GPT Images 1.5 par OpenAI, qui promet une vitesse accrue, une meilleure compréhension des instructions et un contrôle plus précis des résultats, défiant ainsi la domination de Google et de son outil Nano Banana.
- GPT Images 1.5 d’OpenAI offre une vitesse de génération d’images supérieure et une meilleure interprétation des requêtes des utilisateurs.
- Les tests comparatifs montrent qu’OpenAI excelle dans la création d’ambiances visuelles, tandis que Google se distingue par la fidélité aux détails originaux.
- GPT Images 1.5 intègre un nouvel onglet “Images” dans son chatbot, proposant des styles prédéfinis et des modèles pour faciliter la création.
Après avoir vu des acteurs comme Midjourney s’imposer, puis Google prendre de l’avance avec son outil Nano Banana, OpenAI entre dans la danse avec GPT Images 1.5. Ce nouveau modèle d’intelligence artificielle promet non seulement une génération d’images plus rapide, mais aussi une plus grande précision dans l’exécution des instructions et un contrôle accru sur le rendu final.
L’environnement du chatbot d’OpenAI a également été repensé. Un nouvel onglet “Images” a été ajouté, transformant l’application en un véritable centre de création visuelle. Les utilisateurs y trouveront des styles préétablis, des filtres et des inspirations basées sur les tendances actuelles. Des modèles préconçus permettent de créer ou de modifier des images en quelques clics, sans avoir à formuler des requêtes complexes.
Mais comment ce nouveau venu se positionne-t-il face à la concurrence ? Pour évaluer ses performances, une série de tests pratiques a été menée.
Pour le premier test, l’équipe a choisi un motif classique : un chameau dans le désert. La mission consistait à supprimer une personne présente sur la photo, à déplacer l’animal dans un paysage hivernal et à lui ajouter un bonnet de Noël. L’outil d’OpenAI a relevé le défi avec brio. Le chameau est resté dans la même position, la corde attachée à son pied, et le bonnet de Noël lui allait à merveille. De la neige s’est déposée sur la selle et des flocons de neige volaient autour de l’animal. L’arbre visible en arrière-plan a également été conservé, témoignant de la capacité du modèle à percevoir la scène dans son ensemble, et non comme un simple assemblage d’éléments distincts. De plus, le réglage des couleurs a créé une ambiance hivernale appropriée.
Google a également réussi la même tâche, mais avec quelques différences notables. L’arrière-plan a été modifié, l’arbre original a disparu au profit de quelques buissons et d’un ciel légèrement flou. Le chameau s’est vu attribuer une crinière qu’il n’avait pas sur la photo originale, et la tonalité générale de l’image est restée plus chaude, avec des nuances orangées rappelant le désert.
Pain d’épices de Noël ou sculpture étrange ?
Le deuxième test a été plus créatif. Parmi les styles prédéfinis proposés par ChatGPT, l’équipe a choisi de transformer une photo de chat en biscuit au sucre, un thème en accord avec la période des fêtes. C’est là que les différences d’approche entre les deux outils sont devenues plus évidentes.
La solution d’OpenAI a créé un biscuit en plastique presque tridimensionnel, avec un museau très réaliste et quelques moustaches esquissées. Cependant, le résultat ressemblait davantage à une sculpture qu’à un véritable biscuit fait maison.
L’outil de Google, en revanche, a produit exactement ce qui était attendu. La couleur du glaçage correspondait à la fourrure du chat sur la photo originale, ses yeux ressemblaient à de la pâte à sucre et l’ensemble était très réaliste. Si quelqu’un publiait une telle image sur les réseaux sociaux avec la légende “Je l’ai fait moi-même”, ses abonnés le croiraient probablement sans hésitation.
Dans une autre série de tests, l’équipe du podcast Money Maker a été transposée dans l’univers des briques LEGO. Là encore, les deux outils ont révélé des approches fondamentalement différentes. ChatGPT a créé des personnages beaucoup plus détaillés, avec des rides, des ombres plus réalistes et un aspect sophistiqué. Le résultat ressemblait davantage à une capture d’écran d’un film LEGO animé qu’à un véritable kit de construction. Cependant, l’outil a su recréer l’atmosphère de la scène et la lumière, fidèlement à la photographie originale, ajoutant ainsi de la profondeur.
Nano Banana a opté pour une approche inverse. Les personnages sont fluides, simples et correspondent exactement à l’apparence des véritables briques LEGO, sans rides ni textures supplémentaires, juste des formes nettes et bien définies.
En matière de génération d’images, l’IA était autrefois réputée pour son manque de fiabilité, déformant souvent les mains, les pieds et les visages. Aujourd’hui, la situation s’est considérablement améliorée, mais il reste important de vérifier les progrès des dernières technologies.
Pour tester davantage les capacités des deux outils, l’équipe a demandé la création d’une scène à partir d’un portrait photographique : une personne à moto traversant Prague sous un orage, avec une ambiance dramatique. L’IA a rapidement produit des images de Prague en pleine tempête, dignes d’un film noir. ChatGPT a généré une scène pleine d’atmosphère, avec une lumière spectaculaire, des éclairs, de la pluie et un angle de caméra dynamique. Bien que le visage ne soit pas parfaitement fidèle à l’original, l’ensemble est visuellement attrayant et dynamique.
L’outil de Google a mieux préservé les détails des cheveux, des vêtements et l’aspect général du visage. Cependant, le résultat souffre d’un manque de cohérence, le visage étant considérablement modifié et les yeux regardant dans des directions opposées. L’arrière-plan semble également raté, comme si le personnage avait été ajouté en post-production.
Pour pousser les tests plus loin, l’équipe a pris les portraits de deux personnes différentes et a demandé au chatbot de les réunir dans une seule scène : une promenade en forêt. Cette tâche est particulièrement exigeante, car l’IA doit estimer la différence de taille entre les personnages, ajuster la perspective et les intégrer dans l’environnement de manière réaliste.
Le modèle le plus récent a une fois de plus réussi le défi. Les visages sont relativement fidèles, les vêtements sont cohérents et le rapport de taille entre les personnages est presque exact. La photographie ressemble à un portrait artistique réfléchi, où les personnages s’intègrent naturellement dans la scène, avec une composition harmonieuse et une lumière appropriée. L’image a un côté légèrement stylisé, comme si le photographe avait opté pour une post-production prononcée.
Le résultat obtenu avec Google Gemini ressemble davantage à une photographie classique. Bien que le modèle ait adapté les vêtements, les personnages manquent d’ancrage naturel dans l’espace, donnant l’impression d’avoir été insérés dans le décor forestier par un graphiste.
Pour conclure, l’équipe a demandé à l’IA de transposer les deux personnages dans un pub bondé, où ils se livraient à un match d’entraînement sous les acclamations de la foule.
Là encore, l’un des problèmes fondamentaux du modèle OpenAI est apparu. L’ambiance est réussie et la scène semble vivante, mais les visages sont fortement modifiés et ne ressemblent que peu à l’original. Google, en revanche, a mieux préservé les visages et les détails des vêtements. Cependant, le résultat souffre d’un manque de cohérence, l’arrière-plan ressemblant davantage à un montage maladroit qu’à une scène complète.
En conclusion
Il est peu probable qu’un des deux outils puisse être déclaré vainqueur sans équivoque. Chacun a ses propres forces et convient à des types de tâches différents. La nouveauté d’OpenAI excelle dans la création d’ambiances visuelles. Si vous avez besoin de créer une scène cinématographique et visuellement attrayante, où l’impression générale et la dynamique sont primordiales, c’est un excellent choix.
Le modèle se distingue par sa maîtrise de la lumière et de la composition, et sa capacité à intégrer naturellement les personnages dans l’environnement. Il est également plus créatif que son concurrent et n’hésite pas à adopter une stylisation plus expressive et une interprétation plus libre des requêtes.
La solution de Google, en revanche, est plus conservatrice et respecte généralement davantage le matériel original. Si la préservation de la forme des visages ou de détails spécifiques est essentielle, c’est un outil plus fiable. Cependant, sa faiblesse réside dans l’intégration des personnages dans l’arrière-plan, le résultat pouvant parfois ressembler à un montage Photoshop peu réussi.
Pour l’utilisateur moyen, le nouvel outil d’OpenAI est probablement l’option la plus accessible. Les styles prédéfinis, la génération plus rapide et la possibilité d’expérimenter librement sans attendre longtemps font de GPT Image 1.5 une solution polyvalente pour la plupart des besoins. Que ce soit pour créer du contenu pour les réseaux sociaux, prévisualiser des images ou simplement valider rapidement des idées créatives, il sera rarement superflu. Pour un usage professionnel où la fidélité à l’original est primordiale, comme dans la publicité, le branding ou la création de catalogues de produits, un modèle plus ancien pourrait être un choix plus sûr. Une meilleure préservation de la forme des personnes et des détails fins peut être décisive dans ces cas.
À lire aussi





