Développé par la start-up française H, un nouveau modèle d’intelligence artificielle baptisé Holo 4 cherche à résoudre le problème de l’utilisation des interfaces graphiques par les agents logiciels.
Le défi des interfaces graphiques pour les agents d’intelligence artificielle
Si la plupart des grands modèles de langage excellent dans la réponse aux requêtes textuelles, leur navigation au sein des environnements de bureau et des applications sous Windows ou Linux reste limitée. L’histoire informatique distingue traditionnellement trois catégories d’interfaces : les interfaces en ligne de commande, les interfaces de programmation et les interfaces graphiques.
Baptisée Holo 4, cette famille de modèles vise à permettre à des structures de taille relativement modeste de gérer l’ensemble des scénarios d’interaction, qu’il s’agisse de pointer, de cliquer, de faire défiler ou de taper du texte au sein d’interfaces graphiques.
Architecture et performances des modèles Holo 4 de H
Entraînés par apprentissage supervisé et par renforcement, les modèles Holo 4 reposent sur les fondations des modèles Qwen 3.8 27B et Qwen 3.6 35B-A3B d’Alibaba. En s’optimisant pour les lignes de commande, les interfaces de programmation et les interfaces graphiques, l’entreprise H revendique une polyvalence accrue par rapport aux modèles spécialisés dans un seul type d’utilisation informatique. Parallèlement à cette annonce, l’entreprise a également mis à jour son modèle Holotron, basé sur le système Nemotron 3 de Nvidia.
À travers des démonstrations pratiques, la start-up a illustré les capacités de son système. Dans un premier exemple, le modèle Holo 4 27B a exploité la fonction macro du logiciel FreeCAD pour concevoir de manière programmatique un modèle tridimensionnel de la tour Eiffel, évitant ainsi une construction manuelle à l’aide de formes primitives. Dans un second exercice, l’entreprise a procédé à l’inverse en utilisant des formes extrudées pour recréer son propre logo.
Coûts d’inférence et accessibilité matérielle
Bien que les performances annoncées par H placent ses modèles au-dessus de certains grands modèles de pointe dotés d’un nombre de paramètres nettement supérieur, ces gains s’accompagnent de spécificités économiques. Selon le rapport publié par The Register, ces performances accrues se traduisent dans plusieurs cas par un coût par tâche plus élevé. Cette particularité s’explique vraisemblablement par l’utilisation importante de jetons de « réflexion » nécessaires à l’obtention du résultat final, en comparaison avec des solutions concurrentes telles que GPT 6 Luna, moins performantes sur le benchmark OSWorld 2.0 mais plus économiques.
Du côté du matériel, la taille réduite de ces modèles à poids ouverts permet aux chercheurs, aux passionnés d’intelligence artificielle et aux entreprises de les exécuter sur des configurations modestes. Une carte graphique Nvidia RTX 3090 dotée de 24 gigaoctets de mémoire vidéo se révèle pleinement capable de faire tourner ces modèles à une précision de 4 bits.
Disponibilité des poids et perspectives d’optimisation
La société H a rendu disponibles plusieurs types de poids pour les utilisateurs, incluant les formats BF16, FP8 et NVFP4, ainsi qu’une version au format GGUF compatible avec Llama.cpp, LM Studio et Ollama, téléchargeable directement sur la plateforme Hugging Face. De surcroît, le développeur a indiqué son intention de publier des poids de brouillon DSpark afin d’accélérer l’inférence par le biais d’une technique de décodage spéculatif, qui consiste à utiliser un petit modèle pour deviner les productions d’un modèle plus grand.
Néanmoins, ces modèles nécessitent un environnement d’exécution adapté pour être pleinement opérationnels. H a ainsi développé plusieurs dispositifs de contrôle d’agents, dont le kit open source HAI-Agents accessible sur sa page GitHub, tout en assurant une compatibilité théorique avec des solutions tierces.