Home Technologie et scienceLe nouveau modèle VL-JEPA de Meta passe de la génération de jetons à la prédiction de concepts

Le nouveau modèle VL-JEPA de Meta passe de la génération de jetons à la prédiction de concepts

by Thomas Caron

Publié le 4 janvier 2026 à 13h49. Des chercheurs de Meta ont développé un nouveau modèle d’intelligence artificielle, VL-JEPA, qui promet une approche plus efficace et performante de la compréhension du monde visuel et du langage, en s’éloignant des méthodes traditionnelles de génération de texte.

  • VL-JEPA se distingue par sa capacité à prédire des représentations abstraites du monde, plutôt que de générer du texte mot par mot, ce qui réduit considérablement les besoins en calcul.
  • Le modèle a démontré des performances supérieures à celles des modèles de langage de vision (VLM) standard, notamment dans des tâches complexes de modélisation du monde.
  • VL-JEPA ouvre la voie à des applications en temps réel plus réactives et efficaces, telles que la reconnaissance de scènes et la planification d’actions.

Contrairement aux approches actuelles en intelligence artificielle qui reposent sur de grands modèles de langage de vision (VLM) générant du texte de manière séquentielle, VL-JEPA, acronyme de Visual-Language Joint Embedding Predictive Architecture, adopte une stratégie différente. Il se concentre sur la prédiction de représentations abstraites du monde, une approche qui s’avère plus efficace et performante. Cette innovation, présentée dans une publication scientifique, marque un tournant dans la conception des modèles d’IA.

Les VLM traditionnels, bien que performants, sont coûteux en termes de ressources informatiques. Ils doivent capturer à la fois la sémantique pertinente et les nuances linguistiques, ce qui gaspille des efforts de calcul en produisant des séquences de mots qui n’améliorent pas nécessairement la précision de la réponse. De plus, leur nature autorégressive les rend moins adaptés aux tâches en temps réel, nécessitant un décodage complet avant de révéler le sens, ce qui introduit une latence indésirable.

Pour comprendre l’importance de VL-JEPA, il est essentiel de connaître le cadre JEPA (Joint Embedding Predictive Architecture) sur lequel il repose. Développé initialement par Yann LeCun, ce cadre fonctionne en prédisant des représentations dans un « espace latent ». Au lieu de reconstruire des pixels ou de générer des mots spécifiques, un modèle JEPA apprend à prédire la représentation abstraite d’une entrée à partir d’un contexte donné. Cette approche permet au modèle de se concentrer sur les concepts sémantiques de haut niveau, en ignorant le bruit superficiel.

VL-JEPA applique ce principe à la vision et au langage, transformant l’apprentissage coûteux de la génération de texte en une prédiction sémantique efficace dans l’espace latent. L’architecture utilise un « X-Encoder » et un « Y-Encoder ». Le X-Encoder, basé sur le modèle V-JEPA 2, compresse les entrées visuelles (images, vidéos) en intégrations compactes. Simultanément, la requête textuelle est traitée et combinée à l’intégration visuelle pour fournir un contexte à la tâche.

Au cœur du système se trouve le « Predictor », initialisé avec les couches de transformateur de Llama 3. Ce composant prend les intégrations visuelles et la requête, puis prédit l’intégration de la réponse cible. Il ne tente pas de prédire le premier mot de la réponse, mais l’ensemble du concept sémantique en une seule fois.

La formation du modèle se déroule en deux étapes. La première, une pré-formation sans requête, vise à établir un alignement robuste entre la vision et le langage. En utilisant de vastes ensembles de données d’images et de vidéos associées à du texte, le modèle apprend à associer les visuels au langage sans se concentrer sur des tâches spécifiques. Cela donne naissance à VL-JEPA_BASE, qui excelle dans les tâches « zéro plan », comme la classification de vidéos ou la recherche de séquences basées sur des descriptions. La deuxième étape est un réglage fin supervisé (SFT), où le modèle est entraîné sur un mélange de données de questions-réponses visuelles, de sous-titrage et de classification, afin d’éviter l’oubli catastrophique.

Les tests menés par les chercheurs de Meta ont confirmé les capacités du modèle sur une large gamme de tâches, notamment huit ensembles de données de classification vidéo et huit ensembles de données de récupération vidéo. VL-JEPA a été comparé à des modèles de base généralistes tels que CLIP, SigLIP2 et Perception Encoder, ainsi qu’à des modèles spécialisés optimisés pour des benchmarks individuels. En situation de tir zéro, VL-JEPA_BASE a affiché une précision moyenne supérieure (46,4 % contre 44,6 %) dans les ensembles de données de classification et un rappel moyen plus élevé (58,4 % contre 58,1 %) dans les tâches de récupération par rapport à Perception Encoder. Après le réglage fin supervisé, VL-JEPA_SFT a encore progressé, atteignant des performances proches des modèles spécialisés.

En matière de réponse visuelle aux questions, VL-JEPA_SFT a obtenu des résultats comparables à ceux de VLM établis comme InstructBLIP et Qwen-VL, malgré une taille de modèle plus réduite (1,6 milliard de paramètres contre 7 ou 13 milliards pour ses concurrents). Plus impressionnant encore, dans les tâches de « modélisation du monde », VL-JEPA a établi un nouveau record de précision avec 65,7 %, surpassant des modèles massifs tels que GPT-4o (53,3 %), Gemini-2.0 (55,6 %) et Qwen2.5-VL-72B.

Grâce à son mécanisme de décodage sélectif, VL-JEPA se distingue également par son efficacité dans les applications en temps réel. Dans les tâches de streaming vidéo, il a atteint une qualité de sortie équivalente à celle d’une ligne de base uniforme tout en nécessitant 2,85 fois moins d’opérations de décodage, validant ainsi l’hypothèse selon laquelle la prédiction d’intégrations sémantiques permet une surveillance plus intelligente et plus efficace du monde visuel.

Bien que les modèles basés sur JEPA ne soient pas conçus pour des tâches génératives, ils offrent un potentiel considérable pour les applications nécessitant une compréhension du monde et une prise de décision appropriée. Pour ces applications, JEPA promet d’être plus flexible, précis et efficace que les modèles génératifs traditionnels.

You may also like

Leave a Comment