Publié le 27 septembre 2025 16h47. Des chercheurs ont développé un nouveau système, baptisé Fulcrum, capable d’optimiser l’apprentissage automatique sur les appareils embarqués, tout en réduisant considérablement la consommation d’énergie et le temps de configuration, ouvrant la voie à des applications plus performantes et autonomes.
- Fulcrum permet d’optimiser simultanément la formation et l’inférence de réseaux neuronaux profonds sur des appareils Edge, comme les plateformes Nvidia Jetson.
- Le système utilise deux stratégies d’optimisation : la recherche multidimensionnelle basée sur le gradient (GMD) et l’échantillonnage actif basé sur l’apprentissage (SLA).
- Fulcrum réduit significativement le besoin de profilage coûteux et long, un obstacle majeur à l’optimisation des performances sur les appareils Edge.
La demande croissante en intelligence artificielle (IA) embarquée, combinée aux préoccupations grandissantes concernant la confidentialité des données, rend cruciale la mise au point de méthodes d’apprentissage profond efficaces directement sur les appareils, appelés « Edge ». Les ressources matérielles limitées de ces appareils posent un défi majeur : assurer à la fois la formation des modèles d’IA et leur utilisation (inférence) de manière performante et économe en énergie. Prashanthi SK, Saisamarth Taluri, Pranav Gupta et leurs collaborateurs ont relevé ce défi en concevant Fulcrum, un système innovant qui optimise ces deux processus simultanément.
Leur travail s’appuie sur le constat que le matériel existant manque souvent de flexibilité pour gérer efficacement la formation et l’inférence en même temps. Fulcrum résout ce problème en ajustant dynamiquement les paramètres de puissance et la taille des lots de données, afin de maximiser les performances tout en respectant des contraintes strictes de latence et de consommation d’énergie. L’un des atouts majeurs de Fulcrum est sa capacité à atteindre ces objectifs avec un minimum de profilage, une étape traditionnellement longue et coûteuse.
Pour optimiser la gestion des ressources matérielles, les chercheurs ont développé un algorithme de recherche multidimensionnelle basée sur le gradient (GMD) pour la phase de formation. GMD explore les différentes configurations possibles des composants (cœurs, fréquences CPU et GPU, vitesse de la mémoire) en ajustant itérativement les paramètres, en tenant compte du compromis entre performances et consommation d’énergie. La méthode commence par une configuration initiale et se déplace ensuite dans la direction qui améliore les performances tout en réduisant la consommation, éliminant ainsi les options moins prometteuses.
Pour les tâches d’inférence, l’équipe a mis au point une technique d’échantillonnage actif basée sur l’apprentissage (SLA). Cette méthode utilise l’apprentissage automatique pour prédire les performances et la consommation d’énergie de différentes configurations, et sélectionne intelligemment celles qui sont les plus susceptibles d’améliorer la précision du modèle prédictif. Un réseau neuronal est entraîné pour prédire ces paramètres, et l’algorithme échantillonne itérativement les configurations, les profile et met à jour le réseau, permettant une exploration efficace de l’espace de configuration et une prédiction précise des paramètres optimaux.
Fulcrum s’attaque spécifiquement au défi de la formation et de l’inférence simultanées sur les appareils Edge, tels que les plateformes Nvidia Jetson, qui ne disposent pas toujours d’un support natif pour l’utilisation simultanée des GPU et présentent une grande variété de modes de puissance. Pour optimiser les performances dans ces conditions, les chercheurs ont développé une approche intelligente de gestion du temps, formulant un problème d’optimisation qui entrelace les mini-lots de formation et d’inférence, tout en maximisant le débit de l’entraînement.
Les expériences menées par l’équipe démontrent que SLA et GMD surpassent les méthodes plus simples et plus complexes, atteignant un taux de succès de 97 % et fournissant des solutions proches de 0,5 % du débit théoriquement optimal. En affinant l’approche SLA grâce à l’apprentissage actif, les chercheurs ont réussi à réduire le nombre de modes de puissance nécessitant un profilage. Cette technique construit un modèle initial à partir d’un petit ensemble de modes de puissance sélectionnés aléatoirement, puis sélectionne itérativement des modes supplémentaires en fonction de leur potentiel pour diversifier les valeurs de puissance et de temps observées. Le système construit ainsi un front de Pareto partiel, une courbe représentant le compromis entre performances et consommation d’énergie, directement à partir des données profilées, éliminant les erreurs de prédiction.
Cette recherche ouvre la voie à de nombreuses applications potentielles, allant des véhicules autonomes aux soins de santé personnalisés, en passant par la robotique et l’internet des objets. En optimisant l’utilisation des ressources sur les appareils Edge, Fulcrum permet de débloquer tout le potentiel de l’IA embarquée et de créer des systèmes plus intelligents, plus autonomes et plus efficaces.