Publié le 11 septembre 2024 à 14h30. Nvidia, le géant des puces graphiques, a annoncé l’acquisition de SchedMD, une société spécialisée dans les logiciels de gestion de clusters, afin de renforcer son offre pour les entreprises et les laboratoires de recherche en intelligence artificielle.
- Nvidia s’offre SchedMD, développeur de la plateforme open source Slurm, utilisée pour optimiser l’allocation des ressources de calcul.
- L’acquisition vise à améliorer l’efficacité de l’entraînement des modèles d’IA, qui nécessite souvent des ressources considérables.
- Slurm est déjà utilisé dans plus de la moitié des 100 supercalculateurs les plus puissants au monde.
Cette acquisition stratégique permet à Nvidia de consolider sa position dans l’écosystème de l’intelligence artificielle. SchedMD, fondée en 2010 par les créateurs de Slurm (Simple Linux Utility for Resource Management), propose des services professionnels pour aider les organisations à déployer et à optimiser cette plateforme open source de gestion de clusters de serveurs. L’entreprise compte plusieurs centaines de clients, parmi lesquels des agences gouvernementales, des institutions bancaires et des organismes de santé.
L’entraînement des grands modèles de langage est une tâche particulièrement gourmande en ressources. Pour accélérer le processus, les entreprises distribuent généralement la charge de travail sur un grand nombre de GPU (Graphics Processing Units), permettant ainsi de réaliser les calculs en parallèle. Cependant, cette approche introduit une complexité importante : il faut déterminer quelle puce doit effectuer quelle tâche, et éviter que certaines ne restent inactives pendant que d’autres sont surchargées.
Slurm automatise cette répartition des tâches, en optimisant l’utilisation des ressources disponibles. Bien que Kubernetes, une autre plateforme de gestion de clusters open source, offre des fonctionnalités similaires, Slurm se distingue par sa capacité à gérer des clusters de très grande taille – plus de 100 000 GPU – et par ses options de personnalisation avancées. Par exemple, il permet de placer les tâches qui échangent fréquemment des données sur des serveurs adjacents, afin de minimiser les délais de communication.
SchedMD accompagne ses clients dans la configuration et la personnalisation de Slurm, ainsi que dans la maintenance et les mises à jour de la plateforme. La société gère également Slinky, un autre projet open source qui permet d’exécuter Slurm sur Kubernetes, simplifiant ainsi la gestion de l’infrastructure informatique et potentiellement réduisant les coûts.
Nvidia a confirmé que Slurm restera un projet open source et qu’elle continuera à investir dans son développement. Le fabricant de puces prévoit également d’optimiser Slurm pour ses prochaines générations de cartes graphiques Rubin et d’unités centrales de traitement Vera. L’objectif est d’offrir aux utilisateurs de l’infrastructure informatique accélérée de Nvidia des outils performants pour optimiser leurs charges de travail.
L’expertise de SchedMD sera également précieuse pour Nvidia dans le domaine des supercalculateurs, où Slurm est déjà largement utilisé. Plus de la moitié des 100 supercalculateurs les plus rapides au monde s’appuient sur cette plateforme, dont beaucoup intègrent des composants Nvidia.
Pour aller plus loin
