Publié le 29 octobre 2025 à 06h30. La région US-EAST-1 d’Amazon Web Services, déjà fragilisée par une interruption massive la semaine dernière, est à nouveau confrontée à des problèmes techniques affectant plusieurs services essentiels, soulignant une dépendance interne préoccupante.
- Des difficultés de lancement d’instances EC2 et des taux d’échec élevés pour les tâches ECS et Fargate ont été signalés.
- Le service EMR Serverless, utilisé pour les traitements de données massives, est également impacté.
- AWS affirme travailler à la résolution du problème et estime un retour à la normale dans les 2 à 3 heures, mais n’a pas communiqué sur les causes de ces incidents répétés.
La région US-EAST-1 d’Amazon Web Services connaît une nouvelle journée difficile, marquée par des perturbations affectant plusieurs de ses services. Selon les informations publiées par AWS, des problèmes de latence ont été détectés dès l’après-midi, impactant le lancement de nouvelles instances EC2 (Elastic Compute Cloud) dans la zone de disponibilité use1-az2. Amazon a temporairement limité certaines demandes de ressources EC2, conseillant aux utilisateurs de réessayer leurs requêtes.
L’incident a également affecté le service Elastic Container Service (ECS), entraînant des taux d’échec de lancement de tâches pour les clients utilisant EC2 et Fargate. La page d’état d’Amazon précise qu’un nombre limité de cellules ECS dans la région US-EAST-1 rencontrent des difficultés, pouvant entraîner l’arrêt inattendu de tâches existantes et la déconnexion d’instances de conteneurs. AWS a identifié le problème et travaille à sa résolution.
Le service EMR Serverless (Elastic MapReduce), qui permet d’exécuter des outils de traitement de données massives comme Hadoop et Spark, est également touché. AWS explique que ce service utilise un pool de clusters ECS, et que certains de ces clusters sont affectés par les problèmes rencontrés avec ECS.
À 17h31 PDT, AWS a précisé qu’elle rafraîchissait activement les pools de clusters ECS avec des instances saines, tout en soulignant que les progrès n’étaient pas immédiatement visibles pour les utilisateurs. La page d’état d’AWS indiquait que certains services, comme Glue, commençaient à se rétablir, mais pouvaient encore subir une latence accrue. La meilleure estimation de temps de résolution (ETA) était alors de 2 à 3 heures.
AWS n’a pas encore communiqué sur les causes de ces incidents. Cependant, ces problèmes interviennent après une interruption massive la semaine dernière, qui avait révélé une forte dépendance entre les différents services AWS, notamment la base de données DynamoDB. Les difficultés actuelles, liées à ECS, confirment cette vulnérabilité et soulignent la fragilité de l’infrastructure cloud d’Amazon face à des défaillances internes.
Dix services sont actuellement répertoriés comme impactés par cet incident : App Runner, Batch, CodeBuild, Fargate, Glue, EMR Serverless, EC2, ECS et Elastic Kubernetes Service. Au moment de la publication de cet article, The Register ne constate pas de signalements massifs d’interruptions de service, ce qui pourrait s’expliquer par la présence de six zones de disponibilité dans la région US-EAST-1, permettant à de nombreux utilisateurs de basculer vers des ressources non affectées. Il est également possible qu’AWS dispose de ressources de secours dans la zone concernée.
MISE À JOUR À 06h00 UTC, LE 29 OCTOBRE Amazon a annoncé avoir résolu le problème, selon sa dernière mise à jour de statut publiée à 22h57 PDT (05h57 UTC).