Bilan de la maintenance RMS : corrections et prochaines étapes
5 novembre 2024
Le système de gestion à distance (RMS) a été entièrement restauré à son état antérieur à la maintenance. Cependant, les appareils utilisant des versions de firmware nettement plus anciennes peuvent encore rencontrer des problèmes de connectivité. Veuillez nous signaler tout problème de ce type ; nous vous assisterons immédiatement !

Résumé de l'incident
Des complications imprévues lors d'une maintenance planifiée ont entraîné une interruption de service prolongée. Les mises à jour des serveurs ont provoqué des problèmes de connexion avec les appareils et, malgré les efforts déployés, ces problèmes n'ont pu être résolus dans un délai raisonnable. Le système a été restauré, mais les problèmes de connexion ont persisté, entraînant une interruption de service d'environ 24 heures. Les appareils se sont reconnectés progressivement au cours des 72 heures suivantes.
Cause première
Le problème principal provenait des appareils exécutant des versions de firmware antérieures à la version 07.07, qui ne géraient pas correctement la déconnexion suite au redémarrage du serveur RMS. Ces appareils ignoraient les protocoles de reconnexion standard et lançaient des tentatives de reconnexion rapides et continues.
En raison des limitations des équilibreurs de charge AWS, même les appareils initialement connectés étaient déconnectés successivement, provoquant un cycle de connexions et de reconnexions pour des centaines de milliers d'appareils. Ce flux massif de requêtes a rendu le système temporairement indisponible. Durant le week-end, nous avons augmenté le nombre d'équilibreurs de charge actifs, redirigé le trafic et effectué des ajustements côté serveur afin de rétablir progressivement le service.
Mesures prises et prochaines étapes
Cet incident a été une expérience enrichissante pour notre équipe et a mis en lumière des points à améliorer. Bien que nous finalisions encore notre plan d'action à long terme, voici plusieurs mesures que nous nous engageons à prendre :
Tests de mise en place améliorés
Malgré des mois de préparation dans notre environnement de test, ce problème nous a pris par surprise. Nous allons revoir et mettre à jour nos procédures de test en profondeur. Plus précisément, nous augmenterons le nombre de dispositifs de test de démonstration afin de mieux simuler les scénarios de forte charge sur notre système.
Gestion de charge améliorée
Pour éviter que des incidents similaires ne se reproduisent, nous allons améliorer nos capacités d'équilibrage de charge à la demande et mettre en œuvre un sous-système DNS/Proxy/redirection de ports afin de gérer plus efficacement les flux de trafic potentiellement importants.
Page d'état RMS
Afin d'améliorer la communication lors des futures opérations de maintenance ou interruptions de service, nous mettrons en place une page d'état RMS pour tenir nos clients informés en temps réel.
Besoin d'aide ?
Si vous avez besoin d'aide entre-temps, notre équipe d'assistance est là pour vous. Contactez-nous via notre centre d'assistance ou notre forum communautaire , et nous répondrons à toutes vos questions.
Merci de votre compréhension et de votre patience pendant que nous travaillons à améliorer la résilience de nos systèmes et à prévenir de futures perturbations !
VOUS AVEZ AIMÉ CETTE HISTOIRE ?
Partagez-le avec vos amis !
