top of page

Produits

Cas d'utilisation

Soutien

Ressources

Entreprise

Bilan de la maintenance RMS : corrections et prochaines étapes

5 novembre 2024

Le système de gestion à distance (RMS) a été entièrement restauré à son état antérieur à la maintenance. Cependant, les appareils utilisant des versions de firmware nettement plus anciennes peuvent encore rencontrer des problèmes de connectivité. Veuillez nous signaler tout problème de ce type ; nous vous assisterons immédiatement !




Résumé de l'incident


Des complications imprévues lors d'une maintenance planifiée ont entraîné une interruption de service prolongée. Les mises à jour des serveurs ont provoqué des problèmes de connexion avec les appareils et, malgré les efforts déployés, ces problèmes n'ont pu être résolus dans un délai raisonnable. Le système a été restauré, mais les problèmes de connexion ont persisté, entraînant une interruption de service d'environ 24 heures. Les appareils se sont reconnectés progressivement au cours des 72 heures suivantes.



Cause première


Le problème principal provenait des appareils exécutant des versions de firmware antérieures à la version 07.07, qui ne géraient pas correctement la déconnexion suite au redémarrage du serveur RMS. Ces appareils ignoraient les protocoles de reconnexion standard et lançaient des tentatives de reconnexion rapides et continues.


En raison des limitations des équilibreurs de charge AWS, même les appareils initialement connectés étaient déconnectés successivement, provoquant un cycle de connexions et de reconnexions pour des centaines de milliers d'appareils. Ce flux massif de requêtes a rendu le système temporairement indisponible. Durant le week-end, nous avons augmenté le nombre d'équilibreurs de charge actifs, redirigé le trafic et effectué des ajustements côté serveur afin de rétablir progressivement le service.



Mesures prises et prochaines étapes


Cet incident a été une expérience enrichissante pour notre équipe et a mis en lumière des points à améliorer. Bien que nous finalisions encore notre plan d'action à long terme, voici plusieurs mesures que nous nous engageons à prendre :


Tests de mise en place améliorés


Malgré des mois de préparation dans notre environnement de test, ce problème nous a pris par surprise. Nous allons revoir et mettre à jour nos procédures de test en profondeur. Plus précisément, nous augmenterons le nombre de dispositifs de test de démonstration afin de mieux simuler les scénarios de forte charge sur notre système.


Gestion de charge améliorée


Pour éviter que des incidents similaires ne se reproduisent, nous allons améliorer nos capacités d'équilibrage de charge à la demande et mettre en œuvre un sous-système DNS/Proxy/redirection de ports afin de gérer plus efficacement les flux de trafic potentiellement importants.


Page d'état RMS


Afin d'améliorer la communication lors des futures opérations de maintenance ou interruptions de service, nous mettrons en place une page d'état RMS pour tenir nos clients informés en temps réel.



Besoin d'aide ?


Si vous avez besoin d'aide entre-temps, notre équipe d'assistance est là pour vous. Contactez-nous via notre centre d'assistance ou notre forum communautaire , et nous répondrons à toutes vos questions.


Merci de votre compréhension et de votre patience pendant que nous travaillons à améliorer la résilience de nos systèmes et à prévenir de futures perturbations !


VOUS AVEZ AIMÉ CETTE HISTOIRE ?

Partagez-le avec vos amis !

VOUS AVEZ UNE QUESTION ?

Nous sommes là pour vous aider !

FAQ

Lorem Ipsum is simply dummy text of the printing and typesetting industry
Lorem Ipsum is simply dummy text of the printing and typesetting industry
Lorem Ipsum is simply dummy text of the printing and typesetting industry

This page is not yet available in your selected language. Please switch to another language.

bottom of page