Accueil / Articles de blog / Soins pour animaux

Message de York Wu, fondateur et PDG de Petlibro

En tant que propriétaires d’animaux et fondateurs d’une entreprise axée sur de meilleurs soins grâce à la compréhension, nous savons à quel point il est important de pouvoir compter sur les produits qui nous aident à prendre soin de nos animaux. Le mardi 11 août, notre application Petlibro a connu une panne qui a touché une part importante de notre clientèle. Ce problème a été entièrement résolu mercredi 12 août au soir. Nous vous présentons nos sincères excuses pour cette interruption et comprenons la frustration et l’inquiétude qu’elle a suscitées. Nous souhaitons faire preuve de transparence sur ce qui s’est passé et, plus important encore, partager les mesures que nous mettons en œuvre pour la suite. Nous prenons immédiatement des mesures supplémentaires pour renforcer notre système et contribuer à éviter qu’un problème similaire ne se reproduise à l’avenir.

Pour la suite

Nous continuerons à nous imposer un niveau d’exigence élevé et nous nous engageons à tirer les leçons de cette situation.

  • Nous avons analysé le problème, résolu la cause sous-jacente et augmenté la capacité de traitement des demandes.

  • Notre cellule de crise prépare un protocole d’audit destiné à examiner notre infrastructure backend et à corriger toute incohérence similaire.

  • Nous continuerons d’enquêter sur les problèmes secondaires causés par la panne et mettrons à jour nos systèmes avec des solutions adaptées.

  • Nous continuerons d’examiner les signalements indiquant qu’un appareil n’a pas exécuté une routine comme prévu, afin de bien comprendre ce qui s’est passé.

  • La page d’état des services deviendra une rubrique permanente de notre site Web, afin que les utilisateurs puissent toujours vérifier l’état de notre application et de nos serveurs.

  • Nous renforcerons notre équipe d’assistance clientèle afin de traiter plus rapidement le backlog de tickets d’assistance résultant de la panne.

Ce qui s’est passé

La panne a été provoquée par des problèmes sur les serveurs cloud, qui ont entraîné une accumulation de requêtes de données, saturé la mémoire du système et, par là même, interrompu le service des appareils. Après un redémarrage réussi du service cloud, l’accumulation de requêtes est réapparue et le système est de nouveau tombé en panne. À ce moment-là, l’équipe a procédé à un dépannage systématique du système de service cloud, identifié le problème sous-jacent, appliqué un correctif, puis surveillé de près la montée en charge progressive du trafic jusqu’au retour à la stabilité.

En raison de cette panne, l’application ne pouvait plus se connecter aux appareils et toute communication avec ceux-ci était donc impossible. Les services liés à l’application, notamment les actions à la demande, l’historique de fonctionnement, les enregistrements, les notifications et les vidéos, étaient indisponibles.

Vous trouverez ci-dessous une chronologie plus détaillée. Tous les horaires sont exprimés en heure du Pacifique (PT). À noter que, pendant toute cette période, notre équipe a travaillé 24 heures sur 24 et 7 jours sur 7 pour trouver une solution.

  • 11 août :

    • 5 h 20 : une erreur critique est survenue, affectant la connexion à l’application et son contrôle.

    • 6 h 30 : les fonctionnalités de l’application ont été rétablies et le système a commencé à traiter un important arriéré de requêtes de données résultant de la panne.

    • 6 h 53 : un afflux de requêtes entrantes a dépassé la capacité de connexion et le système est de nouveau tombé en panne.

    • 8 h 04 : les fonctionnalités de base ont été rétablies et le service a été ajouté progressivement afin de surveiller tout problème persistant.

    • 9 h 07 : à mesure que de nouvelles fonctions étaient mises en ligne, le temps de chargement de l’application a ralenti et nous avons choisi de réduire temporairement les fonctionnalités.

    • 20 h 04 : tout au long de la journée, le service se rétablissait avant de finir par planter à nouveau. L’équipe de développement a identifié un problème de cache et a désactivé le service pour y remédier.

    • 23 h 43 : une solution au problème de cache a été mise en œuvre et le service a été réactivé.

  • 12 août :

    • 11 h 05 : au cours de la nuit, le service des appareils a été progressivement rétabli jusqu’à atteindre une connectivité normale.

    • 16 h 51 : la charge de demandes est revenue aux niveaux antérieurs à la panne, avec une stabilité normale.

    • 19 h 39 : après avoir observé un fonctionnement stable de l’application pendant un cycle d’utilisation de pointe, l’équipe a fait passer le statut de l’incident à « résolu ». Des correctifs supplémentaires seraient publiés pendant les heures creuses, sans incidence sur l’expérience utilisateur.

Notre réponse

Dès l’identification de la panne, nous avons immédiatement activé notre équipe de réponse aux crises. Notre première action a été de rétablir le service de l’application aussi rapidement que possible afin de limiter les désagréments. Après un premier rétablissement du service, nous avons publié une communication annonçant la résolution, mais avons dû la rétracter lorsque l’application est de nouveau tombée en panne. Nous avons tout tenté pour rétablir les fonctionnalités sans interrompre le service, mais avons dû prendre la décision difficile de suspendre l’application après avoir épuisé toutes les autres options.

Après que notre équipe a identifié la cause sous-jacente et mis en œuvre une solution, nous avons rétabli le service progressivement afin de surveiller la stabilité du correctif appliqué. Au cours de la nuit, nous avons continué à observer les performances à mesure que de nouveaux appareils se reconnectaient, avant de revenir aux niveaux antérieurs à la panne le lendemain matin. Bien qu’une grande partie du service ait été rétablie à ce stade, nous avons continué à fonctionner en mode crise jusqu’à pouvoir observer un cycle complet de demande garantissant des performances constantes.

En parallèle, notre équipe s’efforçait de tenir les clients et les autres parties prenantes informés de l’évolution de la situation. Pendant toute la durée de la panne, notre équipe a envoyé cinq e-mails aux clients actifs disposant d’appareils connectés, publié quatre mises à jour sur Reddit et Instagram, et activé une page d’état sur notre site Web avec un lien direct depuis la page d’accueil. Lorsque l’application était fonctionnelle, nous avons également affiché des fenêtres contextuelles contenant des informations pertinentes, afin que vous ayez toujours un moyen de vérifier ce qui se passait.

Alors que la reprise se poursuit, nous sommes conscients des problèmes secondaires que la panne a pu déclencher. Dans de nombreux cas, la connectivité des appareils a été irrégulière, et nous surveillons ces situations. Dans la plupart des cas, un redémarrage manuel de l’appareil a résolu le problème. Nos produits sont conçus pour exécuter de manière autonome les routines programmées, comme le nourrissage et l’auto-nettoyage, indépendamment de l’application, et cela a fonctionné pour la grande majorité des appareils. Nous examinons activement les signalements isolés indiquant qu’une routine ne s’est peut-être pas déroulée comme prévu, afin de déterminer si des facteurs secondaires ont pu jouer un rôle.

Nous vous présentons une nouvelle fois nos plus sincères excuses pour les désagréments et la frustration que cela a causés, et nous mettons tout en œuvre pour améliorer nos produits à la lumière de cet événement. Nous continuerons de vous tenir informés de notre réponse à la panne et des prochaines étapes. Merci de votre patience cette semaine et de la confiance que vous nous accordez pour vos animaux. Nous prenons cette responsabilité très au sérieux.

Cette déclaration vous est fournie afin de vous tenir informés de nos progrès. Elle n’affecte en rien vos droits en tant que client estimé.


Articles associés