AVD Manager par XOAP est là. Cliquez pour commencer  🚀

Les enseignements d'une panne mondiale : Comment protéger votre organisation

Le CTO de XOAP offre des points clés à retenir suite à l'incident CrowdStrike, d'un point de vue organisationnel et technique.
Image de Sinisa

Sinisa

Nous avons tous été témoins d'incidents récents qui soulignent la fragilité inhérente des systèmes informatiques.

Tout d'abord, permettez-moi d'exprimer ma compréhension de la confiance accordée aux agents de sécurité profondément intégrés dans le système d'exploitation pour renforcer la sécurité du système. Ces agents, fournis par des fournisseurs réputés, sont soumis à des tests rigoureux pour minimiser les problèmes potentiels, en particulier dans les scénarios à fort impact.

Cependant, malgré tous nos efforts et les tests procéduraux les plus rigoureux, des problèmes peuvent encore survenir. Après tout, nous sommes humains et les erreurs font partie intégrante de notre réalité. Je compatisse profondément avec ceux qui sont touchés par de tels incidents, reconnaissant l'immense pression et la responsabilité qu'ils portent.

Des incidents comme celui-ci se produisent quotidiennement dans diverses organisations, souvent à plus petite échelle en raison des mises à jour automatiques.

Nous devons prendre du recul et réfléchir à la manière dont nous pouvons atténuer ces problèmes à l'avenir.

Bien qu'il puisse être tentant de blâmer entièrement CrowdStrike, il est essentiel de se rappeler que les entreprises et les utilisateurs finaux partager la responsabilité de la minimisation de l'impact de tels incidents.

Voici plusieurs points clés à considérer.

🗃️ La perspective organisationnelle

Avant toute chose, établir des étapes de test rigoureuses. Implémentez des processus pour tester minutieusement les mises à jour dans des environnements automatisés avant de les déployer en production. En ce qui concerne la sauvegarde, mise en œuvre de stratégies de sauvegarde complètes est essentiel pour garantir que les données et les systèmes critiques soient sauvegardés sur plusieurs versions et emplacements.

En cas de défaillance totale, vous aurez besoin d'un plan clair et automatisé pour redéployer l'intégralité de votre infrastructure. Développer des plans de redéploiement et d'éviter le piège de considérer la configuration du serveur comme une tâche unique : l'automatisation est cruciale. De plus, faites attention à préparation du bureau. Exploitez les solutions disponibles pour garantir la restauration et le bon fonctionnement des postes de travail en quelques heures.

Si ce n'est pas encore fait, adopter des méthodologies de déploiement contemporaines et des pratiques agiles. Suite aux incidents, mener une enquête approfondie analyses post-mortem identifier et mettre en œuvre des améliorations.

 

💻 La perspective technique

Évitez les “ dernières versions ” et les mises à jour automatiques sur les systèmes critiques. Bien que pratiques, ceux-ci peuvent introduire des problèmes imprévus, alors soyez prudent.

Les tests doivent être effectués dans des environnements contrôlés. Ne déployez rien en production sans des tests approfondis dans un environnement de staging. Des tests devraient également être effectués régulièrement. Effectuez des tests réguliers et complets de vos processus d'automatisation et de déploiement — pas seulement une fois par an.

Afin d'assurer un déploiement rapide dans les scénarios de catastrophe, automatiser votre infrastructure autant que possible et envisager la mise en œuvre tests automatisés. Les processus de test améliorés par l'automatisation permettront de détecter les problèmes à un stade précoce. Pour une récupération plus rapide et une réduction des surfaces d'attaque, migrez l'infrastructure critique vers conteneurs et Kubernetes. Les défaillances simultanées peuvent être atténuées en répartissant l'infrastructure et les composants critiques sur plusieurs fournisseurs de cloud et emplacements géographiques.

En ce qui concerne les instantanés de secours, optez pour le froid. Maintenir des instantanés répliqués et versionnés des systèmes et données essentiels du backend en tant que veille froide, car la veille chaude peut répliquer des données corrompues.

Et enfin, mais non le moindre, repensez vos mesures de sécurité. Explorer des solutions de sécurité innovantes qui réduisent la dépendance aux ordinateurs de bureau complets.

 

Qu'en pensez-vous ?

Avant la fin de ce billet, je souhaite également mettre en évidence une approche particulièrement intelligente pour aborder ces problèmes, développée par Helge Klein et l'équipe UberAgent : Fonctionnalité UberAgent Driver Safety Net. Regardez ça !

Si j'ai oublié quelque chose ou si vous avez une perspective différente, n'hésitez pas à Partagez vos réflexions ici. 💬

Plus d'articles de blog comme celui-ci

Retour en haut