Une panne du cloud peut tourner au cauchemar pour n’importe quelle organisation. Lorsque vos applications et données critiques sont hébergées dans le cloud, une panne imprévue peut paralyser l’activité. Même si les fournisseurs cloud ont fait de grands progrès pour garantir une haute disponibilité et une bonne continuité de service, les pannes restent une réalité.
Le meilleur exemple est celui où Amazon Web Services (AWS) a paralysé Internet le 7 décembre 2021. Plusieurs organisations, parmi lesquelles de grands noms comme Associated Press, Netflix, PayPal, Shopify, Disney et bien d’autres, ont été touchées, la panne ayant nécessité cinq heures pour être résolue. Malheureusement, AWS a encore connu deux autres pannes ce mois-là.
Voici comment protéger votre organisation contre les pannes du cloud en adoptant une approche proactive de vos CloudOps.
Stratégies d’atténuation des risques
Selon une étude de 2020 menée auprès de responsables de centres de données et de l’informatique par l’Uptime Institute, plus de la moitié des répondants ont déclaré qu’une panne leur avait coûté au moins 100 000 dollars US, tandis qu’un tiers ont indiqué avoir subi une perte d’au moins 1 million de dollars US à la suite d’une seule panne. Il est évident que le coût d’une panne peut être élevé.
Toutefois, en mettant en place un plan destiné à atténuer le risque de panne, vous pouvez en réduire le coût. Voici quelques-unes des stratégies que vous pouvez mettre en œuvre :
Architecture de cluster à haute disponibilité
Cette architecture de gestion du cloud utilise plusieurs serveurs pour héberger les applications et les données. Ainsi, si un serveur tombe en panne, les autres peuvent prendre le relais. Cette approche est souvent utilisée pour les applications critiques qui ne peuvent pas se permettre d’interruption de service.
Cette stratégie comporte quatre composantes :
- Équilibrage de charge : Il est essentiel de disposer d’un mécanisme d’équilibrage de charge soigneusement planifié et préconçu afin de répartir uniformément les requêtes des clients entre les nœuds du cluster. Vous devez spécifier la procédure de basculement dans le mécanisme d’équilibrage de charge.
- Évolutivité des données : Les applications cloud doivent être conçues pour effectuer une mise à l’échelle automatique, afin de pouvoir démarrer ou arrêter davantage d’instances selon les besoins. Une solution consiste à utiliser une base de données centrale et à lui assurer une haute disponibilité par réplication ou partitionnement. Une autre option consiste à veiller à ce que chaque instance d’application dispose de son propre stockage de données.
- Diversité géographique : Les fournisseurs cloud possèdent des centres de données partout dans le monde. Faire appel à un fournisseur disposant de plusieurs centres de données peut garantir que vos applications et vos données sont hébergées dans plusieurs emplacements. En outre, cette approche peut contribuer à prévenir les pannes causées par des catastrophes naturelles ou d’autres événements susceptibles de toucher un seul centre de données.
- Sauvegarde et restauration : Il est essentiel de mettre en place un plan de sauvegarde et de restauration pour vos applications et données hébergées dans le cloud. Celui-ci doit prévoir des sauvegardes régulières stockées dans un emplacement différent de celui des données principales, ainsi qu’un plan de reprise après sinistre testé.
Les environnements multicloud et de cloud hybride constituent également un moyen d’assurer une haute disponibilité en cas de panne chez un seul fournisseur cloud. L’utilisation de plusieurs fournisseurs cloud peut garantir que vos applications et vos données sont hébergées dans plusieurs centres de données et emplacements.
Tests réguliers de la résistance de l’infrastructure aux pannes et aux attaques potentielles
Il est essentiel de tester régulièrement la résistance de votre infrastructure aux pannes et aux attaques potentielles. L’infrastructure de chaque organisation fait périodiquement l’objet de modifications qui peuvent impliquer bien davantage que l’ajout de nouveaux serveurs.
Ces modifications peuvent également inclure des méthodes visant à attirer de nouveaux utilisateurs, à établir de nouvelles connexions et à mettre en œuvre de nouvelles méthodes d’authentification — autant d’éléments qui accroissent la surface d’attaque et le nombre d’attaques potentielles, comme les attaques par déni de service distribué (DDoS), les injections de code et d’autres attaques exploitant les failles de l’infrastructure.
Il existe deux types de tests d’infrastructure :
- Tests d’intrusion internes : Ces tests sont menés par une équipe de sécurité et se concentrent sur les systèmes et réseaux internes d’une organisation. Ils identifient les vulnérabilités susceptibles d’être exploitées par des personnes malveillantes au sein ou à l’extérieur de l’organisation ayant obtenu un accès au réseau.
- Tests d’intrusion externes : Ces tests sont menés par une entreprise de sécurité externe et se concentrent sur les systèmes et réseaux publics d’une organisation.
À lire aussi : Tests d’intrusion ou tests de vulnérabilité : une différence importante
Voici les étapes habituelles à suivre lors d’un test d’infrastructure :
- Obtenir les ressources de test : Pour réaliser un test d’infrastructure efficace, vous avez besoin des bons outils. Cela inclut l’accès aux derniers vecteurs d’attaque et aux dernières vulnérabilités, ainsi qu’à divers outils de test des vulnérabilités.
- Modéliser les menaces : Cette étape consiste à identifier les actifs que vous souhaitez protéger et les menaces auxquelles ils sont confrontés. Elle vous aidera à hiérarchiser les tests à effectuer et à déterminer quels actifs sont les plus exposés.
- Définir les priorités, les exclusions et les dépendances : Tous les systèmes et actifs ne se valent pas. Vous devez donc commencer par définir les priorités afin de vous concentrer sur les systèmes les plus critiques, puis déterminer quels systèmes ou actifs vous ne souhaitez pas tester et quels systèmes doivent être testés avant de pouvoir tester les autres.
- Effectuer les tests : Il s’agit de la phase de test proprement dite, au cours de laquelle vous tenterez d’exploiter les vulnérabilités que vous avez identifiées.
- Établir un rapport et analyser : Une fois les tests terminés, vous devez produire un rapport détaillant les résultats. Celui-ci doit inclure la liste de toutes les vulnérabilités détectées et des recommandations pour y remédier.
- Demander conseil pour supprimer les vulnérabilités : Toutes les vulnérabilités ne peuvent pas être corrigées par la simple installation d’un correctif ou la mise à jour d’une configuration. Dans certains cas, vous devrez peut-être consulter un expert pour déterminer la meilleure façon de supprimer la vulnérabilité.
- Vérifier la suppression correcte des vulnérabilités : Éliminez les failles à l’aide de la méthode appropriée et vérifiez qu’elles ont bien été supprimées. Pour cela, effectuez une nouvelle série de tests ou examinez les journaux de sécurité à la recherche de signes d’attaque.
Stratégie de sauvegarde 3-2-1
Ce concept repose sur une stratégie de sauvegarde éprouvée et reconnue recommandée par le gouvernement américain qui peut vous aider à protéger vos données en cas de panne du cloud. L’idée de base est de conserver trois copies de vos données sur deux supports différents, dont une copie hors site.
Cette stratégie connaît d’autres variantes, mais l’essentiel est de conserver au moins trois copies de vos données dans des emplacements différents. Il peut s’agir d’une copie sur un serveur local, d’une copie sur un serveur distant et d’une copie dans le cloud.
Lorsque vous utilisez une sauvegarde basée sur le cloud, voici les bonnes pratiques à suivre :
- Comprendre vos objectifs de restauration : Il s’agit de la première étape de toute stratégie de sauvegarde. Vous devez comprendre ce que vous cherchez à protéger et pourquoi. Cette approche vous aidera à déterminer quels systèmes et quelles données sont les plus importants.
- Redondance intégrée : Elle est essentielle à toute stratégie de sauvegarde, mais elle est impérative lorsqu’une sauvegarde basée sur le cloud est utilisée. Toute défaillance individuelle doit disposer d’un mécanisme de secours au sein de l’architecture. La redondance vous permet de poursuivre vos opérations en cas de panne.
- Prendre en compte les pertes de données et les interruptions de service : Lors de la préparation à une panne du cloud, vous devez prendre en compte à la fois la perte de données, c’est-à-dire la quantité d’informations perdues, et l’interruption de service, c’est-à-dire la durée pendant laquelle un système est indisponible.
- Tenir compte des catégories de systèmes et de données : Tous les systèmes ne se valent pas. Vous devez donc tenir compte de l’importance des différents systèmes et données lors de la création de votre stratégie de sauvegarde. Cela vous aidera à vous concentrer en priorité sur les systèmes les plus critiques.
- Utiliser un cloud de restauration pour les solutions sur site : La sauvegarde dans le cloud constitue une excellente option pour les solutions sur site. Elle peut vous fournir la redondance et la flexibilité nécessaires pour vous remettre d’une panne.
Toujours être prêt
Une panne du cloud peut survenir à tout moment et pour n’importe quelle raison. Il est donc essentiel de s’y préparer en disposant d’un plan. Celui-ci doit inclure une stratégie de sauvegarde et des stratégies d’atténuation des risques.
Pour garantir que les composants les plus importants de votre infrastructure bénéficient du niveau de sécurité et de disponibilité des données le plus élevé, vous devez respecter plusieurs exigences. Vous pouvez commencer à en mettre certaines en œuvre dès maintenant. Vous pouvez également confier la mise en œuvre de l’ensemble des mesures mentionnées ci-dessus à des professionnels du cloud qualifiés.
À lire ensuite : Principaux outils de gestion de la posture de sécurité du cloud (CSPM)