Sauvegarde et Reprise après Sinistre (BCP/DRP)

Fondamentaux de la Sauvegarde et de la Reprise

La sauvegarde et la reprise après sinistre sont des composants critiques de toute stratégie de cybersécurité. Avec la multiplication des attaques par rançongiciel et des sinistres (naturels ou technologiques), disposer de plans robustes de BCP (Business Continuity Planning) et de DRP (Disaster Recovery Planning) est essentiel.

RTO et RPO : Concepts Fondamentaux

RTO (Recovery Time Objective)

Définition : Durée maximale d'indisponibilité acceptable après un sinistre

Exemple : Un RTO de 4 heures signifie que les systèmes doivent être restaurés sous 4 h

Impact : Définit l'urgence et l'investissement nécessaire dans les solutions

RPO (Recovery Point Objective)

Définition : Quantité maximale de données pouvant être perdue, mesurée en temps

Exemple : Un RPO de 1 heure signifie que les sauvegardes doivent avoir lieu toutes les heures

Impact : Définit la fréquence des sauvegardes et les technologies de réplication

Niveau de Criticité :

  • Tier 1 (Critique) : RTO < 1h, RPO < 15min - Réplication synchrone
  • Tier 2 (Important) : RTO 4-8h, RPO 1h - Sauvegarde incrémentale fréquente
  • Tier 3 (Normal) : RTO 24h, RPO 24h - Sauvegarde quotidienne

Règle 3-2-1 de Sauvegarde

La stratégie de référence pour la protection des données :

  • 3 Trois copies des données : production + 2 sauvegardes
  • 2 Deux types de supports différents : disque, bande, cloud
  • 1 Une copie hors site : géographiquement séparée

Évolution moderne : 3-2-1-1-0
+ 1 copie immuable (résistante aux rançongiciels)
+ 0 erreur à la restauration (tests réguliers)

Types de Sauvegarde

1. Sauvegarde Complète (Full)

  • Avantage : Restauration simple et rapide
  • Inconvénient : Lente, consomme beaucoup d'espace
  • Usage : Hebdomadaire ou mensuelle comme baseline

2. Sauvegarde Incrémentale

  • Avantage : Rapide, économise de l'espace
  • Inconvénient : La restauration nécessite la full + toutes les incrémentales
  • Usage : Quotidienne ou horaire entre les fulls

3. Sauvegarde Différentielle

  • Avantage : Restauration plus simple que l'incrémentale
  • Inconvénient : Croît jusqu'à la prochaine full
  • Usage : Quotidienne lorsque la simplicité du restore est critique

4. Snapshot et Réplication

  • Snapshots : Copies point-in-time, restauration instantanée
  • Réplication Synchrone : Aucune perte de données (RPO=0)
  • Réplication Asynchrone : Répartie géographiquement

Technologies et Solutions

On-Premises

  • Veeam Backup & Replication : Leader pour les environnements virtualisés
  • Commvault, Veritas NetBackup : Enterprise backup platforms
  • Acronis Cyber Protect : Sauvegarde + antimalware intégré
  • Dell EMC Data Domain : Deduplicated backup appliances

Cloud-Based

  • AWS Backup : Sauvegarde centralisée pour les services AWS
  • Azure Backup : Intégré aux services Azure
  • Google Cloud Backup : Sauvegardes automatisées GCP
  • Druva, Backblaze B2 : Cloud-native backup solutions

Bases de Données

  • MySQL/PostgreSQL : pg_dump, mysqldump + point-in-time recovery
  • MongoDB : mongodump, Ops Manager backup
  • SQL Server : Native backup + Always On Availability Groups
  • Oracle RMAN : Recovery Manager pour les environnements Oracle

Protection contre les Rançongiciels

Sauvegardes résistantes aux rançongiciels :

  • Immuabilité : Object lock (S3), WORM storage, immutable backups
  • Air-gapping : Sauvegardes hors ligne déconnectées du réseau
  • Séparation des Identifiants : Backup admins ≠ domain admins
  • MFA : Authentification multifacteur pour l'accès aux sauvegardes
  • Versionnement : Plusieurs versions pour une restauration antérieure à l'infection
  • Scanning : Antimalware sur les sauvegardes avant la restauration
  • Alertes : Détection de modifications massives (chiffrement possible)

Disaster Recovery Planning

  • DR Site : Datacenter secondaire ou région cloud
  • Failover Automation : Scripts ou orchestration automatique
  • Runbooks : Documentation pas à pas de la reprise
  • Priorisation : Ordre de reprise basé sur la criticité
  • Dépendances : Carte des interdépendances entre les systèmes
  • Network Configuration : DNS, VPN, firewall rules pour le DR
  • Communication Plan : Parties prenantes, clients, équipe

Tests de Reprise

Types de tests (à réaliser au moins une fois par an) :

  • Tabletop Exercise : Discussion théorique du plan sans exécution
  • Restore Testing : Restauration d'échantillons dans un environnement isolé
  • Partial Failover : Failover des systèmes non critiques
  • Full DR Test : Failover complet (généralement dans une maintenance window)
  • Chaos Engineering : Pannes injectées intentionnellement

Important : Une sauvegarde non testée n'est pas une sauvegarde. Les défaillances sont découvertes au moment du besoin s'il n'y a pas de tests réguliers.

Meilleures Pratiques

  • [OK] Mettre en œuvre la règle 3-2-1-1-0
  • [OK] Définir des RTO/RPO clairs par système
  • [OK] Sauvegardes immuables pour la protection contre les rançongiciels
  • [OK] Tests de restauration trimestriels
  • [OK] Surveillance et alertes des échecs de sauvegarde
  • [OK] Chiffrement des sauvegardes (at rest et in transit)
  • [OK] Documentation à jour des runbooks
  • [OK] Séparation des privilèges (backup admin ≠ domain admin)
  • [OK] Rétention conforme à la compliance (LGPD, SOX, etc.)
  • [OK] DR site réparti géographiquement