Sauvegarde et Reprise après Sinistre (BCP/DRP)
Fondamentaux de la Sauvegarde et de la Reprise
La sauvegarde et la reprise après sinistre sont des composants critiques de toute stratégie de cybersécurité. Avec la multiplication des attaques par rançongiciel et des sinistres (naturels ou technologiques), disposer de plans robustes de BCP (Business Continuity Planning) et de DRP (Disaster Recovery Planning) est essentiel.
RTO et RPO : Concepts Fondamentaux
RTO (Recovery Time Objective)
Définition : Durée maximale d'indisponibilité acceptable après un sinistre
Exemple : Un RTO de 4 heures signifie que les systèmes doivent être restaurés sous 4 h
Impact : Définit l'urgence et l'investissement nécessaire dans les solutions
RPO (Recovery Point Objective)
Définition : Quantité maximale de données pouvant être perdue, mesurée en temps
Exemple : Un RPO de 1 heure signifie que les sauvegardes doivent avoir lieu toutes les heures
Impact : Définit la fréquence des sauvegardes et les technologies de réplication
Niveau de Criticité :
- Tier 1 (Critique) : RTO < 1h, RPO < 15min - Réplication synchrone
- Tier 2 (Important) : RTO 4-8h, RPO 1h - Sauvegarde incrémentale fréquente
- Tier 3 (Normal) : RTO 24h, RPO 24h - Sauvegarde quotidienne
Règle 3-2-1 de Sauvegarde
La stratégie de référence pour la protection des données :
- 3 Trois copies des données : production + 2 sauvegardes
- 2 Deux types de supports différents : disque, bande, cloud
- 1 Une copie hors site : géographiquement séparée
Évolution moderne : 3-2-1-1-0
+ 1 copie immuable (résistante aux rançongiciels)
+ 0 erreur à la restauration (tests réguliers)
Types de Sauvegarde
1. Sauvegarde Complète (Full)
- Avantage : Restauration simple et rapide
- Inconvénient : Lente, consomme beaucoup d'espace
- Usage : Hebdomadaire ou mensuelle comme baseline
2. Sauvegarde Incrémentale
- Avantage : Rapide, économise de l'espace
- Inconvénient : La restauration nécessite la full + toutes les incrémentales
- Usage : Quotidienne ou horaire entre les fulls
3. Sauvegarde Différentielle
- Avantage : Restauration plus simple que l'incrémentale
- Inconvénient : Croît jusqu'à la prochaine full
- Usage : Quotidienne lorsque la simplicité du restore est critique
4. Snapshot et Réplication
- Snapshots : Copies point-in-time, restauration instantanée
- Réplication Synchrone : Aucune perte de données (RPO=0)
- Réplication Asynchrone : Répartie géographiquement
Technologies et Solutions
On-Premises
- Veeam Backup & Replication : Leader pour les environnements virtualisés
- Commvault, Veritas NetBackup : Enterprise backup platforms
- Acronis Cyber Protect : Sauvegarde + antimalware intégré
- Dell EMC Data Domain : Deduplicated backup appliances
Cloud-Based
- AWS Backup : Sauvegarde centralisée pour les services AWS
- Azure Backup : Intégré aux services Azure
- Google Cloud Backup : Sauvegardes automatisées GCP
- Druva, Backblaze B2 : Cloud-native backup solutions
Bases de Données
- MySQL/PostgreSQL : pg_dump, mysqldump + point-in-time recovery
- MongoDB : mongodump, Ops Manager backup
- SQL Server : Native backup + Always On Availability Groups
- Oracle RMAN : Recovery Manager pour les environnements Oracle
Protection contre les Rançongiciels
Sauvegardes résistantes aux rançongiciels :
- Immuabilité : Object lock (S3), WORM storage, immutable backups
- Air-gapping : Sauvegardes hors ligne déconnectées du réseau
- Séparation des Identifiants : Backup admins ≠ domain admins
- MFA : Authentification multifacteur pour l'accès aux sauvegardes
- Versionnement : Plusieurs versions pour une restauration antérieure à l'infection
- Scanning : Antimalware sur les sauvegardes avant la restauration
- Alertes : Détection de modifications massives (chiffrement possible)
Disaster Recovery Planning
- DR Site : Datacenter secondaire ou région cloud
- Failover Automation : Scripts ou orchestration automatique
- Runbooks : Documentation pas à pas de la reprise
- Priorisation : Ordre de reprise basé sur la criticité
- Dépendances : Carte des interdépendances entre les systèmes
- Network Configuration : DNS, VPN, firewall rules pour le DR
- Communication Plan : Parties prenantes, clients, équipe
Tests de Reprise
Types de tests (à réaliser au moins une fois par an) :
- Tabletop Exercise : Discussion théorique du plan sans exécution
- Restore Testing : Restauration d'échantillons dans un environnement isolé
- Partial Failover : Failover des systèmes non critiques
- Full DR Test : Failover complet (généralement dans une maintenance window)
- Chaos Engineering : Pannes injectées intentionnellement
Important : Une sauvegarde non testée n'est pas une sauvegarde. Les défaillances sont découvertes au moment du besoin s'il n'y a pas de tests réguliers.
Meilleures Pratiques
- [OK] Mettre en œuvre la règle 3-2-1-1-0
- [OK] Définir des RTO/RPO clairs par système
- [OK] Sauvegardes immuables pour la protection contre les rançongiciels
- [OK] Tests de restauration trimestriels
- [OK] Surveillance et alertes des échecs de sauvegarde
- [OK] Chiffrement des sauvegardes (at rest et in transit)
- [OK] Documentation à jour des runbooks
- [OK] Séparation des privilèges (backup admin ≠ domain admin)
- [OK] Rétention conforme à la compliance (LGPD, SOX, etc.)
- [OK] DR site réparti géographiquement
