Sauvegarde et reprise après sinistre
Définition
La sauvegarde (backup) protège les données contre la perte (panne, erreur humaine, ransomware, corruption). La reprise après sinistre (DR - Disaster Recovery) restaure l'activité IT après un incident majeur. RTO et RPO définissent les objectifs.
Règle 3-2-1 (et 3-2-1-1-0)
- 3 copies des données (production + 2 sauvegardes)
- 2 supports de stockage différents (disque, bande, cloud, objet)
- 1 copie hors site (géographiquement distante, cloud, coffre-fort)
- 1 copie hors ligne / immuable (air-gapped, WORM, Object Lock)
- 0 erreur non détectée (vérification intégrité, test de restauration)
Types de sauvegarde
| Type | Description | Espace | Temps backup | Temps restore | Cas d'usage |
|---|---|---|---|---|---|
| Complète (Full) | Toutes les données | Max | Long | Court (1 jeu) | Base, périodique (hebdo/mensuel) |
| Différentielle | Changements depuis dernière complète | Moyen | Moyen | Moyen (2 jeux: full + dernier diff) | Quotidien, entre complètes |
| Incrémentale | Changements depuis dernière sauvegarde (quelconque) | Min | Court | Long (chaîne complète) | Fréquent (horaire), stockage limité |
| Forever Incremental | Une complète initiale, puis seulement incrémentales + consolidation | Optimisé | Court | Optimisé | Moderne (Veeam, Rubrik, Commvault) |
| Synthétique | Full reconstituée à partir full + incrémentales (côté cible) | — | — | Court | Évite fenêtre full sur production |
Niveaux de sauvegarde
- Fichier / Dossier : sélectif, granulaire, simple (rsync, robocopy, Duplicati, Restic)
- Image / Volume : bloc, capture instantanée (snapshot), restauration bare-metal (Veeam, Clonezilla, Macrium, Windows Server Backup)
- Application-consistant : VSS (Windows), scripts pre/post freeze (Linux), API natives (SQL, Exchange, AD, Oracle) — cohérence transactionnelle
- VM / Conteneur : niveau hyperviseur (VMware VADP, Hyper-V RCT, KVM qcow2 snapshots), conteneur (Velero, Kasten, Trilio)
Stockage cible
| Support | Avantages | Inconvénients | Durée de vie |
|---|---|---|---|
| Disque (DAS/NAS/SAN) | Rapide, aléatoire, déduplication native | Coût/To, pas hors site natif | 3-5 ans |
| Bande (LTO-9 : 18 To natif, 45 To compressé) | Coût/To bas, hors ligne, longévité, WORM | Séquentiel, lent, robotique coûteuse | 30 ans |
| Objet Cloud (S3, Azure Blob, GCS) | Durabilité 99.999999999%, scalable, tiers (IA, Glacier), Object Lock | Latence, coût sortie (egress), bande passante | Illimitée |
| Appliance dédupliquée (Data Domain, ExaGrid, HPE StoreOnce) | Ratio 10-50:1, réplication intégrée | Propriétaire, coût initial | 5-7 ans |
RTO / RPO / RSL
| Métrique | Définition | Question clé | Exemples cibles |
|---|---|---|---|
| RPO (Recovery Point Objective) | Perte de données max acceptable | "Combien de données peut-on perdre ?" | 0 (synchrone), 15 min, 1 h, 24 h |
| RTO (Recovery Time Objective) | Temps max pour restaurer le service | "Combien de temps avant reprise ?" | <1 h (critique), 4 h, 24 h |
| RSL (Recovery Service Level) | Niveau de service en mode dégradé | "Quel service minimal ?" | 50% capacité, lecture seule, site secours |
Stratégies de réplication
- Synchrone : écriture confirmée sur site primaire + secondaire (RPO=0, latence <10 ms, distance <100 km)
- Asynchrone : acquittement local, réplication en arrière-plan (RPO secondes-minutes, distance illimitée)
- Snapshots : instantané ponctuel (crash-consistent ou app-consistent), base pour backup/réplication
- CDP (Continuous Data Protection) : journalisation chaque écriture, récupération à la seconde près (Zerto, Veeam CDP)
Plan de reprise (DR Plan)
- Inventaire : applications critiques, dépendances, RTO/RPO, propriétaires
- Site de secours : cold (espace seulement), warm (infra pré-déployée), hot (synchrone, actif)
- Procédures : basculement (failover), validation, bascule retour (failback)
- Communication : parties prenantes, clients, régulateurs, médias
- Tests : tabletop (papier), simulation (bac à sable), basculement réel (planifié, annuel minimum)
Outils modernes
- Entreprise : Veeam, Commvault, Rubrik, Cohesity, Dell EMC Avamar/NetWorker, Veritas NetBackup
- Cloud-native : AWS Backup, Azure Backup, Google Cloud Backup and DR, Clumio, Druva
- Kubernetes : Velero, Kasten K10, Trilio, Stash
- Libre / SMB : Restic, BorgBackup, Duplicati, UrBackup, Bareos, Rsync/Robocopy + scripts
Tests de restauration (obligatoires)
- Fréquence : mensuelle (échantillon), trimestrielle (complète critique), annuelle (DR complet)
- Métriques : temps, intégrité (checksums), complétude, RTO/RPO respectés
- Documentation : rapport test, écarts, actions correctives, mise à jour plan
Ransomware et immuabilité
- Object Lock / WORM : S3 Object Lock (Compliance/Governance), Azure Immutable Blob, GCP Object Versioning + Retention
- Air-gap : copie physiquement déconnectée (bande, appliance isolée, compte cloud séparé)
- Détection : anomaly detection (taux changement inhabituel), canary files, honeytokens
- Récupération : restauration depuis copie immuable, validation avant remise en production