Aller au contenu principal

Sauvegarde et reprise après sinistre

Google IT SupportAdministration système et infrastructure

Sauvegarde et reprise après sinistre

Définition

La sauvegarde (backup) protège les données contre la perte (panne, erreur humaine, ransomware, corruption). La reprise après sinistre (DR - Disaster Recovery) restaure l'activité IT après un incident majeur. RTO et RPO définissent les objectifs.

Règle 3-2-1 (et 3-2-1-1-0)

  • 3 copies des données (production + 2 sauvegardes)
  • 2 supports de stockage différents (disque, bande, cloud, objet)
  • 1 copie hors site (géographiquement distante, cloud, coffre-fort)
  • 1 copie hors ligne / immuable (air-gapped, WORM, Object Lock)
  • 0 erreur non détectée (vérification intégrité, test de restauration)

Types de sauvegarde

Type Description Espace Temps backup Temps restore Cas d'usage
Complète (Full) Toutes les données Max Long Court (1 jeu) Base, périodique (hebdo/mensuel)
Différentielle Changements depuis dernière complète Moyen Moyen Moyen (2 jeux: full + dernier diff) Quotidien, entre complètes
Incrémentale Changements depuis dernière sauvegarde (quelconque) Min Court Long (chaîne complète) Fréquent (horaire), stockage limité
Forever Incremental Une complète initiale, puis seulement incrémentales + consolidation Optimisé Court Optimisé Moderne (Veeam, Rubrik, Commvault)
Synthétique Full reconstituée à partir full + incrémentales (côté cible) Court Évite fenêtre full sur production

Niveaux de sauvegarde

  • Fichier / Dossier : sélectif, granulaire, simple (rsync, robocopy, Duplicati, Restic)
  • Image / Volume : bloc, capture instantanée (snapshot), restauration bare-metal (Veeam, Clonezilla, Macrium, Windows Server Backup)
  • Application-consistant : VSS (Windows), scripts pre/post freeze (Linux), API natives (SQL, Exchange, AD, Oracle) — cohérence transactionnelle
  • VM / Conteneur : niveau hyperviseur (VMware VADP, Hyper-V RCT, KVM qcow2 snapshots), conteneur (Velero, Kasten, Trilio)

Stockage cible

Support Avantages Inconvénients Durée de vie
Disque (DAS/NAS/SAN) Rapide, aléatoire, déduplication native Coût/To, pas hors site natif 3-5 ans
Bande (LTO-9 : 18 To natif, 45 To compressé) Coût/To bas, hors ligne, longévité, WORM Séquentiel, lent, robotique coûteuse 30 ans
Objet Cloud (S3, Azure Blob, GCS) Durabilité 99.999999999%, scalable, tiers (IA, Glacier), Object Lock Latence, coût sortie (egress), bande passante Illimitée
Appliance dédupliquée (Data Domain, ExaGrid, HPE StoreOnce) Ratio 10-50:1, réplication intégrée Propriétaire, coût initial 5-7 ans

RTO / RPO / RSL

Métrique Définition Question clé Exemples cibles
RPO (Recovery Point Objective) Perte de données max acceptable "Combien de données peut-on perdre ?" 0 (synchrone), 15 min, 1 h, 24 h
RTO (Recovery Time Objective) Temps max pour restaurer le service "Combien de temps avant reprise ?" <1 h (critique), 4 h, 24 h
RSL (Recovery Service Level) Niveau de service en mode dégradé "Quel service minimal ?" 50% capacité, lecture seule, site secours

Stratégies de réplication

  • Synchrone : écriture confirmée sur site primaire + secondaire (RPO=0, latence <10 ms, distance <100 km)
  • Asynchrone : acquittement local, réplication en arrière-plan (RPO secondes-minutes, distance illimitée)
  • Snapshots : instantané ponctuel (crash-consistent ou app-consistent), base pour backup/réplication
  • CDP (Continuous Data Protection) : journalisation chaque écriture, récupération à la seconde près (Zerto, Veeam CDP)

Plan de reprise (DR Plan)

  1. Inventaire : applications critiques, dépendances, RTO/RPO, propriétaires
  2. Site de secours : cold (espace seulement), warm (infra pré-déployée), hot (synchrone, actif)
  3. Procédures : basculement (failover), validation, bascule retour (failback)
  4. Communication : parties prenantes, clients, régulateurs, médias
  5. Tests : tabletop (papier), simulation (bac à sable), basculement réel (planifié, annuel minimum)

Outils modernes

  • Entreprise : Veeam, Commvault, Rubrik, Cohesity, Dell EMC Avamar/NetWorker, Veritas NetBackup
  • Cloud-native : AWS Backup, Azure Backup, Google Cloud Backup and DR, Clumio, Druva
  • Kubernetes : Velero, Kasten K10, Trilio, Stash
  • Libre / SMB : Restic, BorgBackup, Duplicati, UrBackup, Bareos, Rsync/Robocopy + scripts

Tests de restauration (obligatoires)

  • Fréquence : mensuelle (échantillon), trimestrielle (complète critique), annuelle (DR complet)
  • Métriques : temps, intégrité (checksums), complétude, RTO/RPO respectés
  • Documentation : rapport test, écarts, actions correctives, mise à jour plan

Ransomware et immuabilité

  • Object Lock / WORM : S3 Object Lock (Compliance/Governance), Azure Immutable Blob, GCP Object Versioning + Retention
  • Air-gap : copie physiquement déconnectée (bande, appliance isolée, compte cloud séparé)
  • Détection : anomaly detection (taux changement inhabituel), canary files, honeytokens
  • Récupération : restauration depuis copie immuable, validation avant remise en production