Méthodologie de dépannage
Définition
Le dépannage (troubleshooting) est un processus structuré pour identifier, isoler et résoudre un problème technique. Une méthode rigoureuse évite les suppositions, réduit le temps de résolution et assure la reproductibilité.
Approche en 7 étapes (standard ITIL / Google)
1. Identifier le problème
- Recueillir les symptômes exacts (messages d'erreur, comportement, fréquence)
- Interroger l'utilisateur : quoi, quand, où, changements récents
- Reproduire si possible
- Distinguer : problème utilisateur vs système, isolé vs généralisé
2. Établir une théorie de cause probable
- Commencer par le plus simple et le plus probable (raccourci : "quick wins")
- Utiliser la méthode du "diviser pour régner" (binaire : matériel/logiciel, réseau/local, utilisateur/système)
- Consulter la base de connaissances, tickets similaires, documentation constructeur
3. Tester la théorie
- Appliquer un test ciblé (redémarrage, câble, paramètre, commande de diagnostic)
- Observer le résultat : résolu ? inchangé ? empiré ?
- Si échec : revenir à l'étape 2 avec nouvelle hypothèse
4. Établir et exécuter un plan d'action
- Documenter la solution (étapes, commandes, fichiers modifiés)
- Prévoir un plan de retour arrière (rollback) si changement risqué
- Informer l'utilisateur du temps estimé et de l'impact
5. Vérifier la résolution complète
- Confirmer que le symptôme initial a disparu
- Tester les fonctions connexes (régression)
- Valider avec l'utilisateur final
6. Documenter l'incident et la solution
- Ticket : description, cause racine, actions, temps passé, catégorie, priorité
- Mettre à jour la base de connaissances (KB) si nouveau cas
- Partager avec l'équipe si applicable
7. Prévenir la récurrence
- Identifier la cause racine (analyse 5 Pourquoi, diagramme Ishikawa)
- Proposer correctif permanent (patch, configuration, formation, procédure)
- Suivi : surveiller les métriques (MTTR, taux de récurrence)
Principes directeurs
- Ne pas supposer : vérifier, mesurer, valider
- Un changement à la fois : isoler la variable
- Documenter au fur et à mesure : pas après coup
- Communiquer : tenir l'utilisateur informé, gérer les attentes
- Éviter les pièges : biais de confirmation, solution favorite, précipitation, négliger les bases (câbles, alimentation, redémarrage)
Outils de diagnostic courants
- Matériel : multimètre, testeur câble, POST card, outil de diagnostic constructeur (Dell, HP, Lenovo)
- OS : Gestionnaire des tâches, Moniteur de ressources, Visionneuse d'événements,
dmesg,journalctl,top/htop,Task Manager,Resource Monitor - Réseau :
ping,traceroute/tracert,nslookup/dig,ipconfig/ifconfig/ip a,netstat/ss, Wireshark - Sécurité : antivirus/EDR,
netstat -an, analyseurs de logs, scanners de vulnérabilités - Tickets : Jira, ServiceNow, Zendesk, Freshdesk, GLPI, Spiceworks
Escalade
- Niveau 1 : premier contact, scripts, KB, problèmes connus
- Niveau 2 : analyse approfondie, accès admin, outils avancés
- Niveau 3 : expertise spécialisée (réseau, sécurité, base de données, développement), constructeur