Tests d'hypothèses avancés
Définition
Un test d'hypothèse confronte une hypothèse nulle à une hypothèse alternative à partir d'un échantillon. Le test conclut au rejet ou au non-rejet de l'hypothèse nulle avec un risque d'erreur contrôlé. Le Black Belt choisit le test selon le type de données, la normalité et la question posée.
Erreurs et puissance
L'erreur de type I rejette l'hypothèse nulle alors qu'elle est vraie, avec un risque fixé par alpha, souvent 5 %. L'erreur de type II ne rejette pas l'hypothèse nulle alors qu'elle est fausse, avec un risque bêta. La puissance, égale à 1 - bêta, mesure la capacité du test à détecter un effet réel. Elle dépend de la taille d'échantillon, de l'écart type et de la taille de l'effet. Un test avec une puissance de 0,5 ne détecte l'effet recherché qu'une fois sur deux, il faut augmenter l'échantillon.
Choix du test
Les données continues normales passent par les tests t et l'ANOVA. Les données continues non normales passent par les tests non paramétriques comme Mann-Whitney et Kruskal-Wallis. Les données de comptage passent par les tests du Chi-Deux. Les proportions se comparent avec un test de proportion ou un Chi-Deux d'indépendance. Un test de normalité d'Anderson-Darling précède le choix entre test paramétrique et non paramétrique.
Comparaisons multiples
Multiplier les tests augmente le risque global d'erreur de type I. Comparer 10 paires de moyennes avec un risque de 5 % par test donne un risque global proche de 40 %. La correction de Bonferroni divise alpha par le nombre de comparaisons. Le test de Tukey protège le risque global pour les comparaisons par paires après une ANOVA significative.
Taille d'échantillon
La taille d'échantillon se calcule avant la collecte, à partir de l'écart type attendu, de l'effet minimal à détecter et des risques alpha et bêta. Un effet petit demande un grand échantillon. Un processus avec un écart type de 8 unités et un effet de 2 unités demande environ 200 observations par groupe pour une puissance de 0,8.
Exemple concret
Un laboratoire compare deux méthodes de dosage sur 25 échantillons appariés. La différence moyenne est de 0,4 mg avec un écart type de 0,9 mg. Le test t apparié donne une p-value de 0,038, sous le seuil de 5 %. Le laboratoire conclut que les deux méthodes diffèrent et ajuste ses procédures de référence.