Aller au contenu principal

Régression multiple avancée

Lean Six Sigma Black Belt4.0 Analyze

Régression multiple avancée

Définition

La régression multiple modélise une variable de sortie Y à partir de plusieurs variables d'entrée. Le modèle estime un coefficient par variable, avec un test de significativité pour chacun. Le Black Belt construit, compare et valide le modèle avant de l'utiliser pour la prévision ou l'optimisation.

Sélection de variables

Les méthodes pas à pas ajoutent ou retirent les variables selon leur contribution. La méthode ascendante ajoute la variable la plus significative à chaque étape, la descendante retire la moins significative. Les critères d'information comme l'AIC et le BIC pénalisent le nombre de termes. Le Cp de Mallows compare le biais et la variance d'un modèle candidat au modèle complet. Un bon modèle minimise ces critères sans empiler les variables inutiles.

Colinéarité et VIF

Deux variables fortement corrélées rendent les coefficients instables. Le facteur d'inflation de la variance, ou VIF, quantifie le problème : un VIF supérieur à 10 signale une colinéarité forte. On retire une des variables redondantes ou on combine les deux en un seul prédicteur. Un modèle avec trois variables corrélées à 0,9 entre elles donne des coefficients qui changent de signe selon l'échantillon.

Variables indicatrices et interactions

Une variable catégorielle entre dans le modèle sous forme de variables indicatrices, une par niveau moins une. Un coefficient d'interaction mesure l'écart d'effet d'une variable selon le niveau d'une autre. Une ligne d'assemblage peut modéliser le temps de cycle en fonction de la vitesse, avec une indicatrice pour le modèle de produit et une interaction entre les deux.

Validation du modèle

Le R² ajusté pénalise les variables superflues. La validation croisée divise les données en échantillon d'apprentissage et de test pour mesurer la capacité de prévision réelle. Les résidus doivent rester sans structure, sans tendance et sans hétéroscédasticité. Un modèle avec un R² de 0,95 sur les données d'apprentissage et de 0,60 sur le test surestime sa performance.

Exemple concret

Une chaîne logistique prédit le délai de livraison à partir du poids du colis, de la distance et du mode de transport. Le modèle final retient la distance et le mode, avec un R² ajusté de 0,78 et des VIF inférieurs à 3. La validation croisée confirme un R² de 0,74 sur les données de test. Le poids est écarté car sa contribution ne compense pas sa complexité.