Maths compl. · Chapitre 10 · Probabilités et statistique

Statistique à deux variables

Nuage de points, droite des moindres carrés, corrélation, ajustements par changement de variable.

Ce qu'il faut savoir faire

  • Nuage de points
  • Droite des moindres carrés
  • Corrélation
  • Ajustements par changement de variable

Une station balnéaire relève chaque jour la température et le chiffre d'affaires de ses commerces ; un médecin note la taille et la masse de ses patients ; un économiste met en regard le prix d'un produit et les quantités vendues ; un biologiste suit la taille d'une population de bactéries heure après heure. Dans toutes ces situations, deux grandeurs sont mesurées ensemble, sur les mêmes individus ou aux mêmes dates. Deux questions se posent alors naturellement : ces deux variables sont-elles liées ? Et si oui, peut-on prédire la valeur de l'une à partir de la valeur de l'autre ?

Ce chapitre donne les outils pour y répondre. Nous apprendrons à représenter les données par un nuage de points et à le résumer par son point moyen, puis à l'ajuster, quand sa forme s'y prête, par une droite : la droite des moindres carrés. Le coefficient de corrélation mesurera la qualité de cet ajustement, et nous utiliserons le modèle obtenu pour faire des prédictions, en distinguant interpolation et extrapolation. Nous verrons ensuite comment un changement de variable, grâce au logarithme étudié plus tôt dans l'année, ramène certains nuages « courbés » à un ajustement affine. Enfin, nous prendrons le recul indispensable : une corrélation, même très forte, ne prouve jamais une causalité.

Nuage de points et point moyen

Commençons par fixer le vocabulaire. Jusqu'ici, une série statistique portait sur un seul caractère (des notes, des salaires, des tailles). Ici, on en observe deux à la fois.

Définition

Série statistique à deux variables. On mesure, sur les mêmes individus ou aux mêmes instants, deux caractères quantitatifs x et y. La série est la liste des couples (x1;y1),(x2;y2),,(xn;yn). Le nuage de points associé est l'ensemble des points Mi(xi;yi) placés dans un repère.

Le nuage de points est la première chose à tracer : sa forme dit immédiatement si un lien semble exister entre les deux variables, et lequel. Prenons l'exemple qui nous servira de fil rouge dans tout le chapitre.

Exemple

Le glacier. Un glacier relève, pendant cinq journées, le nombre d'heures d'ensoleillement xi de la journée et le nombre yi de glaces vendues.

Ensoleillement xi (en h) 2 4 6 8 10
Glaces vendues yi 7 8 11 12 14

Sans surprise, plus il y a de soleil, plus il vend de glaces : les points semblent monter régulièrement de gauche à droite.

Pour résumer un nuage par un seul point, on fait la moyenne de chaque coordonnée.

Définition

Point moyen. Le point moyen du nuage est le point G(xˉ;yˉ), où xˉ est la moyenne des xi et yˉ la moyenne des yi.

Sur l'exemple du glacier : xˉ=2+4+6+8+105=6 et yˉ=7+8+11+12+145=525=10,4, donc G(6;10,4). Le point moyen joue le rôle de « centre de gravité » du nuage : il n'est en général pas l'un des points observés, mais il en occupe le centre.

Nuage de points du glacier avec le point moyen G(6 ; 10,4) et la droite des moindres carrés y = 0,9x + 5

Ajustement affine et droite des moindres carrés

Sur la figure, le nuage du glacier a une forme allongée, presque alignée : on devine qu'une droite pourrait le résumer fidèlement. Chercher cette droite, c'est réaliser un ajustement affine : remplacer le nuage par un modèle du type y=ax+b qui passe « au plus près » de tous les points. Mais que signifie exactement « au plus près » ?

Pour chaque point du nuage, comparons la valeur observée yi à la valeur axi+b prédite par la droite : la différence yi(axi+b) est l'écart vertical entre le point et la droite. Une bonne droite doit rendre ces écarts globalement petits. On pourrait penser à minimiser leur somme, mais les écarts positifs (points au-dessus de la droite) et négatifs (points en dessous) se compenseraient : une droite très mauvaise pourrait afficher une somme nulle. On élève donc chaque écart au carré : tous les termes deviennent positifs, plus rien ne se compense, et les grands écarts, une fois élevés au carré, pèsent beaucoup plus lourd que les petits, ce qui force la droite à ne délaisser aucun point. D'où le nom de la méthode.

Définition

Droite des moindres carrés. La droite des moindres carrés, aussi appelée droite de régression de y en x, est la droite d'équation y=ax+b qui rend minimale la somme des carrés des écarts verticaux i=1n(yi(axi+b))2.

Cette droite existe toujours et elle est unique. Le programme admet ses deux propriétés essentielles.

Propriété

Propriété (admise). La droite des moindres carrés passe par le point moyen G(xˉ;yˉ), et ses coefficients valent

a=i=1n(xixˉ)(yiyˉ)i=1n(xixˉ)2etb=yˉaxˉ.

La formule de b traduit exactement le passage par G : elle dit que yˉ=axˉ+b. En pratique, a et b s'obtiennent directement à la calculatrice, en mode statistiques à deux variables ; le calcul à la main reste toutefois exigible sur de petits effectifs, et il faut savoir le mener proprement.

Méthode

Déterminer une droite de régression à la calculatrice.

  1. Entrer les valeurs de x dans une première liste et celles de y dans une seconde (menu statistiques).
  2. Choisir la régression linéaire (souvent notée « LinReg » ou « ax+b »).
  3. Lire les valeurs de a et b affichées et écrire l'équation y=ax+b.

Attention : selon les modèles, la forme affichée est ax+b ou a+bx. Vérifier sur l'écran quel coefficient multiplie x avant de rédiger.

Exemple

Calcul à la main sur quatre points. Considérons la série x=1,2,3,4 et y=2,3,5,6. On calcule d'abord xˉ=1+2+3+44=2,5 et yˉ=2+3+5+64=4, puis on organise les calculs dans un tableau.

xi yi xixˉ yiyˉ (xixˉ)(yiyˉ) (xixˉ)2
1 2 1,5 2 3 2,25
2 3 0,5 1 0,5 0,25
3 5 0,5 1 0,5 0,25
4 6 1,5 2 3 2,25

Les sommes des deux dernières colonnes valent (xixˉ)(yiyˉ)=7 et (xixˉ)2=5. On en déduit a=75=1,4 puis b=yˉaxˉ=41,4×2,5=0,5. La droite des moindres carrés a pour équation y=1,4x+0,5. Vérification : le point moyen G(2,5;4) est bien sur la droite, car 1,4×2,5+0,5=4.

Revenons au glacier. La calculatrice donne y=0,9x+5 : c'est la droite tracée sur la figure. On peut vérifier le passage par le point moyen : 0,9×6+5=10,4, et G(6;10,4) est bien sur la droite.

Coefficient de corrélation

La calculatrice fournit toujours une droite de régression, même si le nuage n'a aucune forme de droite : la méthode des moindres carrés trouve la « meilleure » droite, mais ne dit pas si une droite est un bon modèle. Il faut un indicateur pour en juger.

Définition

Coefficient de corrélation. À toute série statistique à deux variables, la calculatrice associe, en même temps que la régression linéaire, un nombre r compris entre 1 et 1, appelé coefficient de corrélation.

Propriété

Interprétation de r.

  • Plus r est proche de 1, plus les points du nuage sont proches d'être alignés : l'ajustement affine est pertinent.
  • Si r est proche de 0, il n'y a pas de lien affine entre les deux variables.
  • Le signe de r donne le sens de la liaison : r>0 signifie que y a tendance à augmenter quand x augmente, r<0 que y a tendance à diminuer.

En pratique, on considère l'ajustement affine satisfaisant lorsque r0,9 environ. C'est un ordre de grandeur usuel, pas un seuil officiel : un énoncé peut fixer sa propre exigence, et un r de 0,85 sur des données biologiques très bruitées peut être remarquable.

Pour information, il existe une formule explicite : r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2. Elle n'est pas à mémoriser : au programme de l'option, r s'obtient à la calculatrice, affiché sur le même écran que a et b.

Exemple

Pour la série du glacier, la calculatrice affiche r0,99. Cette valeur, très proche de 1 et positive, confirme ce que montrait le nuage : un fort lien affine croissant entre l'ensoleillement et les ventes de glaces. L'ajustement par la droite y=0,9x+5 est pertinent.

Interpolation, extrapolation et regard critique

Un ajustement n'a d'intérêt que si l'on s'en sert : prédire les ventes pour un ensoleillement qui n'a pas été observé, estimer une valeur manquante, anticiper une évolution. Le vocabulaire distingue deux situations très différentes.

Définition

Interpolation, extrapolation. Prédire la valeur de y pour une valeur de x située à l'intérieur de la plage des données observées est une interpolation. La prédire pour une valeur de x située à l'extérieur de cette plage est une extrapolation.

Méthode

Prédire avec un ajustement.

  1. Remplacer x par la valeur voulue dans l'équation de la droite (ou du modèle) et calculer y.
  2. Situer la prédiction : interpolation ou extrapolation ?
  3. Porter un regard critique : une interpolation est en général fiable si l'ajustement est bon (r proche de 1) ; une extrapolation l'est de moins en moins à mesure qu'on s'éloigne du nuage, car rien ne garantit que le modèle reste valable en dehors des valeurs observées.

Sur l'exemple du glacier, prédire les ventes pour 7 heures d'ensoleillement est une interpolation : 7 est entre 2 et 10, et le calcul donne 0,9×7+5=11,3, soit environ 11 glaces vendues. La prédiction est crédible. En revanche, appliquer la formule pour x=24 donnerait 0,9×24+5=26,6 glaces : cette extrapolation est absurde, d'abord parce qu'il n'y a jamais 24 heures de soleil dans une journée, ensuite parce que même par une journée exceptionnellement ensoleillée, la relation observée entre 2 et 10 heures n'a aucune raison de se prolonger. Un modèle statistique décrit les données dont il est issu ; en sortir demande toujours une justification.

Ajustement par changement de variable

Tous les nuages ne sont pas alignés. Certains suivent une courbe qui monte de plus en plus vite, d'autres décroissent en s'aplatissant : leur forme évoque une exponentielle, une fonction inverse... Un ajustement affine direct y serait mauvais. L'idée du programme est astucieuse : transformer les données pour se ramener à un nuage aligné.

Nuage de points d'allure exponentielle : la courbe se redresse, aucun ajustement affine n'est pertinent

Le cas le plus important est le modèle exponentiel, qui réinvestit directement les fonctions ln et exp des chapitres précédents. Si l'on soupçonne une relation de la forme y=Beax (croissance ou décroissance exponentielle), on prend le logarithme des ordonnées : en posant z=lny, la relation devient z=ln(Beax)=ax+lnB. Autrement dit, z dépend de x de façon affine : le nuage des points (xi;zi) doit être presque aligné, et tout ce que nous savons faire s'applique à lui.

Méthode

Ajustement exponentiel par changement de variable.

  1. Poser zi=lnyi pour chaque donnée (possible car les yi sont strictement positifs).
  2. Vérifier que le nuage (xi;zi) est presque aligné (tracé ou coefficient de corrélation), puis faire la régression de z en x à la calculatrice : z=ax+b.
  3. Revenir à y : de lny=ax+b on tire y=eax+b=ebeax, c'est-à-dire y=Beax avec B=eb.

Ce va-et-vient entre y et z=lny est le point technique du chapitre : on transforme, on ajuste dans le monde transformé, puis on revient au monde de départ avec l'exponentielle.

Exemple

Ajustement des données de la figure. Reprenons les six points du nuage exponentiel : x=0,1,2,3,4,5 et y=2 ; 3 ; 4,5 ; 6,6 ; 9,9 ; 14,8. On pose zi=lnyi et on arrondit au centième.

xi 0 1 2 3 4 5
yi 2 3 4,5 6,6 9,9 14,8
zi=lnyi 0,69 1,10 1,50 1,89 2,29 2,69

Les zi augmentent d'environ 0,4 à chaque pas : le nuage (xi;zi) est presque parfaitement aligné. La calculatrice donne z0,40x+0,70 avec r1,00, un ajustement quasi parfait. On revient alors à y : ye0,70e0,40x2e0,40x. Ce modèle exponentiel décrit fidèlement les données, là où aucune droite ne le pouvait.

Signalons qu'un autre changement de variable classique est z=1x, adapté aux grandeurs qui décroissent « en inverse » (comme l'éclairement reçu quand on s'éloigne d'une lampe) : le principe est exactement le même, seule la transformation change.

Corrélation n'est pas causalité

Terminons par le point le plus important du chapitre pour la vie de citoyen, et thème d'étude officiel du programme : « Corrélation et causalité ». Un coefficient de corrélation proche de 1 dit que deux variables varient ensemble. Il ne dit rien sur le pourquoi.

Propriété

Corrélation et causalité. Une forte corrélation entre deux variables ne prouve pas que l'une est la cause de l'autre. Une corrélation observée peut relever de trois situations : une causalité directe (l'une des variables influence réellement l'autre), une variable cachée (un troisième facteur, dit facteur de confusion, influence les deux variables à la fois), ou une coïncidence pure.

L'exemple canonique est celui des ventes de glaces et des noyades : sur des données mensuelles, ces deux variables sont fortement corrélées. Personne ne pense pourtant que manger une glace fait couler, ni que les noyades donnent envie de glaces. La variable cachée est la chaleur : par beau temps, on achète plus de glaces et on se baigne davantage, donc les noyades augmentent. Le facteur commun crée la corrélation sans qu'aucune des deux variables n'agisse sur l'autre. Quant aux coïncidences pures, elles abondent dès qu'on compare suffisamment de séries de données : sur quelques années, presque n'importe quelle grandeur croissante est corrélée à n'importe quelle autre.

Cette distinction est explicitement une question d'épreuve. La formulation attendue d'un élève est du type : « les données montrent une corrélation entre les deux variables, mais on ne peut pas conclure à une causalité, car un facteur extérieur (par exemple la température) peut expliquer l'évolution simultanée des deux variables ». Affirmer une causalité demande bien plus qu'un calcul de r : une expérience contrôlée ou un raisonnement sur le mécanisme qui relie les deux grandeurs.

Ce chapitre clôt la boucle avec le reste de l'année : les ajustements exponentiels remobilisent les fonctions ln et exp, et les calculs sur données réelles se mènent naturellement à la calculatrice ou en Python, comme pour les suites et les simulations. C'est aussi le chapitre le plus directement utile hors des mathématiques : en médecine, en économie ou en sciences sociales, lire un nuage de points, juger un ajustement et se méfier des corrélations trompeuses sont des gestes quotidiens.

Bloqué sur « Statistique à deux variables » ?

On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.