1ʳᵉ techno · Chapitre 10 · Statistiques et probabilités
Variables aléatoires
Loi de probabilité, espérance, loi de Bernoulli, simulation d'échantillons, fluctuation en 1/√n.
Sommaire
Ce qu'il faut savoir faire
- Loi de probabilité
- Espérance
- Loi de Bernoulli
- Simulation d'échantillons
- Fluctuation en 1/√n
Au chapitre précédent, vous avez appris à calculer la probabilité d'un scénario complet dans une répétition d'épreuves de Bernoulli : « la joueuse réussit ses deux premiers tirs au but », « au moins une graine germe »… Mais dans beaucoup de situations concrètes, ce qui nous intéresse vraiment n'est pas le scénario lui-même : c'est un nombre qui en découle. Combien d'euros ce jeu de grattage va-t-il me rapporter ? Combien de clients satisfaits parmi les trois interrogés ? Quelle recette pour le stand de la kermesse ? Chaque fois, l'expérience est aléatoire, et le nombre qui en résulte l'est donc aussi : impossible de le connaître à l'avance, mais possible d'étudier ses valeurs et leurs probabilités. L'outil qui permet cette étude s'appelle une variable aléatoire. Ce chapitre vous apprend à la définir en situation, à dresser sa loi de probabilité, à calculer son espérance (le résultat moyen que l'on peut « espérer »), puis à faire le lien avec l'épreuve de Bernoulli du chapitre précédent et avec la simulation sur machine.
La notion de variable aléatoire
Partons d'un exemple. Sur un stand de kermesse, on lance un dé équilibré à six faces : si le dé affiche , on gagne € ; s'il affiche ou , on gagne € ; sinon, on perd €. L'expérience aléatoire est le lancer du dé, et ses issues sont les six faces. Mais ce qui intéresse le joueur, c'est son gain : un nombre qui dépend de l'issue obtenue. À chaque issue du lancer correspond un nombre, , ou . C'est exactement l'idée d'une variable aléatoire.
Définition
Variable aléatoire. Lorsqu'une expérience aléatoire est réalisée, une variable aléatoire est une quantité qui associe un nombre à chaque issue de l'expérience. On la note en général par une lettre majuscule, le plus souvent .
Comme l'issue de l'expérience est aléatoire, la valeur prise par l'est aussi : on ne la connaît qu'une fois l'expérience réalisée.
Il n'y a aucun formalisme à retenir ici : une variable aléatoire, c'est simplement « le nombre que produit l'expérience ». Toute la suite du chapitre consiste à étudier ce nombre. Voici quelques situations très variées où une variable aléatoire apparaît naturellement.
Exemple
- Gain à un jeu. Sur le stand de kermesse ci-dessus, on note le gain du joueur, en euros. Selon l'issue du lancer, prend la valeur , ou .
- Nombre de pannes. Une entreprise possède deux machines qui, chaque jour, tombent en panne ou non. On note le nombre de machines en panne dans la journée : prend la valeur , ou .
- Nombre de clients satisfaits. On interroge trois clients d'une enseigne et on note le nombre de clients satisfaits parmi eux : prend la valeur , , ou .
- Recette d'un spectacle. Une place coûte € en tarif plein et € en tarif réduit. Si un spectateur se présente à la caisse, la recette apportée par ce spectateur vaut ou selon son tarif.
Dans chacun de ces exemples, la variable aléatoire ne prend qu'un nombre limité de valeurs que l'on peut lister : on dit qu'elle est discrète. Ce sont les seules variables aléatoires étudiées cette année.
Pour travailler avec une variable aléatoire, il faut pouvoir décrire des événements qui la concernent : « le joueur gagne € », « au plus une machine est en panne »… Deux écritures servent à cela.
Définition
Les événements et . Soit une variable aléatoire et un nombre.
- désigne l'événement « prend la valeur » : il est réalisé par toutes les issues de l'expérience pour lesquelles le nombre associé est exactement .
- désigne l'événement « prend une valeur inférieure ou égale à ».
Leurs probabilités se notent et .
Ces écritures sont des raccourcis très pratiques, mais il faut savoir passer sans hésiter de l'écriture mathématique à la phrase en français, et inversement. C'est la première capacité du chapitre.
Méthode
Traduire une phrase en événement, et inversement.
- Du français vers les mathématiques : repérer la valeur ou le seuil dont parle la phrase, puis l'écrire avec . « Le joueur gagne exactement € » se traduit par ; « le joueur ne gagne pas plus de € » se traduit par .
- Des mathématiques vers le français : remplacer par ce qu'il représente dans le contexte. Si est le nombre de machines en panne, se lit « au plus une machine est en panne ».
- Pour calculer : repérer toutes les issues de l'expérience qui donnent la valeur , puis additionner leurs probabilités.
Exemple
Reprenons le jeu de la kermesse : dé équilibré, gain valant € pour un , € pour un ou un , et € sinon.
Traduire. L'événement « le joueur gagne € » s'écrit ; l'événement « le joueur perd de l'argent » s'écrit , car la seule valeur négative possible est ; l'écriture se lit « le joueur gagne au plus € ».
Calculer. Le dé étant équilibré, chaque face a la probabilité .
- est réalisé par la seule face : .
- est réalisé par les faces et : .
- est réalisé par les faces , et : .
Vous voyez le principe : on revient toujours aux issues de l'expérience, on regarde quel nombre chacune produit, et on additionne les probabilités des issues qui conviennent. Ranger tous ces résultats dans un tableau, c'est précisément dresser la loi de probabilité de .
Loi de probabilité
Une fois les valeurs possibles de identifiées et leurs probabilités calculées, il est naturel de tout rassembler dans un tableau : les valeurs sur la première ligne, les probabilités correspondantes sur la seconde. Ce tableau contient toute l'information sur .
Définition
Loi de probabilité. Donner la loi de probabilité d'une variable aléatoire , c'est donner toutes les valeurs que peut prendre, et pour chacune la probabilité correspondante. On présente la loi dans un tableau :
| Valeur | ||||
|---|---|---|---|---|
Ce tableau n'est pas quelconque : comme les valeurs recouvrent tout ce qui peut arriver, les probabilités de la seconde ligne recouvrent toutes les issues de l'expérience. Leur somme est donc obligatoirement égale à , exactement comme la somme des probabilités des chemins d'un arbre au chapitre précédent.
Propriété
Somme des probabilités. Dans la loi de probabilité d'une variable aléatoire, la somme de toutes les probabilités vaut :
C'est un excellent moyen de vérifier un tableau : si la somme ne fait pas , il y a une erreur quelque part (une valeur oubliée ou une probabilité fausse).
Construisons une loi de probabilité complète, de l'énoncé jusqu'au tableau vérifié.
Exemple
Reprenons une dernière fois le jeu de la kermesse. Les valeurs possibles du gain sont , et , et nous avons déjà calculé leurs probabilités. La loi de probabilité de est donc :
| Valeur | |||
|---|---|---|---|
Vérification : . Le tableau est cohérent.
Utiliser la loi pour calculer . Quelle est la probabilité que le joueur gagne au plus € ? L'événement regroupe les valeurs et ; on additionne les probabilités correspondantes lues dans le tableau :
Il y a donc chances sur que le joueur reparte avec au plus €. Autrement dit, le beau gain de € est rare : c'est déjà un premier indice sur l'intérêt (ou non !) de jouer à ce jeu.
Retenez ce réflexe : pour un événement du type , on repère dans le tableau toutes les valeurs inférieures ou égales à et on additionne leurs probabilités. La loi de probabilité répond ainsi à toutes les questions de probabilité sur . Mais elle permet aussi de répondre à une question différente et très concrète : en moyenne, combien ce jeu rapporte-t-il ?
L'espérance
Imaginez qu'un joueur enchaîne un très grand nombre de parties du jeu de la kermesse. Certaines parties lui rapportent €, d'autres €, beaucoup lui coûtent €. Sur l'ensemble, gagne-t-il ou perd-il de l'argent ? Pour le savoir, il faut calculer une moyenne des gains possibles ; mais pas une moyenne ordinaire, car les trois gains n'ont pas la même chance de se produire. Le gain , deux fois plus probable que le gain , doit peser deux fois plus lourd dans la moyenne. On calcule donc une moyenne pondérée par les probabilités : c'est l'espérance.
Définition
Espérance d'une variable aléatoire. Soit une variable aléatoire de loi de probabilité :
| Valeur | ||||
|---|---|---|---|---|
L'espérance de , notée , est la moyenne des valeurs de pondérée par leurs probabilités :
En pratique : on multiplie chaque valeur de la première ligne du tableau par la probabilité écrite juste en dessous, puis on additionne tout.
Exemple
Calculons l'espérance du gain au jeu de la kermesse, à partir de sa loi :
L'espérance du gain vaut d'euro, soit environ €. Que signifie ce nombre ? Sûrement pas qu'une partie rapporte centimes : aucune partie ne rapporte cette somme ! C'est une moyenne, dont l'interprétation est la suivante.
Propriété
Interprétation de l'espérance. Si l'on répète l'expérience un grand nombre de fois, la moyenne des valeurs observées de se rapproche de . L'espérance s'interprète donc comme la valeur moyenne de « sur le long terme ».
Par exemple, pour le jeu de la kermesse ( €), un joueur qui fait parties peut s'attendre à un gain total voisin de € : en moyenne, le jeu lui rapporte de l'argent.
L'espérance est l'outil idéal pour juger un jeu d'argent : elle dit qui, du joueur ou de l'organisateur, est gagnant sur le long terme. Attention toutefois à une subtilité : quand une partie coûte une mise, il faut raisonner sur le gain algébrique, c'est-à-dire ce que le joueur reçoit moins ce qu'il a payé.
Méthode
Étudier un jeu d'argent.
- Définir le gain algébrique. Noter le gain algébrique du joueur : sommes reçues moins la mise. Un jeu à € qui fait gagner € correspond à ; un jeu perdu correspond à .
- Dresser la loi de et vérifier que la somme des probabilités vaut .
- Calculer avec la formule de l'espérance.
- Conclure en contexte :
- si , le jeu est favorable au joueur (il gagne en moyenne) ;
- si , le jeu est défavorable au joueur (il perd en moyenne, et l'organisateur gagne) ;
- si , le jeu est équitable : sur le long terme, personne ne gagne ni ne perd.
Exemple
Une association vend tickets de grattage à € pièce pour financer un voyage. Parmi les tickets, font gagner €, font gagner €, et les autres ne font rien gagner. Le jeu est-il favorable à l'acheteur d'un ticket ?
Gain algébrique. On note le gain algébrique de l'acheteur : les sommes reçues moins les € du ticket. Les valeurs possibles sont , puis , et enfin pour les tickets perdants.
Loi de . Chaque ticket ayant la même chance d'être acheté :
| Valeur | |||
|---|---|---|---|
On vérifie : .
Espérance.
Conclusion. : le jeu est défavorable à l'acheteur, qui perd en moyenne € par ticket. Vu du côté de l'association, c'est une bonne nouvelle : chaque ticket vendu lui rapporte en moyenne €, ce qui est bien le but d'une tombola ! Pour rendre le jeu équitable, il faudrait que l'espérance soit nulle, mais l'association ne financerait alors plus rien.
Nous savons désormais définir une variable aléatoire, dresser sa loi et calculer son espérance. Il est temps de retrouver une vieille connaissance du chapitre précédent : l'épreuve de Bernoulli, qui donne naissance à la plus simple de toutes les variables aléatoires.
La loi de Bernoulli
Au chapitre précédent, une épreuve de Bernoulli était une expérience à deux issues : le succès , de probabilité , et l'échec , de probabilité . Pour en faire une variable aléatoire, il suffit d'associer un nombre à chacune des deux issues, et le choix le plus naturel est le plus simple qui soit : pour le succès, pour l'échec. On obtient ainsi une variable qui « compte » le succès.
Définition
Loi de Bernoulli. On considère une épreuve de Bernoulli de paramètre , et on note la variable aléatoire qui vaut si l'épreuve donne un succès et si elle donne un échec. On dit que suit la loi de Bernoulli de paramètre . Sa loi de probabilité est :
| Valeur | ||
|---|---|---|
C'est la loi la plus simple que l'on puisse imaginer : deux valeurs seulement, et un unique paramètre qui décrit tout. Son espérance se calcule en une ligne.
Propriété
Espérance de la loi de Bernoulli. Si suit la loi de Bernoulli de paramètre , alors :
L'espérance d'une loi de Bernoulli est égale à son paramètre. C'est cohérent avec l'interprétation de l'espérance : ne prend que les valeurs et , donc sa moyenne sur un grand nombre de répétitions est la proportion de , c'est-à-dire la proportion de succès, qui se rapproche de .
Reconnaître une situation modélisée par une loi de Bernoulli est une capacité attendue. La démarche reprend les réflexes du chapitre précédent.
Méthode
Reconnaître une situation modélisée par une loi de Bernoulli.
- Deux issues ? Vérifier que l'expérience n'a que deux issues possibles, ou s'y ramener en appelant succès l'événement qui intéresse la question et échec son contraire.
- Choisir le succès et identifier . Décider clairement ce que l'on appelle succès et relever sa probabilité dans l'énoncé.
- Définir la variable. Poser en cas de succès et en cas d'échec : alors suit la loi de Bernoulli de paramètre .
Exemple
- On interroge au hasard un client d'une enseigne dont des clients sont satisfaits, et on pose si le client est satisfait, sinon : suit la loi de Bernoulli de paramètre , et .
- On prélève une pièce en sortie d'usine, sachant que de la production est défectueuse, et on pose si la pièce est défectueuse : suit la loi de Bernoulli de paramètre . Comme au chapitre précédent, le « succès » n'est pas une bonne nouvelle : c'est un choix de modélisation.
- On lance un dé équilibré et on pose si le dé affiche un six : suit la loi de Bernoulli de paramètre .
Une dernière remarque, qui prépare toute la fin du chapitre. Si l'on répète l'épreuve fois dans les mêmes conditions, on obtient une liste de et de : un échantillon de taille de la loi de Bernoulli. La fréquence des dans cet échantillon (le nombre de divisé par ) est alors une estimation naturelle du paramètre : c'est la proportion de succès observée. Mais cette fréquence varie d'un échantillon à l'autre, puisque le hasard s'en mêle. À quel point varie-t-elle ? Peut-on lui faire confiance ? C'est ce que la simulation va nous montrer.
Simulation et fluctuation d'échantillonnage
Plutôt que de lancer un dé mille fois ou d'interroger cent clients réels, on peut demander à un ordinateur de simuler l'expérience. Python fournit pour cela la fonction random() du module random : chaque appel renvoie un nombre décimal « tiré au hasard » entre et , tous les nombres de cet intervalle étant également probables.
Comment en tirer un succès de probabilité ? L'idée est très simple : la probabilité que le nombre renvoyé par random() soit inférieur à est exactement . En effet, les nombres possibles remplissent uniformément l'intervalle de à , de longueur ; ceux qui sont inférieurs à remplissent l'intervalle de à , de longueur . La proportion de « place » favorable est donc . Ainsi, le test random() < p est vrai avec la probabilité et faux avec la probabilité : c'est une épreuve de Bernoulli de paramètre !
Voici un script complet qui simule un échantillon de taille d'une loi de Bernoulli de paramètre (imaginez par exemple que l'on interroge habitants d'une ville où des habitants utilisent les transports en commun), et qui calcule la fréquence des . La variable compteur est un compteur : elle démarre à et augmente de à chaque succès rencontré. C'est le principe d'accumulateur : une variable qui accumule un résultat au fil de la boucle.
from random import random
p = 0.4
n = 100
compteur = 0 # compteur de succès, démarre à 0
for i in range(n):
if random() < p: # succès avec la probabilité p
compteur = compteur + 1
frequence = compteur / n # fréquence des 1 dans l'échantillon
print(frequence)
Exécutez ce script plusieurs fois : vous obtiendrez par exemple , puis , puis … Jamais deux fois la même valeur, et pas exactement ! Ce phénomène porte un nom : la fluctuation d'échantillonnage. La fréquence observée des varie d'un échantillon à l'autre, tout en restant « dans les parages » de . Pour étudier sérieusement cette fluctuation, un ou deux échantillons ne suffisent pas : il en faut plusieurs centaines. Le script suivant simule échantillons de taille et accumule les fréquences observées dans une liste.
from random import random
p = 0.4
n = 100
N = 500
frequences = [] # liste accumulant les fréquences observées
for j in range(N):
compteur = 0
for i in range(n):
if random() < p:
compteur = compteur + 1
frequences.append(compteur / n)
Que faire de ces nombres ? D'abord, les représenter. L'histogramme ci-dessous regroupe les fréquences observées par petites classes : on voit combien d'échantillons ont donné une fréquence proche de , de , de …
La lecture de cet histogramme est riche d'enseignements. Les fréquences observées s'étalent entre et : la fluctuation est bien réelle, certains échantillons s'éloignent nettement de . Mais l'immense majorité des fréquences se concentre autour de , matérialisé par la ligne pointillée : plus on s'éloigne de , plus les échantillons se font rares. On peut aussi représenter les fréquences par un nuage de points, un point par échantillon : voici les premiers échantillons de la simulation.
Les points dansent de part et d'autre de la ligne , la plupart restant dans la bande délimitée par les deux lignes et . Mais que désigne ce nombre ? C'est l'écart-type de la série des fréquences observées, c'est-à-dire l'indicateur de dispersion que vous connaissez en statistique : il mesure à quel point les fréquences s'écartent, en moyenne, de leur centre. On le calcule à la machine (calculatrice ou Python) sur la série simulée ; ici, la machine donne . Il est alors naturel de compter combien d'échantillons ont donné une fréquence à distance au plus , ou de , c'est-à-dire dans l'intervalle pour , ou . Un compteur suffit :
s = 0.049 # écart-type de la série, donné par la machine
k = 2
compteur = 0
for f in frequences:
if p - k * s <= f <= p + k * s:
compteur = compteur + 1
print(compteur * 100 / N) # pourcentage d'échantillons dans l'intervalle
Sur notre simulation de échantillons, les résultats sont les suivants :
- des échantillons ont une fréquence à distance au plus de ;
- ont une fréquence à distance au plus de ;
- ont une fréquence à distance au plus de .
Propriété
Fréquent ou rare ? Sur un grand nombre d'échantillons simulés, on constate qu'une fréquence observée proche de (à distance au plus ) est une situation fréquente : elle concerne plus de échantillons sur . À l'inverse, une fréquence qui s'écarte de de plus de , et a fortiori de plus de , est une situation rare dans le modèle : environ des échantillons au-delà de , et moins de au-delà de sur notre simulation.
Concrètement : si l'on interroge habitants dans une ville où , observer une fréquence de n'a rien de surprenant ; observer , en revanche, est un événement rare dans le modèle.
Une dernière question, très naturelle : peut-on réduire la fluctuation ? Intuitivement, oui : plus l'échantillon est grand, plus la fréquence observée devrait être fiable. La simulation permet de préciser cette intuition. Reprenons échantillons d'une loi de Bernoulli de paramètre , pour plusieurs tailles , et calculons chaque fois l'écart-type de la série des fréquences :
La lecture ligne à ligne est déjà parlante : quand est multiplié par (de à , puis de à ), l'écart-type est divisé par (de à , puis à ). Pour visualiser la tendance, plaçons pour chaque taille un point d'abscisse et d'ordonnée :
Les quatre points sont presque alignés sur une droite passant par l'origine : l'écart-type est proportionnel à . On retiendra que la dispersion des fréquences observées est de l'ordre de .
Propriété
Dispersion et taille de l'échantillon. Sur des simulations, on constate que l'écart-type de la série des fréquences observées est de l'ordre de , où est la taille des échantillons.
Conséquence pratique : pour diviser la dispersion par , il faut multiplier la taille de l'échantillon par . Diviser la fluctuation par exige des échantillons fois plus grands ; la diviser par exige des échantillons fois plus grands.
Cette dernière règle a des conséquences très concrètes : un institut de sondage qui veut une estimation deux fois plus précise doit interroger quatre fois plus de personnes, avec le coût que cela représente. La précision se paie cher, et c'est la racine carrée qui en est responsable.
Résumons le chemin parcouru. Une variable aléatoire associe un nombre à chaque issue d'une expérience aléatoire ; sa loi de probabilité rassemble ses valeurs et leurs probabilités dans un tableau dont la somme vaut ; son espérance en donne la valeur moyenne sur un grand nombre de répétitions, ce qui permet notamment de juger si un jeu est favorable, défavorable ou équitable. La loi de Bernoulli, qui vaut avec la probabilité et sinon, est la plus simple d'entre elles, et son espérance est . Enfin, la simulation d'échantillons a révélé la fluctuation d'échantillonnage : la fréquence observée des varie autour de , s'en écarte rarement de plus de ou , et sa dispersion diminue comme quand la taille des échantillons augmente. Ces idées, ici simplement observées sur des simulations, seront approfondies en terminale.
Bloqué sur « Variables aléatoires » ?
On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.