PCSI · Chapitre 14 · Second semestre
Probabilités
Univers fini, conditionnement, formule de Bayes, lois usuelles, indépendance, espérance, variance, inégalité de Bienaymé-Tchebychev.
Sommaire
Ce qu'il faut savoir faire
- Univers fini
- Conditionnement
- Formule de Bayes
- Lois usuelles
- Indépendance
- Espérance
- Variance
- Inégalité de Bienaymé-Tchebychev
Introduction
Au lycée, une probabilité s'est longtemps ramenée à une proportion : on comptait des cas favorables, on divisait par des cas possibles, et l'on obtenait un nombre. Ce chapitre conserve entièrement ce savoir-faire, mais il en change le statut. Ce qui était une recette devient ici une conséquence d'une définition : nous appellerons probabilité une application définie sur l'ensemble des parties d'un ensemble fini, à valeurs dans , valant sur l'ensemble tout entier et additive sur les parties disjointes. Trois lignes d'axiomes, et tout le reste s'en déduit, y compris la formule de Bayes et la loi des grands nombres. Le premier bénéfice de cette formalisation est la disparition des raisonnements flous : une phrase française comme « au moins deux capteurs sur cinq tombent en panne » devient une partie explicite de l'univers, sur laquelle on peut calculer sans jamais se demander si l'on a bien compris l'énoncé.
Le cadre est strictement fini, et c'est un choix assumé qui gouverne le chapitre entier. L'univers , c'est-à-dire l'ensemble des résultats possibles de l'expérience, est un ensemble fini non vide, et toutes les sommes que nous écrirons seront des sommes finies, donc calculables sans le moindre théorème de convergence. Le prix à payer est réel et doit être annoncé : nous ne modéliserons pas « je répète l'essai jusqu'au premier succès » sans borne sur le nombre d'essais, ni aucune grandeur continue comme une durée ou une température. Ces situations sont hors de portée des outils de première année, et elles seront reprises plus tard.
La rupture décisive intervient au milieu du chapitre, avec les variables aléatoires. Tant que l'on manipule des événements, on manipule des parties de , objets ensemblistes lourds à décrire et sur lesquels on ne sait presque rien faire : on peut les réunir, les intersecter, les complémenter, c'est tout. Une variable aléatoire est simplement une application définie sur , mais lorsqu'elle est à valeurs réelles, elle transporte l'expérience dans un monde où l'on sait additionner, multiplier, comparer, majorer. Le gain d'un joueur, le nombre de pièces défectueuses d'un lot, la somme de deux dés : ce sont des nombres, et l'algèbre des nombres devient disponible. Cette algèbre culmine dans une propriété d'apparence anodine, la linéarité de l'espérance, qui vaut sans aucune hypothèse d'indépendance et qui fournit l'outil le plus rentable du chapitre, la méthode des indicatrices.
Le chapitre s'achève sur deux inégalités, celle de Markov et celle de Bienaymé-Tchebychev, et sur la loi faible des grands nombres énoncée sous forme non asymptotique : pour variables indépendantes de même loi, la probabilité que la moyenne observée s'écarte de plus de de l'espérance commune est majorée par . Cette majoration explicite est le point d'arrivée naturel de tout ce qui précède, car elle justifie enfin, en tant que théorème et non en tant qu'intuition, la phrase que chacun répète depuis le collège : sur un grand nombre de répétitions, la fréquence observée d'un événement s'approche de sa probabilité. Elle permet même de répondre à une question d'ingénieur, « combien de mesures faut-il pour garantir telle précision avec tel risque ? », et c'est par ce calcul que nous terminerons.
Univers fini, événements
Expérience aléatoire, univers, issues
Définition
On appelle expérience aléatoire une expérience dont on connaît à l'avance l'ensemble des résultats possibles, mais dont on ne peut pas prédire avec certitude lequel se produira.
L'ensemble de ses résultats possibles s'appelle l'univers de l'expérience et se note . Dans tout ce chapitre, est un ensemble fini et non vide. Ses éléments, notés , s'appellent les issues, ou résultats élémentaires.
Exemple
Quelques univers, écrits explicitement.
Un lancer de dé à six faces : , de cardinal .
Un lancer de pièce suivi d'un lancer de dé : , de cardinal . Une issue est un couple, par exemple .
Le contrôle de trois composants sortis d'une chaîne de production, chacun étant déclaré conforme ou défectueux : , de cardinal .
Écrire n'est jamais une formalité. C'est le premier acte de la modélisation, celui qui détermine tous les calculs suivants, et une bonne partie des erreurs de ce chapitre viennent d'un univers mal choisi ou, pire, changé en cours de route sans qu'on s'en aperçoive.
Événements et vocabulaire ensembliste
Définition
Soit un univers fini. On appelle événement toute partie de , c'est-à-dire tout élément de . On dit que l'issue réalise l'événement lorsque .
Un événement élémentaire est un événement réduit à un singleton . L'événement est dit certain, l'événement est dit impossible.
Tout le vocabulaire probabiliste est une traduction du vocabulaire ensembliste, et savoir passer instantanément d'une langue à l'autre est la compétence de base du chapitre : c'est ce passage qui transforme une phrase rédigée en français en un calcul.
| Écriture ensembliste | Traduction probabiliste |
|---|---|
| une issue, un résultat possible de l'expérience | |
| un événement | |
| l'événement élémentaire « le résultat est » | |
| l'événement certain | |
| l'événement impossible | |
| l'issue réalise | |
| « et » : les deux sont réalisés | |
| « ou » : l'un au moins est réalisé | |
| événement contraire : « n'est pas réalisé » | |
| et sont incompatibles | |
| la réalisation de entraîne celle de | |
| « est réalisé mais pas » | |
| « l'un au moins des est réalisé » | |
| « tous les sont réalisés » | |
| « aucun des n'est réalisé » |
Les deux dernières lignes sont les lois de De Morgan, et elles seront utilisées constamment : la traduction de « aucun » est une intersection de contraires, celle de « au moins un » est le contraire de cette intersection. C'est déjà, en germe, la technique du passage au complémentaire.
Événements incompatibles, systèmes complets
Définition
Deux événements et sont dits incompatibles (ou disjoints) lorsque : aucune issue ne les réalise simultanément.
Une famille d'événements est dite deux à deux incompatible lorsque pour tous dans .
Définition
Une famille d'événements est un système complet d'événements lorsque :
- les sont deux à deux incompatibles : pour tous ;
- leur réunion est l'univers tout entier : .
Autrement dit, quelle que soit l'issue de l'expérience, un et un seul des est réalisé.
Exemple
Trois systèmes complets à avoir en tête en permanence.
Pour tout événement , la famille est un système complet à deux éléments : les deux événements sont incompatibles et leur réunion est . C'est le plus utilisé de tous, et c'est lui qui autorise à « discuter selon que est réalisé ou non ».
La famille de tous les événements élémentaires est un système complet, car toute issue appartient à un unique singleton.
On tire une pièce dans un lot produit par trois machines , , . En notant l'événement « la pièce vient de la machine », la famille est un système complet : la pièce vient d'une machine et d'une seule.
La convention retenue ici est la plus souple : on n'exige pas des qu'ils soient non vides, un événement vide ne contribuant jamais que pour dans les formules. En revanche, dès qu'un conditionnement interviendra, il faudra exiger , et cette hypothèse sera alors écrite explicitement.
Choisir son univers : trois protocoles de tirage
Une même urne donne trois univers différents selon le protocole de tirage, et c'est ce choix, fait au début et tenu jusqu'au bout, qui rend un calcul juste ou faux. Considérons une urne contenant boules numérotées de à , dont on extrait boules.
Exemple
Tirages successifs avec remise. On tire une boule, on note son numéro, on la remet, et on recommence trois fois. Un résultat est un triplet ordonné de numéros pouvant se répéter, donc
Tirages successifs sans remise. On tire trois boules l'une après l'autre sans jamais remettre. Un résultat est un triplet ordonné de numéros deux à deux distincts, donc
Tirage simultané. On plonge la main et on prend trois boules d'un coup. L'ordre n'a plus de sens, un résultat est une partie à trois éléments :
Les deux derniers protocoles décrivent la même situation physique vue de deux façons : , car chaque partie à trois éléments correspond exactement aux triplets ordonnés que l'on peut former avec ses éléments. On pourra donc, pour un tirage sans remise, choisir librement le modèle ordonné ou le modèle non ordonné : les probabilités calculées seront les mêmes, à condition de ne pas mélanger les deux en cours de raisonnement. Le modèle ordonné est plus commode dès qu'on veut parler du « premier tiré », le modèle non ordonné est plus court quand seule la composition finale compte.
Espaces probabilisés finis
Définition d'une probabilité
Définition
Soit un univers fini non vide. On appelle probabilité sur toute application
vérifiant les deux conditions suivantes :
- ;
- pour tous événements et incompatibles, .
Le couple s'appelle alors un espace probabilisé fini.
Propriété
Soit un espace probabilisé fini et soit une famille d'événements deux à deux incompatibles. Alors
En particulier, si est un système complet d'événements, alors .
Démonstration. Par récurrence sur . Pour l'égalité est immédiate, et pour c'est exactement l'axiome d'additivité.
Soit . Supposons la propriété vraie pour toute famille de événements deux à deux incompatibles, et soit une famille de tels événements. Posons . Les événements et sont incompatibles : si une issue appartenait à , elle appartiendrait à un certain avec et à , donc à , ce qui est absurde. L'axiome d'additivité donne alors
et l'hypothèse de récurrence appliquée à donne , d'où le résultat au rang .
Enfin, si la famille est un système complet, sa réunion vaut et la somme des vaut .
Une probabilité est déterminée par la distribution des singletons
Définition
Soit un univers fini et une probabilité sur . La famille s'appelle la distribution de probabilités associée à .
Propriété
Soit un univers fini.
- Si est une probabilité sur , alors pour tout événement ,
avec la convention que la somme vide vaut . 2. Réciproquement, si est une famille de réels positifs de somme , il existe une unique probabilité sur telle que pour tout .
Démonstration. Point 1. Si , les deux membres sont nuls, car (démontré ci-dessous, et la démonstration n'utilise pas ce point). Sinon, écrivons avec des issues deux à deux distinctes. Alors , et ces singletons sont deux à deux incompatibles puisque deux singletons distincts sont disjoints. L'additivité finie établie plus haut donne exactement
Point 2, unicité. Si et sont deux probabilités qui coïncident sur les singletons, alors pour tout événement , le point 1 donne
donc .
Point 2, existence. Définissons sur par . Cette somme est finie à termes positifs, donc ; et comme les termes omis sont eux aussi positifs, . Ainsi est bien à valeurs dans , et . Vérifions l'additivité : soient et incompatibles, et notons et les ensembles des indices tels que et respectivement. Comme , les ensembles et sont disjoints, et l'ensemble des indices associés à est exactement . La somme sur se scinde donc :
L'application est donc une probabilité, et par construction.
Ce résultat est le mode d'emploi du chapitre : définir une probabilité, c'est répartir une masse totale égale à sur les issues, rien d'autre. Face à un énoncé, le premier travail consiste à écrire puis à donner les nombres , ou une règle qui les fournit ; tout le reste s'obtient ensuite par simple addition. Un même univers porte évidemment une infinité de probabilités : dit ce qui peut arriver, dit avec quel poids.
Exemple
Un dé pipé. Un dé à six faces est truqué de sorte que le sorte une fois sur trois, les cinq autres faces restant équiprobables entre elles. On prend et l'on cherche la distribution. Par hypothèse , et les cinq autres singletons ont une probabilité commune . La somme des six valeurs vaut , donc
Vérification : . La probabilité d'obtenir un résultat pair vaut alors
Le truquage fait donc passer la probabilité d'un résultat pair de à .
Propriétés de calcul
Propriété
Soit un espace probabilisé fini et soient et deux événements. Alors :
- ;
- ;
- ;
- si , alors (croissance) ;
- ;
- (sous-additivité).
Démonstration. Point 1. Les événements et sont incompatibles et leur réunion vaut ; l'additivité donne , d'où .
Point 2. Les événements et sont incompatibles et leur réunion est , donc .
Point 3. Décomposons selon que est réalisé ou non :
Ces deux événements sont incompatibles, le premier étant inclus dans et le second dans . L'additivité donne , d'où le résultat.
Point 4. Si , alors , et le point 3 appliqué à donne . Or puisque est à valeurs dans , donc .
Point 5. Décomposons la réunion en , réunion de deux événements incompatibles, le second étant inclus dans . Donc , et le point 3 permet de conclure :
Point 6. C'est le point 5 dont on retranche la quantité positive .
Propriété
Soit un espace probabilisé fini et soit une famille quelconque d'événements. Alors
Démonstration. Par récurrence sur . Pour c'est une égalité. Supposons l'inégalité vraie au rang et posons . La sous-additivité pour deux événements donne
la deuxième inégalité venant de l'hypothèse de récurrence. C'est l'inégalité au rang .
Exemple
Deux défauts sur une pièce. Une pièce sortant d'une chaîne peut présenter un défaut de soudure (événement ) et un défaut de marquage (événement ). Une étude donne , et . Alors :
donc des pièces présentent au moins un défaut, et des pièces sont parfaites. La probabilité qu'une pièce ait un défaut de soudure et pas de défaut de marquage vaut
Enfin, la majoration brute est correcte mais grossière : elle compte deux fois les de pièces cumulant les deux défauts.
Réunion de trois événements ou plus : le crible est hors programme
Pour deux événements, la correction du double comptage est exacte, c'est le point 5 ci-dessus. Pour trois événements ou davantage, il existe une formule générale, dite formule du crible ou de Poincaré, qui alterne les sommes d'intersections. Elle est explicitement hors du programme de PCSI : vous ne devez ni l'écrire ni l'utiliser. Ce n'est pas une gêne, car toute situation où l'on serait tenté de l'invoquer se traite par l'un des trois procédés suivants.
Méthode
Calculer sans crible.
1. Passage au complémentaire. C'est la parade principale. Par les lois de De Morgan,
et l'intersection des contraires, qui traduit « aucun des », est presque toujours plus facile à calculer, notamment sous une hypothèse d'indépendance. Retenir : « au moins un » se calcule par « aucun ».
2. Découpage en événements deux à deux incompatibles. On réécrit la réunion comme une réunion disjointe, par exemple en classant les issues selon le premier indice pour lequel est réalisé, puis on additionne.
3. Majoration. Si l'énoncé demande seulement de montrer qu'une probabilité est petite, la sous-additivité suffit souvent.
Exemple
Trois capteurs. Une machine est équipée de trois capteurs qui tombent en panne indépendamment les uns des autres, chacun avec probabilité sur un mois. On cherche la probabilité qu'au moins un capteur tombe en panne dans le mois. Notons l'événement « le capteur tombe en panne ». Le calcul direct de exigerait le crible, interdit ici. On passe au complémentaire : l'événement contraire est , « aucun capteur ne tombe en panne », de probabilité par indépendance. Donc
La majoration par sous-additivité aurait donné , ce qui est exact mais moins précis.
Probabilité uniforme et dénombrement
Probabilité uniforme
Définition
Soit un univers fini non vide de cardinal . La probabilité uniforme sur est l'unique probabilité dont la distribution est constante, c'est-à-dire telle que pour toute issue . On dit alors qu'il y a équiprobabilité.
Propriété
Si est la probabilité uniforme sur , alors pour tout événement ,
formule que l'on énonce : « nombre de cas favorables sur nombre de cas possibles ».
Démonstration. La distribution constante est admissible : ses termes sont positifs et leur somme vaut , donc la probabilité uniforme existe et est unique d'après le théorème de la section précédente. Pour tout événement , ce même théorème donne
puisque la somme comporte exactement termes tous égaux à .
L'équiprobabilité est une hypothèse de modélisation, jamais une conséquence. Elle se justifie par la symétrie du dispositif (dé équilibré, pièce non truquée, cartes bien battues, individu choisi « au hasard ») et doit être écrite en rédaction. Attention surtout à ceci : l'équiprobabilité dépend du choix de . Pour deux dés équilibrés, les couples de sont équiprobables, mais les sommes possibles ne le sont pas du tout, puisque la somme est réalisée par six couples et la somme par un seul, d'où et . Prendre pour univers l'ensemble des sommes en le supposant uniforme est l'erreur de modélisation la plus fréquente du chapitre.
Rappels de dénombrement
Le chapitre précédent fournit exactement les quatre cardinaux dont on a besoin. Soit un ensemble de cardinal et un entier naturel.
Propriété
- Le nombre de -listes d'éléments de , c'est-à-dire , vaut .
- Pour , le nombre de -listes d'éléments deux à deux distincts de (arrangements) vaut
- Le nombre de permutations de , c'est-à-dire de -listes d'éléments distincts, vaut .
- Pour , le nombre de parties à éléments de vaut .
Le tableau suivant traduit chaque protocole d'expérience en objet à compter. C'est lui qu'il faut avoir en tête au moment de choisir l'univers.
| Protocole de tirage dans objets | Objet mathématique | Cardinal |
|---|---|---|
| tirages successifs avec remise | -liste, élément de | |
| tirages successifs sans remise | -liste d'éléments distincts | |
| tirage simultané de objets | partie à éléments | |
| classement des objets | permutation | |
| choix des positions de succès parmi essais | partie à éléments de |
Méthode
Calculer une probabilité par dénombrement.
- Décrire l'univers par une phrase précisant l'ordre : « l'ensemble des triplets ordonnés », « l'ensemble des parties à trois éléments ». Justifier l'équiprobabilité.
- Calculer avec le tableau ci-dessus.
- Décrire l'événement comme un ensemble d'objets du même type que ceux de , puis compter par étapes indépendantes (principe multiplicatif) ou par cas disjoints (principe additif).
- Conclure par , et contrôler que le résultat est bien dans .
Exemples entièrement traités
Exemple
Le même tirage compté de deux façons. Une urne contient jetons indiscernables au toucher, dont rouges et verts. On en tire . Quelle est la probabilité d'obtenir exactement jetons rouges ?
Modèle simultané. On prend pour univers l'ensemble des parties à éléments de l'urne, muni de la probabilité uniforme, ce qui est légitime car les jetons sont indiscernables et le tirage se fait au hasard. Alors
Une partie favorable s'obtient en choisissant rouges parmi , puis vert parmi , soit
Modèle successif sans remise. On prend cette fois pour univers l'ensemble des triplets ordonnés de jetons distincts, de cardinal . Pour former un triplet favorable, on choisit d'abord les deux positions occupées par les rouges parmi les trois, soit possibilités, puis les deux rouges dans l'ordre, soit possibilités, puis le vert restant, soit possibilités. Cela donne triplets favorables, et
Les deux modèles donnent bien le même nombre, ce qui est rassurant et attendu : ils décrivent la même expérience.
Exemple
Un code à quatre chiffres. Un digicode demande un code de chiffres, chacun choisi au hasard et indépendamment dans . Quelle est la probabilité que les quatre chiffres soient deux à deux distincts ?
L'univers est l'ensemble des -listes de chiffres, de cardinal , muni de la probabilité uniforme. Les codes favorables sont les -listes d'éléments distincts, au nombre de . Donc
Par passage au complémentaire, la probabilité qu'au moins deux chiffres coïncident vaut , soit pratiquement une chance sur deux, ce qui surprend souvent.
Exemple
Cinq dés. On lance cinq dés équilibrés discernables. Quelle est la probabilité d'obtenir exactement deux ?
L'univers naturel est , l'ensemble des -listes de résultats, de cardinal , muni de la probabilité uniforme puisque les dés sont équilibrés. Pour construire une issue favorable, on choisit les deux positions des parmi les cinq, soit possibilités, puis les trois autres résultats, chacun dans , soit possibilités. Il y a donc issues favorables et
Ce calcul est en réalité celui d'une loi binomiale, que nous retrouverons plus loin sous la forme .
Probabilités conditionnelles
Définition
Définition
Soient un espace probabilisé fini et un événement tel que . Pour tout événement , on appelle probabilité conditionnelle de sachant le réel
Les deux notations et désignent la même quantité ; nous utiliserons surtout la première, qui met en évidence le fait que est une nouvelle probabilité. L'idée est un changement d'univers : savoir que est réalisé revient à décréter que les issues extérieures à n'existent plus, donc à redistribuer la masse à l'intérieur de proportionnellement aux masses initiales ; la division par est exactement la renormalisation qui rend la masse totale égale à . La condition n'est pas une coquetterie de rédaction, c'est une nécessité : le quotient n'a aucun sens sinon. Vérifiez-la et signalez-la avant d'écrire .
est une probabilité
Propriété
Soit un événement tel que . L'application est une probabilité sur .
En conséquence, toutes les propriétés démontrées précédemment lui sont applicables ; par exemple et .
Démonstration. Vérifions d'abord que est à valeurs dans . Pour tout événement , on a , donc par croissance ; en divisant par , il vient .
Ensuite .
Enfin, soient et deux événements incompatibles. Les événements et sont alors eux aussi incompatibles, car . Par distributivité, , donc l'additivité de donne
Les deux axiomes sont vérifiés : est une probabilité.
L'intérêt pratique est considérable : une fois qu'on sait que est une probabilité, on n'a plus rien à redémontrer sous conditionnement. En revanche, prenez garde à ce que le conditionnement porte bien toujours sur le même événement : est vrai, mais et n'ont aucune raison d'être égaux, et il n'existe aucune formule reliant à .
Formule des probabilités composées
Propriété
Cas de deux événements. Si , alors .
Cas général. Soient des événements tels que . Alors
Démonstration. Le cas de deux événements est la définition, multipliée par .
Remarquons d'abord que l'hypothèse a un sens : par croissance, pour tout , donc tous les conditionnements écrits sont légitimes.
Montrons la formule par récurrence sur . Le cas vient d'être traité. Supposons-la vraie au rang et soient des événements tels que . Posons . Comme , le cas de deux événements donne
Or , donc l'hypothèse de récurrence s'applique à et fournit
En reportant, on obtient la formule au rang .
Exemple
Trois boules blanches d'affilée. Une urne contient boules blanches et noires. On tire successivement trois boules sans remise. Notons l'événement « la -ième boule tirée est blanche ». La formule des probabilités composées donne
Chaque facteur se lit sur la composition de l'urne au moment du tirage : après deux boules blanches sorties, il reste boules dont blanches, d'où le .
Contrôle par dénombrement. Le tirage sans remise de trois boules peut aussi se modéliser par un tirage simultané ; la probabilité cherchée vaut alors . Les deux méthodes concordent.
Arbres pondérés
Un arbre pondéré est la traduction graphique de la formule des probabilités composées. On le lit selon trois règles, qu'il faut savoir énoncer.
Méthode
Règles de lecture d'un arbre pondéré.
- Sur une branche partant de la racine on écrit la probabilité de l'événement atteint ; sur une branche partant d'un nœud on écrit la probabilité conditionnelle de l'événement atteint sachant tout ce qui précède sur le chemin.
- La probabilité d'un chemin est le produit des probabilités des branches qui le composent (probabilités composées).
- La probabilité d'un événement est la somme des probabilités des chemins qui y mènent (probabilités totales).
Contrôle systématique : la somme des probabilités des branches issues d'un même nœud vaut , et la somme des probabilités de tous les chemins complets vaut .
Formule des probabilités totales
Propriété
Soit un système complet d'événements tel que pour tout . Alors, pour tout événement ,
En particulier, pour tout événement tel que ,
Démonstration. Les événements sont deux à deux incompatibles, car dès que . Par ailleurs, comme , la distributivité donne
L'additivité finie donne donc , et comme pour tout , la formule des probabilités composées permet d'écrire , d'où le résultat.
Le cas particulier s'obtient en appliquant ce qui précède au système complet , dont les deux événements sont de probabilité non nulle puisque .
Il arrive qu'un système complet comporte des événements de probabilité nulle, par exemple lorsqu'on découpe l'univers selon une variable dont certaines valeurs ne sont jamais atteintes. La formule reste vraie, à condition d'adopter la convention suivante.
Propriété
Version avec des événements de probabilité nulle. Soit un système complet d'événements, sans hypothèse sur les . Alors, pour tout événement ,
avec la convention dès que , le symbole n'étant alors pas défini.
Démonstration. La décomposition en événements deux à deux incompatibles ne suppose rien sur les probabilités, donc reste valable. Il suffit de vérifier que chaque terme s'écrit bien comme annoncé. Si , la formule des probabilités composées donne . Si , alors , donc par croissance, et le terme vaut , ce qui est exactement la valeur imposée par la convention.
Cette version dispense d'écarter à la main les cas dégénérés. En rédaction, le plus sûr reste de vérifier les hypothèses : citez « le système est complet, tous les sont strictement positifs, donc la formule des probabilités totales donne… ».
Formule de Bayes
Propriété
Soient et deux événements de probabilités non nulles. Alors
Si de plus est un système complet d'événements de probabilités non nulles et si , alors pour tout ,
Démonstration. Par définition, . Comme , la formule des probabilités composées donne , d'où la première égalité.
Pour la seconde, on applique la première à , puis on remplace le dénominateur par son expression donnée par la formule des probabilités totales appliquée au système complet .
Méthode
Quel événement conditionne quoi ? C'est la seule vraie difficulté de cette section, et elle se règle par une question à se poser avant tout calcul : qu'est-ce qui est connu, qu'est-ce qui est cherché ?
- Repérer la cause (l'origine de la pièce, l'état de santé du patient, le type d'urne) : elle fournit le système complet , et l'énoncé donne les .
- Repérer l'effet observé (la pièce est défectueuse, le test est positif) : c'est l'événement , et l'énoncé donne les , c'est-à-dire les probabilités de l'effet sachant la cause.
- Si la question va de la cause vers l'effet, c'est la formule des probabilités totales. Si elle remonte de l'effet vers la cause (« sachant que le test est positif, quelle est la probabilité que… »), c'est la formule de Bayes.
Un exemple complet : test de dépistage
Exemple
Une maladie rare et un bon test. Une maladie touche de la population. Un test de dépistage a une sensibilité de (il est positif chez des malades) et un taux de faux positifs de (il est positif chez des personnes saines). On choisit une personne au hasard dans la population. Notons l'événement « la personne est malade » et l'événement « le test est positif ». L'énoncé fournit
Probabilité d'un test positif. La famille est un système complet d'événements de probabilités non nulles, donc la formule des probabilités totales donne
Valeur prédictive positive. On cherche , c'est-à-dire la probabilité d'être malade sachant que le test est positif. Comme , la formule de Bayes s'applique :
Un test positif ne signale donc un vrai malade que dans des cas, alors que le test paraissait excellent. La raison est arithmétique et non médicale : les personnes saines sont si nombreuses que leurs de faux positifs () écrasent les de vrais positifs.
Valeur prédictive négative. Symétriquement, et , donc
Le test est en revanche excellent pour rassurer : un résultat négatif garantit l'absence de maladie à mieux que . C'est le comportement typique d'un test de dépistage d'une maladie rare, que l'on confirme toujours par un second examen.
Indépendance d'événements
Deux événements indépendants
Définition
Soient un espace probabilisé fini et , deux événements. On dit que et sont indépendants lorsque
Propriété
Si , alors et sont indépendants si et seulement si .
Démonstration. Supposons . Alors , et l'égalité équivaut, en multipliant par , à , c'est-à-dire à l'indépendance.
Cette caractérisation donne le sens intuitif de la notion : savoir que est réalisé ne modifie pas la probabilité de . C'est cependant la définition par le produit qu'il faut retenir, car elle est symétrique en et et reste valable sans hypothèse de non-nullité.
Indépendance et incompatibilité : le piège
Ces deux notions sont fréquemment confondues, alors qu'elles sont presque opposées. Deux événements incompatibles ne peuvent pas se produire ensemble : la réalisation de l'un interdit celle de l'autre, ce qui est une dépendance extrêmement forte. Deux événements indépendants, au contraire, n'ont aucune influence l'un sur l'autre. Précisément :
Propriété
Soient et deux événements incompatibles tels que et . Alors et ne sont pas indépendants.
Démonstration. Comme , on a . Or comme produit de deux réels strictement positifs. Donc , et les deux événements ne sont pas indépendants.
Retenez la formulation courte : incompatibles et de probabilités non nulles dépendants. Autre point de vigilance : l'indépendance est une propriété de la probabilité , pas des ensembles et . Deux événements peuvent être indépendants pour une probabilité et dépendants pour une autre sur le même univers ; il faut donc que l'énoncé la justifie, en général par le dispositif physique (répétitions séparées, composants distincts, individus tirés indépendamment).
Stabilité par passage au contraire
Propriété
Si et sont indépendants, alors et le sont aussi. Il en va de même pour et , ainsi que pour et .
Démonstration. Supposons . Les événements et sont incompatibles et leur réunion vaut , donc
Ainsi et sont indépendants. En échangeant les rôles de et , on obtient l'indépendance de et . Enfin, en appliquant le premier résultat au couple indépendant , on obtient l'indépendance de et .
Cette propriété est le fondement du passage au complémentaire dans les calculs de fiabilité : si des composants fonctionnent indépendamment, leurs pannes sont, elles aussi, indépendantes.
Famille finie d'événements mutuellement indépendants
Définition
Une famille d'événements est dite mutuellement indépendante lorsque, pour toute partie de de cardinal au moins ,
On dit que la famille est indépendante deux à deux lorsque cette égalité est seulement exigée pour les parties de cardinal , c'est-à-dire lorsque pour tous .
L'indépendance mutuelle est donc une conjonction de égalités, et non d'une seule. Pour trois événements, il ne suffit pas de vérifier : il faut aussi les trois égalités deux à deux. Il ne suffit pas non plus de vérifier les trois égalités deux à deux, comme le montre le contre-exemple suivant, qu'il faut savoir refaire.
Exemple
L'indépendance deux à deux n'entraîne pas l'indépendance mutuelle. On lance deux fois une pièce équilibrée ; on prend muni de la probabilité uniforme, chacune des quatre issues ayant la probabilité . Considérons
En listant les issues : , et , donc
Les trois intersections deux à deux valent toutes , de probabilité :
La famille est donc indépendante deux à deux. Pourtant , donc
et la famille n'est pas mutuellement indépendante. C'était prévisible : est entièrement déterminé par et , puisque connaître les deux premiers événements revient à connaître les deux résultats.
Propriété
Si est une famille mutuellement indépendante, alors la famille obtenue en remplaçant certains par leurs contraires est encore mutuellement indépendante.
Ce résultat, admis ici dans le cas général (il se démontre par récurrence sur le nombre d'événements remplacés, en reprenant l'argument du cas de deux événements), est ce qui autorise le calcul suivant, omniprésent en fiabilité : si sont mutuellement indépendants,
Modélisation de expériences indépendantes
Lorsqu'on répète expériences aléatoires « sans influence les unes sur les autres », on construit l'univers produit
muni de la probabilité définie sur les issues par
où est la probabilité gouvernant la -ième expérience. C'est bien une distribution de probabilités : ses termes sont positifs, et leur somme se factorise en un produit de sommes toutes égales à . Le cas le plus fréquent est celui de répétitions identiques et indépendantes d'une même expérience, où tous les et tous les sont égaux.
Exemple
Fiabilité d'un montage. Un dispositif comporte trois composants montés en série : il fonctionne si et seulement si les trois fonctionnent. Ils fonctionnent indépendamment, avec les fiabilités respectives , et . En notant l'événement « le composant fonctionne », l'indépendance mutuelle donne
Mettons maintenant en parallèle deux exemplaires d'un même composant de fiabilité , le montage fonctionnant dès que l'un des deux fonctionne. La probabilité de panne totale est celle de la panne simultanée des deux, soit par indépendance, donc le montage redondant fonctionne avec probabilité
La redondance fait passer la probabilité de panne de à , soit un facteur .
Variables aléatoires
Définition et notations
Définition
Soient un espace probabilisé fini et un ensemble. On appelle variable aléatoire sur à valeurs dans toute application .
Lorsque , on parle de variable aléatoire réelle. L'ensemble des valeurs effectivement prises par est fini, puisque l'est.
Définition
Soit une variable aléatoire sur à valeurs dans . Pour toute partie de et tout , on note
Si est réelle, on note de même , , les événements correspondants.
Ce sont des événements, c'est-à-dire des parties de ; on écrit au lieu de .
Le point à comprendre est que la notation ne désigne pas une égalité, mais un ensemble d'issues. C'est cette identification, entre une condition portant sur la valeur de et la partie de où elle est satisfaite, qui permet de calculer des probabilités sans jamais revenir à la description explicite de , et c'est là tout le confort qu'apportent les variables aléatoires.
Loi d'une variable aléatoire
Définition
Soit une variable aléatoire sur à valeurs dans . On appelle loi de l'application qui, à toute partie de , associe
En pratique, donner la loi de , c'est donner la famille des nombres .
Propriété
Soit une variable aléatoire à valeurs dans et soit l'ensemble de ses valeurs, les étant deux à deux distincts. Alors :
- la famille est un système complet d'événements ;
- la famille est une distribution de probabilités sur :
Démonstration. Point 1. Soient . Si une issue appartenait à , on aurait , ce qui contredit le fait que les valeurs sont deux à deux distinctes : les événements sont donc deux à deux incompatibles. De plus, pour toute issue , la valeur appartient à par définition, donc appartient à l'un des : la réunion vaut . La famille est bien un système complet.
Point 2. La positivité est celle de . Quant à la somme, la propriété d'additivité finie appliquée au système complet du point 1 donne directement
Ce système complet, dit système complet associé à , est l'outil de travail permanent : c'est lui qu'on utilise dans la formule des probabilités totales quand on veut « discuter selon la valeur prise par ». Et le point 2 fournit le contrôle obligatoire de tout calcul de loi : la somme des probabilités doit valoir . Une loi qui ne somme pas à est fausse, sans exception.
Exemple
Somme de deux dés. On lance deux dés équilibrés discernables ; on prend muni de la probabilité uniforme, et l'on pose . Alors , et pour chaque valeur on compte les couples de somme parmi les possibles :
| 2 | 3 | 4 | 5 | 6 | 7 | |
|---|---|---|---|---|---|---|
| 8 | 9 | 10 | 11 | 12 | |
|---|---|---|---|---|---|
Contrôle : la somme des numérateurs vaut , donc la somme des probabilités vaut . On lit par exemple .
Système complet associé, variable
Propriété
Soit une variable aléatoire à valeurs dans et soit une application. Alors est une variable aléatoire à valeurs dans , dont l'ensemble des valeurs est , et dont la loi est donnée par
Démonstration. L'application est bien définie de dans , c'est donc une variable aléatoire, et l'ensemble de ses valeurs est l'image par de l'ensemble des valeurs de .
Fixons et posons . Pour toute issue ,
donc . Cette réunion est constituée d'événements deux à deux incompatibles, puisqu'ils font partie du système complet associé à . L'additivité finie donne alors
ce qui est la formule annoncée.
Exemple
Une image qui fusionne des valeurs. Soit de loi uniforme sur , c'est-à-dire pour tout , et soit . Alors et
Contrôle : . On voit sur cet exemple qu'une image par une fonction non injective fusionne des valeurs et fait perdre de l'information : connaître la loi de ne permet pas de retrouver celle de .
Loi conditionnelle
Définition
Soient une variable aléatoire et un événement tel que . On appelle loi conditionnelle de sachant la famille
Comme est une probabilité, cette famille est bien une distribution de probabilités sur : ses termes sont positifs et leur somme vaut . La formule des probabilités totales appliquée à un système complet de probabilités non nulles s'écrit alors, pour toute valeur ,
égalité qu'on utilise constamment pour reconstituer une loi à partir de lois conditionnelles plus simples.
Exemple
Somme de deux dés, sachant le premier. Reprenons la somme de deux dés équilibrés et notons l'événement « le premier dé donne », de probabilité . Sachant , la somme vaut où parcourt , donc
et pour . Sachant , la variable suit donc la loi uniforme sur , alors que sa loi non conditionnée est très inégale. Le conditionnement a bien changé la loi.
Lois usuelles
Définition
Loi uniforme. Soit un ensemble fini non vide de cardinal . Une variable aléatoire à valeurs dans suit la loi uniforme sur , ce qu'on note , lorsque
Le cas le plus fréquent est .
Définition
Loi de Bernoulli. Soit . Une variable aléatoire suit la loi de Bernoulli de paramètre , ce qu'on note , lorsque et
On appelle épreuve de Bernoulli une expérience à deux issues, « succès » et « échec » ; la variable qui vaut en cas de succès et sinon suit alors , où est la probabilité du succès.
Propriété
Pour tout événement , l'indicatrice de , définie par
est une variable aléatoire qui suit la loi .
Démonstration. L'application est définie sur et à valeurs dans , c'est donc une variable aléatoire. Par construction, et , d'où et : c'est bien la loi de Bernoulli de paramètre .
Cette correspondance entre événements et variables de Bernoulli est le pont qui fait passer du langage ensembliste au langage algébrique ; elle donnera plus loin la méthode des indicatrices.
Définition
Loi binomiale. Soient et . Une variable aléatoire suit la loi binomiale de paramètres et , ce qu'on note , lorsque et
Propriété
La famille est bien une distribution de probabilités : ses termes sont positifs et leur somme vaut .
Démonstration. Chaque terme est un produit de réels positifs, donc positif. Pour la somme, la formule du binôme de Newton appliquée aux réels et donne
Propriété
Contexte d'apparition. On répète fois, de façon indépendante, une même épreuve de Bernoulli de probabilité de succès . Alors la variable égale au nombre de succès obtenus suit la loi .
Démonstration. On modélise l'expérience par l'univers produit , une issue étant la liste des résultats des épreuves, la probabilité d'une issue comportant succès et échecs valant par indépendance. Soit . L'événement est l'ensemble des issues comportant exactement succès. Une telle issue est entièrement déterminée par l'ensemble des positions des succès, c'est-à-dire par une partie à éléments de ; il y en a donc , et chacune a la probabilité . Comme ces issues sont deux à deux distinctes, donc leurs singletons deux à deux incompatibles, l'additivité finie donne
| Loi | Notation | Valeurs | Probabilités | Situation type |
|---|---|---|---|---|
| Uniforme | , | tirage au hasard, dé équilibré | ||
| Bernoulli | une épreuve, succès ou échec | |||
| Binomiale | nombre de succès sur épreuves indépendantes |
Exemple
Un questionnaire au hasard. Un QCM comporte questions indépendantes, chacune offrant réponses dont une seule est correcte. Un candidat répond entièrement au hasard. Le nombre de bonnes réponses est le nombre de succès de épreuves indépendantes de probabilité de succès , donc . La probabilité d'avoir au moins une bonne réponse se calcule par passage au complémentaire :
En revanche, la probabilité d'avoir la moyenne, c'est-à-dire au moins bonnes réponses, exigerait la somme des cinq derniers termes, et l'on verra plus loin qu'elle est faible : l'espérance vaut seulement .
Couples et -uplets de variables aléatoires
Couple, loi conjointe, lois marginales
Définition
Soient et deux variables aléatoires définies sur le même espace probabilisé , à valeurs respectivement dans et . L'application
est une variable aléatoire à valeurs dans , appelée couple de et .
Sa loi s'appelle la loi conjointe de et ; elle est donnée par la famille des nombres
que l'on note plus simplement , pour .
Les lois de et de prises séparément s'appellent alors les lois marginales du couple.
Propriété
Soient et deux variables aléatoires sur . Alors, pour tout et tout ,
Autrement dit, la loi conjointe détermine les deux lois marginales.
Démonstration. Fixons . La famille est le système complet associé à . La formule des probabilités totales, dans sa version valable même en présence d'événements de probabilité nulle, appliquée à l'événement , donne
On peut aussi le voir directement : les événements , pour parcourant , sont deux à deux incompatibles et leur réunion vaut , donc l'additivité finie conclut. Le second point s'obtient en échangeant les rôles de et .
La réciproque est fausse : les lois marginales ne déterminent pas la loi conjointe. Voici le contre-exemple minimal, à connaître. Soient et deux variables de loi . Si elles proviennent de deux lancers indépendants d'une pièce équilibrée, la loi conjointe est pour les quatre couples . Si au contraire , c'est-à-dire si l'on observe deux fois le même lancer, alors et les deux autres probabilités sont nulles. Les lois marginales sont les mêmes dans les deux cas, les lois conjointes sont différentes : la loi conjointe contient une information sur le lien entre et qui est absente des marginales.
Tableau à double entrée
Quand et prennent peu de valeurs, la loi conjointe se présente dans un tableau à double entrée : les probabilités conjointes à l'intérieur, les lois marginales obtenues en sommant les lignes et les colonnes, d'où le nom de « marges ».
Exemple
Lecture d'un tableau croisé. Deux variables et ont pour loi conjointe, exprimée en douzièmes :
| loi de | ||||
|---|---|---|---|---|
| loi de |
Les six probabilités intérieures somment bien à . Les marginales se lisent dans la dernière colonne et la dernière ligne :
Ces deux variables ne sont pas indépendantes : , alors que , et . Une seule case en défaut suffit à conclure.
Variables aléatoires indépendantes
Définition
Deux variables aléatoires et définies sur le même espace probabilisé sont dites indépendantes lorsque
Plus généralement, variables aléatoires sont dites indépendantes (ou mutuellement indépendantes) lorsque
Autrement dit, et sont indépendantes si et seulement si la loi conjointe est le produit des lois marginales : dans le tableau à double entrée, chaque case intérieure doit être le produit de sa marge de ligne par sa marge de colonne. C'est une condition très forte, qui porte sur toutes les cases à la fois, et il suffit d'une seule case en défaut pour la mettre en échec.
Propriété
Toute sous-famille d'une famille indépendante de variables aléatoires est indépendante. Précisément, si sont indépendantes et si , alors la famille est indépendante.
Démonstration. Fixons avec pour tout . Les événements
obtenus en faisant varier les coordonnées dans , sont deux à deux incompatibles, et leur réunion est exactement : toute issue de cet événement possède en effet des valeurs bien déterminées pour les coordonnées restantes. L'additivité finie puis l'indépendance de la famille complète donnent
Or chaque somme intérieure vaut , puisque la loi de est une distribution de probabilités. Il reste , ce qui est l'indépendance de la sous-famille.
Propriété
Si et sont indépendantes, alors pour toutes applications et définies respectivement sur et , les variables et sont indépendantes.
Démonstration. Soient et . Posons
L'événement est la réunion, sur les couples , des événements deux à deux incompatibles . L'additivité finie, puis l'indépendance de et , puis la factorisation d'une somme double à variables séparées, donnent
C'est l'indépendance de et .
-uplets et lemme des coalitions
Propriété
Lemme des coalitions (admis). Soient des variables aléatoires indépendantes et soit . Pour toutes applications définie sur et définie sur , les variables aléatoires
sont indépendantes. Plus généralement, des fonctions de blocs disjoints de variables indépendantes sont indépendantes.
Ce résultat est admis : sa démonstration n'est pas au programme. Il est en revanche d'un usage constant, et il faut le citer explicitement quand on s'en sert. Exemple typique : si sont indépendantes, alors et sont indépendantes, car elles sont fonctions de blocs disjoints. Attention à la condition de disjonction : et n'ont aucune raison d'être indépendantes, la variable figurant dans les deux.
Somme de Bernoulli indépendantes
Propriété
Soient , et des variables aléatoires indépendantes, toutes de loi . Alors
Démonstration. Chaque est à valeurs dans , donc est à valeurs dans . Fixons et cherchons .
Pour toute partie de de cardinal , posons
Ces événements sont deux à deux incompatibles : si , il existe un indice appartenant à l'un et pas à l'autre, et l'on aurait à la fois et sur , ce qui est impossible. De plus, une issue réalise si et seulement si exactement des valent en , c'est-à-dire si et seulement si appartient à pour , partie de cardinal . Donc
Chaque est une intersection où toutes les variables sont fixées, donc l'indépendance de la famille s'applique directement :
cette valeur ne dépendant pas de . Comme le nombre de parties à éléments de vaut , l'additivité finie donne
c'est-à-dire .
Ce théorème est le pivot du chapitre : il transforme une loi binomiale, objet global assez lourd, en une somme de variables simples et indépendantes, ce qui permettra de calculer son espérance et sa variance sans le moindre calcul de somme binomiale. Réciproquement, il fournit un critère de reconnaissance : si l'on parvient à écrire une variable comme une somme d'indicatrices indépendantes de même paramètre, elle est binomiale.
Espérance
Définition et première formule
Définition
Soit une variable aléatoire réelle sur un espace probabilisé fini . On appelle espérance de le réel
La variable est dite centrée lorsque .
L'espérance est la moyenne des valeurs prises par , pondérée par leurs probabilités. Ce n'est pas une valeur que prend nécessairement : l'espérance du nombre de points d'un dé équilibré vaut .
Propriété
Pour toute variable aléatoire réelle sur ,
Démonstration. Notons avec des valeurs deux à deux distinctes. La famille est un système complet d'événements, donc les ensembles forment une partition de (à ceci près que certains peuvent être vides, ce qui ne change rien aux sommes). On peut donc regrouper les termes de la somme sur selon la valeur prise par :
Or, sur l'événement , on a , constante que l'on factorise :
la dernière égalité venant de l'expression d'une probabilité comme somme des masses des singletons. En sommant sur , on obtient .
Les deux formules ont chacune leur usage. La première, sur , est celle du calcul concret dès qu'on connaît la loi. La seconde, sur , est celle des démonstrations, car elle est linéaire en de façon évidente : c'est elle qui donne en trois lignes la linéarité de l'espérance.
Propriétés
Propriété
Soient et deux variables aléatoires réelles sur et deux réels.
- Espérance d'une constante. Si est constante égale à , alors . En particulier .
- Indicatrice. Pour tout événement , .
- Linéarité. .
- Positivité. Si , c'est-à-dire si pour toute issue , alors .
- Croissance. Si , c'est-à-dire si pour toute issue , alors .
- Inégalité triangulaire. .
- Variable centrée. La variable est centrée.
Démonstration. Point 1. Si est constante égale à , alors et , donc .
Point 2. La variable prend les valeurs et avec les probabilités et , donc
Point 3. On utilise la formule sur . Pour toute issue , , donc
par linéarité de la somme finie, c'est-à-dire .
Point 4. Si , tous les termes de sont des produits de réels positifs, donc la somme est positive.
Point 5. Si , la variable est positive, donc par le point 4 ; la linéarité donne .
Point 6. Pour toute issue , , c'est-à-dire . La croissance et la linéarité donnent , ce qui équivaut à .
Point 7. Par linéarité et par le point 1, .
Il faut mesurer la portée du point 3 : la linéarité de l'espérance ne demande aucune hypothèse sur les variables. Elle vaut même si et sont fortement liées, même si , même si l'on ne sait rien de la loi conjointe. C'est ce qui en fait l'outil le plus puissant du chapitre, et c'est ce qui distingue radicalement l'espérance de la variance, laquelle, elle, ne s'ajoute pas sans hypothèse.
Formule de transfert
Propriété
Formule de transfert. Soient une variable aléatoire sur à valeurs dans et une application. Alors
Version pour un couple. Si et sont deux variables aléatoires et une application définie sur à valeurs réelles, alors
Démonstration. Appliquons à la variable réelle la formule de l'espérance sur :
Regroupons les issues selon la valeur prise par , en utilisant le système complet :
puisque est constante sur et que la somme des masses des singletons de vaut .
Pour la version couple, on applique ce qui précède à la variable aléatoire , à valeurs dans , et à la fonction . Il vient
et l'on reconnaît la somme double annoncée, car . La même démonstration s'étend telle quelle à un -uplet.
L'intérêt de la formule est dans son nom : elle transfère le calcul de sur la loi de , sans qu'il soit nécessaire de déterminer la loi de . C'est un gain de temps considérable, car la loi de demande de fusionner des valeurs et de sommer des probabilités, travail entièrement évité.
Exemple
Transfert sur un dé. Soit . Alors, sans chercher la loi de ,
On notera que : l'espérance ne commute pas avec le carré, et il est faux d'écrire . L'écart entre les deux, ici , s'appellera la variance.
La méthode des indicatrices
Méthode
Somme d'indicatrices. Pour calculer l'espérance d'une variable qui compte un nombre d'objets vérifiant une certaine condition, il est presque toujours inutile de déterminer sa loi. On procède ainsi.
- Repérer les objets susceptibles d'être comptés : les indexer par , et noter l'événement « l'objet est compté ».
- Écrire la variable comme une somme d'indicatrices : , en justifiant l'égalité issue par issue.
- Appliquer la linéarité de l'espérance et :
- Calculer chaque séparément, ce qui est en général élémentaire.
Le point capital est que cette méthode ne demande aucune indépendance entre les , et qu'elle fonctionne même lorsque la loi de est inaccessible en pratique.
Exemple
Combien de faces différentes en lançant cinq dés ? On lance cinq dés équilibrés et l'on note le nombre de faces qui apparaissent au moins une fois ; prend ses valeurs dans . Sa loi est pénible à écrire, son espérance est immédiate.
Pour , notons l'événement « la face apparaît au moins une fois ». Pour toute issue , le nombre de faces apparues est le nombre d'indices tels que , donc
Calculons par passage au complémentaire : l'événement signifie que les cinq dés évitent la face , ce qui, l'univers étant muni de la probabilité uniforme, a pour probabilité . Donc
Par linéarité de l'espérance, les six termes étant égaux,
En lançant cinq dés, on voit donc en moyenne environ faces différentes. Remarquons que les événements ne sont pas indépendants (si cinq faces sont apparues, la sixième ne peut pas l'être avec cinq dés), ce qui n'a gêné en rien le calcul.
Espérance des lois usuelles
Propriété
- Si , alors .
- Si , alors .
- Si , alors .
Démonstration. Point 1. Par définition et par la formule de la somme des premiers entiers,
Point 2. .
Point 3, première méthode : par la formule de transfert. On part de la définition et l'on utilise l'identité , valable pour , qui se vérifie sur les factorielles :
Le terme d'indice étant nul, il vient
Le changement d'indice transforme la somme en
par la formule du binôme, d'où .
Point 3, seconde méthode : par les indicatrices. Une variable de loi a la même loi que où les sont indépendantes de loi , d'après le théorème sur la somme de Bernoulli. Comme l'espérance ne dépend que de la loi, la linéarité donne immédiatement
La comparaison des deux méthodes est instructive : la première est un exercice de calcul sur les coefficients binomiaux, la seconde tient en une ligne. Chaque fois qu'une variable se décompose en somme, il faut préférer la décomposition au calcul direct.
Espérance d'un produit
Propriété
Si et sont deux variables aléatoires réelles indépendantes, alors
Démonstration. Appliquons la formule de transfert pour un couple à la fonction :
L'indépendance de et permet de remplacer par , puis de séparer les variables dans la somme double :
L'implication n'est pas une équivalence : il existe des variables non indépendantes vérifiant , et nous en construirons une dans la section suivante. Écrire sans avoir justifié l'indépendance est l'une des fautes les plus lourdement sanctionnées du chapitre.
Variance, écart type et covariance
Variance et écart type
Définition
Soit une variable aléatoire réelle sur un espace probabilisé fini, d'espérance . On appelle variance de le réel
la seconde écriture venant de la formule de transfert appliquée à .
On appelle écart type de le réel .
La variance mesure la dispersion de autour de sa moyenne : c'est la moyenne des carrés des écarts à l'espérance. L'écart type a l'avantage de s'exprimer dans la même unité que , ce qui le rend directement comparable à .
Propriété
Pour toute variable aléatoire réelle :
- , donc est bien défini ;
- si et seulement si , c'est-à-dire si et seulement si est presque sûrement constante.
Démonstration. Point 1. La variable est positive, donc son espérance l'est par positivité de l'espérance.
Point 2. Écrivons . C'est une somme finie de termes tous positifs, donc elle est nulle si et seulement si chacun de ses termes est nul, c'est-à-dire si et seulement si, pour toute valeur ,
Autrement dit, toute valeur de probabilité non nulle est égale à . En sommant les probabilités du système complet associé à , il reste . Réciproquement, si , tous les autres termes sont nuls et .
Koenig-Huygens et transformation affine
Propriété
Formule de Koenig-Huygens. Pour toute variable aléatoire réelle ,
Démonstration. Posons , qui est un réel constant. En développant le carré, puis en utilisant la linéarité de l'espérance et le fait que l'espérance d'une constante est cette constante,
C'est la formule annoncée.
C'est cette formule qu'on utilise dans tous les calculs pratiques : on calcule et par transfert, puis on soustrait. Un contrôle gratuit en découle : on doit toujours trouver , faute de quoi il y a une erreur de calcul.
Propriété
Pour toute variable aléatoire réelle et tous réels et ,
Démonstration. Par linéarité, , donc
En élevant au carré puis en prenant l'espérance, et en utilisant à nouveau la linéarité pour sortir la constante ,
En prenant la racine carrée et en se souvenant que , on obtient l'égalité sur les écarts types.
Deux lectures : d'une part la variance est insensible à une translation, ce qui est logique puisqu'elle mesure une dispersion et non une position ; d'autre part elle est quadratique en , ce qui explique la présence du carré et le passage à l'écart type pour retrouver l'homogénéité.
Définition
Soit une variable aléatoire réelle telle que . La variable centrée réduite associée à est
Elle vérifie et .
En effet, la linéarité donne , et la propriété précédente, appliquée avec et , donne .
Variance des lois usuelles
Propriété
- Si , alors .
- Si , alors .
- Si , alors .
Démonstration. Point 1. La variable étant à valeurs dans , on a , donc . Koenig-Huygens donne
Point 2. On connaît . Par transfert et par la formule de la somme des carrés des premiers entiers,
Koenig-Huygens donne alors
Point 3. La démonstration est donnée plus bas, après la variance d'une somme : elle utilise la décomposition d'une binomiale en somme de Bernoulli indépendantes.
Exemple
Un dé équilibré. Pour , on a et
On retrouve bien la valeur obtenue par Koenig-Huygens à la section précédente : .
Covariance
Définition
Soient et deux variables aléatoires réelles sur le même espace probabilisé. On appelle covariance de et le réel
On dit que et sont décorrélées lorsque .
Propriété
Soient , , des variables aléatoires réelles et , des réels.
- ;
- symétrie : ;
- bilinéarité : , et de même par rapport à la seconde variable ;
- .
Démonstration. Point 1. C'est la définition de la variance : .
Point 2. Le produit de deux réels est commutatif, donc les deux expressions sont identiques.
Point 4. Notons et . En développant le produit puis en utilisant la linéarité de l'espérance :
Point 3. En utilisant le point 4 et la linéarité de l'espérance, avec :
La bilinéarité par rapport à la seconde variable s'en déduit par symétrie.
Propriété
Si et sont indépendantes, alors elles sont décorrélées : .
Démonstration. L'indépendance donne , donc .
La réciproque est fausse, et le contre-exemple suivant doit être su par cœur.
Exemple
Décorrélées mais dépendantes. Soit de loi uniforme sur , c'est-à-dire , et posons .
Calcul de la covariance. Par symétrie de la loi, . Par transfert, . Donc
les deux variables sont décorrélées.
Elles ne sont pourtant pas indépendantes. La variable prend les valeurs et , avec . Or
Comme , les variables ne sont pas indépendantes. C'est même le contraire : est une fonction de , donc entièrement déterminée par elle. La covariance ne détecte que les liens de nature affine ; le lien quadratique entre et lui échappe complètement.
Exemple
Une covariance sur un tableau croisé. Reprenons le tableau de la section précédente, avec et la loi de donnée par , , en , , . On a
Par transfert sur le couple, seuls les termes avec et contribuent :
Donc
La covariance est négative mais très faible : les deux variables varient légèrement en sens contraire. On retrouve au passage qu'elles ne sont pas indépendantes, puisque leur covariance n'est pas nulle.
Variance d'une somme
Propriété
Soient et deux variables aléatoires réelles. Alors
Plus généralement, pour des variables aléatoires réelles,
Si les sont deux à deux décorrélées (en particulier si elles sont indépendantes), alors
Démonstration. Cas de deux variables. En utilisant puis la bilinéarité et la symétrie de la covariance,
Cas général. Posons . La bilinéarité de la covariance, appliquée successivement à chaque argument, donne
On isole dans cette somme double les termes diagonaux , qui valent , et l'on regroupe les termes hors diagonale par paires : pour , les deux termes et sont égaux par symétrie. D'où
Cas décorrélé. Si pour tous , la seconde somme est nulle. Et si les sont indépendantes, toute sous-famille l'est, en particulier chaque paire , donc chaque covariance est nulle d'après la propriété précédente.
Contrairement à l'espérance, la variance ne s'ajoute pas sans hypothèse. Écrire suppose la décorrélation, et il faut la justifier. Notons d'ailleurs, en guise de garde-fou, que et non .
Propriété
Variance de la loi binomiale. Si , alors .
Démonstration. La variable a la même loi que , où sont indépendantes de loi , d'après le théorème sur la somme de Bernoulli. La variance ne dépendant que de la loi, il suffit de calculer . Les étant indépendantes, elles sont deux à deux décorrélées, donc les variances s'ajoutent :
Exemple
Contrôle sur un lot. Une machine produit des pièces dont sont défectueuses, indépendamment les unes des autres. On prélève pièces. Le nombre de pièces défectueuses suit , donc
On s'attend donc à environ pièces défectueuses, avec une fluctuation typique de moins de pièces.
Somme de deux dés. Si avec et indépendantes de loi , alors et, par indépendance,
Inégalités probabilistes et loi faible des grands nombres
Inégalité de Markov
Propriété
Inégalité de Markov. Soit une variable aléatoire réelle positive, c'est-à-dire telle que pour toute issue . Alors, pour tout réel ,
Démonstration. Notons et considérons la variable aléatoire . Montrons l'inégalité , issue par issue.
Soit . Si , alors et par définition de , donc . Si , alors puisque est positive. L'inégalité est donc vraie partout.
Par croissance puis linéarité de l'espérance, et en utilisant ,
Comme , on peut diviser par sans changer le sens de l'inégalité, ce qui donne le résultat.
Inégalité de Bienaymé-Tchebychev
Propriété
Inégalité de Bienaymé-Tchebychev. Soit une variable aléatoire réelle d'espérance et de variance . Alors, pour tout réel ,
Démonstration. Posons . C'est une variable aléatoire positive, d'espérance par définition de la variance. Comme , on a l'équivalence, valable pour toute issue,
la fonction carré étant croissante sur ; les deux événements et sont donc égaux. L'inégalité de Markov appliquée à la variable positive avec le seuil donne alors
Qualité des majorations
Ces deux inégalités partagent une même caractéristique, qui est à la fois leur force et leur faiblesse : elles n'utilisent presque rien de la loi de , seulement son espérance pour Markov, son espérance et sa variance pour Bienaymé-Tchebychev. Elles sont donc universelles, applicables sans jamais calculer une loi, ce qui est exactement ce dont on a besoin pour démontrer un théorème général comme la loi des grands nombres. En contrepartie, sur un exemple précis, elles sont souvent très pessimistes.
Exemple
Une majoration honnête mais large. Soit , le nombre de piles sur lancers d'une pièce équilibrée. On a et . Bienaymé-Tchebychev avec donne
La majoration est correcte, mais la valeur exacte, obtenue en sommant les termes binomiaux correspondants, vaut environ : l'inégalité surestime la probabilité d'un facteur trente environ. Il ne faut donc pas attendre d'elle une estimation fine, mais une garantie valable quelle que soit la loi.
Notons aussi que Markov ne dit rien lorsque , puisque la majoration dépasse alors , et que Bienaymé-Tchebychev ne dit rien lorsque , pour la même raison. Ces inégalités ne deviennent informatives qu'à partir d'un écart de plusieurs écarts types.
Loi faible des grands nombres
Propriété
Loi faible des grands nombres, forme non asymptotique. Soient et des variables aléatoires réelles indépendantes et de même loi, d'espérance commune et de variance commune . Posons
Alors , , et pour tout réel ,
Démonstration. Espérance. Par linéarité de l'espérance, sans aucune hypothèse d'indépendance,
Variance. Les étant indépendantes, elles sont deux à deux décorrélées, donc les variances s'ajoutent :
La formule , appliquée avec , donne alors
Majoration. La variable a pour espérance et pour variance ; l'inégalité de Bienaymé-Tchebychev appliquée à donne directement, pour tout ,
Le contenu du théorème tient dans le facteur : à précision fixée, la probabilité d'un écart d'au moins entre la moyenne observée et l'espérance est majorée par une quantité qui tend vers lorsque augmente, et qui est explicitement calculable. C'est ce caractère explicite, non asymptotique, qui rend l'énoncé utilisable en pratique : il ne dit pas seulement que « ça finit par marcher », il dit à partir de quel .
Interprétation fréquentiste et taille d'échantillon
Propriété
Cas de Bernoulli. Soient un événement de probabilité et des variables indépendantes de loi , où vaut si est réalisé lors de la -ième répétition de l'expérience. La fréquence empirique vérifie alors, pour tout ,
Démonstration. Les sont indépendantes de même loi , d'espérance et de variance . La loi faible des grands nombres appliquée à ces variables donne la première majoration.
Pour la seconde, il suffit de montrer que pour tout . Or
ce qui donne bien , avec égalité si et seulement si .
Voilà enfin la justification de l'intuition fréquentiste avec laquelle nous avons ouvert le chapitre. Répétez un grand nombre de fois, indépendamment, une même expérience : la fréquence d'apparition de l'événement s'écarte de de plus de avec une probabilité majorée par , quantité aussi petite qu'on veut pourvu que soit grand. La probabilité, définie au début comme une masse abstraite répartie sur un univers, se manifeste donc bien, sur le long terme, comme une fréquence observable. Notons que la majoration ne dépend plus de : elle est utilisable même lorsque la valeur de est inconnue, ce qui est précisément la situation d'un sondage.
Méthode
Quelle taille d'échantillon pour telle précision ? On veut estimer une proportion inconnue par la fréquence observée , avec une précision et un risque , c'est-à-dire garantir
- Écrire la majoration universelle : .
- Il suffit donc d'imposer , condition suffisante.
- Résoudre en : .
- Prendre pour le plus petit entier vérifiant cette inégalité, et signaler que la condition obtenue est suffisante mais non nécessaire, la majoration étant pessimiste.
Exemple
Dimensionner un sondage. On veut estimer la proportion d'électeurs favorables à une mesure, avec une précision de points de pourcentage et un risque de . On prend donc et , et la méthode donne
Il suffit donc d'interroger personnes, choisies indépendamment, pour garantir que la fréquence observée s'écarte de de moins de points avec une probabilité d'au moins .
Si l'on exige une précision de point à risque égal, il vient
soit quatre fois plus. C'est la loi générale : la taille d'échantillon nécessaire croît comme , donc diviser par deux la marge d'erreur coûte quatre fois plus de mesures. Ces effectifs sont très supérieurs à ceux des instituts de sondage réels, qui utilisent des majorations plus fines que Bienaymé-Tchebychev ; l'ordre de grandeur du , lui, est le bon.
Méthodes et pièges
Choisir son univers
Méthode
Trois questions avant tout calcul.
- L'ordre intervient-il ? Si l'énoncé parle de « premier tiré », « dans l'ordre », ou si les objets sont numérotés et discernables, prendre un univers de listes. Si seule la composition finale compte, un univers de parties suffit.
- Y a-t-il répétition possible ? Avec remise : . Sans remise : pour les listes, pour les parties.
- L'équiprobabilité est-elle légitime ? Elle l'est si les objets sont indiscernables et le tirage au hasard. Elle ne l'est presque jamais sur un univers de « résultats agrégés » (sommes, nombres de succès, couleurs) : dans ce cas, revenir à un univers d'issues élémentaires symétriques.
Une fois l'univers choisi, ne plus en changer : compter les cas favorables avec des objets du même type que ceux qui composent .
Conditionner ou dénombrer
Face à un tirage sans remise, deux voies s'offrent, également correctes. Le dénombrement convient quand l'événement se décrit par une composition finale (« exactement deux rouges ») : on compte des parties et l'on divise. Le conditionnement convient quand l'événement se décrit par une chronologie (« la première est rouge et la deuxième verte ») : on multiplie les probabilités successives, la composition de l'urne évoluant à chaque tirage. Nous avons vu les deux donner sur le même exemple. Le conditionnement devient obligatoire dès que l'expérience comporte des étapes de nature différente (on choisit d'abord une urne, puis on y tire une boule), car il n'y a plus alors d'univers uniforme naturel : c'est le domaine des arbres et de la formule des probabilités totales.
Passer au complémentaire
Méthode
Reconnaître les énoncés qui l'exigent. Trois formulations doivent déclencher automatiquement le réflexe du contraire.
- « au moins un » : son contraire est « aucun », c'est-à-dire une intersection, souvent un produit sous hypothèse d'indépendance.
- « au moins deux », « pas tous » : contraire respectivement de « au plus un » et de « tous ».
- toute réunion de trois événements ou plus dont on veut la probabilité exacte, puisque la formule du crible est hors programme.
Le calcul type est lorsque les sont mutuellement indépendants.
Utiliser les indicatrices
Trois signaux indiquent que la méthode des indicatrices est la bonne : la variable compte quelque chose ; sa loi paraît difficile ou fastidieuse ; on ne demande que l'espérance. Dans ce cas, écrire , appliquer la linéarité, calculer chaque . Rappelons que l'indépendance n'est jamais requise. Si en revanche l'énoncé demande la variance d'une telle somme, l'indépendance ou au moins la décorrélation devient nécessaire, sans quoi il faut calculer toutes les covariances .
Reconnaître une loi binomiale
Méthode
Quatre conditions, toutes obligatoires. Une variable suit lorsque :
- l'expérience consiste en un nombre fixé à l'avance de épreuves ;
- chaque épreuve n'a que deux issues, succès ou échec ;
- les épreuves sont indépendantes ;
- la probabilité de succès est la même à chaque épreuve ;
et que compte le nombre total de succès.
Les trois pièges classiques correspondent chacun à la violation d'une de ces conditions.
Piège 1 : épreuves non indépendantes. Si le résultat d'une épreuve influence la suivante (une machine qui s'échauffe, un joueur qui apprend, un composant dont la panne surcharge les autres), la loi n'est pas binomiale, même si chaque épreuve est bien à deux issues.
Piège 2 : probabilité de succès variable. Si change d'une épreuve à l'autre, la somme des indicatrices reste une variable parfaitement définie, d'espérance par linéarité, mais sa loi n'est pas binomiale.
Piège 3 : tirage sans remise. C'est le piège le plus fréquent. Un tirage sans remise viole à la fois l'indépendance et la constance de , puisque la composition de l'urne évolue.
Exemple
Avec ou sans remise : l'écart chiffré. Reprenons l'urne de jetons dont rouges, et le nombre de jetons rouges obtenus en tirages.
Avec remise. Les trois tirages sont indépendants et la probabilité de tirer rouge vaut à chaque fois, donc et
Sans remise. La loi n'est plus binomiale, et le calcul se fait par dénombrement, comme au début du chapitre :
Les deux valeurs sont proches mais différentes, et appliquer la formule binomiale au tirage sans remise serait une faute de modélisation, même si l'erreur numérique est ici modeste. Elle grandit à mesure que la taille de l'échantillon se rapproche de celle de la population.
Erreurs classiques
Confondre incompatible et indépendant. Deux événements incompatibles de probabilités non nulles sont dépendants au plus haut point. « Incompatible » se traduit par , « indépendant » par : rien à voir.
Oublier de vérifier avant d'écrire . Le quotient n'existe pas sinon. De même, la formule des probabilités totales dans sa forme usuelle exige pour tout ; à défaut, il faut invoquer la version avec convention.
Écrire sans indépendance. L'égalité est fausse en général : elle équivaut exactement à . Ne l'utiliser qu'après avoir énoncé et justifié l'indépendance.
Croire que décorrélé implique indépendant. La covariance ne capte que la partie affine du lien. Le couple avec uniforme sur est décorrélé et pourtant l'une des variables est fonction de l'autre.
Additionner les variances sans hypothèse. ; le terme croisé ne disparaît que si les variables sont décorrélées.
Appliquer une formule de crible. Pour trois événements ou plus, aucune formule d'inclusion-exclusion n'est disponible en PCSI : complémentaire, découpage disjoint, ou majoration.
Confondre et . Leur différence est la variance, qui est nulle seulement pour une variable presque sûrement constante.
Oublier le contrôle final. Une loi doit sommer à , une probabilité doit appartenir à , une variance doit être positive, et une espérance doit tomber entre la plus petite et la plus grande valeur de la variable. Ces quatre vérifications coûtent trente secondes et détectent la grande majorité des erreurs de calcul.
Bloqué sur « Probabilités » ?
On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.