MPSI · Chapitre 17 · Second semestre
Probabilités
Univers fini, événements, conditionnement, formule de Bayes, indépendance, lois usuelles, espérance, variance, covariance, inégalités probabilistes.
Sommaire
Ce qu'il faut savoir faire
- Univers fini
- Événements
- Conditionnement
- Formule de Bayes
- Indépendance
- Lois usuelles
- Espérance
- Variance
- Covariance
- Inégalités probabilistes
Il y a des expériences dont on ne sait pas prédire le résultat, et pourtant on sait en dire quelque chose. Personne ne peut annoncer la face que montrera un dé, mais tout le monde sait que sur un grand nombre de lancers le six sortira à peu près une fois sur six. Personne ne peut dire si tel patient est malade, mais un laboratoire sait qu'un test se trompe dans deux cas sur cent. Cette double situation, incertitude sur l'issue et régularité sur la masse, est exactement ce que ce chapitre se propose de mettre en équations. L'objet mathématique que nous allons construire ne cherche pas à deviner le résultat d'une expérience : il cherche à répartir une masse totale égale à entre tous les résultats possibles, et à en tirer des conséquences chiffrées.
Le mot « probabilité » va donc changer de sens. Dans le langage courant, il désigne un degré de croyance, plus ou moins argumenté. Ici, il désignera une application : une application qui, à chaque partie de l'ensemble des résultats possibles, associe un nombre compris entre et , avec une seule exigence de fond, l'additivité sur les événements qui ne peuvent pas se produire ensemble. Rien de plus. Toute la théorie que vous allez lire sort de cette unique exigence, et c'est l'un des faits les plus remarquables du chapitre : deux axiomes d'une ligne suffisent à produire la formule de Bayes, l'espérance, la variance et la loi des grands nombres. Nous ne dirons jamais ce qu'est le hasard ; nous dirons comment se calcule une masse.
Une restriction gouverne tout le chapitre : l'ensemble des résultats possibles est fini. Ce choix n'est pas une commodité de rédaction, c'est ce qui rend la théorie élémentaire. Sur un ensemble fini, toute somme est une somme finie, donc elle se calcule sans discussion, et l'on peut affecter une masse à toutes les parties sans exception, sans avoir à trier celles auxquelles on aurait le droit d'en attribuer une. Le prix à payer doit être annoncé franchement, car il est réel : nous ne saurons pas modéliser dans ce chapitre l'expérience « je lance une pièce jusqu'à obtenir pile », dont les résultats possibles forment un ensemble infini, ni aucune grandeur qui varie continûment comme une durée d'attente ou une taille. Ces situations existent, elles se traitent, mais elles demandent des outils que vous n'avez pas encore, et elles seront reprises en seconde année.
Le lien avec le chapitre précédent est immédiat. Lorsque toutes les issues jouent le même rôle, ce qui est le cas d'un dé équilibré, d'un tirage de cartes bien battues ou d'un choix « au hasard » dans une population, la masse se répartit uniformément, et calculer une probabilité revient exactement à compter : nombre de cas favorables sur nombre de cas possibles. Tous les outils du dénombrement, listes, arrangements, combinaisons, principe d'addition et de multiplication, deviennent donc des outils de calcul de probabilités. La difficulté ne change pas de nature pour autant : elle reste le choix du modèle, et vous verrez qu'une même question admet souvent un modèle ordonné et un modèle non ordonné, tous deux corrects, à condition de ne pas les mélanger en cours de route.
La vraie rupture du chapitre est ailleurs, et elle intervient au milieu : c'est la variable aléatoire. Jusque-là, nous regardons des issues et des événements, c'est-à-dire des objets de nature ensembliste, souvent encombrants à décrire. À partir de la quatrième section, nous cessons de regarder les issues et nous regardons les nombres qu'on en tire : le gain d'un joueur, le nombre de succès dans une série d'essais, la durée d'un trajet, la somme de deux dés. Une variable aléatoire n'est rien d'autre qu'une application de l'univers dans , mais ce changement de point de vue est décisif, car les nombres, eux, s'additionnent, se multiplient et se comparent. On peut faire de l'algèbre sur les variables aléatoires, alors qu'on ne peut pas faire d'algèbre sur les issues.
Cette algèbre culmine dans une propriété d'apparence anodine, et qui est en réalité l'outil le plus puissant que vous rencontrerez ici : l'espérance est linéaire. L'espérance d'une somme est la somme des espérances, toujours, sans aucune hypothèse d'indépendance, même lorsque les variables sont fortement liées entre elles. Cette absence d'hypothèse est ce qui rend la propriété si efficace. Elle donne naissance à une méthode générale, la méthode des indicatrices : pour calculer la valeur moyenne d'un nombre d'objets vérifiant une condition, on écrit ce nombre comme une somme de variables valant ou selon que la condition est remplie ou non, et l'espérance cherchée devient une simple somme de probabilités. Vous verrez cette méthode répondre en trois lignes à des questions dont le calcul direct de la loi serait décourageant.
Le plan suit cette progression. Les trois premières sections construisent le cadre : espaces probabilisés finis et propriétés d'une probabilité, puis conditionnement, avec les trois formules qui l'accompagnent, enfin indépendance. Les trois suivantes installent les variables aléatoires : définition et loi, lois usuelles, couples de variables. Les deux dernières sections théoriques sont consacrées aux deux nombres qui résument une variable, l'espérance et la variance, puis aux inégalités qui les relient à des probabilités, ce qui débouche sur la loi faible des grands nombres, seul théorème du chapitre à justifier l'intuition fréquentiste dont nous sommes partis. Une section de méthodes ferme le chapitre.
Les notations sont fixées une fois pour toutes. L'univers est noté , ses éléments, les issues, sont notés , et les événements reçoivent les lettres , , ; l'événement contraire de est , l'événement impossible est , et désigne l'ensemble des parties de . La probabilité est notée , et la probabilité conditionnelle de sachant est notée ; signalons une fois pour toutes que de nombreux ouvrages écrivent pour la même quantité, notation que nous n'utiliserons plus ensuite. Un système complet d'événements est noté , l'intervalle d'entiers de à est , le cardinal d'un ensemble fini est , et le coefficient binomial est . Une variable aléatoire est notée par une majuscule , , , son ensemble de valeurs est , et l'événement « prend la valeur » s'écrit , sa probabilité ; l'indicatrice d'un événement est . Les trois lois usuelles se notent pour la loi uniforme sur un ensemble fini , pour la loi de Bernoulli de paramètre et pour la loi binomiale de paramètres et . Enfin l'espérance est notée , la variance , l'écart-type , la covariance et le coefficient de corrélation . Les inégalités larges sont écrites et , et chaque démonstration se termine par le symbole .
Espaces probabilisés finis
Univers, issues, événements
Définition
On appelle expérience aléatoire une expérience dont on connaît à l'avance tous les résultats possibles, mais dont on ne peut pas prédire lequel se produira.
L'ensemble des résultats possibles est appelé univers de l'expérience et noté . Dans tout ce chapitre, est un ensemble fini et non vide. Ses éléments sont appelés les issues, ou résultats élémentaires.
Définition
Soit un univers fini. On appelle événement toute partie de , c'est-à-dire tout élément de . On dit que l'issue réalise l'événement lorsque .
Un événement élémentaire est un événement réduit à un singleton . L'événement est dit certain, l'événement est dit impossible.
Le vocabulaire probabiliste n'est qu'une traduction du vocabulaire ensembliste, et il est indispensable de savoir passer instantanément de l'un à l'autre : c'est ce passage qui transforme un énoncé rédigé en français en un calcul.
| Écriture ensembliste | Traduction probabiliste |
|---|---|
| une issue, un résultat possible de l'expérience | |
| un événement | |
| l'événement élémentaire « le résultat est » | |
| l'événement certain | |
| l'événement impossible | |
| « et » sont réalisés tous les deux | |
| « ou » : l'un au moins est réalisé | |
| l'événement contraire : « n'est pas réalisé » | |
| et sont incompatibles | |
| la réalisation de entraîne celle de | |
| « est réalisé mais pas » |
Définition
Soient et deux événements. On dit qu'ils sont incompatibles lorsque : aucune issue ne les réalise simultanément.
Une famille d'événements est dite deux à deux incompatibles lorsque pour tous .
Définition
Une famille d'événements est un système complet d'événements lorsque :
- les sont deux à deux incompatibles ;
- leur réunion est l'univers tout entier : .
Autrement dit, quelle que soit l'issue de l'expérience, un et un seul des événements est réalisé.
Exemple
Trois systèmes complets à connaître.
Pour tout événement , la famille est un système complet à deux éléments : c'est le plus utilisé de tous.
La famille des événements élémentaires est un système complet, puisque toute issue appartient à un unique singleton.
Pour un dé à six faces, en notant l'événement « le résultat est ou », « le résultat est ou » et « le résultat est ou », la famille est un système complet.
Remarque
Certains ouvrages exigent d'un système complet que ses événements soient non vides, d'autres non. La convention retenue ici est la plus souple : on autorise des vides, ce qui ne change rien aux formules puisqu'un événement vide contribuera toujours pour . En revanche, dès qu'un conditionnement interviendra, il faudra exiger , et cette hypothèse sera alors écrite explicitement dans l'énoncé.
Probabilité sur un univers fini
Définition
Soit un univers fini. On appelle probabilité sur toute application
vérifiant les deux conditions suivantes :
- ;
- pour tous événements et incompatibles, .
Le couple est alors appelé espace probabilisé fini.
Propriété
Soit un espace probabilisé fini et soit une famille d'événements deux à deux incompatibles. Alors
En particulier, si est un système complet d'événements, alors .
Démonstration. Par récurrence sur . Pour l'égalité est triviale, et pour c'est exactement l'axiome d'additivité.
Soit ; supposons la propriété vraie pour toute famille de événements deux à deux incompatibles, et soit une famille de tels événements. Posons . Les événements et sont incompatibles : si une issue appartenait à , elle appartiendrait à un certain avec et à , donc à , ce qui est absurde. L'axiome d'additivité donne alors
et l'hypothèse de récurrence, appliquée à , donne . D'où le résultat au rang .
Enfin, si la famille est un système complet, sa réunion est et la somme des vaut .
Propriété
Soit un espace probabilisé fini et soient et deux événements. Alors :
- ;
- ;
- ;
- si , alors (croissance) ;
- ;
- (sous-additivité).
Démonstration. Point 1. Les événements et sont incompatibles et leur réunion vaut , donc l'additivité donne , d'où . Point 2. Les événements et sont incompatibles et leur réunion est , donc . Point 3. Décomposons selon que est réalisé ou non :
et ces deux événements sont incompatibles, puisque le premier est inclus dans et le second dans . L'additivité donne , d'où le résultat. Point 4. Si , alors , et le point 3 donne ; or puisque est à valeurs dans , donc .
Point 5. Décomposons cette fois la réunion en , réunion de deux événements incompatibles, le second étant inclus dans . Donc , et le point 3 permet de conclure :
Point 6. C'est le point 5 auquel on retranche la quantité positive .
Propriété
Soit un espace probabilisé fini et soit une famille quelconque d'événements. Alors
Démonstration. Par récurrence sur . Le cas est une égalité. Supposons l'inégalité vraie au rang et posons . La sous-additivité pour deux événements donne
la dernière inégalité venant de l'hypothèse de récurrence. C'est l'inégalité au rang .
Remarque
La sous-additivité est une inégalité, jamais une égalité : les issues comptées dans plusieurs à la fois sont comptées plusieurs fois dans le membre de droite. Pour deux événements, on sait corriger exactement l'écart, c'est le point 5 ci-dessus. Pour trois événements ou plus, la correction exacte n'est pas au programme et vous n'aurez pas à l'écrire : soit vous vous ramenez à des événements deux à deux incompatibles, soit vous passez au contraire, soit vous vous contentez de la majoration.
Une probabilité est déterminée par ses valeurs sur les événements élémentaires
Propriété
Soit un univers fini.
- Si est une probabilité sur , alors pour tout événement ,
avec la convention que la somme vide vaut . 2. Réciproquement, si est une famille de réels positifs de somme , il existe une unique probabilité sur telle que pour tout .
Démonstration. Point 1. Si , les deux membres valent . Sinon, écrivons avec des issues deux à deux distinctes. Alors
et ces singletons sont deux à deux incompatibles, puisque deux singletons distincts sont disjoints. L'additivité finie établie plus haut donne exactement , c'est-à-dire la formule annoncée.
Point 2, unicité. Si et sont deux probabilités prenant les mêmes valeurs sur les singletons, le point 1 donne, pour tout événement , : les deux applications coïncident.
Point 2, existence. Définissons sur par
Cette somme est finie, à termes positifs, donc ; et comme les termes omis sont eux aussi positifs, . Ainsi est bien à valeurs dans , et . Vérifions enfin l'additivité. Soient et incompatibles, et notons et les ensembles d'indices tels que et respectivement. Comme , les ensembles et sont disjoints, et l'ensemble des indices associés à est exactement . La somme sur se scinde donc en la somme sur plus la somme sur :
L'application est donc une probabilité, et par construction.
Remarque
Ce théorème est le mode d'emploi de tout le chapitre : définir une probabilité, c'est répartir une masse totale sur les issues, et rien d'autre. Chaque fois qu'un énoncé décrit une expérience, votre premier travail consiste à écrire et à donner les nombres , ou une règle qui les donne ; tout le reste du calcul en découle mécaniquement par addition. La famille s'appelle d'ailleurs la distribution de la probabilité. Un même univers porte évidemment une infinité de probabilités différentes : décrit ce qui peut arriver, décrit avec quel poids.
Probabilité uniforme et dénombrement
Définition
Soit un univers fini non vide, de cardinal . La probabilité uniforme sur est l'unique probabilité qui donne la même valeur à tous les événements élémentaires, c'est-à-dire celle associée à la distribution pour toute issue . On dit alors qu'il y a équiprobabilité.
Propriété
Si est la probabilité uniforme sur , alors pour tout événement ,
formule que l'on énonce : « nombre de cas favorables sur nombre de cas possibles ».
Démonstration. Le théorème précédent, point 1, donne
puisque la somme comporte exactement termes tous égaux à . Il faut encore vérifier que la distribution constante est admissible : ses termes sont positifs et leur somme vaut .
Remarque
L'équiprobabilité est une hypothèse de modélisation, jamais une conséquence. Elle se justifie par la symétrie physique du dispositif (dé équilibré, pièce non truquée, cartes bien battues, tirage « au hasard ») et l'énoncé doit l'indiquer ; s'il ne dit rien, il faut la poser explicitement en rédaction. Attention enfin à une erreur classique : l'équiprobabilité dépend du choix de . Pour le lancer de deux dés, les couples de sont équiprobables, mais les sommes possibles ne le sont pas du tout, puisque la somme est réalisée par six couples et la somme par cinq seulement, d'où et .
Exemple
Un calcul par dénombrement. On tire simultanément cartes dans un jeu de cartes bien battues. On prend pour univers l'ensemble des parties à éléments du jeu, muni de la probabilité uniforme, de sorte que
Exactement deux as. Une telle main se construit en choisissant as parmi les , puis cartes parmi les qui ne sont pas des as, ce qui donne mains, d'où
Au moins un as. Le passage au contraire est bien plus rapide qu'un décompte direct : les mains sans aucun as sont les parties à éléments des cartes restantes, au nombre de . Donc
Avec seulement quatre as dans le paquet, on en reçoit tout de même au moins un plus d'une fois sur deux.
Probabilités conditionnelles
Définition
Définition
Soient un espace probabilisé fini et un événement tel que . Pour tout événement , on appelle probabilité conditionnelle de sachant le réel
Remarque
L'idée est de changer d'univers. Savoir que est réalisé revient à décider que les issues extérieures à n'existent plus, donc à redistribuer la masse totale à l'intérieur de seulement, proportionnellement aux masses initiales ; la division par est exactement la renormalisation qui rend la nouvelle masse totale égale à . La condition n'est pas une précaution de rédaction, c'est une nécessité : conditionner par un événement de probabilité nulle n'a aucun sens dans ce cadre. Vérifiez-la avant d'écrire , et signalez-la.
Propriété
Soit un événement tel que . L'application est une probabilité sur .
En conséquence, toutes les formules de la section précédente lui sont applicables ; par exemple .
Démonstration. Vérifions d'abord que est bien à valeurs dans . Pour tout événement , on a , donc par croissance ; en divisant par , il vient .
Ensuite .
Enfin, soient et deux événements incompatibles. Les événements et sont alors eux aussi incompatibles, puisque , et l'on a par distributivité. Donc
Les deux axiomes sont vérifiés : est une probabilité.
Remarque
Une erreur très répandue consiste à écrire , ou à croire que et sont égaux. Ni l'un ni l'autre. Ce qui est vrai, et qui découle de la propriété ci-dessus, c'est que le passage au contraire est licite sur l'événement conditionné, celui de droite, jamais sur l'événement conditionnant. Le lien entre et existe, mais il porte un nom et un facteur correctif : c'est la formule de Bayes.
Les trois formules du conditionnement
Propriété
Formule des probabilités composées. Soient des événements tels que . Alors
Démonstration. Observons d'abord que toutes les probabilités conditionnelles écrites ont un sens : pour , on a , donc par croissance . Raisonnons ensuite par récurrence sur .
Initialisation. Pour , l'hypothèse est et la définition de donne directement .
Hérédité. Soit ; supposons la formule vraie pour toute famille de événements vérifiant l'hypothèse, et soient tels que . Posons . Comme , la définition de donne
Par ailleurs, la famille vérifie , donc l'hypothèse de récurrence s'applique et fournit l'expression de comme produit des premiers facteurs. En reportant, on obtient la formule au rang .
Propriété
Formule des probabilités totales. Soit un système complet d'événements tel que pour tout . Alors, pour tout événement ,
Démonstration. Décomposons suivant le système complet. Comme la réunion des vaut , on a
par distributivité de l'intersection sur la réunion. Ces événements sont deux à deux incompatibles : pour , . L'additivité finie donne donc
Enfin, chaque étant strictement positif, la définition du conditionnement s'écrit , ce qui achève la démonstration.
Remarque
La formule reste vraie si certains sont de probabilité nulle, sous la forme , qui ne fait intervenir aucun conditionnement : les termes correspondants sont simplement nuls, car . C'est cette forme qu'il faut employer si l'on n'est pas certain de la stricte positivité. Le cas particulier le plus fréquent est celui du système complet :
Propriété
Formule de Bayes. Soient et deux événements de probabilités strictement positives. Alors
Si de plus est un système complet d'événements de probabilités strictement positives et si , alors pour tout ,
Démonstration. Les deux conditionnements sont licites puisque et sont non nuls. Écrivons deux fois l'intersection :
Ces deux quantités sont égales, et en divisant par on obtient la première formule. Pour la seconde, on l'applique à , puis on remplace le dénominateur par son expression donnée par la formule des probabilités totales appliquée au système complet .
Méthode
Utiliser un arbre pondéré. Un arbre traduit une expérience à plusieurs étapes ; il ne se dessine pas ici, il se décrit, mais sa lecture obéit à trois règles fixes.
- Les branches issues d'un même nœud portent les événements d'un système complet : leurs poids ont donc pour somme .
- Le poids d'une branche est une probabilité conditionnée par tout ce qui la précède sur le chemin. Seules les branches du premier niveau portent des probabilités non conditionnelles.
- La probabilité d'un chemin complet est le produit des poids rencontrés : c'est la formule des probabilités composées.
- La probabilité d'un événement est la somme des probabilités des chemins qui le réalisent : c'est la formule des probabilités totales.
Un arbre se lit toujours dans le sens de sa construction. Remonter le temps, c'est-à-dire calculer la probabilité d'une cause connaissant l'effet, demande la formule de Bayes.
Exemple
Tirages successifs sans remise. Une urne contient boules blanches et boules noires. On tire successivement boules sans remise. Notons l'événement « la -ième boule tirée est blanche ».
L'arbre a trois niveaux. Au premier, la branche porte le poids . Sachant , il reste boules dont blanches, donc la branche porte le poids . Sachant , il reste boules dont blanches, donc la branche porte le poids . La formule des probabilités composées donne
Contrôle par un autre modèle : en tirant les boules simultanément, on trouve . Les deux modèles, l'un ordonné, l'autre non, donnent bien la même réponse.
Exemple
Un test de dépistage. Une maladie touche une personne sur mille dans une population. Un test de dépistage possède les caractéristiques suivantes : il est positif chez des malades, et négatif chez des personnes saines. Une personne choisie au hasard subit le test, qui se révèle positif. Quelle est la probabilité qu'elle soit malade ?
Notons l'événement « la personne est malade » et l'événement « le test est positif ». Les données se traduisent par
d'où , en utilisant que est une probabilité. La famille est un système complet d'événements de probabilités non nulles, donc la formule des probabilités totales donne
La formule de Bayes fournit alors la réponse :
Remarque
Le résultat précédent est contre-intuitif, et c'est pour cela qu'il faut l'avoir traité une fois : un test réputé fiable à ne rend malade qu'une personne positive sur vingt et une. Le mieux est de raisonner sur une population de personnes. Elle compte malades, dont seront détectés, et personnes saines, dont , soit , seront positives à tort. Sur les tests positifs, seuls correspondent à un vrai malade, ce qui redonne bien la fraction . Ce que le calcul met en évidence, c'est le poids de la prévalence : quand la maladie est rare, le réservoir de personnes saines est si grand qu'une petite proportion de faux positifs écrase en nombre les vrais positifs. Le mécanisme se reproduit à l'identique dans tous les problèmes de détection, de contrôle qualité ou de reconnaissance.
Indépendance
Indépendance de deux événements
Définition
Deux événements et d'un espace probabilisé fini sont dits indépendants lorsque
Propriété
Soient et deux événements avec . Alors
Démonstration. Comme , l'égalité équivaut, après division par , à , c'est-à-dire à .
Remarque
C'est la lecture intuitive de l'indépendance : savoir que est réalisé ne modifie pas la probabilité de . On préfère néanmoins la définition par le produit, pour deux raisons. Elle est symétrique en et , alors que l'écriture conditionnelle ne l'est pas ; et elle garde un sens lorsque , cas où tout événement est indépendant de , puisque entraîne .
Propriété
Si et sont indépendants, alors et sont indépendants. Il en va de même de et , ainsi que de et .
Démonstration. Décomposons selon que est réalisé ou non :
réunion de deux événements incompatibles. L'additivité donne , d'où
en utilisant successivement l'indépendance de et , puis la probabilité du contraire. Donc et sont indépendants.
Le deuxième énoncé s'obtient en échangeant les rôles de et , la définition étant symétrique. Le troisième s'obtient en appliquant le premier résultat au couple , déjà connu comme indépendant.
Remarque
Indépendants et incompatibles sont deux notions sans rapport, et même presque contraires. Si et sont incompatibles avec et , alors tandis que : ils ne sont pas indépendants. C'est logique, savoir que est réalisé interdit alors complètement , ce qui est une information maximale. Notez enfin que et sont indépendants de tout événement.
Indépendance mutuelle d'une famille finie
Définition
Une famille d'événements est dite mutuellement indépendante lorsque, pour toute partie de contenant au moins deux éléments,
On dit qu'elle est deux à deux indépendante lorsque et sont indépendants pour tous , c'est-à-dire lorsque la condition ci-dessus est vérifiée pour les seules parties à deux éléments.
Remarque
L'indépendance mutuelle est donc une condition beaucoup plus forte que l'indépendance deux à deux : pour événements, elle impose égalités, contre seulement. Pour , cela fait quatre égalités au lieu de trois : les trois égalités deux à deux, plus l'égalité portant sur l'intersection des trois. C'est cette dernière qui manque dans le contre-exemple ci-dessous.
Propriété
L'indépendance deux à deux n'entraîne pas l'indépendance mutuelle.
Démonstration par contre-exemple. On lance deux fois une pièce équilibrée et l'on prend muni de la probabilité uniforme, chacune des quatre issues ayant donc la probabilité . Considérons les trois événements
En écrivant les issues, , et , chacun de cardinal , donc de probabilité . Les intersections deux à deux valent toutes : en effet , et puisque la seule issue commençant par pile et formée de deux résultats identiques est , et de même . Chacune a donc pour probabilité : les trois événements sont deux à deux indépendants. Pourtant , de probabilité , alors que . Comme , la famille n'est pas mutuellement indépendante.
Remarque
L'exemple est parlant : la connaissance de deux de ces trois événements détermine complètement le troisième, puisque connaître les deux lancers dit évidemment s'ils sont égaux. Il y a donc une dépendance très forte, invisible sur les seules égalités deux à deux. Signalons enfin, sans démonstration, un résultat de stabilité qui prolonge celui de la section précédente : si une famille est mutuellement indépendante, la famille obtenue en remplaçant certains de ses événements par leurs contraires l'est encore.
Remarque
L'indépendance est presque toujours une hypothèse, pas un résultat. Dans la pratique, on ne vérifie pas l'égalité : on la pose, parce que le dispositif expérimental la justifie. Lancer une pièce dix fois de suite, tirer une boule et la remettre dans l'urne, interroger dix personnes choisies indépendamment les unes des autres : dans tous ces cas, l'indépendance mutuelle des résultats successifs fait partie de la description du modèle, au même titre que l'équiprobabilité. C'est ce qui donne son statut à la phrase « on répète fois de façon indépendante la même expérience » : elle ne se démontre pas, elle définit la probabilité sur l'univers produit, en posant que la probabilité d'une suite de résultats est le produit des probabilités de ces résultats. Nous nous en servirons dans un instant pour construire la loi binomiale. En revanche, lorsque l'énoncé fournit les probabilités et demande si deux événements sont indépendants, c'est un calcul : on compare à , et l'on conclut par l'égalité ou par l'inégalité stricte.
Variables aléatoires
Définition et événements associés
Définition
Soit un espace probabilisé fini. On appelle variable aléatoire réelle sur toute application
L'ensemble des valeurs prises par est fini, comme image d'un ensemble fini.
Définition
Soient une variable aléatoire et un réel. On note
qui est un événement. On définit de même , , , et plus généralement, pour une partie de , l'événement .
Remarque
La notation est une abréviation, et c'est la plus importante du chapitre : derrière l'écriture d'apparence algébrique se cache un ensemble d'issues. Écrire , c'est écrire la probabilité de l'événement formé des issues que envoie sur . Gardez cette lecture en tête chaque fois qu'un calcul vous semble opaque : il suffit de revenir aux issues. Notez aussi que dès que , et que dans ce cas .
Propriété
Soit une variable aléatoire sur . La famille est un système complet d'événements.
Démonstration. Ces événements sont deux à deux incompatibles : si et si une issue appartenait à , on aurait et , donc , contradiction. Leur réunion est : pour toute issue , le réel appartient par définition à , donc appartient à l'événement , qui fait partie de la famille.
Loi d'une variable aléatoire
Définition
On appelle loi de la variable aléatoire l'application
Deux variables aléatoires ont même loi lorsqu'elles ont le même ensemble de valeurs et que ces valeurs sont atteintes avec les mêmes probabilités ; on note alors .
Propriété
Soit une variable aléatoire, d'ensemble de valeurs , les étant deux à deux distincts. Alors
et, pour toute partie de ,
Démonstration. La famille est un système complet d'événements d'après la propriété précédente, donc la somme de ses probabilités vaut . Pour la seconde égalité, décomposons l'événement :
En effet, si , alors appartient aussi à , donc figure dans le membre de droite ; la réciproque est immédiate. Cette réunion est formée d'événements deux à deux incompatibles, et l'additivité finie conclut.
Remarque
Cette propriété a une conséquence pratique constante : la loi de contient toute l'information utile sur . Une fois la loi connue, on n'a plus besoin de , et l'on peut oublier complètement l'expérience qui a produit la variable ; c'est ce qui explique que l'on parle de « la » loi binomiale sans jamais préciser l'univers sous-jacent. En pratique, on présente une loi sous forme de tableau, la première ligne donnant les valeurs, la seconde leurs probabilités, et le contrôle à faire systématiquement est que la somme de la seconde ligne vaut : c'est la vérification la plus rentable du chapitre, elle détecte la plupart des erreurs.
Loi d'une fonction d'une variable aléatoire
Propriété
Soient une variable aléatoire et une application définie sur et à valeurs réelles. Alors , définie par , est une variable aléatoire, d'ensemble de valeurs , et pour tout de cet ensemble,
Démonstration. L'application va bien de dans , c'est donc une variable aléatoire, et son ensemble de valeurs est . Fixons et décomposons l'événement suivant la valeur prise par :
L'inclusion de droite à gauche est claire ; réciproquement, si , alors appartient à pour , qui vérifie bien . Cette réunion est formée d'événements deux à deux incompatibles, et l'additivité finie donne la formule.
Exemple
Soit , résultat d'un dé équilibré, et posons . Les valeurs prises par sont , , , , , selon que vaut , , , , , . Donc , et en regroupant les antécédents,
Contrôle : . Notez que n'est pas uniforme, bien que le soit : la fonction n'étant pas injective, elle regroupe des valeurs.
Fonction de répartition et loi d'un maximum
Définition
On appelle fonction de répartition de la variable aléatoire l'application
Méthode
Calculer la loi d'un maximum. Lorsque la variable étudiée est un maximum, le calcul direct de est pénible, car il faut décrire quelle coordonnée réalise le maximum et éviter les doubles comptages. Le calcul de , lui, est immédiat, car « le maximum est inférieur ou égal à » signifie « tous les termes sont inférieurs ou égaux à ». On procède donc en trois temps.
- Calculer pour tout de , en traduisant l'événement par une condition portant sur toutes les coordonnées.
- Écrire la décomposition , réunion de deux événements incompatibles.
- En déduire .
La même méthode s'applique à un minimum, en passant au contraire : « le minimum est supérieur ou égal à » signifie « tous les termes le sont ».
Exemple
On lance deux dés équilibrés discernables, muni de la probabilité uniforme, et l'on note le plus grand des deux résultats.
Pour , l'événement est réalisé exactement par les couples dont les deux coordonnées appartiennent à , au nombre de , donc . En retranchant, on obtient pour tout
La loi de est donc donnée par pour allant de à . Contrôle : la somme vaut .
Lois usuelles
Loi uniforme
Définition
Soit un ensemble fini non vide de réels, de cardinal . On dit que suit la loi uniforme sur , et l'on note , lorsque et
Le cas le plus fréquent est : dès qu'un objet est choisi au hasard parmi objets numérotés, son numéro suit la loi . Ainsi le résultat d'un dé équilibré à six faces suit la loi .
Loi de Bernoulli et indicatrices
Définition
Soit . On dit que suit la loi de Bernoulli de paramètre , et l'on note , lorsque avec
On dit que code une épreuve de Bernoulli, l'événement étant appelé succès et échec.
Définition
Soit un événement. On appelle indicatrice de la variable aléatoire définie par
Propriété
Soient et deux événements. Alors :
- , et toute variable de Bernoulli est l'indicatrice de l'événement ;
- et ;
- .
Démonstration. Point 1. L'indicatrice ne prend que les valeurs et , et l'événement est exactement , de probabilité . Réciproquement, si ne prend que les valeurs et , alors et coïncident en toute issue. Point 2. Pour toute issue , on a si et seulement si , c'est-à-dire si et seulement si : les deux applications et coïncident. Pour la seconde égalité, le produit vaut si et seulement si les deux facteurs valent , c'est-à-dire si et seulement si . Point 3. C'est le point 2 appliqué à , puisque .
Remarque
Le point 3, d'apparence anecdotique, servira deux fois : pour calculer la variance d'une loi de Bernoulli en une ligne, et dans toutes les applications de la méthode des indicatrices. Retenez la formule sous la forme parlante : une indicatrice est égale à son carré.
Loi binomiale
Définition
Soient et . On appelle schéma de Bernoulli de paramètres et la répétition de épreuves de Bernoulli identiques et mutuellement indépendantes, chacune ayant la probabilité de succès.
La variable aléatoire égale au nombre de succès obtenus suit alors la loi binomiale de paramètres et , ce que l'on note .
Propriété
Si , alors et
Démonstration. Construisons d'abord le modèle. Une répétition de épreuves se décrit par la suite de ses résultats, donc on prend
où la -ième coordonnée vaut en cas de succès à la -ième épreuve et sinon. Pour une issue , notons le nombre de succès qu'elle réalise. Posons et définissons la distribution
ce qui traduit exactement l'indépendance mutuelle des épreuves : la probabilité d'une suite de résultats est le produit des probabilités de ces résultats, soit un facteur pour chaque succès et un facteur pour chaque échec.
Vérifions qu'il s'agit bien d'une distribution admissible. Ces nombres sont positifs, et pour calculer leur somme, regroupons les issues selon leur nombre de succès. Pour fixé, les issues telles que sont les suites de chiffres ou comportant exactement fois le chiffre : une telle suite est entièrement déterminée par l'ensemble des positions occupées par les , c'est-à-dire par une partie à éléments de . Il y en a donc exactement , et chacune a la même probabilité . D'où
par la formule du binôme de Newton, et le théorème de la section 1 assure l'existence d'une unique probabilité sur ayant cette distribution. Il ne reste plus qu'à lire le résultat : la variable est ici l'application , dont l'ensemble des valeurs est , et l'événement est formé des issues comptées ci-dessus, chacune de probabilité , donc
Remarque
La démonstration se retient par sa structure, qui est celle de tous les calculs de loi binomiale : le facteur est la probabilité d'une suite particulière de résultats comportant succès, et le coefficient compte le nombre de suites possibles, c'est-à-dire les places où les succès peuvent tomber. Probabilité d'un chemin, multipliée par le nombre de chemins. Le calcul fait au passage la vérification obligatoire : la somme des vaut , par le binôme de Newton, et c'est de là que la loi tire son nom.
Propriété
Cas particuliers utiles. Si , alors
De plus n'est autre que .
Démonstration. Les deux premières égalités sont la formule générale avec et , en utilisant . La troisième est le passage au contraire, puisque est le contraire de . Enfin, pour , la formule donne et , ce qui est la loi de Bernoulli.
Exemple
On lance fois un dé équilibré et l'on note le nombre de obtenus. Les cinq lancers sont identiques et indépendants, chacun donnant un avec la probabilité , donc .
La probabilité d'obtenir exactement deux vaut
La probabilité d'obtenir au moins un vaut
Remarque
Reconnaître un schéma binomial demande trois vérifications, et elles sont éliminatoires. Le nombre d'épreuves doit être fixé à l'avance ; les épreuves doivent être identiques, donc avoir toutes la même probabilité de succès ; elles doivent être mutuellement indépendantes. Le contre-exemple à connaître est le tirage sans remise. Si l'on tire cartes une à une sans remise dans un jeu de et que l'on compte les as obtenus, la deuxième épreuve ne suit plus la même loi conditionnellement au résultat de la première : la composition du paquet a changé. Le nombre d'as n'est donc pas binomial, et écrire serait une faute. Avec remise, en revanche, le schéma est binomial de paramètres et .
Couples de variables aléatoires
Loi conjointe, lois marginales, lois conditionnelles
Définition
Soient et deux variables aléatoires sur le même espace probabilisé fini . On appelle loi conjointe du couple l'application
quantité que l'on note plus simplement .
Les lois de et de prises séparément s'appellent alors les lois marginales du couple.
Propriété
Formule des lois marginales. Pour tout et tout ,
Démonstration. La famille est un système complet d'événements. En décomposant l'événement suivant ce système, comme dans la démonstration de la formule des probabilités totales, on obtient
réunion d'événements deux à deux incompatibles puisque les le sont. L'additivité finie donne la première formule ; la seconde s'obtient en échangeant les rôles de et .
Remarque
La formule porte bien son nom : lorsqu'on présente la loi conjointe dans un tableau à double entrée, une ligne par valeur de et une colonne par valeur de , les lois marginales s'obtiennent en sommant chaque ligne et chaque colonne, et s'écrivent traditionnellement en marge du tableau, la somme totale devant valoir . Attention au sens de l'implication : la loi conjointe détermine les deux lois marginales, mais la réciproque est fausse. Deux couples de variables peuvent avoir exactement les mêmes marginales et des lois conjointes différentes ; c'est précisément parce que les marginales ne disent rien du lien entre et .
Définition
Soient et deux variables aléatoires et tel que . On appelle loi conditionnelle de sachant l'application
C'est la loi d'une variable aléatoire : la somme de ses valeurs sur vaut .
Exemple
Un couple explicite. Une urne contient jetons, chacun portant un couple d'entiers : un jeton porte , deux jetons portent , trois jetons portent , trois jetons portent , deux jetons portent et un jeton porte . On tire un jeton au hasard et l'on note le premier nombre inscrit, le second.
| loi de | ||||
|---|---|---|---|---|
| loi de |
Les marges se lisent directement : et , les autres se calculant de même. La loi conditionnelle de sachant vaut
de somme comme annoncé. Elle diffère de la loi marginale de , qui est uniforme : savoir que modifie donc la loi de .
Indépendance de variables aléatoires
Définition
Deux variables aléatoires et sur le même espace probabilisé fini sont dites indépendantes lorsque
On note parfois cette situation .
Propriété
Les variables et sont indépendantes si et seulement si, pour toutes parties et de ,
c'est-à-dire si et seulement si les événements et sont indépendants.
Démonstration. Le sens réciproque est immédiat : il suffit d'appliquer l'hypothèse à et . Sens direct : supposons et indépendantes et fixons et . En décomposant selon les valeurs prises, comme plus haut, puis en utilisant l'additivité sur les événements deux à deux incompatibles , on obtient
la dernière égalité étant la factorisation d'une somme double dont le terme général est un produit d'un facteur ne dépendant que de par un facteur ne dépendant que de . Les deux sommes obtenues valent respectivement et .
Propriété
Si et sont indépendantes, alors pour toutes applications et définies respectivement sur et , les variables et sont indépendantes.
Démonstration. Soient une valeur de et une valeur de . Posons et , en convenant que et sont prolongées arbitrairement hors de leurs ensembles de définition. Alors et , et la propriété précédente donne
Définition
Une famille de variables aléatoires sur le même espace probabilisé fini est dite mutuellement indépendante lorsque, pour tout -uplet de réels,
On dit alors simplement que les variables sont indépendantes.
Propriété
Lemme des coalitions. Soient des variables aléatoires mutuellement indépendantes et soit . Alors, pour toutes applications définie sur les premières coordonnées et définie sur les dernières, les variables aléatoires
sont indépendantes. Plus généralement, des variables construites à partir de blocs d'indices deux à deux disjoints sont mutuellement indépendantes.
Ce résultat est ADMIS : sa démonstration n'est pas exigible au programme.
Remarque
Le lemme des coalitions est d'un usage constant, et il est très souvent utilisé sans être nommé. C'est lui qui autorise, dans un schéma de Bernoulli à épreuves, à dire que le nombre de succès des trois premières épreuves et le nombre de succès des sept dernières sont indépendants, ou que et sont indépendantes dès que le sont mutuellement. L'hypothèse essentielle est la disjonction des blocs : dès qu'un même indice apparaît dans les deux groupes, la conclusion tombe, et ainsi et n'ont aucune raison d'être indépendantes.
Exemple
Un couple non indépendant. Reprenons l'urne de jetons ci-dessus. On a
Comme , les variables et ne sont pas indépendantes. Un point de méthode important apparaît ici : il aurait été insuffisant de tester le couple , pour lequel on trouve et , donc une égalité. L'indépendance exige l'égalité pour tous les couples de valeurs ; une seule égalité ne prouve rien, alors qu'un seul contre-exemple suffit à conclure à la non-indépendance.
Espérance
Définition et premières propriétés
Définition
Soit une variable aléatoire sur un espace probabilisé fini. On appelle espérance de le réel
Une variable aléatoire est dite centrée lorsque .
Remarque
L'espérance est la moyenne des valeurs prises par , pondérée par les probabilités. Ce n'est pas une valeur que prend nécessairement : l'espérance du résultat d'un dé vaut , qui n'est pas une face. Ce n'est pas non plus la valeur la plus probable. C'est le centre de gravité de la distribution, et c'est aussi la valeur autour de laquelle la moyenne d'un grand nombre de répétitions se stabilise, ce que la dernière section du chapitre démontrera.
Propriété
Soit une variable aléatoire sur . Alors
Démonstration. Partons du membre de droite et regroupons les issues suivant la valeur que leur attribue. Comme la famille est un système complet d'événements, chaque issue appartient à un et un seul de ces événements, et la somme sur se scinde en une somme de sommes :
Dans la somme intérieure, toutes les issues vérifient , donc le facteur est la constante , que l'on sort : , la dernière égalité étant le théorème de la section 1 appliqué à l'événement . En reportant, on obtient exactement .
Propriété
Formule de transfert. Soient une variable aléatoire et une application définie sur . Alors
De même, pour un couple et une application de deux variables,
Démonstration. Appliquons la propriété précédente à la variable aléatoire :
Regroupons de nouveau les issues suivant la valeur de : sur l'événement , le facteur vaut la constante , donc
Pour la version à deux variables, on procède exactement de même, en regroupant cette fois les issues suivant la valeur du couple, c'est-à-dire selon le système complet .
Remarque
Mesurez ce que la formule de transfert évite : pour calculer , il n'est pas nécessaire de déterminer la loi de . On garde la loi de , qui est connue, et l'on transporte à l'intérieur de la somme, ce qui rend le calcul de , donc de la variance, immédiat. Ne confondez jamais pour autant et : ces deux quantités sont différentes en général. Pour le résultat d'un dé, alors que .
Linéarité, positivité, indicatrices
Propriété
Soient et deux variables aléatoires sur le même espace probabilisé fini et deux réels. Alors :
- linéarité : ;
- espérance d'une constante : si est constante égale à , alors ; en particulier ;
- positivité : si , c'est-à-dire si pour toute issue, alors ;
- croissance : si , alors ;
- pour tout événement .
Démonstration. Point 1. C'est ici que l'expression de l'espérance sur les issues montre toute son utilité, car la somme y porte sur un ensemble d'indices, , qui ne dépend pas de la variable considérée. Les trois variables , et sont définies sur le même , et pour toute issue on a . Donc
par linéarité de la somme finie. Aucune hypothèse d'indépendance n'a été utilisée, et c'est le point capital.
Point 2. Si est constante égale à , alors et , donc . En appliquant le point 1 à et à la variable constante , avec et , on obtient . Point 3. Si , toutes les valeurs sont positives, et les probabilités aussi : est une somme de termes positifs. Point 4. La variable est positive, donc par le point 3, et la linéarité donne . Point 5. L'indicatrice suit la loi , donc
Remarque
Le point 1 s'étend immédiatement par récurrence à une combinaison linéaire de variables aléatoires :
Insistons une dernière fois, car c'est l'énoncé le plus utile du chapitre : cette formule ne demande aucune hypothèse sur les liens entre les . Elles peuvent être fortement dépendantes, voire égales, la formule tient.
Espérance des lois usuelles
Propriété
- Si , alors .
- Si , alors .
- Si , alors .
Démonstration. Point 1. La loi étant uniforme,
Point 2. Directement, .
Point 3, première méthode : le pivot. Posons . Par définition,
le terme étant nul. La formule du pivot, établie au chapitre de dénombrement, donne pour . Donc
où l'on a sorti un facteur et un facteur . Le changement d'indice , licite car décrit quand décrit , donne
par la formule du binôme et .
Point 3, seconde méthode : la somme d'indicatrices. Reprenons le modèle de la construction de la loi binomiale, et notons la -ième coordonnée, c'est-à-dire l'indicatrice de l'événement « la -ième épreuve est un succès ». Chaque suit la loi , donc , et par construction
La linéarité de l'espérance donne alors immédiatement .
Remarque
Comparez les deux démonstrations du point 3. La première est un calcul de somme, correct mais technique, avec un pivot et un changement d'indice. La seconde tient en deux lignes et n'utilise que la linéarité. C'est exactement le rapport de force entre le calcul direct d'une loi et la méthode qui suit.
La méthode des indicatrices
Méthode
Décomposer en somme d'indicatrices. Cette méthode est la plus puissante du chapitre. Elle s'applique dès que la variable étudiée compte le nombre d'objets vérifiant une certaine condition.
- Identifier ce qui est compté et indexer les objets : .
- Poser l'événement « l'objet numéro vérifie la condition », et .
- Justifier l'écriture , en vérifiant qu'elle est vraie issue par issue : chaque objet comptabilisé ajoute exactement .
- Appliquer la linéarité : .
Il reste alors à calculer les probabilités , ce qui est en général immédiat, et souvent la même pour tous les par symétrie. À aucun moment on n'a besoin de la loi de , ni d'une quelconque hypothèse d'indépendance entre les .
Exemple
Le nombre de points fixes d'une permutation. On tire au hasard une permutation de , c'est-à-dire que l'on munit de la probabilité uniforme, et l'on note le nombre de points fixes de , c'est-à-dire le nombre d'entiers tels que .
Le calcul direct de la loi de est délicat, alors que la méthode des indicatrices donne la réponse en trois lignes. Posons l'événement « » ; par construction , puisque chaque point fixe contribue pour . Or les permutations qui fixent sont en bijection avec les permutations de , il y en a donc , d'où . La linéarité de l'espérance donne alors
En moyenne, une permutation tirée au hasard possède exactement un point fixe, et ce quel que soit . Notez que les ne sont pas indépendants, ce qui n'a gêné en rien le calcul.
Exemple
Un tirage sans remise. Une urne contient boules dont blanches. On tire boules successivement et sans remise, avec , et l'on note le nombre de boules blanches obtenues. La loi de n'est pas binomiale, et son calcul demanderait un dénombrement ; l'espérance, elle, s'obtient sans loi.
Posons l'événement « la -ième boule tirée est blanche », de sorte que . Prenons pour univers l'ensemble des -uplets de boules deux à deux distinctes, de cardinal , muni de l'équiprobabilité. Pour former un tirage réalisant , on choisit la boule de rang parmi les blanches, puis les autres rangs parmi les boules restantes, ce qui donne tirages. En simplifiant,
valeur indépendante de , ce qui traduit le fait que toutes les positions du tirage jouent le même rôle. D'où . Application chiffrée : dans une main de cartes tirées d'un jeu de , le nombre moyen d'as vaut . Remarquez que c'est la même espérance que pour un tirage avec remise, alors que les lois, elles, diffèrent.
Espérance d'un produit
Propriété
Si et sont deux variables aléatoires indépendantes, alors
Démonstration. Appliquons la formule de transfert au couple avec :
L'indépendance permet de remplacer par , d'où
Le terme général est le produit d'un facteur ne dépendant que de par un facteur ne dépendant que de : la somme double se factorise en
Remarque
La réciproque est fausse : l'égalité n'entraîne pas l'indépendance de et , et un contre-exemple sera construit à la section suivante, où cette égalité prendra le nom de « covariance nulle ». Attention également au sens de l'énoncé : contrairement à la linéarité, cette propriété exige l'indépendance, et écrire sans l'avoir justifiée est l'une des fautes les plus lourdes du chapitre. Notez d'ailleurs qu'en général , ce qui est le cas : une variable n'est presque jamais indépendante d'elle-même.
Variance, écart-type, covariance
Variance et écart-type
Définition
Soit une variable aléatoire sur un espace probabilisé fini. On appelle variance de le réel
et écart-type de le réel .
Remarque
La variance est l'espérance du carré de l'écart à la moyenne : elle mesure la dispersion de autour de , et elle est toujours positive, comme espérance d'une variable positive, ce qui donne un sens à la racine carrée définissant l'écart-type. Le carré n'est pas là par hasard : on souhaite mesurer un écart sans que les écarts positifs compensent les négatifs, or l'écart moyen est toujours nul. Élever au carré résout le problème et, contrairement à la valeur absolue, conduit à des calculs algébriques agréables. Le prix à payer est un changement d'unité, que l'écart-type corrige : si est une longueur en mètres, s'exprime en mètres carrés et en mètres.
Propriété
Formule de Koenig-Huygens. Pour toute variable aléatoire ,
Démonstration. Posons , qui est un réel fixé. Développons le carré, ce qui est licite issue par issue :
La linéarité de l'espérance, appliquée à cette combinaison linéaire des variables , et de la variable constante , donne
Remarque
C'est toujours cette formule que l'on utilise pour calculer une variance : elle ne demande que et , ce dernier s'obtenant par transfert sans connaître la loi de , alors que le calcul direct à partir de la définition est presque toujours plus long. Une conséquence à retenir : , avec égalité si et seulement si la variance est nulle.
Propriété
Soient une variable aléatoire et , deux réels. Alors
Démonstration. La linéarité donne , donc
En élevant au carré, il vient , et l'espérance, qui est linéaire, laisse sortir la constante :
En prenant la racine carrée, et puisque , on obtient l'expression de l'écart-type.
Remarque
Deux lectures. D'une part, une translation ne change pas la variance : ajouter une constante déplace la distribution sans la disperser davantage. D'autre part, une dilatation de rapport multiplie la variance par et l'écart-type par , ce qui confirme que l'écart-type est la bonne unité de dispersion. Ne perdez jamais le carré : , et non ; et attention, .
Propriété
Soit une variable aléatoire. Alors , et
Lorsque , la variable est appelée variable centrée réduite associée à , et vérifie et .
Démonstration. La positivité résulte de celle de l'espérance, appliquée à la variable , qui est un carré donc positive. Posons et utilisons la formule de transfert :
C'est une somme finie de termes positifs. Elle est donc nulle si et seulement si chacun de ses termes l'est, c'est-à-dire si et seulement si, pour tout , on a ou . Dans ce cas, la somme des pour est nulle, et comme la somme totale vaut , il reste . Réciproquement, si , tous les autres termes sont nuls et celui d'indice aussi, donc . Enfin, est de la forme avec et , donc et .
Variance des lois usuelles
Propriété
- Si , alors .
- Si , alors .
- Si , alors .
Démonstration. Point 1. Par transfert, puis avec la somme des carrés des premiers entiers,
La formule de Koenig-Huygens et donnent alors
Point 2. Comme ne prend que les valeurs et , on a , donc et .
Point 3. Posons et calculons d'abord par transfert. Pour , deux applications de la formule du pivot donnent
Les termes d'indices et étant nuls, il vient
après le changement d'indice et la formule du binôme. La linéarité donne alors , d'où
Remarque
Pour un dé équilibré, ces formules donnent et , soit un écart-type . Notez que la variance d'une loi de Bernoulli est maximale pour , où elle vaut , ce qui est bien l'épreuve la plus imprévisible, et qu'elle est nulle pour et , cas où le résultat est certain. Nous réutiliserons la majoration dans la dernière section.
Covariance
Définition
Soient et deux variables aléatoires sur le même espace probabilisé fini. On appelle covariance de et le réel
Propriété
Soient , , des variables aléatoires et , des réels. Alors :
- ;
- et ;
- , et de même par rapport à la seconde variable : la covariance est bilinéaire symétrique ;
- si et sont indépendantes, alors .
Démonstration. Point 1. Posons et , deux réels. Développons le produit issue par issue :
La linéarité de l'espérance donne
Point 2. Avec , la définition redonne exactement celle de la variance, et la symétrie est évidente sur la définition, le produit de deux réels étant commutatif. Point 3. Utilisons la forme du point 1 et la linéarité de l'espérance :
La linéarité par rapport à la seconde variable s'en déduit par symétrie. Point 4. Si et sont indépendantes, alors , et le point 1 donne une covariance nulle.
Remarque
La réciproque du point 4 est fausse. Deux variables de covariance nulle, que l'on dit non corrélées, ne sont pas nécessairement indépendantes. Le contre-exemple de référence, entièrement traité en exercice, consiste à prendre de loi uniforme sur et : on vérifie que et que , d'où et une covariance nulle, alors que est une fonction de , donc entièrement déterminée par elle. Ce que mesure la covariance est en réalité la seule dépendance affine entre et : elle est positive quand les deux variables ont tendance à s'écarter de leur moyenne dans le même sens, négative dans le cas contraire, et une dépendance non affine comme lui échappe complètement.
Variance d'une somme
Propriété
Soient des variables aléatoires sur le même espace probabilisé fini. Alors
En particulier, pour deux variables, .
Si les variables sont deux à deux indépendantes, alors
Démonstration. Posons . D'après le point 2 de la propriété précédente, , et la bilinéarité permet de développer cette covariance comme on développerait un produit :
Séparons les termes diagonaux des autres. Pour , on obtient , ce qui donne la première somme. Pour , les couples et apparaissent tous les deux et contribuent de façon égale, par symétrie de la covariance : leur contribution totale est pour chaque paire avec . D'où la formule. Si enfin les variables sont deux à deux indépendantes, toutes les covariances d'indices distincts sont nulles, et il ne reste que la somme des variances.
Remarque
Une hypothèse mérite d'être soulignée : l'indépendance deux à deux suffit, l'indépendance mutuelle n'est pas nécessaire. C'est un des rares endroits du programme où la distinction joue en notre faveur, et un énoncé qui exigerait l'indépendance mutuelle serait inutilement fort. Retenez surtout que, contrairement à l'espérance, la variance n'est pas linéaire : sans hypothèse, , le terme correctif étant la covariance. Cas extrême : , alors que .
Exemple
La variance de la loi binomiale, en deux lignes. Reprenons , somme des indicatrices de succès d'un schéma de Bernoulli. Ces variables sont mutuellement indépendantes par construction du modèle, donc en particulier deux à deux indépendantes, et chacune a pour variance . D'où
ce qui redonne, sans aucun calcul de somme, le résultat obtenu plus haut par la formule du pivot.
Exemple
Retour aux points fixes d'une permutation. Reprenons muni de l'équiprobabilité, avec , et le nombre de points fixes, où est l'événement « ». Ici les indicatrices ne sont pas indépendantes, il faut donc les covariances.
Pour , les permutations fixant à la fois et sont en bijection avec les permutations des autres entiers, d'où . Comme , on obtient
Chaque indicatrice a pour variance , et il y a paires avec . La formule de la variance d'une somme donne donc
Le nombre de points fixes d'une permutation aléatoire a donc pour espérance et pour variance , quel que soit . Aucune loi n'a été calculée.
Coefficient de corrélation
Propriété
Soient et deux variables aléatoires de variances non nulles. Alors
et l'on appelle coefficient de corrélation de et le réel
Démonstration. Pour tout réel , la variable a une variance positive, et la formule de la variance d'une somme donne
en utilisant et . Le membre de droite est un trinôme du second degré en , de coefficient dominant , qui reste positif ou nul pour toute valeur de . Son discriminant est donc négatif ou nul :
c'est-à-dire . En prenant la racine carrée, on obtient l'inégalité annoncée, et la définition de donne alors .
Remarque
Le coefficient de corrélation est la covariance rendue sans unité : il ne change pas si l'on multiplie ou par une constante positive, alors que la covariance, elle, est multipliée. C'est donc lui, et non la covariance, qui permet de comparer l'intensité du lien affine entre deux couples de variables différents. Deux variables indépendantes ont un coefficient de corrélation nul ; la réciproque reste fausse, pour la même raison que pour la covariance.
Inégalités et loi faible des grands nombres
Inégalité de Markov
Propriété
Inégalité de Markov. Soit une variable aléatoire positive sur un espace probabilisé fini. Alors, pour tout réel ,
Démonstration. Toutes les valeurs de sont positives. Partageons la somme définissant l'espérance selon que la valeur est ou non supérieure ou égale à :
La première somme est positive, comme somme de termes positifs, donc on la minore par , ce qui donne . Dans la somme restante, chaque valeur vérifie , donc chaque terme se minore par :
la dernière égalité étant la décomposition de l'événement suivant les valeurs de . Comme , on peut diviser.
Remarque
L'hypothèse de positivité est essentielle : sans elle, la première somme pourrait être négative et la minoration par tomberait. Notez aussi que l'inégalité n'a d'intérêt que si , faute de quoi le majorant dépasse et ne dit rien. L'énoncé se retient sous forme parlante : une variable positive ne peut pas dépasser souvent plusieurs fois sa moyenne. Si le nombre moyen de pièces défectueuses produites en une journée est , la probabilité d'en produire au moins est majorée par , et ce sans rien savoir d'autre sur la production.
Inégalité de Bienaymé-Tchebychev
Propriété
Inégalité de Bienaymé-Tchebychev. Soit une variable aléatoire sur un espace probabilisé fini. Alors, pour tout réel ,
Démonstration. Posons . C'est une variable aléatoire positive, d'espérance par définition de la variance. Comme , l'équivalence , valable pour tout réel , donne l'égalité d'événements
et l'inégalité de Markov appliquée à et au seuil donne alors
Remarque
En écrivant avec et , l'inégalité prend une forme universelle :
Autrement dit, quelle que soit la loi, une variable s'écarte de sa moyenne de plus de deux écarts-types avec une probabilité inférieure à , et de plus de trois écarts-types avec une probabilité inférieure à . Pour , l'inégalité ne dit rien.
Exemple
Une majoration grossière mais universelle. Soit , par exemple le nombre de piles obtenus en lancers d'une pièce équilibrée. Alors et , donc , et l'inégalité de Bienaymé-Tchebychev donne
La vraie valeur de la première probabilité est très inférieure à , mais son calcul exact exige la somme d'une soixantaine de coefficients binomiaux. C'est tout l'intérêt de l'inégalité : elle est grossière, mais elle ne demande que l'espérance et la variance, et elle s'applique à n'importe quelle loi, connue ou non.
Loi faible des grands nombres
Propriété
Loi faible des grands nombres. Soient et des variables aléatoires sur un même espace probabilisé fini, deux à deux indépendantes et de même loi, d'espérance commune et de variance commune . Posons
Alors , , et pour tout réel ,
Démonstration. Notons , de sorte que . Espérance. Par linéarité, , donc . Variance. Les variables étant deux à deux indépendantes, toutes les covariances sont nulles et la variance de la somme est la somme des variances : . La formule avec donne alors
Majoration. Appliquons l'inégalité de Bienaymé-Tchebychev à la variable , dont l'espérance vaut , avec le seuil :
Remarque
Voici enfin justifiée l'intuition dont ce chapitre est parti. Pour fixé, le majorant tend vers quand grandit : la probabilité que la moyenne observée s'écarte de plus de de l'espérance devient aussi petite que l'on veut, pourvu que l'on répète l'expérience assez de fois. C'est ce que l'on appelle la convergence en probabilité de vers . Le cas des indicatrices donne l'interprétation fréquentiste. Si où est la réalisation d'un même événement de probabilité à la -ième répétition, alors est la fréquence d'apparition de l'événement au cours des répétitions, et . L'inégalité devient
la dernière majoration venant de . La fréquence observée se rapproche donc de la probabilité, ce qui ferme la boucle : la théorie construite à partir de deux axiomes redonne bien le phénomène empirique qu'elle prétendait modéliser.
Exemple
Un sondage. On souhaite estimer la proportion inconnue d'électeurs favorables à une mesure, en interrogeant personnes choisies indépendamment les unes des autres. La fréquence observée estime , et l'on veut que l'erreur dépasse points, soit , avec une probabilité inférieure à . La majoration ci-dessus donne une condition suffisante :
donc suffit. À l'inverse, avec l'échantillon de personnes qu'utilisent réellement les instituts, l'inégalité ne garantit que
Une majoration à n'est évidemment pas ce qu'annoncent les instituts : c'est le signe que Bienaymé-Tchebychev, universelle, est très pessimiste dès que l'on connaît la loi. Obtenir une majoration réaliste demande des outils plus fins, hors de portée de ce cours.
Méthodes à retenir
Méthode
1. Poser l'univers et choisir son modèle.
Avant tout calcul, écrire explicitement et dire quelle probabilité on met dessus, puis trancher deux questions.
L'ordre compte-t-il ? Un tirage « successif » impose un modèle ordonné, un tirage « simultané » un modèle non ordonné. Les deux sont souvent licites et donnent la même réponse ; l'interdit absolu est de compter les cas favorables dans un modèle et les cas possibles dans l'autre. Y a-t-il équiprobabilité ? Elle se justifie par la symétrie du dispositif et doit être posée. Le réflexe qui sauve : choisir le modèle qui la rend vraie, quitte à rendre les objets discernables artificiellement, par exemple en numérotant des boules de même couleur.
Méthode
2. Décomposer selon un système complet.
Dès qu'une expérience se déroule en étapes, ou qu'un paramètre inconnu conditionne la suite, appliquer la formule des probabilités totales avec le système complet des cas possibles à la première étape.
Rédaction type, à reproduire : « La famille est un système complet d'événements de probabilités non nulles, donc . » Puis on remplace par les données de l'énoncé. Contrôle : la somme des poids issus d'un même nœud de l'arbre doit valoir , et la somme des probabilités de tous les chemins aussi.
Méthode
3. Retourner un conditionnement par Bayes.
Signalement : l'énoncé donne les probabilités des causes et les probabilités des effets sachant la cause, puis demande la probabilité d'une cause sachant l'effet observé. C'est exactement la situation de Bayes.
Marche à suivre : nommer les événements, écrire ce que l'on cherche sous la forme , écrire , calculer le dénominateur par les probabilités totales, conclure. Ne jamais confondre et : c'est l'erreur que le calcul du dépistage sanctionne, et l'écart entre les deux peut être d'un facteur vingt.
Méthode
4. Reconnaître, ou réfuter, un schéma binomial.
Trois conditions, toutes nécessaires : un nombre d'épreuves fixé à l'avance ; des épreuves identiques, donc de même probabilité de succès ; des épreuves mutuellement indépendantes.
Rédaction type : « Les épreuves sont identiques et indépendantes, chacune ayant la probabilité de succès, et compte les succès : donc . » Les deux réfutations classiques sont le tirage sans remise, qui casse l'identité des épreuves, et l'expérience répétée « jusqu'à obtenir un succès », dont le nombre d'épreuves n'est pas fixé et qui sort d'ailleurs du cadre fini de ce chapitre.
Méthode
5. Décomposer en somme d'indicatrices.
À employer dès que la variable compte quelque chose, et en particulier chaque fois que le calcul de la loi paraît hors de portée. Pour l'espérance : écrire , vérifier l'égalité issue par issue, puis . Aucune indépendance requise.
Pour la variance : utiliser , avec et , cette dernière formule venant de . Ici, en revanche, il faut calculer les probabilités des intersections.
Méthode
6. Calculer une loi en passant par .
Signalement : est un maximum, ou plus généralement une variable pour laquelle l'événement se traduit par une condition simple portant sur toutes les composantes.
Procédé : calculer , puis , en justifiant par la décomposition , réunion incompatible. Pour un minimum, passer au contraire : se traduit aussi par une condition sur toutes les composantes, et . Contrôle final obligatoire : la somme des doit valoir .
Méthode
7. Majorer une probabilité sans connaître la loi.
Si la variable est positive et que l'on ne dispose que de son espérance : inégalité de Markov, . Si l'on dispose de l'espérance et de la variance, et que l'événement s'écrit comme un écart à la moyenne : inégalité de Bienaymé-Tchebychev, . Si la question porte sur une moyenne de variables de même loi, deux à deux indépendantes : loi faible des grands nombres, c'est-à-dire Bienaymé-Tchebychev appliquée à , dont la variance vaut .
Deux réflexes de rédaction. D'abord, vérifier le signe de la variable avant d'invoquer Markov. Ensuite, si le majorant obtenu dépasse , ne pas conclure : l'inégalité est vraie mais vide, il faut un autre seuil ou une autre méthode.
Méthode
8. Le tableau des trois lois usuelles.
| Loi | ||||
|---|---|---|---|---|
| si , si | ||||
Ces cinq colonnes doivent être sues sans hésitation, ainsi que les trois situations qui les produisent : un choix au hasard parmi objets, une épreuve à deux issues, et le comptage des succès dans épreuves identiques et indépendantes. Contrôles de cohérence utiles : redonne ; la variance de est maximale pour et nulle pour ; l'espérance d'une loi uniforme est le milieu de l'intervalle des valeurs.
Bloqué sur « Probabilités » ?
On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.