Maths compl. · Chapitre 11 · Thème d'étude · Probabilités et statistique
Probabilités conditionnelles et inférence bayésienne
Formule de Bayes, probabilités a priori et a posteriori, tests diagnostiques (porté par le thème d'étude officiel « Inférence bayésienne »).
Sommaire
Ce qu'il faut savoir faire
- Formule de Bayes
- Probabilités a priori et a posteriori
- Tests diagnostiques (porté par le thème d'étude officiel « Inférence bayésienne »)
En 1763, la Royal Society de Londres publie un mémoire posthume au titre austère : An Essay towards solving a Problem in the Doctrine of Chances. Son auteur, Thomas Bayes, pasteur presbytérien d'une petite ville d'eaux anglaise, était mort deux ans plus tôt sans avoir rien fait paraître de ses travaux mathématiques ; c'est son ami Richard Price qui retrouva le manuscrit dans ses papiers et en devina la portée. La question qu'y pose Bayes paraît anodine, mais elle inverse le sens habituel du calcul des probabilités. D'ordinaire, on connaît la cause et l'on calcule l'effet : sachant que l'urne contient trois boules rouges et sept vertes, quelle est la probabilité de tirer une rouge ? Bayes ose le chemin inverse : j'ai tiré une boule rouge — que puis-je en conclure sur l'urne dont elle provient ? Raisonner des effets vers les causes : tout le programme tient dans ce renversement, et une formule de deux lignes suffit à l'accomplir.
Ce renversement est aujourd'hui partout. Le médecin n'observe jamais la maladie elle-même, seulement ses effets — une fièvre, un résultat de test — et doit remonter à la cause ; le filtre anti-spam lit les mots d'un message et estime la probabilité qu'il soit indésirable ; le tribunal pèse un indice matériel et s'interroge sur la culpabilité. Dans chacune de ces situations se cache le même piège : confondre la probabilité de l'effet sachant la cause avec la probabilité de la cause sachant l'effet. Un test médical fiable à ne garantit nullement qu'une personne testée positive soit malade à — nous verrons que la vraie valeur peut descendre sous les . Distinguer ces deux nombres, et savoir passer de l'un à l'autre, est l'objectif central de ce chapitre.
La route est balisée. Nous réviserons d'abord les probabilités conditionnelles de première — définition, arbres pondérés, tableaux croisés — puis nous donnerons un nom et un énoncé à une règle que l'arbre appliquait déjà en silence : la formule des probabilités totales. Viendra alors la formule de Bayes, qui inverse le conditionnement, avec son vocabulaire propre : probabilité a priori, probabilité a posteriori. Nous l'appliquerons au terrain où elle est la plus spectaculaire, les tests de dépistage médicaux, avant de confier à Python le soin de vérifier nos calculs par simulation.
Probabilité conditionnelle et arbres pondérés
Une information partielle modifie les probabilités. Considérons les élèves d'une classe de terminale, répartis selon le sexe et le choix de l'option latin :
| Latinistes | Non latinistes | Total | |
|---|---|---|---|
| Filles | |||
| Garçons | |||
| Total |
On choisit un élève au hasard et l'on note l'événement « l'élève est une fille » et l'événement « l'élève est latiniste ». Sans autre information, . Mais supposons qu'on nous apprenne que l'élève choisi est latiniste : l'univers se rétrécit aux latinistes de la première colonne, parmi lesquels filles. La probabilité que l'élève soit une fille, sachant qu'il est latiniste, vaut donc . Observons le calcul de plus près : . Conditionner, c'est diviser la probabilité de l'intersection par la probabilité de l'information reçue. Cette observation devient la définition générale.
Définition
Soient et deux événements d'un même univers, avec . La probabilité conditionnelle de sachant est le nombre
La notation se lit « probabilité de sachant » : l'indice désigne l'information dont on dispose, la parenthèse l'événement dont on évalue la chance. Sur l'exemple, , tandis que : parmi les latinistes, trois quarts sont des filles, mais seule la moitié des filles est latiniste. Les deux nombres répondent à des questions différentes, et rien ne les oblige à coïncider — nous y reviendrons longuement. Notons enfin que se comporte comme une probabilité ordinaire sur l'univers restreint : en particulier .
En multipliant la définition par , on obtient une formule de produit, si utile qu'elle mérite son propre encadré.
Propriété
Formule des probabilités composées. Pour tous événements et de probabilités non nulles :
Cette formule est le moteur des arbres pondérés. Un arbre représente une expérience en étapes : les branches issues de la racine portent les probabilités des premiers événements possibles, celles du deuxième niveau portent des probabilités conditionnelles, calculées sachant le chemin déjà parcouru.
Sur la figure, la racine se scinde en et , avec les poids et ; puis chaque nœud se scinde en et , avec les poids conditionnels , , et . Les règles d'usage de l'arbre découlent toutes de la définition et de la formule des probabilités composées.
Méthode
Règles de l'arbre pondéré.
- La somme des probabilités portées par les branches issues d'un même nœud vaut .
- Les poids des branches situées après le premier niveau sont des probabilités conditionnelles, sachant les événements du chemin déjà parcouru.
- La probabilité d'un chemin — c'est-à-dire de l'intersection des événements rencontrés — est le produit des probabilités inscrites sur ses branches.
- La probabilité d'un événement est la somme des probabilités de tous les chemins qui y aboutissent.
Exemple
Un sac contient jetons indiscernables au toucher : rouges et verts. On tire successivement et sans remise deux jetons. Notons « le premier jeton est rouge » et « le second jeton est rouge ». Construisons l'arbre : au premier niveau, et . Au second niveau, les poids dépendent du premier tirage : si un rouge est sorti, il reste rouge parmi jetons, donc ; si un vert est sorti, il reste rouges parmi , donc .
Probabilité de deux jetons rouges (règle du produit) :
Probabilité que le second jeton soit rouge (somme des chemins menant à ) :
On trouve : avant toute information sur le premier tirage, le second jeton a exactement les mêmes chances d'être rouge que le premier. L'arbre le démontre sans effort, là où l'intuition hésite.
Arbre et tableau croisé racontent la même histoire sous deux formes : les effectifs du tableau, divisés par le total, donnent les probabilités des intersections — c'est-à-dire des chemins — et les fréquences calculées ligne par ligne ou colonne par colonne sont les probabilités conditionnelles. Savoir passer d'une représentation à l'autre est une compétence exigible : le tableau rend visibles toutes les intersections d'un coup, l'arbre suit la chronologie de l'expérience.
Méthode
Lire une probabilité conditionnelle dans un tableau croisé.
- Identifier l'événement conditionnant : c'est lui qui désigne la ligne ou la colonne dans laquelle on s'enferme.
- Prendre pour dénominateur le total de cette ligne ou colonne — et non le total général du tableau.
- Prendre pour numérateur l'effectif de la case correspondant à l'événement dont on cherche la probabilité.
- Vérifier la cohérence : changer l'événement conditionnant change le dénominateur, donc en général le résultat — c'est toute la différence entre et .
Sur le tableau de la classe, chercher enferme dans la colonne des latinistes (total , dont filles : ), tandis que chercher enferme dans la ligne des filles (total , dont latinistes : ). Même case au numérateur, dénominateurs différents : les deux conditionnements ne se confondent que si les deux totaux coïncident, ce qui n'a aucune raison de se produire.
Terminons cette remise en route par l'indépendance, rencontrée en première. Deux événements sont indépendants lorsque la réalisation de l'un ne modifie pas la probabilité de l'autre — autrement dit, lorsque conditionner ne change rien.
Propriété
Indépendance (rappel de première). Deux événements et de probabilités non nulles sont indépendants lorsque
Cela équivaut à , et aussi à .
L'équivalence se vérifie en une ligne : si , alors , et réciproquement la formule des probabilités composées donne . Dans notre classe, : les événements et ne sont pas indépendants, savoir que l'élève est latiniste rend plus probable que ce soit une fille.
La formule des probabilités totales
La quatrième règle de l'arbre — sommer les chemins — mérite mieux qu'un numéro : c'est un théorème, et l'un des plus utiles du chapitre. Son cadre naturel est celui d'une partition de l'univers : une famille d'événements de probabilités non nulles, deux à deux incompatibles, et dont la réunion est l'univers tout entier. La partition la plus simple est : quoi qu'il arrive, l'un exactement des deux événements et se réalise. C'est elle que dessine tout arbre à deux branches initiales.
Propriété
Formule des probabilités totales. Soit un événement tel que . Pour tout événement :
Plus généralement, si est une partition de l'univers :
La démonstration se lit sur l'arbre. L'événement se réalise soit avec , soit avec , et jamais les deux à la fois : est la réunion des deux événements incompatibles et , donc . Il reste à écrire chaque intersection avec la formule des probabilités composées : ce sont exactement les deux chemins de l'arbre qui aboutissent à . Le cas d'une partition en trois événements se démontre de la même façon, avec un arbre à trois branches initiales.
Exemple
Une usine fabrique des pièces sur deux machines. La machine assure de la production et produit de pièces défectueuses ; la machine assure les restants et produit de pièces défectueuses. On prélève une pièce au hasard dans la production et l'on note « la pièce provient de la machine », « la pièce provient de la machine » et « la pièce est défectueuse ».
L'énoncé donne les poids de l'arbre : , , puis et . La formule des probabilités totales fournit la proportion globale de pièces défectueuses :
L'usine produit donc de pièces défectueuses. Remarquons que ce taux global est compris entre les taux des deux machines, et : c'est une moyenne pondérée des taux, les poids étant les parts de production. Une probabilité totale qui sortirait de cette fourchette signalerait une erreur de calcul.
Le cas d'une partition en trois événements se traite exactement de la même manière : l'arbre a simplement trois branches initiales, et l'on somme trois chemins au lieu de deux.
Exemple
Partition en trois événements. Un magasin d'électroménager s'approvisionne en ampoules auprès de trois fournisseurs. Le fournisseur livre du stock, avec d'ampoules défectueuses ; le fournisseur livre du stock, avec de défectueuses ; le fournisseur livre les restants, avec de défectueuses. On prélève une ampoule au hasard dans le stock ; les événements , , forment une partition de l'univers, et l'on note « l'ampoule est défectueuse ».
Le stock contient d'ampoules défectueuses. Détaillons les trois contributions : , et . Le fournisseur , qui ne livre qu'un cinquième du stock, est celui qui apporte le plus de défauts — son taux élevé l'emporte sur sa faible part. Chiffrer précisément la part de responsabilité de chaque fournisseur dans les ampoules défectueuses, c'est déjà une question d'inversion : elle attend la section suivante.
La formule des probabilités totales répond à la question « quelle est la probabilité de l'effet ? » quand on connaît les causes possibles et leur influence. La section suivante pose la question inverse — et c'est là que Bayes entre en scène.
Inverser le conditionnement : la formule de Bayes
Un arbre pondéré se construit dans le sens de la chronologie : d'abord la cause (la machine, l'urne, la maladie), puis l'effet (le défaut, la couleur, le test). Les probabilités conditionnelles qu'il porte vont donc des causes vers les effets : , la probabilité qu'une pièce soit défectueuse sachant sa machine d'origine, se lit directement sur une branche. Mais la question pratique est presque toujours inverse : la pièce prélevée est défectueuse — de quelle machine provient-elle ? On demande , qui ne figure sur aucune branche de l'arbre. Il faut remonter l'arbre à contre-courant, et c'est précisément ce que permet la formule de Bayes.
Propriété
Formule de Bayes. Soient et deux événements de probabilités non nulles. Alors
où le dénominateur se calcule, si nécessaire, par la formule des probabilités totales : .
La démonstration tient en deux lignes. La formule des probabilités composées, écrite dans les deux sens, donne une double expression du même nombre :
Il suffit de diviser l'égalité de droite par pour isoler . Toute la profondeur du résultat tient dans cette symétrie : l'intersection ne distingue pas ses deux facteurs, et sert de pont entre les deux conditionnements.
Le vocabulaire consacré souligne le rôle du temps et de l'information.
Définition
Dans le calcul de par la formule de Bayes :
- est la probabilité a priori de : celle qu'on attribue à avant de disposer de l'information ;
- est la probabilité a posteriori de : celle qu'on lui attribue après avoir appris que est réalisé.
La formule de Bayes décrit comment une information actualise une probabilité : c'est le principe de l'inférence bayésienne.
Reprenons l'usine de la section précédente : la pièce prélevée est défectueuse, quelle est la probabilité qu'elle provienne de la machine ? A priori, . A posteriori :
La machine ne fabrique que des pièces, mais elle est responsable de des défauts : l'information « la pièce est défectueuse » a fait grimper la probabilité de à . C'est exactement ainsi qu'un contrôleur qualité oriente ses vérifications.
En pratique, le calcul suit toujours le même chemin, que l'on peut résumer d'une formule : une probabilité a posteriori est le quotient du chemin favorable par la somme des chemins compatibles avec l'observation.
Méthode
Calculer une probabilité a posteriori .
- Construire l'arbre pondéré dans le sens chronologique de l'expérience : les causes d'abord ( et ), l'effet observé ensuite ( et ).
- Calculer par la formule des probabilités totales : c'est la somme des probabilités des chemins de l'arbre qui aboutissent à .
- Repérer le chemin favorable, celui qui passe par : sa probabilité est .
- Conclure par la formule de Bayes : , quotient du chemin favorable par la somme des chemins.
- Contrôler la vraisemblance du résultat : doit appartenir à , et l'on doit avoir .
Avant d'appliquer la méthode, arrêtons-nous sur l'erreur que la formule de Bayes permet d'éviter — la plus répandue de tout le calcul des probabilités : confondre et . Ces deux nombres répondent à des questions différentes, et ils peuvent être arbitrairement éloignés l'un de l'autre. Un exemple suffit à s'en convaincre : en France, plus de des centenaires sont des femmes. En notant « être centenaire » et « être une femme », cela s'écrit . Faut-il en conclure que , autrement dit que plus de des femmes sont centenaires ? Évidemment non : les centenaires forment une infime partie de la population, et la probabilité qu'une femme prise au hasard soit centenaire est minuscule. L'inversion brutale des deux conditionnements produit une absurdité ici visible à l'œil nu — mais dans un prétoire ou un cabinet médical, où les ordres de grandeur sont moins familiers, la même confusion passe inaperçue et fausse des décisions graves. La formule de Bayes est le seul passage légitime de à : elle exige de connaître aussi et , et c'est précisément ce que l'inversion naïve oublie.
Exemple
De quelle urne vient la boule ? Deux urnes sont posées sur une table. L'urne contient boules rouges et verte ; l'urne contient boule rouge et vertes. On lance un dé équilibré : si le dé donne , on tire une boule dans l'urne ; sinon, on tire dans l'urne . La boule tirée est rouge. Quelle est la probabilité qu'elle provienne de l'urne ?
Notons « le tirage a lieu dans l'urne » et « la boule tirée est rouge ». L'arbre se construit dans le sens de l'expérience : et , puis et .
Probabilité de l'effet (probabilités totales) :
Remontée vers la cause (formule de Bayes) :
A priori, l'urne n'avait qu'une chance sur six d'être choisie : . La couleur observée, bien plus fréquente dans l'urne , fait bondir cette probabilité à : l'information « la boule est rouge » a presque triplé la plausibilité de l'urne , sans toutefois la rendre majoritaire — le dé lui était trop défavorable au départ. On vérifie au passage que : sachant la boule rouge, elle vient bien de l'une des deux urnes.
Ce mécanisme — une opinion initiale chiffrée, une observation, une opinion révisée — est le cœur du raisonnement bayésien. Le terrain où il se déploie avec le plus d'enjeux est la médecine, et c'est là que nous l'emmenons maintenant.
Tests de dépistage : le raisonnement bayésien en médecine
Un test de dépistage est un instrument de mesure binaire : appliqué à une personne, il rend un résultat positif (le test signale la maladie) ou négatif (il ne la signale pas). Comme tout instrument, il se trompe parfois, et dans deux sens possibles. Le vocabulaire médical distingue soigneusement les quatre situations, selon l'état réel de la personne et la réponse du test. Notons l'événement « la personne est malade » et l'événement « le test est positif ».
Définition
Pour une personne soumise au test :
- un vrai positif est une personne malade dont le test est positif () ;
- un faux négatif est une personne malade dont le test est négatif () ;
- un faux positif est une personne saine dont le test est positif () ;
- un vrai négatif est une personne saine dont le test est négatif ().
Les qualités du test se mesurent par quatre probabilités conditionnelles :
- la sensibilité : probabilité que le test soit positif sachant que la personne est malade ;
- la spécificité : probabilité que le test soit négatif sachant que la personne est saine ;
- la valeur prédictive positive (VPP) : probabilité que la personne soit malade sachant que son test est positif ;
- la valeur prédictive négative (VPN) : probabilité que la personne soit saine sachant que son test est négatif.
Le tableau suivant résume la question à laquelle répond chaque indicateur — et le sens de son conditionnement.
| Indicateur | Notation | Question posée | Sens du conditionnement |
|---|---|---|---|
| Sensibilité | Le test détecte-t-il bien les malades ? | de l'état vers le test | |
| Spécificité | Le test épargne-t-il bien les personnes saines ? | de l'état vers le test | |
| VPP | Un résultat positif est-il fiable ? | du test vers l'état | |
| VPN | Un résultat négatif est-il fiable ? | du test vers l'état |
Sensibilité et spécificité sont des caractéristiques intrinsèques du test : le laboratoire les mesure une fois pour toutes, sur des populations dont l'état est connu. Mais le patient et son médecin, eux, ne connaissent que le résultat du test : ce qui les intéresse, ce sont les valeurs prédictives — des conditionnements inversés. Le passage des unes aux autres est un pur exercice de formule de Bayes, et son résultat dépend d'un troisième nombre que le test ignore : la prévalence de la maladie, c'est-à-dire la proportion de malades dans la population testée.
Exemple
Une maladie touche d'une population : . On dispose d'un test de sensibilité et de spécificité : et , donc — un dixième des personnes saines déclenche un faux positif. Une personne prise au hasard dans la population est testée positive : quelle est la probabilité qu'elle soit réellement malade ?
Probabilité d'un test positif (probabilités totales, en suivant l'arbre ci-dessous) :
Valeur prédictive positive (formule de Bayes) :
Une personne testée positive n'a qu'environ de risque d'être malade. La valeur prédictive négative, elle, est excellente :
Le résultat mérite qu'on s'y arrête, car il heurte l'intuition de plein fouet : un test « fiable à » rend des verdicts positifs qui ne sont corrects que dans des cas. Il n'y a pourtant aucun paradoxe, et un raisonnement en effectifs le montre. Imaginons personnes testées : sont malades et sont saines. Parmi les malades, le test en détecte — les vrais positifs. Mais parmi les personnes saines, il en alarme à tort , soit faux positifs. Le tableau croisé rassemble ces effectifs :
| Test positif | Test négatif | Total | |
|---|---|---|---|
| Malades | |||
| Sains | |||
| Total |
Sur les tests positifs, seuls désignent de vrais malades : , et l'on retrouve la VPP. La maladie est si rare que les malades bien détectés sont noyés sous les faux positifs venus de l'immense majorité saine : contre , plus de dix fois plus. La sensibilité de répond à la question « le test voit-il les malades ? » ; elle ne dit rien de la question du patient, « suis-je malade ? ». Confondre les deux, c'est confondre et — l'erreur d'inversion contre laquelle tout ce chapitre nous arme. En pratique, un dépistage positif dans une population à faible prévalence n'est jamais un diagnostic : c'est un signal, que l'on confirme par un second test plus spécifique.
Cette analyse suggère que la VPP dépend crucialement de la prévalence. Rendons cette dépendance explicite : notons la proportion de malades, avec , en conservant la sensibilité et la spécificité . Le calcul mené plus haut se refait à l'identique avec à la place de :
la dernière écriture s'obtenant en multipliant numérateur et dénominateur par . Voilà une fonction rationnelle sur , que les outils d'étude de fonctions analysent sans peine. Sa dérivée se calcule par la formule du quotient :
La fonction est donc strictement croissante sur , de à : plus la maladie est répandue dans la population testée, plus un résultat positif est digne de confiance. Quelques valeurs fixent les idées :
| Prévalence | |||||
|---|---|---|---|---|---|
La courbe grimpe très vite au voisinage de — la dérivée y vaut — puis s'infléchit en s'approchant de . La leçon de santé publique est directe : le même test, appliqué à la population générale (, VPP ) ou à des patients que leurs symptômes désignent déjà (, VPP ), ne fournit pas du tout la même information. C'est pourquoi on réserve souvent les dépistages aux populations à risque : cibler la population testée, c'est augmenter , donc la valeur d'un résultat positif.
Simuler pour estimer une probabilité conditionnelle
Les calculs de la section précédente reposent sur la formule de Bayes ; le programme invite à les contrôler par une tout autre voie, la simulation. Le principe est celui de la loi des grands nombres, déjà rencontrée : quand on répète une expérience aléatoire un grand nombre de fois, la fréquence observée d'un événement se rapproche de sa probabilité. Pour une probabilité conditionnelle, on adapte l'idée : la fréquence de parmi les seules expériences où s'est réalisé — une fréquence conditionnelle — estime .
Simulons le test de dépistage. La fonction random() du module random renvoie un réel aléatoire de , uniformément réparti : la comparaison random() < p est donc vraie avec la probabilité , ce qui suffit à imiter chaque branche de l'arbre. Pour chaque individu virtuel, on tire d'abord son état (malade avec la probabilité ), puis le résultat de son test, avec la probabilité conditionnelle correspondant à son état — l'ordre des tirages suit exactement la chronologie de l'arbre.
from random import random
def estimer_vpp(n):
positifs = 0
malades_positifs = 0
for k in range(n):
malade = random() < 0.01
if malade:
test_positif = random() < 0.95
else:
test_positif = random() < 0.10
if test_positif:
positifs = positifs + 1
if malade:
malades_positifs = malades_positifs + 1
return malades_positifs / positifs
La fonction renvoie le quotient du nombre de vrais positifs par le nombre total de positifs : c'est la fréquence conditionnelle de sachant dans l'échantillon simulé. L'appel estimer_vpp(100000) renvoie des valeurs voisines de 0.088, différentes à chaque exécution puisque le hasard s'en mêle — en parfait accord avec la VPP calculée, .
Deux observations pour finir. D'abord, l'estimation n'utilise qu'une partie de l'échantillon : sur individus simulés, environ seulement sont testés positifs, soit environ — c'est sur eux seuls que la fréquence est calculée, et il faut donc choisir assez grand pour que ce sous-échantillon soit lui-même fourni. Ensuite, la simulation reproduit fidèlement la structure du raisonnement bayésien : le programme engendre les individus des causes vers les effets (l'état, puis le test), exactement comme l'arbre ; et c'est le simple comptage conditionnel, à la fin, qui inverse le conditionnement — sans qu'aucune formule n'ait été écrite. La fréquence conditionnelle est à ce que la fréquence ordinaire est à une probabilité : son ombre expérimentale, que la loi des grands nombres rapproche de la vraie valeur.
Résumons le chemin parcouru. La probabilité conditionnelle chiffre l'effet d'une information sur une probabilité ; les arbres pondérés et les tableaux croisés la font calculer d'un trait, et l'indépendance est le cas où l'information ne change rien. La formule des probabilités totales assemble la probabilité d'un effet à partir de ses causes possibles : . La formule de Bayes, , remonte l'arbre à contre-courant et transforme une probabilité a priori en probabilité a posteriori : c'est l'inférence bayésienne. Appliquée aux tests de dépistage, elle sépare ce que mesure le laboratoire — sensibilité , spécificité — de ce que veut savoir le patient — les valeurs prédictives et — et révèle le rôle décisif de la prévalence, qu'une brève étude de fonction rend limpide. Et lorsque le calcul se complique, la simulation prend le relais : compter, parmi les expériences simulées où l'effet s'est produit, celles où la cause était présente. Deux cent soixante ans après le mémoire de Bayes, ce va-et-vient entre les causes et les effets reste l'un des raisonnements les plus utiles — et les plus subtils — de toutes les mathématiques.
Bloqué sur « Probabilités conditionnelles et inférence bayésienne » ?
On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.