ECG approfondies · Chapitre 15 · Quatrième semestre
Probabilités : convergences et estimation
2e année
Convergence en probabilité, convergence en loi, estimateurs, biais, intervalles de confiance asymptotiques.
Sommaire
Ce qu'il faut savoir faire
- Convergence en probabilité
- Convergence en loi
- Estimateurs
- Biais
- Intervalles de confiance asymptotiques
Tous les chapitres de probabilités rencontrés jusqu'ici travaillent dans le même sens. On se donne une loi, entièrement connue, et l'on en déduit ce qu'il faut s'attendre à observer : une espérance, une variance, la probabilité d'un événement. C'est le sens naturel du calcul des probabilités, et c'est aussi celui que l'on ne rencontre presque jamais dans la vie réelle. Un institut de sondage ne connaît pas la proportion d'électeurs favorables à un candidat : il possède mille réponses. Un assureur ne connaît pas la loi du nombre de sinistres : il possède le relevé des trois dernières années. Le paramètre est inconnu, les observations sont là, et c'est le chemin inverse qu'il faut parcourir.
Ce chapitre construit ce chemin, et il pose pour cela une seule question, sous deux formes. La première est une question de probabilités : que devient une moyenne d'observations quand leur nombre devient grand ? La seconde est une question de statistique : que peut-on affirmer sur un paramètre inconnu à partir d'un échantillon de taille ? La première prépare la seconde, et la seconde donne à la première tout son intérêt.
Deux théorèmes répondent, et ce sont eux qui justifient l'existence même de la statistique. La loi faible des grands nombres, déjà croisée en première année, affirme que la moyenne de observations indépendantes se rapproche de l'espérance commune : elle garantit qu'observer, c'est apprendre quelque chose. Le théorème limite central va beaucoup plus loin. Il décrit la loi de l'erreur commise, et il affirme que cette loi est toujours la même, la loi normale, quelle que soit la loi des observations de départ. C'est ce second théorème qui permet de chiffrer une incertitude, donc de dire « la proportion cherchée est comprise entre et » plutôt que le vague « la fréquence observée est proche de la proportion ».
Le chapitre suit donc un ordre imposé par la logique. On commence par deux inégalités de concentration, celle de Markov et celle de Bienaymé-Tchebychev, qui sont les seuls outils de majoration disponibles quand on ignore tout de la loi. On définit ensuite deux modes de convergence pour une suite de variables aléatoires : la convergence en probabilité, qui dit que les variables se rapprochent d'une limite, et la convergence en loi, qui dit seulement que leurs lois se rapprochent d'une loi limite. La loi faible des grands nombres est un énoncé du premier type, le théorème limite central un énoncé du second. La seconde moitié du chapitre est le versant statistique : estimation ponctuelle d'un paramètre par un estimateur, puis estimation par intervalle de confiance.
Un mot sur ce qui est admis, car ce chapitre en admet plus que les précédents. Le théorème limite central est admis : sa démonstration classique repose sur des outils à valeurs complexes, et les nombres complexes ne figurent plus au programme. Les propriétés opératoires de la convergence en probabilité et de la convergence en loi sont également admises, ainsi que l'implication reliant les deux. Tout le reste se démontre, et se démontre avec un outil unique : l'inégalité de Bienaymé-Tchebychev. Il faut mesurer ce point avant de commencer, car il structure le chapitre entier. La loi faible des grands nombres, le critère de convergence en probabilité, la convergence d'un estimateur, le premier type d'intervalle de confiance : ces quatre résultats sont quatre applications de la même inégalité, écrite quatre fois de suite.
Voici les notations employées dans tout le chapitre.
| Notation | Sens |
|---|---|
| échantillon de taille : variables indépendantes, de même loi que | |
| somme de l'échantillon, | |
| moyenne empirique, | |
| variance empirique, | |
| variance empirique corrigée, | |
| convergence en probabilité | |
| convergence en loi | |
| fonction de répartition de , définie par | |
| , | densité et fonction de répartition de la loi |
| unique réel positif tel que | |
| paramètre inconnu à estimer | |
| estimateur de construit sur un échantillon de taille | |
| biais de l'estimateur, | |
| la variable suit la loi | |
| , , , | lois discrètes usuelles |
| , , | lois à densité usuelles |
| entiers tels que | |
| indicatrice de l'événement | |
| covariance de et | |
| fin de démonstration |
Une mise en garde sur ces notations, car elles se ressemblent au point de se confondre. Le symbole désigne la somme de l'échantillon, et il ne sert que dans les parties consacrées à la loi faible des grands nombres et au théorème limite central. Le symbole , lui, désigne un objet entièrement différent, la variance empirique corrigée, et il ne sert que dans les parties statistiques. En particulier, n'est pas le carré de la somme : c'est un symbole global, qu'il faut lire d'un bloc. Dans la dernière partie, consacrée aux intervalles de confiance, le symbole désignera en revanche l'écart-type empirique corrigé , conformément à l'usage : c'est un troisième objet, distinct de la somme, et le contexte suffit à les séparer puisque la somme ne sert que dans les parties consacrées aux convergences. Aucun calcul ne fait intervenir les deux dans la même ligne, mais la confusion coûte des points chaque année.
Deux inégalités de concentration
Le programme ne fournit que deux outils pour majorer la probabilité qu'une variable aléatoire prenne une valeur « inhabituelle », et ces deux outils ont la même particularité remarquable : ils ne supposent rien de la loi. On ne demande ni qu'elle soit discrète, ni qu'elle soit à densité, ni qu'elle appartienne à une liste de lois usuelles. On demande seulement l'existence d'une espérance, puis d'une variance. C'est à la fois leur force, puisqu'ils s'appliquent partout, et leur faiblesse, puisque les majorations obtenues sont grossières.
Inégalité de Markov
Propriété
Inégalité de Markov. Soit une variable aléatoire positive, c'est-à-dire telle que , admettant une espérance. Alors, pour tout réel ,
Démonstration dans le cas discret. Notons le support de , avec pour tout . Par définition de l'espérance,
série à termes positifs, convergente par hypothèse. Séparons les indices en deux paquets, selon que ou :
la dernière inégalité venant de ce que l'on retire une somme de termes positifs, ce qui ne peut que diminuer le total. C'est ici, et seulement ici, que sert l'hypothèse de positivité de .
Dans la somme restante, chaque vérifie , donc
la dernière égalité provenant de ce que les événements pour sont deux à deux incompatibles et de réunion . Comme , on peut diviser sans changer le sens de l'inégalité, et l'on obtient le résultat annoncé.
Le cas d'une variable à densité. Le raisonnement est identique, la somme étant remplacée par une intégrale. Si est une variable à densité , positive, alors est nulle sur et
toutes les intégrales étant convergentes puisque l'espérance existe. La première inégalité retire une intégrale de fonction positive, la seconde utilise sur le domaine d'intégration.
Deux remarques d'usage. D'abord, l'inégalité n'apporte de l'information que lorsque : sinon le majorant dépasse , et l'on savait déjà qu'une probabilité est majorée par . Ensuite, l'hypothèse de positivité est indispensable et pas seulement technique. Si prend la valeur avec une forte probabilité et la valeur avec une petite probabilité, son espérance peut être négative alors que : la conclusion serait absurde. Appliquer Markov à une variable qui n'est pas positive est l'une des erreurs les plus fréquentes du chapitre.
Exemple
Un standard téléphonique reçoit en moyenne appels par jour. On ne sait rien d'autre : ni la loi du nombre d'appels, ni sa variance. La variable est positive et admet une espérance, donc l'inégalité de Markov s'applique avec :
Il y a donc au plus une chance sur quatre que le standard reçoive au moins mille appels dans la journée. La majoration est faible, et elle est probablement très loin de la réalité, mais elle a été obtenue à partir d'une seule donnée. C'est exactement le type de garantie que l'on cherche lorsqu'on dimensionne une installation sans connaître la loi du trafic.
Pourquoi l'on parle d'inégalités de concentration
Le nom mérite une explication, car il annonce exactement ce que ces inégalités font. Une variable aléatoire est dite concentrée autour d'une valeur lorsqu'elle s'en écarte rarement beaucoup. Une inégalité de concentration est donc un énoncé de la forme « la probabilité de s'écarter de tant est au plus de tant », et l'inégalité de Markov comme celle de Bienaymé-Tchebychev en sont les deux exemplaires les plus simples.
Leur structure est toujours la même : au numérateur une quantité qui mesure la taille ou la dispersion de la variable, au dénominateur le seuil d'écart, élevé à une puissance. Plus le seuil est grand, plus la majoration est petite ; plus la dispersion est grande, plus la majoration est lâche. C'est cette structure qu'il faut retenir, davantage que les formules elles-mêmes, car elle indique tout de suite dans quel sens joue chaque donnée d'un énoncé.
Toute la suite du chapitre repose sur un usage particulier de cette idée : appliquée non pas à une variable isolée, mais à une moyenne de variables, dont la dispersion diminue quand augmente, elle produit une majoration qui tend vers . C'est exactement le mécanisme de la loi faible des grands nombres, et il est déjà entièrement contenu dans l'inégalité suivante.
Inégalité de Bienaymé-Tchebychev
Propriété
Inégalité de Bienaymé-Tchebychev. Soit une variable aléatoire admettant une espérance et une variance . Alors, pour tout réel ,
Démonstration. Posons . Vérifions les hypothèses de l'inégalité de Markov pour cette variable. D'une part, est positive, comme carré d'une variable aléatoire réelle. D'autre part, admet une espérance, et cette espérance vaut , par définition même de la variance, dont l'existence est supposée.
L'inégalité de Markov appliquée à avec le réel , qui est bien strictement positif puisque , donne
Il reste à identifier l'événement du membre de gauche. Pour tout de l'univers, les deux inégalités
sont équivalentes : la fonction racine carrée est croissante sur , les deux membres de la première sont positifs, et . Les deux événements et sont donc égaux, et ils ont a fortiori la même probabilité.
Cette démonstration est exigible, et elle est courte : on pose , on vérifie que est positive d'espérance , on applique Markov avec , on traduit l'événement. Il faut savoir l'écrire de mémoire.
Propriété
Formes équivalentes. Sous les mêmes hypothèses, et pour tout :
Si de plus , alors pour tout réel , en prenant ,
Démonstration. La première forme s'obtient en passant à l'événement contraire : , puis en majorant le second terme. La seconde forme est l'inégalité de départ avec , en remarquant que .
La seconde écriture est la plus parlante, car elle est universelle : le majorant ne dépend plus ni de la loi, ni de l'espérance, ni de l'écart-type, mais du seul nombre d'écarts-types considéré. Quelle que soit la variable aléatoire, la probabilité de s'écarter de son espérance de plus de deux écarts-types est majorée par , celle de s'écarter de plus de trois écarts-types par , celle de s'écarter de plus de dix écarts-types par .
Il faut mesurer à quel point ces bornes sont grossières, et le tableau suivant le montre en comparant le majorant universel à la valeur exacte pour la loi normale, qui est la loi la plus courante.
| majorant | valeur exacte pour | |
|---|---|---|
Le majorant est cinq fois trop grand pour , quarante fois trop grand pour , mille fois trop grand pour . Faut-il en conclure que l'inégalité est inutile ? Certainement pas, et pour une raison simple : la colonne de droite n'existe que si l'on sait que la loi est normale. L'inégalité de Bienaymé-Tchebychev, elle, s'applique à toutes les lois à la fois, y compris à celles que l'on ne connaît pas. Elle ne sert pas à approcher une probabilité, elle sert à la garantir. C'est la différence entre « je pense qu'il y aura peu de défauts » et « je certifie qu'il y en aura moins de tant, quoi qu'il arrive ».
Exemple
Une machine produit des pièces dont la longueur , exprimée en millimètres, a pour espérance et pour écart-type . On ne connaît pas la loi de . Une pièce est déclarée conforme lorsque sa longueur diffère de millimètres de moins de millimètres. L'inégalité de Bienaymé-Tchebychev avec donne
Au plus des pièces sont donc non conformes, et donc au moins sont conformes. Remarquons que millimètres représentent exactement écarts-types, ce qui redonne bien le majorant . Si l'on savait de plus que suit une loi normale, la vraie proportion de pièces non conformes serait de l'ordre de : mille fois plus faible. La garantie obtenue sans hypothèse est donc très prudente, mais elle est incontestable.
Exemple
Les deux inégalités sur le même problème. Une variable aléatoire est positive, d'espérance et d'écart-type . On cherche à majorer .
Par Markov. La variable est positive et , donc
Par Bienaymé-Tchebychev. L'événement s'écrit , et il n'y a pas de valeur absolue : on passe par l'inclusion
puis on applique l'inégalité avec :
Comparaison. La seconde majoration est cinq fois meilleure que la première, et cela n'a rien de surprenant : elle utilise une information de plus, l'écart-type. La règle générale est donc simple. Dès que la variance est connue, Bienaymé-Tchebychev l'emporte sur Markov ; Markov ne sert que lorsque la variance manque, ou lorsque l'énoncé le demande explicitement. On notera cependant que la majoration par Bienaymé-Tchebychev reste ici deux fois trop généreuse, puisqu'elle majore la probabilité d'un écart des deux côtés pour ne conclure que sur un seul.
Méthode
Choisir entre Markov et Bienaymé-Tchebychev. Les deux inégalités ne répondent pas à la même question, et le choix se lit dans l'énoncé.
a. L'énoncé demande de majorer , c'est-à-dire la probabilité d'une grande valeur, et la variable est positive : c'est Markov. C'est aussi le seul choix possible lorsque la variance est inconnue ou n'existe pas.
b. L'énoncé demande de majorer , c'est-à-dire la probabilité d'un écart à l'espérance, et la variance est connue : c'est Bienaymé-Tchebychev. Les formulations qui doivent déclencher ce réflexe sont « s'écarte de plus de », « diffère de sa moyenne d'au moins », « est en dehors de l'intervalle ».
c. L'événement ne comporte pas de valeur absolue, par exemple : on ne peut pas appliquer directement Bienaymé-Tchebychev. On majore d'abord par l'événement symétrisé, en écrivant l'inclusion
puis on applique l'inégalité. On obtient une majoration valable, mais deux fois trop grande pour une loi symétrique.
d. L'énoncé fournit une suite de variables et demande une limite quand : on écrit Bienaymé-Tchebychev, on majore, et l'on conclut par encadrement. C'est le schéma de toute la suite du chapitre.
Dans tous les cas, la rédaction commence par la vérification des hypothèses : positivité pour Markov, existence de la variance pour Bienaymé-Tchebychev. Une inégalité appliquée sans cette phrase préliminaire ne rapporte pas les points.
Convergence en probabilité
Définition
Définition
Soit une suite de variables aléatoires définies sur un même espace probabilisé , et soit une variable aléatoire définie sur ce même espace. On dit que la suite converge en probabilité vers lorsque, pour tout réel ,
On note alors
Le cas de loin le plus fréquent, et le seul qui serve dans la suite du chapitre, est celui où la limite est une constante. Il mérite d'être écrit à part.
Définition
Soit une suite de variables aléatoires et soit un réel. On dit que converge en probabilité vers lorsque, pour tout réel ,
La définition demande une lecture lente, car sa structure logique est inhabituelle. Elle ne dit pas que la suite de nombres converge vers pour un résultat donné : ce serait une convergence de suites réelles, et ce n'est pas ce qui est écrit. Elle dit que, pour un seuil fixé à l'avance, la probabilité de dépasser ce seuil devient arbitrairement petite. Autrement dit, l'écart entre et n'est pas garanti petit : il est seulement de plus en plus improbable d'être grand.
Le passage à l'événement contraire donne une formulation équivalente, souvent plus intuitive :
Elle se lit : « pour grand, il est presque certain que se trouve dans l'intervalle ». C'est cette lecture qu'il faut avoir en tête, et c'est elle qui donnera son sens à l'intervalle de confiance de la dernière partie.
Une dernière remarque de forme. Comme est quelconque, l'inégalité large peut être remplacée par l'inégalité stricte sans changer la définition : la propriété pour tout avec l'une entraîne la propriété pour tout avec l'autre. On rencontrera les deux écritures selon les énoncés, et il n'y a pas lieu de s'en inquiéter.
Ce que la définition ne dit pas
Il est indispensable de comprendre tout de suite ce que la convergence en probabilité n'entraîne pas, faute de quoi on lui fera dire des choses fausses. En particulier, elle n'entraîne aucune convergence des espérances. Le contre-exemple suivant est court et il faut le connaître.
Exemple
Convergence en probabilité et espérance. Pour tout entier , on considère une variable aléatoire dont la loi est donnée par
Ces deux nombres sont bien positifs pour et leur somme vaut : la loi est correctement définie.
La suite converge en probabilité vers . Soit . Pour tout entier , la seule valeur non nulle prise par est , qui dépasse , donc l'événement est exactement l'événement et
La définition est donc vérifiée, et .
Les espérances ne convergent pas vers . Un calcul direct donne
pour tout . La suite est constante égale à , elle converge donc vers , et non vers .
Interprétation. La variable vaut presque toujours , mais quand elle ne vaut pas , elle vaut très grand. La probabilité de l'accident tend vers ; son coût, lui, tend vers l'infini, et les deux se compensent exactement. On calcule d'ailleurs , donc , qui tend vers .
Ce dernier calcul mérite d'être retenu : il montre que le critère par la variance énoncé ci-dessous n'est qu'une condition suffisante. Ici la variance explose, et pourtant la convergence en probabilité a lieu.
Le critère par l'inégalité de Bienaymé-Tchebychev
Voici l'outil numéro un du chapitre. Il transforme une question de convergence en probabilité, qui porte sur des probabilités d'événements, en deux questions de convergence de suites réelles, qui se traitent avec l'analyse de première année.
Propriété
Critère de convergence en probabilité. Soit une suite de variables aléatoires admettant chacune une espérance et une variance, et soit un réel. Si
alors la suite converge en probabilité vers .
Démonstration. Posons et , de sorte que par hypothèse. Soit fixé.
Une inclusion d'événements. Comme , il existe un rang tel que pour tout . Fixons un tel et montrons l'inclusion
Soit un élément du premier événement. L'inégalité triangulaire donne
d'où . L'élément appartient donc au second événement, ce qui établit l'inclusion.
Majoration. La croissance de la probabilité, puis l'inégalité de Bienaymé-Tchebychev appliquée à , qui admet bien une variance, avec le seuil , donnent pour tout :
Conclusion. À fixé, le majorant tend vers puisque . Le théorème d'encadrement donne donc
Ceci valant pour tout , la suite converge en probabilité vers .
Propriété
Cas particulier le plus fréquent. Si pour tout et si , alors . La démonstration se réduit alors à l'application directe de Bienaymé-Tchebychev :
Ce cas particulier est celui de la loi faible des grands nombres, où exactement, et celui de tout estimateur sans biais. Le cas général, avec un biais qui tend vers , sert pour les estimateurs seulement asymptotiquement sans biais. Il faut savoir écrire les deux, mais c'est le second qui est le plus souvent demandé.
Attention enfin : le critère est suffisant, il n'est pas nécessaire. Le contre-exemple de la section précédente le prouve, puisqu'il y avait convergence en probabilité vers avec une variance tendant vers . Si les hypothèses du critère ne sont pas vérifiées, on ne peut donc rien conclure, ni dans un sens ni dans l'autre, et il faut revenir à la définition.
Propriétés opératoires
Les propriétés suivantes sont admises par le programme. Leur démonstration ne présente pas de difficulté conceptuelle, mais elle demande des découpages en et des majorations d'événements assez techniques, sans intérêt pour la suite : c'est la raison pour laquelle elles ne sont pas exigibles. En revanche, leur utilisation l'est, et elle est constante.
Propriété
Opérations sur les limites en probabilité (admises). Soient et deux suites de variables aléatoires définies sur le même espace probabilisé, convergeant en probabilité respectivement vers les variables et , et soit un réel.
a. Somme. .
b. Produit par un réel. .
c. Produit. .
d. Composition par une fonction continue. Si la limite est une constante , c'est-à-dire si , et si est une fonction continue en , alors
Le point d est le plus utile des quatre, et c'est aussi celui que l'on oublie le plus souvent. Il autorise à passer une convergence en probabilité à travers n'importe quelle fonction usuelle, à condition de vérifier la continuité au point limite. En pratique, il se décline ainsi :
a. Si , alors , la fonction carré étant continue sur .
b. Si avec , alors , la fonction inverse étant continue en .
c. Si avec , alors , la fonction racine étant continue en .
d. Si , alors , l'exponentielle étant continue sur .
L'hypothèse dans le point b n'est pas une précaution de style : la fonction inverse n'est pas continue en , et l'énoncé serait faux. C'est exactement ce cas qui se présente lorsqu'on veut estimer le paramètre d'une loi exponentielle par , et l'on prendra soin de dire que la limite de est non nulle.
Exemples
Exemple
a. Une loi exponentielle de paramètre croissant. Soit pour . Alors
Les deux hypothèses du critère sont vérifiées, donc . C'est conforme à l'intuition : une durée de vie de moyenne devient de plus en plus courte.
b. Le maximum d'un échantillon uniforme. Soit et soit un échantillon de la loi . Posons . Pour tout , l'événement signifie que toutes les variables sont inférieures ou égales à , donc par indépendance
La variable est donc à densité, de densité sur et nulle ailleurs. On en tire
La formule de König-Huygens donne alors
le numérateur se simplifiant en . Comme et , puisque le dénominateur est de degré et le numérateur de degré , le critère s'applique :
Le plus grand des tirages finit donc par se coller à la borne supérieure de l'intervalle, ce qui est intuitif et sera réutilisé dans la partie consacrée à l'estimation.
c. Une composition. Reprenons l'exemple b et posons , en supposant . La fonction inverse est continue en , qui est non nul, donc le point d des propriétés opératoires donne
On notera qu'aucun calcul de ni de n'a été nécessaire, et c'est bien là tout l'intérêt de la propriété de composition.
d. Une proportion binomiale. Soit et soit pour tout . Posons . Alors
donc . On reconnaîtra dans la partie suivante que ce n'est rien d'autre que la loi faible des grands nombres appliquée à un échantillon de Bernoulli, puisqu'une variable binomiale est une somme de variables de Bernoulli indépendantes.
Méthode
Montrer qu'une suite converge en probabilité. Trois voies, à essayer dans cet ordre.
1. Le critère par la variance, dans neuf cas sur dix. On calcule et l'on montre qu'elle tend vers la limite candidate ; on calcule et l'on montre qu'elle tend vers ; on conclut par le critère, ou l'on rédige l'inégalité de Bienaymé-Tchebychev si la démonstration est explicitement demandée. Ne jamais oublier de dire que admet une variance avant d'invoquer l'inégalité.
2. Les propriétés opératoires, quand la suite s'écrit à partir d'une autre dont la limite est déjà connue. C'est le cas de tout ce qui est de la forme : on cite la convergence de vers , on vérifie que est continue en , on conclut. Cette voie évite des calculs souvent inextricables, et elle est largement sous-utilisée dans les copies.
3. Le retour à la définition, en dernier recours, lorsque le critère échoue parce que la variance ne tend pas vers ou n'existe pas. On fixe , on identifie explicitement l'événement , on calcule ou l'on majore sa probabilité, et l'on montre que la majoration tend vers . C'est ce que l'on a fait pour le contre-exemple où .
Une erreur de rédaction à éviter : la limite candidate s'annonce avant les calculs, elle ne se découvre pas à la fin. La définition de la convergence en probabilité n'a de sens qu'une fois la limite fixée.
Loi faible des grands nombres
Tout est désormais en place pour démontrer le premier des deux grands théorèmes du chapitre. Son énoncé donne un contenu mathématique précis à une intuition vieille comme le jeu de dés : en répétant longtemps la même expérience, la moyenne des résultats se stabilise.
Énoncé et démonstration
Propriété
Loi faible des grands nombres. Soit une suite de variables aléatoires indépendantes, de même loi, admettant une espérance et une variance . Posons, pour tout entier ,
Alors la suite converge en probabilité vers : pour tout réel ,
Démonstration. Vérifions d'abord que admet une espérance et une variance, puis calculons-les.
Espérance. Chaque admet une espérance, égale à puisque toutes les variables ont la même loi. La linéarité de l'espérance, qui ne demande aucune hypothèse d'indépendance, donne
Variance. Chaque admet une variance, égale à . Les variables étant indépendantes, elles le sont en particulier deux à deux, donc toutes les covariances pour sont nulles et la variance de la somme est la somme des variances. Avec appliqué à , il vient
Application du critère. L'espérance de vaut pour tout , et sa variance tend vers quand , la quantité étant une constante. Le critère de convergence en probabilité s'applique donc, et l'on conclut .
Version détaillée, si l'on veut refaire le critère. Soit . La variable admet une variance, donc l'inégalité de Bienaymé-Tchebychev s'applique et donne
À et fixés, le majorant tend vers , et le théorème d'encadrement conclut.
Cette démonstration est exigible, et elle est régulièrement demandée aux concours. Elle tient en trois lignes de calcul et une application d'inégalité, à condition de ne rien sauter : la linéarité pour l'espérance, l'indépendance pour la variance, l'existence de la variance avant d'invoquer Bienaymé-Tchebychev.
Un point de vigilance sur les hypothèses. L'indépendance sert uniquement dans le calcul de la variance, et l'indépendance deux à deux y suffit. L'hypothèse « même loi » sert deux fois : pour écrire et sans indice. Sans elle, l'énoncé se généralise, mais l'espérance limite n'a plus de raison d'exister.
Le cas de Bernoulli, ou la justification de l'intuition fréquentiste
Propriété
Convergence de la fréquence empirique. On répète, de façon indépendante, une même épreuve dont la probabilité de succès vaut . Notons l'événement « la -ième épreuve est un succès » et posons , de sorte que . La variable
est alors la fréquence des succès au cours des premières épreuves, et
Démonstration. Les variables sont indépendantes, de même loi , d'espérance et de variance , toutes deux existantes puisque le support est fini. La loi faible des grands nombres s'applique donc directement avec et . On peut au passage préciser la majoration obtenue :
la dernière inégalité utilisant , que l'on démontrera dans la partie 7.
Ce résultat est la justification mathématique de l'interprétation fréquentiste d'une probabilité. Depuis le lycée, on dit qu'une probabilité est « la fréquence obtenue à la longue », et l'on s'en sert pour estimer en répétant l'expérience. Cette phrase n'est pas une définition : la probabilité est définie axiomatiquement, et la convergence de la fréquence est un théorème, démontré à partir des axiomes. L'ordre logique est exactement l'inverse de celui que suggère l'intuition, et c'est un point que les jurys apprécient de voir mentionné.
La figure montre, pour une pièce équilibrée, l'évolution de la fréquence de pile au fil de lancers. Trois lectures s'imposent. D'abord, les premières valeurs sont erratiques : après cinq lancers, la fréquence peut valoir comme , et cela ne contredit rien. Ensuite, la courbe se resserre progressivement autour de , et le resserrement est de plus en plus lent : il faut multiplier par quatre pour diviser l'amplitude par deux, ce que le théorème limite central expliquera. Enfin, et c'est le point le plus important, la courbe ne se stabilise jamais définitivement : elle continue d'osciller, simplement de moins en moins. C'est précisément ce que dit la convergence en probabilité, et c'est pourquoi elle ne prétend pas que converge pour chaque suite de lancers.
Un exemple chiffré
Exemple
Combien de lancers pour garantir un écart ? On lance une pièce équilibrée fois et l'on note la fréquence de pile. Combien de lancers faut-il effectuer pour être sûr, avec une probabilité d'au moins , que diffère de de moins de ?
Ici , donc . L'inégalité de Bienaymé-Tchebychev avec donne
Il suffit donc que , c'est-à-dire
Cinquante mille lancers suffisent à garantir la précision demandée. Ce nombre est considérable, et il faut savoir pourquoi : la majoration de Bienaymé-Tchebychev est très grossière. Le théorème limite central, appliqué au même problème dans la partie 7, ramènera ce nombre à , soit cinq fois moins, en échange d'une garantie seulement asymptotique.
Exemple
Une moyenne de lancers de dé. On lance fois un dé équilibré à six faces et l'on note la moyenne des résultats obtenus. Combien de lancers garantissent, avec une probabilité d'au moins , que cette moyenne diffère de de moins d'un dixième ?
Espérance et variance d'un lancer. On a
Application. Les lancers sont indépendants et de même loi, la variance existe puisque le support est fini : la loi faible des grands nombres s'applique, et l'inégalité de Bienaymé-Tchebychev appliquée à avec donne
Résolution. On veut , c'est-à-dire , soit . Comme est entier, il suffit de lancers. On retrouve le même ordre de grandeur que pour la pièce : quelques milliers de répétitions pour une précision de l'ordre du centième relatif.
Ce que la loi faible des grands nombres ne dit pas
Ce théorème est probablement le plus mal compris de tout le programme, et les malentendus qu'il suscite sont assez répandus pour avoir un nom. Il vaut la peine de les écarter explicitement.
Elle ne dit pas qu'il y a compensation. Après une longue série de faces, la loi faible des grands nombres n'affirme pas que les piles vont devenir plus fréquents pour « rattraper le retard ». Les lancers sont indépendants : le passé n'a aucune influence sur l'avenir, et la pièce n'a aucune mémoire des faces déjà sortis. Ce qui se produit est tout autre : l'écart accumulé n'est pas résorbé, il est simplement dilué par la masse des lancers suivants. Si l'on a obtenu faces sur les premiers lancers, un déficit de piles, ce déficit ne s'efface pas ; mais rapporté à lancers, il ne pèse plus que sur la fréquence. La convergence de vers ne vient pas d'une force de rappel, elle vient du dénominateur qui grandit.
Elle ne dit rien sur un tirage particulier. L'énoncé porte sur une probabilité, pas sur une trajectoire. Il reste parfaitement possible d'observer une fréquence de après mille lancers d'une pièce équilibrée : cet événement a une probabilité minuscule, mais elle n'est pas nulle, et la loi faible se contente de dire qu'elle tend vers .
Elle ne donne pas de rang à partir duquel tout est stabilisé. La convergence en probabilité n'exhibe aucun seuil : pour tout , aussi grand soit-il, la probabilité d'un écart important est strictement positive. C'est précisément pourquoi les intervalles de confiance de la dernière partie sont assortis d'un risque non nul.
Deux remarques pour finir
L'hypothèse de variance finie. Elle ne figure dans l'énoncé que parce que la démonstration passe par Bienaymé-Tchebychev, qui réclame une variance. Le résultat reste vrai sous la seule hypothèse d'existence de l'espérance, mais sa démonstration sort largement du programme. En revanche, si la variable n'a pas d'espérance, la moyenne empirique ne converge vers rien : il ne s'agit donc pas d'une hypothèse purement technique.
La vitesse de convergence. La loi faible des grands nombres ne dit rien de la vitesse, sinon à travers la majoration , dont on vient de voir qu'elle est cinq fois trop pessimiste. Il y a pourtant un ordre de grandeur exact, et il est déjà visible dans le calcul de la variance :
L'écart typique entre et est donc de l'ordre de , et non de . C'est le fameux ordre en , qui explique le coût des sondages : diviser l'incertitude par deux exige de multiplier la taille de l'échantillon par quatre. Le théorème limite central est l'énoncé qui transforme cet ordre de grandeur en une loi précise.
Convergence en loi
La convergence en probabilité compare et variable par variable : elle exige que l'écart soit petit avec grande probabilité, donc que les deux variables soient définies sur le même espace et prennent des valeurs voisines. C'est une exigence forte, et elle est trop forte pour énoncer le théorème limite central. Ce que celui-ci affirme, c'est que la loi d'une somme centrée réduite ressemble de plus en plus à la loi normale, et non que cette somme se rapproche numériquement d'une variable normale particulière. Il faut donc une seconde notion de convergence, plus faible, qui ne porte que sur les lois.
Définition
Définition
Soit une suite de variables aléatoires réelles et soit une variable aléatoire réelle. On dit que la suite converge en loi vers lorsque
en tout point où la fonction de répartition est continue. On note alors
Comme la définition ne fait intervenir que les fonctions de répartition, donc que les lois, on se permet d'écrire directement la loi limite : on note par exemple pour dire que converge en loi vers une variable suivant la loi normale centrée réduite. Peu importe laquelle, puisque seule sa fonction de répartition intervient.
La restriction « en tout point de continuité » surprend toujours au premier abord, et l'on est tenté de la prendre pour une coquetterie de théoricien. Elle est en réalité indispensable : sans elle, les convergences les plus évidentes seraient fausses.
Exemple
Pourquoi la restriction est indispensable. Pour tout entier , soit la variable aléatoire certaine égale à , et soit la variable certaine égale à . Il n'y a rien de plus convergent que cette suite : .
Écrivons les fonctions de répartition. Pour tout réel ,
Cas . On a pour tout , donc , qui tend vers .
Cas . Pour assez grand, on a , donc à partir d'un certain rang, et la limite vaut .
Cas . Pour tout , on a , donc , et la limite vaut . Or . La convergence échoue en ce point, et en ce point seulement.
Le point est exactement le point où est discontinue, puisqu'elle y saute de à . Si la définition exigeait la convergence en tout réel, la suite des variables certaines ne convergerait pas en loi vers la variable certaine , ce qui serait absurde. La restriction aux points de continuité est donc là pour rendre la définition utilisable.
Ce que la convergence en loi signifie, et ce qu'elle ne signifie pas
Il faut insister, car c'est la source d'erreur numéro un du chapitre : c'est la loi qui converge, pas la variable. La convergence en loi ne dit rien sur les valeurs prises par et pour un même résultat ; elle ne dit même rien sur l'existence d'un tel commun. Les variables peuvent parfaitement être définies sur des espaces probabilisés différents les uns des autres, et sur un troisième. C'est impossible pour la convergence en probabilité, qui a besoin de calculer , donc d'un espace commun.
L'énoncé « » signifie donc exactement ceci, et rien de plus : pour grand, les probabilités que l'on calcule sur sont proches de celles que l'on calculerait sur une variable normale centrée réduite. C'est un énoncé sur les tableaux de probabilités, pas sur les variables. Et c'est pourtant suffisant pour tout ce qu'on veut faire, puisqu'en pratique on ne cherche jamais à comparer deux variables : on cherche à calculer une probabilité.
Le cas des variables à valeurs entières
Lorsque toutes les variables en jeu sont à valeurs dans , la définition par les fonctions de répartition, qui sont alors en escalier, se remplace par un critère beaucoup plus maniable.
Propriété
Critère pour les variables entières (admis). Soit une suite de variables aléatoires à valeurs dans , et soit une variable aléatoire à valeurs dans . Alors
Ce résultat est admis. Le sens direct s'obtient sans difficulté en écrivant , ce qui est licite puisque toutes les variables sont à valeurs entières, puis en appliquant la convergence aux deux points et , qui ne sont pas entiers, donc sont des points de continuité de ; la réciproque, elle, demande d'échanger une limite et une somme infinie, ce qui relève d'arguments hors programme.
Le critère est celui que l'on utilise systématiquement pour une suite de lois discrètes : on écrit pour fixé, on calcule la limite quand , et l'on reconnaît la loi limite. C'est ainsi que se démontre l'approximation de la loi binomiale par la loi de Poisson.
Propriétés opératoires
Propriété
Opérations sur les limites en loi (admises). Soit une suite de variables aléatoires convergeant en loi vers .
a. Transformation affine. Pour tous réels et ,
b. Composition par une fonction continue. Si est une fonction continue sur , alors
Ces deux propriétés sont admises. La première est celle qui sert constamment avec le théorème limite central : elle permet de passer de la variable centrée réduite, dont on connaît la loi limite, à la variable brute dont l'énoncé parle. Elle explique aussi pourquoi l'on prend soin d'écrire : si , la variable est la constante , et l'énoncé n'a plus d'intérêt.
Lien entre les deux convergences
Propriété
La convergence en probabilité entraîne la convergence en loi (admis). Si , alors .
Ce résultat est admis ; sa démonstration, sans être longue, repose sur un encadrement de par et sur la continuité de au point considéré, ce qui n'est pas exigible. Il confirme la hiérarchie annoncée : la convergence en probabilité est la plus forte des deux, la convergence en loi la plus faible.
Propriété
La réciproque est FAUSSE en général. Une suite peut converger en loi sans converger en probabilité vers la même limite.
Exemple
Le contre-exemple de référence. Soit une variable aléatoire de loi uniforme sur , c'est-à-dire , et posons pour tout .
Convergence en loi. La variable prend elle aussi les valeurs et avec la probabilité chacune : elle a exactement la même loi que . Donc pour tout , la suite des fonctions de répartition est constante, et de façon triviale.
Absence de convergence en probabilité. On a , donc , quelle que soit l'issue. Ainsi, en prenant ,
pour tout . Cette suite constante égale à ne tend pas vers , donc ne converge pas en probabilité vers .
Moralité. Les lois de et de sont identiques, et pourtant les variables sont systématiquement aussi éloignées que possible l'une de l'autre. C'est le résumé de tout ce que la convergence en loi ignore.
Il existe cependant un cas, et un seul, où la réciproque est vraie. C'est le cas qui servira à la fin du chapitre.
Propriété
Cas d'une limite constante (admis). Soit une suite de variables aléatoires et soit un réel. Alors
où désigne aussi la variable certaine égale à .
L'implication de la droite vers la gauche est le cas particulier du résultat admis précédent. La réciproque, admise elle aussi, s'explique intuitivement : quand la loi limite est concentrée en un seul point, dire que la loi de se rapproche de cette loi, c'est dire que se concentre autour de , ce qui est bien la convergence en probabilité. Ce cas est le seul où les deux notions coïncident.
En résumé, et c'est à retenir sous cette forme :
| Convergence | Ce qui converge | Vers quoi | Implication |
|---|---|---|---|
| en probabilité | les variables | une variable ou une constante | entraîne la convergence en loi |
| en loi | les fonctions de répartition | une loi | n'entraîne rien, sauf si la limite est constante |
Deux convergences en loi au programme
Le programme mentionne explicitement deux convergences en loi, en dehors du théorème limite central. Toutes deux se démontrent, et il faut savoir le faire.
Propriété
De la loi binomiale à la loi de Poisson. Soit . Pour tout entier , soit une variable aléatoire de loi . Alors
Démonstration. Toutes les variables sont à valeurs dans , ainsi que la loi limite : on peut donc utiliser le critère pour les variables entières, et il suffit de montrer que pour tout entier fixé.
Fixons donc et posons , qui appartient bien à dès que . Pour tout ,
On étudie séparément les deux facteurs.
Le facteur . Le numérateur comporte exactement facteurs, et le dénominateur en comporte également. En les appariant,
Le nombre est fixé, donc ce produit comporte un nombre fixe de facteurs, chacun tendant vers quand . Il tend donc vers , et
Le facteur . Pour , on a , donc
Le développement limité au voisinage de , appliqué à qui tend bien vers , donne
donc
le second terme tendant vers car est borné et est fixé. Par continuité de l'exponentielle,
Conclusion. Le produit des limites donne
pour une variable . Le critère pour les variables entières permet de conclure.
Ce théorème est la justification de l'appellation « loi des événements rares » donnée à la loi de Poisson : elle décrit un très grand nombre d'épreuves indépendantes, chacune de probabilité de succès très faible , le nombre moyen de succès restant fixe. On notera que les deux lois ont exactement la même espérance pour tout , ce qui est le bon réglage du paramètre.
Propriété
De la loi géométrique à la loi exponentielle. Soit . Pour tout entier , soit une variable aléatoire de loi . Alors
Démonstration. Posons et , qui appartient à pour . Notons la fonction de répartition de la loi :
Cette fonction est continue sur tout entier, y compris en où les deux expressions valent . Il faut donc établir la convergence en tout réel , sans exception.
Cas . La variable est à valeurs dans , donc est à valeurs strictement positives et .
Cas . On rappelle que pour une loi géométrique de paramètre , on a pour tout entier . Comme ne prend que des valeurs entières, l'événement coïncide avec , où désigne la partie entière de . Donc
Étudions la limite de . Comme pour ,
Écrivons avec , par définition de la partie entière, et avec , d'après le développement limité du logarithme. Alors
Le premier terme tend vers , et le second vers puisque est borné par et que le dénominateur tend vers . Par continuité de l'exponentielle, , donc
La convergence a lieu en tout réel, donc en particulier en tout point de continuité de : la suite converge bien en loi vers la loi .
L'interprétation est éclairante et vaut d'être connue. La loi géométrique est un temps d'attente discret : on compte le nombre d'épreuves jusqu'au premier succès. La loi exponentielle est un temps d'attente continu. Le théorème dit que si l'on découpe le temps en intervalles de plus en plus fins, chacun de durée , en donnant à chaque intervalle une probabilité de succès proportionnelle à sa durée, alors l'instant du premier succès suit à la limite une loi exponentielle. On retrouve d'ailleurs les espérances : , donc , qui est bien l'espérance de la loi . C'est aussi la raison profonde pour laquelle ces deux lois sont les seules à être sans mémoire, chacune dans son monde.
Exemple
Le maximum d'un échantillon uniforme, renormalisé. Soit et soit un échantillon de la loi . On a vu dans la partie 2 que le maximum converge en probabilité vers . À quelle vitesse, et selon quelle loi ? Posons
et montrons que .
La fonction de répartition limite. Celle de la loi vaut pour et pour . Elle est continue sur tout entier : il faut donc établir la convergence en tout réel.
Cas . Comme , la variable est positive, donc .
Cas . Soit . En résolvant l'inégalité, et en utilisant puis ,
Le réel appartient à puisque . La variable étant à densité, on a sur cet intervalle, d'où
Or, pour ,
par continuité de l'exponentielle. Donc , ce qui achève la démonstration.
Ce que cela apprend. L'écart est de l'ordre de , et non de : le maximum s'approche de beaucoup plus vite qu'une moyenne ne s'approche de son espérance. De plus la loi limite de l'erreur est exponentielle, donc dissymétrique, et pas du tout normale. C'est un avertissement utile avant d'aborder le théorème limite central : celui-ci concerne les sommes, et son universalité ne s'étend pas aux maximums, qui obéissent à d'autres régimes.
Méthode
Montrer une convergence en loi. La marche à suivre dépend de la nature des variables.
1. Variables à valeurs dans , limite entière. On utilise le critère : on fixe , on écrit , on calcule la limite quand à fixé, et l'on reconnaît la loi limite. Le mot « fixé » est essentiel : c'est lui qui autorise à traiter un produit de facteurs comme un produit à nombre constant de facteurs.
2. Variables quelconques. On revient à la définition, en trois temps. On écrit d'abord la fonction de répartition limite et l'on repère ses points de discontinuité ; on calcule ensuite , en traduisant l'événement en un événement portant sur les variables de départ ; on montre enfin que en tout point de continuité de . Quand est continue partout, ce qui est le cas des lois à densité usuelles, il n'y a aucun point à exclure et on le dit.
3. Une transformation affine d'une suite dont on connaît la limite. On cite la propriété opératoire, sans refaire de calcul. C'est ce que l'on fait à chaque application du théorème limite central.
Les outils analytiques mobilisés sont toujours les mêmes : le passage par l'exponentielle pour une puissance -ième, le développement limité , et la continuité de l'exponentielle pour conclure. Une puissance de la forme doit immédiatement faire écrire .
Théorème limite central
Énoncé
Propriété
Théorème limite central (admis). Soit une suite de variables aléatoires indépendantes, de même loi, admettant une espérance et un écart-type . Posons
Alors la suite converge en loi vers la loi normale centrée réduite :
c'est-à-dire que pour tout réel ,
Ce théorème est admis, et il faut savoir pourquoi. Sa démonstration classique repose sur un outil qui transforme les sommes de variables indépendantes en produits, et cet outil est à valeurs complexes ; or les nombres complexes ont été retirés du programme des classes préparatoires ECG en 2021. Aucune démonstration élémentaire n'en est connue dans le cadre du programme. Il faut donc le citer, jamais tenter de le redémontrer.
Deux vérifications s'imposent avant chaque usage, et elles sont attendues dans une copie. D'une part, la variable est bien centrée réduite : par linéarité, donc , et par indépendance , donc
Le théorème affirme donc que la loi de cette variable, déjà normalisée, converge vers la loi normale, qui est la loi centrée réduite par excellence. D'autre part, l'hypothèse est indispensable : si , la variable est certaine, la division n'a pas de sens, et il n'y a plus rien d'aléatoire.
Les autres hypothèses ne sont pas davantage décoratives, et il faut savoir dire à quoi chacune sert.
L'indépendance. Sans elle, la variance de n'est plus , et le facteur de normalisation n'est plus le bon. Le cas extrême est celui où toutes les variables sont égales : , la variable centrée réduite vaut pour tout , elle ne dépend pas de , et sa loi n'a aucune raison d'être normale. Rien ne converge vers rien.
L'identité des lois. Elle permet d'écrire et sans indice, donc de normaliser par une expression simple. Le théorème se généralise à des variables de lois différentes sous des conditions techniques, mais ces extensions sont hors programme.
L'existence de la variance. C'est l'hypothèse la plus profonde. Il existe des lois d'espérance finie mais de variance infinie, pour lesquelles la somme centrée normalisée par ne converge vers rien du tout. Le du dénominateur n'est pas un choix arbitraire : c'est exactement l'écart-type de , divisé par , et il n'existe que si la variance existe.
Les deux écritures équivalentes
Propriété
Forme en moyenne empirique. Sous les hypothèses du théorème limite central, on a l'égalité de variables aléatoires
et par conséquent
Démonstration. Il suffit de diviser le numérateur et le dénominateur par , qui est non nul :
en utilisant . Les deux variables sont égales, donc elles ont la même loi et la même limite en loi.
Ces deux écritures sont la même, et il faut savoir passer de l'une à l'autre sans réfléchir. La première est adaptée aux énoncés qui parlent d'un total : un chiffre d'affaires, un nombre de succès, une somme de durées. La seconde est adaptée aux énoncés qui parlent d'une moyenne : une note moyenne, une fréquence, une taille moyenne. La seconde est celle de la statistique, et c'est elle qui servira dans les parties 6 et 7. On remarquera qu'elle s'écrit aussi
puisque et : c'est simplement la variable centrée réduite.
Propriété
Traduction pratique. Pour grand, on utilise les approximations
Ces deux phrases sont commodes et il faut savoir les écrire, mais elles n'ont aucun sens mathématique précis : le mot « approximativement » n'est défini nulle part, et n'a aucune raison d'être une variable à densité. L'énoncé rigoureux est celui du théorème, c'est-à-dire la convergence en loi de la variable centrée réduite. Dans une copie, on écrit le théorème, on centre et l'on réduit soi-même, et l'on n'utilise l'approximation qu'au moment de lire la table. Le raccourci est admis dans les énoncés d'application, jamais dans une démonstration.
Ce que le théorème limite central apporte de plus que la loi faible
Les deux théorèmes portent sur la même quantité , mais ils en disent des choses de nature différente, et il faut voir clairement laquelle.
La loi faible des grands nombres affirme que tend vers en probabilité. C'est un énoncé qualitatif : l'erreur disparaît. Il ne dit ni à quelle vitesse elle disparaît, ni comment elle est répartie autour de tant qu'elle n'a pas disparu.
Le théorème limite central affirme que la même erreur, multipliée par , admet une loi limite non triviale. Il en découle deux informations que la loi faible ne contenait pas.
D'abord, l'ordre de grandeur exact de l'erreur. Puisque se stabilise en loi, l'erreur est de l'ordre de . Ni plus grande, ni plus petite. C'est la fameuse règle de la racine carrée : multiplier la taille de l'échantillon par ne divise l'erreur que par . Toute l'économie des sondages est contenue dans cette phrase.
Ensuite, la loi de l'erreur. Non seulement l'erreur a la bonne taille, mais on sait comment elle se répartit : selon une loi normale, toujours la même, quelle que soit la loi de départ. C'est cette universalité qui est stupéfiante. Que l'on somme des résultats de dés, des durées de vie exponentielles, des indicatrices de Bernoulli ou des variables dont on ignore tout, la loi limite de la somme centrée réduite est la même. C'est ce qui explique l'omniprésence de la loi normale en pratique : toute grandeur qui résulte de l'addition d'un grand nombre de petites contributions indépendantes lui ressemble.
La figure illustre le phénomène sur le cas le plus simple, celui d'une loi binomiale. Les bâtons représentent la loi de où avec et , c'est-à-dire une somme de trente indicatrices de Bernoulli centrée et réduite. La courbe superposée est la densité de la loi . Trois observations. La loi de départ est discrète et pourtant les sommets des bâtons se placent presque exactement sur la courbe : la convergence en loi n'exige nullement que les soient à densité. La loi de départ est dissymétrique, puisque , et pourtant la limite est symétrique : la dissymétrie, encore lisible ici sur les bâtons qui s'arrêtent net à gauche et s'étirent à droite, s'efface quand grandit. Enfin l'ajustement est excellent au centre et un peu moins bon sur les bords, ce qui est le comportement général du théorème limite central : il décrit bien le corps de la loi, moins bien ses queues extrêmes.
Méthode d'application
Méthode
Appliquer le théorème limite central en trois temps. Un énoncé demande une probabilité portant sur une somme ou une moyenne, avec un grand. On procède toujours ainsi.
Temps 1. Identifier l'échantillon. Écrire explicitement les variables , dire pourquoi elles sont indépendantes et de même loi, et calculer et . Vérifier . Cette étape est la seule qui demande de comprendre l'énoncé ; les deux suivantes sont mécaniques.
Temps 2. Centrer et réduire. Transformer l'événement de l'énoncé en un événement portant sur , ou sur selon la forme de la question, en appliquant la même transformation aux deux membres de chaque inégalité. Une inégalité devient
Attention au sens des inégalités : la division par le conserve, mais un passage au complémentaire l'inverse.
Temps 3. Lire la table. Remplacer la loi de la variable centrée réduite par , et exprimer la probabilité à l'aide de , en utilisant les deux identités
et la relation de symétrie , qui sert à chaque fois que l'argument est négatif, la table ne donnant que les valeurs positives.
Une phrase de conclusion, avec le résultat arrondi et son interprétation en français, termine la question.
Le cas de Bernoulli
Le théorème limite central appliqué à un échantillon de Bernoulli mérite d'être écrit à part : c'est le cas historique, celui par lequel le théorème a été découvert, et c'est aussi celui qui sert dans toute la partie 7.
Propriété
Théorème limite central pour une somme de Bernoulli. Soit et, pour tout entier , soit . Alors
De façon équivalente, en notant la fréquence empirique,
Démonstration. Une variable de loi a même loi qu'une somme de variables indépendantes de loi . Ces variables ont pour espérance et pour variance , donc pour écart-type , qui est strictement positif puisque . Le théorème limite central s'applique donc et donne
La seconde écriture s'obtient en divisant le numérateur et le dénominateur par , comme on l'a fait plus haut pour passer de la somme à la moyenne.
C'est cet énoncé qui justifie l'approximation de la loi binomiale par la loi normale, et c'est lui qui fabriquera les intervalles de confiance pour une proportion. On remarquera que l'hypothèse y est essentielle : pour ou , la variable est certaine, l'écart-type est nul, et il n'y a rien à normaliser.
Les approximations usuelles
Le théorème limite central et le théorème de convergence de la binomiale vers la loi de Poisson fournissent trois approximations, que les énoncés utilisent constamment.
Propriété
Approximations usuelles et conditions d'emploi.
| Loi de départ | Approchée par | Conditions usuelles |
|---|---|---|
| grand, petit, modéré : , , | ||
| , , | ||
| grand, en pratique |
Ces trois approximations conservent l'espérance, et la deuxième et la troisième conservent aussi la variance : c'est la règle de réglage des paramètres, et c'est ainsi qu'on les retrouve si on les a oubliées.
Il faut dire clairement une chose sur les seuils numériques du tableau : ce sont des usages, pas des théorèmes. Aucun énoncé mathématique ne dit que l'approximation devient valable à partir de ou de . Les théorèmes sous-jacents sont des énoncés de limite, donc asymptotiques, et ils ne fournissent aucun seuil. Les valeurs du tableau sont des conventions issues de la pratique, elles varient d'un manuel à l'autre, et un énoncé de concours précise en général celles qu'il retient. Ce qui est exigible, c'est de vérifier explicitement les conditions annoncées par l'énoncé avant d'approcher, et de ne jamais approcher en silence.
On notera aussi la cohérence de l'ensemble : les deux premières lignes ne s'appliquent pas dans les mêmes situations. Si est petit et modéré, on va vers Poisson ; si et sont tous deux confortables, donc si n'est ni proche de ni proche de , on va vers la loi normale. Et la troisième ligne referme la boucle, puisque la loi de Poisson elle-même devient normale quand son paramètre grandit.
Enfin, une précision d'honnêteté : le programme ECG ne demande pas la correction de continuité, ce petit décalage d'un demi-entier que certains ouvrages appliquent lorsqu'on approche une loi entière par une loi à densité. On applique donc le théorème limite central tel quel, sans correction, et l'erreur qui en résulte est de l'ordre de quelques millièmes, comme le montre l'exemple ci-dessous.
Trois exemples entièrement traités
Exemple
a. Un total de dépenses. Dans un magasin, les montants dépensés par les clients sont des variables aléatoires indépendantes et de même loi, d'espérance euros et d'écart-type euros. On observe clients dans la journée et l'on note le total encaissé. Quelle est la probabilité que ce total dépasse euros ? Quelle est la probabilité qu'il soit compris entre et euros ?
Temps 1. Les variables sont indépendantes, de même loi, d'espérance et d'écart-type . Le théorème limite central s'applique, et est assez grand pour utiliser l'approximation.
Temps 2. On a et . Donc
Temps 3. En remplaçant la loi de la variable centrée réduite par ,
Il y a donc environ chances sur que la recette dépasse euros.
Pour la seconde question, les deux bornes centrées réduites valent
d'où
La recette a donc environ chances sur de tomber dans cette fourchette. On remarquera l'usage de la symétrie , indispensable puisque la table ne donne pas les valeurs négatives.
Exemple
b. Une loi binomiale approchée par la loi normale. On lance fois une pièce équilibrée et l'on note le nombre de piles obtenus, de sorte que . Quelle est la probabilité que soit compris entre et ?
Vérification des conditions. On a , et : les trois conditions de l'approximation normale sont réunies.
Paramètres. et , donc .
Centrage-réduction et lecture. Les bornes deviennent et , d'où
Contrôle. La valeur exacte, obtenue en sommant les termes binomiaux, vaut à près. L'approximation commet donc une erreur de , soit un demi-point de pourcentage, pour un calcul incomparablement plus rapide. C'est ce compromis qui justifie l'approximation.
Exemple
c. Une loi de Poisson approchée par la loi normale. Un serveur reçoit un nombre de requêtes par minute suivant la loi . Quelle est la probabilité que ce nombre soit compris entre et ?
Vérification. Le paramètre dépasse : l'approximation normale est licite avec la loi , puisque l'espérance et la variance d'une loi de Poisson valent toutes deux .
Calcul. On a , et les bornes centrées réduites valent et . Donc
Contrôle. La valeur exacte vaut à près. L'écart est ici de l'ordre du point de pourcentage, un peu plus grand que dans l'exemple précédent : c'est le prix de l'absence de correction de continuité sur une loi discrète dont le pas n'est pas négligeable devant l'écart-type . L'approximation reste tout à fait acceptable pour un ordre de grandeur.
Exemple
d. Un contrôle de qualité, en travaillant sur la fréquence. Une chaîne de production fabrique des pièces dont une proportion est défectueuse, chaque pièce étant défectueuse indépendamment des autres. On prélève pièces et l'on note la fréquence de pièces défectueuses dans le prélèvement. Quelle est la probabilité que cette fréquence atteigne ou dépasse ?
Temps 1. Posons si la -ième pièce est défectueuse et sinon. Les variables sont indépendantes, de même loi , d'espérance et de variance , donc . Les conditions usuelles sont réunies : , et .
Temps 2. On travaille ici sur la moyenne empirique, puisque l'énoncé parle d'une fréquence. Son écart-type vaut
La borne centrée réduite vaut donc
Temps 3. En lisant la table au voisinage de ,
Il y a donc environ chances sur d'observer au moins de pièces défectueuses sur un prélèvement de , alors que le taux réel n'est que de .
Contrôle et mise en garde. La valeur exacte, calculée avec la loi binomiale , vaut . L'erreur relative est ici de , bien plus élevée que dans les exemples précédents, et la raison en est claire : on calcule une probabilité de queue, dans une zone où l'ajustement normal est le moins bon, et sur une loi nettement dissymétrique puisque est loin de . C'est la limite honnête de la méthode, et elle confirme ce que montrait la figure : le théorème limite central décrit très bien le centre d'une loi, moins bien ses extrémités.
Table de la loi normale centrée réduite
La table ci-dessous donne quelques valeurs usuelles de , à près. Pour les arguments négatifs, on utilise la relation de symétrie , conséquence de la parité de la densité .
Définition
Pour , on note l'unique réel positif tel que
De façon équivalente, si , alors
L'existence et l'unicité de viennent de ce que est continue et strictement croissante sur , de limites en et en : le théorème de la bijection s'applique, et appartient bien à , donc l'antécédent est positif. L'équivalence entre les deux écritures s'obtient en écrivant
Le réel est donc la demi-largeur, en écarts-types, de l'intervalle centré qui contient la variable normale avec la probabilité . Voici les valeurs à connaître.
La valeur est de très loin la plus utilisée : c'est celle du niveau de confiance , standard universel des sondages et des contrôles de qualité. Il faut la connaître par cœur, ainsi que .
Estimation ponctuelle
Tout ce qui précède relève du calcul des probabilités : la loi est donnée, on en déduit le comportement des observations. On change maintenant de sens. Une loi est connue à un paramètre près, on dispose d'observations, et l'on cherche à remonter au paramètre. C'est la démarche statistique, et elle utilise comme unique carburant les théorèmes des parties précédentes.
Le vocabulaire
Définition
Modèle statistique. On observe une grandeur modélisée par une variable aléatoire dont la loi est connue à un paramètre réel près : ce paramètre, noté , est inconnu et appartient à un ensemble de valeurs possibles, appelé ensemble des paramètres. La donnée de la famille de lois et de l'ensemble constitue le modèle statistique.
Par exemple, « le nombre de clients arrivant en une heure suit une loi de Poisson de paramètre inconnu » est un modèle statistique, avec et . « Un électeur pris au hasard vote pour le candidat A avec la probabilité inconnue » en est un autre, avec et .
Définition
Échantillon. On appelle échantillon de taille de la loi de tout -uplet de variables aléatoires indépendantes et de même loi que . Un -uplet de réels obtenu en observant effectivement l'échantillon s'appelle une réalisation de cet échantillon, ou encore les données.
Définition
Statistique. On appelle statistique toute variable aléatoire de la forme
où est une fonction de variables réelles ne dépendant pas du paramètre inconnu .
La condition sur n'est pas décorative : c'est elle qui rend la statistique calculable. Une fois les données observées, on doit pouvoir en tirer un nombre, ce qui serait impossible si l'expression contenait . Ainsi est une statistique, et n'en est pas une.
Définition
Estimateur et estimation. Un estimateur de est une statistique construite dans le but d'approcher . Le nombre
obtenu en remplaçant l'échantillon par une réalisation, s'appelle une estimation de .
Cette distinction est la première chose à maîtriser dans toute la partie statistique, et c'est celle que les correcteurs vérifient en priorité.
Un estimateur est une variable aléatoire. Il n'a pas de valeur numérique : il a une loi, une espérance, une variance. C'est un objet du calcul des probabilités, et c'est sur lui que l'on démontre des théorèmes.
Une estimation est un nombre. Elle n'a ni loi, ni espérance, ni variance. C'est le résultat d'un calcul sur des données, et on ne peut rien en démontrer.
Exemple
Un institut interroge personnes. On pose si la -ième personne répond oui, et sinon, de sorte que avec inconnu.
L'estimateur naturel de est la fréquence empirique
qui est une variable aléatoire : elle prend ses valeurs dans et l'on peut calculer et .
Si le sondage donne effectivement réponses positives, l'estimation de est le nombre
Il serait dénué de sens d'écrire ou , et tout aussi dénué de sens d'écrire « » sans préciser qu'il s'agit d'une valeur observée. La rédaction correcte distingue toujours les deux, souvent par la casse : la variable en majuscule, la donnée en minuscule.
Biais d'un estimateur
Définition
Soit un estimateur du paramètre admettant une espérance. On appelle biais de le réel
L'estimateur est dit sans biais lorsque , c'est-à-dire , et ceci pour toute valeur possible de .
Définition
Une suite d'estimateurs de est dite asymptotiquement sans biais lorsque
et ceci pour toute valeur possible de .
Le biais mesure une erreur systématique : c'est l'écart entre la valeur moyenne de l'estimateur et la cible. Un estimateur sans biais vise juste en moyenne ; répété sur un très grand nombre d'échantillons, il ne surestime ni ne sous-estime . Un estimateur biaisé se trompe toujours dans le même sens, et le biais dit de combien et dans quel sens.
Trois remarques indispensables.
Un estimateur sans biais est asymptotiquement sans biais, puisque son biais est la suite nulle. La réciproque est fausse : le biais peut être non nul à fixé tout en tendant vers . C'est le cas de la variance empirique , dont on va calculer le biais dans un instant.
Sans biais ne veut pas dire précis. Un estimateur peut être sans biais et pourtant fluctuer énormément d'un échantillon à l'autre. L'estimateur , qui ignore les autres observations, est sans biais pour l'espérance , puisque ; il est pourtant sans le moindre intérêt, car sa variance vaut et ne diminue jamais. Le biais ne dit rien de la dispersion, et c'est pourquoi on l'accompagne toujours de la variance.
On compare deux estimateurs sans biais par leurs variances. Entre deux estimateurs sans biais du même paramètre, on préfère celui dont la variance est la plus petite : il se trompe autant en moyenne, c'est-à-dire pas du tout, mais il se trompe moins souvent beaucoup. C'est le seul critère de comparaison au programme.
Propriété
Le risque quadratique est HORS PROGRAMME en ECG mathématiques approfondies. Certains ouvrages, et le programme d'autres filières, définissent une quantité qui synthétise le biais et la variance en un seul nombre, et démontrent une décomposition biais-variance. Rien de tout cela n'est au programme ECG, et il ne faut ni l'écrire ni l'utiliser : cela ne rapporte aucun point et fait perdre du temps.
Ce que le programme demande à la place est exactement ceci :
a. calculer le biais et dire s'il est nul, ou s'il tend vers ;
b. calculer la variance et regarder si elle tend vers ;
c. conclure à la convergence par l'inégalité de Bienaymé-Tchebychev, selon le critère de la partie 2 ;
d. comparer deux estimateurs sans biais par leurs variances.
Suite d'estimateurs convergente
Définition
Soit une suite d'estimateurs du paramètre , l'estimateur étant construit sur un échantillon de taille . On dit que cette suite est convergente lorsqu'elle converge en probabilité vers , c'est-à-dire lorsque, pour tout ,
et ceci pour toute valeur possible de .
C'est la qualité minimale que l'on exige d'une méthode d'estimation : en augmentant la taille de l'échantillon, on doit finir par atteindre la cible avec une probabilité arbitrairement proche de . Un estimateur non convergent est un estimateur qui n'apprend rien des données supplémentaires.
Propriété
Critère de convergence d'une suite d'estimateurs. Soit une suite d'estimateurs de , chacun admettant une espérance et une variance. Si
c'est-à-dire si la suite est asymptotiquement sans biais et si sa variance tend vers , alors la suite est convergente.
Démonstration. L'hypothèse s'écrit , c'est-à-dire . Les deux hypothèses du critère de convergence en probabilité de la partie 2 sont donc vérifiées avec , et l'on conclut .
Redonnons la démonstration complète, car elle est régulièrement redemandée. Soit . Comme , il existe un rang à partir duquel . Pour , l'inégalité triangulaire donne l'inclusion d'événements
car si alors
La croissance de la probabilité puis l'inégalité de Bienaymé-Tchebychev appliquée à , qui admet une variance, donnent
et le théorème d'encadrement conclut.
Propriété
Cas d'un estimateur sans biais. Si est sans biais pour tout et si , alors la suite est convergente, et la démonstration se réduit à
puisque permet d'appliquer Bienaymé-Tchebychev directement autour de .
Comme dans la partie 2, ce critère est suffisant et non nécessaire : une suite d'estimateurs peut converger sans que sa variance tende vers , voire sans admettre de variance. En pratique, tous les estimateurs du programme relèvent du critère, et c'est par lui qu'on conclut.
Estimation de l'espérance par la moyenne empirique
Propriété
La moyenne empirique estime l'espérance. Soit un échantillon d'une loi d'espérance inconnue et de variance finie. Alors la moyenne empirique
est un estimateur sans biais de , de variance , et la suite est convergente.
Démonstration. C'est bien un estimateur. La fonction ne fait intervenir aucun paramètre inconnu : est donc une statistique, calculable à partir des seules données.
Sans biais. Par linéarité de l'espérance, qui ne demande aucune hypothèse,
Variance. Les variables de l'échantillon sont indépendantes, donc leurs covariances deux à deux sont nulles et la variance de la somme est la somme des variances :
Convergence. L'estimateur est sans biais et sa variance tend vers : le critère s'applique. La suite est donc convergente, ce qui n'est rien d'autre que la loi faible des grands nombres.
Ce résultat est le socle de toute la statistique élémentaire : la moyenne des observations est un bon estimateur de l'espérance, sans biais et convergent, et sa précision s'améliore comme puisque son écart-type vaut . Il s'applique en particulier au cas de Bernoulli, où : la fréquence empirique est un estimateur sans biais et convergent de la proportion inconnue , de variance .
Estimation de la variance
La question suivante est naturelle : puisque la moyenne empirique estime l'espérance, la « variance empirique » estime-t-elle la variance ? La réponse est presque oui, et le « presque » est instructif.
Définition
Soit un échantillon, avec . On appelle variance empirique la statistique
et variance empirique corrigée la statistique
On rappelle la mise en garde de l'introduction : le symbole se lit d'un bloc, il désigne la variance empirique corrigée et non le carré de la somme de la partie 5. Les deux notations ne se rencontrent jamais dans le même calcul, mais elles se ressemblent assez pour mériter cet avertissement.
Propriété
Biais des deux variances empiriques. Soit un échantillon d'une loi admettant une espérance et une variance , avec . Alors et admettent une espérance, et
Ainsi est un estimateur biaisé de , de biais
mais asymptotiquement sans biais, tandis que est un estimateur sans biais de .
Démonstration. Elle repose sur une identité algébrique qu'il faut savoir retrouver, et qui n'a rien de probabiliste.
Étape 1 : une identité de décomposition. Montrons que
On fait apparaître dans chaque terme du membre de gauche, en écrivant , puis on développe le carré :
la quantité ne dépendant pas de l'indice , ce qui permet de la sortir de la somme et donne le facteur dans le dernier terme. Or
En reportant, le terme du milieu vaut , et il vient
ce qui est bien l'identité annoncée après réduction des deux derniers termes.
Étape 2 : espérance de chaque morceau. Chaque a la même loi que , d'espérance et de variance , donc
Par ailleurs, on a montré plus haut que et , donc, par définition de la variance,
C'est ici que se joue tout le calcul : l'écart quadratique moyen de à est fois plus petit que celui d'une observation isolée.
Étape 3 : conclusion. Toutes les variables en jeu admettent une espérance, donc la linéarité de l'espérance appliquée à l'identité de l'étape 1 donne
En divisant par , puis par , on obtient
Le biais de vaut donc , qui est strictement négatif et tend vers : l'estimateur sous-estime systématiquement la variance, mais de moins en moins. Le facteur correcteur appliqué à compense exactement ce défaut.
D'où vient le ? L'explication tient en une phrase, et il faut savoir la donner. La quantité , vue comme fonction du réel , est minimale pour : c'est un simple trinôme du second degré en . En mesurant la dispersion autour de la moyenne observée plutôt qu'autour de la vraie espérance , que l'on ignore, on prend donc à coup sûr la valeur la plus petite possible, et l'on sous-estime la dispersion réelle. L'étape 3 chiffre exactement cette sous-estimation : elle vaut un -ième, et diviser par au lieu de la corrige. On dit aussi que l'on a « consommé un degré de liberté » en estimant par .
Propriété
Convergence des variances empiriques (admise). Si admet un moment d'ordre , alors les suites et sont des suites d'estimateurs convergentes de :
Ce résultat est admis dans sa généralité, mais son mécanisme se comprend en trois lignes avec les outils du chapitre, et il est bon de le voir. On part de la forme développée de la variance empirique, obtenue en prenant dans l'identité de König-Huygens empirique :
La loi faible des grands nombres appliquée à l'échantillon , dont la variance existe précisément parce que admet un moment d'ordre , donne . La loi faible appliquée à l'échantillon initial donne , puis la composition par la fonction carré, continue en , donne . La propriété de la somme conclut :
par la formule de König-Huygens. Le passage à ne change rien, le facteur tendant vers .
Estimer un paramètre dans les lois usuelles
Dans la plupart des lois usuelles, le paramètre s'exprime simplement en fonction de l'espérance : il suffit alors d'estimer l'espérance par et de transporter la relation. Voici les cas au programme.
| Loi de | Paramètre | Relation | Estimateur usuel | Biais |
|---|---|---|---|---|
| nul | ||||
| nul | ||||
| non nul, tend vers | ||||
| non nul, tend vers | ||||
| nul |
Deux commentaires sur ce tableau.
Les deux lignes à biais non nul. Lorsque le paramètre est l'inverse de l'espérance, l'estimateur naturel est l'inverse de la moyenne empirique, et il est biaisé : l'espérance d'un inverse n'est pas l'inverse de l'espérance. Pour la loi exponentielle, on montre, en utilisant la loi gamma, que pour , ce qui donne un biais égal à : il est strictement positif, donc l'estimateur surestime , et il tend vers , donc l'estimateur est asymptotiquement sans biais. La convergence, elle, est immédiate : par la loi faible des grands nombres, et la fonction inverse est continue en , qui est non nul, donc par composition.
Le cas de la loi uniforme, ou comment comparer deux estimateurs sans biais. Pour la loi , il existe un second estimateur sans biais, construit à partir du maximum étudié dans la partie 2. On y a établi , donc
c'est un estimateur sans biais de . Comparons-le à par les variances, seul critère au programme. D'une part, la loi uniforme sur a pour variance , donc
D'autre part, en reprenant calculée dans la partie 2,
Le rapport des deux variances vaut
qui dépasse dès que et tend vers . L'estimateur fondé sur le maximum est donc strictement meilleur dès , et son avantage croît sans limite : sa variance décroît en là où celle de décroît seulement en . C'est un exemple typique de ce que le programme attend : deux estimateurs sans biais, on calcule leurs variances, on tranche.
La moyenne empirique est le meilleur estimateur linéaire sans biais
On a vu que estime l'espérance sans biais. Mais ce n'est pas la seule combinaison des observations qui le fasse : l'estimateur convient aussi, et plus généralement toute moyenne pondérée dont les poids somment à . Le résultat suivant tranche entre tous ces candidats, et il illustre parfaitement la règle « à biais égal, on compare les variances ».
Propriété
Optimalité de la moyenne empirique. Soit un échantillon d'une loi d'espérance et de variance . Soient des réels et posons
a. L'estimateur est sans biais pour si et seulement si .
b. Sous cette condition, , et cette variance est minimale lorsque tous les poids sont égaux à , c'est-à-dire lorsque . Le minimum vaut alors .
Démonstration. a. Par linéarité de l'espérance, sans aucune hypothèse,
Le biais vaut donc . Il est nul pour toute valeur de si et seulement si : la condition est bien nécessaire, puisque le biais devrait s'annuler en particulier pour .
b. Les variables de l'échantillon sont indépendantes, donc les covariances sont nulles et
Il reste à minimiser sous la contrainte . Développons la quantité positive suivante, en utilisant la contrainte à la deuxième ligne :
Le membre de gauche est une somme de carrés, donc positif ou nul, d'où
avec égalité si et seulement si chaque carré est nul, c'est-à-dire si pour tout . La variance minimale vaut donc , et elle est atteinte uniquement pour la moyenne empirique.
Ce résultat justifie l'usage universel de : parmi toutes les façons de moyenner les observations sans introduire de biais, c'est celle qui fluctue le moins. Il justifie aussi, a posteriori, le rejet de l'estimateur évoqué plus haut : il correspond aux poids et pour , dont la somme des carrés vaut , soit fois le minimum. On notera que l'indépendance est indispensable au point b et inutile au point a, ce qui est la répartition habituelle des rôles entre espérance et variance.
Deux exemples entièrement traités
Exemple
a. Un comptage de clients. Le nombre de clients entrant dans une boutique en une minute est modélisé par une variable de loi , avec inconnu. On observe minutes indépendantes et l'on relève les comptages suivants.
| minute | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| clients |
L'estimateur. Comme pour une loi de Poisson, la moyenne empirique est un estimateur de . C'est bien une statistique : son expression ne contient pas . Il est sans biais, puisque , et sa variance vaut
en utilisant , propre à la loi de Poisson. Cette variance tend vers , donc la suite est convergente.
L'estimation. Le total observé vaut , donc l'estimation de est
On dira : « on estime à client par minute le paramètre de la loi de Poisson ». On n'écrira surtout pas « » sans préciser qu'il s'agit d'une valeur observée, ni « », qui n'a aucun sens.
Précision. L'écart-type de l'estimateur vaut , que l'on estime par . Autrement dit, avec seulement dix minutes d'observation, l'estimation est connue à quelques dixièmes près : c'est très imprécis, et il faudrait cent fois plus d'observations pour gagner un facteur dix sur cette incertitude.
Exemple
b. Des durées de vie, ou comment corriger un biais. La durée de vie d'un composant, exprimée en heures, suit la loi avec inconnu. On teste composants indépendants, et la durée de vie moyenne observée est de heures.
Estimation de la durée de vie moyenne. L'espérance de la loi vaut , et en est un estimateur sans biais, de variance
puisque pour la loi exponentielle. Cette variance tend vers , donc l'estimateur est convergent. L'estimation de est simplement heures.
Estimation du paramètre. Le paramètre lui-même est , ce qui suggère l'estimateur . Deux points sont à traiter.
La convergence est immédiate et ne demande aucun calcul : la loi faible des grands nombres donne , la fonction inverse est continue au point , qui est bien non nul, donc la propriété de composition donne
Le biais, lui, n'est pas nul : l'espérance d'un inverse n'est pas l'inverse de l'espérance. On admet le calcul, qui repose sur la loi gamma suivie par à un facteur près, et qui donne pour
Le biais est strictement positif, donc surestime systématiquement , et il tend vers : l'estimateur est asymptotiquement sans biais.
Correction du biais. Puisque le facteur multiplicatif fautif est , il suffit de le compenser. L'estimateur
vérifie : il est sans biais. Le procédé est exactement celui qui a transformé en .
Les nombres. L'estimation brute vaut panne par heure, et l'estimation corrigée
L'écart entre les deux est de l'ordre de , ce qui est exactement : négligeable ici, mais considérable si l'on n'avait testé que cinq composants.
Méthode
Méthode
Étudier un estimateur, du début à la fin. L'énoncé propose une statistique et demande ce qu'elle vaut comme estimateur de . La démarche est toujours la même, dans cet ordre.
1. Vérifier que c'est bien un estimateur. L'expression de ne doit contenir que les et des constantes connues, jamais . Une phrase suffit, mais elle n'est pas facultative quand l'énoncé propose plusieurs candidats dont l'un est piégé.
2. Calculer . On utilise la linéarité de l'espérance, qui ne demande aucune hypothèse, et l'identité de loi . Si n'est pas une fonction affine des , on passe par le théorème de transfert, ou par la loi de lorsqu'on sait la déterminer, ce qui est le cas pour un maximum ou un minimum.
3. En déduire le biais , puis conclure : sans biais si le biais est nul pour toute valeur de , asymptotiquement sans biais s'il tend vers , biaisé sinon. Préciser le signe du biais : il dit si l'estimateur surestime ou sous-estime.
4. Calculer . C'est ici, et seulement ici, que sert l'indépendance des variables de l'échantillon : elle annule les covariances et permet d'écrire la variance d'une somme comme somme des variances. Ne jamais l'invoquer à l'étape 2, où elle est inutile, ni l'oublier à l'étape 4, où elle est indispensable.
5. Conclure à la convergence par le critère : biais tendant vers et variance tendant vers . Rédiger l'inégalité de Bienaymé-Tchebychev si l'énoncé demande une démonstration complète, citer le critère sinon.
6. Comparer, si l'énoncé le demande, deux estimateurs sans biais par leurs variances, et conclure en faveur de celui dont la variance est la plus petite, en précisant à partir de quelle valeur de si le résultat en dépend.
Estimation par intervalle de confiance
Une estimation ponctuelle donne un nombre, par exemple , et ce nombre a un défaut rédhibitoire : il ne dit rien de sa propre précision. La vraie valeur de est-elle à près, ou à près ? Un sondage sur personnes et un sondage sur personnes peuvent donner la même estimation ponctuelle, et ils ne valent évidemment pas la même chose. L'objet de cette dernière partie est de remplacer le nombre par un intervalle, assorti d'une garantie chiffrée.
Définitions
Définition
Soit un paramètre inconnu et soit . Soient et deux statistiques construites sur un échantillon de taille , avec . On dit que est un intervalle de confiance pour au niveau de confiance lorsque
et ceci pour toute valeur possible de . Le réel s'appelle le risque.
Définition
Avec les mêmes notations, on dit que est un intervalle de confiance asymptotique pour au niveau de confiance lorsque
cette limite étant supposée exister.
La différence entre les deux définitions est capitale et elle est facile à énoncer. Un intervalle de confiance non asymptotique offre une garantie valable pour tout , y compris . Un intervalle de confiance asymptotique n'offre de garantie qu'à la limite : rien n'est promis à fixé, et l'on espère seulement que est assez grand pour que la limite soit une bonne approximation. Les deux méthodes ci-dessous produisent respectivement l'un et l'autre.
La phrase que les correcteurs attendent
Voici le point le plus délicat de tout le chapitre, et celui qui coûte le plus de points. Il faut prendre le temps de bien lire ce qui suit.
Le paramètre est un nombre fixé, inconnu de nous, mais parfaitement déterminé : la proportion d'électeurs favorables au candidat A à un instant donné est ce qu'elle est. Elle n'est pas aléatoire. Ce qui est aléatoire, ce sont les bornes et , qui dépendent de l'échantillon tiré : un autre sondage donnerait d'autres bornes.
L'énoncé se lit donc ainsi : l'intervalle aléatoire contient le nombre fixe dans au moins des échantillons possibles. C'est une propriété de la méthode, pas de l'intervalle particulier obtenu un jour donné.
Une fois l'échantillon observé, les bornes deviennent des nombres, par exemple , et il n'y a plus rien d'aléatoire nulle part. Le nombre appartient à cet intervalle, ou bien il ne lui appartient pas ; on ignore lequel des deux cas est réalisé, mais il n'y a plus de probabilité en jeu. Écrire « appartient à avec la probabilité » est donc incorrect, et c'est sanctionné.
La formulation attendue est du type : « au niveau de confiance , la proportion inconnue est estimée dans l'intervalle », ou, si l'on veut être complet : « cet intervalle a été obtenu par une méthode qui, répétée sur un grand nombre d'échantillons, produit un intervalle contenant la vraie valeur dans des cas ». La probabilité porte sur la méthode et sur l'échantillonnage, jamais sur le paramètre.
Méthode 1 : intervalle de confiance par Bienaymé-Tchebychev
Cette première méthode est non asymptotique : elle fournit une garantie valable pour toute taille d'échantillon. C'est sa force, et son prix est un intervalle assez large.
Propriété
Construction générale. Soit un estimateur sans biais de , admettant une variance majorée par un réel connu , c'est-à-dire . Alors, pour tout , l'intervalle
est un intervalle de confiance pour au niveau de confiance .
Démonstration. Posons . L'estimateur est sans biais, donc , et il admet une variance : l'inégalité de Bienaymé-Tchebychev s'applique autour de et donne
En passant à l'événement contraire,
Or l'événement équivaut à , donc il est inclus dans l'événement . La croissance de la probabilité donne finalement
ce qui est exactement la définition demandée.
Le point délicat de cette construction est la majoration de la variance par une quantité connue : si dépendait du paramètre inconnu, les bornes ne seraient pas des statistiques et l'intervalle serait incalculable. Dans le cas d'une proportion, cette majoration est fournie par le lemme suivant.
Propriété
Majoration fondamentale. Pour tout réel ,
avec égalité si et seulement si .
Démonstration. Pour tout réel ,
en reconnaissant une identité remarquable. L'inégalité en découle immédiatement, et le cas d'égalité correspond à l'annulation du carré, c'est-à-dire à .
Propriété
Intervalle de confiance pour une proportion, par Bienaymé-Tchebychev. Soit un échantillon de la loi , avec inconnu, et soit la fréquence empirique. Alors, pour tout ,
est un intervalle de confiance pour au niveau de confiance , valable pour tout entier .
Démonstration. L'estimateur est sans biais, d'espérance , et sa variance vaut . La majoration précédente donne
et cette borne ne dépend que de , donc elle est connue. La construction générale s'applique avec
ce qui donne l'intervalle annoncé.
On retiendra la structure du résultat : la demi-largeur vaut , elle décroît en , et elle grandit quand le risque diminue, ce qui est logique : exiger plus de confiance oblige à élargir l'intervalle.
Méthode 2 : intervalle de confiance asymptotique par le théorème limite central
La seconde méthode exploite l'information supplémentaire fournie par le théorème limite central : non seulement l'erreur est petite, mais on connaît sa loi. Elle donne des intervalles nettement plus courts, au prix d'une garantie seulement asymptotique.
Propriété
Construction générale. Soit un échantillon d'une loi d'espérance inconnue et d'écart-type connu. Alors, pour tout ,
est un intervalle de confiance asymptotique pour au niveau de confiance .
Démonstration. Posons . D'après le théorème limite central, .
Or les inégalités suivantes sont équivalentes, la quantité étant strictement positive :
la dernière équivalence s'obtenant en retranchant partout puis en multipliant par , ce qui inverse les inégalités et échange les deux bornes. Les deux événements extrêmes sont donc égaux, et ils ont la même probabilité :
Enfin, la convergence en loi de vers et la continuité de sur tout entier, qui garantit que tous les points sont des points de continuité, donnent
par définition de . La limite existe et vaut exactement : l'intervalle est donc bien un intervalle de confiance asymptotique au niveau .
La figure donne la lecture géométrique du procédé. Sous la densité de la loi , l'aire totale vaut . On découpe cette aire en trois morceaux : une aire centrale entre et , égale à , et deux queues symétriques de chacune. Choisir un niveau de confiance, c'est choisir la taille de l'aire centrale ; le quantile est simplement l'abscisse qui la délimite. On voit tout de suite pourquoi les intervalles s'allongent brutalement quand on exige beaucoup de confiance : la densité étant très faible sur les bords, il faut aller chercher loin pour grappiller les derniers pour-cents d'aire. Passer de à fait passer de à , soit un intervalle plus large pour seulement points de confiance supplémentaires.
Propriété
Intervalle de confiance asymptotique pour une proportion. Soit , soit un échantillon de la loi et . L'hypothèse est indispensable : c'est celle du théorème limite central de Bernoulli, sur lequel tout repose ici. Pour tout , chacun des deux intervalles suivants est un intervalle de confiance asymptotique pour au niveau :
Le premier s'obtient en majorant l'écart-type inconnu par , grâce au lemme : élargir l'intervalle ne peut qu'augmenter la probabilité de contenir , donc la garantie est conservée. Le second remplace par son estimation : ce remplacement est admis, il n'est pas une conséquence immédiate du théorème limite central. Le premier est plus simple et toujours valable ; le second est plus court dès que s'éloigne de , et c'est celui qu'utilisent les instituts de sondage.
Le cas où l'écart-type est inconnu
Dans la construction générale ci-dessus, l'écart-type était supposé connu, ce qui est rare : si l'on ignore l'espérance, on ignore en général aussi la variance. Le programme fournit la réponse, sous forme d'un résultat admis.
Propriété
Remplacement de l'écart-type (admis). Soit un échantillon d'une loi d'espérance inconnue et d'écart-type inconnu. On note l'écart-type empirique corrigé, racine carrée de la variance empirique corrigée ; ce symbole ne désigne pas la somme de la partie 5, qui ne réapparaît pas ici. Alors
et par conséquent
est un intervalle de confiance asymptotique pour au niveau de confiance .
Ce résultat est admis : sa démonstration combine la convergence en probabilité de vers avec un théorème de composition entre convergence en loi et convergence en probabilité, qui n'est pas au programme. Intuitivement, il dit qu'un estimateur convergent de peut prendre la place de sans changer la loi limite, ce qui est plausible mais pas évident.
Il faut noter que la loi limite reste la loi normale, et que le quantile utilisé reste : remplacer par son estimation ne change ni la loi limite, ni les tables à consulter. C'est cette version qui s'emploie dans la pratique, puisque l'écart-type théorique est presque toujours inconnu. On se gardera en revanche de croire que l'intervalle obtenu est aussi fiable que si était connu : deux approximations se superposent désormais, celle du théorème limite central et celle du remplacement de , et l'exigence sur la taille de l'échantillon en est renforcée d'autant.
Exemple
Un temps d'attente moyen. Dans une agence, on relève le temps d'attente de clients pris indépendamment. On observe une moyenne de minutes et un écart-type empirique corrigé de minute. On cherche un intervalle de confiance pour le temps d'attente moyen de l'agence.
Au niveau de confiance . On a et . L'écart-type de la moyenne empirique est estimé par
donc la demi-largeur vaut , et l'intervalle de confiance asymptotique est
Au niveau de confiance . Seul le quantile change : , donc la demi-largeur devient , et l'intervalle
Lecture. Aucune loi n'a été supposée pour le temps d'attente : ni exponentielle, ni normale. C'est tout le confort du théorème limite central, qui ne demande que l'existence d'une variance et une taille d'échantillon suffisante. On observe aussi le prix de la confiance : passer de à élargit l'intervalle d'environ , soit exactement le rapport . Enfin la formulation correcte de la conclusion est : « au niveau de confiance , le temps d'attente moyen de l'agence est estimé entre et minutes », et non « il y a de chances que soit entre et ».
Comparaison chiffrée des deux méthodes
Exemple
Un sondage. Un institut interroge personnes choisies indépendamment ; répondent oui. On souhaite un intervalle de confiance pour la proportion inconnue au niveau de confiance , donc avec . L'estimation ponctuelle est .
Méthode 1, par Bienaymé-Tchebychev. La demi-largeur vaut
L'intervalle de confiance est donc, en arrondissant vers l'extérieur pour ne pas perdre la garantie,
Méthode 2, par le théorème limite central. Avec et l'écart-type estimé , la demi-largeur vaut
L'intervalle de confiance asymptotique est donc
Si l'on avait préféré la version majorée, la demi-largeur aurait valu , donnant un intervalle pratiquement identique : c'est normal, puisque est proche de , valeur pour laquelle la majoration est une égalité.
Bilan. L'intervalle obtenu par le théorème limite central est plus de deux fois plus court que celui obtenu par Bienaymé-Tchebychev : points de pourcentage contre , soit un rapport de . Sur les mêmes données, la seconde méthode est donc bien plus informative. Le premier intervalle, lui, ne permet même pas d'affirmer que est inférieur à avec un doute raisonnable, alors que le second exclut nettement la barre des .
Et ce qu'on perd. Il faut le dire honnêtement : la garantie n'est pas de même nature. L'intervalle de Bienaymé-Tchebychev vérifie pour tout , y compris , sans aucune approximation. L'intervalle du théorème limite central ne vérifie cette propriété qu'à la limite : à fixé, la vraie probabilité de couverture peut être inférieure à , et aucun théorème du programme ne dit de combien. Pour et proche de , l'approximation est excellente ; pour ou pour très proche de , elle ne l'est pas du tout. C'est le compromis permanent de la statistique : la précision se paie en hypothèses.
Méthode
Construire un intervalle de confiance, dans l'ordre. L'énoncé donne un échantillon, un paramètre inconnu et un niveau de confiance. On procède ainsi.
1. Choisir l'estimateur ponctuel du paramètre, presque toujours ou la fréquence , et vérifier qu'il est sans biais. Toute la construction repose sur .
2. Choisir la méthode, en lisant l'énoncé. Les mots « pour tout », « sans approximation », « à l'aide de l'inégalité de Bienaymé-Tchebychev » imposent la méthode 1. Les mots « asymptotique », « pour grand », « à l'aide du théorème limite central » imposent la méthode 2. En l'absence d'indication, on choisit la méthode 2 si est grand, et l'on justifie le choix en une phrase.
3. Écrire l'inégalité de départ, et elle seule : Bienaymé-Tchebychev appliquée à autour de pour la méthode 1 ; le théorème limite central écrit sur la variable pour la méthode 2.
4. Éliminer le paramètre inconnu du rayon. C'est l'étape que l'on oublie. Le rayon de l'intervalle doit être calculable, donc ne contenir ni , ni inconnu. Deux issues : la majoration pour une proportion, ou le remplacement de par son estimation, résultat admis. Si le rayon contient encore le paramètre à la fin, l'intervalle n'est pas un intervalle de confiance.
5. Isoler au centre de l'encadrement, en transformant l'événement par équivalences successives, et conclure en donnant l'intervalle et son niveau.
6. Rédiger la conclusion en français, avec la formulation attendue : « au niveau de confiance , le paramètre est estimé dans ». Jamais de probabilité attribuée au paramètre.
Dimensionner un échantillon
La question inverse est au moins aussi fréquente : combien d'observations faut-il pour obtenir une précision donnée ? On se fixe une demi-largeur maximale, notée , et un niveau de confiance , et l'on résout en .
Méthode
Trouver la taille d'échantillon nécessaire. On veut une demi-largeur au plus égale à pour une proportion, au niveau de confiance .
Par Bienaymé-Tchebychev. On résout . En passant aux inverses, puis au carré, cela équivaut à
Par le théorème limite central. On résout , ce qui donne de la même façon
Dans les deux cas, on conclut par un entier : on prend pour le plus petit entier vérifiant l'inégalité, et l'on n'oublie pas que doit être entier, donc qu'un arrondi par excès s'impose. On retiendra la dépendance en , commune aux deux méthodes : diviser la marge d'erreur par deux exige de multiplier l'échantillon par quatre.
Exemple
Un sondage à deux points près. On veut estimer une proportion inconnue avec une demi-largeur , soit deux points de pourcentage, au niveau de confiance , donc et .
Par Bienaymé-Tchebychev.
Par le théorème limite central.
Commentaire. Il faut personnes pour une garantie valable à tout coup, contre pour une garantie asymptotique : cinq fois moins, ce qui n'est pas un hasard puisque le rapport des tailles est le carré du rapport des largeurs, soit . C'est très exactement la raison pour laquelle les instituts de sondage interrogent environ mille personnes : avec , la demi-largeur asymptotique majorée vaut
soit les fameux « trois points de marge d'erreur » que l'on entend commenter chaque soir d'élection. On peut vérifier au passage la promesse faite dans la partie 3 : pour la pièce équilibrée avec et , la méthode asymptotique donne , contre par Bienaymé-Tchebychev.
Ce qu'il faut retenir
Les deux convergences
| Convergence en probabilité | Convergence en loi | |
|---|---|---|
| Définition | pour tout | en tout point de continuité de |
| Ce qui converge | les variables elles-mêmes | les lois seulement |
| Espace | un espace commun est nécessaire | les peuvent vivre sur des espaces différents |
| Outil de preuve | inégalité de Bienaymé-Tchebychev | fonctions de répartition, ou critère entier |
| Théorème type | loi faible des grands nombres | théorème limite central |
| Usage | justifier qu'un estimateur est convergent | calculer une probabilité approchée, construire un intervalle asymptotique |
| Lien | entraîne la convergence en loi | n'entraîne la convergence en probabilité que si la limite est constante |
Les résultats à savoir citer
| Résultat | Énoncé | Statut |
|---|---|---|
| Markov | pour , | démontré |
| Bienaymé-Tchebychev | démontré | |
| Critère de convergence | et donnent | démontré |
| Loi faible des grands nombres | démontré | |
| Binomiale vers Poisson | démontré | |
| Géométrique vers exponentielle | pour | démontré |
| Théorème limite central | admis | |
| Opérations sur les convergences | somme, produit, composition continue | admises |
| Convergence en probabilité vers en loi | l'implication et son cas réciproque constant | admis |
| Remplacement de par | la loi limite reste | admis |
L'estimation en un tableau
| Notion | Définition | Ce qu'on en fait |
|---|---|---|
| Estimateur | statistique sans dans | c'est une variable aléatoire |
| Estimation | sur les données observées | c'est un nombre |
| Biais | nul : sans biais ; tend vers : asymptotiquement sans biais | |
| Convergence | acquise si biais et | |
| Comparaison | entre deux estimateurs sans biais | on garde celui de plus petite variance |
| estime | sans biais, , convergent | |
| estime | biais , asymptotiquement sans biais | |
| estime | sans biais | |
| IC par Bienaymé-Tchebychev | valable pour tout , mais large | |
| IC asymptotique par le TCL | court, mais garantie asymptotique seulement |
Quel outil pour quelle question
| Ce que l'énoncé demande | L'outil |
|---|---|
| de majorer , avec positive et seule connue | inégalité de Markov |
| de majorer la probabilité d'un écart à la moyenne | inégalité de Bienaymé-Tchebychev |
| de montrer qu'une suite converge en probabilité | critère : et |
| de montrer qu'une moyenne empirique tend vers l'espérance | loi faible des grands nombres |
| de montrer qu'une suite de lois discrètes tend vers une loi discrète | critère entier : |
| de montrer qu'une suite tend en loi vers une loi à densité | fonctions de répartition, avec passage par et |
| une probabilité approchée sur une somme, avec grand | théorème limite central, puis table de |
| si un estimateur est bon | biais, puis variance, puis convergence |
| de départager deux estimateurs sans biais | comparaison des variances |
| un intervalle valable pour tout | Bienaymé-Tchebychev, avec |
| un intervalle asymptotique, ou le plus court possible | théorème limite central, avec le quantile |
| la taille d'échantillon nécessaire | on écrit la demi-largeur, on la majore par , on résout en |
Les erreurs classiques
Erreur 1. Confondre convergence en loi et convergence en probabilité. Ce sont deux notions distinctes, et une seule implication les relie : en probabilité entraîne en loi, jamais l'inverse, sauf si la limite est une constante. Le contre-exemple uniforme sur et doit pouvoir s'écrire de mémoire en quatre lignes. Concrètement, on n'écrit jamais que le théorème limite central donne une convergence en probabilité, et l'on n'écrit jamais que la loi faible des grands nombres donne une loi limite : elle donne une limite constante, ce qui n'a rien à voir.
Erreur 2. Oublier la valeur absolue dans l'inégalité de Bienaymé-Tchebychev. L'inégalité majore , jamais ni . Si l'énoncé demande une majoration unilatérale, il faut passer par l'inclusion et le dire. Sans cette ligne, la majoration est simplement fausse.
Erreur 3. Appliquer l'inégalité de Markov à une variable qui n'est pas positive. L'hypothèse de positivité est utilisée dans la démonstration au moment où l'on retire des termes de la somme, et elle est indispensable. Une variable centrée, une différence, un écart signé ne sont pas positifs. En revanche, leur carré l'est toujours, et c'est exactement l'astuce qui fait passer de Markov à Bienaymé-Tchebychev.
Erreur 4. Écrire « appartient à l'intervalle avec la probabilité ». Une fois l'échantillon observé, l'intervalle est un intervalle de nombres et est un nombre : il y appartient ou il n'y appartient pas, sans probabilité. La probabilité porte sur l'intervalle aléatoire, avant observation, donc sur la méthode. La formule correcte est « au niveau de confiance , est estimé dans ». C'est une phrase, elle s'apprend, et elle rapporte des points chaque année.
Erreur 5. Approcher sans vérifier les conditions. Remplacer une loi binomiale par une loi de Poisson ou par une loi normale suppose des conditions sur , et , et l'énoncé les rappelle presque toujours. Les écrire et les vérifier prend deux lignes et fait partie de la question. On n'oubliera pas non plus que ces seuils sont des usages et non des théorèmes, et qu'il faut suivre ceux de l'énoncé plutôt que ceux d'un autre manuel.
Erreur 6. Oublier le facteur dans le théorème limite central. La variable qui converge en loi est , avec un au dénominateur, et non ni . Le contrôle est immédiat et il faut le faire systématiquement : la variable candidate doit être centrée réduite, donc on vérifie que sa variance vaut . Sous l'autre forme, le dénominateur est , avec le au numérateur de la fraction complète : c'est l'écart-type de , pas celui de .
Erreur 7. Confondre et . La variance empirique divise par et elle est biaisée ; la variance empirique corrigée divise par et elle est sans biais. Le lien est , et la relation à retenir est . On se rappellera aussi que n'est pas le carré de la somme : c'est un symbole global, qui désigne une variance.
Bloqué sur « Probabilités : convergences et estimation » ?
On peut le travailler ensemble dès cette semaine. La première heure est offerte — on fait le point honnêtement, et vous repartez au minimum avec une méthode.