↓ Aller au contenu

Loi binomiale négative

La loi binomiale négative modélise le nombre d’essais de Bernoulli indépendants nécessaires pour obtenir un nombre fixé de succès, lorsque chaque essai possède la même probabilité de succès \(p\).

Question type : une expérience succès/échec est répétée jusqu’à obtenir \(r\) succès. Combien d’essais faudra-t-il réaliser ?

Exemples : nombre d’appels nécessaires pour obtenir 5 ventes, nombre de lancers avant d’obtenir 3 fois un six, nombre de candidats interrogés avant d’obtenir 10 réponses positives.

🎯 Définition
#


On répète des expériences de Bernoulli indépendantes ayant toutes :

  • une probabilité de succès \(p\) ;
  • une probabilité d’échec \(1-p\).

On arrête l’expérience lorsque le \(r\)-ième succès est obtenu.

Si \(X\) représente le nombre total d’essais nécessaires pour obtenir \(r\) succès, alors :

\[ X \sim \operatorname{NegBin}(r,p) \]

avec :

\[ r\in{1,2,3,\ldots} \]

et :

\[ p\in(0,1] \]

Le support de \(X\) est :

\[ X\in{r,r+1,r+2,\ldots} \]

Il faut en effet réaliser au minimum \(r\) essais pour obtenir \(r\) succès.

⚠️ Deux conventions existent
#


Comme pour la loi géométrique, la loi binomiale négative possède plusieurs conventions.

Nombre total d’essais jusqu’au \(r\)-ième succès
#

C’est la convention utilisée dans cette fiche.

La variable \(X\) représente :

\[ X=\text{nombre total d’essais} \]

et :

\[ X\in{r,r+1,r+2,\ldots} \]

Nombre d’échecs avant le \(r\)-ième succès
#

Une autre convention définit une variable \(Y\) représentant uniquement le nombre d’échecs :

\[ Y\in{0,1,2,\ldots} \]

Les deux variables sont reliées par :

\[ X=Y+r \]

car les \(X\) essais contiennent nécessairement :

  • \(r\) succès ;
  • \(Y\) échecs.

Réflexe : toujours vérifier ce que compte exactement la variable aléatoire avant d’utiliser une formule ou une bibliothèque.

📐 Fonction de masse
#


Pour que le \(r\)-ième succès se produise exactement au \(k\)-ième essai :

  • le \(k\)-ième essai doit être un succès ;
  • parmi les \(k-1\) essais précédents, il doit y avoir exactement \(r-1\) succès.

La probabilité est donc :

\[ P(X=k)
#

\binom{k-1}{r-1} p^r (1-p)^{k-r} \]

avec :

\[ k\in{r,r+1,\ldots} \]

La formule peut se comprendre comme :

\[ \underbrace{\binom{k-1}{r-1}}{\text{position des \(r-1\) premiers succès}} \underbrace{p^r}{\text{\(r\) succès}} \underbrace{(1-p)^{k-r}}_{\text{\(k-r\) échecs}} \]

Le dernier essai n’est pas libre : il doit nécessairement correspondre au \(r\)-ième succès.

💡 Comprendre la formule
#


Supposons que l’on souhaite obtenir le troisième succès exactement au cinquième essai.

Le dernier essai doit nécessairement être un succès :

\[ _ \quad _ \quad _ \quad _ \quad S \]

Parmi les quatre premiers essais, il faut donc placer exactement deux succès.

Le nombre de configurations possibles est :

\[ \binom{4}{2}=6 \]

Par exemple :

\[ S,S,E,E,S \]

\[ S,E,S,E,S \]

\[ E,S,E,S,S \]

et ainsi de suite.

Chaque séquence contient :

  • 3 succès ;
  • 2 échecs.

Sa probabilité est donc :

\[ p^3(1-p)^2 \]

et les six configurations donnent :

\[ P(X=5) = \binom{4}{2}p^3(1-p)^2 \]

📊 Espérance et variance
#


Espérance
#

Avec la convention utilisée dans cette fiche :

\[ \mathbb{E}[X] = \frac{r}{p} \]

L’espérance représente le nombre moyen d’essais nécessaires pour obtenir \(r\) succès.

Par exemple, pour :

\[ r=5 \]

et :

\[ p=0.2 \]

on obtient :

\[ \mathbb{E}[X] = \frac{5}{0.2} = 25 \]

Il faudra donc en moyenne 25 essais pour obtenir 5 succès.

Variance
#

\[ \operatorname{Var}(X) = \frac{r(1-p)}{p^2} \]

et donc :

\[ \sigma_X = \frac{\sqrt{r(1-p)}}{p} \]

Pour \(r=5\) et \(p=0.2\) :

\[ \operatorname{Var}(X) = \frac{5(1-0.2)}{0.2^2} = 100 \]

et :

\[ \sigma_X=10 \]

💡 Exemple
#


Un commercial possède une probabilité de conclure une vente de :

\[ p=0.2 \]

pour chaque prospect contacté.

On suppose que :

  • chaque prospect achète ou n’achète pas ;
  • les décisions sont indépendantes ;
  • la probabilité de vente reste constante.

Le commercial souhaite obtenir 3 ventes.

On définit \(X\) comme le nombre de prospects qu’il devra contacter jusqu’à obtenir sa troisième vente.

Alors :

\[ X\sim\operatorname{NegBin}(3,0.2) \]

Probabilité d’obtenir la troisième vente au 5e prospect
#

On cherche :

\[ P(X=5) \]

La formule donne :

\[ P(X=5) = \binom{4}{2} (0.2)^3 (0.8)^2 \]

soit :

\[ P(X=5) = 6 \times 0.008 \times 0.64 \]

et donc :

\[ P(X=5) = 0.03072 \]

Il y a donc environ 3,07 % de probabilité que la troisième vente soit obtenue exactement avec le cinquième prospect.

Nombre moyen de prospects nécessaires
#

\[ \mathbb{E}[X] = \frac{3}{0.2} = 15 \]

Il faudra donc en moyenne contacter 15 prospects pour obtenir 3 ventes.

🔄 Une somme de lois géométriques
#


La loi binomiale négative peut également être comprise comme une somme de variables géométriques.

Supposons que :

  • \(G_1\) représente le nombre d’essais jusqu’au premier succès ;
  • \(G_2\) le nombre d’essais supplémentaires entre le premier et le deuxième succès ;
  • …
  • \(G_r\) le nombre d’essais supplémentaires jusqu’au \(r\)-ième succès.

Alors :

\[ G_1,\ldots,G_r \sim \operatorname{Geom}(p) \]

et :

\[ X=G_1+\cdots+G_r \]

suit une loi binomiale négative.

Cette relation permet notamment de retrouver facilement son espérance :

\[ \mathbb{E}[X] = \mathbb{E}[G_1]+\cdots+\mathbb{E}[G_r] \]

or :

\[ \mathbb{E}[G_i] = \frac{1}{p} \]

donc :

\[ \mathbb{E}[X] = \frac{r}{p} \]

✅ Quand utiliser une loi binomiale négative ?
#


La loi binomiale négative est adaptée lorsque :

  1. on répète une expérience ayant exactement deux issues ;
  2. les essais sont indépendants ;
  3. la probabilité de succès \(p\) reste constante ;
  4. on fixe à l’avance un nombre de succès \(r\) à atteindre ;
  5. on cherche combien d’essais seront nécessaires pour atteindre ces \(r\) succès.

Le nombre total d’essais est donc aléatoire.

⚠️ Quand ne pas l’utiliser ?
#


La loi binomiale négative ne convient pas directement lorsque :

  • la probabilité de succès change entre les essais ;
  • les essais ne sont pas indépendants ;
  • on fixe le nombre d’essais et cherche combien de succès seront obtenus ;
  • on s’intéresse uniquement au premier succès, auquel cas la loi géométrique suffit ;
  • le phénomène étudié ne peut pas être représenté par une succession d’essais succès/échec indépendants.

🔗 Relations avec les autres lois
#


Bernoulli → Binomiale négative
#

Chaque essai élémentaire est une expérience de Bernoulli :

\[ X_i\sim\operatorname{Bernoulli}(p) \]

On répète ces expériences jusqu’à obtenir \(r\) succès.

Géométrique → Binomiale négative
#

La loi géométrique est un cas particulier de la loi binomiale négative.

Pour :

\[ r=1 \]

on obtient :

\[ \operatorname{NegBin}(1,p) = \operatorname{Geom}(p) \]

La géométrique répond donc à :

Combien d’essais jusqu’au premier succès ?

La binomiale négative généralise la question :

Combien d’essais jusqu’au \(r\)-ième succès ?

Binomiale vs Binomiale négative
#

Malgré leurs noms proches, les deux lois inversent ce qui est fixé et ce qui est aléatoire.

Loi binomiale :

\[ \boxed{\text{nombre d’essais fixé}} \]

\[ \downarrow \]

\[ \text{nombre de succès aléatoire} \]

Loi binomiale négative :

\[ \boxed{\text{nombre de succès fixé}} \]

\[ \downarrow \]

\[ \text{nombre d’essais aléatoire} \]

C’est un moyen simple de distinguer les deux.

📈 Une autre utilisation : données de comptage
#


La loi binomiale négative apparaît également dans un contexte différent : la modélisation de données de comptage.

Une loi de Poisson possède la propriété :

\[ \mathbb{E}[X] = \operatorname{Var}(X) \]

Or, dans de nombreux jeux de données réels, on observe plutôt :

\[ \operatorname{Var}(X) > \mathbb{E}[X] \]

Ce phénomène est appelé surdispersion.

La loi binomiale négative est alors fréquemment utilisée comme alternative à la loi de Poisson, notamment dans les modèles de régression pour données de comptage.

Cette utilisation repose sur une autre paramétrisation de la loi binomiale négative, mais il s’agit de la même famille de distributions.

🐍 En Python
#


Avec SciPy, il faut être particulièrement attentif à la convention utilisée.

scipy.stats.nbinom représente le nombre d’échecs observés avant d’obtenir \(r\) succès.

from scipy.stats import nbinom

r = 3
p = 0.2

distribution = nbinom(n=r, p=p)

print(distribution.mean())
print(distribution.var())

L’espérance renvoyée par SciPy correspond donc au nombre moyen d’échecs :

\[ \mathbb{E}[Y] = \frac{r(1-p)}{p} \]

Pour retrouver le nombre total moyen d’essais utilisé dans cette fiche :

\[ X=Y+r \]

On peut donc écrire :

mean_trials = distribution.mean() + r

print(mean_trials)

Pour calculer la probabilité que le troisième succès arrive exactement au cinquième essai, il faut comprendre que cela correspond à :

\[ 5-3=2 \]

échecs avant le troisième succès.

On écrit donc :

probability = distribution.pmf(2)

print(probability)

On peut également simuler les nombres d’échecs :

failures = nbinom.rvs(n=3, p=0.2, size=1000)

et obtenir le nombre total d’essais avec :

trials = failures + 3

🧠 À retenir
#


PropriétéLoi binomiale négative
TypeDiscrète
ExpérienceRépétition d’essais succès / échec
Arrêt\(r\)-ième succès
Variable étudiée iciNombre total d’essais
Valeurs possibles\(r,r+1,r+2,\ldots\)
Paramètres\(r,p\)
Fonction de masse\(\displaystyle \binom{k-1}{r-1}p^r(1-p)^{k-r}\)
Espérance\(\displaystyle \frac{r}{p}\)
Variance\(\displaystyle \frac{r(1-p)}{p^2}\)
Cas particulierLoi géométrique pour \(r=1\)
Autre usage importantComptages surdispersés

Réflexe : essais de Bernoulli indépendants répétés jusqu’à obtenir \(r\) succès, et on compte le nombre d’essais nécessaires → penser loi binomiale négative.

Thibault CLEMENT - Intechnia
Auteur
Thibault CLEMENT - Intechnia
Data Scientist / ML Engineer