La régression linéaire :
prédire l’avenir avec une droite
Une vendeuse de tomates au marché de Dantokpa le fait intuitivement chaque matin. Un data scientist le fait avec Python. Et Galton l’a découvert au XIXe siècle en étudiant la taille des pères et de leurs fils. C’est la régression linéaire — l’un des outils les plus puissants et les plus élégants des mathématiques appliquées.
Chaque matin au marché de Dantokpa à Cotonou, Mama Adjoavi regarde ses stocks de tomates, observe les prix des jours précédents, et décide combien vendre aujourd’hui pour maximiser ses bénéfices. Elle ne le sait pas, mais elle fait de la régression linéaire — instinctivement, dans sa tête.
La régression linéaire, c’est l’art de trouver la droite qui passe au plus près d’un nuage de points. C’est simple à comprendre, puissant à utiliser, et c’est la porte d’entrée de toute la data science moderne.
L’histoire : Galton et les fils qui ressemblent à leurs pères
En 1886, le statisticien britannique Francis Galton étudie un phénomène curieux : les fils de pères très grands sont souvent grands, mais rarement aussi grands que leurs pères. Et les fils de pères très petits sont souvent petits, mais rarement aussi petits.
Il appelle ce phénomène la « régression vers la moyenne » — les valeurs extrêmes tendent à revenir vers la moyenne de la population. Pour modéliser cette relation entre la taille du père et celle du fils, il invente une méthode graphique : tracer la droite qui résume le mieux la relation entre deux variables.
Né d’une observation biologique sur des familles anglaises du XIXe siècle, cet outil voyage aujourd’hui dans les algorithmes de Netflix, les modèles météo de l’ASECNA, et les prédictions de récolte des agriculteurs béninois.
L’intuition : une droite dans un nuage
Imagine que tu collectes des données dans un village agricole du Borgou : la quantité de pluie (en mm) et la production de maïs (en kg) pour 6 saisons consécutives.
| Saison | Pluie (mm) — x | Maïs (kg) — y |
|---|---|---|
| 1 | 100 | 200 |
| 2 | 150 | 280 |
| 3 | 200 | 350 |
| 4 | 120 | 230 |
| 5 | 180 | 320 |
| 6 | 250 | 420 |
Si tu traces ces points sur un graphe, tu verras qu’ils forment un nuage avec une tendance claire : plus il pleut, plus la production est élevée. La régression linéaire consiste à trouver la droite qui résume le mieux cette tendance.
La formule : d’où vient cette droite ?
La droite de régression s’écrit :
Où :
ŷ (y chapeau) = la valeur prédite par le modèle
x = la variable d’entrée (ici, la quantité de pluie)
a = la pente de la droite (combien y augmente quand x augmente de 1)
b = l’ordonnée à l’origine (valeur de y quand x = 0)
Pour trouver les valeurs de a et b qui donnent la meilleure droite possible, on utilise la méthode des moindres carrés : on minimise la somme des carrés des écarts entre les valeurs réelles et les valeurs prédites.
Les formules mathématiques pour calculer a et b sont :
Application : les données du Borgou
Reprenons nos données agricoles et calculons a et b :
| x | y | x – x̄ | y – ȳ | (x-x̄)(y-ȳ) | (x-x̄)² |
|---|---|---|---|---|---|
| 100 | 200 | -66,7 | -100 | 6670 | 4448,9 |
| 150 | 280 | -16,7 | -20 | 334 | 278,9 |
| 200 | 350 | 33,3 | 50 | 1665 | 1108,9 |
| 120 | 230 | -46,7 | -70 | 3269 | 2180,9 |
| 180 | 320 | 13,3 | 20 | 266 | 176,9 |
| 250 | 420 | 83,3 | 120 | 9996 | 6938,9 |
| x̄=166,7 | ȳ=300 | — | — | ∑=22200 | ∑=15133 |
Interprétation concrète : chaque millimètre de pluie supplémentaire apporte environ 1,47 kg de maïs en plus. Si la météo annonce 220 mm de pluie pour la prochaine saison, on prédit : ŷ = 1,47 × 220 + 54,9 ≈ 378 kg de maïs.
Et maintenant, avec Python
Faire ces calculs à la main, c’est bien pour comprendre. Mais en pratique, on utilise Python. Voici comment faire la même chose en quelques lignes :
Pente a = 1.47 → identique à notre calcul manuel ✅
Ordonnée b = 54.90 → identique aussi ✅
Prédiction pour 220mm : 378 kg
Les limites à connaître
La régression linéaire est puissante, mais elle n’est pas magique. Voici ce qu’il faut garder en tête :
1. Elle suppose une relation linéaire. Si la vraie relation est courbe, la droite sera une mauvaise approximation.
2. Elle est sensible aux valeurs aberrantes. Un point très éloigné des autres peut tirer la droite vers lui.
3. Corrélation ≠ causalité. Ce que la pluie et le maïs ont en commun ne prouve pas que l’un cause l’autre — même si ici c’est logique !
4. Ne pas extrapoler trop loin. Prédire pour 2000 mm de pluie avec un modèle calibré entre 100 et 250 mm serait hasardeux.
Tous les modèles sont faux, mais certains sont utiles. — George Box, statisticien britannique
✏️ Exercice corrigé
Un vendeur de sachets d’eau à Cotonou note ses ventes sur 5 jours de forte chaleur :
Température (°C) : 32, 34, 36, 35, 38
Sachets vendus : 120, 145, 170, 158, 200
a) Calcule la moyenne de x (température) et de y (sachets).
b) Calcule la pente a de la droite de régression.
c) Si demain la température atteint 40°C, combien de sachets faut-il prévoir ?
a) x̄ = (32+34+36+35+38)/5 = 175/5 = 35°C
ȳ = (120+145+170+158+200)/5 = 793/5 = 158,6 sachets
b) Calcul de a :
∑(xᵢ-x̄)(yᵢ-ȳ) = (-3)(-38,6)+(-1)(-13,6)+(1)(11,4)+(0)(-0,6)+(3)(41,4)
= 115,8 + 13,6 + 11,4 + 0 + 124,2 = 265
∑(xᵢ-x̄)² = 9+1+1+0+9 = 20
a = 265/20 = 13,25
b = 158,6 – 13,25 × 35 = 158,6 – 463,75 = -305,15
c) ŷ = 13,25 × 40 – 305,15 = 530 – 305,15 ≈ 225 sachets à prévoir ✅
Ce qu’on retient
La régression linéaire, c’est le pont entre les mathématiques pures et la data science. Elle transforme un nuage de points chaotique en une droite qui prédit, qui explique, qui décide. De Galton aux marchés de Cotonou, en passant par les champs du Borgou, c’est le même outil — élégant, simple, universel.
Et le plus beau ? Tu viens de comprendre le fondement mathématique d’algorithmes qui font tourner des entreprises valant des milliards. Pas mal pour une droite.
Dans le prochain article, nous découvrirons pourquoi les abeilles construisent des hexagones — et ce que ça nous apprend sur l’optimisation mathématique. Un problème que les abeilles ont résolu bien avant les ingénieurs.