Cours public de démonstration

Profil simulé · débutant · style équilibré

Cet exemple est volontairement stocké en dur pour rester disponible pendant la démonstration. Une génération réelle adapte le contenu au profil et à l’intention propres à l’utilisateur.

Cours

Prédire une valeur avec la régression linéaire

Débutant40 minmachine_learning.linear_regressionIntention : Comprendredemo-static-v1

Cours généré

Prédire une valeur avec la régression linéaire

Objectifs du cours

À la fin de ce cours, vous saurez expliquer une régression linéaire, interpréter ses coefficients, entraîner un modèle avec scikit-learn et choisir une métrique d'évaluation adaptée.

1. Le problème : prédire un nombre

Supposons que vous vouliez estimer le prix d'un appartement à partir de sa surface. Les observations forment un nuage de points : chaque appartement possède une surface et un prix. La régression linéaire cherche la droite qui résume au mieux leur tendance.

Le modèle à une variable s'écrit simplement : prédiction = coefficient × surface + constante.

Le coefficient indique de combien la prédiction varie lorsque la surface augmente d'une unité. La constante correspond à la valeur prédite lorsque la surface vaut zéro ; elle est utile au calcul, même si son interprétation métier n'est pas toujours pertinente.

2. Résidu et erreur quadratique

Pour chaque appartement, le résidu est la différence entre le prix réel et le prix prédit. Une bonne droite produit globalement de petits résidus.

La méthode des moindres carrés choisit les paramètres qui minimisent la moyenne des résidus au carré, appelée MSE. Le carré empêche les erreurs positives et négatives de s'annuler et pénalise davantage les grosses erreurs.

3. De la droite au modèle multivariable

Un prix dépend rarement de la seule surface. On peut ajouter le nombre de pièces, l'âge du bâtiment ou la distance au centre. Le principe reste identique : chaque variable reçoit un coefficient.

Un coefficient positif signifie que la prédiction augmente lorsque cette variable augmente, toutes choses égales par ailleurs.

Un coefficient négatif signifie que la prédiction diminue.

La taille du coefficient ne se compare directement à une autre que si les unités et les échelles sont prises en compte.

Attention : un coefficient décrit une association apprise dans les données. Il ne prouve pas à lui seul qu'une variable cause le résultat.

4. Entraîner et évaluer avec scikit-learn

pythonfrom sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_absolute_error, r2_score
from sklearn.model_selection import train_test_split

features = data[["surface", "rooms", "distance_center"]]
target = data["price"]

X_train, X_test, y_train, y_test = train_test_split(
    features, target, test_size=0.2, random_state=42
)

model = LinearRegression()
model.fit(X_train, y_train)
predictions = model.predict(X_test)

print("MAE :", mean_absolute_error(y_test, predictions))
print("R²  :", r2_score(y_test, predictions))
print("Coefficients :", dict(zip(features.columns, model.coef_)))

La MAE est l'erreur absolue moyenne, exprimée dans la même unité que la cible. Si la MAE vaut 15 000 euros, la prédiction s'écarte en moyenne d'environ 15 000 euros. Le score R² indique la part de variabilité expliquée par le modèle ; une valeur proche de 1 est généralement meilleure, mais doit toujours être replacée dans le contexte.

5. Vérifier les hypothèses utiles

La relation entre les variables et la cible doit être raisonnablement linéaire.

Les erreurs ne devraient pas former un motif évident selon la valeur prédite.

Quelques valeurs extrêmes peuvent fortement déplacer la droite.

Deux variables presque redondantes rendent l'interprétation de leurs coefficients instable.

Un graphique des résidus aide à repérer une courbure oubliée, une variance qui augmente ou des observations atypiques.

6. Erreurs fréquentes

Utiliser le jeu de test pendant les choix de conception fausse l'évaluation finale.

Interpréter R² comme un pourcentage de prédictions exactes est incorrect.

Extrapoler loin en dehors des valeurs observées est risqué.

Confondre corrélation et causalité mène à des conclusions injustifiées.

Mini-exercice

Entraînez d'abord un modèle avec la seule surface, puis ajoutez le nombre de pièces. Comparez la MAE sur le même jeu de test et observez l'évolution des coefficients. Expliquez en une phrase si la nouvelle variable apporte une information utile.

Quiz final

Quiz final · 3 questions

0/3 répondues

Que représente un résidu ?

Pourquoi calculer la MAE sur le jeu de test ?

Un coefficient positif prouve-t-il une causalité ?

À retenir

La régression linéaire ajuste une relation simple et interprétable. Sa simplicité est une force : elle fournit une excellente référence, à condition d'évaluer sur des données séparées et de contrôler les résidus.