PASCAL YIM / apprendreÉvaluer les modèles

ÉVALUATION / 09 · EXERCICE

Exercice · prédire le prix des maisons

house_mini contient 21 613 ventes. price est la cible ; sqft_living et sqft_lot sont des surfaces en pieds carrés.

EXPLICATION DU CODE

bedrooms, bathrooms et floors décrivent le logement. zipcode est volontairement exclu : un code postal est une catégorie, et une différence numérique entre codes ne représente pas une distance géographique pertinente.

Exemple expliqué

  1. 1
    X = df[["sqft_living", "bedrooms", "bathrooms", "floors", "sqft_lot"]]
    y = df["price"]

    Les mêmes caractéristiques seront reprises dans les comparaisons suivantes.

  2. 2
    X_dev, X_final, y_dev, y_final = train_test_split(
        X, y, test_size=0.2, random_state=42)

    20 % des lignes sont réservées au test final. Les comparaisons par validation croisée utilisent seulement X_dev et y_dev.

  3. 3
    scores = -cross_val_score(LinearRegression(), X_dev, y_dev,
        cv=cv, scoring="neg_root_mean_squared_error", n_jobs=1)

    Les erreurs sont en unités de prix du fichier, décrites comme des dollars dans le notebook.

Exemple de référence · La consultation conserve le crédit de l’exercice.
EXERCICE / PYTHON

Code à compléter

Réserver 20 % en test final, puis calculer scores par validation croisée à cinq plis sur le développement et afficher moyenne et dispersion.

Saisie autonome · crédit complet après réussite

Le résultat apparaîtra ici.
Session Python

Les variables restent disponibles entre les pages. Un rechargement efface les variables ; le code et l’utilisation de l’aide restent enregistrés dans cet onglet.

Parcours · chapitres

Entraînement, test, fuites de données et validation croisée.

01 / Rappels de Python

02 / Classes et objets en Python

03 / Pandas et DataFrames

04 / Régression linéaire et métriques

05 / Régressions multiple et polynomiale

06 / Évaluer les modèles

07 / KNN et normalisation

Quiz de synthèse · 24 questions →Rejoindre une session →