PASCAL YIM / apprendreÉvaluer les modèles

ÉVALUATION / 06 · EXPLICATION

Les fuites de données

Une fuite se produit lorsque l’apprentissage profite d’informations qui ne seraient pas disponibles au moment d’une vraie prédiction.

FONCTIONNEMENT

Il faut séparer les données avant d’apprendre une transformation. Calculer une moyenne de normalisation sur l’ensemble complet fait déjà intervenir les observations de test.

scikit-learn · fuites de données ↗

À retenir

  1. 01

    Exemple direct : inclure Rings dans X pour prédire Rings, ou price dans X pour prédire price.

  2. 02

    Exemple indirect : ajuster un scaler ou une sélection de caractéristiques avant de réserver le test.

  3. 03

    Des doublons ou plusieurs observations du même objet peuvent aussi traverser la séparation : un découpage par groupes est alors nécessaire.

  4. 04

    Pour une série temporelle, prévoir le futur exige une séparation chronologique ; un mélange aléatoire peut divulguer le futur.

  5. 05

    Consulter le test à répétition pour choisir un modèle le transforme en outil de sélection. La validation croisée doit porter sur les données de développement, avec un test final réservé.

Les slides d’explication ne donnent pas lieu à une validation de code.

Parcours · chapitres

Entraînement, test, fuites de données et validation croisée.

01 / Rappels de Python

02 / Classes et objets en Python

03 / Pandas et DataFrames

04 / Régression linéaire et métriques

05 / Régressions multiple et polynomiale

06 / Évaluer les modèles

07 / KNN et normalisation

Quiz de synthèse · 24 questions →Rejoindre une session →