PASCAL YIM / apprendreÉvaluer les modèles

ÉVALUATION / 07 · EXPLICATION

Validation croisée en cinq plis

Les données de développement sont réparties en cinq blocs. Chaque bloc est réservé une fois pour la validation.

FONCTIONNEMENT

À chaque passage, un modèle neuf est appris sur les quatre autres blocs. Chaque observation est évaluée une fois dans le découpage à cinq plis, sans avoir participé à l’ajustement du modèle qui la prédit.

Cinq blocs de données · passage 1/5

Bloc 1Validation
Bloc 2Entraînement
Bloc 3Entraînement
Bloc 4Entraînement
Bloc 5Entraînement

Un nouveau modèle est ajusté sur les quatre blocs d’entraînement, puis évalué sur le bloc réservé.

scikit-learn · validation croisée ↗

À retenir

  1. 01

    Les cinq scores décrivent la variabilité selon les blocs réservés.

  2. 02

    KFold(shuffle=True, random_state=42) mélange avant de former les blocs ; KFold sans shuffle conserve l’ordre des lignes.

  3. 03

    RepeatedKFold permet plusieurs partitions en plis. Cela coûte davantage de calculs et ne remplace pas un test final indépendant.

  4. 04

    Des groupes ou des dates imposent des schémas de validation adaptés : GroupKFold ou TimeSeriesSplit, par exemple.

Les slides d’explication ne donnent pas lieu à une validation de code.

Parcours · chapitres

Entraînement, test, fuites de données et validation croisée.

01 / Rappels de Python

02 / Classes et objets en Python

03 / Pandas et DataFrames

04 / Régression linéaire et métriques

05 / Régressions multiple et polynomiale

06 / Évaluer les modèles

07 / KNN et normalisation

Quiz de synthèse · 24 questions →Rejoindre une session →