PASCAL YIM / apprendreKNN et normalisation

KNN / 03 · EXPLICATION

Pourquoi mettre les caractéristiques à l’échelle ?

Une distance additionne des écarts entre coordonnées. Des unités très différentes peuvent déséquilibrer cette comparaison.

FONCTIONNEMENT

Dans house_mini, une différence de plusieurs milliers de pieds carrés sur sqft_lot peut dominer une différence de deux chambres. Le voisinage reflète alors surtout les grandes échelles numériques.

xj′=xj−min⁡train(xj)max⁡train(xj)−min⁡train(xj)x_j^{\prime}=\frac{x_j-\min_{train}(x_j)}{\max_{train}(x_j)-\min_{train}(x_j)}

Min–max : l’entraînement est entre 0 et 1 ; une nouvelle observation peut sortir de cet intervalle.

zj=xj−μtrain,jσtrain,jz_j=\frac{x_j-\mu_{train,j}}{\sigma_{train,j}}

Standardisation : moyenne 0 et écart type 1 sur l’entraînement pour une colonne non constante. Ici σ est calculé avec ddof=0.

À retenir

  1. 01

    MinMaxScaler exprime chaque caractéristique relativement à son minimum et à son étendue d’entraînement.

  2. 02

    StandardScaler centre chaque caractéristique et la divise par son écart type d’entraînement. Cela n’impose pas une distribution normale.

  3. 03

    La mise à l’échelle ne garantit pas une meilleure performance : elle change la notion de proximité, qui doit être évaluée.

  4. 04

    Les valeurs extrêmes influencent les minima, maxima, moyennes et écarts types.

  5. 05

    Ni la cible ni le test ne servent à calculer les paramètres du scaler.

Les slides d’explication ne donnent pas lieu à une validation de code.

Parcours · chapitres

Voisins, scalers, pipelines et comparaison sur les maisons.

01 / Rappels de Python

02 / Classes et objets en Python

03 / Pandas et DataFrames

04 / Régression linéaire et métriques

05 / Régressions multiple et polynomiale

06 / Évaluer les modèles

07 / KNN et normalisation

Quiz de synthèse · 24 questions →Rejoindre une session →