Les valeurs manquantes sont l’un des problèmes de qualité des données les plus courants. Une cellule vide, une valeur nulle ou un espace réservé comme « N/A » ou « 999 » représentent tous des données manquantes — et ils doivent être traités avec soin.
Types de données manquantes
Manquantes complètement aléatoirement (MCAR) — les valeurs manquantes n’ont pas de schéma. Un capteur qui échoue aléatoirement à enregistrer produit des données MCAR.
Manquantes aléatoirement (MAR) — le caractère manquant est lié à d’autres variables mais pas à la valeur manquante elle-même. Les répondants à un sondage qui sautent les questions sur le revenu peuvent le faire en fonction de l’âge ou de l’éducation, pas du niveau de revenu.
Manquantes non aléatoirement (MNAR) — le caractère manquant est lié à la valeur elle-même. Les personnes à hauts revenus peuvent être plus susceptibles de sauter les questions sur le revenu précisément parce que leur revenu est élevé. C’est le type le plus difficile à gérer.
Comment identifier les valeurs manquantes
Commencez par profiler votre jeu de données : comptez le nombre de valeurs manquantes dans chaque colonne, calculez le pourcentage manquant et recherchez des schémas. Certaines colonnes sont-elles toujours manquantes ensemble? Les valeurs manquantes sont-elles concentrées dans certaines périodes ou zones géographiques?
Options pour gérer les valeurs manquantes
- Les laisser — si le caractère manquant est acceptable pour votre cas d’utilisation
- Supprimer les lignes — si les valeurs manquantes sont peu nombreuses et aléatoires
- Imputer — remplir les valeurs manquantes en utilisant une règle (moyenne, médiane, mode) ou un modèle
- Signaler — ajouter une colonne séparée indiquant qu’une valeur était manquante
L’imputation des valeurs manquantes introduit des hypothèses. Remplacer les âges manquants par l’âge moyen modifie la distribution de vos données. Documentez toujours ce que vous avez imputé et pourquoi.
Découvrez comment gérer les Doublons.