Extraction automatique de données de sites Web en analysant leur contenu HTML, utilisée lorsque les données ne sont pas disponibles via une API ou un téléchargement structuré.
L'extraction de données Web utilise des logiciels pour charger des pages Web et extraire des éléments de données spécifiques — tableaux, listes, texte, liens — du HTML. C'est une méthode d'acquisition de données de dernier recours : si un site Web offre une API ou des fichiers téléchargeables, ceux-ci sont toujours préférables à l'extraction.
L'extraction de données Web soulève d'importantes considérations juridiques et éthiques. De nombreux sites Web interdisent l'extraction dans leurs conditions d'utilisation. L'extraction de renseignements personnels peut violer les lois sur la protection de la vie privée. Une extraction agressive peut surcharger les serveurs. Vérifiez toujours les conditions d'utilisation et le fichier robots.txt avant d'extraire des données d'un site Web.
Exemple : Un chercheur veut analyser les prix des annonces immobilières d'un site Web immobilier qui n'offre pas de téléchargement de données ni d'API. Il écrit un extracteur Web qui charge chaque page d'annonce, extrait le prix, l'adresse et les attributs de la propriété du HTML, et enregistre les résultats dans un fichier CSV. Avant d'exécuter l'extracteur, il vérifie les conditions d'utilisation du site Web et constate que l'extraction à des fins de recherche non commerciale est permise avec attribution.
Termes connexes
- Extraction de données
- Acquisition de données
- API de données
- Conditions d'utilisation
- Pipeline de données