Aller au contenu
Le scraping web pour vos agents.
Tous les articles

Crawling et scraping répondent à deux besoins différents

Le crawler trouve les pages, le scraper en extrait le contenu. Voici comment choisir le point de départ de votre collecte.

Par BackFetch2 min de lectureGuides

Vous voulez collecter un catalogue produits. Si vous avez déjà toutes les URL, il reste à extraire les champs de chaque page. Si vous n'avez que l'accueil du catalogue, il faut d'abord trouver les pages produits.

Cette différence sépare le crawling du scraping.

Le crawling trouve les pages

Un crawler part d'une URL, lit les liens présents sur la page et choisit lesquels visiter. Dans une documentation, il peut suivre les liens vers les pages d'installation, de configuration et de référence API.

La décision essentielle concerne le périmètre. Définissez les domaines et les chemins utiles avant de suivre leurs liens. Les filtres, les calendriers et la pagination peuvent produire de nombreuses URL sans ajouter de contenu intéressant.

Le scraping extrait le contenu

Un scraper lit une page et sélectionne les informations utiles. Pour des articles, il peut extraire le titre, le texte et l'URL source. Pour des produits, il peut récupérer le nom, la description et le prix.

Votre point de départL'étape suivante
Une liste d'URL produitsExtraire les champs de chaque page
L'accueil d'un catalogueDécouvrir les URL produits
Une question ou un sujetTrouver des pages par la recherche

Conservez l'URL source avec chaque résultat. Elle permet de vérifier la page d'origine lorsqu'un champ manque ou qu'une valeur change.

Associer les deux pour collecter un site

Une collecte de site combine souvent découverte et extraction. Le crawler trouve les pages. Le scraper transforme leur contenu en données que votre application peut stocker.

Découvrez le fonctionnement de Deep Crawl. Si votre point de départ est une requête de recherche, consultez SERP.

Pour continuer