Vous voulez collecter un catalogue produits. Si vous avez déjà toutes les URL, il reste à extraire les champs de chaque page. Si vous n'avez que l'accueil du catalogue, il faut d'abord trouver les pages produits.
Cette différence sépare le crawling du scraping.
Le crawling trouve les pages
Un crawler part d'une URL, lit les liens présents sur la page et choisit lesquels visiter. Dans une documentation, il peut suivre les liens vers les pages d'installation, de configuration et de référence API.
La décision essentielle concerne le périmètre. Définissez les domaines et les chemins utiles avant de suivre leurs liens. Les filtres, les calendriers et la pagination peuvent produire de nombreuses URL sans ajouter de contenu intéressant.
Le scraping extrait le contenu
Un scraper lit une page et sélectionne les informations utiles. Pour des articles, il peut extraire le titre, le texte et l'URL source. Pour des produits, il peut récupérer le nom, la description et le prix.
| Votre point de départ | L'étape suivante |
|---|---|
| Une liste d'URL produits | Extraire les champs de chaque page |
| L'accueil d'un catalogue | Découvrir les URL produits |
| Une question ou un sujet | Trouver des pages par la recherche |
Conservez l'URL source avec chaque résultat. Elle permet de vérifier la page d'origine lorsqu'un champ manque ou qu'une valeur change.
Associer les deux pour collecter un site
Une collecte de site combine souvent découverte et extraction. Le crawler trouve les pages. Le scraper transforme leur contenu en données que votre application peut stocker.
Découvrez le fonctionnement de Deep Crawl. Si votre point de départ est une requête de recherche, consultez SERP.