Aller au contenu
Le scraping web pour vos agents.
Tous les articles

Conservez l'URL source avec le contenu extrait

Un texte extrait est plus utile quand on peut retrouver sa source. Gardez ce lien avant d'indexer du contenu pour un agent IA.

Par BackFetch2 min de lectureIA et données

Un paragraphe extrait peut répondre à une question. Son URL source permet au lecteur de vérifier la réponse. Conservez les deux quand vous préparez du contenu web pour une application ou un agent IA.

Stocker le contenu avec sa source

Quelques champs suffisent pour commencer. Gardez l'URL d'origine, le titre et le texte extrait. Ajoutez la date de collecte si votre application doit tenir compte de la fraîcheur du contenu.

{
  "url": "https://example.com/docs/setup",
  "title": "Guide d'installation",
  "content": "Configurez le projet avant de le lancer."
}

Cet exemple montre un format de stockage, pas un contrat de réponse de l'API BackFetch. Choisissez les champs utiles à votre application.

Garder la source lors du découpage

Si vous découpez une longue page pour l'indexer, copiez son URL dans les métadonnées de chaque fragment. Vous pouvez aussi conserver le titre de la section pour situer le passage.

record = {
    "url": "https://example.com/docs/setup",
    "title": "Guide d'installation",
    "content": "Configurez le projet avant de le lancer."
}

chunk = {
    "text": record["content"],
    "source_url": record["url"],
    "source_title": record["title"]
}

Vérifier la page avant de se fier au résultat

Une URL identifie une source. Elle ne prouve pas que le contenu est exact ou à jour. Votre application doit choisir les sources fiables et décider quand les collecter à nouveau.

Utilisez SERP pour découvrir des sources et Deep Crawl pour collecter les pages liées d'une base de connaissances.

Pour continuer