Un paragraphe extrait peut répondre à une question. Son URL source permet au lecteur de vérifier la réponse. Conservez les deux quand vous préparez du contenu web pour une application ou un agent IA.
Stocker le contenu avec sa source
Quelques champs suffisent pour commencer. Gardez l'URL d'origine, le titre et le texte extrait. Ajoutez la date de collecte si votre application doit tenir compte de la fraîcheur du contenu.
{
"url": "https://example.com/docs/setup",
"title": "Guide d'installation",
"content": "Configurez le projet avant de le lancer."
}
Cet exemple montre un format de stockage, pas un contrat de réponse de l'API BackFetch. Choisissez les champs utiles à votre application.
Garder la source lors du découpage
Si vous découpez une longue page pour l'indexer, copiez son URL dans les métadonnées de chaque fragment. Vous pouvez aussi conserver le titre de la section pour situer le passage.
record = {
"url": "https://example.com/docs/setup",
"title": "Guide d'installation",
"content": "Configurez le projet avant de le lancer."
}
chunk = {
"text": record["content"],
"source_url": record["url"],
"source_title": record["title"]
}
Vérifier la page avant de se fier au résultat
Une URL identifie une source. Elle ne prouve pas que le contenu est exact ou à jour. Votre application doit choisir les sources fiables et décider quand les collecter à nouveau.
Utilisez SERP pour découvrir des sources et Deep Crawl pour collecter les pages liées d'une base de connaissances.