Generic Extractor
Un extracteur agnostique - récupère liens, images, titres et contenu principal de n'importe quelle page web.
Utilisation de l'API
Ajoutez &scraper=generic-extractor à une requête Crawling API. Encodez l'URL cible en URL-encoding dans le paramètre url.
curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
--data-urlencode 'url=https://stackoverflow.com/' \
--data-urlencode 'scraper=generic-extractor' -Gfrom crawlbase import CrawlingAPI
api = CrawlingAPI({'token': 'YOUR_TOKEN'})
res = api.get(
'https://stackoverflow.com/',
{'scraper': 'generic-extractor'}
)
import json
data = json.loads(res['body'])const { CrawlingAPI } = require('crawlbase');
const api = new CrawlingAPI({ token: 'YOUR_TOKEN' });
const res = await api.get(
'https://stackoverflow.com/',
{ scraper: 'generic-extractor' }
);
const data = JSON.parse(res.body);require 'crawlbase'
api = Crawlbase::API.new(token: 'YOUR_TOKEN')
res = api.get('https://stackoverflow.com/', scraper: 'generic-extractor')
data = JSON.parse(res.body)Exemple d'URL d'entrée
L'URL passée dans le paramètre url (décodée pour plus de lisibilité) :
https://stackoverflow.com/Structure de la réponse
Corps de réponse JSON. Les types de champs peuvent être null lorsque la page source omet la valeur.
URL finale.
Balise title de la page.
Meta description.
Lien canonique.
Langue détectée.
Tableaux h1/h2/h3 du texte des titres.
Liens sortants avec href, text, rel.
URLs des images avec texte alt.
Texte lisible du corps extrait.
Exemple de réponse
{
"url": "https://stackoverflow.com/",
"title": "Stack Overflow - Where Developers Learn...",
"language": "en",
"headings": {
"h1": ["Where developers grow together"],
"h2": ["Hot Network Questions"]
}
}