Produit / Crawler

Crawler.
Poussez des URLs, récupérez des données, en asynchrone à grande échelle.

Poussez des millions d'URLs vers une file push/pull gérée bâtie sur la Crawling API, et recevez les données rendues sur votre webhook ou dans le cloud storage.
Aucune file, retry ou proxy à faire tourner.

99% de taux de succèsPush et pull asynchronesWebhook ou cloud storage
Envoyer les URLsRécupérer les donnéesenvoi : toute URLcallback=trueCrawlerFile d'attenteRenduRéessaiWebhookCloud StorageSuivi en directyour-server.com/hookstorage.crawlbase.comstats en temps réelen file · crawlé à grande échelle · 200
File du crawler en direct1.24M req/minStreaming
200target.com/c/electronics/-/N-5xtg6US137ms
200bestbuy.com/site/searchpage.jsp?st=tvGB103ms
200booking.com/searchresults.html?offset=25DE73ms
200indeed.com/jobs?q=engineer&start=20CA191ms
200etsy.com/c/jewelry?page=4FR193ms
200amazon.com/s?k=laptops&page=1GB183ms
200yelp.com/search?find_desc=cafe&start=30IN83ms
200glassdoor.com/Reviews/company-reviews.htmJP166ms
200zillow.com/homes/for_sale/2_p/NL200ms
200booking.com/searchresults.html?offset=25DE153ms
301etsy.com/c/jewelry?page=4SG155ms
200zillow.com/homes/for_sale/2_p/CA130ms
200booking.com/searchresults.html?offset=25NL69ms
200amazon.com/s?k=laptops&page=3BR186ms
200ebay.com/sch/i.html?_nkw=gpu&_pgn=1CA147ms
200zillow.com/homes/for_sale/2_p/DE118ms
404amazon.com/s?k=laptops&page=3BR83ms
301glassdoor.com/Reviews/company-reviews.htmAU45ms
200amazon.com/s?k=laptops&page=3JP191ms
200amazon.com/s?k=laptops&page=1CA54ms
200zillow.com/homes/for_sale/2_p/US124ms
200walmart.com/browse/electronics/3944CA158ms
200tripadvisor.com/Hotels-g60763-oa30CA98ms
200glassdoor.com/Reviews/company-reviews.htmFR131ms
200target.com/c/electronics/-/N-5xtg6CA155ms
200yelp.com/search?find_desc=cafe&start=30NL54ms
200target.com/c/electronics/-/N-5xtg6US137ms
200bestbuy.com/site/searchpage.jsp?st=tvGB103ms
200booking.com/searchresults.html?offset=25DE73ms
200indeed.com/jobs?q=engineer&start=20CA191ms
200etsy.com/c/jewelry?page=4FR193ms
200amazon.com/s?k=laptops&page=1GB183ms
200yelp.com/search?find_desc=cafe&start=30IN83ms
200glassdoor.com/Reviews/company-reviews.htmJP166ms
200zillow.com/homes/for_sale/2_p/NL200ms
200booking.com/searchresults.html?offset=25DE153ms
301etsy.com/c/jewelry?page=4SG155ms
200zillow.com/homes/for_sale/2_p/CA130ms
200booking.com/searchresults.html?offset=25NL69ms
200amazon.com/s?k=laptops&page=3BR186ms
200ebay.com/sch/i.html?_nkw=gpu&_pgn=1CA147ms
200zillow.com/homes/for_sale/2_p/DE118ms
404amazon.com/s?k=laptops&page=3BR83ms
301glassdoor.com/Reviews/company-reviews.htmAU45ms
200amazon.com/s?k=laptops&page=3JP191ms
200amazon.com/s?k=laptops&page=1CA54ms
200zillow.com/homes/for_sale/2_p/US124ms
200walmart.com/browse/electronics/3944CA158ms
200tripadvisor.com/Hotels-g60763-oa30CA98ms
200glassdoor.com/Reviews/company-reviews.htmFR131ms
200target.com/c/electronics/-/N-5xtg6CA155ms
200yelp.com/search?find_desc=cafe&start=30NL54ms
01 Démo en direct

Poussez une URL. Recevez-la livrée.

Le Crawler, tapé en direct. Poussez une URL vers la file, puis recevez le résultat rendu sur votre webhook. Survolez pour mettre en pause et lire.

prêt
touches 1-2 pour changer · cliquez pour mettre en pauselancez votre propre URL
Lancez votre premier request en quelques minutes. Jusqu'à 10,000 requests gratuits, sans carte bancaire.Commencer gratuitement
02 Capacités

Crawling à grande échelle, files incluses.

Tout ce qui rend les gros crawls difficiles, pris en charge pour vous : une file asynchrone, les retries, la livraison et le monitoring, le tout par-dessus la Crawling API.

async

Push et pull asynchrones

Poussez autant d'URLs que vous le souhaitez et continuez. Crawlbase les met en file, les planifie et les rend en arrière-plan, pour que votre client ne bloque jamais.

built-on

Bâti sur la Crawling API

Chaque fonctionnalité de la Crawling API est conservée : rendering JavaScript, proxies résidentiels, geotargeting, paramètres et gestion anti-bot sur chaque request.

deliver

Livraison par webhook

Pointez le crawler vers votre endpoint et chaque résultat y est envoyé. Crawlbase surveille votre webhook pour que la livraison reste précise et fiable.

storage

Cloud storage

Vous préférez le pull ? Gardez chaque page crawlée dans le cloud storage Crawlbase et récupérez-la selon votre propre rythme. Voir Cloud Storage.

monitor

Crawlers personnalisés, stats en direct

Nommez un crawler par charge de travail et suivez-le en temps réel. Consultez les stats via l'API, et mettez en pause ou reprenez selon votre budget.

fresh

Données fraîches, moins de retries

Chaque page est crawlée en direct, rien n'est mis en cache. Le système push/pull rapproche les taux de succès de 100%, si bien que les retries côté client disparaissent presque.

03 Comment ça marche

Migrez avec deux paramètres supplémentaires.

Gardez vos appels à la Crawling API. Ajoutez un callback et un nom de crawler, et vous voilà en asynchrone.

01

Créez un crawler

Ouvrez le dashboard Crawler, créez un crawler nommé et pointez-le vers votre webhook ou votre cloud storage.

02

Poussez les URLs

Appelez la Crawling API avec callback=true et crawler=YourCrawlerName, pour une URL ou des millions.

03

Nous mettons en file et rendons

Crawlbase planifie chaque request, fait tourner un proxy résidentiel, rend la page et retente les échecs.

04

Livrez le résultat

Chaque page rendue est envoyée à votre webhook ou écrite dans le cloud storage, en HTML ou en JSON structuré.

05

Récupérez et surveillez

Récupérez depuis le storage quand vous êtes prêt et suivez chaque crawler en direct, avec pause et reprise à la demande.

04 Cas d'usage

Ce que les équipes construisent avec le Crawler.

USE / 01Échelle

Des millions de pages

Poussez des catalogues entiers ou des sitemaps et laissez la file les traiter, sans planification côté client.

USE / 02Pipelines

Des données dans votre stack

Livrez les pages rendues directement vers un webhook ou un storage, prêtes pour votre entrepôt, votre index ou votre modèle.

USE / 03Commerce

Monitoring continu

Re-crawlez les prix, les stocks et les annonces selon un planning, avec des données fraîches à chaque passage.

USE / 04IA

Corpus d'entraînement et RAG

Constituez de grands ensembles de pages propres pour l'entraînement et la récupération, tirés du storage en masse.

USE / 05Migration

Quittez votre propre crawler

Remplacez votre système push/pull par le nôtre avec deux paramètres et laissez tomber les proxies, files et retries.

USE / 06Couverture

Des millions de sites

Crawlez sur des millions de sites pris en charge avec un seul crawler et un seul token.

05 Tarifs

Ajoutez les sites que vous crawlez, voyez le prix.

Ajoutez les sites que vous crawlez avec leur volume mensuel et leur type de request. Nous les regroupons par difficulté et par type, puis tarifons chaque groupe selon son volume combiné : plus vous crawlez, moins c'est cher.

100k / mo

Aucun site pour l'instant. Ajoutez-en un ci-dessus pour démarrer votre estimation.

Coût mensuel estimé
$0/ mois
≈ $0.00 moyenne pondérée par 1,000 requests

Jusqu'à 10,000 requests gratuits. Sans carte bancaire.

Démarrer gratuitementVous crawlez plus d'1 milliard par mois ? Parlons-en →
06 Notes

Bon à savoir.

Testez gratuitement

Jusqu'à 10,000 requests sont gratuits, sans carte bancaire. Le même token fonctionne sur le Crawler, la Crawling API et chaque scraper.

Tarification à l'usage

Payez ce que vous crawlez, sans contrat à long terme, annulez à tout moment. Mettez en pause et reprenez selon votre budget. Voir le détail complet sur la page tarifs.

Entièrement documenté

La création de crawlers, les callbacks et la livraison sont tous couverts dans la documentation du Crawler, avec des exemples à copier-coller.

Conforme GDPR et CCPA

Crawlbase applique les normes de protection des consommateurs à l'échelle mondiale, avec équité et transparence intégrées à la façon dont les données sont traitées.

07 Pourquoi Crawlbase

Conçu pour crawler le web à grande échelle.

Le Crawler tourne sur le même réseau qui sert 70,000+ développeurs et les charges de crawling les plus exigeantes au monde. Aucune file à faire tourner, aucun proxy à acheter, rien à corriger quand un site change.

99%
Taux de succès moyen des requests
70K+
Clients sur le réseau
Async
Push et pull, files gérées
99.99%
Disponibilité du réseau

Un seul token sur le Crawler, la Crawling API et chaque scraper, avec livraison vers votre webhook ou votre storage.

08 FAQ

Questions sur le Crawler.

Un crawler asynchrone bâti sur la Crawling API. Vous poussez des URLs vers une file push/pull gérée et Crawlbase rend chaque page, retente les échecs et livre le résultat sur votre webhook ou dans le cloud storage, si bien que vous ne gérez jamais les files, les retries ou les proxies.
La Crawling API est synchrone : vous obtenez la réponse sur le même appel. Le Crawler est asynchrone : vous poussez des URLs et les données sont livrées plus tard sur votre webhook ou votre storage. Il conserve chaque fonctionnalité de la Crawling API, y compris le rendering JavaScript et les proxies résidentiels.
Créez un crawler nommé dans le dashboard, puis ajoutez deux paramètres à votre appel à la Crawling API, callback=true et crawler=YourCrawlerName. C'est le seul changement nécessaire pour faire passer des appels synchrones au système push/pull asynchrone.
Deux façons. Pointez le crawler vers votre endpoint webhook et Crawlbase y envoie chaque résultat, ou stockez les résultats dans le cloud storage et récupérez-les quand vous êtes prêt. Les URLs de webhook sont surveillées pour que la livraison reste fiable.
Oui. Le dashboard affiche les stats en direct de chaque crawler, et l'API Crawler vous permet de consulter les stats et de gérer les crawls. Vous pouvez mettre en pause et reprendre le crawling selon votre budget et vos besoins.
Oui. Chaque page est crawlée en direct depuis internet au moment du request. Rien n'est mis en cache ni servi depuis un crawl antérieur, donc les données que vous recevez sont à jour.

Crawlez le web en asynchrone.
Poussez des URLs, nous livrons les données.

Gratuit au départ avec jusqu'à 10,000 requests. Un seul token pour le Crawler, la Crawling API et chaque scraper.