Cookbook du scraping · méthode

Comment les chiffres sont comptés

Chaque chiffre d’une page du Cookbook est produit de la même manière, à partir des mêmes compteurs qui facturent les clients. Cette page en est la définition.

Ce qui compte comme une réussite

Crawlbase enregistre une ligne par request. Un request est une réussite quand Crawlbase a répondu avec cb_status 200, 207, 227 ou 228 et que le site lui-même a répondu avec 200, 201, 204, une redirection (301, 302, 303, 307 ou 308), 404 ou 410. Tout le reste est un échec.

Un 404 sur un produit que le site a retiré compte donc comme une réussite : le request a atteint le site et le site a répondu. Une page de blocage, un challenge qui n’a pas pu être franchi, un timeout ou une erreur interne comptent comme un échec. Le taux de réussite est le nombre de réussites divisé par la somme des réussites et des échecs.

Quels requests sont comptés

Tous. Chaque request de chaque compte, à travers la Crawling API, le Crawler et le Smart AI Proxy, sur un mois calendaire. Pas d’échantillonnage, pas d’exclusion de comptes ni de réessais. Le mois est imprimé sur chaque page ; les chiffres sont rafraîchis à la clôture du mois suivant.

Les sites sont indexés par leur nom enregistrable sans l’extension, comme les compteurs les stockent, si bien qu’idealo.de, idealo.es et idealo.co.uk forment un seul site. Le domaine affiché sur une page est celui que les comptes récupèrent le plus.

Ce que signifie la part de browser

Chaque request est fait soit avec un token normal, soit avec un token JavaScript. La part de browser est la part des requests réussis faits avec le token JavaScript. Elle dit comment les comptes ont choisi de récupérer le site, pas ce que le site exige strictement ; c’est la recette qui le dit. "Non" est en dessous de 5%, "Oui" au-dessus de 95%, tout ce qui est entre les deux est affiché comme la part.

Tiers et crédits

Chaque site se trouve dans un tier de prix. Une page standard coûte un crédit ; les autres tiers le multiplient : modéré 1.5, complexe 2, complexe I 3, complexe II 4.5, extrême 9, extrême I 13.5, extrême II 20. Le tier affiché est celui en vigueur le jour où la page a été générée. Un request JavaScript coûte le prix du tier plus le supplément browser décrit sur la page des tarifs.

Comment une recette est écrite

Une recette vient de ce que les comptes qui récupèrent le site envoient réellement et reçoivent en retour : les motifs d’URL, le pays et le token qui réussissent, les statuts renvoyés par le site, la latence. Quatre recettes ont aussi été écrites à la main. Rien sur une page n’est deviné ; chaque phrase cite le chiffre derrière elle. Aucun client n’est jamais nommé ni identifiable.

Actualisation

Les chiffres sont recalculés sur le mois civil complet une fois celui-ci clos, et chaque page porte le mois qu’elle affiche. Un site qui passe sous le seuil perd sa page jusqu’à ce qu’il le franchisse à nouveau.

Quels sites ont une page

Un site apparaît dans le Cookbook quand trois comptes ou plus l’ont récupéré avec au moins mille réussites dans le mois. Les infrastructures d’hébergement et de CDN, les banques et marques de paiement, les écoles, et les services de recherche de personnes et de vérification d’antécédents n’ont jamais de page, quels que soient les chiffres.

Les noms de sites identifient les pages qu’une recette récupère. Crawlbase n’est affilié à aucun site listé. Utilisez les recettes dans le cadre de la politique d’utilisation acceptable.Chiffres mesurés de August 2026, actualisés chaque mois