Scraper les pages content sur ft.com

L’appel qui renvoie les pages content de ft.com aujourd’hui, avec les paramètres, les motifs et les modes d’échec lus dans le journal des requêtes depuis le 14 Aug 2026.

90.9% de réussite · Aug 2026Browser sur 77% des appelsPrix Standard · 1 crédit

Mesuré sur Crawlbase

Taux de réussite sur chaque requête de chaque compte en August 2026 : 90.9%. Motifs, pays et échecs viennent du journal des requêtes depuis le 14 Aug 2026 ; 76.7% des appels réussis ont utilisé le token JavaScript et la réponse médiane a pris 15.7s.

Parmi les 74 sites actualités et médias du Cookbook, ft.com se place 74 sur 74 au taux de réussite ; la médiane de la catégorie est de 98.9%. Sa réponse médiane de 15.7s est plus lente que la médiane de la catégorie, 2.3s. 58 des 74 acceptent le token simple ; celui-ci seulement sur certaines pages.

L’appel

Les pages d’article sont la forme que les comptes récupèrent le plus ici, avec le pays et le token qui réussissent le plus souvent. Remplacez le chemin fictif par une vraie URL d’article du site.

Lancer dans le Playground
curl "https://api.crawlbase.com/?token=YOUR_JS_TOKEN&url=https%3A%2F%2Fwww.ft.com%2Fcontent%2Fexample-page"

Les paramètres qui comptent

ParamètreValeurPourquoi
countrylaisser videLa plupart des appels réussis ne définissent aucun country (97.9%) et réussissent à 93.8%.
javascriptutiliser le token JavaScriptLes appels avec le token JavaScript réussissent à 97.1% contre 52.2% pour le token simple, et 90.8% des appels l’utilisent.

Motifs d’URL que les comptes récupèrent

MotifPart des réussitesToken JavaScriptCountryParamètres de requête
/content/{slug}90.3%91.7%aucunsyn-25a6b1a6

Les champs que vous obtenez

Une page d’article porte un titre, une date et un auteur, en général dans un bloc ld+json Article, et le corps dans le HTML. Le bloc nomme souvent aussi la rubrique.

Ce qui casse, et la solution

Sur les échecs depuis le 14 Aug 2026, le site a répondu :

403 : 49.7% des échecs Un 403 est le site qui refuse la sortie. Définissez le country utilisé par les appels réussis et réessayez une fois ; un second 403 signifie que l’URL elle-même est protégée.
0 : 11.5% des échecs Un statut 0 est un request qui n’a jamais reçu de réponse dans le timeout. Réessayez une fois avec le token JavaScript si le motif a besoin d’un browser.
999 : 7.9% des échecs 999 n’est pas une réponse HTTP standard ; le site l’a envoyée comme un refus. Traitez-la comme un blocage : réessayez une fois avec le token JavaScript et le country utilisé par les appels réussis, puis arrêtez.
594, 515 : 12.5% des échecs ensemble Un 5xx est le site qui échoue, pas la récupération. Réessayez après une minute.

Lancez-la de façon planifiée

L’actualité bouge d’heure en heure. Interrogez la rubrique ou le sitemap pour les nouveaux liens, puis envoyez les URL d’articles au Crawler avec un callback pour que les récupérations soient régulées. La réponse médiane sur ce site est de 15.7s.

Questions

Ai-je besoin d’un browser pour scraper ft.com ?

Oui pour la plupart des pages. Les appels avec le token JavaScript réussissent à 97.1% tandis que ceux avec le token simple atteignent 52.2%.

Combien coûte une page ft.com sur Crawlbase ?

1 crédit sans browser. ft.com est dans le tier standard.

Quel country dois-je définir pour ft.com ?

Aucun n’est nécessaire : la plupart des appels réussis le laissent vide.

Les noms de sites identifient les pages qu’une recette récupère. Crawlbase n’est affilié à aucun site listé. Utilisez les recettes dans le cadre de la politique d’utilisation acceptable.Chiffres mesurés de August 2026, actualisés chaque mois