Cookbook·Actualités et médias·houstonchronicle.com

Scraper les articles sur houstonchronicle.com

L’appel qui renvoie les articles de houstonchronicle.com aujourd’hui, avec les paramètres, les motifs et les modes d’échec lus dans le journal des requêtes depuis le 14 Aug 2026.

94.6% de réussite · Aug 2026Browser sur 80% des appelsPrix Standard · 1 crédit

Mesuré sur Crawlbase

Taux de réussite sur chaque requête de chaque compte en August 2026 : 94.6%. Motifs, pays et échecs viennent du journal des requêtes depuis le 14 Aug 2026 ; 79.9% des appels réussis ont utilisé le token JavaScript et la réponse médiane a pris 24.9s.

Parmi les 74 sites actualités et médias du Cookbook, houstonchronicle.com se place 60 sur 74 au taux de réussite ; la médiane de la catégorie est de 98.9%. Sa réponse médiane de 24.9s est plus lente que la médiane de la catégorie, 2.3s. 58 des 74 acceptent le token simple ; celui-ci seulement sur certaines pages.

L’appel

Les pages d’article sont la forme que les comptes récupèrent le plus ici, avec le pays et le token qui réussissent le plus souvent. Remplacez le chemin fictif par une vraie URL d’article du site.

Lancer dans le Playground
curl "https://api.crawlbase.com/?token=YOUR_JS_TOKEN&url=https%3A%2F%2Fwww.houstonchronicle.com%2Fnews%2Fexample-page%2Fexample-page"

Les paramètres qui comptent

ParamètreValeurPourquoi
countrylaisser videLa plupart des appels réussis ne définissent aucun country (100%) et réussissent à 92.2%.
javascriptutiliser le token JavaScriptLes appels avec le token JavaScript réussissent à 95.4% contre 78.5% pour le token simple, et 81.1% des appels l’utilisent.

Motifs d’URL que les comptes récupèrent

MotifPart des réussitesToken JavaScriptCountryParamètres de requête
/news/{slug}/{slug}17.0%95.6%aucunaucun
/{slug}/{slug}/{slug}17.0%100%aucunaucun
/entertainment/{slug}/{slug}8.0%100%aucunaucun
/food-culture/{slug}/{slug}6.8%100%aucunaucun
/lifestyle/{slug}/{slug}5.5%100%aucunaucun
/neighborhood/{slug}/{slug}4.3%82.4%aucunaucun
/projects/{id}/{slug}4.0%100%aucunaucun
/business/{slug}/{slug}3.5%100%aucunaucun

Les champs que vous obtenez

Une page d’article porte un titre, une date et un auteur, en général dans un bloc ld+json Article, et le corps dans le HTML. Le bloc nomme souvent aussi la rubrique.

Ce qui casse, et la solution

Sur les échecs depuis le 14 Aug 2026, le site a répondu :

504 : 48.2% des échecs Un 504 est un timeout : la page n’a pas fini de charger dans la limite. Réessayez une fois, et gardez le timeout de votre propre client au-dessus du temps de réponse médian affiché pour ce site.
403 : 45.3% des échecs Un 403 est le site qui refuse la sortie. Définissez le country utilisé par les appels réussis et réessayez une fois ; un second 403 signifie que l’URL elle-même est protégée.

Lancez-la de façon planifiée

L’actualité bouge d’heure en heure. Interrogez la rubrique ou le sitemap pour les nouveaux liens, puis envoyez les URL d’articles au Crawler avec un callback pour que les récupérations soient régulées. La réponse médiane sur ce site est de 24.9s.

Questions

Ai-je besoin d’un browser pour scraper houstonchronicle.com ?

Oui pour la plupart des pages. Les appels avec le token JavaScript réussissent à 95.4% tandis que ceux avec le token simple atteignent 78.5%.

Combien coûte une page houstonchronicle.com sur Crawlbase ?

1 crédit sans browser. houstonchronicle.com est dans le tier standard.

Quel country dois-je définir pour houstonchronicle.com ?

Aucun n’est nécessaire : la plupart des appels réussis le laissent vide.

Les noms de sites identifient les pages qu’une recette récupère. Crawlbase n’est affilié à aucun site listé. Utilisez les recettes dans le cadre de la politique d’utilisation acceptable.Chiffres mesurés de August 2026, actualisés chaque mois