Crawling API / Stack Exchange

Scraper Stack Exchange.
Chaque site, entièrement rendu.

Envoyez n'importe quelle URL Stack Exchange et récupérez le HTML entièrement rendu, via des proxys résidentiels avec gestion anti-bot intégrée.
Ou obtenez du JSON structuré avec les scrapers stackexchange-serp et stackexchange-thread.

99 % de réussite140M IP résidentielles30 zones géographiques
URL Stack ExchangeHTML or JSONstackoverflow.com/questions/2861071CrawlbaseRouterRenduExtraireHTML renduJSON structurécrawling-apistackexchange-threadstackoverflow.com · limite de débit reroutée · 200
Flux de crawl en direct · Stack Exchange1.24M req/minEn streaming
200serverfault.com/questionsGB96ms
200math.stackexchange.com/questions/tagged/linear-algebraBR83ms
200math.stackexchange.com/questions/tagged/linear-algebraUS154ms
200dba.stackexchange.com/questions/tagged/postgresqlES210ms
404superuser.com/questions/217504/how-do-i-record-my-screenBR141ms
200dba.stackexchange.com/questions/tagged/postgresqlCA47ms
200dba.stackexchange.com/questions/tagged/postgresqlDE206ms
404askubuntu.com/questionsDE171ms
200superuser.com/questions/217504/how-do-i-record-my-screenAU88ms
200superuser.com/questions/217504/how-do-i-record-my-screenIN138ms
200superuser.com/questions/tagged/windowsAU98ms
200askubuntu.com/questions/tagged/aptFR154ms
301serverfault.com/questions/tagged/nginxBR47ms
200math.stackexchange.com/questions/tagged/linear-algebraGB58ms
200stackoverflow.com/search?q=async+awaitGB63ms
200serverfault.com/questions/tagged/nginxGB44ms
200askubuntu.com/questions/tagged/aptFR213ms
200stackoverflow.com/questions/tagged/pythonUS213ms
200serverfault.com/questionsGB112ms
200serverfault.com/questionsSG194ms
200stackoverflow.com/search?q=async+awaitBR178ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileJP164ms
200security.stackexchange.com/questions/tagged/tlsSG75ms
200dba.stackexchange.com/questions/tagged/postgresqlAU205ms
200math.stackexchange.com/questions/tagged/linear-algebraES114ms
200stackoverflow.com/questions/tagged/pythonUS190ms
200serverfault.com/questionsGB96ms
200math.stackexchange.com/questions/tagged/linear-algebraBR83ms
200math.stackexchange.com/questions/tagged/linear-algebraUS154ms
200dba.stackexchange.com/questions/tagged/postgresqlES210ms
404superuser.com/questions/217504/how-do-i-record-my-screenBR141ms
200dba.stackexchange.com/questions/tagged/postgresqlCA47ms
200dba.stackexchange.com/questions/tagged/postgresqlDE206ms
404askubuntu.com/questionsDE171ms
200superuser.com/questions/217504/how-do-i-record-my-screenAU88ms
200superuser.com/questions/217504/how-do-i-record-my-screenIN138ms
200superuser.com/questions/tagged/windowsAU98ms
200askubuntu.com/questions/tagged/aptFR154ms
301serverfault.com/questions/tagged/nginxBR47ms
200math.stackexchange.com/questions/tagged/linear-algebraGB58ms
200stackoverflow.com/search?q=async+awaitGB63ms
200serverfault.com/questions/tagged/nginxGB44ms
200askubuntu.com/questions/tagged/aptFR213ms
200stackoverflow.com/questions/tagged/pythonUS213ms
200serverfault.com/questionsGB112ms
200serverfault.com/questionsSG194ms
200stackoverflow.com/search?q=async+awaitBR178ms
200stackoverflow.com/questions/2861071/how-to-modify-a-text-fileJP164ms
200security.stackexchange.com/questions/tagged/tlsSG75ms
200dba.stackexchange.com/questions/tagged/postgresqlAU205ms
200math.stackexchange.com/questions/tagged/linear-algebraES114ms
200stackoverflow.com/questions/tagged/pythonUS190ms
01 Démo en direct

Un scraper, tous les sites Stack Exchange.

La Crawling API, tapée en direct. Regardez le scraper stackexchange-serp renvoyer du JSON structuré depuis Super User, Ask Ubuntu et MathOverflow - le même appel fonctionne sur tous les sites du réseau. Survolez pour mettre en pause et lire.

prêt
touches 1-3 pour changer · cliquez pour mettre en pauselancez votre propre URL
Lancez votre première requête en quelques minutes. Jusqu'à 20 000 requêtes gratuites, sans carte bancaire.Commencer gratuitement
02 Capacités

Une API, tout le réseau Stack Exchange.

Les deux scrapers sont host-agnostic, donc le même appel fonctionne sur Stack Overflow, Super User, Ask Ubuntu, MathOverflow et tous les sites *.stackexchange.com. La Crawling API rend chaque page dans un vrai navigateur, l'atteint via des IP résidentielles et vous renvoie du HTML ou du JSON propre.

réseau

Chaque site Stack Exchange

stackoverflow.com, superuser.com, askubuntu.com, serverfault.com, mathoverflow.net et toutes les communautés *.stackexchange.com fonctionnent via les deux mêmes scrapers.

proxys

140M IP résidentielles

Stack Exchange limite le débit des IP de datacenter, donc chaque requête fait tourner une IP résidentielle sur 30 zones géographiques et atteint chaque site comme un vrai visiteur local.

anti-bot

Blocages gérés pour vous

CAPTCHAs, murs anti-bot et limites de débit sont franchis automatiquement. Rien à résoudre, rien à maintenir.

format

HTML ou JSON

Obtenez le HTML entièrement rendu, ou ajoutez scraper=stackexchange-serp ou stackexchange-thread pour renvoyer des listes de questions et des fils complets en JSON structuré.

extras

Captures d'écran et asynchrone

Le même appel peut capturer une capture d'écran pleine page, ou s'exécuter de façon asynchrone avec webhooks et stockage cloud.

un token

Une API pour chaque site

La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre tout le réseau Stack Exchange et tout ce que vous crawlez d'autre. Voir la démo en direct.

03 Sortie

Chaque champ du fil, en JSON propre.

Envoyez une URL de question avec scraper=stackexchange-thread et le fil revient en JSON typé. Remplacez par stackexchange-serp pour faire de même avec les listes de questions, les tags et les résultats de recherche.

{ "question": { "id": "2861071", "title": "How to modify a text file?", "score": 312, "viewCount": 486201, "tags": [ "python", "file" ], "askedAt": "2010-05-18T20:11:33Z", "author": { "name": "Nathan Fellman", "url": "https://stackoverflow.com/users/8460", "reputation": 127843 }, "comments": [ { "score": 3, "createdAt": "2010-05-18T20:19:04Z" } ] }, "answerCount": 2, "answers": [ { "id": "2861108", "score": 401, "isAccepted": true, "body": "Read the file into a list of lines, insert, then write it back.", "author": { "name": "Roberto Bonvallet", "url": "https://stackoverflow.com/users/193568", "reputation": 30215 }, "createdAt": "2010-05-18T20:15:52Z", "comments": [ { "score": 12, "createdAt": "2010-05-18T21:02:11Z" } ] } ] }

Question

question.id · string  question.title · string  question.score · number  question.viewCount · number

Auteur

question.author.name · string  question.author.url · string  question.author.reputation · number

Réponses

answerCount · number  answers[].score · number  answers[].isAccepted · boolean  answers[].body · string

Commentaires

question.comments[] · array  answers[].comments[].score · number  answers[].comments[].createdAt · string

Tags

question.tags · array  question.askedAt · string  answers[].createdAt · string

04 Comment ça marche

De l'URL aux données en un seul appel.

Chaque requête Stack Exchange suit le même chemin. Vous envoyez une URL, nous gérons tout le reste.

01

Envoyez l'URL

Passez n'importe quelle URL publique Stack Exchange avec votre token : une question, un tag, une recherche ou une liste sur n'importe quel site du réseau.

02

Faites tourner un proxy

Une IP et une zone résidentielles qui atteignent chaque site proprement, tirées de 140M IP sur 30 régions.

03

Rendez la page

Un vrai navigateur charge la page pour que scores, réponses et commentaires soient rendus avant la capture.

04

Franchissez l'anti-bot

Les contrôles de bot et les limites de débit par page de chaque site sont gérés automatiquement. Rien à résoudre, rien à maintenir.

05

Renvoyez HTML ou JSON

Le HTML entièrement rendu revient, ou du JSON typé quand vous ajoutez stackexchange-serp ou stackexchange-thread.

05 Cas d'usage

Ce que les équipes construisent avec les données Stack Exchange.

USE / 01Connaissance

Extraction de connaissances dev

Récupérez questions, réponses acceptées et commentaires sur le réseau pour bâtir des bases de connaissances consultables.

USE / 02Entraînement

Données d'entraînement et RAG

Alimentez modèles, pipelines RAG et agents de code en texte question-réponse propre via une seule API.

USE / 03Tendances

Suivi des tendances tech

Surveillez tags et pages de recherche sur les sites pour repérer tôt les langages, outils et sujets émergents.

USE / 04Q&R

Jeux de données Q&R

Assemblez des jeux de données structurés question, réponse et vote pour l'évaluation et les benchmarks.

USE / 05Recherche

Recherche concurrentielle et dev

Exploitez de vraies questions, erreurs et contournements de développeurs pour orienter produit et docs.

USE / 06Couverture

N'importe quelle URL, une API

Crawlez questions, tags, pages utilisateur et recherche sur le réseau, plus tout autre site dont vous avez besoin.

06 À savoir

Bon à savoir pour scraper Stack Exchange.

Une paire de scrapers, chaque site

stackexchange-serp et stackexchange-thread sont host-agnostic, donc les deux mêmes scrapers couvrent Stack Overflow, Super User, Ask Ubuntu, MathOverflow et toutes les communautés *.stackexchange.com.

HTML par défaut, JSON à la demande

Vous obtenez le HTML entièrement rendu. Ajoutez scraper=stackexchange-serp ou stackexchange-thread pour du JSON parsé, ou parsez le HTML vous-même.

Proxys résidentiels par conception

Stack Exchange limite le débit des IP de datacenter, donc les requêtes passent par le pool résidentiel. Chacune fait tourner une IP fraîche, pour un accès constant.

Atteignez chaque site de n'importe où

Le geotargeting sur 30 régions et 140M IP résidentielles signifie un accès constant sans gérer de proxys.

07 Pourquoi Crawlbase

Conçu pour crawler Stack Exchange à grande échelle.

La Crawling API tourne sur le même réseau qui sert plus de 46 000 clients payants et 70 000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à corriger quand un site Stack Exchange change.

99%
Taux de réussite moyen des requêtes
140M
IP résidentielles, plus 98M datacenter
30
Zones géographiques pour des résultats locaux précis
20/s
Requêtes par seconde par défaut, plus sur demande

Un token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99,99 % de disponibilité en dessous.

08 FAQ

Questions sur le scraping de Stack Exchange.

Envoyez n'importe quelle URL Stack Exchange à la Crawling API de Crawlbase avec votre token. Crawlbase fait tourner un proxy résidentiel, rend la page dans un vrai navigateur, franchit les contrôles de bot et renvoie le HTML entièrement rendu. Ajoutez un scraper dédié (scraper=stackexchange-serp ou stackexchange-thread) pour obtenir du JSON structuré à la place.
Oui. Par défaut la Crawling API renvoie du HTML rendu ; ajoutez un scraper dédié (scraper=stackexchange-serp pour les listes de questions, tags et recherche, stackexchange-thread pour une question complète avec ses réponses et commentaires) pour recevoir du JSON structuré, ou parsez le HTML vous-même.
Les deux scrapers sont host-agnostic, donc ils fonctionnent sur stackoverflow.com, tous les sites *.stackexchange.com, superuser.com, askubuntu.com, serverfault.com et mathoverflow.net via la même API.
Crawlbase route chaque requête via des IP résidentielles rotatives sur 30 zones géographiques et franchit les contrôles de bot automatiquement. Stack Exchange limite le débit des IP de datacenter, donc le pool résidentiel garde l'accès constant, et il n'y a rien à maintenir quand un site change sa configuration.
stackexchange-serp renvoie une liste de questions depuis une page de tag, de recherche ou de liste, chacune avec son titre, son score, son nombre de réponses, son nombre de vues, ses tags et son extrait, plus la pagination. stackexchange-thread renvoie une seule page de question : le corps complet de la question avec chaque réponse et commentaire, y compris scores, statut accepté, réputation de l'auteur et horodatages.
N'importe quelle URL publique : questions et leurs réponses, listes de tags, profils utilisateur et pages de résultats de recherche sur n'importe quel site du réseau. La même API fonctionne aussi sur tout autre site.
Commencez gratuitement avec jusqu'à 20 000 requêtes et sans carte bancaire. Les offres payantes évoluent avec l'usage, et le même token fonctionne pour la Crawling API et chaque scraper Crawlbase.

Commencez à scraper Stack Exchange.
Oubliez les proxys et les limites de débit.

Gratuit pour démarrer avec jusqu'à 20 000 requêtes. Un token pour la Crawling API et chaque scraper.