Scraper Stack Exchange.
Chaque site, entièrement rendu.
Envoyez n'importe quelle URL Stack Exchange et récupérez le HTML entièrement rendu, via des proxys résidentiels avec gestion anti-bot intégrée.
Ou obtenez du JSON structuré avec les scrapers stackexchange-serp et stackexchange-thread.
Un scraper, tous les sites Stack Exchange.
La Crawling API, tapée en direct. Regardez le scraper stackexchange-serp renvoyer du JSON structuré depuis Super User, Ask Ubuntu et MathOverflow - le même appel fonctionne sur tous les sites du réseau. Survolez pour mettre en pause et lire.
Une API, tout le réseau Stack Exchange.
Les deux scrapers sont host-agnostic, donc le même appel fonctionne sur Stack Overflow, Super User, Ask Ubuntu, MathOverflow et tous les sites *.stackexchange.com. La Crawling API rend chaque page dans un vrai navigateur, l'atteint via des IP résidentielles et vous renvoie du HTML ou du JSON propre.
Chaque site Stack Exchange
stackoverflow.com, superuser.com, askubuntu.com, serverfault.com, mathoverflow.net et toutes les communautés *.stackexchange.com fonctionnent via les deux mêmes scrapers.
140M IP résidentielles
Stack Exchange limite le débit des IP de datacenter, donc chaque requête fait tourner une IP résidentielle sur 30 zones géographiques et atteint chaque site comme un vrai visiteur local.
Blocages gérés pour vous
CAPTCHAs, murs anti-bot et limites de débit sont franchis automatiquement. Rien à résoudre, rien à maintenir.
HTML ou JSON
Obtenez le HTML entièrement rendu, ou ajoutez scraper=stackexchange-serp ou stackexchange-thread pour renvoyer des listes de questions et des fils complets en JSON structuré.
Captures d'écran et asynchrone
Le même appel peut capturer une capture d'écran pleine page, ou s'exécuter de façon asynchrone avec webhooks et stockage cloud.
Une API pour chaque site
La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre tout le réseau Stack Exchange et tout ce que vous crawlez d'autre. Voir la démo en direct.
Chaque champ du fil, en JSON propre.
Envoyez une URL de question avec scraper=stackexchange-thread et le fil revient en JSON typé. Remplacez par stackexchange-serp pour faire de même avec les listes de questions, les tags et les résultats de recherche.
Question
question.id · string question.title · string question.score · number question.viewCount · number
Auteur
question.author.name · string question.author.url · string question.author.reputation · number
Réponses
answerCount · number answers[].score · number answers[].isAccepted · boolean answers[].body · string
Commentaires
question.comments[] · array answers[].comments[].score · number answers[].comments[].createdAt · string
Tags
question.tags · array question.askedAt · string answers[].createdAt · string
De l'URL aux données en un seul appel.
Chaque requête Stack Exchange suit le même chemin. Vous envoyez une URL, nous gérons tout le reste.
Envoyez l'URL
Passez n'importe quelle URL publique Stack Exchange avec votre token : une question, un tag, une recherche ou une liste sur n'importe quel site du réseau.
Faites tourner un proxy
Une IP et une zone résidentielles qui atteignent chaque site proprement, tirées de 140M IP sur 30 régions.
Rendez la page
Un vrai navigateur charge la page pour que scores, réponses et commentaires soient rendus avant la capture.
Franchissez l'anti-bot
Les contrôles de bot et les limites de débit par page de chaque site sont gérés automatiquement. Rien à résoudre, rien à maintenir.
Renvoyez HTML ou JSON
Le HTML entièrement rendu revient, ou du JSON typé quand vous ajoutez stackexchange-serp ou stackexchange-thread.
Ce que les équipes construisent avec les données Stack Exchange.
Extraction de connaissances dev
Récupérez questions, réponses acceptées et commentaires sur le réseau pour bâtir des bases de connaissances consultables.
Données d'entraînement et RAG
Alimentez modèles, pipelines RAG et agents de code en texte question-réponse propre via une seule API.
Suivi des tendances tech
Surveillez tags et pages de recherche sur les sites pour repérer tôt les langages, outils et sujets émergents.
Jeux de données Q&R
Assemblez des jeux de données structurés question, réponse et vote pour l'évaluation et les benchmarks.
Recherche concurrentielle et dev
Exploitez de vraies questions, erreurs et contournements de développeurs pour orienter produit et docs.
N'importe quelle URL, une API
Crawlez questions, tags, pages utilisateur et recherche sur le réseau, plus tout autre site dont vous avez besoin.
Bon à savoir pour scraper Stack Exchange.
Une paire de scrapers, chaque site
stackexchange-serp et stackexchange-thread sont host-agnostic, donc les deux mêmes scrapers couvrent Stack Overflow, Super User, Ask Ubuntu, MathOverflow et toutes les communautés *.stackexchange.com.
HTML par défaut, JSON à la demande
Vous obtenez le HTML entièrement rendu. Ajoutez scraper=stackexchange-serp ou stackexchange-thread pour du JSON parsé, ou parsez le HTML vous-même.
Proxys résidentiels par conception
Stack Exchange limite le débit des IP de datacenter, donc les requêtes passent par le pool résidentiel. Chacune fait tourner une IP fraîche, pour un accès constant.
Atteignez chaque site de n'importe où
Le geotargeting sur 30 régions et 140M IP résidentielles signifie un accès constant sans gérer de proxys.
Conçu pour crawler Stack Exchange à grande échelle.
La Crawling API tourne sur le même réseau qui sert plus de 46 000 clients payants et 70 000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à corriger quand un site Stack Exchange change.
Un token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99,99 % de disponibilité en dessous.
Questions sur le scraping de Stack Exchange.
Commencez à scraper Stack Exchange.
Oubliez les proxys et les limites de débit.
Gratuit pour démarrer avec jusqu'à 20 000 requêtes. Un token pour la Crawling API et chaque scraper.