GitHub Scraper.
Chaque page, entièrement rendue.
Envoyez n'importe quelle URL GitHub et récupérez le HTML entièrement rendu, via des proxies résidentiels avec gestion anti-bot intégrée.
Ou extrayez du JSON structuré avec les scrapers github-repository, github-serp et github-profile.
Trois scrapers GitHub, en direct.
La Crawling API, tapée en direct. Regardez les scrapers github-repository, github-serp et github-profile renvoyer chacun du JSON structuré. Survolez pour mettre en pause et lire.
Une seule API, pour tout ce que GitHub vous oppose.
GitHub rend les repos côté client et applique des rate limits agressifs. La Crawling API charge la page complète dans un vrai navigateur, l'atteint via des IP résidentielles, et vous remet du HTML ou du JSON propre.
Rendering JavaScript complet
Un vrai navigateur exécute la page, si bien que le README, les stars, les forks, les langages et l'arborescence de fichiers sont tous rendus et présents dans le HTML, pas seulement le markup initial.
140M d'IP résidentielles
Chaque request fait tourner une IP résidentielle parmi 30 zones géographiques, pour que vous atteigniez GitHub comme un vrai visiteur local.
Les blocages gérés pour vous
Les rate limits, les vérifications anti-bot et les pages de challenge sont franchis automatiquement. Aucun personal access token à jongler, rien à maintenir.
HTML ou JSON
Obtenez le HTML entièrement rendu, ou ajoutez scraper=github-repository, github-serp ou github-profile pour renvoyer les repositories, les résultats de recherche et les profils en JSON structuré.
Captures d'écran et asynchrone
Le même appel peut capturer une capture d'écran pleine page, ou s'exécuter de manière asynchrone avec des webhooks et du cloud storage.
Une seule API pour chaque site
La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre GitHub et tout le reste de ce que vous crawlez. Voir la démo en direct.
Chaque champ du repository, en JSON propre.
Envoyez l'URL d'un repository avec scraper=github-repository et le repository revient en JSON typé. Utilisez github-serp ou github-profile pour faire de même avec les résultats de recherche et les profils.
Identité
name · string fullName · string url · string description · string
Popularité
stars · number forks · number watchers · number
Stack
primaryLanguage · string languages · array topics · array
Activité
openIssues · number latestRelease · string defaultBranch · string
Meta
license · string archived · boolean
De l'URL aux données en un seul appel.
Chaque request GitHub suit le même chemin. Vous envoyez une URL, nous gérons tout ce qui se trouve entre les deux.
Envoyez l'URL
Passez n'importe quelle URL GitHub publique avec votre token : un repository, une issue, un profil ou une recherche.
Faites tourner un proxy
Une IP résidentielle et une zone géographique qui atteignent GitHub proprement, tirées de 140M d'IP réparties sur 30 régions.
Rendez la page
Un vrai navigateur charge la page du repository afin que le README, les stars, les forks, les langages et l'arborescence de fichiers soient rendus avant la capture.
Franchissez l'anti-bot
Les rate limits et les vérifications anti-bot de GitHub sont gérés automatiquement. Aucun token à jongler, rien à maintenir.
Renvoyez du HTML ou du JSON
Le HTML entièrement rendu revient, ou du JSON typé lorsque vous ajoutez un scraper comme github-repository, github-serp ou github-profile.
Ce que les équipes construisent sur les données GitHub.
Intelligence open source et développeurs
Suivez les repositories, les stars, les forks, les langages et les releases pour cartographier le paysage open source et savoir qui construit quoi.
Suivi des dépendances et des tendances
Observez les topics, les pages de recherche et l'activité des releases pour repérer tôt les bibliothèques, frameworks et outils qui montent.
Recrutement et dev-rel
Exploitez les profils publics et les contributions pour trouver des mainteneurs, sourcer des talents et atteindre les bonnes communautés de développeurs.
Données d'entraînement pour modèles de code
Alimentez les modèles, les pipelines RAG et les agents de code avec du texte de README et de page propre via une seule API.
Sécurité et recherche sur la supply chain
Surveillez les repositories, les issues et les dépendances publics pour étudier les packages et le risque de supply chain.
N'importe quelle URL, une seule API
Crawlez les repos, les issues, les profils, les topics et la recherche, plus tout autre site dont vous avez besoin.
Bon à savoir pour scraper GitHub.
Rendu comme un vrai navigateur
GitHub rend les repos côté client ; la Crawling API lance un vrai navigateur afin que le README, les stars, les forks, les langages et l'arborescence de fichiers se chargent tous avant la capture.
HTML par défaut, JSON à la demande
Vous obtenez le HTML entièrement rendu. Ajoutez scraper=github-repository, github-serp ou github-profile pour du JSON parsé, ou parsez le HTML vous-même.
Aucun token GitHub ni limite d'API
Vous pointez vers la page web publique, il n'y a donc aucun personal access token à faire tourner ni aucun rate limit de REST API à budgéter.
Repos et profils publics uniquement
La Crawling API lit les pages visibles publiquement, sans login, vous obtenez donc ce que voit un visiteur déconnecté.
Conçu pour crawler GitHub à grande échelle.
La Crawling API tourne sur le même réseau qui sert plus de 46,000 clients payants et plus de 70,000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à patcher quand GitHub change.
Un seul token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99.99% de disponibilité en dessous.
Questions sur le scraping de GitHub.
Commencez à scraper GitHub.
Oubliez les tokens et les rate limits.
Gratuit pour débuter avec jusqu'à 20,000 requests. Un seul token pour la Crawling API et chaque scraper.