Crawling API / GitHub

GitHub Scraper.
Chaque page, entièrement rendue.

Envoyez n'importe quelle URL GitHub et récupérez le HTML entièrement rendu, via des proxies résidentiels avec gestion anti-bot intégrée.
Ou extrayez du JSON structuré avec les scrapers github-repository, github-serp et github-profile.

99% de taux de réussite140M d'IP résidentielles30 zones géographiques
URL GitHubJSON structurégithub.com/rails/railsCrawlbaseRouterRenduAnalyseJSON dépôtJSON rechercheJSON profilgithub-repositorygithub-serpgithub-profilegithub.com · rate limit rerouted · 200
Flux de crawl en direct · GitHub1.24M req/minStreaming
200github.com/torvalds/linuxSG167ms
200github.com/huggingfaceSG103ms
200github.com/vercel/next.js/issuesCA124ms
200github.com/kubernetes/kubernetes/issuesCA128ms
200github.com/vercel/next.js/issuesFR83ms
200github.com/search?q=web+scraping&type=repositoriesGB61ms
200github.com/search?q=web+scraping&type=repositoriesGB146ms
200github.com/golang/goAU190ms
200github.com/torvalds/linuxIN42ms
200github.com/topics/machine-learningBR67ms
200github.com/topics/machine-learningAU200ms
200github.com/facebook/reactBR168ms
200github.com/search?q=llm+agents&type=repositoriesNL143ms
301github.com/kubernetes/kubernetes/issuesUS183ms
200github.com/kubernetes/kubernetes/issuesES102ms
200github.com/search?q=llm+agents&type=repositoriesNL144ms
200github.com/golang/goBR75ms
200github.com/microsoftES41ms
200github.com/rust-lang/rustGB58ms
200github.com/anthropics/anthropic-sdk-pythonCA53ms
200github.com/huggingfaceCA143ms
200github.com/search?q=web+scraping&type=repositoriesJP95ms
200github.com/facebook/reactBR119ms
200github.com/search?q=llm+agents&type=repositoriesDE217ms
200github.com/kubernetes/kubernetes/issuesNL63ms
200github.com/topics/machine-learningSG217ms
200github.com/torvalds/linuxSG167ms
200github.com/huggingfaceSG103ms
200github.com/vercel/next.js/issuesCA124ms
200github.com/kubernetes/kubernetes/issuesCA128ms
200github.com/vercel/next.js/issuesFR83ms
200github.com/search?q=web+scraping&type=repositoriesGB61ms
200github.com/search?q=web+scraping&type=repositoriesGB146ms
200github.com/golang/goAU190ms
200github.com/torvalds/linuxIN42ms
200github.com/topics/machine-learningBR67ms
200github.com/topics/machine-learningAU200ms
200github.com/facebook/reactBR168ms
200github.com/search?q=llm+agents&type=repositoriesNL143ms
301github.com/kubernetes/kubernetes/issuesUS183ms
200github.com/kubernetes/kubernetes/issuesES102ms
200github.com/search?q=llm+agents&type=repositoriesNL144ms
200github.com/golang/goBR75ms
200github.com/microsoftES41ms
200github.com/rust-lang/rustGB58ms
200github.com/anthropics/anthropic-sdk-pythonCA53ms
200github.com/huggingfaceCA143ms
200github.com/search?q=web+scraping&type=repositoriesJP95ms
200github.com/facebook/reactBR119ms
200github.com/search?q=llm+agents&type=repositoriesDE217ms
200github.com/kubernetes/kubernetes/issuesNL63ms
200github.com/topics/machine-learningSG217ms
01 Démo en direct

Trois scrapers GitHub, en direct.

La Crawling API, tapée en direct. Regardez les scrapers github-repository, github-serp et github-profile renvoyer chacun du JSON structuré. Survolez pour mettre en pause et lire.

prêt
touches 1-3 pour changer · cliquez pour mettre en pauselancez votre propre URL
Lancez votre premier request en quelques minutes. Jusqu'à 20,000 requests gratuits, sans carte bancaire.Commencer gratuitement
02 Fonctionnalités

Une seule API, pour tout ce que GitHub vous oppose.

GitHub rend les repos côté client et applique des rate limits agressifs. La Crawling API charge la page complète dans un vrai navigateur, l'atteint via des IP résidentielles, et vous remet du HTML ou du JSON propre.

rendering

Rendering JavaScript complet

Un vrai navigateur exécute la page, si bien que le README, les stars, les forks, les langages et l'arborescence de fichiers sont tous rendus et présents dans le HTML, pas seulement le markup initial.

proxies

140M d'IP résidentielles

Chaque request fait tourner une IP résidentielle parmi 30 zones géographiques, pour que vous atteigniez GitHub comme un vrai visiteur local.

anti-bot

Les blocages gérés pour vous

Les rate limits, les vérifications anti-bot et les pages de challenge sont franchis automatiquement. Aucun personal access token à jongler, rien à maintenir.

format

HTML ou JSON

Obtenez le HTML entièrement rendu, ou ajoutez scraper=github-repository, github-serp ou github-profile pour renvoyer les repositories, les résultats de recherche et les profils en JSON structuré.

extras

Captures d'écran et asynchrone

Le même appel peut capturer une capture d'écran pleine page, ou s'exécuter de manière asynchrone avec des webhooks et du cloud storage.

un seul token

Une seule API pour chaque site

La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre GitHub et tout le reste de ce que vous crawlez. Voir la démo en direct.

03 Sortie

Chaque champ du repository, en JSON propre.

Envoyez l'URL d'un repository avec scraper=github-repository et le repository revient en JSON typé. Utilisez github-serp ou github-profile pour faire de même avec les résultats de recherche et les profils.

{ "name": "rails", "fullName": "rails/rails", "url": "https://github.com/rails/rails", "description": "Ruby on Rails", "stars": 58789, "forks": 22414, "watchers": 3819, "primaryLanguage": "Ruby", "languages": [ "Ruby", "JavaScript", "HTML" ], "topics": [ "ruby", "rails", "framework" ], "openIssues": 612, "latestRelease": "v8.1.3", "defaultBranch": "main", "license": "MIT license", "archived": false }

Identité

name · string  fullName · string  url · string  description · string

Popularité

stars · number  forks · number  watchers · number

Stack

primaryLanguage · string  languages · array  topics · array

Activité

openIssues · number  latestRelease · string  defaultBranch · string

Meta

license · string  archived · boolean

04 Fonctionnement

De l'URL aux données en un seul appel.

Chaque request GitHub suit le même chemin. Vous envoyez une URL, nous gérons tout ce qui se trouve entre les deux.

01

Envoyez l'URL

Passez n'importe quelle URL GitHub publique avec votre token : un repository, une issue, un profil ou une recherche.

02

Faites tourner un proxy

Une IP résidentielle et une zone géographique qui atteignent GitHub proprement, tirées de 140M d'IP réparties sur 30 régions.

03

Rendez la page

Un vrai navigateur charge la page du repository afin que le README, les stars, les forks, les langages et l'arborescence de fichiers soient rendus avant la capture.

04

Franchissez l'anti-bot

Les rate limits et les vérifications anti-bot de GitHub sont gérés automatiquement. Aucun token à jongler, rien à maintenir.

05

Renvoyez du HTML ou du JSON

Le HTML entièrement rendu revient, ou du JSON typé lorsque vous ajoutez un scraper comme github-repository, github-serp ou github-profile.

05 Cas d'usage

Ce que les équipes construisent sur les données GitHub.

USE / 01OSS

Intelligence open source et développeurs

Suivez les repositories, les stars, les forks, les langages et les releases pour cartographier le paysage open source et savoir qui construit quoi.

USE / 02Tendances

Suivi des dépendances et des tendances

Observez les topics, les pages de recherche et l'activité des releases pour repérer tôt les bibliothèques, frameworks et outils qui montent.

USE / 03Recrutement

Recrutement et dev-rel

Exploitez les profils publics et les contributions pour trouver des mainteneurs, sourcer des talents et atteindre les bonnes communautés de développeurs.

USE / 04Entraînement

Données d'entraînement pour modèles de code

Alimentez les modèles, les pipelines RAG et les agents de code avec du texte de README et de page propre via une seule API.

USE / 05Sécurité

Sécurité et recherche sur la supply chain

Surveillez les repositories, les issues et les dépendances publics pour étudier les packages et le risque de supply chain.

USE / 06Couverture

N'importe quelle URL, une seule API

Crawlez les repos, les issues, les profils, les topics et la recherche, plus tout autre site dont vous avez besoin.

06 Notes

Bon à savoir pour scraper GitHub.

Rendu comme un vrai navigateur

GitHub rend les repos côté client ; la Crawling API lance un vrai navigateur afin que le README, les stars, les forks, les langages et l'arborescence de fichiers se chargent tous avant la capture.

HTML par défaut, JSON à la demande

Vous obtenez le HTML entièrement rendu. Ajoutez scraper=github-repository, github-serp ou github-profile pour du JSON parsé, ou parsez le HTML vous-même.

Aucun token GitHub ni limite d'API

Vous pointez vers la page web publique, il n'y a donc aucun personal access token à faire tourner ni aucun rate limit de REST API à budgéter.

Repos et profils publics uniquement

La Crawling API lit les pages visibles publiquement, sans login, vous obtenez donc ce que voit un visiteur déconnecté.

07 Pourquoi Crawlbase

Conçu pour crawler GitHub à grande échelle.

La Crawling API tourne sur le même réseau qui sert plus de 46,000 clients payants et plus de 70,000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à patcher quand GitHub change.

99%
Taux de réussite moyen des requests
140M
IP résidentielles, plus 98M en datacenter
30
Zones géographiques pour des résultats locaux précis
20/s
Requests par seconde par défaut, davantage sur demande

Un seul token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99.99% de disponibilité en dessous.

08 FAQ

Questions sur le scraping de GitHub.

Envoyez l'URL GitHub à la Crawling API de Crawlbase avec votre token. Crawlbase fait tourner un proxy résidentiel, rend la page dans un vrai navigateur, franchit les vérifications anti-bot et renvoie le HTML entièrement rendu. Ajoutez un scraper dédié (scraper=github-repository, github-serp ou github-profile) pour obtenir du JSON structuré à la place.
Oui. Par défaut, la Crawling API renvoie du HTML rendu ; ajoutez un scraper GitHub dédié (scraper=github-repository pour les repos, github-serp pour la recherche, github-profile pour les profils) pour recevoir du JSON structuré, ou parsez le HTML vous-même.
Non. Vous pointez la Crawling API vers la page web publique, il n'y a donc aucun personal access token à émettre ou à faire tourner ni aucun rate limit de REST API à budgéter. Crawlbase atteint GitHub pour vous.
Crawlbase route chaque request via des IP résidentielles rotatives réparties sur 30 zones géographiques et franchit les vérifications anti-bot automatiquement. Vous ne gérez pas de proxies ni ne jonglez avec des tokens, et il n'y a rien à maintenir quand GitHub change sa configuration.
Oui. Un vrai navigateur charge la page du repository, si bien que le README rendu, les stars, les forks, les langages et l'arborescence de fichiers sont tous présents dans le HTML, pas seulement le markup initial.
N'importe quelle URL publique : repositories, issues et pull requests, profils d'utilisateurs et d'organisations, pages de topics et résultats de recherche. La même API fonctionne aussi sur n'importe quel autre site.
Commencez gratuitement avec jusqu'à 20,000 requests et sans carte bancaire. Les plans payants évoluent avec l'usage, et le même token fonctionne sur la Crawling API et tous les scrapers Crawlbase.

Commencez à scraper GitHub.
Oubliez les tokens et les rate limits.

Gratuit pour débuter avec jusqu'à 20,000 requests. Un seul token pour la Crawling API et chaque scraper.