Crawling API / Kaggle

Scraper Kaggle.
Datasets et notebooks, entièrement rendus.

Envoyez n'importe quelle URL Kaggle et récupérez le HTML entièrement rendu, via des proxys résidentiels avec gestion anti-bot intégrée.
Ou obtenez du JSON structuré avec les scrapers kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp et kaggle-notebook.

99 % de réussite140M IP résidentielles30 zones géographiques
URL KaggleHTML or JSONkaggle.com/datasets?search=...CrawlbaseRouterRenduExtraireHTML renduRecherche de jeuxJeu de donnéesRecherche de notebooksNotebookcrawling-apikaggle-dataset-serpkaggle-datasetkaggle-notebook-serpkaggle-notebookkaggle.com · rendu + parsé · 200
Flux de crawl en direct · Kaggle1.24M req/minEn streaming
200kaggle.com/code?searchQuery=titanicBR89ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudSG115ms
200kaggle.com/code?searchQuery=nlp&page=2ES195ms
200kaggle.com/code?searchQuery=titanicNL144ms
404kaggle.com/code?searchQuery=titanicGB83ms
200kaggle.com/datasets/zynicide/wine-reviewsNL193ms
200kaggle.com/codeIN59ms
200kaggle.com/datasets?search=heart+diseaseGB185ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudBR188ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyJP121ms
200kaggle.com/codeFR185ms
301kaggle.com/code?searchQuery=xgboost&language=PythonBR171ms
200kaggle.com/datasets?search=nlp&fileType=csvAU47ms
200kaggle.com/datasets?search=heart+diseaseGB96ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetNL187ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetJP122ms
200kaggle.com/datasets?search=image+classificationSG126ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetJP67ms
200kaggle.com/code?searchQuery=xgboost&language=PythonNL101ms
200kaggle.com/codeJP159ms
200kaggle.com/code?searchQuery=titanicDE206ms
200kaggle.com/code/alexisbcook/titanic-tutorialNL137ms
301kaggle.com/datasets?search=nlp&fileType=csvFR148ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyIN117ms
200kaggle.com/datasets/zynicide/wine-reviewsGB42ms
200kaggle.com/code?searchQuery=nlp&page=2DE165ms
200kaggle.com/code?searchQuery=titanicBR89ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudSG115ms
200kaggle.com/code?searchQuery=nlp&page=2ES195ms
200kaggle.com/code?searchQuery=titanicNL144ms
404kaggle.com/code?searchQuery=titanicGB83ms
200kaggle.com/datasets/zynicide/wine-reviewsNL193ms
200kaggle.com/codeIN59ms
200kaggle.com/datasets?search=heart+diseaseGB185ms
200kaggle.com/datasets/mlg-ulb/creditcardfraudBR188ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyJP121ms
200kaggle.com/codeFR185ms
301kaggle.com/code?searchQuery=xgboost&language=PythonBR171ms
200kaggle.com/datasets?search=nlp&fileType=csvAU47ms
200kaggle.com/datasets?search=heart+diseaseGB96ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetNL187ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetJP122ms
200kaggle.com/datasets?search=image+classificationSG126ms
200kaggle.com/datasets/johnsmith88/heart-disease-datasetJP67ms
200kaggle.com/code?searchQuery=xgboost&language=PythonNL101ms
200kaggle.com/codeJP159ms
200kaggle.com/code?searchQuery=titanicDE206ms
200kaggle.com/code/alexisbcook/titanic-tutorialNL137ms
301kaggle.com/datasets?search=nlp&fileType=csvFR148ms
200kaggle.com/code/ldfreeman3/a-data-science-framework-to-achieve-99-accuracyIN117ms
200kaggle.com/datasets/zynicide/wine-reviewsGB42ms
200kaggle.com/code?searchQuery=nlp&page=2DE165ms
01 Démo en direct

Quatre scrapers Kaggle. Un JSON propre chacun.

Les quatre scrapers Kaggle, tapés en direct. kaggle-dataset-serp lit une page de recherche de datasets, kaggle-dataset récupère un dataset avec ses fichiers et sa licence, kaggle-notebook-serp lit une liste de notebooks, et kaggle-notebook renvoie un notebook avec ses stats et ses inputs. Changez d'onglet, ou survolez pour mettre en pause et lire.

prêt
touches 1-4 pour changer · cliquez pour mettre en pauselancez votre propre URL
Lancez votre première requête en quelques minutes. Jusqu'à 20 000 requêtes gratuites, sans carte bancaire.Commencer gratuitement
02 Capacités

Une API, chaque recoin de Kaggle.

Quatre scrapers dédiés couvrent les pages qui comptent : recherche de datasets, datasets individuels, recherche de notebooks et notebooks individuels. La Crawling API rend chaque page dans un vrai navigateur, l'atteint via des IP résidentielles et vous renvoie du HTML ou du JSON propre.

recherche de datasets

Chaque liste de datasets

kaggle-dataset-serp transforme une page de recherche de datasets en JSON : totalCount, page et hasNextPage, plus chaque carte avec sa position, son titre, son slug, son propriétaire, sa note d'utilisabilité, son nombre de fichiers et son format, sa taille, ses téléchargements, son nombre de notebooks, ses votes et sa médaille.

datasets

Métadonnées complètes de dataset

kaggle-dataset renvoie un dataset avec son titre, son sous-titre, sa description Markdown, sa version, ses mots-clés, son propriétaire, sa licence, sa liste de fichiers avec formats et tailles en octets, et ses compteurs de téléchargements, vues, votes et commentaires.

recherche de notebooks

Listes de notebooks

kaggle-notebook-serp renvoie une page de recherche de notebooks, chaque ligne avec sa position, son titre, son slug, son auteur et ses coauteurs, sa dernière mise à jour, son nombre de commentaires, son contexte de compétition ou de dataset, ses votes et sa médaille.

notebooks

Notebooks individuels

Ajoutez scraper=kaggle-notebook pour renvoyer un notebook avec son auteur, son langage, son runtime, son historique de versions, ses vues, ses votes, ses copies, ses commentaires, sa médaille, sa licence et ses inputs.

proxys

140M IP résidentielles

Chaque requête fait tourner une IP résidentielle sur 30 zones géographiques et franchit les contrôles de bot automatiquement. Rien à résoudre, rien à maintenir.

un token

Une API pour chaque page

La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre chaque dataset et chaque notebook Kaggle et tout ce que vous crawlez d'autre. Voir la démo en direct.

03 Sortie

Chaque champ de dataset, en JSON propre.

Envoyez une URL de dataset avec scraper=kaggle-dataset et le dataset revient en JSON typé, fichiers et licence inclus. Remplacez par kaggle-dataset-serp, kaggle-notebook-serp ou kaggle-notebook pour les listes et les notebooks.

{ "url": "https://www.kaggle.com/datasets/uciml/iris", "id": "19", "title": "Iris Species", "subtitle": "Classify iris plants into three species in this classic dataset", "description": "The famous Iris flower data set, first used by Sir R.A. Fisher.", "version": 2, "keywords": [ "subject", "earth and nature", "biology" ], "owner": { "name": "UCI Machine Learning", "url": "https://www.kaggle.com/organizations/uciml" }, "license": { "name": "CC0: Public Domain", "url": "https://creativecommons.org/publicdomain/zero/1.0/" }, "files": [ { "format": "zip", "sizeBytes": 3687, "downloadUrl": "https://www.kaggle.com/api/v1/datasets/download/uciml/iris", "requiresSubscription": true } ], "downloads": 907784, "views": 3131083, "votes": 4861, "commentCount": 33, "lastUpdated": "2016-09-27T07:38:05.44Z", "isAccessibleForFree": true }

Dataset

url · string  id · string  title · string  subtitle · string

Propriétaire et licence

owner.name · string  owner.url · string  license.name · string  license.url · string

Fichiers

files[].format · string  files[].sizeBytes · number  files[].downloadUrl · string  files[].requiresSubscription · boolean

Engagement

downloads · number  views · number  votes · number  commentCount · number

Métadonnées

description · string  keywords · array  lastUpdated · string  isAccessibleForFree · boolean

04 Comment ça marche

De l'URL aux données en un seul appel.

Chaque requête Kaggle suit le même chemin. Vous envoyez une URL, nous gérons tout le reste.

01

Envoyez l'URL

Passez n'importe quelle URL publique Kaggle avec votre token : une page de recherche de datasets, un dataset, une liste de notebooks ou un notebook individuel.

02

Faites tourner un proxy

Une IP et une zone résidentielles qui atteignent le site proprement, tirées de 140M IP sur 30 régions.

03

Rendez la page

Un vrai navigateur charge la page pour que résultats de recherche, cartes de datasets et barres latérales de notebooks soient rendus avant la capture.

04

Franchissez l'anti-bot

Les contrôles de bot et les limites de débit du site sont gérés automatiquement. Rien à résoudre, rien à maintenir.

05

Renvoyez HTML ou JSON

Le HTML entièrement rendu revient, ou du JSON typé quand vous ajoutez kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp ou kaggle-notebook.

05 Cas d'usage

Ce que les équipes construisent avec les données Kaggle.

USE / 01Découverte

Découverte de datasets

Parcourez les pages de recherche de datasets par mot-clé et par page pour construire un index consultable de ce qui existe, de qui le possède et de la licence qui s'y applique.

USE / 02Catalogue

Sync de catalogue de données

Mirrorez titres, sous-titres, descriptions, mots-clés, versions, formats de fichiers et tailles en octets des datasets dans un catalogue interne et gardez-le à jour.

USE / 03Licences

Contrôles de licence et d'accès

Lisez le nom et l'URL de la licence, isAccessibleForFree et le flag requiresSubscription par fichier avant qu'un dataset n'entre dans un pipeline.

USE / 04Recherche

Recherche sur les notebooks et les méthodes

Collectez listes de notebooks et notebooks individuels pour voir avec quels langages, runtimes et contextes de compétition la communauté travaille vraiment.

USE / 05Classement

Suivi de popularité

Suivez téléchargements, vues, votes, copies et nombre de commentaires dans le temps pour voir quels datasets et notebooks gagnent du terrain.

USE / 06Couverture

N'importe quelle URL, une API

Crawlez recherche de datasets, datasets, recherche de notebooks et notebooks individuels, plus tout autre site dont vous avez besoin.

06 À savoir

Bon à savoir pour scraper Kaggle.

HTML par défaut, JSON à la demande

Vous obtenez le HTML entièrement rendu. Ajoutez scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp ou kaggle-notebook pour du JSON parsé, ou parsez le HTML vous-même.

Les listes de notebooks affichent un label, pas un compte

Kaggle n'affiche que Results (100+) sur la liste de notebooks, donc totalCountLabel revient exactement sous cette forme plutôt que sous celle d'un nombre inventé. La liste de datasets expose bien un totalCount numérique réel.

Le corps des notebooks vit dans une iframe

Le notebook exécuté est servi depuis une origine séparée dans une iframe, il ne fait donc pas partie du document de la page. contentUrl pointe vers cette frame et porte un token signé de courte durée : récupérez-le peu après le crawl.

Les stats de liste arrivent telles qu'affichées

Sur une carte de dataset, size est la chaîne que Kaggle affiche avec ses unités, comme 6 kB, et le nombre de téléchargements abrégé est réexpansé en entier simple, donc 362K revient sous la forme 362000.

07 Pourquoi Crawlbase

Conçu pour crawler Kaggle à grande échelle.

La Crawling API tourne sur le même réseau qui sert plus de 46 000 clients payants et 70 000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à corriger quand le site change.

99%
Taux de réussite moyen des requêtes
140M
IP résidentielles, plus 98M datacenter
30
Zones géographiques pour des résultats locaux précis
20/s
Requêtes par seconde par défaut, plus sur demande

Un token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99,99 % de disponibilité en dessous.

08 FAQ

Questions sur le scraping de Kaggle.

Envoyez n'importe quelle URL Kaggle à la Crawling API de Crawlbase avec votre token. Crawlbase fait tourner un proxy résidentiel, rend la page dans un vrai navigateur, franchit les contrôles de bot et renvoie le HTML entièrement rendu. Ajoutez un scraper dédié (scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp ou kaggle-notebook) pour obtenir du JSON structuré à la place.
Oui. Par défaut la Crawling API renvoie du HTML rendu ; ajoutez un scraper dédié pour recevoir du JSON structuré : kaggle-dataset-serp pour une page de recherche de datasets, kaggle-dataset pour un dataset individuel, kaggle-notebook-serp pour une liste de notebooks, et kaggle-notebook pour un notebook individuel.
Les pages de recherche et de liste de datasets, les pages de dataset individuelles, les pages de recherche et de liste de notebooks, et les pages de notebook individuelles sur kaggle.com. La même API fonctionne aussi sur tout autre site.
Crawlbase route chaque requête via des IP résidentielles rotatives sur 30 zones géographiques et franchit les contrôles de bot automatiquement, donc l'accès reste constant et il n'y a rien à maintenir quand le site change sa configuration.
kaggle-dataset-serp renvoie une page de recherche de datasets avec totalCount, pagination et une carte par résultat. kaggle-dataset renvoie un dataset avec sa description, ses mots-clés, son propriétaire, sa licence, ses fichiers et ses compteurs. kaggle-notebook-serp renvoie une liste de notebooks avec auteur, coauteurs, contexte, votes et médaille par ligne. kaggle-notebook renvoie un notebook individuel avec son langage, son runtime, ses versions, ses vues, ses votes, ses copies, sa licence et ses inputs.
Le scraper kaggle-notebook renvoie les métadonnées du notebook : auteur, langage, runtime, nombre de versions, vues, votes, copies, commentaires, médaille, licence et inputs. Le corps du notebook exécuté est servi dans une iframe séparée, il n'est donc pas dans le document de la page ; le scraper renvoie contentUrl, qui pointe vers cette frame et porte un token signé de courte durée que vous pouvez récupérer juste après le crawl.
Commencez gratuitement avec jusqu'à 20 000 requêtes et sans carte bancaire. Les offres payantes évoluent avec l'usage, et le même token fonctionne pour la Crawling API et chaque scraper Crawlbase.

Commencez à scraper Kaggle.
Oubliez les proxys et les limites de débit.

Gratuit pour démarrer avec jusqu'à 20 000 requêtes. Un token pour la Crawling API et chaque scraper.