Scraper Kaggle.
Datasets et notebooks, entièrement rendus.
Envoyez n'importe quelle URL Kaggle et récupérez le HTML entièrement rendu, via des proxys résidentiels avec gestion anti-bot intégrée.
Ou obtenez du JSON structuré avec les scrapers kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp et kaggle-notebook.
Quatre scrapers Kaggle. Un JSON propre chacun.
Les quatre scrapers Kaggle, tapés en direct. kaggle-dataset-serp lit une page de recherche de datasets, kaggle-dataset récupère un dataset avec ses fichiers et sa licence, kaggle-notebook-serp lit une liste de notebooks, et kaggle-notebook renvoie un notebook avec ses stats et ses inputs. Changez d'onglet, ou survolez pour mettre en pause et lire.
Une API, chaque recoin de Kaggle.
Quatre scrapers dédiés couvrent les pages qui comptent : recherche de datasets, datasets individuels, recherche de notebooks et notebooks individuels. La Crawling API rend chaque page dans un vrai navigateur, l'atteint via des IP résidentielles et vous renvoie du HTML ou du JSON propre.
Chaque liste de datasets
kaggle-dataset-serp transforme une page de recherche de datasets en JSON : totalCount, page et hasNextPage, plus chaque carte avec sa position, son titre, son slug, son propriétaire, sa note d'utilisabilité, son nombre de fichiers et son format, sa taille, ses téléchargements, son nombre de notebooks, ses votes et sa médaille.
Métadonnées complètes de dataset
kaggle-dataset renvoie un dataset avec son titre, son sous-titre, sa description Markdown, sa version, ses mots-clés, son propriétaire, sa licence, sa liste de fichiers avec formats et tailles en octets, et ses compteurs de téléchargements, vues, votes et commentaires.
Listes de notebooks
kaggle-notebook-serp renvoie une page de recherche de notebooks, chaque ligne avec sa position, son titre, son slug, son auteur et ses coauteurs, sa dernière mise à jour, son nombre de commentaires, son contexte de compétition ou de dataset, ses votes et sa médaille.
Notebooks individuels
Ajoutez scraper=kaggle-notebook pour renvoyer un notebook avec son auteur, son langage, son runtime, son historique de versions, ses vues, ses votes, ses copies, ses commentaires, sa médaille, sa licence et ses inputs.
140M IP résidentielles
Chaque requête fait tourner une IP résidentielle sur 30 zones géographiques et franchit les contrôles de bot automatiquement. Rien à résoudre, rien à maintenir.
Une API pour chaque page
La Crawling API fonctionne sur n'importe quelle URL, donc le même token couvre chaque dataset et chaque notebook Kaggle et tout ce que vous crawlez d'autre. Voir la démo en direct.
Chaque champ de dataset, en JSON propre.
Envoyez une URL de dataset avec scraper=kaggle-dataset et le dataset revient en JSON typé, fichiers et licence inclus. Remplacez par kaggle-dataset-serp, kaggle-notebook-serp ou kaggle-notebook pour les listes et les notebooks.
Dataset
url · string id · string title · string subtitle · string
Propriétaire et licence
owner.name · string owner.url · string license.name · string license.url · string
Fichiers
files[].format · string files[].sizeBytes · number files[].downloadUrl · string files[].requiresSubscription · boolean
Engagement
downloads · number views · number votes · number commentCount · number
Métadonnées
description · string keywords · array lastUpdated · string isAccessibleForFree · boolean
De l'URL aux données en un seul appel.
Chaque requête Kaggle suit le même chemin. Vous envoyez une URL, nous gérons tout le reste.
Envoyez l'URL
Passez n'importe quelle URL publique Kaggle avec votre token : une page de recherche de datasets, un dataset, une liste de notebooks ou un notebook individuel.
Faites tourner un proxy
Une IP et une zone résidentielles qui atteignent le site proprement, tirées de 140M IP sur 30 régions.
Rendez la page
Un vrai navigateur charge la page pour que résultats de recherche, cartes de datasets et barres latérales de notebooks soient rendus avant la capture.
Franchissez l'anti-bot
Les contrôles de bot et les limites de débit du site sont gérés automatiquement. Rien à résoudre, rien à maintenir.
Renvoyez HTML ou JSON
Le HTML entièrement rendu revient, ou du JSON typé quand vous ajoutez kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp ou kaggle-notebook.
Ce que les équipes construisent avec les données Kaggle.
Découverte de datasets
Parcourez les pages de recherche de datasets par mot-clé et par page pour construire un index consultable de ce qui existe, de qui le possède et de la licence qui s'y applique.
Sync de catalogue de données
Mirrorez titres, sous-titres, descriptions, mots-clés, versions, formats de fichiers et tailles en octets des datasets dans un catalogue interne et gardez-le à jour.
Contrôles de licence et d'accès
Lisez le nom et l'URL de la licence, isAccessibleForFree et le flag requiresSubscription par fichier avant qu'un dataset n'entre dans un pipeline.
Recherche sur les notebooks et les méthodes
Collectez listes de notebooks et notebooks individuels pour voir avec quels langages, runtimes et contextes de compétition la communauté travaille vraiment.
Suivi de popularité
Suivez téléchargements, vues, votes, copies et nombre de commentaires dans le temps pour voir quels datasets et notebooks gagnent du terrain.
N'importe quelle URL, une API
Crawlez recherche de datasets, datasets, recherche de notebooks et notebooks individuels, plus tout autre site dont vous avez besoin.
Bon à savoir pour scraper Kaggle.
HTML par défaut, JSON à la demande
Vous obtenez le HTML entièrement rendu. Ajoutez scraper=kaggle-dataset-serp, kaggle-dataset, kaggle-notebook-serp ou kaggle-notebook pour du JSON parsé, ou parsez le HTML vous-même.
Les listes de notebooks affichent un label, pas un compte
Kaggle n'affiche que Results (100+) sur la liste de notebooks, donc totalCountLabel revient exactement sous cette forme plutôt que sous celle d'un nombre inventé. La liste de datasets expose bien un totalCount numérique réel.
Le corps des notebooks vit dans une iframe
Le notebook exécuté est servi depuis une origine séparée dans une iframe, il ne fait donc pas partie du document de la page. contentUrl pointe vers cette frame et porte un token signé de courte durée : récupérez-le peu après le crawl.
Les stats de liste arrivent telles qu'affichées
Sur une carte de dataset, size est la chaîne que Kaggle affiche avec ses unités, comme 6 kB, et le nombre de téléchargements abrégé est réexpansé en entier simple, donc 362K revient sous la forme 362000.
Conçu pour crawler Kaggle à grande échelle.
La Crawling API tourne sur le même réseau qui sert plus de 46 000 clients payants et 70 000 développeurs. Aucun proxy à acheter, aucun navigateur à faire tourner, rien à corriger quand le site change.
Un token, des SDK officiels pour Python, Node et Ruby, et un réseau à 99,99 % de disponibilité en dessous.
Questions sur le scraping de Kaggle.
Commencez à scraper Kaggle.
Oubliez les proxys et les limites de débit.
Gratuit pour démarrer avec jusqu'à 20 000 requêtes. Un token pour la Crawling API et chaque scraper.