La promesse d'un scraper IA sans code est simple : décrivez en langage naturel les données souhaitées, et un workflow récupère la page, la transmet à un modèle de langage, et vous renvoie des lignes structurées et propres. Pas de sélecteurs à maintenir, pas de script de scraping à surveiller, et surtout, aucun ingénieur requis pour l'exécuter. Ce guide vous montre comment construire exactement cela avec Crawlbase : un workflow visuel dans n8n qui connecte le Web MCP Crawlbase (ou la Crawling API) à un LLM afin qu'un non-technicien puisse scraper et structurer de vraies données web.
Les composants sont tous disponibles sur étagère. n8n vous offre un canevas en glisser-déposer, Crawlbase gère la partie difficile qui consiste à récupérer une page qui résiste aux bots, et le LLM transforme le HTML brut en la structure JSON que vous avez demandée. Vous n'avez à rédiger qu'une courte instruction et quelques lignes de configuration. Au terme de ce tutoriel, vous disposerez d'un scraper IA sans code avec Crawlbase que n'importe quel membre de votre équipe pourra déclencher et réutiliser.
Ce que fait réellement un scraper IA sans code
Il est utile d'être précis sur la répartition des tâches, car le mot magique « IA » masque trois rôles distincts. La récupération consiste à obtenir la page rendue malgré JavaScript, les proxies rotatifs et les défenses anti-bots. L'interprétation consiste à lire ce HTML et à en extraire les champs qui vous intéressent. L'orchestration consiste à connecter ces étapes pour qu'elles s'exécutent selon un calendrier ou un déclencheur, sans que vous ayez à toucher au code à chaque fois.
Dans cette configuration, Crawlbase prend en charge la récupération, le LLM s'occupe de l'interprétation, et n8n gère l'orchestration. Maintenir ces frontières clairement définies est ce qui rend le workflow fiable. Le LLM excelle à lire du contenu et échoue à contourner les blocages : ne lui demandez donc jamais de récupérer une URL directement. Crawlbase excelle à récupérer les pages et se soucie peu du sens : ne lui demandez donc jamais de « comprendre » la page. Chaque nœud fait ce qu'il fait de mieux.
Les outils dont vous avez besoin
Trois comptes et vous êtes prêt, aucun ne nécessite d'écrire du code pour être configuré.
- n8n, l'outil de workflow no-code/low-code. Utilisez n8n Cloud ou une instance auto-hébergée ; les deux exposent le même canevas visuel.
- Un compte Crawlbase pour la couche de récupération. Après l'inscription, vous obtenez un token normal et un token JavaScript (JS) depuis le tableau de bord. Utilisez le token JS pour les pages qui se rendent côté client.
- Un fournisseur de LLM tel que Claude ou GPT, accessible soit via les nœuds IA natifs de n8n, soit via un simple nœud HTTP.
Vous pouvez connecter Crawlbase à votre workflow de deux façons. Le serveur Web MCP expose Crawlbase comme un ensemble d'outils qu'un agent IA peut appeler de lui-même, ce qui convient parfaitement lorsque votre outil no-code dispose d'un nœud MCP ou agent IA natif. Si vous préférez garder les choses explicites, la Crawling API est un endpoint HTTP standard que vous pouvez appeler depuis n'importe quel nœud HTTP. Nous utiliserons le nœud Crawling API pour la démonstration principale, car il fonctionne dans toutes les versions de n8n, puis nous montrerons comment le serveur MCP s'y intègre.
Le serveur MCP et la Crawling API s'appuient sur le même moteur de récupération. Le MCP est conçu pour les agents IA qui décident eux-mêmes quel outil appeler et quand ; la Crawling API est une requête directe que vous contrôlez étape par étape. Si votre outil no-code dispose d'un nœud MCP natif, le chemin MCP permet à l'agent de récupérer des pages de façon autonome. Sinon, le nœud HTTP appelant la Crawling API donne le même résultat sans configuration supplémentaire.
La forme du workflow
Le flux visuel comprend quatre nœuds, de gauche à droite sur le canevas n8n. Un Trigger démarre l'exécution, soit manuellement, soit selon un calendrier, soit à partir d'un webhook. Un nœud HTTP Request appelle la Crawling API Crawlbase et récupère le HTML rendu. Un nœud AI / LLM reçoit ce HTML avec votre instruction d'extraction et renvoie du JSON structuré. Un nœud final écrit le résultat quelque part d'utile : une Google Sheet, une base de données, un message Slack, ou simplement la sortie du workflow.
Voilà l'ensemble du tableau. Chaque étape après le trigger est un nœud que vous faites glisser sur le canevas et connectez avec une ligne. La seule saisie que vous effectuez est l'URL, un token et une phrase d'instruction.
Étape 1 : ajouter un déclencheur
Commencez un nouveau workflow et ajoutez un nœud déclencheur. Pour votre premier test, le Manual Trigger est le plus simple, car vous pouvez cliquer sur « Execute workflow » et observer les données circuler. Une fois que cela fonctionne, remplacez-le par un Schedule Trigger pour exécuter le scraping chaque matin, ou par un Webhook pour qu'un autre système puisse le déclencher. Rien en aval ne change lorsque vous changez de déclencheur, c'est précisément l'intérêt de séparer l'orchestration.
Étape 2 : récupérer la page avec Crawlbase
Ajoutez un nœud HTTP Request et connectez-le au déclencheur. C'est ce nœud qui communique avec la Crawling API. Définissez la méthode sur GET et pointez-la vers l'endpoint Crawlbase, en passant votre token, l'URL cible et l'indicateur de rendu JS pour les pages côté client. Dans n8n, vous renseignez ces valeurs dans les champs du nœud, mais sous le capot, il s'agit d'une seule requête qui ressemble à ceci.
https://api.crawlbase.com/?token=YOUR_CRAWLBASE_JS_TOKEN&javascript=true&ajax_wait=true&url=https%3A%2F%2Fwww.ebay.com%2Fstr%2Fbestsellingproducts
Trois éléments sont importants ici. Le token est votre token JS, qui indique à Crawlbase de rendre la page dans un vrai navigateur avant de la renvoyer. L'indicateur javascript=true active ce rendu, et ajax_wait=true attend le contenu asynchrone afin que les listes chargées tardivement soient présentes dans la réponse. L'url est votre cible, encodée en URL. Crawlbase fait tourner des adresses IP résidentielles et gère les CAPTCHA côté serveur, de sorte que le nœud récupère du HTML complet plutôt qu'une coquille vide ou une page de blocage.
Dans le nœud HTTP Request de n8n, ajoutez ces paramètres en tant que paramètres de requête plutôt que de construire la chaîne manuellement. Placez le token dans un credential pour qu'il ne soit jamais affiché en clair sur le canevas, définissez url comme une expression qui lit depuis le déclencheur, et vous obtenez une étape de récupération réutilisable.
Étape 3 : transmettre le HTML au LLM
Ajoutez ensuite un nœud IA, soit le nœud AI Agent natif de n8n, soit un Basic LLM Chain, et connectez-le au nœud HTTP Request. C'est là que l'interprétation se produit. Vous alimentez le nœud avec le HTML de l'étape précédente, accompagné d'une instruction claire décrivant les champs souhaités et la structure JSON exacte à renvoyer. Un prompt comme celui ci-dessous fonctionne bien.
You are a data extraction assistant. From the HTML below, extract every product as an object with these keys: title (string), price (number), condition (string), seller (string), url (string). Return a JSON array only, no prose. If a field is missing, set it to null. If a product is out of stock, still include it and add availability: false. HTML: {{ $json.body }}
L'expression {{ $json.body }} injecte le HTML renvoyé par le nœud Crawlbase dans le prompt. L'instruction fait le reste : elle nomme les clés, fixe leurs types, et indique au modèle comment se comporter quand la réalité est désordonnée. Parce que le LLM lit le contenu de manière sémantique, il repère les prix et les détails des vendeurs même lorsque la mise en page varie entre les annonces, ce qui est précisément la résilience qu'un scraper basé sur des sélecteurs ne possède pas.
Vous souhaitez que l'agent IA récupère les pages de lui-même plutôt qu'à travers une étape HTTP fixe ? Le serveur Web MCP expose Crawlbase comme des outils que votre agent peut appeler, de sorte qu'il décide quand crawler, quand effectuer un nouveau rendu et quand paginer, le tout derrière des adresses IP résidentielles tournantes. Ajoutez le serveur MCP au nœud agent de votre outil no-code et la couche de récupération devient l'une des capacités natives du modèle. Commencez sur l'offre gratuite et pointez-le vers une page publique en premier.
Étape 4 : enregistrer la sortie structurée
Le nœud IA émet désormais un tableau JSON propre. Ajoutez un nœud final pour le placer quelque part d'utilisable. Un nœud Google Sheets ajoute chaque produit en tant que ligne, un nœud Postgres ou MySQL écrit dans une table, et un nœud Slack ou email peut envoyer un résumé. Comme les données sont déjà structurées, leur mapping sur des colonnes se fait en glisser-déposer : connectez chaque clé JSON au champ de destination et exécutez le workflow.
Le résultat est ce que le scraper IA sans code s'était fixé pour objectif. Un non-technicien clique sur « Execute workflow » et un jeu de données propre se retrouve dans un tableur, sans HTML, sans sélecteurs et sans script en vue.
Utiliser le serveur Web MCP à la place
Si votre outil no-code prend en charge le MCP, vous pouvez fusionner les étapes 2 et 3 en une seule. Au lieu d'un nœud HTTP fixe, vous donnez à votre agent IA accès au serveur MCP et le laissez appeler lui-même l'outil de crawl. L'agent lit votre instruction (« récupère les produits les plus vendus de cette page eBay au format JSON »), invoque l'outil Crawlbase pour récupérer le HTML rendu, puis extrait les champs au cours du même tour. La connexion est un petit bloc JSON dans les paramètres MCP de votre outil.
{ "mcpServers": { "crawlbase": { "command": "npx", "args": ["-y", "@crawlbase/mcp"], "env": { "CRAWLBASE_TOKEN": "YOUR_CRAWLBASE_JS_TOKEN" } } } }
Une fois le serveur enregistré, l'agent traite le crawl comme une compétence intégrée. C'est la version la plus « sans code » de cette configuration, car la récupération et l'interprétation résident toutes deux dans une seule étape IA et vous orchestrez le tout dans n8n exactement comme avant. Pour une démonstration complète de ce chemin, consultez comment connecter n8n avec Crawlbase Web MCP et, pour le contexte expliquant pourquoi alimenter un modèle avec des pages en temps réel est important, lisez présentation de Crawlbase MCP.
Rédiger des instructions qui produisent des données propres
Le workflow ne vaut que la qualité de l'instruction donnée au modèle. Les mêmes bonnes pratiques qui améliorent n'importe quel prompt s'appliquent ici, et elles ne coûtent rien.
Nommer les champs et leurs types
Un vague « récupère les données de cette page » produit une sortie incohérente. Précisez chaque clé et son type, comme le fait le prompt de l'étape 3, et le modèle suit le schéma de près. Indiquez la structure JSON exacte attendue plutôt que d'espérer que le modèle la devine.
Anticiper les valeurs manquantes ou inhabituelles
Les pages réelles sont désordonnées. Dites au modèle quoi faire lorsqu'un champ est absent (« mettre à null ») et comment gérer les cas particuliers (« si en rupture de stock, l'inclure quand même avec availability: false »). Cela maintient la cohérence de chaque ligne et vous évite une passe de nettoyage ultérieure.
Valider le JSON avant de le stocker
Ajoutez une petite étape de validation avant le nœud de destination, soit le parseur JSON intégré de n8n, soit un court nœud Function, afin qu'une réponse malformée échoue bruyamment au lieu d'écrire des données incorrectes dans votre feuille. Traitez la sortie du LLM comme non fiable tant qu'elle n'a pas été parsée.
Pourquoi cette approche surpasse un scraper codé manuellement pour les non-techniciens
L'attrait ne réside pas seulement dans « moins de code », mais dans la question de qui peut l'utiliser. Une fois le workflow créé, un marketeur ou un analyste peut changer l'URL cible, ajuster le prompt et relancer, sans impliquer l'ingénierie. La lecture sémantique du modèle signifie également que de petits changements de mise en page sur le site cible ne cassent pas l'exécution comme le ferait un sélecteur CSS fragile. Et comme Crawlbase porte l'intégralité de la charge de récupération, en rendant JavaScript, en faisant tourner des adresses IP résidentielles et en résolvant les CAPTCHA, le workflow reste opérationnel sans que personne n'ait à régler les pools de proxies.
Pour les équipes comparant les approches en termes de coût, le scraping assisté par IA représente généralement une fraction du coût d'un pipeline développé manuellement une fois que l'on tient compte des heures d'ingénierie et de maintenance, de nombreuses équipes rapportant environ 70 à 90 % d'économies sur un an. Pour en savoir plus sur la pertinence de ce modèle, le guide sur les cas d'usage des proxies IA couvre les workflows adjacents. Si vous avez besoin d'une couche de récupération encore plus légère, le Smart AI Proxy achemine toute requête à travers la même infrastructure anti-blocage, et la Crawling API renvoie du JSON pré-parsé pour les types de sites courants sans LLM.
Points clés
- Trois tâches, trois couches. Crawlbase récupère, le LLM interprète, et n8n orchestre. Les maintenir séparées est ce qui rend le workflow fiable.
- La configuration tient en quatre nœuds. Trigger, HTTP Request vers la Crawling API, extraction IA, puis un nœud de destination. La seule saisie est une URL, un token et une instruction.
-
Utilisez le token JS pour les pages rendues. Passez
javascript=trueetajax_wait=truepour que Crawlbase renvoie du HTML complet, pas une coquille vide. - Le prompt est le parseur. Nommez chaque champ et son type, et dites au modèle comment gérer les données manquantes, pour obtenir du JSON cohérent.
- MCP fusionne la récupération et l'extraction. Si votre outil dispose d'un nœud agent natif, le serveur Web MCP permet au modèle de crawler de lui-même en une étape.
- Les non-techniciens peuvent le piloter. Une fois construit, n'importe qui peut changer l'URL ou le prompt et relancer, sans sélecteurs à maintenir.
Foire aux questions
Dois-je savoir coder pour construire cela ?
Non. L'ensemble du workflow est assemblé en faisant glisser des nœuds sur le canevas n8n et en les connectant. La seule saisie de texte que vous effectuez est l'URL cible, votre token Crawlbase (stocké comme credential) et une instruction en langage naturel pour le LLM. Il n'y a aucun script de scraping ni aucun sélecteur à écrire ou maintenir.
Dois-je utiliser le serveur Web MCP ou la Crawling API ?
Les deux s'appuient sur le même moteur de récupération Crawlbase. Utilisez la Crawling API via un nœud HTTP lorsque vous souhaitez que chaque étape soit explicite et que cela fonctionne dans n'importe quelle version de votre outil. Utilisez le serveur Web MCP lorsque votre outil no-code dispose d'un nœud agent IA ou MCP natif, afin que le modèle puisse récupérer et extraire en une seule étape au lieu de deux.
Pourquoi faire passer la page par Crawlbase plutôt que de laisser le LLM récupérer l'URL directement ?
Les modèles de langage sont bons pour lire du contenu et inefficaces pour contourner les blocages. La plupart des sites commerciaux se rendent côté client et bloquent le trafic automatisé, de sorte qu'une récupération directe renvoie une coquille vide ou une page de blocage. Crawlbase rend la page dans un vrai navigateur derrière des adresses IP résidentielles tournantes et résout les CAPTCHA, afin que le modèle reçoive du HTML complet avec lequel travailler.
Comment obtenir une sortie structurée plus fiable du modèle ?
Soyez explicite dans le prompt : nommez chaque champ et son type, indiquez la structure JSON exacte, et dites au modèle comment gérer les valeurs manquantes ou inhabituelles. Ajoutez ensuite une étape de validation avant le nœud de destination pour que le JSON malformé échoue bruyamment plutôt que d'écrire de mauvaises lignes. Traitez la sortie du modèle comme non fiable tant qu'elle n'a pas été parsée proprement.
Puis-je exécuter cela selon un calendrier ou le déclencher depuis un autre système ?
Oui. Remplacez le déclencheur manuel par un Schedule Trigger pour exécuter le scraping à intervalles réguliers, ou par un Webhook pour qu'une autre application puisse le démarrer. Rien en aval ne change, car l'orchestration est séparée de la récupération et de l'extraction. C'est ce qui permet à un non-technicien de mettre en place une collecte de données récurrente sans toucher à la logique de récupération ou d'analyse.
Quels types de données puis-je collecter de cette façon ?
Toute donnée web publique accessible par le workflow : listes de produits et prix, inventaires de places de marché, entrées d'annuaires ou contenu agrégé provenant de multiples sources. Limitez-vous aux pages publiques, respectez les conditions d'utilisation et les attentes de débit de chaque site, et évitez les données derrière une connexion ou les données personnelles. Pour des modèles connexes, le guide sur les cas d'usage des proxies IA couvre les workflows adjacents.
Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.
Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

