n8n a gagné son audience parce qu'il vous permet d'automatiser un vrai travail sans beaucoup de code. Vous reliez des services sur un canevas visuel, déclenchez des actions sur un calendrier ou un événement, et les enchaînez en flux de travail complets. Associez cela à un serveur MCP capable de lire le web en direct, et vos étapes d'IA cessent de deviner à partir de données d'entraînement périmées et commencent à agir sur ce qu'une page dit vraiment aujourd'hui.
Ce guide vous montre comment connecter n8n à Crawlbase Web MCP de bout en bout : exécuter le serveur Web MCP, ajouter un nœud MCP Client Tool dans n8n, le pointer vers le serveur, et construire un petit flux de travail d'IA qui crawle une page et la résume. Pas de code de scraper personnalisé, pas de pool de proxies à surveiller. À la fin, vous aurez une boucle fonctionnelle où un agent d'IA atteint un outil de crawl de lui-même et vous renvoie une sortie propre et structurée.
Pourquoi connecter n8n à un serveur MCP du tout
Un agent d'IA dans n8n est aussi bon que les données auxquelles il peut accéder. Seul, il peut raisonner et écrire, mais il ne peut pas voir une page produit en direct, les prix d'un concurrent ou un article de presse publié il y a une heure. Le Model Context Protocol (MCP) comble cet écart : c'est une interface standard qui permet à un modèle d'IA d'appeler des outils externes sans intégration sur mesure pour chacun. Exécutez un serveur MCP, et tout client compatible MCP, n8n inclus, peut appeler les fonctions que ce serveur expose.
Le serveur Crawlbase Web MCP expose le crawling comme un ensemble d'outils. Une fois connecté, votre agent n8n acquiert la capacité de récupérer une URL et d'obtenir en retour du HTML rendu, du markdown propre ou une capture d'écran, le tout derrière l'infrastructure anti-blocage de Crawlbase. C'est la même idée couverte dans présentation de Crawlbase MCP : un pont prêt à l'emploi entre les agents LLM et le web en temps réel.
Ce dont vous avez besoin avant de commencer
Mettez ces éléments en place d'abord et le reste de la configuration sera rapide :
- n8n l'application de bureau ou n8n Cloud fonctionnent tous les deux ; la seule différence est la façon dont n8n atteint votre serveur MCP local.
- Un compte Crawlbase inscrivez-vous pour obtenir vos tokens API gratuits depuis le tableau de bord. Vous avez besoin à la fois du token Normal et du token JavaScript.
- Node.js nécessaire pour exécuter le serveur Crawlbase Web MCP localement.
- ngrok (optionnel) uniquement pour les utilisateurs de n8n Cloud qui ont besoin que leur serveur local soit accessible sur internet.
Comment n8n communique avec Crawlbase via MCP
Au lieu d'écrire une intégration HTTP avec des en-têtes et une logique de nouvelle tentative, vous exécutez le serveur MCP et laissez n8n l'appeler. Le flux est court :
- Le nœud MCP Client Tool dans n8n se connecte au serveur MCP en cours d'exécution.
- Le serveur Crawlbase Web MCP expose les fonctions de crawling réelles.
- Votre agent d'IA choisit le bon outil, le flux de travail reçoit les données, et l'étape suivante agit dessus.
Vous ne touchez jamais aux tokens API dans n8n, car les tokens vivent avec le serveur que vous démarrez à l'étape 1. n8n appelle simplement les outils et lit le résultat.
Étape 1 : Installer et démarrer le serveur Crawlbase Web MCP
Le serveur est ce qui rend les outils de crawling disponibles pour n8n, donc il doit être en cours d'exécution avant que n8n puisse voir quoi que ce soit. Ouvrez un terminal et récupérez le projet.
git clone https://github.com/crawlbase/crawlbase-mcp cd crawlbase-mcp npm install
Maintenant démarrez le serveur en mode transport HTTP, en passant vos deux tokens comme variables d'environnement. Remplacez les espaces réservés par les vraies valeurs depuis votre tableau de bord Crawlbase.
CRAWLBASE_TOKEN=your_token CRAWLBASE_JS_TOKEN=your_js_token npm run start:http
Les deux tokens ont des rôles différents :
- CRAWLBASE_TOKEN gère le crawling standard des pages statiques.
- CRAWLBASE_JS_TOKEN gère les pages qui rendent leur contenu avec JavaScript, où le serveur lance un vrai navigateur avant de renvoyer le HTML.
Si tout s'est installé correctement, le serveur démarre sur http://localhost:3000. Laissez cette fenêtre de terminal ouverte. n8n se connecte à ce processus en cours d'exécution chaque fois que votre flux de travail se déclenche, donc le fermer brise le lien.
Crawlbase émet deux types de tokens. Le token Normal récupère le HTML statique ; le token JavaScript (JS) rend d'abord la page dans un vrai navigateur. Passer les deux au démarrage permet à l'agent d'IA de crawler des pages simples à moindre coût tout en gérant les sites rendus côté client sans que vous ayez à changer quoi que ce soit en cours de flux de travail. Vous pouvez trouver les deux dans votre tableau de bord sous la documentation du compte.
Optionnel pour les utilisateurs de n8n Cloud : exposer le serveur avec ngrok
n8n Desktop s'exécute sur la même machine que le serveur MCP, donc http://localhost:3000 fonctionne directement et vous pouvez ignorer cela. n8n Cloud s'exécute sur les serveurs de n8n, donc il a besoin d'une URL publique pour atteindre le serveur sur votre machine. ngrok crée un tunnel sécurisé exactement pour cela.
ngrok http 3000
ngrok affiche une URL HTTPS publique qui pointe vers votre port local 3000. Utilisez cette URL comme point d'entrée dans n8n au lieu de localhost. Comme cela expose votre serveur MCP à internet, gardez l'URL et vos tokens privés.
Étape 2 : Connecter n8n au serveur Crawlbase Web MCP
Ouvrez n8n et accédez à votre flux de travail. Ajoutez un nœud MCP Client Tool à côté de votre nœud agent d'IA. Ce nœud est ce qui donne à l'agent accès aux outils de crawling Crawlbase. Configurez-le comme ceci :
-
Endpoint : utilisez
http://localhost:3000sur n8n Desktop, ou votre URL HTTPS ngrok sur n8n Cloud. -
Server Transport : choisissez HTTP Streamable, ce qui correspond au mode
start:httpque vous avez lancé. - Authentication : définissez sur None ; vos tokens ont déjà été fournis au serveur à l'étape 1, donc n8n n'en a pas besoin.
- Tools to Include : choisissez All pour que l'agent puisse choisir l'outil de crawl adapté à la tâche.
Lorsque la connexion réussit, le nœud liste les outils que le serveur expose :
{ "tools": [ { "name": "crawl", "description": "Crawl a URL and return HTML" }, { "name": "crawl_markdown", "description": "Extract clean markdown from a URL" }, { "name": "crawl_screenshot", "description": "Take a screenshot of a webpage" } ] }
Voir crawl, crawl_markdown et crawl_screenshot confirme que le lien est actif. Si la liste est vide, la connexion n'a pas abouti ; la section de dépannage ci-dessous couvre les causes habituelles.
Le serveur Web MCP transforme l'infrastructure de crawling de Crawlbase en outils que tout client MCP peut appeler. Il rend les pages JavaScript dans un vrai navigateur, fait tourner des IPs résidentielles côté serveur, et renvoie du HTML, du markdown ou une capture d'écran, pour que votre agent n8n lise le web en direct sans que vous gériez une flotte sans interface ni un pool de proxies. Commencez sur le forfait gratuit et pointez-le vers une page publique.
Étape 3 : Construire votre premier flux de travail de scraping IA
Avec les outils connectés, construisez un petit flux de travail qui récupère une page web et produit un résumé. Il comporte deux parties principales :
- Un nœud agent d'IA qui a déjà le MCP Client Tool câblé comme outil.
- Un nœud Chat Model (OpenAI, Anthropic ou tout modèle que n8n supporte) que l'agent utilise pour raisonner et écrire.
Dans le nœud agent d'IA, donnez-lui un prompt qui lui dit quoi faire. L'agent lit le prompt, décide qu'il doit crawler, appelle le bon outil, et alimente le résultat au modèle. Un exemple simple :
Crawl https://crawlbase.com/blog and summarize the latest article in three bullet points.
Cliquez sur Execute step sur le nœud agent d'IA. En un instant, le résumé apparaît dans la sortie. En coulisses, l'agent a atteint crawl_markdown, qui renvoie du markdown propre beaucoup plus facile à lire pour un modèle que le HTML brut, puis a passé ce texte au modèle de chat pour le résumé. Ouvrez les journaux d'exécution du flux de travail pour voir toute la chaîne : la requête de crawl, le markdown renvoyé par le serveur et la réponse finale du modèle.
C'est la boucle principale. L'agent décide quel outil utiliser en fonction de votre prompt, donc lui demander de « prendre une capture d'écran de » une page le dirige vers crawl_screenshot à la place, sans aucun changement de nœud de votre côté. Si vous souhaitez approfondir la façon dont un agent choisit des outils et raisonne sur des données web, l'extraction de données IA et son fonctionnement couvre le schéma.
Dépannage de la connexion
La plupart des problèmes de configuration entrent dans quelques catégories. Des vérifications rapides les résolvent généralement :
n8n ne peut pas se connecter au serveur MCP
- Confirmez que le serveur est toujours en cours d'exécution dans sa fenêtre de terminal et n'a pas quitté.
- Vérifiez deux fois le point d'entrée :
http://localhost:3000sur Desktop, ou l'URL HTTPS ngrok actuelle sur Cloud (ngrok émet une nouvelle URL à chaque redémarrage). - Assurez-vous que rien d'autre sur votre machine n'occupe le port 3000.
Aucun outil n'apparaît dans le nœud MCP Client Tool
- Vérifiez que Server Transport est défini sur HTTP Streamable pour correspondre au mode de lancement
start:http. - Rafraîchissez la liste d'outils dans le nœud.
- Si elle est toujours vide, redémarrez le serveur MCP et n8n, puis reconnectez.
Erreurs de token ou de permission
- Recopiez les deux tokens depuis le tableau de bord pour exclure des espaces parasites ou un caractère manquant.
- Confirmez que votre compte a suffisamment de crédits pour exécuter la requête.
- Si une page lourde en JavaScript revient vide, assurez-vous que
CRAWLBASE_JS_TOKENétait défini quand vous avez démarré le serveur.
La sortie est vide ou semble incorrecte
- Ouvrez les journaux d'exécution pour voir exactement ce que le crawl a renvoyé.
- Testez d'abord avec une URL statique plus simple pour isoler si le problème vient de la page ou du prompt.
- Affinez le prompt pour qu'il indique clairement à l'agent de crawler avant de résumer.
Où aller ensuite
Le flux de travail de résumé est délibérément petit, mais le même câblage s'adapte à une vraie automatisation. Quelques directions qui valent la peine d'essayer :
- Crawler les pages de concurrents selon un calendrier et faire poster par n8n de courts résumés dans Slack.
- Suivre les prix de produits sur plusieurs sites et déclencher une notification quand l'un change.
- Récupérer une poignée d'articles sur un sujet et laisser le modèle produire un résumé combiné.
- Collecter des informations commerciales publiques depuis des répertoires et les router vers un CRM.
- Surveiller comment les pages clés changent au fil du temps pour le SEO ou la conformité.
Comme le serveur MCP fonctionne derrière l'infrastructure de Crawlbase, les parties difficiles du scraping (rendu, rotation et évitement des blocages) sont gérées pour vous. Si vous rencontrez de la résistance sur une cible difficile, comment scraper des sites sans être bloqué est le guide. Et si vous évaluez comment l'accès géré se compare au proxying brut, qu'est-ce qu'un proxy IA est une lecture utile. Pour des constructions personnalisées plus lourdes en dehors de n8n, la Crawling API et le Smart AI Proxy vous donnent le même moteur à appeler directement.
L'attrait de cette configuration est qu'elle fonctionne sans code : n8n pilote l'automatisation, Crawlbase effectue le crawling, et MCP maintient les deux synchronisés. Crawlbase est approuvé par plus de 70 000 développeurs, donc la couche de crawling sous votre flux de travail est la même que celle qui alimente des scrapers de production à grande échelle.
Points clés
- MCP est le pont. Il permet à un agent n8n d'IA d'appeler des outils externes, et le serveur Crawlbase Web MCP expose le crawling comme ces outils.
-
Le serveur détient les tokens. Démarrez-le avec
CRAWLBASE_TOKENetCRAWLBASE_JS_TOKEN; n8n se connecte avec Authentication défini sur None. -
Faites correspondre le transport. Lancez avec
start:httpet définissez le Server Transport du nœud sur HTTP Streamable, en pointant verslocalhost:3000ou une URL ngrok. -
L'agent choisit l'outil.
crawl,crawl_markdownetcrawl_screenshotsont choisis par l'agent en fonction de votre prompt. - Pas de code, pas de pool de proxies. Crawlbase gère le rendu, la rotation et les blocages, pour que le flux de travail reste propre.
Foire aux questions
Qu'est-ce que le serveur Crawlbase Web MCP ?
C'est un petit serveur qui expose les fonctionnalités de crawling de Crawlbase comme des outils Model Context Protocol. Tout client compatible MCP, y compris n8n, Claude Desktop et Cursor, peut s'y connecter et appeler des fonctions comme crawl, crawl_markdown et crawl_screenshot pour récupérer des données web en direct sans écrire d'intégration personnalisée.
Ai-je besoin des deux tokens Crawlbase pour connecter n8n ?
Utilisez les deux pour la configuration la plus fluide. CRAWLBASE_TOKEN gère les pages statiques et CRAWLBASE_JS_TOKEN rend les pages lourdes en JavaScript dans un vrai navigateur. Passer les deux quand vous démarrez le serveur permet à l'agent d'IA de crawler des pages simples et complexes sans que vous changiez quoi que ce soit dans le flux de travail.
Quelle est la différence entre n8n Desktop et n8n Cloud pour cette configuration ?
n8n Desktop s'exécute sur la même machine que le serveur MCP, donc il peut atteindre http://localhost:3000 directement. n8n Cloud s'exécute sur les serveurs de n8n, donc il a besoin d'une URL publique ; tunnelisez votre serveur local avec ngrok et utilisez cette adresse HTTPS comme point d'entrée à la place.
Pourquoi le nœud MCP Client Tool n'affiche-t-il aucun outil ?
La cause la plus courante est une inadéquation de transport : assurez-vous que Server Transport est défini sur HTTP Streamable pour correspondre au mode de lancement start:http. Confirmez également que le serveur est toujours en cours d'exécution, que le point d'entrée est correct et que le port 3000 est libre. Rafraîchir la liste d'outils ou redémarrer le serveur et n8n le résout généralement.
Dois-je écrire du code pour utiliser cela ?
Non. Au-delà de quelques commandes de terminal pour démarrer le serveur, tout le flux de travail est construit visuellement dans n8n. L'agent d'IA décide quel outil de crawl appeler en fonction de votre prompt, donc vous câblez les nœuds une fois et pilotez tout avec des instructions simples.
L'agent d'IA peut-il choisir lui-même quel outil de crawl utiliser ?
Oui. Avec Tools to Include défini sur All, l'agent lit votre prompt et sélectionne l'outil adapté. Demandez-lui de résumer une page et il atteint crawl_markdown ; demandez une capture d'écran et il utilise crawl_screenshot. Vous guidez le choix à travers la formulation du prompt, pas via les paramètres des nœuds.
Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.
Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

