La recherche de produits se faisait autrefois en ouvrant une douzaine d'onglets de navigateur, en copiant manuellement les prix dans un tableur et en recommençant la semaine suivante. Automatiser ce travail était réservé aux développeurs, car cela impliquait d'écrire des scrapers, de gérer des proxies et de surveiller du code. Cette barrière a disparu. Les outils d'automatisation visuelle permettent désormais à tout le monde de mettre en place un workflow qui collecte automatiquement des données produits, sans aucune compétence en programmation requise.

Ce guide vous montre comment automatiser la recherche de produits eCommerce avec n8n, une plateforme d'automatisation open source, et Crawlbase, qui s'occupe de la partie difficile : récupérer les pages produits en direct depuis des sites comme Amazon. Vous construirez un workflow qui lit une liste de produits depuis une Google Sheet, extrait les détails frais de chacun via Crawlbase, et réécrit les résultats pour que votre recherche reste à jour sans que vous n'y touchiez. Nous couvrirons deux façons de connecter les deux : le Web MCP pour un flux piloté par IA, et la Crawling API pour un flux direct et prévisible.

Pourquoi automatiser la recherche de produits

La recherche manuelle ne passe pas à l'échelle. Dès que vous suivez plus d'une poignée de produits, la boucle copier-coller dévore votre journée et les données sont déjà obsolètes lorsque vous avez terminé. Pire encore, les prix et la disponibilité bougent en permanence, un instantané ponctuel ne vous dit donc presque rien sur un marché. La valeur réside dans l'observation des mêmes produits dans le temps pour repérer les changements.

Un workflow automatisé transforme cela en processus en arrière-plan. Vous définissez les produits une fois, fixez un calendrier, et les données se rafraîchissent d'elles-mêmes. Ce type de configuration est rentable pour plusieurs rôles :

  • Les chercheurs eCommerce qui constituent de grands ensembles de données pour l'analyse de niches
  • Les analystes concurrentiels qui suivent les mouvements de prix et de stock
  • Les vendeurs Amazon qui surveillent leurs propres fiches et celles de leurs rivaux
  • Les analystes de données qui étudient les tendances de marché sur des semaines ou des mois

L'élément sur lequel la plupart des gens butent est la récupération. Amazon et d'autres grands détaillants rendent le contenu avec JavaScript et challengent agressivement le trafic automatisé, une requête HTTP simple renvoie donc généralement une page quasi-vide ou un blocage. C'est le travail que Crawlbase prend en charge, et c'est pourquoi ce workflow reste fiable au lieu de casser dès qu'un site renforce ses défenses.

Ce dont vous avez besoin avant de commencer

Vous connectez quelques outils, vous ne codez pas. Mettez d'abord ces éléments en place :

  • n8n pour construire et exécuter l'automatisation. Utilisez une installation locale ou n8n Cloud ; les deux fonctionnent de la même manière pour ce workflow.
  • Un compte Crawlbase pour effectuer le crawling. Inscrivez-vous, puis copiez vos tokens API depuis le tableau de bord. Vous obtenez un token Normal pour les pages statiques et un token JavaScript pour les pages rendues côté client.
  • Un compte Google avec l'API Sheets activée pour que n8n puisse lire votre liste de produits et réécrire les résultats. Vous le connectez la première fois que vous ajoutez un nœud Google Sheets.
  • Une Google Sheet avec votre liste de produits une seule colonne d'ASINs Amazon suffit pour commencer. Nommez la colonne quelque chose de clair comme ASIN.

Le flux entier est court : votre feuille contient la liste des produits, n8n exécute le workflow sur un déclencheur ou un calendrier, Crawlbase récupère chaque page produit et renvoie des données structurées propres, et n8n réécrit ces données dans la feuille.

Deux façons de connecter n8n à Crawlbase

Il y a deux voies solides, et celle que vous choisissez dépend du contrôle que vous souhaitez par rapport à la flexibilité.

La voie Web MCP expose le crawling comme des outils qu'un Agent IA dans n8n peut appeler de lui-même. Vous décrivez l'objectif en langage naturel, l'agent décide quel outil de crawl utiliser, et vous obtenez une sortie structurée. C'est idéal lorsque vos cibles varient ou que vous voulez que le modèle raisonne sur la page. Le guide complet Web MCP couvre cette configuration de bout en bout.

La voie Crawling API est un appel HTTP direct. Vous envoyez une URL et un token, vous obtenez les données, à chaque fois, sans modèle dans la boucle. C'est prévisible, économique, et le bon choix par défaut pour une tâche ciblée comme extraire les mêmes champs de pages produits. C'est le chemin que nous construisons ci-dessous, car la recherche de produits est une tâche bien définie où un scraper intégré fait exactement ce dont vous avez besoin.

Quel token utiliser

Crawlbase délivre deux types de tokens. Le token Normal récupère le HTML statique ; le token JavaScript (JS) rend d'abord la page dans un vrai navigateur. Les pages produit Amazon chargent les détails clés côté client, optez donc pour le token JS ici. Utiliser le token Normal sur une page rendue côté client renvoie une coquille légère avec les données manquantes.

Étape 1 : Créer un nouveau workflow dans n8n

Connectez-vous à n8n et cliquez sur Create Workflow. Donnez-lui un nom clair comme "Amazon Product Data Collector" pour le retrouver facilement lorsque vous aurez plusieurs workflows en cours. Vous commencez avec un canevas vide ; tout à partir d'ici consiste à glisser des nœuds dessus et à les relier.

Étape 2 : Lire la liste de produits depuis Google Sheets

Ajoutez un nœud Google Sheets et choisissez le déclencheur On row added or updated. Cela déclenche le workflow automatiquement chaque fois que vous ajoutez un nouvel ASIN dans votre feuille, la recherche démarre donc dès que vous y déposez quelque chose à rechercher.

Authentifiez-vous avec votre compte Google, puis sélectionnez la feuille de calcul et la feuille de travail contenant votre liste d'ASINs. Cliquez sur Fetch Test Event pour confirmer que la connexion tire bien une ligne. Une fois que c'est fait, n8n sait exactement où lire vos produits, et chaque ligne qui passe porte une valeur ASIN que l'étape suivante peut utiliser.

Étape 3 : Récupérer les données produit avec la Crawling API

n8n ne vient pas avec un nœud Crawlbase dédié, vous utilisez donc le nœud HTTP Request intégré pour appeler la Crawling API directement. Ajoutez-le après le nœud Google Sheets et configurez les paramètres :

  • Méthode : GET
  • URL : https://api.crawlbase.com
  • Authentification : Aucune
  • Send Query Parameters : activé

Ensuite ajoutez trois paramètres de requête. La valeur url est construite dynamiquement depuis l'ASIN qui est passé par le déclencheur, chaque ligne récupère donc son propre produit :

text
token     your_crawlbase_js_token
url       https://www.amazon.com/dp/{{ $json.ASIN }}/ref=nosim
scraper   amazon-product-details

Trois valeurs font le travail. token est votre token JavaScript depuis le tableau de bord. url utilise l'expression n8n {{ $json.ASIN }} pour insérer l'ASIN de la ligne courante dans l'URL du produit Amazon, le même nœud gère donc chaque produit sans modification. scraper indique à Crawlbase d'exécuter son parseur intégré amazon-product-details, qui renvoie la page déjà structurée en JSON plutôt qu'en HTML brut que vous auriez à analyser vous-même.

Cliquez sur Execute Node et vous devriez voir une réponse JSON dans le panneau de sortie avec des champs comme name, price, rating et reviewCount. La forme ressemble à ceci :

json
{
  "body": {
    "name": "Wireless Noise Cancelling Headphones",
    "price": "$248.00",
    "rating": "4.6",
    "reviewCount": 31482,
    "inStock": true
  }
}

Comme le scraper intégré a déjà analysé la page, vous lisez ces champs par nom dans le nœud suivant. Pas de sélecteurs CSS, pas de XPath, rien qui casse lorsqu'Amazon déploie un nouveau design.

Crawlbase Crawling API

n8n pilote l'automatisation, mais il ne peut pas passer seul les défenses anti-bot d'Amazon. La Crawling API comble cet écart en un seul appel : passez un token JS et elle rend la page dans un vrai navigateur, fait tourner des adresses IP résidentielles côté serveur, et renvoie des données structurées propres, vous évitant ainsi de gérer une flotte de navigateurs sans interface et un pool de proxies. Commencez gratuitement avec 1 000 requêtes et pointez-la vers une page produit publique en premier.

Étape 4 : Réécrire les résultats dans Google Sheets

Stockez maintenant ce que vous avez collecté. Ouvrez votre feuille et ajoutez des colonnes pour les champs qui vous intéressent, par exemple ASIN, Titre, Prix, Note et URL. Vous pouvez toujours en ajouter d'autres plus tard selon ce qui compte pour votre recherche.

De retour dans n8n, ajoutez un second nœud Google Sheets après la requête HTTP et choisissez l'action Append or update row in sheet. Définissez Column to match on sur ASIN pour que chaque produit mette à jour sa propre ligne plutôt que de créer des doublons à chaque exécution. Ensuite mappez les champs de la réponse de la Crawling API dans vos colonnes :

text
ASIN     {{ $('Google Sheets Trigger').item.json.ASIN }}
Title    {{ $json.body.name }}
Price    {{ $json.body.price }}
Rating   {{ $json.body.rating }}
URL      {{ $json.url }}

L'ASIN provient du déclencheur d'origine pour correspondre toujours à la bonne ligne, tandis que les champs produit proviennent du body de la réponse de la Crawling API. Exécutez le workflow une fois et regardez la feuille se remplir de titres, de prix et de notes, bien alignés sur leurs ASINs.

Étape 5 : Activer et planifier

Passez le workflow en mode Active dans le coin supérieur droit. À partir de maintenant, ajouter un ASIN dans votre feuille déclenche un nouveau crawl et réécrit les détails en quelques secondes. Cela seul supprime la boucle de recherche manuelle.

Pour une recherche continue, vous voulez que les données se rafraîchissent d'elles-mêmes plutôt que seulement lorsque vous ajoutez des lignes. Ajoutez un nœud Schedule Trigger qui exécute le workflow quotidiennement ou toutes les quelques heures et réinjecte votre liste d'ASINs existante dans la Crawling API. Votre feuille suit désormais les changements de prix et de stock dans le temps sans que vous ayez à lever le petit doigt, ce qui est tout l'intérêt d'automatiser la recherche au lieu de simplement l'accélérer.

Rendre le workflow plus utile

Une fois les bases en place, quelques petits ajouts transforment un collecteur de données en un vrai outil de recherche. Aucun de ceux-ci ne nécessite de tout reconstruire.

Capturer plus de champs

Le scraper intégré renvoie plus que le titre et le prix. Mappez rating, reviewCount, le nom du vendeur ou la disponibilité pour obtenir un tableau plus complet de la performance d'un produit et de son évolution dans le temps. Des données plus riches sont ce qui rend l'analyse de tendances utile.

Utiliser d'autres scrapers

Crawlbase dispose de scrapers intégrés pour de nombreux sites, pas seulement Amazon. Pour rechercher sur une autre plateforme, changez le paramètre de requête scraper et l'URL cible ; le reste du workflow reste identique. L'approche par workflow d'agent IA va encore plus loin et permet à un agent de choisir le bon outil par cible, ce qui est pratique lorsque vos sources varient.

Stocker les pages crawlées pour plus tard

Si vous voulez une sauvegarde de tout ce que vous récupérez, ajoutez store=true à la requête Crawling API et Crawlbase conserve une copie de chaque crawl dans votre compte. Cela vous permet de revisiter d'anciens instantanés ou de comparer des changements sans re-crawler, ce qui est utile pour les audits et l'analyse historique.

Router les données n'importe où

Google Sheets est la destination la plus simple, mais n8n se connecte à des centaines de services. Poussez des alertes vers Slack quand un concurrent baisse un prix, ajoutez des lignes dans une base de données ou alimentez un tableau de bord. L'étape de crawl ne change pas ; vous ajoutez simplement un nœud après.

Rester non bloqué à grande échelle

La raison pour laquelle ce workflow continue de fonctionner là où un scraper fait maison s'arrêterait est que la Crawling API gère le rendu et la rotation d'adresses IP pour vous. Elle exécute chaque requête derrière un vrai navigateur et des adresses IP résidentielles rotatives, Amazon voit donc un trafic d'apparence normale plutôt qu'un bot évident. Si vous préférez router vos propres requêtes via un pool rotatif, le Smart AI Proxy vous donne la même rotation résidentielle comme point de terminaison de substitution. Dans tous les cas, les tactiques plus larges se trouvent dans comment scraper des sites sans se faire bloquer.

Récapitulatif

Points clés

  • Divisez le travail. n8n pilote l'automatisation et Google Sheets contient les données ; Crawlbase récupère les pages produits et les renvoie structurées. Chaque composant fait la partie dans laquelle il excelle.
  • Utilisez le scraper intégré. Le scraper amazon-product-details renvoie du JSON analysé, vous lisez donc des champs comme name et price par nom sans sélecteurs à maintenir.
  • Utilisez le token JS pour Amazon. Les détails des produits se rendent côté client, le token JavaScript rend donc la page dans un vrai navigateur avant de renvoyer les données.
  • Planifiez-le. Un Schedule Trigger rafraîchit votre liste automatiquement, transformant un scraping ponctuel en suivi de tendances continu.
  • Deux voies de connexion. Utilisez la Crawling API pour une tâche directe et prévisible, ou le Web MCP lorsque vous voulez qu'un Agent IA choisisse des outils sur des cibles variées.

Foire aux questions

Dois-je savoir coder pour construire ceci ?

Non. L'ensemble du workflow est construit visuellement dans n8n en glissant des nœuds et en remplissant des champs. Vous n'écrivez jamais de script. Les seules parties qui ressemblent à du technique sont les expressions n8n comme {{ $json.ASIN }}, qui sont simplement des espaces réservés qui tirent une valeur de l'étape précédente, et vous les copiez directement depuis ce guide.

Dois-je utiliser le Web MCP ou la Crawling API ?

Utilisez la Crawling API pour une tâche ciblée et répétable comme extraire les mêmes champs de pages produits, car c'est un appel direct avec un coût et une sortie prévisibles. Optez pour le Web MCP lorsque vous voulez qu'un Agent IA dans n8n décide quel outil de crawl utiliser sur des cibles variées ou changeantes. Les deux tournent sur le même moteur de crawling Crawlbase, vous pouvez donc commencer avec l'un et changer plus tard.

Pourquoi utiliser Crawlbase plutôt qu'une requête HTTP simple vers Amazon ?

Amazon rend les détails des produits avec JavaScript et bloque agressivement le trafic automatisé, une requête simple renvoie donc généralement une coquille vide ou une page de blocage. Crawlbase rend la page dans un vrai navigateur derrière des adresses IP résidentielles rotatives, puis renvoie des données structurées propres, ce qui est la partie qui empêche le workflow de casser dès que vous passez à l'échelle.

Comment rechercher des produits sur des sites autres qu'Amazon ?

Changez le paramètre de requête scraper pour celui qui correspond à votre site cible et mettez à jour l'URL que le workflow construit. Crawlbase dispose de scrapers intégrés pour de nombreuses plateformes, et le reste du workflow n8n, le déclencheur et la réécriture dans Google Sheets, reste exactement identique.

Est-ce que cela va me faire bloquer ?

La Crawling API fait tourner des adresses IP résidentielles et rend les pages côté serveur, ce qui gère la plupart des blocages pour vous. Pour rester en sécurité à grande échelle, cadencez vos requêtes avec le Schedule Trigger plutôt que de marteler un site, variez vos cibles, et surveillez les codes de statut de réponse pour pouvoir reculer si un site commence à challenger le trafic.

Puis-je conserver un historique des données que je collecte ?

Oui. Ajoutez store=true à la requête Crawling API et Crawlbase enregistre une copie de chaque crawl dans votre compte, vous pouvez donc revisiter d'anciens instantanés ou comparer des changements sans refaire une récupération. Côté n8n, planifier des exécutions régulières contre la même liste d'ASINs constitue un historique courant de l'évolution des prix et des stocks dans le temps.

Commencer à construire

Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.

Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

En libre-service · Sans appel commercial requis · Volumes de crawl entreprise disponibles