Trouver des leads de qualité est un travail lent. Quiconque a fait de la vente ou du marketing connaît la corvée : ouvrir un navigateur, chercher des entreprises qui correspondent à votre profil, copier leurs coordonnées dans une feuille de calcul, recommencer. Ce guide vous montre comment sauter la majeure partie de ce processus en construisant un bot de vente IA avec le Crawlbase Web MCP, un assistant qui rassemble lui-même des données publiques sur les entreprises et les pages de contact, et rédige vos messages de prospection pour vous.

Pour que cela reste honnête et défendable, l'ensemble de la construction est limité aux données commerciales publiques : noms d'entreprises, sites web, pages de contact publiques, secteurs listés, et les adresses e-mail génériques qu'une entreprise publie pour les demandes entrantes. Il ne scrape pas de contenu protégé par connexion, n'achète ni ne collecte de données personnelles, et n'essaie pas d'enrichir des individus au-delà de ce qu'une entreprise choisit de publier. La section sur l'éthique et les CGU vers la fin n'est pas du remplissage, alors lisez-la avant de pointer cet outil sur un volume réel.

Ce que fait réellement un bot de vente IA construit sur le Crawlbase Web MCP

Le pattern est simple une fois que vous voyez les deux moitiés. Claude (ou tout client compatible MCP) fournit le raisonnement : il lit votre demande, décide quelles pages consulter, et structure le résultat. Le Crawlbase Web MCP fournit les mains : il récupère des pages en direct, rend les sites à forte charge JavaScript, contourne les blocages courants, et remet du contenu propre au modèle pour qu'il le lise.

Seul, un modèle de langage ne peut pas naviguer sur le web ouvert de manière fiable. Le serveur MCP est ce qui comble cette lacune. Il expose un petit ensemble d'outils que le modèle peut appeler pour crawler et lire une URL, de sorte qu'au lieu que vous colliez du contenu de page à la main, le modèle les demande lui-même et travaille avec la sortie structurée. Si vous voulez la vue d'ensemble de l'importance de cela, alimenter les LLM en données web en temps réel couvre la motivation en profondeur.

Une exécution réaliste ressemble à ceci : vous décrivez un profil client idéal, le bot trouve des entreprises qui correspondent, visite le site public et la page de contact de chaque entreprise, extrait les champs demandés, et retourne un tableau soigné plus du texte de prospection rédigé et adapté à chacune. Pas de scripts de scraping, pas de pool de proxys à surveiller, pas d'automatisation de navigateur à maintenir.

Données publiques uniquement

Tout ce qui suit cible des données qu'une entreprise publie pour le public : son site, son secteur listé, et les adresses de contact génériques (sales@, hello@, info@) qu'elle demande aux gens d'utiliser. Le bot reçoit l'instruction explicite de ne pas collecter de données personnelles sur des individus nommés. C'est cette limite qui rend le travail défendable, et elle est appliquée dans le prompt, pas laissée au hasard.

Comment les pièces s'emboîtent

Trois composants font le travail, et il est utile de les nommer avant de câbler quoi que ce soit.

Claude est la couche de raisonnement

Le modèle décompose votre demande en étapes, décide quelles pages valent la peine d'être visitées, choisit les champs à extraire, et formate le résultat. Vous décrivez le résultat souhaité en langage simple et il planifie le chemin. Cette planification est la partie que vous feriez autrement à la main.

Le Web MCP est la couche de crawling

Le serveur MCP est ce qui permet au modèle d'atteindre le web en direct. Il récupère la page derrière une IP de confiance, rend le contenu côté client, gère les frictions anti-bots courantes, et retourne une sortie propre. En coulisses, il s'appuie sur la même infrastructure que la Crawling API et le Smart AI Proxy, donc vous obtenez des données en temps réel sans assembler vous-même une flotte headless et un pool de proxys tournants.

Votre sortie est des leads structurés plus des brouillons

Une fois les pages retournées, le modèle assemble chaque entreprise en une ligne, nom, site web, e-mail de contact public, secteur, description courte, puis rédige un court message de prospection basé sur ce qu'il a lu sur le site de cette entreprise. Vous pouvez exporter le tableau en CSV pour un CRM, ou continuer à itérer dans le chat.

Étape 1 : Installer et configurer le Web MCP

Le Web MCP s'exécute comme un serveur local que votre client MCP lance. Pour Claude Desktop, ouvrez Paramètres, Développeur, Modifier la configuration, et ajoutez le serveur Crawlbase au bloc mcpServers. La configuration ci-dessous pointe le client vers le package publié et passe vos tokens via l'environnement.

json
{
  "mcpServers": {
    "crawlbase": {
      "command": "npx",
      "args": ["-y", "crawlbase-mcp"],
      "env": {
        "CRAWLBASE_TOKEN": "YOUR_NORMAL_TOKEN",
        "CRAWLBASE_JS_TOKEN": "YOUR_JS_TOKEN"
      }
    }
  }
}

Deux tokens, tous les deux depuis votre tableau de bord Crawlbase. Le token normal récupère le HTML statique ; le token JavaScript (JS) rend la page dans un vrai navigateur d'abord. Les sites d'entreprises qui construisent leur contenu côté client ont besoin du token JS, donc gardez les deux disponibles et laissez le bot choisir. Enregistrez la configuration et redémarrez le client pour qu'il prenne en compte le nouveau serveur.

Token normal vs token JS

Le token normal est plus rapide et moins cher, et fonctionne pour les pages rendues côté serveur. Le token JS lance un vrai navigateur et est ce dont vous avez besoin pour les sites qui chargent leur contenu avec JavaScript. De nombreux sites marketing sont suffisamment statiques pour le token normal ; utilisez le token JS quand une page revient incomplète ou vide.

Étape 2 : Confirmer que les outils sont actifs

Après le redémarrage, votre client devrait lister les outils Crawlbase (généralement un outil crawl et un outil read). Une vérification rapide est de demander au modèle de récupérer une page publique connue et de la résumer. S'il retourne du vrai contenu plutôt qu'un message disant qu'il n'a pas accès au web, le serveur est correctement câblé.

text
Using the Crawlbase Web MCP, fetch https://example.com and give me
a one-line summary of what the company does.

Si cela retourne un vrai résumé, le modèle appelle les outils MCP et lit des pages en direct. Vous êtes prêt à lui confier le vrai travail.

Étape 3 : Donner au bot son brief de vente

Maintenant vous dites au bot ce qu'il doit collecter et, tout aussi important, ce qu'il ne doit pas faire. Le prompt ci-dessous définit le rôle, limite la recherche aux données commerciales publiques, nomme les champs exacts, et interdit catégoriquement les données personnelles. Traitez-le comme une instruction système et collez-le dans une nouvelle conversation.

text
You are an AI sales bot. You use the Crawlbase Web MCP to gather
PUBLIC business data only and to draft outreach.

Rules:
- Collect only data a company publishes publicly: company name,
  website, listed industry, public description, and the generic
  contact email on the site (e.g. sales@, hello@, info@).
- Do NOT collect personal data about named individuals.
- Do NOT guess or pattern-build emails. Use only what is published.
- If a field is not public, leave it blank rather than inferring it.

For each company, return a row with: Company Name, Website,
Contact Email, Industry, Description, and a 2-sentence draft
outreach note referencing something specific from their site.

Les deux lignes "do NOT" font un vrai travail. Elles maintiennent le bot sur les données publiées au niveau de l'entreprise et l'empêchent de fabriquer des adresses, ce qui est à la fois un problème de précision et un problème éthique. Une fois le rôle défini, envoyez la cible réelle dans un message de suivi.

text
Find 10 B2B SaaS companies in Singapore that offer CRM or
marketing automation. For each, visit the company site and its
public contact page, then fill in the row format above.
Crawlbase Web MCP

Le Web MCP donne à votre assistant un accès web en direct en une seule installation. Il rend les pages JavaScript, contourne les blocages courants, et retourne du contenu propre pour que le modèle puisse le lire, de sorte que votre bot de vente extrait de vraies données d'entreprises publiques à jour sans que vous n'exécutiez un crawler ou un pool de proxys. Commencez avec le niveau gratuit et pointez-le sur quelques sites publics en premier.

Étape 4 : Laisser le bot crawler et rédiger

Avec le brief et la cible en place, le bot planifie son exécution. Il identifie des entreprises candidates, appelle l'outil MCP crawl sur le site public et la page de contact de chaque entreprise, lit ce qui revient, et remplit le format de ligne que vous avez défini. Parce que le modèle peut voir le texte réel de la page, le message de prospection brouillon qu'il écrit peut référencer quelque chose de concret, une ligne de produit, un lancement récent, un axe déclaré, plutôt qu'un remplissage générique.

Un exemple allégé de ce qui revient :

json
[
  {
    "companyName": "Acme CRM",
    "website": "https://acmecrm.example",
    "contactEmail": "[email protected]",
    "industry": "B2B SaaS / CRM",
    "description": "Pipeline and contact management for SMB teams.",
    "draftNote": "Saw your pipeline-automation focus for SMB teams..."
  }
]

Demandez au bot de rendre les mêmes données en CSV et vous pouvez les importer directement dans une feuille de calcul ou un CRM. Le message brouillon reste un brouillon : un point de départ que vous éditez, pas un message à envoyer sans l'avoir relu.

Étape 5 : Resserrer la boucle

La première exécution est rarement la dernière. Quelques petits ajouts rendent le bot beaucoup plus utile en pratique, et chacun est un message de suivi d'une ligne dans le chat plutôt que du nouveau code.

Validez avant de faire confiance

Toutes les adresses publiées ne sont pas surveillées, et les boîtes de réception génériques varient en qualité. Demandez au bot de signaler les lignes où l'e-mail de contact ressemble à un catch-all ou où la page de contact manquait, afin que vous puissiez prioriser les plus propres. Il s'agit d'un filtre de qualité, pas d'un enrichissement de données personnelles.

Dédoublonnez entre les exécutions

Lancez le bot quelques fois avec des critères qui se chevauchent et la même entreprise apparaît deux fois, parfois sous des noms légèrement différents. Faites-lui comparer les domaines et fusionner les doublons avant de retourner le tableau. Cela maintient votre liste en ordre et vous évite de contacter la même entreprise deux fois.

Affinez le ciblage

Le système entier n'est qu'un prompt, donc le reciblage est à une phrase. Changez le secteur, la région ou la niche et le bot s'adapte. Plus le brief est précis, plus les résultats sont pertinents, donc orientez-vous vers des demandes précises comme "entreprises fintech au Canada offrant du prêt ou des paiements" plutôt que des demandes larges. Pour des configurations multi-étapes plus avancées, construire des workflows d'agents IA avec le Crawlbase Web MCP va plus loin qu'un seul prompt.

La place de cela dans un vrai stack de vente

Un bot comme celui-ci n'est pas un remplacement d'un CRM ou d'un outil de séquencement ; c'est le front-end de recherche qui les alimente. Il transforme "construis-moi une liste" d'un après-midi de jonglage d'onglets en une conversation, et il maintient les données fraîches car chaque exécution tire des pages en direct plutôt que de réutiliser un export périmé. Si vous pesez l'accès web géré contre le déploiement de votre propre couche de proxy, les cas d'usage de proxy IA expose où chaque approche gagne sa place.

Un cadrage à garder à l'esprit : les chiffres sectoriels publiés sur le temps de recherche de leads varient beaucoup et sont faciles à sélectionner, donc traitez toute affirmation "économise X heures", y compris celles que vous pourriez être tenté de faire en interne, comme directionnelle plutôt que précise. La vraie victoire est la cohérence, le bot collecte les mêmes champs de la même façon à chaque fois, ce qui est plus difficile à faire à la main qu'il n'y paraît.

La partie honnête : CGU et données personnelles

La collecte de données commerciales sur des sites publics est dans une zone grise, et si une exécution donnée est autorisée dépend des conditions d'utilisation de chaque site, de votre juridiction, et de ce que vous faites des données. De nombreux sites restreignent l'accès automatisé dans leurs conditions, donc le crawling peut aller à l'encontre de ces conditions peu importe le soin apporté à votre outillage. Le MCP rend la partie technique fonctionnelle ; il ne change pas les règles sous lesquelles vous opérez.

Quelques lignes à respecter. Collectez uniquement des données publiques au niveau de l'entreprise : noms, sites, secteurs listés, et les adresses de contact génériques qu'une entreprise publie pour les demandes entrantes. Ne collectez pas de données personnelles sur des individus nommés, ne construisez pas ou ne devinez pas des adresses e-mail, et ne récupérez rien derrière une connexion. Respectez le robots.txt et les attentes de débit de chaque site, et maintenez le volume de requêtes suffisamment bas pour ne pas surcharger les serveurs de personne. Quand vous envoyez réellement de la prospection, suivez les lois anti-spam qui s'appliquent à vous, donnez aux gens un moyen clair de se désabonner, et honorez-le.

Ce guide est délibérément limité aux données commerciales publiques car c'est la ligne qui rend le travail défendable. Si votre projet a besoin de données de contact plus riches, la bonne démarche est une source de données avec consentement ou un fournisseur officiel, pas un crawler plus habile. Le même accès géré qui alimente le Web MCP, la Crawling API, le AI Proxy, et la Crawling API, est conçu pour la collecte de données publiques faite de manière responsable, pas pour contourner le consentement.

Récapitulatif

Points clés

  • Deux moitiés, un bot. Claude raisonne et planifie ; le Crawlbase Web MCP récupère et rend les pages en direct. Ensemble ils font de la recherche et rédigent de la prospection sans code de scraping.
  • L'installation est de la configuration, pas du code. Ajoutez le serveur Crawlbase à la configuration de votre client MCP avec vos tokens normal et JS, redémarrez, et confirmez que les outils sont actifs.
  • Le prompt est le produit. Définissez le rôle, limitez aux données publiques, nommez les champs, et interdisez les données personnelles. Le reciblage est un suivi en une phrase.
  • Token JS pour les sites rendus. Utilisez le token normal pour les pages statiques et le token JS quand le contenu se charge côté client.
  • Restez sur les données publiques au niveau de l'entreprise. Pas de contenu protégé par connexion, pas d'e-mails devinés, pas de données personnelles sur des individus. Respectez les CGU, robots.txt, et la loi anti-spam.

Foire aux questions

Qu'est-ce qu'un bot de vente IA construit sur le Crawlbase Web MCP ?

C'est un assistant qui associe le raisonnement d'un modèle de langage à l'accès web en direct du Crawlbase Web MCP. Vous décrivez un profil client idéal, le modèle planifie la recherche et appelle les outils MCP pour crawler les sites publics d'entreprises, et il retourne des leads structurés plus des brouillons de prospection, sans que vous n'écriviez un scraper ou ne fassiez tourner un pool de proxys.

Dois-je écrire du code pour construire cela ?

Non. La construction est une entrée de configuration plus des prompts. Vous ajoutez le serveur Crawlbase à la configuration de votre client MCP avec vos tokens, redémarrez, puis donnez au bot un prompt de rôle et une cible. Le modèle gère le crawling et le formatage via les outils MCP.

Dois-je utiliser le token normal ou le token JS ?

Les deux. Ajoutez les deux à la configuration et laissez le bot choisir par page. Le token normal récupère le HTML statique et est plus rapide ; le token JS rend la page dans un vrai navigateur d'abord et c'est ce dont vous avez besoin pour les sites qui construisent leur contenu avec JavaScript. Si une page revient incomplète ou vide, basculez cette récupération vers le token JS.

Le bot peut-il trouver des adresses e-mail personnelles pour des individus spécifiques ?

Il ne devrait pas, et ce guide lui dit de ne pas le faire. Le prompt restreint la collecte aux données publiques au niveau de l'entreprise telles que les adresses de contact génériques (sales@, hello@, info@) et interdit de deviner ou construire des e-mails personnels. La collecte ou l'inférence de données sur des individus nommés est hors portée délibérément, à la fois pour la précision et pour la conformité.

Quelle est la précision des données retournées par le bot ?

Elle est aussi précise que les pages qu'il lit, c'est pourquoi le prompt lui dit de laisser un champ vide plutôt que de l'inférer. Les sites publics peuvent être périmés ou incohérents, donc ajoutez une passe de validation : faites signaler par le bot les pages de contact manquantes ou les adresses catch-all, et vérifiez les lignes avant toute prospection. Traitez les brouillons de messages comme des points de départ que vous éditez, pas des messages terminés.

Est-il légal d'utiliser un bot comme celui-ci pour la génération de leads ?

Cela dépend des conditions d'utilisation de chaque site, de votre juridiction et de votre objectif, et de nombreux sites restreignent l'accès automatisé. Limitez-vous strictement aux données publiques au niveau de l'entreprise, respectez robots.txt et les attentes de débit, et ne collectez jamais de données personnelles ni de contenu protégé par connexion. Quand vous envoyez de la prospection, suivez les lois anti-spam qui s'appliquent à vous et offrez un moyen clair de se désabonner. Pour des données de contact plus riches, utilisez une source avec consentement plutôt qu'un crawler plus agressif.

Commencer à construire

Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.

Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

En libre-service · Sans appel commercial requis · Volumes de crawl entreprise disponibles