Chaque requête que votre machine envoie sur internet porte votre adresse IP. Un serveur proxy s'intercale au milieu et effectue la requête à votre place, de sorte que la destination voit l'adresse du proxy au lieu de la vôtre. Cette unique couche d'indirection est toute l'idée. Tout le reste, rotation, niveaux d'anonymat, la douzaine de noms de produits, est une variation sur ce principe.

Cet article explique ce qui se passe réellement quand vous acheminez du trafic via un proxy, les quelques types qui méritent d'être compris, et comment en choisir un pour une charge de travail réelle. Nous organiserons les seize "types" que vous voyez ailleurs selon les décisions qu'ils représentent réellement, car la plupart décrivent les mêmes deux ou trois choix sous des noms différents.

Ce qu'est un serveur proxy

Un serveur proxy est une machine qui effectue des requêtes réseau au nom d'une autre machine. Votre client parle au proxy, le proxy parle à la destination, et la réponse revient par le même chemin. Pour la destination, le trafic semble provenir du proxy.

Cette indirection vous apporte plusieurs choses à la fois : l'origine voit une IP différente, vous pouvez placer cette IP dans un réseau ou un pays différent, et le saut intermédiaire peut inspecter, mettre en cache, filtrer ou réécrire le trafic au passage. Celui de ces avantages qui vous intéresse détermine quel type de proxy vous utilisez.

Comment fonctionne réellement un proxy

Quand vous utilisez un proxy HTTP, votre client ouvre une connexion au proxy au lieu du site cible et met l'URL cible complète dans la ligne de requête. Le proxy la lit, ouvre sa propre connexion vers l'origine, transfère votre requête et renvoie la réponse en streaming. Comme il peut voir la requête en clair, il peut ajouter, supprimer ou réécrire les en-têtes au passage. C'est ainsi qu'un proxy attache une IP propre, définit une géolocalisation, ou applique une politique d'en-tête.

HTTPS est différent. Votre client ne peut pas laisser le proxy lire un flux chiffré, donc il envoie une requête CONNECT demandant au proxy d'ouvrir un tunnel brut vers l'origine, puis effectue sa négociation TLS directement à travers ce tunnel. Le proxy fait passer des octets dans les deux sens sans voir leur contenu.

http
# Client asks the proxy to tunnel to the origin
CONNECT example.com:443 HTTP/1.1
Host: example.com:443

# Proxy confirms, then relays the encrypted bytes blindly
HTTP/1.1 200 Connection Established
Note

C'est pourquoi un proxy HTTP peut filtrer ou modifier le contenu mais qu'un tunnel HTTPS se contente principalement de le relayer. L'inspection "transparente" de HTTPS nécessite d'installer un certificat sur le client pour que le proxy puisse terminer TLS lui-même, ce dont vous devez vous méfier sur tout réseau que vous ne contrôlez pas.

La taxonomie des proxies : quatre décisions, pas seize types

La plupart des listes de "types de proxies" mélangent quatre questions sans rapport dans un seul menu plat. Séparez-les et le tableau devient simple. Un proxy donné est un point dans quatre dimensions : d'où vient son IP, dans quelle direction il fait face, quel protocole il parle, et à quel point il révèle d'informations sur vous.

Par origine : datacenter, résidentiel, mobile

C'est la dimension qui compte le plus pour le scraping et celle pour laquelle les gens paient vraiment.

Les proxies datacenter sont des IP hébergées chez des fournisseurs cloud ou d'hébergement. Ils sont rapides et bon marché, et ils viennent en grands blocs contigus, ce qui les rend aussi les plus faciles à identifier et bloquer pour un site. Utilisez-les quand la cible ne scrute pas la réputation des IP.

Les proxies résidentiels transitent par de vraies connexions ISP grand public, donc leurs IP ressemblent à des utilisateurs domestiques ordinaires. Ils sont plus lents et plus chers, mais bien plus difficiles à bloquer. Voir proxies datacenter vs résidentiels pour le compromis complet, et proxies ISP vs résidentiels pour le juste milieu des proxies résidentiels statiques.

Les proxies mobiles transitent par des réseaux cellulaires (4G et 5G). Parce que les opérateurs partagent un petit pool d'IP entre de nombreux abonnés via le NAT de niveau opérateur, bloquer une IP mobile risque de bloquer des milliers d'utilisateurs réels, donc les sites les tolèrent davantage. Ils sont aussi les plus chers.

Crawlbase Smart AI Proxy

Ignorez la logique de rotation. Smart AI Proxy choisit une IP résidentielle, datacenter ou mobile par requête, gère les réessais, et se place derrière un seul endpoint, pour que vous ne gériez pas les pools vous-même.

Par direction : forward vs reverse

Un proxy forward se place devant les clients et fait face vers internet. C'est ce que les gens entendent généralement par "proxy" : vous y envoyez votre trafic. Un proxy reverse se place devant les serveurs et fait face vers eux, prenant les requêtes du public et les distribuant aux backends pour l'équilibrage de charge, la mise en cache ou la terminaison TLS. Nginx devant une application est un proxy reverse. Les mécaniques se chevauchent, mais l'intention est opposée. Nous les comparons en détail dans proxy forward vs reverse.

Forward vs reverse. La même machine au milieu ; ce qui change, c'est le côté qu'elle représente. Un proxy forward se place à l'intérieur de votre réseau et fait face vers l'extérieur ; un proxy reverse se place devant l'origine et fait face vers l'intérieur.

Par protocole : HTTP(S) vs SOCKS5

Un proxy HTTP comprend HTTP, ce qui lui permet d'agir sur les requêtes au niveau de la couche applicative (la réécriture d'en-têtes ci-dessus). Un proxy SSL/HTTPS est simplement un proxy HTTP qui gère aussi le tunnel CONNECT pour le trafic chiffré ; voir proxies HTTP vs HTTPS.

Un proxy SOCKS5 fonctionne une couche plus bas. Il transfère du TCP et UDP bruts sans comprendre le protocole au-dessus, il peut donc transporter n'importe quoi (HTTP, email, torrents, trafic de jeux) mais ne peut pas réécrire les en-têtes parce qu'il ne les lit jamais. Optez pour SOCKS5 quand vous avez besoin d'un transfert agnostique au protocole ; optez pour HTTP quand vous voulez un contrôle au niveau des requêtes. Détails dans qu'est-ce qu'un proxy SOCKS5.

Par anonymat : transparent, anonyme, élite

Les proxies diffèrent dans ce qu'ils divulguent. Un proxy transparent transfère votre vraie IP dans des en-têtes comme X-Forwarded-For et s'annonce ; il est utilisé pour la mise en cache et le filtrage de contenu, pas pour l'anonymat. Un proxy anonyme cache votre IP mais s'identifie toujours comme un proxy. Un proxy élite ou haute anonymité cache les deux, se présentant comme un client ordinaire. Un proxy distordant va plus loin et signale une fausse IP. Pour le scraping, vous voulez généralement un comportement élite, où la cible ne peut pas dire qu'un proxy est impliqué.

Proxies spécialisés et de confidentialité

Les autres noms que vous verrez sont des outils plus ciblés plutôt que des catégories distinctes :

  • Proxy web : un proxy que vous utilisez depuis une page de navigateur, sans configuration client requise. Pratique, limité, souvent journalisé.
  • Proxy CGI : la même idée implémentée comme un script côté serveur qui récupère des pages pour vous.
  • Proxy suffix : ajoute son nom à l'URL cible ; trivial à utiliser, facile à bloquer, courant pour contourner des filtres simples.
  • Proxy DNS : transfère les requêtes DNS plutôt que HTTP, utilisé pour le filtrage et le routage géographique au niveau de la résolution de noms.
  • Tor (oignon) et I2P : réseaux d'anonymat, pas des proxies commerciaux. Ils acheminent à travers plusieurs relais bénévoles pour un fort anonymat à un coût de vitesse élevé. Utiles pour la confidentialité, inadaptés au scraping haut débit.

À quoi vous sert réellement un proxy

Au-delà des listes de fonctionnalités, les proxies jouent leur rôle dans quatre usages :

Collecter des données à grande échelle. L'utilisation réelle dominante. La rotation des IP vous permet de rassembler des données publiques (prix, annonces, résultats de recherche) sans qu'une seule adresse soit limitée ou bloquée. C'est pourquoi l'infrastructure de scraping est principalement une infrastructure de proxies.

Contrôler d'où vous semblez venir. Un proxy dans un autre pays vous permet de voir les tarifs géo-spécifiques, les contenus et les résultats de recherche, et de tester comment votre propre site se comporte depuis d'autres endroits.

Performance par la mise en cache. Un proxy forward ou reverse qui met en cache les réponses sert les requêtes répétées localement, réduisant la latence et la charge sur l'origine. C'est la raison originelle pour laquelle les réseaux d'entreprise utilisaient des proxies.

Sécurité, filtrage et surveillance. En tant que point d'étranglement pour le trafic, un proxy peut bloquer des catégories de sites, inspecter les requêtes pour détecter les violations de politique et journaliser l'utilisation. C'est le filtrage de contenu et la surveillance du trafic, et c'est pourquoi les proxies sont courants sur les réseaux gérés.

Les risques, honnêtement

Un proxy est une machine à travers laquelle vous acheminez votre trafic, ce qui signifie que vous faites confiance à celui qui le fait tourner.

Méfiez-vous des proxies gratuits

Un proxy HTTP simple peut tout lire ce que vous envoyez sur des connexions non chiffrées, et un opérateur malveillant peut journaliser des identifiants ou injecter du contenu. Les listes de proxies publics gratuits sont les pires contrevenants : vous ne savez pas qui les fait tourner ni ce qu'ils conservent. Si un proxy est gratuit, anonyme et que vous ne l'avez pas mis en place vous-même, supposez qu'il journalise.

Deux risques spécifiques méritent d'être nommés. Premièrement, pas de chiffrement sur le saut proxy : avec un proxy HTTP simple, le lien entre vous et le proxy n'est pas chiffré sauf si la destination elle-même utilise HTTPS. Deuxièmement, le stockage non autorisé de données : tout proxy peut enregistrer les requêtes qui le traversent, donc la politique de journalisation importe autant que la qualité des IP. Pour le travail en production, utilisez un fournisseur avec une politique claire plutôt que des listes gratuites collectées au hasard.

Comment acheminer le trafic via un proxy

Dans sa forme la plus simple, un proxy est un hôte, un port et des identifiants optionnels. La plupart des outils l'acceptent directement. Voici une seule requête via un proxy HTTP avec curl :

bash
# Send the request through a proxy and check the exit IP
curl -x "http://user:[email protected]:8080" "https://httpbin.org/ip"

# Response shows the proxy's IP, not yours
{ "origin": "203.0.113.42" }

Pour une session shell entière, vous pouvez définir les variables d'environnement HTTP_PROXY et HTTPS_PROXY, que la plupart des outils en ligne de commande respectent. Les navigateurs et les systèmes d'exploitation exposent les mêmes paramètres hôte/port dans leurs préférences réseau. Les mécaniques sont identiques partout ; seul le champ de configuration change.

Utiliser Crawlbase Smart AI Proxy

Gérer soi-même les pools, la rotation et les réessais est la partie qui devient coûteuse. Un endpoint géré le masque : vous pointez votre client vers un hôte, et il sélectionne une IP, tourne en cas d'échec, et retourne la réponse. Avec un fournisseur géré, le même appel curl fonctionne, sans la partie où vous maintenez le pool. C'est le modèle que Crawlbase Smart AI Proxy utilise, et vous pouvez le brancher sur la documentation API.

Comment trouver et vérifier votre IP proxy

Pour voir l'IP qu'un proxy présente, demandez un service d'écho comme httpbin.org/ip ou ifconfig.me à travers lui et lisez l'adresse en retour, exactement comme dans l'exemple curl ci-dessus. Si cela montre l'IP du proxy plutôt que la vôtre, le routage fonctionne.

Et oui, une IP peut être falsifiée dans le sens où des en-têtes comme X-Forwarded-For sont trivialement forgés, ce qui est pourquoi les serveurs ne leur font jamais confiance pour les décisions de sécurité. L'adresse source TCP elle-même ne peut pas être falsifiée pour une connexion bidirectionnelle normale, car la négociation nécessite de recevoir des paquets en retour. Un proxy ne falsifie pas votre IP autant qu'il initie légitimement la connexion depuis la sienne.

Récapitulatif

Points clés

  • Un proxy est une couche d'indirection. Il effectue la requête à votre place, de sorte que l'origine voit son IP, pas la vôtre.
  • Les proxies HTTP voient vos requêtes ; les tunnels HTTPS ne le font pas. Ce seul fait explique ce que chacun peut et ne peut pas faire.
  • Choisissez selon quatre axes, pas seize types : origine, direction, protocole, anonymat. La plupart des "types" nommés ne sont qu'un de ces choix.
  • Pour le scraping, l'origine est ce pour quoi vous payez. Datacenter pour la vitesse, résidentiel et mobile pour éviter les blocages.
  • Vous faites confiance à celui qui fait tourner le proxy. Les proxies anonymes gratuits présentent un risque de journalisation ; utilisez un fournisseur avec une politique claire.

Foire aux questions

En quoi un serveur proxy diffère-t-il d'un pare-feu à filtrage de paquets ?

Un proxy fonctionne au niveau de la couche applicative et effectue des requêtes en votre nom, donc il peut comprendre et réécrire le trafic qu'il transporte. Un pare-feu à filtrage de paquets fonctionne plus bas, autorisant ou rejetant des paquets selon les adresses et les ports sans agir comme endpoint. Un pare-feu décide si le trafic peut passer ; un proxy y participe.

Qu'est-ce qu'une adresse de serveur proxy ?

C'est l'hôte et le port auxquels votre client se connecte, par exemple proxy.example.com:8080, parfois avec un nom d'utilisateur et un mot de passe. Cette paire est tout ce dont un outil a besoin pour acheminer le trafic via le proxy.

Comment trouver une adresse de serveur proxy ?

Pour un proxy que vous contrôlez ou auquel vous êtes abonné, le fournisseur vous donne l'hôte, le port et les identifiants. Sur un réseau géré, l'adresse peut être définie dans les paramètres réseau de votre système d'exploitation ou de votre navigateur, ou envoyée automatiquement par un administrateur. Pour voir l'IP qu'un proxy présente, demandez un service d'écho à travers lui.

Quelle est la fonction courante d'un serveur proxy ?

L'utilisation en production la plus courante est la collecte de données web publiques à grande échelle en faisant tourner des IP pour éviter les limitations de débit et les blocages. Sur les réseaux d'entreprise, la fonction la plus courante est la mise en cache et le filtrage de contenu en un seul point de contrôle centralisé.

Commencer à construire

Crawlez n'importe quel site à grande échelle, sans combattre l'infrastructure.

Crawlbase gère les proxies, les empreintes et les CAPTCHA afin que votre équipe livre des pipelines de données au lieu de maintenir la plomberie de crawl. 1 000 requêtes gratuites, sans carte requise.

En libre-service · Sans appel commercial requis · Volumes de crawl entreprise disponibles