Les proxies pour la navigation web des agents IA sont devenus un élément non négociable de l'infrastructure d'agents en production. Chaque fois que votre agent LangChain scrape une page de tarifs, que votre instance AutoGPT étudie la concurrence ou que votre équipe CrewAI collecte des données d'entraînement, le site web cible voit une seule adresse IP le bombarder de requêtes automatisées. Le résultat : limitation de débit, CAPTCHA, bannissements d'IP et agents qui retournent silencieusement des données inexploitables.
Gartner prédit que 40% des applications d'entreprise intégreront des agents IA orientés vers des tâches spécifiques d'ici fin 2026, contre moins de 5% en 2025 (Gartner, août 2025). À mesure que le déploiement d'agents monte en charge, les blocages aussi. Ce guide couvre tout ce dont vous avez besoin pour construire une infrastructure de proxy fiable pour la collecte de données LLM : quels types de proxy utiliser, comment les brancher aux trois frameworks d'agents les plus populaires et comment garder les coûts sous contrôle.
Les agents IA interagissent avec le web différemment des humains. Un seul agent peut lancer des centaines de requêtes par minute sur des dizaines de domaines. Sans proxies, chacune de ces requêtes provient de la même adresse IP.
Limitation de débit. La plupart des sites web imposent des limites de requêtes par IP. Un agent qui atteint 60 requêtes par minute depuis une seule IP déclenchera le throttling en quelques secondes. Les réponses ralentissent jusqu'à se traîner ou renvoient des erreurs 429, et la chaîne de raisonnement de votre agent se brise.
Détection anti-bot. Des systèmes comme Cloudflare, Akamai et PerimeterX analysent les schémas de requêtes, les empreintes TLS et les signaux comportementaux. Un agent qui utilise une session requests par défaut, sans empreinte de navigateur et avec un rythme de mitraillette, est trivial à identifier.
Fingerprinting d'IP. Une seule IP qui fait des requêtes vers plusieurs endpoints du même site crée une empreinte claire. Le site corrèle ces requêtes, signale l'IP et la bloque—souvent de façon permanente.
Restrictions géographiques. Les agents qui collectent des données de tarifs, du contenu publicitaire ou des résultats de recherche localisés doivent paraître provenir de pays spécifiques. Sans proxies à ciblage géographique, votre agent ne voit que ce qui est servi à l'emplacement réel de votre serveur.
Les IP résidentielles proviennent d'appareils réels attribués par des FAI. Les sites web les traitent comme du trafic d'utilisateur normal, ce qui les rend idéales pour les cibles avec des systèmes anti-bot agressifs. Chez JIBAO Proxy, la bande passante résidentielle coûte $2/GB au tarif de base, avec des remises sur volume qui la font descendre jusqu'à $5.50/GB.
Les IP de centre de données sont plus rapides et moins chères mais plus faciles à détecter pour les sites web. Elles fonctionnent bien pour les API, les sources de données publiques et les cibles sans protection anti-bot. À $0.8/GB pour les IP rotatives de centre de données, elles constituent le choix rentable pour la collecte à fort volume et faible risque.
Les proxies rotatifs attribuent une nouvelle IP à chaque requête. Utilisez-les quand chaque requête est indépendante : requêtes de recherche, listings de produits, vérifications d'URL en masse.
Les sessions sticky conservent la même IP pendant une durée configurable (1–30 minutes). Utilisez-les pour les workflows multi-étapes : se connecter, naviguer dans des résultats paginés ou remplir des formulaires.
| Tâche de l'agent | Type de proxy | Session | Pourquoi |
|---|---|---|---|
| Web scraping (sites protégés) | Résidentiel | Rotative | Évite les limitations de débit basées sur l'IP |
| Remplissage de formulaires multi-étapes | Résidentiel | Sticky | Maintient la cohérence de la session |
| Collecte de données via API | Centre de données | Rotative | Rapide, bon marché ; les API bloquent rarement les IP de centre de données |
| Monitoring de prix (e-commerce) | Résidentiel | Rotative | L'e-commerce utilise un anti-bot agressif |
| Collecte de données d'entraînement LLM | Centre de données | Rotative | Le volume compte ; la plupart des cibles sont permissives |
| Recherche sur les réseaux sociaux | Résidentiel | Sticky | Les plateformes suivent le lien session-IP |
from langchain_community.document_loaders import WebBaseLoader
# JIBAO Proxy rotating residential endpoint
PROXY_USER = "your_username"
PROXY_PASS = "your_password"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10001"
proxy_url = f"http://{PROXY_USER}:{PROXY_PASS}@{PROXY_HOST}:{PROXY_PORT}"
loader = WebBaseLoader(
web_paths=["https://example.com/pricing"],
proxies={"http": proxy_url, "https": proxy_url},
requests_kwargs={"timeout": 30},
)
docs = loader.load()
import requests
from langchain_community.document_loaders import WebBaseLoader
# Sticky session: append session ID to username
SESSION_ID = "agent-task-001"
PROXY_USER = f"your_username-session-{SESSION_ID}"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10002"
proxy_url = f"http://{PROXY_USER}:your_password@{PROXY_HOST}:{PROXY_PORT}"
session = requests.Session()
session.proxies = {"http": proxy_url, "https": proxy_url}
loader = WebBaseLoader(
web_paths=["https://example.com/page/1", "https://example.com/page/2"],
session=session,
)
docs = loader.load()
import os
from langchain.tools import tool
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
@tool
def fetch_page(url: str) -> str:
"""Fetch a web page through a residential proxy."""
import requests
resp = requests.get(url, timeout=30)
resp.raise_for_status()
return resp.text[:8000]
AutoGPT lit la configuration du proxy depuis des variables d'environnement. Ajoutez celles-ci à votre fichier .env :
# .env - AutoGPT proxy configuration
HTTP_PROXY=http://your_username:[email protected]:10001
HTTPS_PROXY=http://your_username:[email protected]:10001
# Bypass proxy for LLM API calls
NO_PROXY=localhost,127.0.0.1,api.openai.com
# Rate limits (seconds between requests)
BROWSE_COOLDOWN=3
SEARCH_COOLDOWN=5
Si vous exécutez AutoGPT via Docker, passez les variables à travers docker-compose.yml :
services:
autogpt:
environment:
- HTTP_PROXY=http://user:[email protected]:10001
- HTTPS_PROXY=http://user:[email protected]:10001
- NO_PROXY=localhost,127.0.0.1,api.openai.com
La variable NO_PROXY garantit que les appels à l'API de votre fournisseur de LLM partent en direct. Seul le trafic de navigation web devrait passer par le proxy.
import os
# Configure proxy BEFORE importing CrewAI tools
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
os.environ["NO_PROXY"] = "api.openai.com,api.anthropic.com"
from crewai import Agent, Task, Crew
from crewai_tools import ScrapeWebsiteTool, SerperDevTool
scrape_tool = ScrapeWebsiteTool()
search_tool = SerperDevTool()
researcher = Agent(
role="Market Researcher",
goal="Gather competitor pricing data from e-commerce sites",
tools=[scrape_tool, search_tool],
verbose=True,
)
task = Task(
description="Scrape pricing pages of the top 5 competitors",
agent=researcher,
expected_output="A comparison table of competitor prices",
)
crew = Crew(agents=[researcher], tasks=[task])
result = crew.kickoff()
Faites tourner les IP entre les tâches, pas au sein d'une tâche. Si votre agent exécute un workflow en 5 étapes sur un site, utilisez une session sticky pour les 5 étapes. Changer d'IP en milieu de tâche déclenche les systèmes anti-fraude.
Utilisez des sessions sticky pour les flux d'authentification. Tout workflow impliquant une connexion ou des cookies de session doit conserver la même IP. Un cookie émis sur l'IP-A qui apparaît depuis l'IP-B ressemble à un détournement de session.
Implémentez une logique de réessai avec rotation de proxy :
import requests
from time import sleep
def fetch_with_retry(url, proxy_base, max_retries=3):
for attempt in range(max_retries):
proxy = f"http://user-session-{attempt}:pass@{proxy_base}"
try:
resp = requests.get(
url,
proxies={"http": proxy, "https": proxy},
timeout=30,
)
resp.raise_for_status()
return resp.text
except requests.exceptions.HTTPError:
sleep(2 ** attempt)
raise Exception(f"Failed after {max_retries} retries: {url}")
Surveillez la consommation de bande passante. Les proxies résidentiels facturent au GB. Un agent avec un bug qui boucle sur une page de 10MB peut épuiser le budget rapidement.
Respectez robots.txt. Les proxies vous donnent la capacité d'accéder à tout. Cela ne signifie pas que vous devriez le faire. Ignorer robots.txt comporte un risque juridique et fait signaler les plages d'IP du proxy.
Routez le trafic selon la difficulté de la cible, pas par commodité.
Proxies de centre de données ($0.8/GB) pour : API publiques, portails gouvernementaux, bases de données académiques, sites d'actualités. Ces cibles emploient rarement des systèmes anti-bot.
Proxies résidentiels ($2/GB, jusqu'à $5.50/GB avec volume) pour : plateformes e-commerce, réseaux sociaux, moteurs de recherche, tout ce qui se trouve derrière Cloudflare/Akamai.
Cette approche par paliers réduit les coûts de proxy de 60–80% par rapport au routage de tout via du résidentiel.
Testez avant de vous engager. JIBAO Proxy propose un essai gratuit avec 500 Mo de trafic à l'inscription—suffisant pour valider le pipeline de votre agent. Les nouveaux comptes reçoivent aussi un bonus de 100% sur le premier dépôt.
Obtenez 500 Mo de trafic gratuit pour tester les proxies résidentiels et de centre de données avec votre framework d'agents.
Démarrer l'essai gratuitLes nouveaux utilisateurs reçoivent 500 Mo à l'inscription, plus un bonus sur la première recharge. Offre à durée limitée.