Los proxies para la navegación web de agentes de IA se han convertido en una parte no negociable de la infraestructura de agentes en producción. Cada vez que tu agente de LangChain extrae una página de precios, tu instancia de AutoGPT investiga a la competencia o tu equipo de CrewAI recopila datos de entrenamiento, el sitio web objetivo ve una única dirección IP bombardeándolo con peticiones automatizadas. El resultado: limitación de tasa, CAPTCHAs, bloqueos de IP y agentes que devuelven datos basura de forma silenciosa.
Gartner predice que el 40% de las aplicaciones empresariales incorporarán agentes de IA orientados a tareas específicas para finales de 2026, frente a menos del 5% en 2025 (Gartner, ago. 2025). A medida que escala el despliegue de agentes, también lo hacen los bloqueos. Esta guía cubre todo lo que necesitas para construir una infraestructura de proxy fiable para la recopilación de datos de LLM: qué tipos de proxy usar, cómo conectarlos a los tres frameworks de agentes más populares y cómo mantener los costes bajo control.
Los agentes de IA interactúan con la web de forma distinta a los humanos. Un solo agente puede lanzar cientos de peticiones por minuto a docenas de dominios. Sin proxies, cada una de esas peticiones proviene de la misma dirección IP.
Limitación de tasa. La mayoría de los sitios web imponen límites de peticiones por IP. Un agente que alcanza 60 peticiones por minuto desde una sola IP activará el throttling en cuestión de segundos. Las respuestas se ralentizan hasta arrastrarse o devuelven errores 429, y la cadena de razonamiento de tu agente se rompe.
Detección anti-bot. Sistemas como Cloudflare, Akamai y PerimeterX analizan patrones de peticiones, huellas TLS y señales de comportamiento. Un agente que usa una sesión requests por defecto, sin huella de navegador y con un ritmo de ametralladora, es trivial de identificar.
Fingerprinting de IP. Una única IP que hace peticiones a múltiples endpoints del mismo sitio crea una huella clara. El sitio correlaciona esas peticiones, marca la IP y la bloquea—a menudo de forma permanente.
Restricciones geográficas. Los agentes que recopilan datos de precios, contenido publicitario o resultados de búsqueda localizados necesitan aparentar provenir de países específicos. Sin proxies con segmentación geográfica, tu agente solo ve lo que se sirve a la ubicación real de tu servidor.
Las IP residenciales provienen de dispositivos reales asignados por ISP. Los sitios web las tratan como tráfico de usuario normal, lo que las hace ideales para objetivos con sistemas anti-bot agresivos. En JIBAO Proxy, el ancho de banda residencial cuesta $2/GB a tarifa base, con descuentos por volumen que lo reducen hasta los $5.50/GB.
Las IP de centro de datos son más rápidas y baratas, pero más fáciles de detectar para los sitios web. Funcionan bien para APIs, fuentes de datos públicas y objetivos sin protección anti-bot. A $0.8/GB para IP rotativas de centro de datos, son la opción rentable para la recopilación de alto volumen y bajo riesgo.
Los proxies rotativos asignan una nueva IP en cada petición. Úsalos cuando cada petición sea independiente: consultas de búsqueda, listados de productos, comprobaciones masivas de URL.
Las sesiones persistentes (sticky) mantienen la misma IP durante una duración configurable (1–30 minutos). Úsalas para flujos de trabajo de varios pasos: iniciar sesión, navegar resultados paginados o completar formularios.
| Tarea del agente | Tipo de proxy | Sesión | Por qué |
|---|---|---|---|
| Web scraping (sitios protegidos) | Residencial | Rotativa | Evita la limitación de tasa basada en IP |
| Rellenado de formularios de varios pasos | Residencial | Persistente (sticky) | Mantiene la consistencia de la sesión |
| Recopilación de datos vía API | Centro de datos | Rotativa | Rápida, barata; las APIs rara vez bloquean IP de centro de datos |
| Monitorización de precios (e-commerce) | Residencial | Rotativa | El e-commerce usa anti-bot agresivo |
| Recopilación de datos de entrenamiento de LLM | Centro de datos | Rotativa | El volumen importa; la mayoría de los objetivos son permisivos |
| Investigación en redes sociales | Residencial | Persistente (sticky) | Las plataformas rastrean el vínculo sesión-IP |
from langchain_community.document_loaders import WebBaseLoader
# JIBAO Proxy rotating residential endpoint
PROXY_USER = "your_username"
PROXY_PASS = "your_password"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10001"
proxy_url = f"http://{PROXY_USER}:{PROXY_PASS}@{PROXY_HOST}:{PROXY_PORT}"
loader = WebBaseLoader(
web_paths=["https://example.com/pricing"],
proxies={"http": proxy_url, "https": proxy_url},
requests_kwargs={"timeout": 30},
)
docs = loader.load()
import requests
from langchain_community.document_loaders import WebBaseLoader
# Sticky session: append session ID to username
SESSION_ID = "agent-task-001"
PROXY_USER = f"your_username-session-{SESSION_ID}"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10002"
proxy_url = f"http://{PROXY_USER}:your_password@{PROXY_HOST}:{PROXY_PORT}"
session = requests.Session()
session.proxies = {"http": proxy_url, "https": proxy_url}
loader = WebBaseLoader(
web_paths=["https://example.com/page/1", "https://example.com/page/2"],
session=session,
)
docs = loader.load()
import os
from langchain.tools import tool
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
@tool
def fetch_page(url: str) -> str:
"""Fetch a web page through a residential proxy."""
import requests
resp = requests.get(url, timeout=30)
resp.raise_for_status()
return resp.text[:8000]
AutoGPT lee la configuración de proxy desde variables de entorno. Añade estas a tu archivo .env:
# .env - AutoGPT proxy configuration
HTTP_PROXY=http://your_username:[email protected]:10001
HTTPS_PROXY=http://your_username:[email protected]:10001
# Bypass proxy for LLM API calls
NO_PROXY=localhost,127.0.0.1,api.openai.com
# Rate limits (seconds between requests)
BROWSE_COOLDOWN=3
SEARCH_COOLDOWN=5
Si ejecutas AutoGPT mediante Docker, pasa las variables a través de docker-compose.yml:
services:
autogpt:
environment:
- HTTP_PROXY=http://user:[email protected]:10001
- HTTPS_PROXY=http://user:[email protected]:10001
- NO_PROXY=localhost,127.0.0.1,api.openai.com
La variable NO_PROXY garantiza que las llamadas a la API de tu proveedor de LLM vayan directas. Solo el tráfico de navegación web debería pasar por el proxy.
import os
# Configure proxy BEFORE importing CrewAI tools
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
os.environ["NO_PROXY"] = "api.openai.com,api.anthropic.com"
from crewai import Agent, Task, Crew
from crewai_tools import ScrapeWebsiteTool, SerperDevTool
scrape_tool = ScrapeWebsiteTool()
search_tool = SerperDevTool()
researcher = Agent(
role="Market Researcher",
goal="Gather competitor pricing data from e-commerce sites",
tools=[scrape_tool, search_tool],
verbose=True,
)
task = Task(
description="Scrape pricing pages of the top 5 competitors",
agent=researcher,
expected_output="A comparison table of competitor prices",
)
crew = Crew(agents=[researcher], tasks=[task])
result = crew.kickoff()
Rota las IP entre tareas, no dentro de una tarea. Si tu agente realiza un flujo de trabajo de 5 pasos en un sitio, usa una sesión persistente para los 5 pasos. Cambiar de IP a mitad de la tarea activa los sistemas anti-fraude.
Usa sesiones persistentes para los flujos de autenticación. Cualquier flujo de trabajo que implique inicio de sesión o cookies de sesión debe mantener la misma IP. Una cookie generada en la IP-A que aparece desde la IP-B parece un secuestro de sesión.
Implementa lógica de reintento con rotación de proxy:
import requests
from time import sleep
def fetch_with_retry(url, proxy_base, max_retries=3):
for attempt in range(max_retries):
proxy = f"http://user-session-{attempt}:pass@{proxy_base}"
try:
resp = requests.get(
url,
proxies={"http": proxy, "https": proxy},
timeout=30,
)
resp.raise_for_status()
return resp.text
except requests.exceptions.HTTPError:
sleep(2 ** attempt)
raise Exception(f"Failed after {max_retries} retries: {url}")
Monitoriza el uso de ancho de banda. Los proxies residenciales facturan por GB. Un agente con un bug que entra en bucle sobre una página de 10MB puede agotar el presupuesto rápidamente.
Respeta robots.txt. Los proxies te dan la capacidad de acceder a cualquier cosa. Eso no significa que debas hacerlo. Ignorar robots.txt conlleva riesgo legal y hace que los rangos de IP del proxy queden marcados.
Enruta el tráfico según la dificultad del objetivo, no por comodidad.
Proxies de centro de datos ($0.8/GB) para: APIs públicas, portales gubernamentales, bases de datos académicas, sitios de noticias. Estos objetivos rara vez emplean sistemas anti-bot.
Proxies residenciales ($2/GB, hasta $5.50/GB con volumen) para: plataformas de e-commerce, redes sociales, motores de búsqueda, cualquier cosa detrás de Cloudflare/Akamai.
Este enfoque por niveles reduce los costes de proxy entre un 60–80% en comparación con enrutar todo a través de residencial.
Prueba antes de comprometerte. JIBAO Proxy ofrece una prueba gratuita con 500MB de tráfico al registrarte—suficiente para validar el pipeline de tu agente. Las cuentas nuevas también reciben un bono del 100% en el primer depósito.
Consigue 500MB de tráfico gratis para probar proxies residenciales y de centro de datos con tu framework de agentes.
Iniciar prueba gratuitaLos nuevos usuarios reciben 500MB al registrarse, más un bono en la primera recarga. Oferta por tiempo limitado.