Proxies para navegação web de agentes de IA tornaram-se uma parte inegociável da infraestrutura de agentes em produção. Toda vez que seu agente LangChain faz scraping de uma página de preços, sua instância AutoGPT pesquisa concorrentes ou sua equipe CrewAI coleta dados de treinamento, o site alvo enxerga um único endereço IP martelando-o com requisições automatizadas. O resultado: limites de taxa, CAPTCHAs, banimentos de IP e agentes que silenciosamente retornam dados inúteis.
A Gartner prevê que 40% das aplicações corporativas terão agentes de IA específicos para tarefas até o final de 2026, contra menos de 5% em 2025 (Gartner, ago. 2025). Conforme a implantação de agentes escala, o bloqueio também escala. Este guia cobre tudo que você precisa para construir uma infraestrutura de proxy confiável para coleta de dados de LLM: quais tipos de proxy usar, como conectá-los aos três frameworks de agentes mais populares e como manter os custos sob controle.
Agentes de IA interagem com a web de forma diferente dos humanos. Um único agente pode disparar centenas de requisições por minuto em dezenas de domínios. Sem proxies, cada uma dessas requisições vem do mesmo endereço IP.
Limitação de taxa. A maioria dos sites impõe limites de requisições por IP. Um agente que atinge 60 requisições por minuto a partir de um IP vai disparar throttling em segundos. As respostas ficam lentíssimas ou retornam erros 429, e a cadeia de raciocínio do seu agente quebra.
Detecção anti-bot. Sistemas como Cloudflare, Akamai e PerimeterX analisam padrões de requisição, fingerprints de TLS e sinais comportamentais. Um agente usando uma sessão requests padrão, sem fingerprint de navegador e com timing de metralhadora, é trivial de identificar.
Fingerprinting de IP. Um único IP fazendo requisições a múltiplos endpoints no mesmo site cria um fingerprint claro. O site correlaciona essas requisições, sinaliza o IP e o bloqueia — muitas vezes permanentemente.
Restrições geográficas. Agentes coletando dados de preços, conteúdo de anúncios ou resultados de busca localizados precisam parecer vir de países específicos. Sem proxies com segmentação geográfica, seu agente vê apenas o que é servido para a localização real do seu servidor.
IPs residenciais vêm de dispositivos reais atribuídos por ISPs. Os sites os tratam como tráfego de usuário normal, o que os torna ideais para alvos com sistemas anti-bot agressivos. Na JIBAO Proxy, a banda residencial custa $6,8/GB na taxa base, com descontos por volume baixando para até $5,50/GB.
IPs de datacenter são mais rápidos e baratos, mas mais fáceis de os sites detectarem. Funcionam bem para APIs, fontes de dados públicas e alvos sem proteção anti-bot. A $0.8/GB para IPs de datacenter rotativos, eles são a escolha econômica para coleta de alto volume e baixo risco.
Proxies rotativos atribuem um novo IP para cada requisição. Use-os quando cada requisição é independente: consultas de busca, listagens de produtos, verificações de URL em massa.
Sessões sticky mantêm o mesmo IP por uma duração configurável (1–30 minutos). Use-as para fluxos de múltiplos passos: fazer login, navegar por resultados paginados ou preencher formulários.
| Tarefa do agente | Tipo de proxy | Sessão | Por quê |
|---|---|---|---|
| Scraping web (sites protegidos) | Residencial | Rotativo | Evita limites de taxa por IP |
| Preenchimento de formulário em múltiplos passos | Residencial | Sticky | Mantém a consistência da sessão |
| Coleta de dados via API | Datacenter | Rotativo | Rápido, barato, APIs raramente bloqueiam IPs de datacenter |
| Monitoramento de preços (e-commerce) | Residencial | Rotativo | E-commerce usa anti-bot agressivo |
| Coleta de dados de treinamento para LLM | Datacenter | Rotativo | Volume importa, a maioria dos alvos é permissiva |
| Pesquisa em redes sociais | Residencial | Sticky | Plataformas rastreiam o vínculo sessão-IP |
from langchain_community.document_loaders import WebBaseLoader
# JIBAO Proxy rotating residential endpoint
PROXY_USER = "your_username"
PROXY_PASS = "your_password"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10001"
proxy_url = f"http://{PROXY_USER}:{PROXY_PASS}@{PROXY_HOST}:{PROXY_PORT}"
loader = WebBaseLoader(
web_paths=["https://example.com/pricing"],
proxies={"http": proxy_url, "https": proxy_url},
requests_kwargs={"timeout": 30},
)
docs = loader.load()
import requests
from langchain_community.document_loaders import WebBaseLoader
# Sticky session: append session ID to username
SESSION_ID = "agent-task-001"
PROXY_USER = f"your_username-session-{SESSION_ID}"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10002"
proxy_url = f"http://{PROXY_USER}:your_password@{PROXY_HOST}:{PROXY_PORT}"
session = requests.Session()
session.proxies = {"http": proxy_url, "https": proxy_url}
loader = WebBaseLoader(
web_paths=["https://example.com/page/1", "https://example.com/page/2"],
session=session,
)
docs = loader.load()
import os
from langchain.tools import tool
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
@tool
def fetch_page(url: str) -> str:
"""Fetch a web page through a residential proxy."""
import requests
resp = requests.get(url, timeout=30)
resp.raise_for_status()
return resp.text[:8000]
O AutoGPT lê a configuração de proxy a partir de variáveis de ambiente. Adicione estas ao seu arquivo .env:
# .env - AutoGPT proxy configuration
HTTP_PROXY=http://your_username:[email protected]:10001
HTTPS_PROXY=http://your_username:[email protected]:10001
# Bypass proxy for LLM API calls
NO_PROXY=localhost,127.0.0.1,api.openai.com
# Rate limits (seconds between requests)
BROWSE_COOLDOWN=3
SEARCH_COOLDOWN=5
Se você roda o AutoGPT via Docker, passe as variáveis pelo docker-compose.yml:
services:
autogpt:
environment:
- HTTP_PROXY=http://user:[email protected]:10001
- HTTPS_PROXY=http://user:[email protected]:10001
- NO_PROXY=localhost,127.0.0.1,api.openai.com
A variável NO_PROXY garante que as chamadas de API ao seu provedor de LLM vão direto. Apenas o tráfego de navegação web deve passar por proxy.
import os
# Configure proxy BEFORE importing CrewAI tools
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
os.environ["NO_PROXY"] = "api.openai.com,api.anthropic.com"
from crewai import Agent, Task, Crew
from crewai_tools import ScrapeWebsiteTool, SerperDevTool
scrape_tool = ScrapeWebsiteTool()
search_tool = SerperDevTool()
researcher = Agent(
role="Market Researcher",
goal="Gather competitor pricing data from e-commerce sites",
tools=[scrape_tool, search_tool],
verbose=True,
)
task = Task(
description="Scrape pricing pages of the top 5 competitors",
agent=researcher,
expected_output="A comparison table of competitor prices",
)
crew = Crew(agents=[researcher], tasks=[task])
result = crew.kickoff()
Rotacione IPs entre tarefas, não dentro de uma tarefa. Se seu agente executa um fluxo de 5 passos em um site, use uma sessão sticky para os 5 passos. Trocar IPs no meio da tarefa dispara sistemas antifraude.
Use sessões sticky para fluxos de autenticação. Qualquer fluxo envolvendo login ou cookies de sessão precisa manter o mesmo IP. Um cookie emitido no IP-A que aparece a partir do IP-B parece sequestro de sessão.
Implemente lógica de retry com rotação de proxy:
import requests
from time import sleep
def fetch_with_retry(url, proxy_base, max_retries=3):
for attempt in range(max_retries):
proxy = f"http://user-session-{attempt}:pass@{proxy_base}"
try:
resp = requests.get(
url,
proxies={"http": proxy, "https": proxy},
timeout=30,
)
resp.raise_for_status()
return resp.text
except requests.exceptions.HTTPError:
sleep(2 ** attempt)
raise Exception(f"Failed after {max_retries} retries: {url}")
Monitore o uso de banda. Proxies residenciais cobram por GB. Um agente com um bug que fica em loop numa página de 10MB pode queimar o orçamento rápido.
Respeite o robots.txt. Proxies te dão a capacidade de acessar qualquer coisa. Isso não significa que você deveria. Ignorar o robots.txt traz risco de exposição legal e faz faixas de IP de proxy serem sinalizadas.
Roteie o tráfego com base na dificuldade do alvo, não na conveniência.
Proxies de datacenter ($0.8/GB) para: APIs públicas, portais governamentais, bancos de dados acadêmicos, sites de notícias. Esses alvos raramente empregam sistemas anti-bot.
Proxies residenciais ($6,8/GB, até $5,50/GB com volume) para: plataformas de e-commerce, redes sociais, mecanismos de busca, qualquer coisa atrás de Cloudflare/Akamai.
Essa abordagem em camadas corta os custos de proxy em 60–80% comparado a rotear tudo por residencial.
Teste antes de se comprometer. A JIBAO Proxy oferece um experimente grátis com 500MB de tráfego no cadastro — o suficiente para validar o pipeline do seu agente. Contas novas também recebem um bônus de 100% no primeiro depósito.
Ganhe 500MB de tráfego grátis para testar proxies residenciais e de datacenter com o framework do seu agente.
Começar teste grátisNovos usuários recebem 500MB ao se cadastrar, mais um bônus na primeira recarga. Oferta por tempo limitado.