Proxy cho việc duyệt web của AI agent đã trở thành một phần không thể thiếu trong hạ tầng agent production. Mỗi khi LangChain agent của bạn cào một trang giá, instance AutoGPT nghiên cứu đối thủ, hay đội CrewAI thu thập dữ liệu huấn luyện, website đích sẽ thấy một địa chỉ IP duy nhất dồn dập gửi các yêu cầu tự động. Kết quả: rate limit, CAPTCHA, ban IP, và những agent âm thầm trả về dữ liệu rác.
Gartner dự đoán rằng 40% ứng dụng doanh nghiệp sẽ tích hợp các AI agent chuyên biệt theo tác vụ vào cuối năm 2026, tăng từ mức dưới 5% trong năm 2025 (Gartner, tháng 8/2025). Khi việc triển khai agent mở rộng quy mô, mức độ bị chặn cũng tăng theo. Hướng dẫn này bao quát mọi thứ bạn cần để xây dựng hạ tầng proxy đáng tin cậy cho việc thu thập dữ liệu LLM: nên dùng loại proxy nào, cách kết nối chúng vào ba framework agent phổ biến nhất, và cách kiểm soát chi phí.
AI agent tương tác với web theo cách khác con người. Một agent đơn lẻ có thể bắn hàng trăm yêu cầu mỗi phút trên hàng chục domain. Không có proxy, mọi yêu cầu đó đều đến từ cùng một địa chỉ IP.
Giới hạn tốc độ (rate limiting). Hầu hết website áp đặt giới hạn số yêu cầu trên mỗi IP. Một agent gửi 60 yêu cầu mỗi phút từ một IP sẽ kích hoạt việc bóp băng thông chỉ trong vài giây. Phản hồi chậm như rùa hoặc trả về lỗi 429, và chuỗi suy luận của agent bị đứt gãy.
Phát hiện chống bot. Các hệ thống như Cloudflare, Akamai và PerimeterX phân tích mẫu yêu cầu, dấu vân tay TLS và các tín hiệu hành vi. Một agent dùng phiên requests mặc định không có dấu vân tay trình duyệt và nhịp gửi như súng máy thì cực kỳ dễ bị nhận diện.
Lấy dấu vân tay IP. Một IP đơn lẻ gửi yêu cầu đến nhiều endpoint trên cùng một site tạo ra một dấu vân tay rõ ràng. Site tương quan các yêu cầu này, đánh dấu IP và chặn nó—thường là vĩnh viễn.
Hạn chế theo địa lý. Các agent thu thập dữ liệu giá, nội dung quảng cáo, hay kết quả tìm kiếm bản địa cần xuất hiện từ những quốc gia cụ thể. Không có proxy nhắm địa lý, agent của bạn chỉ thấy được những gì được phục vụ cho vị trí thực của server.
IP residential đến từ các thiết bị thật được ISP gán. Website đối xử với chúng như lưu lượng người dùng bình thường, khiến chúng lý tưởng cho các mục tiêu có hệ thống chống bot quyết liệt. Tại JIBAO Proxy, băng thông residential có giá $2/GB ở mức cơ bản, với chiết khấu theo dung lượng đưa giá xuống thấp tới $5.50/GB.
IP datacenter nhanh hơn và rẻ hơn nhưng website dễ phát hiện hơn. Chúng hoạt động tốt cho API, nguồn dữ liệu công khai và các mục tiêu không có bảo vệ chống bot. Với giá $0.8/GB cho IP datacenter xoay vòng, đây là lựa chọn tiết kiệm chi phí cho việc thu thập khối lượng lớn, rủi ro thấp.
Proxy xoay vòng gán một IP mới cho mỗi yêu cầu. Dùng chúng khi mỗi yêu cầu độc lập: truy vấn tìm kiếm, danh sách sản phẩm, kiểm tra URL hàng loạt.
Phiên sticky duy trì cùng một IP trong một khoảng thời gian có thể cấu hình (1–30 phút). Dùng chúng cho các luồng công việc nhiều bước: đăng nhập, điều hướng kết quả phân trang, hay điền biểu mẫu.
| Tác Vụ Của Agent | Loại Proxy | Phiên | Lý Do |
|---|---|---|---|
| Cào web (site được bảo vệ) | Residential | Xoay vòng | Tránh rate limit dựa trên IP |
| Điền biểu mẫu nhiều bước | Residential | Sticky | Duy trì tính nhất quán của phiên |
| Thu thập dữ liệu API | Datacenter | Xoay vòng | Nhanh, rẻ, API hiếm khi chặn IP datacenter |
| Giám sát giá (thương mại điện tử) | Residential | Xoay vòng | Thương mại điện tử dùng chống bot quyết liệt |
| Thu thập dữ liệu huấn luyện LLM | Datacenter | Xoay vòng | Khối lượng quan trọng, hầu hết mục tiêu dễ dãi |
| Nghiên cứu mạng xã hội | Residential | Sticky | Nền tảng theo dõi ràng buộc phiên-IP |
from langchain_community.document_loaders import WebBaseLoader
# JIBAO Proxy rotating residential endpoint
PROXY_USER = "your_username"
PROXY_PASS = "your_password"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10001"
proxy_url = f"http://{PROXY_USER}:{PROXY_PASS}@{PROXY_HOST}:{PROXY_PORT}"
loader = WebBaseLoader(
web_paths=["https://example.com/pricing"],
proxies={"http": proxy_url, "https": proxy_url},
requests_kwargs={"timeout": 30},
)
docs = loader.load()
import requests
from langchain_community.document_loaders import WebBaseLoader
# Sticky session: append session ID to username
SESSION_ID = "agent-task-001"
PROXY_USER = f"your_username-session-{SESSION_ID}"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10002"
proxy_url = f"http://{PROXY_USER}:your_password@{PROXY_HOST}:{PROXY_PORT}"
session = requests.Session()
session.proxies = {"http": proxy_url, "https": proxy_url}
loader = WebBaseLoader(
web_paths=["https://example.com/page/1", "https://example.com/page/2"],
session=session,
)
docs = loader.load()
import os
from langchain.tools import tool
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
@tool
def fetch_page(url: str) -> str:
"""Fetch a web page through a residential proxy."""
import requests
resp = requests.get(url, timeout=30)
resp.raise_for_status()
return resp.text[:8000]
AutoGPT đọc cấu hình proxy từ các biến môi trường. Thêm những dòng này vào file .env của bạn:
# .env - AutoGPT proxy configuration
HTTP_PROXY=http://your_username:[email protected]:10001
HTTPS_PROXY=http://your_username:[email protected]:10001
# Bypass proxy for LLM API calls
NO_PROXY=localhost,127.0.0.1,api.openai.com
# Rate limits (seconds between requests)
BROWSE_COOLDOWN=3
SEARCH_COOLDOWN=5
Nếu bạn chạy AutoGPT qua Docker, hãy truyền các biến qua docker-compose.yml:
services:
autogpt:
environment:
- HTTP_PROXY=http://user:[email protected]:10001
- HTTPS_PROXY=http://user:[email protected]:10001
- NO_PROXY=localhost,127.0.0.1,api.openai.com
Biến NO_PROXY đảm bảo các lệnh gọi API đến nhà cung cấp LLM của bạn đi thẳng. Chỉ lưu lượng duyệt web mới nên được định tuyến qua proxy.
import os
# Configure proxy BEFORE importing CrewAI tools
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
os.environ["NO_PROXY"] = "api.openai.com,api.anthropic.com"
from crewai import Agent, Task, Crew
from crewai_tools import ScrapeWebsiteTool, SerperDevTool
scrape_tool = ScrapeWebsiteTool()
search_tool = SerperDevTool()
researcher = Agent(
role="Market Researcher",
goal="Gather competitor pricing data from e-commerce sites",
tools=[scrape_tool, search_tool],
verbose=True,
)
task = Task(
description="Scrape pricing pages of the top 5 competitors",
agent=researcher,
expected_output="A comparison table of competitor prices",
)
crew = Crew(agents=[researcher], tasks=[task])
result = crew.kickoff()
Xoay IP giữa các tác vụ, không phải trong một tác vụ. Nếu agent của bạn thực hiện một luồng công việc 5 bước trên một site, hãy dùng phiên sticky cho cả 5 bước. Đổi IP giữa chừng tác vụ sẽ kích hoạt các hệ thống chống gian lận.
Dùng phiên sticky cho các luồng xác thực. Bất kỳ luồng công việc nào liên quan đến đăng nhập hay cookie phiên đều phải giữ cùng một IP. Một cookie được tạo trên IP-A nhưng xuất hiện từ IP-B trông giống như chiếm quyền phiên.
Triển khai logic thử lại với việc xoay proxy:
import requests
from time import sleep
def fetch_with_retry(url, proxy_base, max_retries=3):
for attempt in range(max_retries):
proxy = f"http://user-session-{attempt}:pass@{proxy_base}"
try:
resp = requests.get(
url,
proxies={"http": proxy, "https": proxy},
timeout=30,
)
resp.raise_for_status()
return resp.text
except requests.exceptions.HTTPError:
sleep(2 ** attempt)
raise Exception(f"Failed after {max_retries} retries: {url}")
Giám sát mức sử dụng băng thông. Proxy residential tính phí theo GB. Một agent bị lỗi và lặp vô tận trên một trang 10MB có thể đốt cháy ngân sách rất nhanh.
Tôn trọng robots.txt. Proxy cho bạn khả năng truy cập bất cứ thứ gì. Điều đó không có nghĩa là bạn nên làm vậy. Bỏ qua robots.txt có nguy cơ phơi bày pháp lý và khiến các dải IP proxy bị đánh dấu.
Định tuyến lưu lượng dựa trên độ khó của mục tiêu, không phải sự tiện lợi.
Proxy datacenter ($0.8/GB) cho: API công khai, cổng thông tin chính phủ, cơ sở dữ liệu học thuật, trang tin tức. Những mục tiêu này hiếm khi dùng hệ thống chống bot.
Proxy residential ($2/GB, thấp tới $5.50/GB theo dung lượng) cho: nền tảng thương mại điện tử, mạng xã hội, công cụ tìm kiếm, bất cứ thứ gì nằm sau Cloudflare/Akamai.
Cách tiếp cận phân tầng này cắt giảm chi phí proxy 60–80% so với việc định tuyến mọi thứ qua residential.
Thử nghiệm trước khi cam kết. JIBAO Proxy cung cấp dùng thử miễn phí 500MB lưu lượng khi đăng ký—đủ để xác thực pipeline agent của bạn. Tài khoản mới cũng nhận được khuyến mãi 100% cho lần nạp đầu tiên.
Nhận 500MB lưu lượng miễn phí để thử nghiệm proxy residential và datacenter với framework agent của bạn.
Bắt Đầu Dùng Thử Miễn PhíNgười dùng mới nhận 500MB khi đăng ký, cùng tiền thưởng cho lần nạp đầu tiên. Ưu đãi có thời hạn.