AI এজেন্টের ওয়েব ব্রাউজিংয়ের জন্য প্রক্সি এখন প্রোডাকশন এজেন্ট অবকাঠামোর একটি অবিচ্ছেদ্য অংশ হয়ে উঠেছে। প্রতিবার আপনার LangChain এজেন্ট একটি pricing পেজ scrape করে, আপনার AutoGPT ইনস্ট্যান্স প্রতিযোগীদের নিয়ে গবেষণা করে, অথবা আপনার CrewAI ক্রু ট্রেনিং ডেটা সংগ্রহ করে, টার্গেট ওয়েবসাইট একটিমাত্র IP অ্যাড্রেসকে স্বয়ংক্রিয় রিকোয়েস্ট দিয়ে আঘাত করতে দেখে। ফলাফল: rate limit, CAPTCHA, IP ban, এবং এমন এজেন্ট যা নীরবে আবর্জনা ডেটা ফেরত দেয়।
Gartner-এর পূর্বাভাস অনুযায়ী, ২০২৬ সালের শেষ নাগাদ ৪০% এন্টারপ্রাইজ অ্যাপ্লিকেশনে টাস্ক-নির্দিষ্ট AI এজেন্ট থাকবে, যা ২০২৫ সালে ৫%-এরও কম ছিল (Gartner, আগস্ট ২০২৫)। এজেন্ট ডিপ্লয়মেন্ট যত বাড়ছে, ব্লকিংও তত বাড়ছে। এই গাইডে LLM ডেটা সংগ্রহের জন্য প্রক্সি অবকাঠামো তৈরি করতে যা যা দরকার তার সবকিছু রয়েছে: কোন প্রক্সি টাইপ ব্যবহার করবেন, সবচেয়ে জনপ্রিয় তিনটি এজেন্ট ফ্রেমওয়ার্কে কীভাবে সেগুলো যুক্ত করবেন, এবং খরচ নিয়ন্ত্রণে রাখবেন কীভাবে।
AI এজেন্ট মানুষের চেয়ে ভিন্নভাবে ওয়েবের সঙ্গে ইন্টারঅ্যাক্ট করে। একটি একক এজেন্ট মিনিটে কয়েকশ রিকোয়েস্ট কয়েক ডজন ডোমেইন জুড়ে ছুড়তে পারে। প্রক্সি ছাড়া, এর প্রতিটি রিকোয়েস্ট একই IP অ্যাড্রেস থেকে আসে।
Rate limiting। বেশিরভাগ ওয়েবসাইট প্রতি-IP রিকোয়েস্ট সীমা প্রয়োগ করে। একটি এজেন্ট যা একটি IP থেকে মিনিটে ৬০ রিকোয়েস্ট মারে, কয়েক সেকেন্ডের মধ্যেই throttling ট্রিগার করবে। রেসপন্স ক্রমশ ধীর হয়ে পড়ে বা 429 error ফেরত দেয়, এবং আপনার এজেন্টের যুক্তি-শৃঙ্খল ভেঙে যায়।
Anti-bot সনাক্তকরণ। Cloudflare, Akamai এবং PerimeterX-এর মতো সিস্টেম রিকোয়েস্ট প্যাটার্ন, TLS ফিঙ্গারপ্রিন্ট এবং আচরণগত সিগন্যাল বিশ্লেষণ করে। কোনো ব্রাউজার ফিঙ্গারপ্রিন্ট ছাড়া ডিফল্ট requests সেশন ব্যবহারকারী এবং মেশিনগানের মতো টাইমিংওয়ালা একটি এজেন্ট শনাক্ত করা তুচ্ছ ব্যাপার।
IP ফিঙ্গারপ্রিন্টিং। একই সাইটের একাধিক এন্ডপয়েন্টে রিকোয়েস্ট করা একটি একক IP একটি স্পষ্ট ফিঙ্গারপ্রিন্ট তৈরি করে। সাইটটি এই রিকোয়েস্টগুলো পরস্পর সম্পর্কিত করে, IP-টি ফ্ল্যাগ করে এবং ব্লক করে দেয়—প্রায়শই স্থায়ীভাবে।
Geo-restriction। pricing ডেটা, বিজ্ঞাপন কনটেন্ট বা স্থানীয়কৃত সার্চ রেজাল্ট সংগ্রহকারী এজেন্টদের নির্দিষ্ট দেশ থেকে আসা দেখাতে হয়। geo-targeted প্রক্সি ছাড়া, আপনার এজেন্ট শুধু সেটুকুই দেখে যা আপনার সার্ভারের প্রকৃত লোকেশনে পরিবেশিত হয়।
Residential IP প্রকৃত ISP-বরাদ্দকৃত ডিভাইস থেকে আসে। ওয়েবসাইট এগুলোকে স্বাভাবিক ব্যবহারকারীর ট্র্যাফিকের মতো গণ্য করে, যা আগ্রাসী anti-bot সিস্টেমওয়ালা টার্গেটের জন্য এগুলোকে আদর্শ করে তোলে। JIBAO Proxy-তে residential ব্যান্ডউইথের বেস রেট $2/GB, ভলিউম ছাড়ে যা $5.50/GB পর্যন্ত নেমে আসে।
Datacenter IP দ্রুততর ও সস্তা কিন্তু ওয়েবসাইটের জন্য সনাক্ত করা সহজ। এগুলো API, পাবলিক ডেটা সোর্স এবং anti-bot সুরক্ষাবিহীন টার্গেটের জন্য ভালো কাজ করে। রোটেটিং datacenter IP-র জন্য $0.8/GB-তে, এগুলো উচ্চ-ভলিউম, কম-ঝুঁকির সংগ্রহের জন্য সাশ্রয়ী পছন্দ।
Rotating প্রক্সি প্রতিটি রিকোয়েস্টের জন্য একটি নতুন IP বরাদ্দ করে। যখন প্রতিটি রিকোয়েস্ট স্বতন্ত্র তখন এগুলো ব্যবহার করুন: সার্চ কোয়েরি, প্রোডাক্ট লিস্টিং, বাল্ক URL চেক।
Sticky session একটি কনফিগারযোগ্য সময়কালের জন্য (১–৩০ মিনিট) একই IP বজায় রাখে। মাল্টি-স্টেপ ওয়ার্কফ্লোর জন্য এগুলো ব্যবহার করুন: লগ ইন করা, পেজিনেটেড রেজাল্টে নেভিগেট করা, বা ফর্ম পূরণ করা।
| এজেন্ট টাস্ক | প্রক্সি টাইপ | সেশন | কেন |
|---|---|---|---|
| ওয়েব scraping (সুরক্ষিত সাইট) | Residential | Rotating | IP-ভিত্তিক rate limit এড়ায় |
| মাল্টি-স্টেপ ফর্ম পূরণ | Residential | Sticky | সেশন সামঞ্জস্য বজায় রাখে |
| API ডেটা সংগ্রহ | Datacenter | Rotating | দ্রুত, সস্তা, API খুব কমই datacenter IP ব্লক করে |
| মূল্য পর্যবেক্ষণ (ই-কমার্স) | Residential | Rotating | ই-কমার্স আগ্রাসী anti-bot ব্যবহার করে |
| LLM ট্রেনিং ডেটা সংগ্রহ | Datacenter | Rotating | ভলিউম গুরুত্বপূর্ণ, বেশিরভাগ টার্গেট অনুমোদনশীল |
| সোশ্যাল মিডিয়া গবেষণা | Residential | Sticky | প্ল্যাটফর্ম সেশন-IP বাঁধন ট্র্যাক করে |
from langchain_community.document_loaders import WebBaseLoader
# JIBAO Proxy rotating residential endpoint
PROXY_USER = "your_username"
PROXY_PASS = "your_password"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10001"
proxy_url = f"http://{PROXY_USER}:{PROXY_PASS}@{PROXY_HOST}:{PROXY_PORT}"
loader = WebBaseLoader(
web_paths=["https://example.com/pricing"],
proxies={"http": proxy_url, "https": proxy_url},
requests_kwargs={"timeout": 30},
)
docs = loader.load()
import requests
from langchain_community.document_loaders import WebBaseLoader
# Sticky session: append session ID to username
SESSION_ID = "agent-task-001"
PROXY_USER = f"your_username-session-{SESSION_ID}"
PROXY_HOST = "gate.jibaoproxy.com"
PROXY_PORT = "10002"
proxy_url = f"http://{PROXY_USER}:your_password@{PROXY_HOST}:{PROXY_PORT}"
session = requests.Session()
session.proxies = {"http": proxy_url, "https": proxy_url}
loader = WebBaseLoader(
web_paths=["https://example.com/page/1", "https://example.com/page/2"],
session=session,
)
docs = loader.load()
import os
from langchain.tools import tool
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
@tool
def fetch_page(url: str) -> str:
"""Fetch a web page through a residential proxy."""
import requests
resp = requests.get(url, timeout=30)
resp.raise_for_status()
return resp.text[:8000]
AutoGPT পরিবেশ ভেরিয়েবল থেকে প্রক্সি কনফিগারেশন পড়ে। এগুলো আপনার .env ফাইলে যোগ করুন:
# .env - AutoGPT proxy configuration
HTTP_PROXY=http://your_username:[email protected]:10001
HTTPS_PROXY=http://your_username:[email protected]:10001
# Bypass proxy for LLM API calls
NO_PROXY=localhost,127.0.0.1,api.openai.com
# Rate limits (seconds between requests)
BROWSE_COOLDOWN=3
SEARCH_COOLDOWN=5
আপনি যদি Docker-এর মাধ্যমে AutoGPT চালান, তাহলে docker-compose.yml-এর মাধ্যমে ভেরিয়েবলগুলো পাস করুন:
services:
autogpt:
environment:
- HTTP_PROXY=http://user:[email protected]:10001
- HTTPS_PROXY=http://user:[email protected]:10001
- NO_PROXY=localhost,127.0.0.1,api.openai.com
NO_PROXY ভেরিয়েবল নিশ্চিত করে যে আপনার LLM প্রোভাইডারে API কল সরাসরি যায়। শুধু ওয়েব ব্রাউজিং ট্র্যাফিক প্রক্সি করা উচিত।
import os
# Configure proxy BEFORE importing CrewAI tools
os.environ["HTTP_PROXY"] = "http://user:[email protected]:10001"
os.environ["HTTPS_PROXY"] = "http://user:[email protected]:10001"
os.environ["NO_PROXY"] = "api.openai.com,api.anthropic.com"
from crewai import Agent, Task, Crew
from crewai_tools import ScrapeWebsiteTool, SerperDevTool
scrape_tool = ScrapeWebsiteTool()
search_tool = SerperDevTool()
researcher = Agent(
role="Market Researcher",
goal="Gather competitor pricing data from e-commerce sites",
tools=[scrape_tool, search_tool],
verbose=True,
)
task = Task(
description="Scrape pricing pages of the top 5 competitors",
agent=researcher,
expected_output="A comparison table of competitor prices",
)
crew = Crew(agents=[researcher], tasks=[task])
result = crew.kickoff()
টাস্কের মধ্যে IP রোটেট করুন, টাস্কের ভেতরে নয়। আপনার এজেন্ট যদি একটি সাইটে ৫-ধাপের একটি ওয়ার্কফ্লো করে, তাহলে পাঁচটি ধাপের জন্যই একটি sticky session ব্যবহার করুন। টাস্কের মাঝপথে IP বদলানো anti-fraud সিস্টেম ট্রিগার করে।
অথেন্টিকেশন flow-এর জন্য sticky session ব্যবহার করুন। login বা session cookie জড়িত যে কোনো ওয়ার্কফ্লোকে একই IP ধরে রাখতে হবে। IP-A-তে তৈরি একটি cookie IP-B থেকে এলে তা session hijacking-এর মতো দেখায়।
প্রক্সি রোটেশনসহ retry লজিক বাস্তবায়ন করুন:
import requests
from time import sleep
def fetch_with_retry(url, proxy_base, max_retries=3):
for attempt in range(max_retries):
proxy = f"http://user-session-{attempt}:pass@{proxy_base}"
try:
resp = requests.get(
url,
proxies={"http": proxy, "https": proxy},
timeout=30,
)
resp.raise_for_status()
return resp.text
except requests.exceptions.HTTPError:
sleep(2 ** attempt)
raise Exception(f"Failed after {max_retries} retries: {url}")
ব্যান্ডউইথ ব্যবহার পর্যবেক্ষণ করুন। Residential প্রক্সি GB অনুসারে বিল করে। একটি 10MB পেজে লুপ করা bug-যুক্ত একটি এজেন্ট দ্রুত বাজেট পুড়িয়ে ফেলতে পারে।
robots.txt সম্মান করুন। প্রক্সি আপনাকে যেকোনো কিছু অ্যাক্সেস করার ক্ষমতা দেয়। তার মানে এই নয় যে আপনার তা করা উচিত। robots.txt উপেক্ষা করা আইনি ঝুঁকি তৈরি করে এবং প্রক্সি IP রেঞ্জ ফ্ল্যাগ করিয়ে দেয়।
সুবিধার ভিত্তিতে নয়, টার্গেটের কঠিনতার ভিত্তিতে ট্র্যাফিক রুট করুন।
Datacenter প্রক্সি ($0.8/GB) এর জন্য: পাবলিক API, সরকারি পোর্টাল, একাডেমিক ডেটাবেস, নিউজ সাইট। এই টার্গেটগুলো খুব কমই anti-bot সিস্টেম ব্যবহার করে।
Residential প্রক্সি ($2/GB, ভলিউমসহ $5.50/GB পর্যন্ত) এর জন্য: ই-কমার্স প্ল্যাটফর্ম, সোশ্যাল মিডিয়া, সার্চ ইঞ্জিন, Cloudflare/Akamai-র পেছনের যেকোনো কিছু।
এই স্তরভিত্তিক পদ্ধতি সবকিছু residential দিয়ে রুট করার তুলনায় প্রক্সি খরচ ৬০–৮০% কমায়।
প্রতিশ্রুতিবদ্ধ হওয়ার আগে পরীক্ষা করুন। JIBAO Proxy সাইন-আপে 500MB ফ্রি ট্রাফিকসহ একটি ফ্রি ট্রায়াল দেয়—আপনার এজেন্ট পাইপলাইন যাচাই করার জন্য যথেষ্ট। নতুন অ্যাকাউন্টগুলো প্রথম ডিপোজিটে ১০০% বোনাসও পায়।
আপনার এজেন্ট ফ্রেমওয়ার্ক দিয়ে residential ও datacenter প্রক্সি পরীক্ষা করতে 500MB ফ্রি ট্রাফিক পান।
ফ্রি ট্রায়াল শুরু করুননতুন ব্যবহারকারীরা নিবন্ধনের সময় 500MB পান, সাথে প্রথম রিচার্জে বোনাস। সীমিত সময়ের অফার।