Amazon Scraping Proxies: Mga Presyo, Buy Box at Robot Check (2026)

Na-publish noong 12 Hunyo 2026 · ≈8 min na pagbasa

Ang Amazon ay isang gintong mina para sa price-monitoring at product-research at isa sa pinaka-agresibong ipinagtatanggol na site sa web. I-scrape mo ito mula sa datacenter IP at makikita mo ang mga CAPTCHA, ang "Robot Check" na pader, mga umiikot na presyo, o isang 503 sa loob ng iilang request. Sinasaklaw ng gabay na ito kung ano ang tsinetsek ng Amazon, ang proxy strategy na nakakaligtas dito, at ang session discipline na pinapanatiling tumpak ang prices at Buy Box data.

Ano ang Dinedetect ng Amazon

Residential, na May Marketplace-Matched Geo

Ang datacenter proxies ay isang patay na kalsada sa Amazon sa anumang totoong volume — ang residential exits na may malinis na ASN ang nagpapanatili nito. Kasinghalaga: itugma ang exit country sa marketplace na sini-scrape mo. Ang pagkuha ng amazon.de prices sa pamamagitan ng US exit ay nagbibigay sa iyo ng US pricing, currency at Buy Box, na tahimik na sumisira sa dataset mo. Isang exit geography bawat marketplace.

Sticky Sessions para sa Tumpak na Presyo

Pinepersonalize ng Amazon ayon sa session — ang add-to-cart, delivery location, at price tests ay nasa cookies lahat. Kung iikutin mo ang IP sa bawat request, palagi mong nire-reset ang context na iyon at makakakuha ka ng hindi pare-parehong presyo at Buy Box winners. Hawakan ang isang sticky session para sa buong scrape ng isang produkto, pagkatapos ay umikot sa product o task boundary:

import itertools, time, random
from curl_cffi import requests

PROXIES = ["socks5h://USERNAME:[email protected]:913", "..."]
pool = itertools.cycle(PROXIES)

def scrape_product(asin, proxy):
    # Same sticky exit for every page of this product
    s = requests.Session(impersonate="chrome",
                         proxies={"http": proxy, "https": proxy})
    detail = s.get(f"https://www.amazon.com/dp/{asin}")
    offers = s.get(f"https://www.amazon.com/gp/offer-listing/{asin}")
    return detail.text, offers.text

for asin in asins:
    proxy = next(pool)                 # new sticky exit per product
    if "Robot Check" in scrape_product(asin, proxy)[0]:
        # flagged - back off, rotate, retry on a fresh exit
        ...
    time.sleep(random.uniform(2.0, 5.0))

Rate-Limit Bawat Exit at Mag-Back Off

Tulad sa Google SERP scraping, ang disiplinang nagpapanatili sa iyong buhay ay ang per-exit rate, hindi ang laki ng pool. I-randomize ang mga gap, limitahan ang concurrency bawat IP, at kapag nakita mo ang "Robot Check" o isang 503, ihinto ang pagtama sa exit na iyon at mag-back off — ang muling pagtama sa isang naka-flag na IP ay nagpapahaba lang ng block.

Huwag Magpatong ng Python Fingerprint

Ang isang simpleng requests call ay nagpapadala ng JA3 na nagmamarka sa iyo bilang automation bago pa man mag-apply ang IP score. Magpadala ng browser fingerprint gamit ang curl_cffi (sa itaas) o isang totoong browser — tingnan ang Bypass TLS Fingerprinting with curl_cffi. Kung magtapon ang Amazon ng JS CAPTCHA wall, mag-escalate sa isang totoong browser engine.

Checklist

Para sa lahat ng IP products · napakalaking pool ng nodes na available anumang oras

Magrehistro ngayon at makakuha ng hanggang 100% na rebate sa iyong recharge

Ang mga bagong user ay makakatanggap ng 500MB sa pagrehistro, kasama ang bonus sa unang recharge. Limitadong oras lang ang alok.