用单一IP做爬虫抓取,几千次请求之后就会触发429限速,接着是验证码,最后什么都拿不到。爬虫代理IP把请求分散到一个庞大的住宅IP池里,这个天花板就不存在了。
每一次请求看起来都像普通用户的正常访问,抓取任务能保持节奏,而不是卡在每个站点的第三页。
大多数网站是按IP地址统计请求量的。一台机器、一个IP,每分钟能用的请求配额很有限。抓取速度被访问过的最严格的站点卡死。
云服务商的IP段是公开的,反爬公司都订阅了这些名单。用便宜VPS抓取,第一页还没渲染完就已经被标记了。
搜索结果、价格、库存都会因国家和城市不同而变化。只从一个地点抓取,拿到的只是互联网的一个版本,而不是真实用户看到的版本。
我们的套餐不限制并发数。实际上限只取决于你自己的爬虫线程数量,以及你想对目标网站保持的访问频率礼貌度。
广度优先抓取多个域名时用轮换IP;如果站点通过会话cookie在多页间保持状态(比如分页搜索),就用保持会话。
按GB计费,用多少流量买多少,只抓HTML的话通常每页50-200KB,具体单价视套餐规模和地区而定,量越大单价越低。