抓不到数据先别急,看看 Scrapy 代理有没有真起作用
你写的 Scrapy 爬虫跑了一晚上,库里还是空的。第一反应通常是目标站反爬升级,或者 XPath 写错。这两种都有可能,但我遇到更多的是代理压根没生效:请求用本机 IP 直连出去,被封或者拿到假页面,你却在调选择器。这篇文章讲清楚代理在 Scrapy 里是怎么真正生效的,以及接入亿牛云动态转发代理时几个会咬人的细节。Scrapy 处理代理的两条路径Scrapy 不要求你写中间件才能用代理。内置的 HttpProxyMiddleware(默认优先级 750)会在下载阶段读取 request.meta['proxy'],把它交给底层的下载处理器。也就是说,只要请求的 meta 里带 proxy ...