|
|
发表于 2015-11-4 16:52:59
|
显示全部楼层
" q% j; q; ^2 [" {. o2 i( K
量不大的话,楼下 @阿百川 兄弟说的是正解
" N( ~1 T" J. O3 f6 ` G否则你肯定会碰上RobotCheck,或者0或空字段
% D4 N* y0 g. t Y: T* U: |/ l但API的限制我没记错的话是1秒,大数据级的话基本是会把自己憋屈死的
2 d: t0 |& H9 T# h5 ^# x6 U+ D, D9 ~: F
我这边因为同时为客户跑非常多的爬虫,常规有一个大概2万的匿名代理池,一般有客户要爬东西,直接先上代理池大并发,如果不行再仔细研究网站和其他方法,如果每一个网站都仔细研究他们反爬技术的话,会累死的,呵呵+ r' L* a( f8 L' R$ l3 O# A
: r s1 F! @) W8 P5 I@李小冲 说的方法如果你没试过也一定要试一下,能减少很大工作量
3 I8 x3 J3 `1 }7 u; @, X; x" P( b' E8 b
通常来说,爬一个网站之前,先看这三点:有没有API, 有没有Mobile站,有没有sitemap,吃过无数次亏的血泪经验,哈 |
|