IP代理中间件和user-agent中间件的编写
作者:互联网
在制作爬虫的时候需要对我们的爬虫进行伪装,有两种伪装的方式:第一种是通过代理IP,第二种是通过修改user-agent。
一、代理IP
二、user-agent
import random # user agent 列表 USER_AGENT_LIST = [ 'MSIE (MSIE 6.0; X11; Linux; i686) Opera 7.23', 'Opera/9.20 (Macintosh; Intel Mac OS X; U; en)', 'Opera/9.0 (Macintosh; PPC Mac OS X; U; en)', 'iTunes/9.0.3 (Macintosh; U; Intel Mac OS X 10_6_2; en-ca)', 'Mozilla/4.76 [en_jp] (X11; U; SunOS 5.8 sun4u)', 'iTunes/4.2 (Macintosh; U; PPC Mac OS X 10.2)', 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:5.0) Gecko/20100101 Firefox/5.0', 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:9.0) Gecko/20100101 Firefox/9.0', 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.8; rv:16.0) Gecko/20120813 Firefox/16.0', 'Mozilla/4.77 [en] (X11; I; IRIX;64 6.5 IP30)', 'Mozilla/4.8 [en] (X11; U; SunOS; 5.7 sun4u)' ] # 随机生成user agent USER_AGENT = random.choice(USER_AGENT_LIST)
---------------------
注意事项:
1、中间件定义完要在settings文件内启用
2、爬虫文件名和爬虫名称不能相同,spider目录内不能存在相同爬虫名称的项目文件
3、做一个文明守法的好网民,不要爬取公民的隐私数据,不要给对方系统带来不必要的麻烦。
标签:en,Intel,IP,Mozilla,中间件,agent,Mac,OS,Macintosh 来源: http://blog.51cto.com/13870710/2349010