目录
简单的爬虫架构:
网页下载器:
URL管理器:
网页解析器:
网页下载器requests:
发送requests请求:
接收requests请求:
requests操作实例:
负责通过URL将网页进行下载,主要是进行相应的伪装处理模拟浏览器访问、下载网页
负责URL的管理,包括带爬取和已爬取的URL、已经提供相应的接口函数(类似增删改查的函数)
负责网页信息的解析,这里是解析方式视具体需求来确定

Requests是一个优雅的,简单的Python HTTP库,常常用于爬虫对网页中的内容下载;
安装:pip install requests

requests.get/post(url,params,data,headers,timeout,verify,allow_redirects,cookies)
我们的爬虫会默认向服务器发送爬取请求,而一般情况下网站是不允许被爬虫访问的,输出的text信息中会出现抱歉,无法访问等。我通过更改User-Agent等可以实现网站请求。
r = requests.get/post(url)
我们用ipython进行简单的requests操作,先导入requests(import requests),然后我们以百度的url地址来进行访问(www.baidu.com)
![]()

上一篇:双子男是什么表情?
下一篇:多线程DPDK应用的内存优化