当前位置:   article > 正文

爬虫(四)requests模块_爬虫 requess

爬虫 requess

request模块处理cookie相关的请求

 

1 爬虫中使用cookie

        为了能够通过爬虫获取到登录后的页面,或者是解决通过cookie的反扒,需要使用request来处理cookie相关的请求

1.1 爬虫中使用cookie的利弊

  1. 带上cookie的好处

    • 能够访问登录后的页面
    • 能够实现部分反反爬
  2. 带上cookie的坏处

         一套cookie往往对应的是一个用户的信息,请求太频繁有更大的可能性被对方识别为爬虫

               那么上面的问题如何解决 ?   ------------------使用多个账号

 

1.2 requests处理cookie的方法

使用requests处理cookie有三种方法:

  1. cookie字符串放在headers中
  2. 把cookie字典放传给请求方法的cookies参数接收
  3. 使用requests提供的session模块

 

 

2 cookie添加在heades中

2.1 headers中cookie的位置

  • headers中的cookie:
    • 使用分号(;)隔开
    • 分号两边的类似a=b形式的表示一条cookie
    • a=b中,a表示键(name),b表示值(value)
    • 在headers中仅仅使用了cookie的name和value

2.2 cookie的具体组成的字段

由于headers中对cookie仅仅使用它的name和value,所以在代码中我们仅仅需要cookie的name和value即可

 

2.3 在headers中使用cookie

复制浏览器中的cookie到代码中使用

  1. headers = {
  2. "User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_4) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36",
  3. "Cookie":" Pycharm-26c2d973=dbb9b300-2483-478f-9f5a-16ca4580177e; Hm_lvt_98b9d8c2fd6608d564bf2ac2ae642948=1512607763; Pycharm-26c2d974=f645329f-338e-486c-82c2-29e2a0205c74; _xsrf=2|d1a3d8ea|c5b07851cbce048bd5453846445de19d|1522379036"}
  4. requests.get(url,headers=headers)

注意:

        cookie有过期时间 ,所以直接复制浏览器中的cookie可能意味着下一程序继续运行的时候需要替换代码中的cookie,对应的我们也可以通过一个程序专门来获取cookie供其他程序使用;当然也有很多网站的cookie过期时间很长,这种情况下,直接复制cookie来使用更加简单

 

 

3 使用cookies参数接收字典形式的cookie

  • cookies的形式:字典
cookies = {"cookie的name":"cookie的value"}
  • 使用方法:
requests.get(url,headers=headers,cookies=cookie_dict}

 

4 使用requests.session处理cookie

前面用手动的方式使用cookie,requests 提供了一个叫做session类,来实现客户端和服务端的会话保持

会话保持有两个内涵:

  • 保存cookie,下一次请求会带上前一次的cookie
  • 实现和服务端的长连接,加快请求速度

4.1 使用方法

  1. session = requests.session()
  2. response = session.get(url,headers)

session实例在请求了一个网站后,对方服务器设置在本地的cookie会保存在session中,下一次再使用session请求对方服务器的时候,会带上前一次的cookie

4.2 动手练习:

动手尝试使用session来登录人人网: http://www.renren.com/PLogin.do (先不考虑这个url地址从何而来),请求体的格式:{"email":"username", "password":"password"}

思路分析

  1. 准备url地址和请求参数
  2. 构造session发送post请求
  3. 使用session请求个人主页,观察是否请求成功

 

以上对requests的cookie相关处理进行了介绍,下面看一下requests模块的其他方法:

1 requests中cookieJar的处理方法

        使用request获取的resposne对象,具有cookies属性,能获取对方服务器设置在本地的cookie,如何使用这些cookie呢?

1.1 方法介绍

  1. response.cookies是CookieJar类型
  2. 使用requests.utils.dict_from_cookiejar,能够实现把cookiejar对象转化为字典

1.2 方法展示

  1. import requests
  2. url = "http://www.baidu.com"
  3. #发送请求,获取resposne
  4. response = requests.get(url)
  5. print(type(response.cookies))
  6. #使用方法从cookiejar中提取数据
  7. cookies = requests.utils.dict_from_cookiejar(response.cookies)
  8. print(cookies)

输出为:

  1. <class 'requests.cookies.RequestsCookieJar'>
  2. {'BDORZ': '27315'}

注意:

        在前面的requests的session类中,我们不需要处理cookie的任何细节,如果有需要,我们可以使用上述方法来解决

 

2 requests处理证书错误

经常我们在网上冲浪时,经常能够看到下面的提示:

出现这个问题的原因是:ssl的证书不安全导致

2.1 代码中发起请求的效果

那么如果在代码中请求会怎么样呢?

  1. import requests
  2. url = "https://www.12306.cn/mormhweb/"
  3. response = requests.get(url)

返回证书错误,如下:

ssl.CertificateError ...

2.2 解决方案

为了在代码中能够正常的请求,我们修改添加一个参数

  1. import requests
  2. url = "https://www.12306.cn/mormhweb/"
  3. response = requests.get(url,verify=False)

 

3 超时参数的使用

        在平时网上冲浪的过程中,我们经常会遇到网络波动,这个时候,一个请求等了很久可能任然没有结果

        在爬虫中,一个请求很久没有结果,就会让整个项目的效率变得非常低,这个时候我们就需要对请求进行强制要求,让他必须在特定的时间内返回结果,否则就报错。 

3.1 超时参数使用方法如下:

response = requests.get(url,timeout=3)

通过添加timeout参数,能够保证在3秒钟内返回响应,否则会报错

注意:

        这个方法还能够拿来检测代理ip的质量,如果一个代理ip在很长时间没有响应,那么添加超时之后也会报错,对应的这个ip就可以从代理ip池中删除

 

4 retrying模块的使用

        使用超时参数能够加快我们整体的请求速度,但是在正常的网页浏览过成功,如果发生速度很慢的情况,我们会做的选择是刷新页面,那么在代码中,我们是否也可以刷新请求呢?

        对应的,retrying模块就可以帮助我们解决

 

4.1 retrying模块的使用

retrying模块的地址:https://pypi.org/project/retrying/

retrying 模块的使用

  1. 使用retrying模块提供的retry模块
  2. 通过装饰器的方式使用,让被装饰的函数反复执行
  3. retry中可以传入参数stop_max_attempt_number,让函数报错后继续重新执行,达到最大执行次数的上限,如果每次都报错,整个函数报错,如果中间有一个成功,程序继续往后执行

 

4.2 retrying和requests的简单封装

实现一个发送请求的函数,每次爬虫中直接调用该函数即可实现发送请求,在其中

  • 使用timeout实现超时报错
  • 使用retrying模块实现重试

代码参考:

  1. # parse.py
  2. import requests
  3. from retrying import retry
  4. headers = {}
  5. #最大重试3次,3次全部报错,才会报错
  6. @retry(stop_max_attempt_number=3)
  7. def _parse_url(url)
  8. #超时的时候回报错并重试
  9. response = requests.get(url, headers=headers, timeout=3)
  10. #状态码不是200,也会报错并重试
  11. assert response.status_code == 200
  12. return response
  13. def parse_url(url)
  14. try: #进行异常捕获
  15. response = _parse_url(url)
  16. except Exception as e:
  17. print(e)
  18. #报错返回None
  19. response = None
  20. return response

 

 

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/AllinToyou/article/detail/384409
推荐阅读
  

闽ICP备14008679号