热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

requests模块(三、cookie相关的请求及其他高级用法)

目录requess模块处理cookie相关内容1爬虫中使用cookie1.1爬虫中使用cookie的利弊1.2requests处理cookie的方法2cookie添加在heades



目录

  • requess模块处理COOKIE相关内容
    • 1 爬虫中使用COOKIE
      • 1.1 爬虫中使用COOKIE的利弊
      • 1.2 requests处理COOKIE的方法
    • 2 COOKIE添加在heades中
      • 2.1 headers中COOKIE的位置
      • 2.2 COOKIE的具体组成的字段
      • 2.3 在headers中使用COOKIE
    • 3 使用COOKIEs参数接收字典形式的COOKIE
    • 4 使用requests.session处理COOKIE
      • 4.1 使用方法
  • requests模块的其他方法
    • 1 requests中cookirJar的处理方法
      • 1.1 方法介绍
      • 1.2 方法展示
    • 2 requests处理证书错误
      • 2.1 代码中发起请求的效果
      • 2.2 解决方案
    • 3 超时参数的使用
      • 3.1 超时参数使用方法如下:
    • 4 retrying模块的使用
      • 4.1 retrying模块的使用
      • 4.2 retrying和requests的简单封装


requess模块处理COOKIE相关内容


1 爬虫中使用COOKIE


为了能够通过爬虫获取到登录后的页面,或者是解决通过COOKIE的反扒,需要使用request来处理COOKIE相关的请求



1.1 爬虫中使用COOKIE的利弊



  1. 带上COOKIE的好处

    • 能够访问登录后的页面

    • 能够实现部分反反爬



  2. 带上COOKIE的坏处

    • 一套COOKIE往往对应的是一个用户的信息,请求太频繁有更大的可能性被对方识别为爬虫

    • 那么上面的问题如何解决 ?使用多个账号




1.2 requests处理COOKIE的方法

使用requests处理COOKIE有三种方法:



  1. COOKIE字符串放在headers中

  2. 把COOKIE字典放传给请求方法的COOKIEs参数接收

  3. 使用requests提供的session模块


2 COOKIE添加在heades中


2.1 headers中COOKIE的位置

在这里插入图片描述


2.2 COOKIE的具体组成的字段

在这里插入图片描述

由于headers中对COOKIE仅仅使用它的name和value,所以在代码中我们仅仅需要COOKIE的name和value即可


2.3 在headers中使用COOKIE

复制浏览器中的COOKIE到代码中使用

headers = {
"User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_4) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36",
"COOKIE":" Pycharm-26c2d973=dbb9b300-2483-478f-9f5a-16ca4580177e; Hm_lvt_98b9d8c2fd6608d564bf2ac2ae642948=1512607763; Pycharm-26c2d974=f645329f-338e-486c-82c2-29e2a0205c74; _xsrf=2|d1a3d8ea|c5b07851cbce048bd5453846445de19d|1522379036"}
requests.get(url,headers=headers)

注意:

COOKIE有过期时间 ,所以直接复制浏览器中的COOKIE可能意味着下一程序继续运行的时候需要替换代码中的COOKIE,对应的我们也可以通过一个程序专门来获取COOKIE供其他程序使用;当然也有很多网站的COOKIE过期时间很长,这种情况下,直接复制COOKIE来使用更加简单


3 使用COOKIEs参数接收字典形式的COOKIE



  • COOKIEs的形式:字典

COOKIEs = {"COOKIE的name":"COOKIE的value"}


  • 使用方法:

requests.get(url,headers=headers,COOKIEs=COOKIE_dict}

4 使用requests.session处理COOKIE


前面使用手动的方式使用COOKIE,那么有没有更好的方法在requets中处理COOKIE呢?


requests 提供了一个叫做session类,来实现客户端和服务端的会话保持

会话保持有两个内涵:



  • 保存COOKIE,下一次请求会带上前一次的COOKIE

  • 实现和服务端的长连接,加快请求速度


4.1 使用方法

session = requests.session()
respOnse= session.get(url,headers)

session实例在请求了一个网站后,对方服务器设置在本地的COOKIE会保存在session中,下一次再使用session请求对方服务器的时候,会带上前一次的COOKIE


requests模块的其他方法


1 requests中cookirJar的处理方法


使用request获取的resposne对象,具有COOKIEs属性,能够获取对方服务器设置在本地的COOKIE,但是如何使用这些COOKIE呢?



1.1 方法介绍



  1. response.COOKIEs是COOKIEJar类型

  2. 使用requests.utils.dict_from_COOKIEjar,能够实现把COOKIEjar对象转化为字典


1.2 方法展示

import requests
url = "http://www.baidu.com"
#发送请求,获取resposne
respOnse= requests.get(url)
print(type(response.COOKIEs))
#使用方法从COOKIEjar中提取数据
COOKIEs = requests.utils.dict_from_COOKIEjar(response.COOKIEs)
print(COOKIEs)

输出为:


{'BDORZ': '27315'}

注意:

在前面的requests的session类中,我们不需要处理COOKIE的任何细节,如果有需要,我们可以使用上述方法来解决


2 requests处理证书错误


经常我们在网上冲浪时,经常能够看到下面的提示:


在这里插入图片描述

出现这个问题的原因是:ssl的证书不安全导致


2.1 代码中发起请求的效果

如果在代码中请求会显示如下效果?

import requests
url = "https://www.12306.cn/mormhweb/"
respOnse= requests.get(url)

返回证书错误,如下:

ssl.CertificateError ...

2.2 解决方案

为了在代码中能够正常的请求,我们修改添加一个参数:verify=False

import requests
url = "https://www.12306.cn/mormhweb/"
respOnse= requests.get(url,verify=False)

3 超时参数的使用


在平时网上冲浪的过程中,我们经常会遇到网络波动,这个时候,一个请求等了很久可能任然没有结果



在爬虫中,一个请求很久没有结果,就会让整个项目的效率变得非常低,这个时候我们就需要对请求进行强制要求,让他必须在特定的时间内返回结果,否则就报错



3.1 超时参数使用方法如下:

respOnse= requests.get(url,timeout=3)

通过添加timeout参数,能够保证在3秒钟内返回响应,否则会报错

注意:

这个方法还能够拿来检测代理ip的质量,如果一个代理ip在很长时间没有响应,那么添加超时之后也会报错,对应的这个ip就可以从代理ip池中删除


4 retrying模块的使用


使用超时参数能够加快我们整体的请求速度,但是在正常的网页浏览过成功,如果发生速度很慢的情况,我们会做的选择是刷新页面,那么在代码中,我们是否也可以刷新请求呢?


对应的,retrying模块就可以帮助我们解决


4.1 retrying模块的使用



  • retrying模块的地址:https://pypi.org/project/retrying/

  • retrying 模块的使用

    1. 使用retrying模块提供的retry模块

    2. 通过装饰器的方式使用,让被装饰的函数反复执行

    3. retry中可以传入参数stop_max_attempt_number,让函数报错后继续重新执行,达到最大执行次数的 上限,如果每次都报错,整个函数报错,如果中间有一个成功,程序继续往后执行




4.2 retrying和requests的简单封装

实现一个发送请求的函数,每次爬虫中直接调用该函数即可实现发送请求,在其中



  • 使用timeout实现超时报错

  • 使用retrying模块实现重试

代码参考:

# parse.py
import requests
from retrying import retry
headers = {}
#最大重试3次,3次全部报错,才会报错
@retry(stop_max_attempt_number=3)
def _parse_url(url)
#超时的时候回报错并重试
respOnse= requests.get(url, headers=headers, timeout=3)
#状态码不是200,也会报错并重试
assert response.status_code == 200
return response
def parse_url(url)
try: #进行异常捕获
respOnse= _parse_url(url)
except Exception as e:
print(e)
#报错返回None
respOnse= None
return response


推荐阅读
  • 一.常见基于身份识别进行反爬1通过headers字段来反爬headers中有很多字段,这些字段都有可能会被对方服务器拿过来进行判断是否为爬虫1.1通过headers中的User-A ... [详细]
  • Python瓦片图下载、合并、绘图、标记的代码示例
    本文提供了Python瓦片图下载、合并、绘图、标记的代码示例,包括下载代码、多线程下载、图像处理等功能。通过参考geoserver,使用PIL、cv2、numpy、gdal、osr等库实现了瓦片图的下载、合并、绘图和标记功能。代码示例详细介绍了各个功能的实现方法,供读者参考使用。 ... [详细]
  • 浏览器如何工作(How browsers work)的阅读笔记
    浏览器如何工作(Howbrowserswork)的阅读笔记1.整体结构完整的浏览器整体框架的发改如下:UI:就是那些我们常常 ... [详细]
  • 这是原文链接:sendingformdata许多情况下,我们使用表单发送数据到服务器。服务器处理数据并返回响应给用户。这看起来很简单,但是 ... [详细]
  • HTML学习02 图像标签的使用和属性
    本文介绍了HTML中图像标签的使用和属性,包括定义图像、定义图像地图、使用源属性和替换文本属性。同时提供了相关实例和注意事项,帮助读者更好地理解和应用图像标签。 ... [详细]
  • WebSocket与Socket.io的理解
    WebSocketprotocol是HTML5一种新的协议。它的最大特点就是,服务器可以主动向客户端推送信息,客户端也可以主动向服务器发送信息,是真正的双向平等对话,属于服务器推送 ... [详细]
  • 使用正则表达式爬取36Kr网站首页新闻的操作步骤和代码示例
    本文介绍了使用正则表达式来爬取36Kr网站首页所有新闻的操作步骤和代码示例。通过访问网站、查找关键词、编写代码等步骤,可以获取到网站首页的新闻数据。代码示例使用Python编写,并使用正则表达式来提取所需的数据。详细的操作步骤和代码示例可以参考本文内容。 ... [详细]
  • 本文介绍了响应式页面的概念和实现方式,包括针对不同终端制作特定页面和制作一个页面适应不同终端的显示。分析了两种实现方式的优缺点,提出了选择方案的建议。同时,对于响应式页面的需求和背景进行了讨论,解释了为什么需要响应式页面。 ... [详细]
  • 如何在php文件中添加图片?
    本文详细解答了如何在php文件中添加图片的问题,包括插入图片的代码、使用PHPword在载入模板中插入图片的方法,以及使用gd库生成不同类型的图像文件的示例。同时还介绍了如何生成一个正方形文件的步骤。希望对大家有所帮助。 ... [详细]
  • 本文由编程笔记#小编为大家整理,主要介绍了markdown[软件代理设置]相关的知识,希望对你有一定的参考价值。 ... [详细]
  • XMLhttpREquest_Ajax技术总结之XmlHttpRequest
    Ajax1、 什么是ajax   ... [详细]
  • 找到JDK下载URL当然去官网找了。目前最新的1.8的下载URL(RPM)如下:http:download.oracle.comotn-pubjavajdk8u161-b122f3 ... [详细]
  • Java大文件HTTP断点续传到服务器该怎么做?
    最近由于笔者所在的研发集团产品需要,需要支持高性能的大文件http上传,并且要求支持http断点续传。这里在简要归纳一下,方便记忆 ... [详细]
  • 第一种<script>$(".eq").on(&qu ... [详细]
  • IamgettingaUnicodeerror:UnicodeEncodeError:charmapcodeccantencodecharacteru\xa9in ... [详细]
author-avatar
奋斗中DU_536
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有