热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

超出最大递归深度.多处理和bs4

如何解决《超出最大递归深度.多处理和bs4》经验,为你挑选了1个好方法。

我正在尝试使解析器使用beautifulSoup和多处理.我有一个错误:

RecursionError:超出最大递归深度

我的代码是:

import bs4, requests, time
from multiprocessing.pool import Pool

html = requests.get('https://www.avito.ru/moskva/avtomobili/bmw/x6?sgtd=5&radius=0')
soup = bs4.BeautifulSoup(html.text, "html.parser")

divList = soup.find_all("div", {'class': 'item_table-header'})


def new_check():
    with Pool() as pool:
        pool.map(get_info, divList)

def get_info(each):
   pass

if __name__ == '__main__':
    new_check()

为什么我会收到此错误以及如何解决?

更新: 错误的所有文本是

Traceback (most recent call last):
  File "C:/Users/eugen/PycharmProjects/avito/main.py", line 73, in  new_check()
  File "C:/Users/eugen/PycharmProjects/avito/main.py", line 67, in new_check
    pool.map(get_info, divList)
  File "C:\Users\eugen\AppData\Local\Programs\Python\Python36\lib\multiprocessing\pool.py", line 266, in map
    return self._map_async(func, iterable, mapstar, chunksize).get()
  File "C:\Users\eugen\AppData\Local\Programs\Python\Python36\lib\multiprocessing\pool.py", line 644, in get
    raise self._value
  File "C:\Users\eugen\AppData\Local\Programs\Python\Python36\lib\multiprocessing\pool.py", line 424, in _handle_tasks
    put(task)
  File "C:\Users\eugen\AppData\Local\Programs\Python\Python36\lib\multiprocessing\connection.py", line 206, in send
    self._send_bytes(_ForkingPickler.dumps(obj))
  File "C:\Users\eugen\AppData\Local\Programs\Python\Python36\lib\multiprocessing\reduction.py", line 51, in dumps
    cls(buf, protocol).dump(obj)
RecursionError: maximum recursion depth exceeded

abarnert.. 8

当您使用时multiprocessing,您传递给工人的所有东西都必须被腌制.

不幸的是,许多BeautifulSoup树木无法腌制.


这有几个不同的原因.其中一些是已修复的错误,所以你可以尝试确保你有最新的bs4版本,有些是特定于不同的解析器或树构建器......但是这样的事情很有可能对这有帮助.

但根本问题是树中的许多元素都包含对树的其余部分的引用.

偶尔,这会导致实际的无限循环,因为循环引用对于其循环引用检测来说太间接.但这通常是一个被修复的错误.

但是,更重要的是,即使循环不是无限的,它仍然可以拖动来自树的其余部分的1000多个元素,这已经足以导致了RecursionError.

我认为后者就是这里发生的事情.如果我拿你的代码并尝试腌制divList[0],它就会失败.(如果我将递归限制上升并计算帧数,它需要23080的深度,这是超过默认值1000的方式.)但如果我完全相同div并分别解析它,它成功没有问题.


所以,一种可能性就是做sys.setrecursionlimit(25000).这将解决这个确切页面的问题,但稍微不同的页面可能需要甚至更多.(另外,它通常不是一个好主意来设置递归限制高,与其说是因为浪费的内存,但因为这意味着实际的无限循环的时间需要25倍和25个之多浪费资源,来检测.)


另一个技巧是编写"修剪树"的代码,在你腌制它之前消除div中的任何向上链接.这是一个很好的解决方案,除了它可能需要做很多工作,并且需要深入了解BeautifulSoup如何工作的内部,我怀疑你想做什么.


最简单的解决方法是有点笨重,但是......你可以将汤转换为字符串,将其传递给孩子,并让孩子重新解析它:

def new_check():
    divTexts = [str(div) for div in divList]
    with Pool() as pool:
        pool.map(get_info, divTexts)

def get_info(each):
    div = BeautifulSoup(each, 'html.parser')

if __name__ == '__main__':
    new_check()

这样做的性能成本可能并不重要; 更大的担心是,如果你有不完美的HTML,转换为字符串并重新解析它可能不是一个完美的往返.因此,我建议您先进行一些测试,不要先进行多处理,以确保不影响结果.



1> abarnert..:

当您使用时multiprocessing,您传递给工人的所有东西都必须被腌制.

不幸的是,许多BeautifulSoup树木无法腌制.


这有几个不同的原因.其中一些是已修复的错误,所以你可以尝试确保你有最新的bs4版本,有些是特定于不同的解析器或树构建器......但是这样的事情很有可能对这有帮助.

但根本问题是树中的许多元素都包含对树的其余部分的引用.

偶尔,这会导致实际的无限循环,因为循环引用对于其循环引用检测来说太间接.但这通常是一个被修复的错误.

但是,更重要的是,即使循环不是无限的,它仍然可以拖动来自树的其余部分的1000多个元素,这已经足以导致了RecursionError.

我认为后者就是这里发生的事情.如果我拿你的代码并尝试腌制divList[0],它就会失败.(如果我将递归限制上升并计算帧数,它需要23080的深度,这是超过默认值1000的方式.)但如果我完全相同div并分别解析它,它成功没有问题.


所以,一种可能性就是做sys.setrecursionlimit(25000).这将解决这个确切页面的问题,但稍微不同的页面可能需要甚至更多.(另外,它通常不是一个好主意来设置递归限制高,与其说是因为浪费的内存,但因为这意味着实际的无限循环的时间需要25倍和25个之多浪费资源,来检测.)


另一个技巧是编写"修剪树"的代码,在你腌制它之前消除div中的任何向上链接.这是一个很好的解决方案,除了它可能需要做很多工作,并且需要深入了解BeautifulSoup如何工作的内部,我怀疑你想做什么.


最简单的解决方法是有点笨重,但是......你可以将汤转换为字符串,将其传递给孩子,并让孩子重新解析它:

def new_check():
    divTexts = [str(div) for div in divList]
    with Pool() as pool:
        pool.map(get_info, divTexts)

def get_info(each):
    div = BeautifulSoup(each, 'html.parser')

if __name__ == '__main__':
    new_check()

这样做的性能成本可能并不重要; 更大的担心是,如果你有不完美的HTML,转换为字符串并重新解析它可能不是一个完美的往返.因此,我建议您先进行一些测试,不要先进行多处理,以确保不影响结果.


推荐阅读
  • Python瓦片图下载、合并、绘图、标记的代码示例
    本文提供了Python瓦片图下载、合并、绘图、标记的代码示例,包括下载代码、多线程下载、图像处理等功能。通过参考geoserver,使用PIL、cv2、numpy、gdal、osr等库实现了瓦片图的下载、合并、绘图和标记功能。代码示例详细介绍了各个功能的实现方法,供读者参考使用。 ... [详细]
  • Spring源码解密之默认标签的解析方式分析
    本文分析了Spring源码解密中默认标签的解析方式。通过对命名空间的判断,区分默认命名空间和自定义命名空间,并采用不同的解析方式。其中,bean标签的解析最为复杂和重要。 ... [详细]
  • 向QTextEdit拖放文件的方法及实现步骤
    本文介绍了在使用QTextEdit时如何实现拖放文件的功能,包括相关的方法和实现步骤。通过重写dragEnterEvent和dropEvent函数,并结合QMimeData和QUrl等类,可以轻松实现向QTextEdit拖放文件的功能。详细的代码实现和说明可以参考本文提供的示例代码。 ... [详细]
  • Linux重启网络命令实例及关机和重启示例教程
    本文介绍了Linux系统中重启网络命令的实例,以及使用不同方式关机和重启系统的示例教程。包括使用图形界面和控制台访问系统的方法,以及使用shutdown命令进行系统关机和重启的句法和用法。 ... [详细]
  • 开发笔记:加密&json&StringIO模块&BytesIO模块
    篇首语:本文由编程笔记#小编为大家整理,主要介绍了加密&json&StringIO模块&BytesIO模块相关的知识,希望对你有一定的参考价值。一、加密加密 ... [详细]
  • CSS3选择器的使用方法详解,提高Web开发效率和精准度
    本文详细介绍了CSS3新增的选择器方法,包括属性选择器的使用。通过CSS3选择器,可以提高Web开发的效率和精准度,使得查找元素更加方便和快捷。同时,本文还对属性选择器的各种用法进行了详细解释,并给出了相应的代码示例。通过学习本文,读者可以更好地掌握CSS3选择器的使用方法,提升自己的Web开发能力。 ... [详细]
  • android listview OnItemClickListener失效原因
    最近在做listview时发现OnItemClickListener失效的问题,经过查找发现是因为button的原因。不仅listitem中存在button会影响OnItemClickListener事件的失效,还会导致单击后listview每个item的背景改变,使得item中的所有有关焦点的事件都失效。本文给出了一个范例来说明这种情况,并提供了解决方法。 ... [详细]
  • 本文讨论了一个关于cuowu类的问题,作者在使用cuowu类时遇到了错误提示和使用AdjustmentListener的问题。文章提供了16个解决方案,并给出了两个可能导致错误的原因。 ... [详细]
  • 本文介绍了计算机网络的定义和通信流程,包括客户端编译文件、二进制转换、三层路由设备等。同时,还介绍了计算机网络中常用的关键词,如MAC地址和IP地址。 ... [详细]
  • ASP.NET2.0数据教程之十四:使用FormView的模板
    本文介绍了在ASP.NET 2.0中使用FormView控件来实现自定义的显示外观,与GridView和DetailsView不同,FormView使用模板来呈现,可以实现不规则的外观呈现。同时还介绍了TemplateField的用法和FormView与DetailsView的区别。 ... [详细]
  • 使用正则表达式爬取36Kr网站首页新闻的操作步骤和代码示例
    本文介绍了使用正则表达式来爬取36Kr网站首页所有新闻的操作步骤和代码示例。通过访问网站、查找关键词、编写代码等步骤,可以获取到网站首页的新闻数据。代码示例使用Python编写,并使用正则表达式来提取所需的数据。详细的操作步骤和代码示例可以参考本文内容。 ... [详细]
  • 使用圣杯布局模式实现网站首页的内容布局
    本文介绍了使用圣杯布局模式实现网站首页的内容布局的方法,包括HTML部分代码和实例。同时还提供了公司新闻、最新产品、关于我们、联系我们等页面的布局示例。商品展示区包括了车里子和农家生态土鸡蛋等产品的价格信息。 ... [详细]
  • 超级简单加解密工具的方案和功能
    本文介绍了一个超级简单的加解密工具的方案和功能。该工具可以读取文件头,并根据特定长度进行加密,加密后将加密部分写入源文件。同时,该工具也支持解密操作。加密和解密过程是可逆的。本文还提到了一些相关的功能和使用方法,并给出了Python代码示例。 ... [详细]
  • Java容器中的compareto方法排序原理解析
    本文从源码解析Java容器中的compareto方法的排序原理,讲解了在使用数组存储数据时的限制以及存储效率的问题。同时提到了Redis的五大数据结构和list、set等知识点,回忆了作者大学时代的Java学习经历。文章以作者做的思维导图作为目录,展示了整个讲解过程。 ... [详细]
  • 导出功能protectedvoidbtnExport(objectsender,EventArgse){用来打开下载窗口stringfileName中 ... [详细]
author-avatar
可爱的伊比2324767445hMkK
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有