当前位置: 开发笔记 > 编程语言 > 正文

python怎么爬取电影海报_Python爬虫“王者”：豆瓣海报爬取

作者：-Dear-xi | 来源：互联网 | 2023-07-14 15:24

我这里就以女神王祖贤的海报来作为例子。翻页分析在豆瓣电影中搜索“王祖贤”，进入王祖贤主页后，点击全部影人图片，进入到影人图片页面。在该页面

我这里就以女神王祖贤的海报来作为例子。

翻页分析

在豆瓣电影中搜索“王祖贤”，进入王祖贤主页后，点击全部影人图片，进入到影人图片页面。

在该页面点击下一页，可以看到浏览器的 URL 变化如下：

https://movie.douban.com/celebrity/1166896/photos/?type=C&start=30&sortby=like&size=a&subtype=a

继续使用 Postman 来分析 URL，可以很轻松的得知，start 就是类似于 page 的页数控制参数，而且步长为 30，即第一页是 start = 0，第二页为 start = 30，第三页为 start = 60，以此类推。

详情页分析

使用 Network 来查看页面上的图片信息：

这里我们得到了两个信息：

a 标签中的链接可以得到每张图片的评论信息；

img 标签中的链接可以用来保存女神的海报。

对于这两个信息 url，可以分别返回：

&＃39;&＃39;&＃39;

更多Python学习资料以及源码教程资料，可以在群821460695 免费获取

&＃39;&＃39;&＃39;

def get_posters():

comment_url_list = []

picture_list = []

for i in range(0, 40000, 30):

url = &＃39;https://movie.douban.com/celebrity/1166896/photos/?type=C&start=%s&sortby=like&size=a&subtype=a&＃39; % str(i)

req = requests.get(url).text

cOntent= BeautifulSoup(req, "html.parser")

chekc_point = content.find(&＃39;span&＃39;, attrs={&＃39;class&＃39;: &＃39;next&＃39;}).find(&＃39;a&＃39;)

if chekc_point != None:

data = content.find_all(&＃39;div&＃39;, attrs={&＃39;class&＃39;: &＃39;cover&＃39;})

for k in data:

ulist = k.find(&＃39;a&＃39;)[&＃39;href&＃39;]

plist = k.find(&＃39;img&＃39;)[&＃39;src&＃39;]

comment_url_list.append(ulist)

picture_list.append(plist)

else:

break

return comment_url_list, picture_list

之后，就可以下载海报了。

评论获取

然后我们手动跳转到每周海报的详情页面，继续查看评论信息。

通过 BeautifulSoup 可以很容易地获得评论信息，然后保存到 MongoDB 中。

def get_comment(comment_l):

client = pymongo.MongoClient(&＃39;mongodb://douban:douban1989@ds149744.mlab.com:49744/douban&＃39;)

db = client.douban

mongo_collection = db.comment

comment_list = []

comment = []

print("Save to MongoDB")

for i in comment_l:

respOnse= requests.get(i).text

cOntent= BeautifulSoup(response, "html.parser")

tmp_list = content.find_all(&＃39;div&＃39;, attrs={&＃39;class&＃39;: &＃39;comment-item&＃39;})

comment_list = comment_list + tmp_list

for k in comment_list:

tmp_comment = k.find(&＃39;p&＃39;).text

mongo_collection.insert_one({&＃39;comment&＃39;: tmp_comment})

comment.append(tmp_comment)

print("Save Finish!")

推荐阅读

post
爬虫python需要什么软件Python爬虫需要学习那些东西？

基础爬虫过程基础的爬虫其实很简单的，主要过程就是：发送请求，并获取响应数据；解析响应数据，获取想要的那部分 ... [详细]

蜡笔小新 2023-10-11 14:01:35
get
Python爬取小姐姐内衣信息，寻找妹纸们的偏好

今天继续来分析爬虫数据分析文章，一起来看看网易严选商品评论的获取和分析。警告：本教程仅用作学习交流，请勿用作商业盈利，违者后果自负！如本文有侵犯任何组织集团 ... [详细]

蜡笔小新 2023-10-12 09:52:28
php
如何实现织梦DedeCms全站伪静态

本文介绍了如何通过修改织梦DedeCms源代码来实现全站伪静态，以提高管理和SEO效果。全站伪静态可以避免重复URL的问题，同时通过使用mod_rewrite伪静态模块和.htaccess正则表达式，可以更好地适应搜索引擎的需求。文章还提到了一些相关的技术和工具，如Ubuntu、qt编程、tomcat端口、爬虫、php request根目录等。 ... [详细]

蜡笔小新 2023-12-14 19:45:47
php
Java实战之电影在线观看系统的实现

本文介绍了Java实战之电影在线观看系统的实现过程。首先对项目进行了简述，然后展示了系统的效果图。接着介绍了系统的核心代码，包括后台用户管理控制器、电影管理控制器和前台电影控制器。最后对项目的环境配置和使用的技术进行了说明，包括JSP、Spring、SpringMVC、MyBatis、html、css、JavaScript、JQuery、Ajax、layui和maven等。 ... [详细]

蜡笔小新 2023-12-14 15:52:03
php
Python瓦片图下载、合并、绘图、标记的代码示例

本文提供了Python瓦片图下载、合并、绘图、标记的代码示例，包括下载代码、多线程下载、图像处理等功能。通过参考geoserver，使用PIL、cv2、numpy、gdal、osr等库实现了瓦片图的下载、合并、绘图和标记功能。代码示例详细介绍了各个功能的实现方法，供读者参考使用。 ... [详细]

蜡笔小新 2023-12-13 12:14:55
php
使用正则表达式爬取36Kr网站首页新闻的操作步骤和代码示例

本文介绍了使用正则表达式来爬取36Kr网站首页所有新闻的操作步骤和代码示例。通过访问网站、查找关键词、编写代码等步骤，可以获取到网站首页的新闻数据。代码示例使用Python编写，并使用正则表达式来提取所需的数据。详细的操作步骤和代码示例可以参考本文内容。 ... [详细]

蜡笔小新 2023-12-12 19:16:21
get
django视图函数的使用方法

本文介绍了django中视图函数的使用方法，包括如何接收Web请求并返回Web响应，以及如何处理GET请求和POST请求。同时还介绍了urls.py和views.py文件的配置方式。 ... [详细]

蜡笔小新 2023-12-12 16:02:59
post
Android实战——jsoup实现网络爬虫，糗事百科项目的起步

本文介绍了Android实战中使用jsoup实现网络爬虫的方法，以糗事百科项目为例。对于初学者来说，数据源的缺乏是做项目的最大烦恼之一。本文讲述了如何使用网络爬虫获取数据，并以糗事百科作为练手项目。同时，提到了使用jsoup需要结合前端基础知识，以及如果学过JS的话可以更轻松地使用该框架。 ... [详细]

蜡笔小新 2023-12-11 09:19:45
post
layui表格分页不生效怎么办

web前端|Layui教程layuiweb前端-Layui教程小程序实例源码,ubuntuip切换,tomcat默认端改为80,爬虫完整源码,微信小程序php接口,seo专业培训班 ... [详细]

蜡笔小新 2023-10-17 12:00:22
post
SAP接口编程PyRFC 调用 BAPI_FIXEDASSET_CREATE1创建固定资产

本篇演示通过PyRFC调用BAPI_FIXEDASSET_CREATE1在SAP系统中创建固定资产，再一次体验一下Python与其它语言相比的简洁性。首先简单说明B ... [详细]

蜡笔小新 2023-10-15 16:46:39
config
config设置源使用pip_最全的 pip 使用指南，50 % 你可能都没用过~

所有的Python开发者都清楚，Python之所以如此受欢迎，能够在众多高级语言中，脱颖而出，除了语法简单，上 ... [详细]

蜡笔小新 2023-09-25 17:03:35
process
SpringMVC接收请求参数的方式总结

本文总结了在SpringMVC开发中处理控制器参数的各种方式，包括处理使用@RequestParam注解的参数、MultipartFile类型参数和Simple类型参数的RequestParamMethodArgumentResolver，处理@RequestBody注解的参数的RequestResponseBodyMethodProcessor，以及PathVariableMapMethodArgumentResol等子类。 ... [详细]

蜡笔小新 2023-12-11 19:55:40
post
JavaWeb中读取文件资源的路径问题及解决方法

在JavaWeb开发中，读取文件资源的路径是一个常见的问题。本文介绍了使用绝对路径和相对路径两种方法来解决这个问题，并给出了相应的代码示例。同时，还讨论了使用绝对路径的优缺点，以及如何正确使用相对路径来读取文件。通过本文的学习，读者可以掌握在JavaWeb中正确找到和读取文件资源的方法。 ... [详细]

蜡笔小新 2023-12-10 19:49:18
post
python打卡记录去重_Python零基础学习笔记与记录之一（了解Python这个小伙伴）

本人学习笔记，知识点均摘自于网络，用于学习和交流(如未注明出处，请提醒，将及时更正，谢谢)OS:我学习是为了上 ... [详细]

蜡笔小新 2023-10-17 16:05:58
post
开发笔记:常用#免费%代理IP库&整理*收藏——实时@更新（大概）

篇首语：本文由编程笔记#小编为大家整理，主要介绍了常用#免费%代理IP库&整理*收藏——实时@更新（大概）相关的知识，希望对你有一定的参考价值。 ... [详细]

蜡笔小新 2023-10-17 13:34:54

-Dear-xi

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章