问

python - scrapy 如何爬取网页里面的thunder链接？

Gemini强强Gemini 发布于 2022-10-28 00:51

目标url：
http://www.xiaopian.com/html/...

这个是chrome里显示的源代码

这个是scrapy shell url后用response.css().extract()显示东西

我想知道为何二者不一致？scrapy爬取到的信息并没有对应的thunder链接，而是明面上的ftp链接

1 个回答

爬虫看网页源代码应该是右键>查看网页源代码. 而不是在审查元素里,这里看到的代码都经过了js渲染,和原始代码不同了,而通过爬虫得到的代码是没经过js渲染的,也就是原始代码.
我看了下,这个迅雷下载地址是js算出来的

具体代码如下:
```
function ThunderEncode(t_url) {
    var thunderPrefix = "AA";
    var thunderPosix = "ZZ";
    var thunderTitle = "thunder://";

    var thunderUrl = thunderTitle + base64encode(utf16to8(thunderPrefix + t_url + thunderPosix));

    return thunderUrl;
}
```
测试了下:
把地址 ftp://a:a@dygod18.com:21/[电影天堂www.dy2018.com]忍者神龟2破影而出BD中英双字.rmvb 作为参数传入就得到了迅雷连接,但和网页上的不太一样,反编后它是把汉字进行了url编码,只要编码统一,就不会有问题了.
2022-10-29 11:16 回答

w康d

撰写答案

今天，你开发时遇到什么问题呢？

热门标签

PHP1.CN | 中国最专业的PHP中文社区 | PNG素材下载 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved

京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区版权所有