网络爬虫：Python+requests+re+xlwt爬取淘宝商品并把价格和名字写入Excel表格

作者：金裕麟雯茂俊佑 | 来源：互联网 | 2023-10-12 17:01

网络爬虫：Python+requests+re+xlwt爬取淘宝商品并把价格和名字写入Excel表格,Go语言社区,Golang程序员人脉社

由于学东西比较死，不够灵活，学校的acm实验室做算法题，打比赛，我是真的跟不上那些大佬...就看到人以前实验室退出的，加到其他实验室学习项目，做项目，做项目相对学习算法来说，没有那么烧脑，还能做出有趣的东西....我就想学习做项目，因为打比赛我是拿不到能看的成绩.....我们实验室的指导老师，也挺为大家考虑的，让喜欢打比赛的暑假集训，继续刷题，学习算法，还为了，一部分人开设了项目组，进行机器学习，网络爬虫.....哈哈，学了两个月的python，正好有一些基础，正好也想学习网络爬虫，首先得感谢mooc上面的北京理工大学嵩天等老师开设的 python程序设计，和网络爬虫课程，收益良多，起码能用python做点cf的题了，还学习了爬虫。。

在爬虫课程里面，模仿到嵩天老师的爬取淘宝的商品信息，价格和名字，然后自己改了一部分，增加了存入excel表的功能，然后增加提示，增加用户体验感，虽然说还是有很多不足，但是对于小白来说，有这个程度很开心了....

爬虫难点：需要对网页里面大量的网页代码里面找需要的信息，用正则表达式提取出来，正则表达式，表示很头疼...然后就是python基础能够是否灵活的运用，还有第三方库的用法。

首先：分析网页的搜索接口，以便我们通过自己的输入爬取对应的商品

可以发现搜索接口是：

https://s.taobao.com/search?q= （后面就是自己输入的商品名称在调用这个接口）

我们一般会爬取不止一页：所以需要翻页，可以有上面图片发现，每翻一页，最后的&s=（）是44的倍数，所以到时候翻页的时候，就for 循环用变量自动翻页。

这里分享一下这里自己的代码：仅供互相学习。

首先看下效果吧:

由于我是打包成可运行.exe文件的就直接运行：如果是用的idle或者其他编译器请在运行这份代码的路径下寻找excel表。

爬完后保存的是这个代码文件的位置打开后：

爬取成功也保存了进来了，还可以对照这淘宝上搜索一下花卉，发现都有的。说明爬取非常成功！

贴一份源代码供大家学习，切记爬取超大量数据！

import requests,re,xlwt
#获取页面
def getHtml(url):
    try:
        r=requests.get(url,timeout=30)
        r.raise_for_status()
        r.encoding=r.apparent_encoding
        print("请求服务器成功！n")
        return r.text
    except:
        print("请求失败")
    
#解析页面 正则表达式提取信息
def parsePage(ilt,html):
    try:
        plt=re.findall(r'"view_price":"[d.]*"',html)
        tlt=re.findall(r'"raw_title":".*?"',html)
        print("解析成功!n")
        for i in range(len(plt)):
            price=eval(plt[i].split(':')[1])
            title=eval(tlt[i].split(':')[1])
            ilt.append([price,title])
    except:
        print("解析失败!n")
    
#写入Excel
def Write_Excel(ilt):
  print("正在写入Exel表格....")
  #创建工作簿指定编码
  file=xlwt.Workbook(encoding='utf-8')
  #创建表
  table=file.add_sheet("淘宝商品信息")
  count=0
  #print(tplt.format("序号","价格","商品名称"))
  value=["序号","价格","商品名称"]
  for i in range(len(value)):
    table.write(count,i+1,value[i])
  for g in ilt:
      count+=1
      value=[count,float(g[0]),g[1][0:10]]
      for j in range(3):
          table.write(count,j+1,value[j])
      #Write_Excel(count,value=[g[0],g[1]],f=file)
  file.save("淘宝商品信息.xls")
  print("写入成功！")
      #print(tplt.format(count,g[0],g[1]))
#把数据写入Excel表
   
def main():
    goods=input("请输入需要爬取的淘宝商品名称：")
    #爬取的页面深度
    depth=int(input("请输入爬取的页面数量（建议不超过5页）："))
    start_url="https://s.taobao.com/search?q="+goods
    inforList=[]
    for i in range(depth):
        try:
            #翻页，起始页面s，在a起始页面上进行翻页
            url=start_url+'&s='+str(44*i)
            print("正在请求服务器商品链接第%d页，请稍等......"%(i+1))
            html=getHtml(url)
            print("正在解析第%d页，请稍等......"%(i+1))
            parsePage(inforList,html)
        except:
            continue
    Write_Excel(inforList)
    #printGoodsList(inforList)
main()

推荐阅读

blob
sklearn数据集库中的常用数据集类型介绍

本文介绍了sklearn数据集库中常用的数据集类型，包括玩具数据集和样本生成器。其中详细介绍了波士顿房价数据集，包含了波士顿506处房屋的13种不同特征以及房屋价格，适用于回归任务。 ... [详细]

蜡笔小新 2023-12-13 17:45:15
web
AJAX操作授权过期的全局处理方式

本文介绍了一种处理AJAX操作授权过期的全局方式，以解决Asp.net MVC中Session过期异常的问题。同时还介绍了基于WebImage的图片上传工具类。详细内容请参考链接：https://www.cnblogs.com/starluck/p/8284949.html ... [详细]

蜡笔小新 2023-12-11 19:17:35
copy
手把手教你使用GraphPad Prism和Excel绘制回归分析结果的森林图

本文介绍了使用GraphPad Prism和Excel绘制回归分析结果的森林图的方法。通过展示森林图，可以更加直观地将回归分析结果可视化。GraphPad Prism是一款专门为医学专业人士设计的绘图软件，同时也兼顾统计分析的功能，操作便捷，可以帮助科研人员轻松绘制出高质量的专业图形。文章以一篇发表在JACC杂志上的研究为例，利用其中的多因素回归分析结果来绘制森林图。通过本文的指导，读者可以学会如何使用GraphPad Prism和Excel绘制回归分析结果的森林图。 ... [详细]

蜡笔小新 2023-12-10 18:32:57
python
如何实现织梦DedeCms全站伪静态

本文介绍了如何通过修改织梦DedeCms源代码来实现全站伪静态，以提高管理和SEO效果。全站伪静态可以避免重复URL的问题，同时通过使用mod_rewrite伪静态模块和.htaccess正则表达式，可以更好地适应搜索引擎的需求。文章还提到了一些相关的技术和工具，如Ubuntu、qt编程、tomcat端口、爬虫、php request根目录等。 ... [详细]

蜡笔小新 2023-12-14 19:45:47
python
JavaScript疑难杂症系列相称性推断的知识点详解

本文详细解析了JavaScript中相称性推断的知识点，包括严厉相称和宽松相称的区别，以及范例转换的规则。针对不同类型的范例值，如差别范例值、统一类的原始范例值和统一类的复合范例值，都给出了具体的比较方法。对于宽松相称的情况，也解释了原始范例值和对象之间的比较规则。通过本文的学习，读者可以更好地理解JavaScript中相称性推断的概念和应用。 ... [详细]

蜡笔小新 2023-12-14 19:12:10
utf-8
Python3中选择文件对话框的格式打开和保存图片

本文介绍了在Python3中如何使用选择文件对话框的格式打开和保存图片的方法。通过使用tkinter库中的filedialog模块的asksaveasfilename和askopenfilename函数，可以方便地选择要打开或保存的图片文件，并进行相关操作。具体的代码示例和操作步骤也被提供。 ... [详细]

蜡笔小新 2023-12-14 17:46:55
string
Android开发笔记：使用Picasso加载网络图片等比例缩放

在Android开发中，使用Picasso库可以实现对网络图片的等比例缩放。本文介绍了使用Picasso库进行图片缩放的方法，并提供了具体的代码实现。通过获取图片的宽高，计算目标宽度和高度，并创建新图实现等比例缩放。 ... [详细]

蜡笔小新 2023-12-14 17:34:00
string
Java工具类库Hutool介绍及功能概述

本文介绍了Java工具类库Hutool，该工具包封装了对文件、流、加密解密、转码、正则、线程、XML等JDK方法的封装，并提供了各种Util工具类。同时，还介绍了Hutool的组件，包括动态代理、布隆过滤、缓存、定时任务等功能。该工具包可以简化Java代码，提高开发效率。 ... [详细]

蜡笔小新 2023-12-14 14:29:36
js
生成对抗式网络GAN及其衍生CGAN、DCGAN、WGAN、LSGAN、BEGAN介绍

一、GAN原理介绍学习GAN的第一篇论文当然由是IanGoodfellow于2014年发表的GenerativeAdversarialNetworks（论文下载链接arxiv：[h ... [详细]

蜡笔小新 2023-12-14 11:39:45
copy
PhysioNet生理信号处理（三）WFDB Toolbox for Matlab的安装和使用方法

本文介绍了PhysioNet网站提供的生理信号处理工具箱WFDB Toolbox for Matlab的安装和使用方法。通过下载并添加到Matlab路径中或直接在Matlab中输入相关内容，即可完成安装。该工具箱提供了一系列函数，可以方便地处理生理信号数据。详细的安装和使用方法可以参考本文内容。 ... [详细]

蜡笔小新 2023-12-13 20:46:48
window
无损压缩算法专题——LZSS算法实现

本文介绍了基于无损压缩算法专题的LZSS算法实现。通过Python和C两种语言的代码实现了对任意文件的压缩和解压功能。详细介绍了LZSS算法的原理和实现过程，以及代码中的注释。 ... [详细]

蜡笔小新 2023-12-13 19:47:31
web
高校天文共享平台开发过程中的思考与规划

本文介绍了高校天文共享平台的开发过程中的思考和规划。该平台旨在为高校学生提供天象预报、科普知识、观测活动、图片分享等功能。文章分析了项目的技术栈选择、网站前端布局、业务流程、数据库结构等方面，并总结了项目存在的问题，如前后端未分离、代码混乱等。作者表示希望通过记录和规划，能够理清思路，进一步完善该平台。 ... [详细]

蜡笔小新 2023-12-13 18:08:58
web
HTML学习02 图像标签的使用和属性

本文介绍了HTML中图像标签的使用和属性，包括定义图像、定义图像地图、使用源属性和替换文本属性。同时提供了相关实例和注意事项，帮助读者更好地理解和应用图像标签。 ... [详细]

蜡笔小新 2023-12-13 11:31:26
web
GPT-3发布，动动手指就能自动生成代码的神器来了！

近日，OpenAI发布了最新的NLP模型GPT-3，该模型在GitHub趋势榜上名列前茅。GPT-3使用的数据集容量达到45TB，参数个数高达1750亿，训练好的模型需要700G的硬盘空间来存储。一位开发者根据GPT-3模型上线了一个名为debuid的网站，用户只需用英语描述需求，前端代码就能自动生成。这个神奇的功能让许多程序员感到惊讶。去年，OpenAI在与世界冠军OG战队的表演赛中展示了他们的强化学习模型，在限定条件下以2:0完胜人类冠军。 ... [详细]

蜡笔小新 2023-12-11 11:04:43
python
Pandas 基础(3) - 生成 Dataframe 的几种方式总结

本文总结了使用不同方式生成 Dataframe 的方法，包括通过CSV文件、Excel文件、python dictionary、List of tuples和List of dictionary。同时介绍了一些注意事项，如使用绝对路径引入文件和安装xlrd包来读取Excel文件。 ... [详细]

蜡笔小新 2023-12-10 12:59:34

金裕麟雯茂俊佑

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章