热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

爬虫:在网易财经抓取表格数据案例

(1)数据网址获取网易财经和新浪财经等网站的数据可以免费获取,我们可以使用爬虫方法(通过rvest包)抓取相应网站的表格数据,我们首先以在网易财经中抓取600550在2019年第3

1)数据网址获取

网易财经和新浪财经等网站的数据可以免费获取,我们可以使用爬虫方法(通过rvest包)抓取相应网站的表格数据,我们首先以在网易财经中抓取600550在2019年第3季度的数据为例,其网址为:

http://quotes.money.163.com/trade/lsjysj_600550.html?year=2019&season=3,

可以看到不同时间段的网址是有规律的,只需要更改其中的股票代码和year、season就可以进行多个股票的循环网页抓取。

2)网络表格数据节点获取

我们需要解析网页表格数据的节点,除了系统性地掌握网页设计原理和基本结构,还可以通过FireFox(Firebug插件)、Chrome浏览器来对网页结构进行解析得到相应的分支结构点,这里我们使用Firefox浏览器,具体操作为在找到我们需要的表格位置后(关于如何找到表格位置请自行探索),右键点击复制XPath路径。

表格部分的XPath为/html/body/div[2]/div[4]/table[1]。

技术分享图片

 

 

3)抓取单个股票的单个页面数据 

 


library(rvest)
symbol
=600550
year
=2019
season
=3
url
=paste0("http://quotes.money.163.com/trade/lsjysj_",symbol,".html?year=",year,"&season=",season)
web
=read_html(url)
xpath
="/html/body/div[2]/div[4]/table[1]"
web.table
=web%>%html_nodes(xpath=xpath)%>%html_table()

 

此时的web.table就是爬取到的数据

4)抓取单个股票的多个页面数据并合并


library(lubridate)
symbol
=600550
from="2001-05-28"
from=as.Date(from)
to
=Sys.Date()
time.index
=seq(from=from,to=to,by="quarter")#生成以季度为开始的时间序列
year.id=year(time.index)#获取年份
quarter.id=quarter(time.index)#获取季度

price
=list()
for(t in 1:length(time.index)){
year
=year.id[t]
season
=quarter.id[t]
url
=paste0("http://quotes.money.163.com/trade/lsjysj_",symbol,".html?year=",year,"&season=",season)
web
=read_html(url)
xpath
="/html/body/div[2]/div[4]/table[1]"
web.table
=web%>%html_nodes(xpath=xpath)%>%html_table()
web.table
=web.table[[1]][-1,]
price[[t]]
=web.table
}

5)抓取多个股票的多个页面数据并合并


get.wangyi.stock=function(symbol,from,to){
from=as.Date(from)
to
=as.Date(to)
if(mday(from==1)){
from=from-1
}
time.index
=seq(from=from,to=to,by="quarter")
year.id
=year(time.index)
quarter.id
=quarter(time.index)
prices
=list()
for(t in 1:length(time.index)){
year
=year.id[t]
season
=quarter.id[t] url=paste0("http://quotes.money.163.com/trade/lsjysj_",symbol,".html?year=",year,"&season=",season)
web
=read_html(url)
xpath
="/html/body/div[2]/div[4]/table[1]"
web.table
=web%>%html_nodes(xpath=xpath)%>%html_table()
web.table
=web.table[[1]][-1,]
prices[[t]]
=web.table
}
}
to
=Sys.Date()
stock.index
=matrix(nrow=6,ncol=2)
stock.index[,
1]=c("600550.ss","600192.ss","600152.ss","600644.ss","600885.ss","600151.ss")
stock.index[,
2]=c("2017-05-28","2017-05-28","2017-05-28","2017-05-28","2017-05-28","2017-05-28")
for(i in nrow(stock.index)){
symbol
=stock.index[i,1]
from=stock.index[i,2]
prices
=get.wangyi.stock(symbol,from,to)
filenames
=paste0("D://dataset//",symbol,".csv")
}

6)读取所有A股数据

我们还可以将所有的A股代码整理为一个文件,读取后即可以实现对所有A股股票数据进行实时更新,可以通过这种方法来建立自己的数据库进行实时分析。同时通过网络爬虫,我们还可以爬取很多有意义的数据,并进行实时更新。

 


推荐阅读
  • 知识图谱——机器大脑中的知识库
    本文介绍了知识图谱在机器大脑中的应用,以及搜索引擎在知识图谱方面的发展。以谷歌知识图谱为例,说明了知识图谱的智能化特点。通过搜索引擎用户可以获取更加智能化的答案,如搜索关键词"Marie Curie",会得到居里夫人的详细信息以及与之相关的历史人物。知识图谱的出现引起了搜索引擎行业的变革,不仅美国的微软必应,中国的百度、搜狗等搜索引擎公司也纷纷推出了自己的知识图谱。 ... [详细]
  • Java验证码——kaptcha的使用配置及样式
    本文介绍了如何使用kaptcha库来实现Java验证码的配置和样式设置,包括pom.xml的依赖配置和web.xml中servlet的配置。 ... [详细]
  • 基于layUI的图片上传前预览功能的2种实现方式
    本文介绍了基于layUI的图片上传前预览功能的两种实现方式:一种是使用blob+FileReader,另一种是使用layUI自带的参数。通过选择文件后点击文件名,在页面中间弹窗内预览图片。其中,layUI自带的参数实现了图片预览功能。该功能依赖于layUI的上传模块,并使用了blob和FileReader来读取本地文件并获取图像的base64编码。点击文件名时会执行See()函数。摘要长度为169字。 ... [详细]
  • 本文介绍了使用Java实现大数乘法的分治算法,包括输入数据的处理、普通大数乘法的结果和Karatsuba大数乘法的结果。通过改变long类型可以适应不同范围的大数乘法计算。 ... [详细]
  • 本文介绍了在SpringBoot中集成thymeleaf前端模版的配置步骤,包括在application.properties配置文件中添加thymeleaf的配置信息,引入thymeleaf的jar包,以及创建PageController并添加index方法。 ... [详细]
  • 本文讲述了作者通过点火测试男友的性格和承受能力,以考验婚姻问题。作者故意不安慰男友并再次点火,观察他的反应。这个行为是善意的玩人,旨在了解男友的性格和避免婚姻问题。 ... [详细]
  • 本文详细介绍了Linux中进程控制块PCBtask_struct结构体的结构和作用,包括进程状态、进程号、待处理信号、进程地址空间、调度标志、锁深度、基本时间片、调度策略以及内存管理信息等方面的内容。阅读本文可以更加深入地了解Linux进程管理的原理和机制。 ... [详细]
  • 1,关于死锁的理解死锁,我们可以简单的理解为是两个线程同时使用同一资源,两个线程又得不到相应的资源而造成永无相互等待的情况。 2,模拟死锁背景介绍:我们创建一个朋友 ... [详细]
  • 后台获取视图对应的字符串
    1.帮助类后台获取视图对应的字符串publicclassViewHelper{将View输出为字符串(注:不会执行对应的ac ... [详细]
  • 《数据结构》学习笔记3——串匹配算法性能评估
    本文主要讨论串匹配算法的性能评估,包括模式匹配、字符种类数量、算法复杂度等内容。通过借助C++中的头文件和库,可以实现对串的匹配操作。其中蛮力算法的复杂度为O(m*n),通过随机取出长度为m的子串作为模式P,在文本T中进行匹配,统计平均复杂度。对于成功和失败的匹配分别进行测试,分析其平均复杂度。详情请参考相关学习资源。 ... [详细]
  • 本文介绍了通过ABAP开发往外网发邮件的需求,并提供了配置和代码整理的资料。其中包括了配置SAP邮件服务器的步骤和ABAP写发送邮件代码的过程。通过RZ10配置参数和icm/server_port_1的设定,可以实现向Sap User和外部邮件发送邮件的功能。希望对需要的开发人员有帮助。摘要长度:184字。 ... [详细]
  • 动态规划算法的基本步骤及最长递增子序列问题详解
    本文详细介绍了动态规划算法的基本步骤,包括划分阶段、选择状态、决策和状态转移方程,并以最长递增子序列问题为例进行了详细解析。动态规划算法的有效性依赖于问题本身所具有的最优子结构性质和子问题重叠性质。通过将子问题的解保存在一个表中,在以后尽可能多地利用这些子问题的解,从而提高算法的效率。 ... [详细]
  • 高质量SQL书写的30条建议
    本文提供了30条关于优化SQL的建议,包括避免使用select *,使用具体字段,以及使用limit 1等。这些建议是基于实际开发经验总结出来的,旨在帮助读者优化SQL查询。 ... [详细]
  • 本文介绍了指针的概念以及在函数调用时使用指针作为参数的情况。指针存放的是变量的地址,通过指针可以修改指针所指的变量的值。然而,如果想要修改指针的指向,就需要使用指针的引用。文章还通过一个简单的示例代码解释了指针的引用的使用方法,并思考了在修改指针的指向后,取指针的输出结果。 ... [详细]
  • 猜字母游戏
    猜字母游戏猜字母游戏——设计数据结构猜字母游戏——设计程序结构猜字母游戏——实现字母生成方法猜字母游戏——实现字母检测方法猜字母游戏——实现主方法1猜字母游戏——设计数据结构1.1 ... [详细]
author-avatar
淘气小顽童刘
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有