热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Hortonworks,快速上手Hadoop的套件

最近我在思考的一件事情:如何帮助团队SQL开发快速掌握大数据相关技术呢?面对疯狂暴涨的数据,SQLServer存储成本越来越高了ÿ

最近我在思考的一件事情:如何帮助团队 SQL 开发快速掌握大数据相关技术呢?面对疯狂暴涨的数据,SQL Server 存储成本越来越高了,日志的增长量也极大超过预期,隔三差五总有空间不足导致的应用异常。而且各种多样化的查询需求,在海量数据环境中,响应也越发慢了。

打开Google ,开始琢磨起来,找到两个工具: HDP, CDH.

Hortonwork Hadoop 与 Cloudera Hadoop 是两大 Hadoop 实施商。

Cloudera 是老牌的 Hadoop 供应商,除了定制化的 Hadoop 还提供培训以及支持。

Hortonworks 是新兴的 Hadoop 供应商,与 Cloudear 最大的不同,他是免费的。但同样也提供培训与支持,培训与支持是收费的。

https://www.springpeople.com/blog/hortonworks-or-cloudera-which-one-is-better

文章针对 hortonworks hadoop(HDP) , Cloudera hadoop(CDH) 的优缺点做了详细的阐述,给我们选型 Hadoop 供应商提供了参考

之所以对 Hortonworks 的 Hadoop 进行研究,纯碎是因为它开源。因为你研究透了它,你自己就可以定制 Hadoop 套件,成立自己的大数据咨询公司,这么想,是不是有些许动心了呢?

Hortonworks 旨在用 Apache 开源组件搭建 Hadoop 平台,这些组件都是属于 Apache 旗下,全部开源。包括三大产品: Horton Data Platform, HDP;Apache Ambai ; SmartSense

Hortonworks Hadoop 提供了VMWare, Virtual box 以及 Docker 容器等快速安装的镜像,这些镜像基于单个节点,用来快速体验 HDP 的使用,这是台一体机,下载的文件后缀名是.ova. 这才是本文的重点。完完全全从一个扣 SQL 的开发者,摇身一变,操盘 10 个亿的大数据工程师。这段时间不会超过 2 小时!

就看你 In Or Not , 来不来?下载地址在这里,只帮你到这儿了:

https://hortonworks.com/downloads/#data-platform

这不是替他们打广告,我不持有他们公司的任何股票!

介绍这款软件,来源于曾经的一个失败的想法:我想用 http://asp.net 搭建一个学习环境,让所有的使用者都可以在不用安装 SQL Server 环境下就可以学会 SQL。基于种种原因,这个项目破产了。而如今有这么好的资源,可以帮大家快速上手大数据的学习,我当然愿意推荐了!

回到正题,我们来走一遍 Hortonworks Hadoop 的玩法。

在整个不到 2 小时的使用中,我大概体验了这些操作:

1 在 Hive 中创建表
2 学会了 Hive 基本的 DML 语句,比如: SELECT, WHERE,GROUP BY, SORT,Join
3 使用 Pig Latin1, 做了一次 ETL 的实现

比起纯粹使用 Apache Hadoop, Hive 来构建分布式系统, 使用套件可以更形象的帮我们建立直观感受,加深对概念的理解。

在 HDP 中,Ambari 是作为开发者与 Hadoop 底层交互的界面,非常友好,拿出一照片,领略下界面的风格(保证看了之后,想自己开公司做咨询的,至少在底层封装方向上,可以放弃了):

这是 HDP 的 Dashboard, 通过它我们可以连接到其他组件的控制台,比如 HDFS, Hive, Pig, Spark 等

Hive 作为分布式数据仓库,在支持 SQL 基本语法的同时,帮我们开发者封装了 MapReduce 底层编程实现,使得我们不需要重复开发 Java 程序来实现常见的数据库操作,亦可操作 T/P/E 级的数据量。

1 我们只需要在 Ambari 中找到 Hive 2 View 就可以像 SQL Server Management Studio 管理SQL Server 一样来操作 Hive.

如此清晰的编辑界面,简洁的 SQL 风格,SQL 开发者们可谓分分钟上手

2 使用 Pig 实现 ETL: 我们平时用的最多的ETL 工具,有 SSIS, Informatic 等, 而在大数据环境下,使用 Pig Latin 一样可以实现 ETL 的功能。遇上特别复杂的计算,Pig 还可以扩展,调用 Java, Python 的方法。

是不是够简单,想要跃跃欲试,超级方便,下载他的一体机打开运行即可!

唯一的条件,内存要超级强悍,我的内存 8G, 大家看图感受下我当时的心情。

本文转载自:https://blog.csdn.net/wujiandao/article/details/80558759

转:https://www.cnblogs.com/wpcnblog/p/10974409.html



推荐阅读
  • 一、Hadoop来历Hadoop的思想来源于Google在做搜索引擎的时候出现一个很大的问题就是这么多网页我如何才能以最快的速度来搜索到,由于这个问题Google发明 ... [详细]
  • 本文介绍了数据库的存储结构及其重要性,强调了关系数据库范例中将逻辑存储与物理存储分开的必要性。通过逻辑结构和物理结构的分离,可以实现对物理存储的重新组织和数据库的迁移,而应用程序不会察觉到任何更改。文章还展示了Oracle数据库的逻辑结构和物理结构,并介绍了表空间的概念和作用。 ... [详细]
  • Linux如何安装Mongodb的详细步骤和注意事项
    本文介绍了Linux如何安装Mongodb的详细步骤和注意事项,同时介绍了Mongodb的特点和优势。Mongodb是一个开源的数据库,适用于各种规模的企业和各类应用程序。它具有灵活的数据模式和高性能的数据读写操作,能够提高企业的敏捷性和可扩展性。文章还提供了Mongodb的下载安装包地址。 ... [详细]
  • mac php错误日志配置方法及错误级别修改
    本文介绍了在mac环境下配置php错误日志的方法,包括修改php.ini文件和httpd.conf文件的操作步骤。同时还介绍了如何修改错误级别,以及相应的错误级别参考链接。 ... [详细]
  • 如何实现织梦DedeCms全站伪静态
    本文介绍了如何通过修改织梦DedeCms源代码来实现全站伪静态,以提高管理和SEO效果。全站伪静态可以避免重复URL的问题,同时通过使用mod_rewrite伪静态模块和.htaccess正则表达式,可以更好地适应搜索引擎的需求。文章还提到了一些相关的技术和工具,如Ubuntu、qt编程、tomcat端口、爬虫、php request根目录等。 ... [详细]
  • 本文详细介绍了SQL日志收缩的方法,包括截断日志和删除不需要的旧日志记录。通过备份日志和使用DBCC SHRINKFILE命令可以实现日志的收缩。同时,还介绍了截断日志的原理和注意事项,包括不能截断事务日志的活动部分和MinLSN的确定方法。通过本文的方法,可以有效减小逻辑日志的大小,提高数据库的性能。 ... [详细]
  • 推荐一个ASP的内容管理框架(ASP Nuke)的优势和适用场景
    本文推荐了一个ASP的内容管理框架ASP Nuke,并介绍了其主要功能和特点。ASP Nuke支持文章新闻管理、投票、论坛等主要内容,并可以自定义模块。最新版本为0.8,虽然目前仍处于Alpha状态,但作者表示会继续更新完善。文章还分析了使用ASP的原因,包括ASP相对较小、易于部署和较简单等优势,适用于建立门户、网站的组织和小公司等场景。 ... [详细]
  • 在说Hibernate映射前,我们先来了解下对象关系映射ORM。ORM的实现思想就是将关系数据库中表的数据映射成对象,以对象的形式展现。这样开发人员就可以把对数据库的操作转化为对 ... [详细]
  • 本文介绍了使用postman进行接口测试的方法,以测试用户管理模块为例。首先需要下载并安装postman,然后创建基本的请求并填写用户名密码进行登录测试。接下来可以进行用户查询和新增的测试。在新增时,可以进行异常测试,包括用户名超长和输入特殊字符的情况。通过测试发现后台没有对参数长度和特殊字符进行检查和过滤。 ... [详细]
  • 本文详细介绍了MysqlDump和mysqldump进行全库备份的相关知识,包括备份命令的使用方法、my.cnf配置文件的设置、binlog日志的位置指定、增量恢复的方式以及适用于innodb引擎和myisam引擎的备份方法。对于需要进行数据库备份的用户来说,本文提供了一些有价值的参考内容。 ... [详细]
  • 使用Ubuntu中的Python获取浏览器历史记录原文: ... [详细]
  • 本文介绍了Perl的测试框架Test::Base,它是一个数据驱动的测试框架,可以自动进行单元测试,省去手工编写测试程序的麻烦。与Test::More完全兼容,使用方法简单。以plural函数为例,展示了Test::Base的使用方法。 ... [详细]
  • mysql-cluster集群sql节点高可用keepalived的故障处理过程
    本文描述了mysql-cluster集群sql节点高可用keepalived的故障处理过程,包括故障发生时间、故障描述、故障分析等内容。根据keepalived的日志分析,发现bogus VRRP packet received on eth0 !!!等错误信息,进而导致vip地址失效,使得mysql-cluster的api无法访问。针对这个问题,本文提供了相应的解决方案。 ... [详细]
  • 解决nginx启动报错epoll_wait() reported that client prematurely closed connection的方法
    本文介绍了解决nginx启动报错epoll_wait() reported that client prematurely closed connection的方法,包括检查location配置是否正确、pass_proxy是否需要加“/”等。同时,还介绍了修改nginx的error.log日志级别为debug,以便查看详细日志信息。 ... [详细]
  • 本文介绍了sqlserver云存储和本地存储的区别,云存储是将数据存储在网络上,方便查看和调用;本地存储是将数据存储在电脑磁盘上,只能在存储的电脑上查看。同时提供了几种启动sqlserver的方法。此外,还介绍了如何导出数据库的步骤和工具。 ... [详细]
author-avatar
Re__my_雨言栋
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有