大数据学习——Hadoop第一天
2024-09-08 09:18:28
1.1 什么是HADOOP
- HADOOP是apache旗下的一套开源软件平台
- HADOOP提供的功能:利用服务器集群,根据用户的自定义业务逻辑,对海量数据进行分布式处理
- HADOOP的核心组件有
- HDFS(分布式文件系统)
- YARN(运算资源调度系统)
- MAPREDUCE(分布式运算编程框架)
- 广义上来说,HADOOP通常是指一个更广泛的概念——HADOOP生态圈
国内外HADOOP应用案例介绍
1、HADOOP应用于数据服务基础平台建设
2、/HADOOP用于用户画像
3、HADOOP用于网站点击流日志数据挖掘
金融行业: 个人征信分析
证券行业: 投资模型分析
交通行业: 车辆、路况监控分析
电信行业:用户上网行为分析
...
总之:hadoop并不会跟某种具体的行业或者某个具体的业务挂钩,它只是一种用来做海量数据分析处理的工具
HADOOP生态圈以及各组成部分的简介
重点组件:
HDFS:分布式文件系统
MAPREDUCE:分布式运算程序开发框架
HIVE:基于大数据技术(文件系统+运算框架)的SQL数据仓库工具
HBASE:基于HADOOP的分布式海量数据库
ZOOKEEPER:分布式协调服务基础组件
Mahout:基于mapreduce/spark/flink等分布式运算框架的机器学习算法库
Oozie:工作流调度框架
Sqoop:数据导入导出工具
Flume:日志数据采集框架
最新文章
- Android 启动后页面跳转
- C/C++面试知识点总结
- ZabbixCPU温度监视-Centos
- iNeedle日志下载功能问题
- 【leetcode】Scramble String
- python some install tips
- Hadoop2.2.0 手动切换HA环境搭建
- [改善Java代码]不要覆写静态方法
- String 转Clob
- 我也谈javascript正则匹配
- Docker网络——单host网络
- Python--开发简单爬虫
- C#模拟POST表单提交 --- WebClient
- webpack通过postcss-loader添加浏览器前缀
- POJ3301 Texas Trip 计算几何、随机化贪心
- Selenium 获取文本信息方法+select(定位)
- jmeter --自动化badboy脚本开发技术
- [转载][翻译]Go的50坑:新Golang开发者要注意的陷阱、技巧和常见错误[2]
- PCB直角走线的影响
- Oracle中实现dblink的作法