一个菜鸡的大数据之路

一·语言方面:由于很多大数据框架都是基于JAVA开发的,个人认为JAVA语言是必不可少的,有余力的话可以去掌握以下PYTHON😊
二·数据结构与算法:大二课上没好好学,现在只能再补一遍了,悲😣打算刷完Leetcode的Hot100就先放一边,等秋招再刷别的题😇
三·MYSQL:一个关系型数据库管理系统,SQL BOY的开始,初步领略通过建表来管理数据的思想,学完可以去刷一下基础50题和进阶50题(虽然本菜鸡只刷了基础50😓)
四·Linux:会安装虚拟机,掌握常见linux常见命令即可
五·Hadoop:一个分布式计算框架。所谓分布式,就是将一台电脑无法处理的数据量分散给一个由多台电脑组成的计算机集群来处理,互相分工,彼此合作,形成一个有机整体。框架分为三部分:HDFS(数据存储),MapReduce(数据计算),Yarn(资源调度)。虽然MapReduce已经逐渐被Spark淘汰,但思想依然值得借鉴。高可用机制也应当学习
六·Maven:会用即可,打包项目用的
七·Hive:也是一种SQL,有了MYSQL的基础应该还算好理解
八·Scala和Spark:Spark是用Scala写的,在学习之前得先浏览一遍基本语法。Spark是基于内存的批式计算引擎,已经逐渐取代MapReduce(基于磁盘的计算引擎),APACHE也基本上停止了对MapReduce的更新(经典白学😃)。将来很多离线数仓项目也都是基于SPARK的,可以说非常重要了
九·Kafka,Hbase,Flume和ZooKeeper:都是一些小组件,将来面试可能会问到
十·Flink:一个流式实时计算引擎,本人JAVA基础较弱,听的时候也是懵懵懂懂

当然,仅仅这些肯定远远不够,本人将来还要学Doris,数仓建模理论,数仓项目,八股面经等等。上述理解如有错误还请友好指正(叠甲叠甲叠甲😱)。这些理论也只是匆匆过了一遍(大一太贪玩,大二2月份才开始学),发布笔记也只是记录自己的学习过程,提醒自己不要懈怠(还有当个免费网盘😏)。如果能帮助到你就更好了,虽然我也比较迷茫😖
全部评论
刚学完维度建模、hive、spark,接下来打算学Kafka、Doris、Flink这些,再补充一个数仓项目,希望秋招能找到工作
1 回复 分享
发布于 07-03 20:00 北京
哥,你是我的参考分向,不要断更啊
1 回复 分享
发布于 07-02 17:14 广东
接好运
1 回复 分享
发布于 07-02 17:13 广东

相关推荐

评论
2
3
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务