活了二十多年,没能为祖国、为人民做点什么,每思及此,伤心欲绝 !

 分类:大数据

分享一份大数据教程资源(内含文档和视频)

分享一份大数据教程资源(内含文档和视频)
来吧,这个是传智播客的大数据视频资料,包括每一天的文档和视频。 这个是文档,大部分人应该都是想要文档,除了没有基础的新手,而不想要视频,因为看视频真的太花时间啦。 获取方法:关注公众号:Java大数据与数据仓库,回复"大数据",即可获得这份很全的文档。 视频...

柯广 21小时前 45℃ 0评论 0喜欢

Flink之Watermark详解

Flink之Watermark详解
在上一篇文章中我们介绍了窗口相关的内容,那么问题来了,比如公司组织春游,规定周六早晨8:00 ~ 8:30清查人数,人齐则发车出发,可是总有那么个同学会睡懒觉迟到,这时候通常也会等待20分钟,但是不能一直等下去,如果到了20分钟则认为,想自己在家过周末,不参与春游活动了,不会继续...

柯广 2周前 (04-01) 482℃ 0评论 6喜欢

彻底搞清Flink中的Window机制

彻底搞清Flink中的Window机制
关注公众号:Java大数据与数据仓库,回复 "资料",领取大数据资料,学习大数据技术。 窗口 在流处理应用中,数据是连续不断的,因此我们不可能等到所有数据都到了才开始处理。当然我们可以每来一个消息就处理一次,但是有时我们需要做一些聚合类的处理,例如:在过...

柯广 2周前 (04-01) 467℃ 0评论 0喜欢

Flink实时计算topN热榜

Flink实时计算topN热榜
TopN的常见应用场景,最热商品购买量,最高人气作者的阅读量等等。 1. 用到的知识点 Flink创建kafka数据源; 基于 EventTime 处理,如何指定 Watermark; Flink中的Window,滚动(tumbling)窗口与滑动(sliding)窗口; St...

柯广 1个月前 (03-10) 1406℃ 0评论 3喜欢

Hive必会SQL语法explode 和 lateral view

Hive必会SQL语法explode 和 lateral view
explode 和 lateral view 为什么把这两个放一块呢,因为这两个经常放在一起用啊。 explode与lateral view在关系型数据库中本身是不该出现的,因为他的出现本身就是在操作不满足第一范式的数据(每个属性都不可再分),本身已经违背了数据库的设计原理(不论...

柯广 1个月前 (03-04) 1633℃ 0评论 0喜欢

生男生女概率一样吗?为什么中国男性多于女性?

生男生女概率一样吗?为什么中国男性多于女性?
先来看一下2019年人口普查,也是第七次人口普查的男女性别比例数据,是目前最新的数据了。这里性别比,女性基数是100,例如:20 ~ 24这个区间,性别比是114.61,也就是说,114.6个男性对应100个女性。 可以看出,男女数量差异比较明显,但是在这个人口基数大国中,这个...

柯广 2个月前 (02-03) 2942℃ 0评论 1喜欢

YARN调度器(Scheduler)详解

YARN调度器(Scheduler)详解
理想情况下,我们应用对Yarn资源的请求应该立刻得到满足,但现实情况资源往往是有限的,特别是在一个很繁忙的集群,一个应用资源的请求经常需要等待一段时间才能的到相应的资源。在Yarn中,负责给应用分配资源的就是Scheduler。其实调度本身就是一个难题,很难找到一个完美的策略可...

柯广 2个月前 (01-27) 3221℃ 0评论 3喜欢

Spark开发常用参数

Spark开发常用参数
Driver spark.driver.cores driver端分配的核数,默认为1,thriftserver是启动thriftserver服务的机器,资源充足的话可以尽量给多。 spark.driver.memory driver端分配的内存数,默认为1g,同上。 spark...

柯广 3个月前 (01-26) 3232℃ 0评论 0喜欢

Spark内核解析

Spark内核解析
Spark内核概述 Spark内核泛指Spark的核心运行机制,包括Spark核心组件的运行机制、Spark任务调度机制、Spark内存管理机制、Spark核心功能的运行原理等,熟练掌握Spark内核原理。 一、Spark核心组件回顾 Driver Spark驱动器节点,用于执行...

柯广 3个月前 (01-14) 3771℃ 0评论 3喜欢

Hive进阶—抽样的各种玩法

Hive进阶—抽样的各种玩法
抽样 抽样在Hive 中也是比较常用的一种手段,主要用在下面的几个场景中 一些机器学习的场景中,数仓作为数据的提供方提供样本数据 数据的计算结果异常或者是指标异常,这个时候如果我们往往需要确认数据源的数据是否本身就有异常 SQL的性能有问题的时候我们也会使用抽样的方法区查看数...

柯广 3个月前 (01-13) 3766℃ 0评论 1喜欢

Hive表的基本操作

Hive表的基本操作
Hive系列文章 Hive表的基本操作 Hive中的集合数据类型 Hive动态分区详解 hive中orc格式表的数据导入 Java通过jdbc连接hive 通过HiveServer2访问Hive SpringBoot连接Hive实现自助取数 hive关联hbase表 Hive ...

柯广 3个月前 (01-10) 3948℃ 0评论 0喜欢

Hive窗口函数row number的用法

Hive窗口函数row number的用法
row_number 前面我们介绍窗口函数的时候说到了窗口函数的使用场景,我们也给它起了一个名字进行区分,通用窗口函数和特殊窗口函数,今天我们就来看一下排序相关的窗口函数,因为是窗口函数,并且我们说它是用来排序的,我们大概也能猜到它就是用来对窗口内的数据进行排序的 其实关于排序...

柯广 3个月前 (01-07) 4057℃ 0评论 1喜欢

Hive 中的四种排序详解,再也不会混淆用法了。

Hive 中的四种排序详解,再也不会混淆用法了。
Hive 中的四种排序 排序操作是一个比较常见的操作,尤其是在数据分析的时候,我们往往需要对数据进行排序,hive 中和排序相关的有四个关键字,今天我们就看一下,它们都是什么作用。 数据准备 下面我们有一份温度数据,tab 分割 2008 32.0 2008 21....

柯广 3个月前 (01-06) 4055℃ 0评论 0喜欢

Hive基于UDF进行文本分词

Hive基于UDF进行文本分词
Hive系列文章 Hive表的基本操作 Hive中的集合数据类型 Hive动态分区详解 hive中orc格式表的数据导入 Java通过jdbc连接hive 通过HiveServer2访问Hive SpringBoot连接Hive实现自助取数 hive关联hbase表 Hive ...

柯广 3个月前 (12-30) 4370℃ 0评论 1喜欢

数据湖是谁?那数据仓库又算什么?

数据湖是谁?那数据仓库又算什么?
刀光剑影江湖情,摧枯拉朽浪滔滔。功名利禄拂衣去,山高水远路迢迢。 数据湖初识 近两年,为什么都开始谈论起 Data Lake 这个”新名词”了? 先说说我的想法,其实还是用户需求驱动数据服务,大家开始关注 Data Lake 的根本原因是用户需求发生了质变,过去的数据仓库模式以及...

柯广 4个月前 (12-25) 4534℃ 0评论 3喜欢