百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

这是我见过最简单易懂的sql窗口分析函数使用教程了[赞][赞][赞]

wptr33 2024-11-21 22:05 34 浏览

上一篇:「sql笔记」left join 还是right join?


一、理解

Mysql8.0开始支持窗口函数,极大增强了Mysql的统计性能,再也不会被Oracle等鄙视了。Mysql8.0还增加了其他实用的高级性能,关注公众号后续文章进行了解。

1、使用场景

可从两个角度来了解和分辨需要使用窗口函数的场景。

(1)要查询的数据有n组性质相同的数据集(订单表可以按品类分成n组、按日期分成n组等),对每组组内的数据都需要做相同的统计计算。比如各品类的销售额前3名的商品分别是?比如各部门出勤率最好的3位员工是?

(2)符合以下5类窗口函数的代表的统计意义

排序函数:row_number() 、rank()、dense_rank(),对每组组内进行排序。

分布函数:percent_rank()、cume_dist(),对每组组内的个体在组内占比或累计占比。

绝对位置函数:first_value()、last_value()、nth_value(),对每组组内的第1位、最后1位、第n位的值。

相对位置函数:lag()、lead(),对每组内的某字段的前n行和后n行的值。

分桶函数:ntile(x),将每组内的行,再分别分成x个组(桶)。

此前版本的Mysql没有窗口函数,要解决此类问题,会引入变量到sql中,很复杂。现在好啦,最方便的窗口函数可以使用了。

2、理解窗口

窗口可以理解为上面描述的把待分析数据分为n组的组或集合。每组内的每条数据都要在此窗口内执行同一个函数。窗口函数运行后,数据行数保持不变。

以下示例,每个品类的商品按照金额从大到小的排名。金额排名这列就是用窗口函数计算出来的,各窗口内的数据行数保持不变,零食类还是2行,水果类还是3行。

row_number() over(partition by 品类 order by 金额 desc) as 金额排名

当不分组,而是全部数据当作1组来对待,此时窗口只有1个,单一窗口。

row_number() over(order by 金额 desc) as 金额排名

二、函数介绍

1、排序函数

row_number(),1、2、3、4,重复值的序号也是连续+1,不会有重复结果。

rank(),1、1、3、4,有相同值时,序号可能不连续。

dense_rank(),1、1、2、3,有相同值时,序号也是连续的。

2、分布函数

3、相对位置函数

4、绝对位置函数

5、分桶函数

6、聚合函数参与窗口计算

三、特殊窗口

1、单一窗口

在理解窗口章节中已经提及过,over()中不使用pratition by,即where出来的数据作为1组。

2、细分窗口

3、滑动窗口

current row,边界是当前行,一般和其他范围关键字一起使用

rows x preceding/following,边界是当前行减去x行,边界是当前行加上x行

rows unbounded preceding/following,边界是分组的第一行,边界是分组的最后一行

range interval 7 day preceding/following,当前行日期向前、向后7天纳入计算

窗口函数很神奇,很强悍,可以把复杂的逻辑封装起来,简洁调用。对于数据分析师,这是打怪升级过程中必须掌握的,会让你的数据加工提效n倍。

最后提一个问题,本文案例均是partition by和order by一个字段,试问,over()里可以partition by几个字段,order by 几个字段?关注明天文章揭晓答案。



上一篇:「sql笔记」left join 还是right join?

相关推荐

高性能并发队列Disruptor使用详解

基本概念Disruptor是一个高性能的异步处理框架,是一个轻量的Java消息服务JMS,能够在无锁的情况下实现队列的并发操作Disruptor使用环形数组实现了类似队列的功能,并且是一个有界队列....

Disruptor一个高性能队列_java高性能队列

Disruptor一个高性能队列前言说到队列比较熟悉的可能是ArrayBlockingQueue、LinkedBlockingQueue这两个有界队列,大多应用在线程池中使用能保证线程安全,但其安全性...

谈谈防御性编程_防御性策略

防御性编程对于程序员来说是一种良好的代码习惯,是为了保护自己的程序在不可未知的异常下,避免带来更大的破坏性崩溃,使得程序在错误发生时,依然能够云淡风轻的处理,但很多程序员入行很多年,写出的代码依然都是...

有人敲门,开水开了,电话响了,孩子哭了,你先顾谁?

前言哎呀,这种情况你肯定遇到过吧!正在家里忙活着,突然——咚咚咚有人敲门,咕噜咕噜开水开了,铃铃铃电话响了,哇哇哇孩子又哭了...我去,四件事一起来,人都懵了!你说先搞哪个?其实这跟我们写Java多线...

面试官:线程池如何按照core、max、queue的执行顺序去执行?

前言这是一个真实的面试题。前几天一个朋友在群里分享了他刚刚面试候选者时问的问题:"线程池如何按照core、max、queue的执行循序去执行?"。我们都知道线程池中代码执行顺序是:co...

深入剖析 Java 中线程池的多种实现方式

在当今高度并发的互联网软件开发领域,高效地管理和利用线程资源是提升程序性能的关键。Java作为一种广泛应用于后端开发的编程语言,为我们提供了丰富的线程池实现方式。今天,就让我们深入探讨Java中...

并发编程之《彻底搞懂Java线程》_java多线程并发解决方案详解

目录引言一、核心概念:线程是什么?...

Redis怎么实现延时消息_redis实现延时任务

一句话总结Redis可通过有序集合(ZSET)实现延时消息:将消息作为value,到期时间戳作为score存入ZSET。消费者轮询用ZRANGEBYSCORE获取到期消息,配合Lua脚本保证原子性获取...

CompletableFuture真的用对了吗?盘点它最容易被误用的5个场景

在Java并发编程中,CompletableFuture是处理异步任务的利器,但不少开发者在使用时踩过这些坑——线上服务突然雪崩、异常悄无声息消失、接口响应时间翻倍……本文结合真实案例,拆解5个最容易...

接口性能优化技巧,有点硬_接口性能瓶颈

背景我负责的系统到2021年初完成了功能上的建设,开始进入到推广阶段。随着推广的逐步深入,收到了很多好评的同时也收到了很多对性能的吐槽。刚刚收到吐槽的时候,我们的心情是这样的:...

禁止使用这5个Java类,每一个背后都有一段"血泪史"

某电商平台的支付系统突然报警:大量订单状态异常。排查日志发现,同一笔订单被重复支付了三次。事后复盘显示,罪魁祸首竟是一行看似无害的SimpleDateFormat代码。在Java开发中,这类因使用不安...

无锁队列Disruptor原理解析_无锁队列实现原理

队列比较队列...

Java并发队列与容器_java 并发队列

【前言:无论是大数据从业人员还是Java从业人员,掌握Java高并发和多线程是必备技能之一。本文主要阐述Java并发包下的阻塞队列和并发容器,其实研读过大数据相关技术如Spark、Storm等源码的,...

线程池工具及拒绝策略的使用_线程池处理策略

线程池的拒绝策略若线程池中的核心线程数被用完且阻塞队列已排满,则此时线程池的资源已耗尽,线程池将没有足够的线程资源执行新的任务。为了保证操作系统的安全,线程池将通过拒绝策略处理新添加的线程任务。...

【面试题精讲】ArrayBlockingQueue 和 LinkedBlockingQueue 区别?

有的时候博客内容会有变动,首发博客是最新的,其他博客地址可能会未同步,认准...