百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

画像笔记6- (标签总原则)非实时标签-统计类标签-近30日行为标签

wptr33 2025-01-31 15:39 15 浏览

续昨天。

标签数据的开发,主要包括 离线标签开发、实时类标签开发、用户特征库开发、人群计算、打通数据服务层等开发内容。

离线标签

主要包含:统计类标签、规则类标签、挖掘类标签。

实时类标签

针对给用户展现实时性较强的场景:首页新人弹窗、新人红包

用户特征库

围绕用户每次行为明细记录相关数据,如用户浏览、搜索、收藏、下单等行为明细。一般该特征库按日做时间分区。

人群计算

应用在数据服务层之前,业务方需要组合用户的标签来筛选出对应的人群,通过人群计算功能组合标签划分出对应的人群。

打通数据服务区层,

将业务规则圈出来的用户人群推送到不同的业务系统上去。

统计类标签开发:

统计类标签指的统计用户相关数值、客观描述用户状态的标签,如用户的年龄、体重、累计购买金额、累计购买次数、近30日登陆次数等。

userid维度的用户标签表可按日分区,设计为如下结构:


案例1,离线标签

近30日购买行为这个二级类目进行拆解,可将其拆解为:付款订单量(ACTION_U_01_001)、总付款金额(ACTION_U_01_002)、加入购物车次数(ACTION_U_01_003)

将需要计算的标签从目标表中抽取出来:




union all 表示把各个结果集的数据按照列名进行合并,而且不会消除重复的数据。

比如第一个查询有100条两列,第二个查询结果也为160条两列,故使用union all之后,可以将这两个结果合并成一个,变成260行两列。

可参考csdn::https://blog.csdn.net/helloxiaozhe/article/details/88598003

保证每天作业将近30日的标签打在每个有相应行为的用户身上,单要做到增量获取用户最新状态,还需要做一层全连接关联。

举个常见的例子,某个用户前天购买了3单商品,如果昨天又购买了2单,则今天最新的状态是3+2=5单,替换掉前天3单的权重值,

如果昨天没有购买行为,则权重值仍为3.


关注下NVL()函数,

NVL( string1, replace_with):给值为NULL的数据赋值:如果string1为NULL,则NVL函数返回replace_with的值,否则返回string1的值;如果两个参数都为NULL ,则返回NULL。

给labelweight 赋值,如果最新的有数据t2.labelweight,则用最新的,否则用老的(t1.labelweight)。

上面脚本old_date_partition 为设置的一个日期变量,每日传入的数值都不同:


这段代码中对第二段代码做了一层Spark 封装,

另外,上面的代码做了一层Spark封装,可将第二段的HiveSQL语句提交到Spark集群上执行。提交Spark任务计算该标签

“spark-submit --master yarn --deploy-mode client --driver-memroy 1g --executor-memory 2g --executor-cores 2 --num-executors 50 userprfile_latest_30days_label.py start-date”

其中spark-submit的参数设置如下:

  • deploy-mode:在本地(Client)启动Driver 还是在集群上(Cluster)启动Driver;
  • driver-memory:Driver 端内存大小;
  • executor-memory:Executor端内存大小;
  • executor-cores:每个Executor 核数
  • num-executors:启动Executor的数量。

class:如果是JAR或Scala程序的jar包,该参数对应应用程序的主类,对于提交的Python脚本,不用提交该参数。


解释下strptime:


解释下datetime. timedelta


old_date_partition = strftime(strptime(start_date_str,format) - datetime.timedelta(1),format) // 获取1天前的日期,按照format 输出(%Y%M%D)

month_day_ago = strftime(strptime(start_date_str,format) - datetime.timedelta(1),format) //获取一个月钱的日期,按照format输出(%Y%M%D)


第一个用户 “44463729”

付款订单量(ACTION_U_01_001): 付款订单量为3 ,一天就下三单,不错嘛。

第六个用户“32101029”

总付款金额(ACTION_U_01_002) : 157元 , 还可以啊,一天买了157块

第七个用户“23551034”

加入购物车次数(ACTION_U_01_003) :16次,没买东西,看来转化不行啊。

相关推荐

Linux文件系统操作常用命令(linux文件内容操作命令)

在Linux系统中,有一些常用的文件系统操作命令,以下是这些命令的介绍和作用:#切换目录,其中./代表当前目录,../代表上一级目录cd#查看当前目录里的文件和文件夹ls#...

别小看tail 命令,它难倒了技术总监

我把自己以往的文章汇总成为了Github,欢迎各位大佬star...

lnav:基于 Linux 的高级控制台日志文件查看器

lnav是一款开源的控制台日志文件查看器,专为Linux和Unix-like系统设计。它通过自动检测日志文件的格式,提取时间戳、日志级别等关键信息,并将多个日志文件的内容按时间顺序合并显示,...

声明式与命令式代码(声明模式和命令模式)

编程范式中的术语和差异信不信由你,你可能已经以开发人员的身份使用了多种编程范例。因为没有什么比用编程理论招待朋友更有趣的了,所以这篇文章可以帮助您认识代码中的流行范例。命令式编程命令式编程是我们从As...

linux中的常用命令(linux常用命令和作用)

linux中的常用命令linux中的命令统称shell命令shell是一个命令行解释器,将用户命令解析为操作系统所能理解的指令,实现用户与操作系统的交互shell终端:我们平时输入命令,执行程序的那个...

提高工作效率的--Linux常用命令,能够决解95%以上的问题

点击上方关注,第一时间接受干货转发,点赞,收藏,不如一次关注评论区第一条注意查看回复:Linux命令获取linux常用命令大全pdf+Linux命令行大全pdf...

如何限制他人操作自己的电脑?(如何控制别人的电脑不让发现)

这段时间,小猪罗志祥正处于风口浪尖,具体是为啥?还不知道的小伙伴赶紧去补一下最近的娱乐圈八卦~简单来说,就是我们的小罗同事,以自己超强的体力,以及超强的时间管理能力,重新定义了「多人运动」的含义,重新...

最通俗易懂的命令模式讲解(命令模式百科)

我们先不讲什么是命令模式,先通过一个场景来引出命令模式,看看命令模式能解决什么样的问题。现在有一个渣男张三,他有还几个女朋友,你现在是不是还是单身狗,你就说你气不气?然后他需要每天分别叫几个女朋友起床...

互联网大厂后端必看!Spring Boot 中Runtime执行与停止命令?

你是否曾在使用SpringBoot开发项目时,遇到需要执行系统命令的场景?比如调用脚本进行文件处理,又或是启动外部程序?很多后端开发人员会使用Processexec=Runtime.get...

Linux 常用命令(linux常用的20个命令面试)

日志排查类操作命令...

Java字节码指令:if_icmpgt(0xA3)(java字节码使用的汇编语言)

if_icmpgt是Java字节码中的一条条件跳转指令,其全称是"IfIntegerCompareGreaterThan"。它用于比较两个整数值的大小。如果栈顶的第一个...

外贸干货|如何增加领英的曝光量和询盘

#跨境电商#...

golang执行linux命令(golang调用shell脚本)

需求需要通过openssl生成rsa秘钥,然后保存该秘钥。代码实例packagemainimport("io/ioutil""bytes"&...

LINUX磁盘挂载(linux磁盘挂载到windows)

1、使用root用户查看磁盘挂载情况:fdisk-l2、使用df查看当前磁盘挂载情况,根据和fdisk-l的结果进行对比,查看还有那些磁盘未使用3、挂载:mount磁盘挂载路径...

Linux命令学习——nl命令(linux ln命令的使用)

nl命令主要功能为每一个文件添加行号,每一个输入的文件添加行号后发送到标准输出。当没有文件或文件为-时,读取标准输入...