百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

画像笔记6- (标签总原则)非实时标签-统计类标签-近30日行为标签

wptr33 2025-01-31 15:39 19 浏览

续昨天。

标签数据的开发,主要包括 离线标签开发、实时类标签开发、用户特征库开发、人群计算、打通数据服务层等开发内容。

离线标签

主要包含:统计类标签、规则类标签、挖掘类标签。

实时类标签

针对给用户展现实时性较强的场景:首页新人弹窗、新人红包

用户特征库

围绕用户每次行为明细记录相关数据,如用户浏览、搜索、收藏、下单等行为明细。一般该特征库按日做时间分区。

人群计算

应用在数据服务层之前,业务方需要组合用户的标签来筛选出对应的人群,通过人群计算功能组合标签划分出对应的人群。

打通数据服务区层,

将业务规则圈出来的用户人群推送到不同的业务系统上去。

统计类标签开发:

统计类标签指的统计用户相关数值、客观描述用户状态的标签,如用户的年龄、体重、累计购买金额、累计购买次数、近30日登陆次数等。

userid维度的用户标签表可按日分区,设计为如下结构:


案例1,离线标签

近30日购买行为这个二级类目进行拆解,可将其拆解为:付款订单量(ACTION_U_01_001)、总付款金额(ACTION_U_01_002)、加入购物车次数(ACTION_U_01_003)

将需要计算的标签从目标表中抽取出来:




union all 表示把各个结果集的数据按照列名进行合并,而且不会消除重复的数据。

比如第一个查询有100条两列,第二个查询结果也为160条两列,故使用union all之后,可以将这两个结果合并成一个,变成260行两列。

可参考csdn::https://blog.csdn.net/helloxiaozhe/article/details/88598003

保证每天作业将近30日的标签打在每个有相应行为的用户身上,单要做到增量获取用户最新状态,还需要做一层全连接关联。

举个常见的例子,某个用户前天购买了3单商品,如果昨天又购买了2单,则今天最新的状态是3+2=5单,替换掉前天3单的权重值,

如果昨天没有购买行为,则权重值仍为3.


关注下NVL()函数,

NVL( string1, replace_with):给值为NULL的数据赋值:如果string1为NULL,则NVL函数返回replace_with的值,否则返回string1的值;如果两个参数都为NULL ,则返回NULL。

给labelweight 赋值,如果最新的有数据t2.labelweight,则用最新的,否则用老的(t1.labelweight)。

上面脚本old_date_partition 为设置的一个日期变量,每日传入的数值都不同:


这段代码中对第二段代码做了一层Spark 封装,

另外,上面的代码做了一层Spark封装,可将第二段的HiveSQL语句提交到Spark集群上执行。提交Spark任务计算该标签

“spark-submit --master yarn --deploy-mode client --driver-memroy 1g --executor-memory 2g --executor-cores 2 --num-executors 50 userprfile_latest_30days_label.py start-date”

其中spark-submit的参数设置如下:

  • deploy-mode:在本地(Client)启动Driver 还是在集群上(Cluster)启动Driver;
  • driver-memory:Driver 端内存大小;
  • executor-memory:Executor端内存大小;
  • executor-cores:每个Executor 核数
  • num-executors:启动Executor的数量。

class:如果是JAR或Scala程序的jar包,该参数对应应用程序的主类,对于提交的Python脚本,不用提交该参数。


解释下strptime:


解释下datetime. timedelta


old_date_partition = strftime(strptime(start_date_str,format) - datetime.timedelta(1),format) // 获取1天前的日期,按照format 输出(%Y%M%D)

month_day_ago = strftime(strptime(start_date_str,format) - datetime.timedelta(1),format) //获取一个月钱的日期,按照format输出(%Y%M%D)


第一个用户 “44463729”

付款订单量(ACTION_U_01_001): 付款订单量为3 ,一天就下三单,不错嘛。

第六个用户“32101029”

总付款金额(ACTION_U_01_002) : 157元 , 还可以啊,一天买了157块

第七个用户“23551034”

加入购物车次数(ACTION_U_01_003) :16次,没买东西,看来转化不行啊。

相关推荐

redis的八种使用场景

前言:redis是我们工作开发中,经常要打交道的,下面对redis的使用场景做总结介绍也是对redis举报的功能做梳理。缓存Redis最常见的用途是作为缓存,用于加速应用程序的响应速度。...

基于Redis的3种分布式ID生成策略

在分布式系统设计中,全局唯一ID是一个基础而关键的组件。随着业务规模扩大和系统架构向微服务演进,传统的单机自增ID已无法满足需求。高并发、高可用的分布式ID生成方案成为构建可靠分布式系统的必要条件。R...

基于OpenWrt系统路由器的模式切换与网页设计

摘要:目前商用WiFi路由器已应用到多个领域,商家通过给用户提供一个稳定免费WiFi热点达到吸引客户、提升服务的目标。传统路由器自带的Luci界面提供了工厂模式的Web界面,用户可通过该界面配置路...

这篇文章教你看明白 nginx-ingress 控制器

主机nginx一般nginx做主机反向代理(网关)有以下配置...

如何用redis实现注册中心

一句话总结使用Redis实现注册中心:服务注册...

爱可可老师24小时热门分享(2020.5.10)

No1.看自己以前写的代码是种什么体验?No2.DooM-chip!国外网友SylvainLefebvre自制的无CPU、无操作码、无指令计数器...No3.我认为CS学位可以更好,如...

Apportable:拯救程序员,IOS一秒变安卓

摘要:还在为了跨平台使用cocos2d-x吗,拯救objc程序员的奇葩来了,ApportableSDK:FreeAndroidsupportforcocos2d-iPhone。App...

JAVA实现超买超卖方案汇总,那个最适合你,一篇文章彻底讲透

以下是几种Java实现超买超卖问题的核心解决方案及代码示例,针对高并发场景下的库存扣减问题:方案一:Redis原子操作+Lua脚本(推荐)//使用Redis+Lua保证原子性publicbo...

3月26日更新 快速施法自动施法可独立设置

2016年3月26日DOTA2有一个79.6MB的更新主要是针对自动施法和快速施法的调整本来内容不多不少朋友都有自动施法和快速施法的困扰英文更新日志一些视觉BUG修复就不翻译了主要翻译自动施...

Redis 是如何提供服务的

在刚刚接触Redis的时候,最想要知道的是一个’setnameJhon’命令到达Redis服务器的时候,它是如何返回’OK’的?里面命令处理的流程如何,具体细节怎么样?你一定有问过自己...

lua _G、_VERSION使用

到这里我们已经把lua基础库中的函数介绍完了,除了函数外基础库中还有两个常量,一个是_G,另一个是_VERSION。_G是基础库本身,指向自己,这个变量很有意思,可以无限引用自己,最后得到的还是自己,...

China's top diplomat to chair third China-Pacific Island countries foreign ministers' meeting

BEIJING,May21(Xinhua)--ChineseForeignMinisterWangYi,alsoamemberofthePoliticalBureau...

移动工作交流工具Lua推出Insights数据分析产品

Lua是一个适用于各种职业人士的移动交流平台,它在今天推出了一项叫做Insights的全新功能。Insights是一个数据平台,客户可以在上面实时看到员工之间的交流情况,并分析这些情况对公司发展的影响...

Redis 7新武器:用Redis Stack实现向量搜索的极限压测

当传统关系型数据库还在为向量相似度搜索的性能挣扎时,Redis7的RedisStack...

Nginx/OpenResty详解,Nginx Lua编程,重定向与内部子请求

重定向与内部子请求Nginx的rewrite指令不仅可以在Nginx内部的server、location之间进行跳转,还可以进行外部链接的重定向。通过ngx_lua模块的Lua函数除了能实现Nginx...