如何快速全面建立自己的大数据知识体系?

大数据 ETL 用户画像 机器学习
阅读232 

作者经过研发多个大数据产品,将自己形成关于大数据知识体系的干货分享出来,希望给大家能够快速建立起大数据产品的体系思路,让大家系统性学习和了解有关大数据的设计架构。

很多人都看过不同类型的书,也接触过很多有关大数据方面的文章,但都是很零散不成系统,对自己也没有起到多大的作用,所以作者第一时间,带大家从整体体系思路上,了解大数据产品设计架构和技术策略。

大数据产品,从系统性和体系思路上来做,主要分为五步:

  • 针对前端不同渠道进行数据埋点,然后根据不同渠道的采集多维数据,也就是做大数据的第一步,没有全量数据,何谈大数据分析;
  • 第二步,基于采集回来的多维度数据,采用ETL对其各类数据进行结构化处理及加载;
  • 然后第三步,对于ETL处理后的标准化结构数据,建立数据存储管理子系统,归集到底层数据仓库,这一步很关键,基于数据仓库,对其内部数据分解成基础的同类数据集市;
  • 然后基于归集分解的不同数据集市,利用各类R函数包对其数据集进行数据建模和各类算法设计,里面算法是需要自己设计,个别算法可以用R函数,这个过程产品和运营参与最多;这一步做好了,也是很多公司用户画像系统的底层。
  • 最后根据建立的各类数据模型及算法,结合前端不同渠道不同业务特征,根据渠道触点自动匹配后端模型自动展现用户个性化产品和服务。

建立系统性数据采集指标体系

建立数据采集分析指标体系是形成营销数据集市的基础,也是营销数据集市覆盖用户行为数据广度和深度的前提,数据采集分析体系要包含用户全活动行为触点数据,用户结构化相关数据及非结构化相关数据,根据数据分析指标体系才能归类汇总形成筛选用户条件的属性和属性值,也是发现新的营销事件的基础。

构建营销数据指标分析模型,完善升级数据指标采集,依托用户全流程行为触点,建立用户行为消费特征和个体属性,从用户行为分析、商业经营数据分析、营销数据分析三个维度,形成用户行为特征分析模型。用户维度数据指标是不同维度分析要素与用户全生命周期轨迹各触点的二维交叉得出。

目前做大数据平台的公司,大多数采集的数据指标和输出的可视化报表,都存在几个关键问题:

  • 采集的数据都是以渠道、日期、地区统计,无法定位到具体每个用户;
  • 计算统计出的数据都是规模数据,针对规模数据进行挖掘分析,无法支持;
  • 数据无法支撑系统做用户获客、留存、营销推送使用。

所以,要使系统采集的数据指标能够支持平台前端的个性化行为分析,必须围绕用户为主线来进行画像设计,在初期可视化报表成果基础上,将统计出来的不同规模数据,细分定位到每个用户,使每个数据都有一个用户归属。

将分散无序的统计数据,在依据用户来衔接起来,在现有产品界面上,每个统计数据都增加一个标签,点击标签,可以展示对应每个用户的行为数据,同时可以链接到其他统计数据页面。

由此可以推导出,以用户为主线来建立数据采集指标维度:用户身份信息、用户社会生活信息、用户资产信息、用户行为偏好信息、用户购物偏好、用户价值、用户反馈、用户忠诚度等多个维度,依据建立的采集数据维度,可以细分到数据指标或数据属性项。

① 用户身份信息维度

性别,年龄,星座,居住城市,活跃区域,证件信息,学历,收入,健康等。

② 用户社会生活信息维度

行业,职业,是否有孩子,孩子年龄,车辆,住房性质,通信情况,流量使用情况……

③ 用户行为偏好信息

是否有网购行为,风险敏感度,价格敏感度,品牌敏感度,收益敏感度,产品偏好,渠道偏好……

④ 用户购物偏好信息

品类偏好,产品偏好,购物频次,浏览偏好,营销广告喜好,购物时间偏好,单次购物最高金额……

⑤ 用户反馈信息维度

用户参与的活动,参与的讨论,收藏的产品,购买过的商品,推荐过的产品,评论过的产品……

基于采集回来的多维度数据,采用ETL对其各类数据进行结构化处理及加载

  • 数据补缺:对空数据、缺失数据进行数据补缺操作,无法处理的做标记
  • 数据替换:对无效数据进行数据的替换
  • 格式规范化:将源数据抽取的数据格式转换成为便于进入仓库处理的目标数据格式
  • 主外键约束:通过建立主外键约束,对非法数据进行数据替换或导出到错误文件重新处理
  • 数据合并:多用表关联实现(每个字段加索引,保证关联查询的效率)
  • 数据拆分:按一定规则进行数据拆分
  • 行列互换、排序/修改序号、去除重复记录

数据处理层 由 Hadoop集群 组成 , Hadoop集群从数据采集源读取业务数据,通过并行计算完成业务数据的处理逻辑,将数据筛选归并形成目标数据。

数据建模、用户画像及特征算法

提取与营销相关的客户、产品、服务数据,采用聚类分析和关联分析方法搭建数据模型,通过用户规则属性配置、规则模板配置、用户画像打标签,形成用户数据规则集,利用规则引擎实现营销推送和条件触发的实时营销推送,同步到前端渠道交互平台来执行营销规则,并将营销执行效果信息实时返回到大数据系统。

根据前端用户不同个性化行为,自动匹配规则并触发推送内容

根据用户全流程活动行为轨迹,分析用户与线上渠道与线下渠道接触的所有行为触点,对营销用户打标签,形成用户行为画像,基于用户画像提炼汇总营销筛选规则属性及属性值,最终形成细分用户群体的条件。每个用户属性对应多个不同属性值,属性值可根据不同活动个性化进行配置,支持用户黑白名单的管理功能。

可以预先配置好基于不同用户身份特性的活动规则和模型,当前端用户来触发配置好的营销事件,数据系统根据匹配度最高的原则来实时自动推送营销规则,并通过实时推送功能来配置推送的活动内容、优惠信息和产品信息等,同时汇总前端反馈回的效果数据,对推送规则和内容进行优化调整。

大数据系统结合客户营销系统在现有用户画像、用户属性打标签、客户和营销规则配置推送、同类型用户特性归集分库模型基础上,未来将逐步扩展机器深度学习功能,通过系统自动搜集分析前端用户实时变化数据,依据建设的机器深度学习函数模型,自动计算匹配用户需求的函数参数和对应规则,营销系统根据计算出的规则模型,实时自动推送高度匹配的营销活动和内容信息。

机器自学习模型算法是未来大数据系统深度学习的核心,通过系统大量采样训练,多次数据验证和参数调整,才能最终确定相对精准的函数因子和参数值,从而可以根据前端用户产生的实时行为数据,系统可自动计算对应的营销规则和推荐模型。

大数据系统在深度自学习外,未来将通过逐步开放合作理念,对接外部第三方平台,扩展客户数据范围和行为触点,尽可能覆盖用户线上线下全生命周期行为轨迹,掌握用户各行为触点数据,扩大客户数据集市和事件库,才能深层次挖掘客户全方位需求,结合机器自学习功能,从根本上提升产品销售能力和客户全方位体验感知。

本文转自作者个人微信号「互联网金融干货」

如何快速全面建立自己的大数据知识体系? 大数据 ETL 用户画像 机器学习 阅读232 作者经过研发多个大数据产品,将自己形成关于大数据知识体系的干货分享出来,希望给大家能够快速建立起大数据相关推荐

  1. 大数据杀熟的背后 -- 浅谈用户画像

    ​A有一天在某电商平台搜了"连衣裙",惊呼:"xx上的裙子好贵啊,怎么都要四五百?".B接话:"不能吧,我看看,哎?我这就两百多啊".胖里默 ...

  2. 网易微专业python数据分析统计服_40套大数据云计算高级实战精品,数据分析,数据仓库,数据爬虫,项目实战,用户画像, ......

    40套大数据云计算高级实战精品,数据分析,数据仓库,数据爬虫,项目实战,用户画像,日志分析,Hadoop,Flink,Spark,Kafka,Storm,Docker,ElaticStack等视频教程 ...

  3. 民生银行京东三位大咖,手把手教你构建用户画像

    说个真事儿,有次我在淘宝搜"汽车贴膜",隔段时间我无意间打开淘宝,多出了个"我的爱车"模块,点进去一看,车的品牌型号款式全部展示在你面前,我开始一度以为4S店或 ...

  4. 火锅店选址如何用大数据软件了解商圈内用户画像,交通情况

    火锅店选址如何用大数据软件了解商圈内用户画像,交通情况 在如今这个大数据的时代里,人人都希望能够借助大数据的力量: 电商希望能够借助大数据进一步获悉用户的消费需求,实现更为精准的营销; 网络安全从业者 ...

  5. 快餐店选址如何用大数据软件了解商圈内用户画像,交通情况

    快餐店选址如何用大数据软件了解商圈内用户画像,交通情况 大数据分析通俗的讲就是将海量混杂的数据,通过利用各类手段统一协调成一个有机整体,然后以不同的可视化分析工具直观呈现给用户,让其通俗易懂的发现数据 ...

  6. 大数据时代,如何构建精准用户画像,直击精细化运营

    移动互联网时代,精细化运营逐渐成为企业发展的重要竞争力,"用户画像"的概念也应运而生.用户画像是指,在大数据时代,企业通过对海量数据信息进行清洗.聚类.分析,将数据抽象成标签,再利 ...

  7. 什么叫大数据人物画像_大数据时代,如何构建精准用户画像,直击精细化运营...

    移动互联网时代,精细化运营逐渐成为企业发展的重要竞争力,"用户画像"的概念也应运而生.用户画像是指,在大数据时代,企业通过对海量数据信息进行清洗.聚类.分析,将数据抽象成标签,再利 ...

  8. 【大数据、数据挖掘、数据分析】用户画像是什么?如何制作用户画像?

    文章目录 什么是用户画像 用户画像的八要素 用户画像的优点 如何制作用户画像 用户画像,作为一种勾画目标用户.联系用户诉求与设计方向的有效工具,用户画像在各领域得到了广泛的应用. 用户画像最初是在电商 ...

  9. 大数据算法_大数据算法解析,如何创建用户画像实现千人千面?

    " 一面科技,一面生活 技术与社交电商的完美融合 打开了全新的幸福视界 " 幸福蜜糖  2020·11·5 大数据算法无处不在 "处在如今的时代中,数据越来越值钱,如何 ...

最新文章

  1. python离线安装包_Python2.7如何离线安装包
  2. 硕士毕业后去国外读法学博士_法学硕士的完整形式是什么?
  3. 前端学习(2711):重读vue电商网站31之左侧菜单栏图标设计
  4. 超图(hypergraph)
  5. pta求阶乘序列前n项和_序列问题总结-超级巧妙
  6. 清水河畔论坛二手帖子爬虫
  7. vmware下虚拟机不能上网问题解决
  8. 记录php运行日记的方法
  9. 使用python实现微信小程序自动签到
  10. win 7系统微信如何用代理服务器,win7系统电脑上使用微信的操作方法
  11. 3. mysql-视图
  12. python头像教程_微信好友头像全家福详细教程python版
  13. Contest2257 - 抗击疫情,从我做起--大中小学生联合训练赛第五十二场
  14. Win10-1809 离线安装 .net framework 3.5
  15. Android WebView 视频播放,全屏按钮不显示或灰显解决方案
  16. linux终端显示打印记录,Ubuntu使用-记录终端输出的LOG
  17. HTTP请求错误 2xx 3xx 4xx 5xx
  18. 如何学习计算机视觉?
  19. [035] 微信公众帐号开发教程第11篇-符号表情的发送(上)
  20. 赵小楼《天道》《遥远的救世主》深度解析(5)丁元英之所以能成为丁元英的条件的可能之一(一)

热门文章

  1. sql delete删除的数据怎么恢复_如何恢复按下Shift + DELETE键永久删除的文件和资料夹?...
  2. java 查询表 并返回数据_ajax与java前后台传值及数据表查询解决一个bug的问题
  3. java 命令直接执行(运行)jar 包的几种方法【笔记自用】
  4. Pytorch学习 - Task5 PyTorch卷积层原理和使用
  5. python super 变参数问题(五)
  6. opencv sobe 边缘检测算子
  7. tensorflow 进阶(四)---CNN
  8. 电脑下载的python在哪里_mac下 python3 安装--有说明原电脑安装的文件在哪里
  9. 15 分钟搭建一个基于XLNET的文本分类模型——keras实战
  10. java 左边补0_java基础知识