本人多年大数据数仓开发经验,深耕金融信贷行业离线数仓搭建,熟练掌握 Hive、Spark SQL、MySQL 等主流技术,精通标准数仓分层架构,熟练完成 ODS、DWD、DWS、ADS 全流程开发。
擅长业务需求梳理、维度建模、指标开发、数据清洗、数据对账、SQL 性能调优,可独立完成数据表设计、脚本开发、任务调度、数据倾斜优化、小文件治理等工作。
熟悉事务事实表、周期快照、累计快照等多种模型用法,具备丰富报表开发、临时取数、数据迁移、业务复盘数据支撑经验
用户画像项目:
1.标签体系搭建:负责和业务人员对接,梳理标签需求,拆解标签业务逻辑,组织标签计算口径,完成标签体系建设
2.标签模型设计:采用横表加竖表的模式设计标签模型,用户基础标签比如,基本属性、行为属性、授信属性、信用风险属性等标签采用竖表模型,竖表易于拓展,方使代码并行开发,业务应用标签比如授信层级标签,信贷会员标签等标签采用横表模型,横表可以降低存储成本,提高查询性能
1、标签开发:负责部分统计类,规则类标签开发及合并大宽表,其中宽表生成SQL语句使用spark引擎执行,通过spark参数调优、join语句数据表顺序调整,使用bucket ioin等方式提升宽表的生产效率,开发的标签有累计贷款金额,近一个月成功支付非金融订单数、RFM模型阶段等标签,并将建设完成的标签数据同步到为下游提供查询服务的数据库中
4.标签数据质量保障:从全流程上来保证,如遵循标签生命周期管理流程,遵循标签上下架规范,技术方面,监控标签ETL
完整性,如数据是否异常;标签生产的时效性,如确保数据能够及时更新;标签数据的完整性,如uuid字段不为空等;
5.标签管理:基于用户画像平台对标签进行管理维护,包括标签创建、上线、评估、变更、下线等整个声明周期
6.标签治理:参与标签评分模型的建设,基于标签的质量、使用情况、关注度、安全性等方面评估业务收益,并进行标签优化,如任务链路优化、标签下线等。
项目成果:
1.基于用户画像的精准营销活动,新贷款人数提升了5.32%,6个月内活跃客户增长25.36%。
2.提前识别了潜在的高风险客户,采取针对性措施,客户流失率降低了12.24%。
3.通过横表加昱表设计模型,查询性能提升30%,能够支持更高效的业务分析和决策。
4.营销活动转化率从9.83%提升至16.24%,客户满意度从78.35%提升至86.34%,客户体验明显改善。
金融信贷数仓项目:
1.需求承接:与产品方讨论需求。对实现需求的关键点进行确认,包括数据口径、接口格式、供数频率、需求优先级
2.模型设计开发:结合业务需求,划分总线矩阵,确立分析维度,结合维度建模理论,完成DWD、DWS层各数据域模型如授信域、风控域的设计与开发,并在ADS层生成个性化指标数据,为贷前、贷中、贷后提供数据支持;
3.BI报表开发:全链路开发监控报表十余张,如授信域的授信通过率报表、提额通过率监控报表;风控域的贷前风控报表
贷中风控报表、反欺诈监控报表;催收域的催回率报表,坏账回收率分析报表等。
4.标签开发:负责部分统计类标签,如用户基本属性标签、用户行为统计标签、用户风控信息标签等,然后将开发好的标签推送至Hbase存储,基于标签开发用户画像报表。
5.性能优化:在工作中采用代码或者参数优化进行调优,比如开启map端聚合、负载均衡、拆分热点值等多种方式解决数据倾斜问题,通过参数调优、小文件合并、并行度设置等方式对执行层调优,提高任务的执行性能
6.任务运维保障:参与任务运维保障机制,包括数据质量、数据安全,存储计算进行检查,提升任务产出的稳定性和时效性保障,对SLA核心任务异常,采用电话告警方式通知负责人,针对普通任务异常,采用短信告警方式通知
1、命名规范与指标管理:推动字段和表的命名规范化,提升元数据完整性,确保数据的一致性。通过公司自研的指标管理平台,统一指标口径和定义流程,解决口径不一致导致的指标歧义问题
2、数据模型优化:将应用层指标下沉与复用,如贷前全产品流程分析报表、贷前授信通过率报表,然后根据数据域、周期和维度拆解出来申请日期、授信申请人数、授信通过人数等指标,并将其放入DWS公共层,减少重复逻辑代码,提升数提的复用率。另外通过分析ADS层对ODS层的跨层引用,重新构建数据至DWD和DWS层,减少跨层依赖
9.计算资源优化:通过分析核心数据任务的计算数据,识别出高消耗任务并进行优化,包括对Hive和Spark作业的内存管理、并发设置、Shufle调优等进行针对性调整。同时,利用任务调度优化技术,比如资源隔离、任务优先级设置等,巡免资源争夺和集群过载问题。对于复杂任务,还可结合业务逻辑进行任务拆分或数据倾斜处理,确保计算资源的高效使用,减少任务执行时间和集群资源消耗。
10.存储成本优化:通过存储资源元数据表,识别出低频访问,长期报错的临时表和无用表及对应作业,经内部确认过后进行下线处理。其次根据数据的访问频率和价值,动态调整生命周期策略。对于重要目频繁访问的数据,适当延长生命周期
同时对小文件进行合并操作,有效减小了NameNode存储压力。
项目成果:
1.通过对数仓的规范化建设,保障了技术和团队口径的统一,降低了沟通成本,提升了开发效率
2.通过对模型优化和任务优化,高资源消耗任务的执行时间平均缩短了45%左右
3.SLA平均产出时间由原来的9点提升至现在的7点,提高了数据处理的及时性和准确性。
4.建立了公司夜间任务运维保障机制,确保任务产出的稳定性和时效性,任务故障率从0.35%降到了0.12%,任务故障处理时间从平均2小时降到了40分钟。
5、通过解决字段、表,模型存在的命名不一致问题,使得表字段模型的规范化程度提升36.8%
6、通过梳理ADS层重复计算的指标,维护指标体系,指标重复开发率降低61.4%。指标口径不一致情况减少82.6%。
可兼职时间
可兼职地点
0条评论 雇主评价