2016年-Talkingdata_【智能数据技术峰会】探寻数据价值之路_20页_2mb
报告摘要
探寻数据价值之路总结
核心内容
本文档围绕Data Cloud智能数据平台的实践展开,重点介绍了数据价值模型、数据处理模型、数据同步机制以及数据质量评估等内容。文档旨在展示如何通过数据平台的构建与应用,实现数据从原始采集到价值挖掘的全过程。
数据价值模型 - WISDOM
数据价值模型由五个层级组成,从底层到顶层依次为:
- DATA:数据是记录或保存的事件或情景的符号。
- INFORMATION:信息是被赋予了意义和目标的数据。
- KNOWLEDGE:知识是把信息简洁而恰当的收集,使之有用。
- WISDOM:智慧是知识的应用,它知道为什么,知道如何去做。
这一模型强调了数据到智慧的转化过程,为数据价值的实现提供了清晰的路径。
数据处理模型
数据处理模型涵盖多个关键模块,包括:
- 数据接入:支持多种数据源接入,包括内部自有数据、外部自有数据及第三方数据。
- 数据连接器:用于连接不同的数据源。
- 数据同步器:实现数据的同步与更新。
- 数据源管理:统一管理各类数据源。
- 数据目录:对数据进行分类与管理。
- 数据概要:提供数据的简要描述与统计。
- 数据安全:保障数据在传输与存储过程中的安全性。
- 数据质量:通过多种标准评估数据质量,如及时性、完整性、一致性、准确性。
- 数据标签:为数据添加标签以增强可识别性。
- 元数据管理:管理数据的元信息。
- 数据工厂:用于数据的加工与处理。
- 可视化加工:支持数据的可视化操作。
- 交互式探索:用户可直接对数据进行探索与分析。
- 智能调度:实现任务的自动化调度。
- 智能清洗规则:提供自动化的数据清洗规则。
- 自定义算子:支持用户自定义数据处理逻辑。
- 数据发布:支持数据的快速发布。
- 敏捷发布:实现数据发布的灵活性与高效性。
- 访问审计:记录数据访问情况以确保合规性。
- 智能脱敏:对敏感数据进行脱敏处理。
数据同步的实践
- 数据同步主要针对实时性低、最终一致性的数据。
- 数据同步流程包括:查询数据 -> 转换数据 -> 插入数据。
- 为应对数据源变化,引入了UpdateTime和IsDeleted字段。
- 数据选取方式包括:
SELECT * FROM User WHERE UpdateTime >= DATE_SUB(Now(), INTERVAL 5 MINUTE)SELECT * FROM User WHERE UpdateTime >= #LastRunTime#SELECT * FROM User WHERE UpdateTime >= #LastRowTime#
数据质量评估标准
- 及时性:数据从产生到可用是否延时过长。
- 完整性:数据或元数据是否存在缺失。
- 一致性:数据是否遵循了统一的规范,是否符合逻辑。
- 准确性:数据是否存在异常或错误。
数据质量加工流程
- 数据清洗:包括数组拼接、数组抽取、删除某列、筛选多列、多值展平、查找替换、数值取整、数据抽样、时间转换、拼接多列、空值填充、长度计算、数值离散、空值过滤、数值过滤、分隔某列、文本截取、去除空格、规则过滤等。
- 数据合并:支持分组统计、数据关联等操作。
- 业务函数:如IMEI校验、坐标转换等。
数据集与数据转换
- 源数据:原始数据来源。
- 目标数据:经过处理后的数据。
- 数据转换:支持多种转换方式,包括数据清洗、数据合并、分组统计等。
数据探索提速机制
- 协同工作:不同角色之间可以高效协作。
- 屏蔽底层依赖:避免因存储版本变化导致的问题。
- 冷热数据分配:实现数据的智能存储与访问策略。
总结
Data Cloud智能数据平台通过WISDOM模型构建数据价值体系,结合数据接入、同步、清洗、质量评估、探索等模块,实现数据从采集到应用的全链路管理。平台支持多种数据源接入,具备强大的数据处理与分析能力,同时通过智能化手段提升数据探索效率,为业务提供数据驱动的决策支持。
数据体量与吞吐量
- 覆盖体量:
- 累计设备:40亿
- 日活设备:2.5亿
- 月活设备:6.5亿
- 数据吞吐:
- 每天新增数据:14T
- 每天交互会话:34亿
- 每天处理事件:370亿
技术栈
- Acceleration Layer:加速层,支持数据处理的高效性。
- Storage & Calculation:存储与计算模块,使用Spark、MR、Hive、Flink、YARN、HDFS、RMDB、HBase等技术。
联系方式
- 邮箱:hr@tendcloud.com
- 口号:Let’s rock data together!
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载