京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。
要懂得从大数据中还原数据真实,《决战大数据:驾驭未来商业的利器》一书传达的这个观点给笔者留下了深刻印象。大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。信息搜集需要成本,还将面临用户隐私意识等障碍。更大的成本来源于存储和分析。
信息和数据分布从来就遵循幂律特点,如果数据挖掘以拒绝遗漏为原则,将产生大量的无意义劳动消耗,因为根据一部分数据其实就可以得出足够推导出80%-90%的结论。再者,大数据分析的重要意义在于改善实时分析,对数据搜集及处理速度有很高的要求,譬如电商企业不得不切实提高与用户的有效互动,要尽可能依据掌握并不全面的用户数据给出推荐,并就疑难及时响应。相反,如果数据处理和响应总带有迟滞性,企业希望搜集到足够的、全面的用户数据再给予响应,就必然错过时机。
海量数据还可能包含大量看上去彼此矛盾,甚至根本就带有误导性的数据内容。《决战大数据:驾驭未来商业的利器》一书的作者是阿里巴巴集团商业智能部副总裁、数据委员会会长车品觉,他在书中描绘了消费者通过智能手机等终端购物的一种常见场景:消费者早上看到某款好看的衣服,想要购买,在网上搜出大批量的相关商品;正在挑选时,被叫去开会,在开会时打开手机应用,发现了有诱惑力的促销广告,就下单购买了另外一类商品(比如手机)。
这起场景中,消费者先后使用了手机端和PC端,如果均保持同一个用户名的登录状态,其搜索数据和最终购买数据汇集在一起显然会让许多数据分析师抓狂。如果企业要求数据分析师从这些数据挖掘、还原用户的真实需求,难度可想而知。如果这一个消费者在手机端、PC端还使用不同用户名,又该搜集哪些、多少数据,才能做到辨识其身份?
车品觉指出,“大数据的真正价值是将数据用于形成主动收集数据的良性循环,以带动更多的数据进入这个自循环中”。要做到这一点必然是困难的,上述场景非常常见,直接原因是普通消费者使用互联网具有多场景,完全可能灵活的轮换使用PC端、手机端、智能穿戴设备等终端;往深了说,移动互联网时代,很多人的注意力是高度涣散的。许多时候,用户可能长时间停留于某个页面,这并不能表明其一定是在专心停留阅读,更大的可能在于消费者这时有事走开了,或者切换到别的终端界面。因此,数据挖掘分析必须承认这种手段的相对有效性、局限性。
书中提出,数据具有5大价值:识别与串联价值(根据大数据中的核心数据对用户真实身份、真实行为进行还原)、描述价值(在特定框架内找出核心用户、紧密购买行为数据)、时间价值(在特定时间段分析历史数据)、预测价值、产出数据的价值。这其中提到的特定框架,也就是说从海量数据中根据关联性,提取核心有用数据的范围。比如一个企业要判断是否继续使用导航网站的广告,就要明确导航网站引进的新老用户比、引进的新老用户的投入产出比和转化率、推断一旦撤去广告会带来的流失影响,还要对竞争对手进行行为分析预测(对方可能加强导航广告投入),这些限定因素将使得数据提取及后续分析就不会毫无章法。
这本书第二部分对阿里巴巴的大数据实践作了基本介绍。阿里巴巴成长到今天的规模,还能继续驾驭宏大的产品线和业务范围,电商行业内外有识之士都认为这应归功于阿里巴巴能够很好的实现数据化运营,可以通过海量数据成功实现即便是细小范围内的业务对比、细分及趋势预估。车品觉分享指出,阿里巴巴数据化运营落地是从“人”做起,利用好了“混、通、晒”三板斧。“混”就是让数据分析师与业务部门的人经常“混”在一起,这是确保两大部门培养商业和数字直觉的前提;“通”就是打通“混”的数据;在此基础上,让数据得以最有效的获取、使用、分享、协同、连接和组合,就是“晒”。
车品觉认为,2011年起,阿里巴巴已经开始从数据化运营向运营数据发展,形成了良性循环,走到了运营数据的外三板斧“存、管、用”。“存”指的是搜集并存储有效数据;“管”涵盖了数据的安全管理、让数据更趋准确稳定、更好运用数据等范畴;“用”,就是要从数据本身实现分裂和重组,推动颠覆性创新。书中就此对“用”这一层次,结合作者长期以来的从业实践及对京东、一号店等其他知名电商企业运营经验的观察,展开了颇为深入的梳理剖析。文章来源:CDA数据分析师培训官网
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Excel数据分析中,数据透视表是汇总、整理海量数据的高效工具,而公式则是实现数据二次计算、逻辑判断的核心功能。实际操作中 ...
2026-04-30Excel透视图是数据分析中不可或缺的工具,它能将透视表中的数据快速可视化,帮助我们直观捕捉数据规律、呈现分析结果。但在实际 ...
2026-04-30 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-04-30在中介效应分析中,人口统计学变量(如年龄、性别、学历、收入、职业等)是常见的控制变量或调节变量,其处理方式直接影响分析结 ...
2026-04-29在SQL数据库实操中,日期数据的存储与显示是高频需求,而“数字日期”(如20240520、20241231、45321)是很多开发者、数据分析师 ...
2026-04-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-04-29在手游行业竞争日趋白热化的当下,“流量为王”早已升级为“留存为王”,而付费用户留存率更是衡量一款手游盈利能力、运营质量的 ...
2026-04-28在日常MySQL数据库运维与开发中,经常会遇到“同一台服务器上,两个不同数据库(以下简称“源库”“目标库”)的表数据需要保持 ...
2026-04-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-04-28箱线图(Box Plot)作为一种经典的数据可视化工具,广泛应用于统计学、数据分析、科研实证等领域,核心价值在于直观呈现数据的集 ...
2026-04-27实证分析是社会科学、自然科学、经济管理等领域开展研究的核心范式,其核心逻辑是通过对多维度数据的收集、分析与解读,揭示变量 ...
2026-04-27 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-04-27在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22