京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。
要懂得从大数据中还原数据真实,《决战大数据:驾驭未来商业的利器》一书传达的这个观点给笔者留下了深刻印象。大数据当然需要大量、海量的数据,但究竟是不是有些研究者和论者所说的无限数据,是一个重大疑问。信息搜集需要成本,还将面临用户隐私意识等障碍。更大的成本来源于存储和分析。
信息和数据分布从来就遵循幂律特点,如果数据挖掘以拒绝遗漏为原则,将产生大量的无意义劳动消耗,因为根据一部分数据其实就可以得出足够推导出80%-90%的结论。再者,大数据分析的重要意义在于改善实时分析,对数据搜集及处理速度有很高的要求,譬如电商企业不得不切实提高与用户的有效互动,要尽可能依据掌握并不全面的用户数据给出推荐,并就疑难及时响应。相反,如果数据处理和响应总带有迟滞性,企业希望搜集到足够的、全面的用户数据再给予响应,就必然错过时机。
海量数据还可能包含大量看上去彼此矛盾,甚至根本就带有误导性的数据内容。《决战大数据:驾驭未来商业的利器》一书的作者是阿里巴巴集团商业智能部副总裁、数据委员会会长车品觉,他在书中描绘了消费者通过智能手机等终端购物的一种常见场景:消费者早上看到某款好看的衣服,想要购买,在网上搜出大批量的相关商品;正在挑选时,被叫去开会,在开会时打开手机应用,发现了有诱惑力的促销广告,就下单购买了另外一类商品(比如手机)。
这起场景中,消费者先后使用了手机端和PC端,如果均保持同一个用户名的登录状态,其搜索数据和最终购买数据汇集在一起显然会让许多数据分析师抓狂。如果企业要求数据分析师从这些数据挖掘、还原用户的真实需求,难度可想而知。如果这一个消费者在手机端、PC端还使用不同用户名,又该搜集哪些、多少数据,才能做到辨识其身份?
车品觉指出,“大数据的真正价值是将数据用于形成主动收集数据的良性循环,以带动更多的数据进入这个自循环中”。要做到这一点必然是困难的,上述场景非常常见,直接原因是普通消费者使用互联网具有多场景,完全可能灵活的轮换使用PC端、手机端、智能穿戴设备等终端;往深了说,移动互联网时代,很多人的注意力是高度涣散的。许多时候,用户可能长时间停留于某个页面,这并不能表明其一定是在专心停留阅读,更大的可能在于消费者这时有事走开了,或者切换到别的终端界面。因此,数据挖掘分析必须承认这种手段的相对有效性、局限性。
书中提出,数据具有5大价值:识别与串联价值(根据大数据中的核心数据对用户真实身份、真实行为进行还原)、描述价值(在特定框架内找出核心用户、紧密购买行为数据)、时间价值(在特定时间段分析历史数据)、预测价值、产出数据的价值。这其中提到的特定框架,也就是说从海量数据中根据关联性,提取核心有用数据的范围。比如一个企业要判断是否继续使用导航网站的广告,就要明确导航网站引进的新老用户比、引进的新老用户的投入产出比和转化率、推断一旦撤去广告会带来的流失影响,还要对竞争对手进行行为分析预测(对方可能加强导航广告投入),这些限定因素将使得数据提取及后续分析就不会毫无章法。
这本书第二部分对阿里巴巴的大数据实践作了基本介绍。阿里巴巴成长到今天的规模,还能继续驾驭宏大的产品线和业务范围,电商行业内外有识之士都认为这应归功于阿里巴巴能够很好的实现数据化运营,可以通过海量数据成功实现即便是细小范围内的业务对比、细分及趋势预估。车品觉分享指出,阿里巴巴数据化运营落地是从“人”做起,利用好了“混、通、晒”三板斧。“混”就是让数据分析师与业务部门的人经常“混”在一起,这是确保两大部门培养商业和数字直觉的前提;“通”就是打通“混”的数据;在此基础上,让数据得以最有效的获取、使用、分享、协同、连接和组合,就是“晒”。
车品觉认为,2011年起,阿里巴巴已经开始从数据化运营向运营数据发展,形成了良性循环,走到了运营数据的外三板斧“存、管、用”。“存”指的是搜集并存储有效数据;“管”涵盖了数据的安全管理、让数据更趋准确稳定、更好运用数据等范畴;“用”,就是要从数据本身实现分裂和重组,推动颠覆性创新。书中就此对“用”这一层次,结合作者长期以来的从业实践及对京东、一号店等其他知名电商企业运营经验的观察,展开了颇为深入的梳理剖析。文章来源:CDA数据分析师培训官网
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在机器学习与数据分析领域,特征是连接数据与模型的核心载体,而特征重要性分析则是挖掘数据价值、优化模型性能、赋能业务决策的 ...
2026-01-27关联分析是数据挖掘领域中挖掘数据间潜在关联关系的经典方法,广泛应用于零售购物篮分析、电商推荐、用户行为路径挖掘等场景。而 ...
2026-01-27数据分析的基础范式,是支撑数据工作从“零散操作”走向“标准化落地”的核心方法论框架,它定义了数据分析的核心逻辑、流程与目 ...
2026-01-27在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19