京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据产品到底应该是什么形态
大数据很时髦,但企业如何操作,如何落地,才是真正要面对的,好在现在我们看到很多朋友开始思考这样的实操性问题,本文将从大数据产品形态角度帮助我们理清一些概念。
嗨,朋友,看到这个标题请先别主观排斥,跟你一样,我也反感动辄乱谈大数据,为了后续的沟通愉快,先做下这里的“大数据“指向,特指符合4V特点的大数据,即:
1,数据体量巨大;
2,数据类型繁多;
3,价值密度低;
4,处理速度快。
所以,本文的“大数据”既不是有些人口中的海量数据,也不是非结构化数据,更不是什么相关与因果,这里不谈什么是大数据,只谈谈大数据的产品形态与商业逻辑,抛砖引玉,期待交流。
一、大数据的产品特性
顾名思义,“大数据产品”应该是基于大数据而设计出的产品,那么理应符合大数据的特点,毕竟基因在那,那么回顾下大数据与(传统)数据有哪些具体区别。
(传统)数据是通过问卷调查收集数据,或者是已存储的历史经营数据,比如财务数据、销售数据这些,至于数据量级,可能就是一台server的存储级别。
而大数据是海量,这个海量并不是某个时间断点的量级总结,而是持续有更新,持续有增量,那么就决定了可以”制造”出大数据产品的应该不是传统企业,而是类似电信、银行、微博这样的平台级机构,或者依附于平台级企业的第三方机构,亦或者是更宏观层面的政府管理机构。
这些机构拥有大量用户,可以源源不断的产生UGC数据,因此存储和计算成本必然会随之上涨,也就决定了大数据产品的甲乙方级别,屌丝可能会被无情的淘汰出局。这些数据不仅仅是数值型的结构化数据,还包括文本内容、图片、音视频等非结构化数据。
在处理速度上,(传统)数据使用excel或者spss,前期有严谨的方法论,后期有完善的分析处理过程,从数据的收集到最后报表/报告的产出,这个周期可能在至少一周以上,而大数据因为有了hadoop/storm等IT技术的支持,在处理速度上可以保证在小时级延迟,甚至更快。
这里需要补充一点的是,大数据产品是否要快速计算?个人觉得应该是,这里的快速是相对快,不一定非要实时,毕竟在收集、存储、计算上花了更多的成本,策略如果不及时发现,也对不起那些集群啊。
那么是否说大数据就一定比(传统)数据好了?不一定,引用祝建华老师《文科教授眼中的大数据》里的一段话,“理论上讲大数据指的应该就是总体数据。但实际上,由于技术、商业、保密和其它原因,除了少数大数据的原始拥有者,对于绝大多数的第三方来讲,现在大家讲的大数据,基本上都不是总体数据而是局部数据。注意,这种局部数据,哪怕占了总体的很大一个百分比(70%、80%),既不是总体数据、也不是抽样数据。因为哪怕是缺了10%、20%的个案,局部数据跟总体也许就有很大的差别。”
所以在总体代表性上,(传统)数据可以较好的代表整体,而大数据可能会出现偏差。但是,这个偏差并不影响大数据产品的商业应用,举个例子,微博上每天都有各种口碑和舆情,如果涉及某个企业的负面舆情突然趋势走高,即使在不能代表总体的情况下,你能认为这个态势不值得警惕么?当然是不能。并且,大数据产品对使用者的要求更高了,不光关注活跃的数据,还得关注沉默的数据。
由此,大数据产品所具备的特性应当是:
1、数据量级更多;
2、数据处理速度更快;
3、数据类型多样;
4、使用者要求更高。
那么,大数据产品究竟长啥样?
二、大数据的产品形态
先说一个亲身经历,在家收看好声音导师考核的汪峰场,之前一直很期待这场,毕竟汪峰的风格理念偏重社会观察,偏重人文洞察,但看到快一半的时候,却发现很乏味,想换台,没有那英那场更黏我,如果说看上一场脸部肌肉是松弛的话,那这一场则是紧绷的,”上苍、思念、回忆、故人、泪水….”当这些碎片词语不断的充斥在我的耳边时,真的不觉得这是一个娱乐节目,一个比一个悲凉,我的诉求很简单,像看周星驰无厘头电影一样,开心一下足矣,哪怕没有任何的教育意义。
随后我发了一条微博吐糟,引来众多附议。我想这应该是不少受众当时的心态,但不代表对汪峰场的整体评价。那么,试想一下,如果你是好声音的竞争对手,在此刻很实时的洞察到了用户的心情反馈,再通过合适的路径传递出营销信息,受众是否会换台?答案是未知的,但想象空间是巨大的。
这个场景很恰如其分的给我们描绘出了大数据的产品形态。首先他需要在平台级机构(微博)上监控海量数据(微博内容),这些数据是非结构化的,通过实时计算获得洞察(拥有不满情绪的是少量群体还是大量群体,是真实声音还是噪音污染),并快速应用(推送营销信息)。
这样的例子还有很多,特别是在营销环境里,受众的情绪不是线性稳定的,可能十分钟前还是心情愉悦的,而十分钟后,则是心情紧张的,不利于接受你的品牌信息并形成记忆,这些情绪的变化是随机动态的,因环境的变化而随之变化。还有哪些属于大数据产品呢,仅以我所了解的互联网领域为例,DSP、RTB、推荐系统,另外就是宏观的情报系统了,比如联合国的全球脉动项目。
三、总结
综上所述,大数据的产品形态应该是,运行在平台级机构之上,通过对持续性海量增加的多结构类型数据,进行快速计算产生策略,结合使用者的经验认知及时应用,进而产生价值形成商业闭环,一切不以此为特性的大数据产品都是耍流氓!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
箱线图(Box Plot)作为数据分布可视化的核心工具,能清晰呈现数据的中位数、四分位数、异常值等关键统计特征,广泛应用于数据分 ...
2026-01-28在回归分析、机器学习建模等数据分析场景中,多重共线性是高频数据问题——当多个自变量间存在较强的线性关联时,会导致模型系数 ...
2026-01-28数据分析的价值落地,离不开科学方法的支撑。六种核心分析方法——描述性分析、诊断性分析、预测性分析、规范性分析、对比分析、 ...
2026-01-28在机器学习与数据分析领域,特征是连接数据与模型的核心载体,而特征重要性分析则是挖掘数据价值、优化模型性能、赋能业务决策的 ...
2026-01-27关联分析是数据挖掘领域中挖掘数据间潜在关联关系的经典方法,广泛应用于零售购物篮分析、电商推荐、用户行为路径挖掘等场景。而 ...
2026-01-27数据分析的基础范式,是支撑数据工作从“零散操作”走向“标准化落地”的核心方法论框架,它定义了数据分析的核心逻辑、流程与目 ...
2026-01-27在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20