京公网安备 11010802034615号
经营许可证编号:京B2-20210330
吃饭、睡觉、旅行、走路、购物,所有纯物理性的行为都成为可被记录数据的组成部分,这些看似与我们的生活、工作、赚钱等无关的行为,正成为新时期的价值瑰宝,谷歌、亚马逊、Facebook、百度、阿里巴巴等均陷在其中而不能自拔。
近期,腾讯、搜房、浪潮集团、易观等纷纷与统计局签署了大数据战略合作框架协议,再加上去年签署的11家公司,越来越多的互联网公司、传统企业数据正被纳入新构建的大数据“基地”当中。
不少人对大数据的概念有很大误解,甚至有不少公司搭上“大数据”的概念来玩资本运作。大数据并不仅仅是“大”,但它首先得“Bigger”,拥有足够量级的数据才能被称作大数据,所以你看到仅仅分析几百人的数据就说自己是大数据的公司基本上都是骗子。我不认为当前有多少公司量级的数据能够是“Bigger”的。对于用户级市场,至少该产品的用户量达到亿级,达到该产业用户量的前几名;对于企业级市场,也至少得拥有足够量级的企业用户,才算得上拥有大数据的基础,再加上用户使用各个产品的习惯大不相同,所以当前的大数据绝对是缺憾的,抽样数据并不准确不是么?多谈无益,故本文纯从数据来分析。
数据的记录
数字产品的出现,迅速让用户的个人信息能够被记录,电脑、智能手机、可穿戴设备、智能硬件、未来的智能电视等正成为数据记录的新工具,其中较为热门的是围绕医疗需求来建立相关的数据记录,睡眠、血压、体重等产品较多,虽然这些产品的用户量并不“多”,但是硬件厂商们依然乐此不彼的做着这一切。
要想让数据能够真正的发挥作用,首先这些数据肯定得被记录,必须有了记录才会有相关的模型分析,否则都是纸上谈兵。比如用户的睡眠时间、用户的出行时间、用户每天所摄入食物的卡路里、用户吃饭的消费金额等等,所有出现的物理性数据,只有被记录了这些数据才会有价值,没有记录,这些都是“废物”,没人会重视这些物理性动作的价值。
数据如何才能被记录?首先得有工具,拿医疗为例,我们在医院看病,医生会使用相关仪器记录用户的心跳周期;我们去餐厅吃饭,餐厅会记录每桌顾客的消费记录以及用户最爱点的菜品;我们在网上使用搜索引擎,搜索引擎会记录用户的搜索习惯。医疗器械、ERP系统、电脑等成为了数据记录的工具。
数据被记录是用户被动选择的结果,如果用户不去医院检查,那么数据就不会被记录,用户去了B餐厅而不是A餐厅消费,A餐厅也无法获取到用户的喜爱。所以,可穿戴设备、智能硬件等都试图让用户能够主动将自身的数据被记录,应该说这也是UGC模式的一种,用户自愿将自身的数据提供到平台上去,供平台进行分析。
被动和主动的区别是非常大的,被动就意味着有用户的数据会流失掉,当流失掉的这部分用户足够多以后,新的数据模型就无法完成。记录是数据的基础,接下来就是连接。
连接
用户不可能一直在某个餐厅消费,也不可能一直在某一个地方睡眠,至于可穿戴设备,用户也很难做到每天都按时去佩戴,让自身的数据可以记录。单个用户某一行为被不同商家记录,而这些商家记录的数据是分离的、独立的,无法形成连贯性,当这些被记录的数据到了一定时间滞后,肯定是面临被丢弃的命运。让数据能够同平台的相互连接,要比单个“独霸”有用的多。
另一方面,就是数据和用户的连接,如何让用户的数据能够被主动贡献出来,并通过互联网、移动互联网相互连接,形成数字存储而不是纸质记录,这是当前围绕数据进行创业者的思考。
跨界连接是最困难的,就像拼图一样,如何通过混乱的形体组合,形成有效的画面。比如餐饮和超市购物、搜索和社交、电商和社交等,这些数据得形成有效的连接。单一的从搜索行为就分析出用户的购物行为或者其他行为是有失偏颇的,搜索的需求太单一,并不能是用户整个的行为特征。只有综合用户搜索、购物、社交等多个使用行为,才能有效的分析出用户的某个行为特征。
有效的价值转化
从记录→连接→价值转化,这肯定是一个漫长的过程,要知道先祖们用了数千年的时间也仅将少量的数据形成转化并遗传下来。互联网、移动互联网在国内的发展还不足20年,而数据从被重视到被记录到被连接,就更是一个漫长的过程,目前市场上的智能手环、智能手表、无线路由器、盒子等产品虽然都不尽人意,但是其无一不在让数据变的有效的道路上奋斗着。
将用户的搜索数据记录并有效价值转化,最早的案例是谷歌当年预测流感病毒,当然,已有不少互联网公司都有将用户数据记录、连接并实现有效的价值转化。互联网公司离数字存储最近,占据着有利条件,能够更敏锐也是正常。
不过,仅仅有互联网的数据是不完全的,用户在线下的数据,用户在生活中的数据,在更多不使用互联网情况时使用的数据,我把它称之为物理数据,这部分数据是现实生活当中的数据,其价值要高于互联网络上的数据的,互联网公司们正在吸收着这些数据。
数据的有效转化,可以体现在几个方面,一是预防,针对企业级的。应该说每个行业都有泡沫的存在,就算没有泡沫,也会有倒闭的风险,通过对相关数据的分析,可以对未知的风险起到一定的预防措施,即使不能避免,至少能更大程度上的减少损失,并能够助力公司挺过这场风暴。
一是隐性价值,针对用户级的。比如时间成本,通过地图工具和当地公交系统对接,让用户实时了解公交车的到站时间,节约用户等待公交车的时间,海量用户的时间成本加起来,肯定是一笔不菲的价值。再比如健康预防,越来越多的慢性病开始向用户渗透,通过对相关数据记录、连接,让用户能够尽早预防慢性病的发生,比如肥胖的问题(健康产品的前提是有高质量的医疗体系在背后支撑)。
让所有可能有价值的数据都被记录、连接,再将这些数据分析之后,实现有效的价值转化,互联网公司、传统企业、统计机构、用户,所有人都是这场风暴的参与者。我们应该给予正在为这场大风暴做贡献的企业和创业团队,可能有人被“掉队”,也有人可能在这场风暴中崛起。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Excel数据分析中,数据透视表是汇总、整理海量数据的高效工具,而公式则是实现数据二次计算、逻辑判断的核心功能。实际操作中 ...
2026-04-30Excel透视图是数据分析中不可或缺的工具,它能将透视表中的数据快速可视化,帮助我们直观捕捉数据规律、呈现分析结果。但在实际 ...
2026-04-30 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-04-30在中介效应分析中,人口统计学变量(如年龄、性别、学历、收入、职业等)是常见的控制变量或调节变量,其处理方式直接影响分析结 ...
2026-04-29在SQL数据库实操中,日期数据的存储与显示是高频需求,而“数字日期”(如20240520、20241231、45321)是很多开发者、数据分析师 ...
2026-04-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-04-29在手游行业竞争日趋白热化的当下,“流量为王”早已升级为“留存为王”,而付费用户留存率更是衡量一款手游盈利能力、运营质量的 ...
2026-04-28在日常MySQL数据库运维与开发中,经常会遇到“同一台服务器上,两个不同数据库(以下简称“源库”“目标库”)的表数据需要保持 ...
2026-04-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-04-28箱线图(Box Plot)作为一种经典的数据可视化工具,广泛应用于统计学、数据分析、科研实证等领域,核心价值在于直观呈现数据的集 ...
2026-04-27实证分析是社会科学、自然科学、经济管理等领域开展研究的核心范式,其核心逻辑是通过对多维度数据的收集、分析与解读,揭示变量 ...
2026-04-27 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-04-27在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22