京公网安备 11010802034615号
经营许可证编号:京B2-20210330
浅谈数据分析中的“暗物质”
我们分析数据,更重要的是看到数据中所隐藏的暗物质,即数据图中你看不见的数据\逻辑\知识。
开门见山,以下是某新闻媒体WAP\APP\PC三端的分周中和周末的PV曲线,下面尝试分析其中是否存在某种规律。
图一:newsAPP某周一库存
图二:newsAPP某周日库存
1.数据的准确性和代表性
在分析数据之前,有一个非常重要的事情,大家往往会忽略,那就是数据的置信度是多少。
如果数据的准确性本身存在问题,那能产出正确结果的概率与买彩票中奖的概率大概相差无几。即便数据是准确地,那还得证明数据具有代表性,你是不是只抽取了一天的数据,你是不是只抽取了一端的数据。
自然,很多时候,你必须要进行抽样,那你更要谨慎了,因素那么多,你要保证自己在数据采样过程中,考虑了应该考虑的因素。当然,这些数据对于这个结论很具有代表性,对于另一个分析目的却有可能完全没有代表性,这些都不能一概而论。
总之,数据准确性这个问题基本上要在分析之前给出确定的答案。而数据是否具有代表性这个问题由于比较复杂,尽可能的在分析之前考虑清楚的同时,在分析过程中,一定要随时保持着质疑精神,每向前一步,都要重新考虑数据样本是否还具有代表性。
图三:newsWAP某周一库存
图四:newsWAP某周末库存
2.看图说话
以下图中数据经受过了我们多方位的考验,所以数据基本准确,代表性具体要看你的分析目的。
基本确定了准确性和代表性后,怀着高度质疑的精神,让我们开始我们的分析之旅。
首先,单独来看每一个图,大家可以很清晰的理解,这六条PV曲线都是与用户的行为息息相关的。从各条PV曲线的变化来看,用户7:00-8:00起床的比较多,22:00是一个大家进入休息比较集中的时间点。凌晨的2:00-5:00是用户活动的低谷,而波峰在时间上一般是20:00-22:00。
图五:newsPC某周一库存
图六:newsPC某周日库存
3.多项对比
说到这里,细心的大家可能对图五\图六中的数据表示质疑。因为它不符合我们刚才推出来的规律。
比如说,PC端一天中的波峰时间是每天的9:00-10:00,而且周一和周日的PV曲线变化非常大。 周一的数据量大周日一两倍的样子,而且周日白天的波动比较缓和,而周一的波动非常大,存在多个波峰波谷。相反,APP\WAP在周日和周一的PV总量并未出现明显变化,而且曲线变化规律也大抵相同。
4.挖掘暗物质
所谓暗物质,就是数据图中你看不见的数据\逻辑\知识。
所谓的数据分析或者挖掘就是挖掘各个数据之前的关联,数据与暗物质之间的关联。
仔细想来,我在“看图说话”中的推理其实利用了先验知识,也就是说大家有起床后看新闻和睡觉前看新闻的习惯,事实真的是这样吗?事实大概确实如此,但是在分端上可就不同了。
APP\WAP都是移动设备上可以触及的渠道,所以基本可以与用户的起居习惯相吻合。但是PC端并非触手所及,并不能完全和用户的起居相吻合,毕竟你零碎时间里可以打开手机,却不太可能去打开电脑。
上面我说到PC端并不能很好的反映用户的起居,那他能反映用户的什么呢。想想我们平时使用PC的场景,PC端数据是否能反映用户的上班时间特性?这点确实能给出数据支持。
一是周一比周日PV量大,说明周末使用PC的用户少,周中上班时间就身不由己了,所以PV量比较大。周日和周一的曲线波动也完全能理解了,周一的PV的上涨时间落后于起居时间是因为那是上班时间,延迟的一小时左右要吃饭\要挤地铁啊,9:00左右(上班的集中时间点)大家都坐定了,刷一下新闻,PV量也就达到最大。
9:00-11:00期间的PV量几乎没有太大变化,但11:00开始就开始慢慢下跌了,一直持续到12:00,这个可能与大家要逐渐去吃午饭相关,经过了12:00-14:00的午休阶段,PV量存在一定上涨。
等到下午17:00,又开始下降了,到了18:00基本降得差不多了。大家基本都已经下班了。所以,我们可以说周日创造PV的这些用户,周中也会同样创造PV,而周一多出来的这些PV,其用户特征完全符合上班特性,或者说其特性完全符合朝九晚五的上班族。
5.反复求证
你的数据真的对了吗? 那我们可以说创造PC端PV波动的这些朝九晚五的用户是国企员工吗?我们可以说国企员工上班就是看看新闻,聊聊天吗?那我们是否可以说互联网员工上班就不看新闻。
我们取得就是来看新闻的UV产生的PV数据,得出来的数据当然是这样了。互联网员工的行为是否被湮没在其他原因中了?这是我上面提到的,始终要保持质疑精神。你的数据对于之前的分析是有代表性的,可是分析以上问题,可以说是一点代表性都没有。
有些人数据分析时已经早有结论,往往数据选择和分析时便会不自觉的有所倾向,难免会得出与自己假设相同的结论。所以我们在得出结论时,其实还要从其他很多方面进行求证,包括去掉某因素后,现象是否会消失等等。
6.你的结论真的对了吗?
之前朋友圈流传着这样一个消息:有权威分析机构经过数据分析发现,战狼2和疯狂动物城的票房都很高,但两者用户重合度并不高。战狼2的观看用户更喜欢喝冷饮,而疯狂动物城的用户却更喜欢奶茶。但其实疯狂动物城上映在冬季,而战狼2上映在夏季。即便经过反复求证,我们也只能说是结论的置信度越来越高了,并不能证明这是对的。所以,除了尽可能的反复求证,剩下的方法是就是进行数据驱动策略的验证了。验证可以分为对照组等等,此处不再赘述。
7.猜猜他的用户
如果你细心一点,便会发现newsAPP\WAP两端在周日的变动相比周一稍稍延后,这估计和大家的周末作息习惯延后有关,至于为什么延后并不多,那说明主流用户肯定不是那些“上班睡不醒,周末睡不着的”年轻人啊。
8.写在最后
就是这几张平时用来做实时监控的曲线还能扯出这么多东西来?来张照片给大家。
【以下内容来自百度】中国最著名“照片泄密案”,是由1964年《中国画报》封面刊出的一张照片引起的。在这张照片中,大庆油田的“铁人”王进喜头戴大狗皮帽,身穿厚棉袄,顶着鹅毛大雪,握着钻机手柄眺望远方,在他身后散布着星星点点的高大井架。日本情报专家据此解开了中国当时最大的石油基地–大庆油田的秘密。
1、他们根据照片上王进喜的衣着判断,只有在北纬46度至48度的区域内,冬季才有可能穿这样的衣服,因此推断大庆油田位于齐齐哈尔与哈尔滨之间。
2、通过照片中王进喜所握手柄的架式,推断出油井的直径;
3、从王进喜所站的钻井与背后油田间的距离和井架密度,推断出油田的大致储量和产量。有了如此多的准确情报,日本人迅速设计出适合大庆油田开采用的石油设备。当中国政府向世界各国征求开采大庆油田的设备方案时,日本人一举中标。
庆幸的是,日本当时是出于经济危机,根据情报分析结果,向我国高价推销炼油设施,而不是用于军事战略意图。
所以数据分析中最重要的是什么?暗物质啊!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、质量控制、科研实验等场景中,数据波动性(离散程度)的精准衡量是判断数据可靠性、稳定性的核心环节。标准差(Stan ...
2026-01-29在数据分析、质量检测、科研实验等领域,判断数据间是否存在本质差异是核心需求,而t检验、F检验是实现这一目标的经典统计方法。 ...
2026-01-29统计制图(数据可视化)是数据分析的核心呈现载体,它将抽象的数据转化为直观的图表、图形,让数据规律、业务差异与潜在问题一目 ...
2026-01-29箱线图(Box Plot)作为数据分布可视化的核心工具,能清晰呈现数据的中位数、四分位数、异常值等关键统计特征,广泛应用于数据分 ...
2026-01-28在回归分析、机器学习建模等数据分析场景中,多重共线性是高频数据问题——当多个自变量间存在较强的线性关联时,会导致模型系数 ...
2026-01-28数据分析的价值落地,离不开科学方法的支撑。六种核心分析方法——描述性分析、诊断性分析、预测性分析、规范性分析、对比分析、 ...
2026-01-28在机器学习与数据分析领域,特征是连接数据与模型的核心载体,而特征重要性分析则是挖掘数据价值、优化模型性能、赋能业务决策的 ...
2026-01-27关联分析是数据挖掘领域中挖掘数据间潜在关联关系的经典方法,广泛应用于零售购物篮分析、电商推荐、用户行为路径挖掘等场景。而 ...
2026-01-27数据分析的基础范式,是支撑数据工作从“零散操作”走向“标准化落地”的核心方法论框架,它定义了数据分析的核心逻辑、流程与目 ...
2026-01-27在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21