
大数据在互联网用户系统中的应用
但是对于今日的互联网和移动互联网,大数据的规模和应用深度早已不次于传统的电信、民航等行业,甚至超过不少。因此笔者还是想写些东西浅谈一下互联网的大数据应用,权当抛砖引玉,也希望更多的朋友参与交流和讨论。
首先,第一篇想谈一下互联网的用户系统。无论互联网还是移动互联网,本身具有很大的特性就是互联,所以我们都可以称之为互联网,或者说移动互联网是互联网的一个子集和延伸。
在传统的电信、民航、能源等行业,企业的客户和主体用户构成都是有身份ID的。比如电信行业中身份证登记的手机卡号,比如民航用户乘坐航班登机的身份证或护照信息等,这些信息可以作为基本的用户身份ID,便于企业对其用户、客户进行身份辨别,并对后续的用户行为进行跟踪和分析。传统企业所存储的用户信息的很大优势在于完整性,很多先天的比如姓名、性别、年龄甚至籍贯等真实的基础身份信息都可以简单获得。而在互联网上,用户的访问都是匿名的,即使用户在接入互联网的时候使用的登记信息是实名的,但那主要是提供给电信服务商和公共安全机构备案而用。普通的互联网网站在用户面前是完全透明的被"围观"的,这个状况在web1.0
的主要产品--门户网站中最为典型。到了web2.0
时代,互联网开始变得互动起来,用户从简单的匿名浏览,变成了可以通过注册身份参与信息的制造和流通。这个时候,诞生了这个时代在谈的互联网大数据应用中非常重要的一个非决定性条件--用户身份系统。为什么说是"非决定性条件"呢?因为,在这之前,大量的数据分析也是可以做的,但是由于对用户缺乏身份缺乏甄别,因此数据分析能够应用的场景和得到的数据都相对很有限,但并不代表不能做大数据分析。而web2.0
的用户身份系统诞生,则使互联网某种程度上具有了和传统行业同样的用户身份记录系统,数据统计和分析都可以更精准和深入。其中,以腾讯QQ、新浪UC等PC桌面产品为代表的互联网早期产品,应该是建立了互联网更早的用户身份系统,我们也可以看到这些系统在其后续的web产品铺开时同样被继承了过来。
那么,互联网的用户身份系统,一般都具有哪些信息呢?
打开任何一个网站,我们都可以看到注册页面需要填写用户名/email,性别,年龄
等基本信息。当然,不同的网站和互联网产品有不同的用户资料细化的程度。拿现在比较流行的几款产品做比较,其他互联网产品大多类似:1.
新浪微博中用户可以填写自己的昵称、头像、真实姓名、所在地、性别、生日、博客地址、email、QQ/MSN、自我介绍、用户标签、教育信息、职业信息……;2.腾讯QQ客户端上可以填写头像、昵称、个性签名、姓名、性别、英文名、生日、血型、生肖、故乡、所在地、邮编、电话、学历、职业、语言、手机……
看起来还真不少,那么网站要用户的这些信息会被干嘛用呢?
这里笔者刘三德认为主要有以下几点:1.
展示自我;2.作为唯一的身份ID用作用户身份区别;3.搜索和推荐相关;4.网站自身可以做用户分析和用户行为跟踪。展现自我放到第一位是因为这是从产品满足用户需求的角度决定的,用户资料的首要任务就是为了作为用户唯一的可识别身份标识展示自我。其次,搜索和推荐相关这一点笔者刘三德计划在后续用专门的篇章来写,此处简单理解即可。最后一点,也就是本文所关注的一点,就是用用户身份来做数据分析。涉及到的用户分析主要维度为用户资料和用户行为。同样,用户行为也计划在后续篇章专门来写,本文着重讨论一下用户资料的分析。
可能行业内的一些文章和老前辈的观点,数据首先要量大、其次要有高的复杂度,才可以称为大数据。但笔者认为,大数据在一维的层次上不一定具有很强的复杂度,大部分是由最简单的数据形式构成。就譬如用户资料,一个网站如果有一千万的注册用户,如果每个用户的资料具有6个有效字段,就是6000万的有效数据。而将这6000万的有效数据通过一层或者几层简单的统计叠加分析、交叉分析等,在计算上本身就具有了不小的复杂度。何况现今的互联网产品,尤其社交类产品如FACEBOOK,腾讯QQ、新浪微博等动辄上亿的注册用户,本身用户系统就是一个非常具有价值的大数据。[page]
通过分析用户系统可以得到什么呢?
当然,用户填写的注册资料中包含的资料,都是最基础的分析数据。还是用数据说话,如下图:
以上图片来自互联网
以上数据是第三方机构公布的,而且都是最简单的一维数据,我们可以看到很多家网站的用户资料对比(上面引用的部分数据来源也可为线上调查问卷等形式)。对于独立的一个网站来说,用户资料的分析当然只是局限在自己的网站范围之内。进入互联网web2.0
时代以后,大家都开始更加重视用户和用户体验,对于网站自身用户的特征进行分析,可以更好的网站的用户特性分布,方便针对网站的用户群特点更有针对性的进行对应的产品设计和研发。比如通过了解用户的消费层次等,也可以更好的提供用户消费相关展示和服务。
那么,无用户身份信息的互联网是否不再大数据?--不用注册的用户身份系统的。
可能有的朋友会对这个话题存疑问,也可能有的朋友会惊恐,认为隐私泄露了,其实这里的应用也非常简单。在类似传统的web1.0
门户类以展示为主的互联网产品中,也是可以做数据的分析和挖掘的,而且也有比较成熟的方案。是否有朋友曾经经历过以下场景:在百度上搜索汽车、查了半天汽车资料,一个小时以后再随手打开的一个图书阅读网站上居然出现了"汽车广告".其实,即使我们没有在这些网站上注册,百度等搜索引擎本身还是可以为用户标识一个唯一的身份信息,虽然这个身份信息只是临时的,可能有效期也只有几天左右。但是,这依然是一种唯一的用户身份,只不过是记录的信息有限而已,但是仍然为用户行为分析提供了很大的帮助。感兴趣的朋友可以搜索"google
adsense隐私政策" 进行相关了解,此处不在赘述。
用户资料系统方便了一系列的大数据挖掘
除了传统的互联网桌面端和web端产品,最近几年突飞猛进的移动互联网以及终端应用,基本也都有完备的用户信息系统。apple苹果公司做了app
store,迄今为止的应用下载次数突破250亿次,而每一次的下载都需要使用唯一的用户ID,通过分析,苹果可能比你父母更加了解你想要什么--这属于用户行为分析范畴,后续将专门讨论。
总之,用户身份和资料的分析是互联网大数据分析中最基础的分析,用户身份系统在互联网的大数据时代,为后续的用户行为分析和对应的企业产品、服务设计提供了基石,也为更加深入的数据挖掘奠定了基础。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29