京公网安备 11010802034615号
经营许可证编号:京B2-20210330
“这是一个数据的时代,什么都要靠数据说话,数据是必须的。”
C.与专家对话“大数据”
为了对大数据有一个更全面和准确的理解,记者找到了嘉兴学院计算机系主任何丰教授,他眼里的“大数据”扮演的是怎么样的角色?
记者:什么是大数据?
何丰:我们的生活中,时时刻刻在产生数据,只是我们平常没有留意到而已。国际数据公司(IDC)的研究结果表明,2008年全球产生的数据量为0.49ZB(泽字节,等于270字节),2009年的数据量为0.8ZB,2010年增长为1.2ZB,2011年的数量更是高达1.82ZB,相当于全球每人产生200GB以上的数据。而到2012年为止,人类生产的所有印刷材料的数据量是200PB(拍字节,等于250字节),全人类历史上说过的所有话的数据量大约是5EB(艾字节,等于260字节)。IBM的研究称,整个人类文明所获得的全部数据中,有90%是过去两年内产生的。而到了2020年,全世界所产生的数据规模将达到今天的44倍。
大数据就是需要人们通过对数据的采集、分析、管理等手段,让原本淹没在数据海洋中的信息浮出水面,为生活提供信息和知识。
大数据并不是一个现成的数据库,而是个人在不同的网上操作后留下数据,这些数据经过分析整合后,能形成对个人特性的描述。简单来说,例如一个人既上了淘宝,又浏览了新闻,发了微博,还与朋友发了邮件,这种种的网上行为,都是数据,将它们整合起来,就能获取此人的喜好、所在地、近况等种种信息。
记者:大数据的作用具体有哪些?
何丰:大数据为人们提供的,是一种工具,目的是方便生活,其本质是追求更好的服务。
例如我们在网购时,页面下方常常会跳出来“看了该宝贝的人还看了”、“买了该宝贝的人还买了”这些选项,这其实是调用了别人的数据;而第二天我们就会发现,在浏览别的网页时,“Google提供的广告”中,会出现我们前一天想要购买的东西,这其实是我们自己的数据被记录和运用了。
电商或网站能根据用户的喜好、行为规律来提供特定的服务。用户喜欢什么,它就推送什么,达到精准营销。
记者:数据的取得者们是通过何种渠道获取数据的?
何丰:一是通过电脑,二是手机。在我国,电脑方面的大数据处理较手机成熟,手机大多仍停留在位置服务层面。
比如团购网站,就会根据用户所在的位置,为其提供附近的餐饮、娱乐等信息,这些信息也极有可能是针对该用户个性化细分的,因为他平时的搜索项数据都已被记录下来。而社交网站上,常有“附近的人”、“周边”等选项,也都是利用了手机的定位数据而为用户提供的服务。
记者:大数据时代会如何改变我们的生活?
何丰:如今,所有的活动都可以被数据化,相比过去,现在的数据在层次上、范围上都要深层、广泛得多。过去的信息是局部的、零散的,现在的信息则是全面的、准确的,这中间有一个整合提炼的过程。由于大数据的出现,使得服务的范围和对象都有所改变。
具体到生活中,这样的改变有很多。有人举例说:通过大数据,医疗机构能实时监测用户的身体健康状况;
教育机构有针对性的制定用户喜欢的教育培训计划;
社交网络能提供合适的交友对象,并为志同道合的人群组织各种聚会活动;
政府能在用户的心理健康出现问题时有效干预,防范自杀、刑事案件的发生;
金融机构能帮助用户进行有效的理财管理,为用户的资金提供更有效的使用建议和规划;
道路交通、汽车租赁及运输行业可以为用户提供更合适的出行线路和路途服务安排。
记者:是否存在隐私泄露的问题?应该如何最大程度保护自己的隐私?
何丰:的确会有隐私泄露的问题。因为只要有信息交互,就一定会有数据留下,所以一不注意,自己的信息就会散布各地。
因此针对用户来说,一定要培养自己的保密意识,不要在公共网络环境下留下个人信息,多选择可信的网络环境。
其次,服务的提供商要严格遵守相关规定,保证不泄露用户的个人隐私。许多网站是需要实名认证的,例如购买机票、火车票,而有的服务则是关系钱财的,如移动支付,这些针对特定服务提供的信息,若整合到一起,再被不法分子利用,那么后果不堪设想。
再次,相关部门也应该加强监管。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在统计学分析、实验研究、业务数据复盘过程中,单因素方差分析是检验自变量对因变量是否存在显著影响的核心方法。其中,两个水平 ...
2026-05-26【核心关键词】算法、客户、大数据、互联网、调优、建模、模型优化、机器学习、评分卡模型、模型开发、智能风控、业务场景、数 ...
2026-05-26 很多数据分析师写过无数个 SELECT,但当被问到“新建一张表,该如何定义字段类型来保证数据质量”“创建视图和存储物理表有 ...
2026-05-26在数据清洗、统计分析与数据质量检测工作中,箱型图(又称箱线图、Box Plot)是最直观、最高效的可视化分析工具之一。相较于柱状 ...
2026-05-25在大数据分析、数据清洗、质量管控、风险监测等领域,异常数据识别是保障数据质量、确保分析结论精准、规避业务决策失误的核心基 ...
2026-05-25 很多数据分析师精通Excel函数和透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么关系 ...
2026-05-25数字化经营时代,企业的市场竞争早已从经验决策转向数据决策。门店营收、用户转化、产品销量、成本损耗、存量资产等所有经营行为 ...
2026-05-22在MySQL数据库日常运维、业务数据校验、数据迁移与数据清洗场景中,自增主键ID的连续性校验是一项基础且关键的工作。MySQL的Auto ...
2026-05-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-05-22【核心关键词】大数据、可视化、存储、架构、客户、离线、产品、同步、实时、数据仓库、数据分析、数据可视化、存储数据、离线 ...
2026-05-21在电商流量红利消退、公域获客成本持续走高的当下,存量用户深度挖掘已成为店铺增收增效的核心抓手。相较于付费投放获取的陌生新 ...
2026-05-21 很多数据分析师每天盯着几十个指标,但当被问到“这套指标要支撑什么业务目标”“指标之间是什么逻辑关系”“业务变化时如何 ...
2026-05-21在数据驱动决策的时代,数据质量直接决定分析结果的可靠性与准确性,而异常值作为数据清洗中的核心痛点,往往会扭曲分析结论、误 ...
2026-05-20 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-05-20Agent的能力边界,很大程度上取决于其掌握的Skill质量和数量。传统做法是靠人工编写和维护Skill,但这条路很快会遇到瓶颈。业务 ...
2026-05-20在统计分析中,方差分析(ANOVA)是一种常用的假设检验方法,核心用于分析“一个或多个自变量对单个因变量的影响”,广泛应用于 ...
2026-05-19 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“什么是指标”“指标和维度有什么区别”“如何定义指标值的计算规则和 ...
2026-05-19想高效备考 CDA 一级,拒绝盲目刷题、冗余学习?《CDA 一级教材知识手册》重磅来袭!以官方教材为核心,浓缩 13 章 103 个核心考 ...
2026-05-19在数据统计分析中,卡方检验是一种常用的非参数检验方法,核心用于判断两个或多个分类变量之间是否存在显著关联,广泛应用于市场 ...
2026-05-18在企业数字化转型的浪潮中,很多企业陷入了“技术堆砌”的误区——上线了ERP、CRM、BI等各类系统,积累了海量数据,却依然面临“ ...
2026-05-18