京公网安备 11010802034615号
经营许可证编号:京B2-20210330
正确运用大数据 避免走向误区
“大数据”是当今最热的概念之一,有人把大数据形容为未来世界的石油,有人宣称掌握大数据的人可以像上帝一样俯瞰整个世界,美国政府甚至已经把对大数据的研究上升为国家战略。喧哗的背后,实际上,随着信息与通讯技术的发展,“大数据”正进入与我们息息相关的每一个角落。近日,记者参加中国科协主办的第36期科学家与媒体面对面活动,采访相关专家,请他们畅谈了大数据时代的技术特色与隐私保护。
大数据是什么
故事一:无法完成的任务
大数据是一个时髦的新词,也是一个古老的现象。因为,对某个时代来说,超出当时社会信息处理能力的数据,就可以说是大数据。
以人类遇到的第一个大数据人口普查为例。中国在公元2年就有史书记载的人口普查数据(《汉书 地理志》):全国103个郡国,人口是59594978人。对当时的古代中国来说,近六千万人口的普查无疑就是一个难以处理的大数据。美国宪法曾规定,美国人口普查十年一次。1880年开始,美国人花8年完成了一次人口普查,并预计1890年做下一次人口普查大概需要13年时间。也就是说,人口普查成为当时一项无法完成的任务。不过,危机常常带来新的技术革命。有人发明了穿孔卡片制表机,使得这个任务仅用一年时间就可以完成。穿孔卡片制表机就是今天计算机的前身。
“大数据不是今天就出现的,你对付不了的就是大数据。”工业和信息化部电信研究院互联网中心主任何宝宏说:“今天所说的大数据革命也是2008年之后,这5年来信息发生了翻天覆地的变化。大数据让物质世界变得可计算,这是整个人类的目标。”
无法完成的任务,带来的是前所未有的技术突破。如今,移动互联网、物联网、基因测序等采集数据的工具越来越多样化,使我们对物质世界的描述越来越精确,拥有的数据量越来越大;云计算等处理数据的工具越来越经济,又使得大数据的应用走入百姓身边,对我们的生产和生活方式产生深远的影响。
目前大数据最成熟的应用是互联网广告营销。近一年中,老百姓在搜索或者浏览网页时会发现,网上推出的广告越来越精确。这是因为互联网广告已经进入到完全自动、实时竞价的状态,通过对个人上网行为的分析,推导出这个人的性格特征和可能需要,并有针对性地投放广告。广告请求、竞价邀请、受众筛选、申请出价、中标投放的全过程,仅需120毫秒也就是0.12秒即可完成,而在传统媒体完成这样的工作,很可能需要几个月的时间。
互联网金融也是近一年的大热点,根基就是由于大数据技术的成熟。互联网金融在面对中小企业的贷款业务中,拥有独特的优势。据一份对中国互联网金融的调查报告显示,互联网金融对小微企业贷款时,不良贷款率仅为1.02%,单笔放款成本为2.3元;而传统银行对小微企业的贷款不良率为5.5%至6%,单笔成本达800元至2000元。这种低成本、低坏账率、全时服务(机器可以全天候开启)的金融服务,使广大中小企业变成了互联网金融的客户,可以解决小微企业贷款难的问题——这其实也是一个过去无法完成的任务。
大数据怎么用
故事二:不懂外语的翻译
百度公司发展研究中心副主任率鹏给记者讲了一个有趣的故事。“百度翻译”这个工具,目前已经提供了24种语言的自动翻译服务,翻译质量在行业中领先。“但这24种语言中有12种语言,整个百度翻译的团队没有人能懂。”率鹏说,“大数据的技术使我们完全在不了解、不懂得、不能够理解这种语言的情况下,仅仅靠技术本身就开发出一个非常好的翻译工具,这在以往的时代是难以想象的。”
不懂外语的外语翻译,这个听起来很天方夜谭的故事,其实精准反映了如今大数据技术的一大特点——不需要知道为什么,只需要知道是什么。
这个技术特点,是由如今大数据本身的特点决定的。中国通信学会副理事长兼秘书长张新生表示,大数据有四大特点:一是海量,大到“以目前的技术无法管理的数据量”;二是多样,数据种类复杂,非结构数据占到所存储数据总量的75%—95%,这些非结构数据无法以现在的技术手段与关系分析的数据库来处理;三是速度,数据产生的频率和传送频率非常快,需要进行实时处理;四是价值密度低,需从大量的低质量、低价值的数据中获取知识,犹如大海捞针,获取数据成本很高。
事实上,大数据还将越来越大。在过去两年中,全球产生的信息占到人类整体掌握信息总量的90%,现在每天全球产生的数据相当于国家图书馆馆藏总量的1500倍。而互联网数据中心IDC预测,到2020年全世界将有300亿个物联网终端。中国在这一市场上将占据至关重要地位,届时中国普通家庭将拥有40个到50个智能设备或传感器,每年创造出20TB的数据。而中国国家图书馆藏书是2631万册,信息量相当于41TB。也就是说,届时一个普通中国家庭每年产生的数据,就相当于半个国家图书馆。
我们如何才能不被大数据所淹没?
“大数据的核心重点在于深度挖掘,通过挖掘产生新的应用。”张新生表示,大数据的处理技术是一个工具,它有几个新特色:不再是小样本、随机样本,而要全体数据;接收数据有混杂性,不再追求精确性;关注事物之间的相关性,可以只知道是什么,不知道为什么;对所获数据可多次、反复利用,并可扩展,具有互用性,也就是未来可能知道为什么。
大数据产业也在变得越来越大。大数据的采集和传感、物联网领域有很大关联性;大数据的处理,又和云计算等产业相关;大数据的应用和医疗、金融等各个行业相关。未来将有越来越多企业发展成大数据企业。
“大数据应该是我们的战略性新兴产业中新一代信息技术重要的产业部分,和互联网产业、物联网产业、电信产业都有很大关联性。”中国联通网络技术研究院首席专家唐雄燕表示:“大数据本身和很多产业相关,现在可能已经有几千亿元的产业规模,将来会无处不在。大数据的从业者,未来也将不止是高科技人员,也会有很多蓝领。大数据是一个材料,和石油、矿藏一样,需要有采集数据的人员,需要有探矿的人员,各种各样的人都需要。”
大数据怎么管
故事三:应该保护的隐私
我国大数据应用面临着数据资源难以开放共享、数据安全和隐私急需保护、大数据技术创新人才不足等诸多挑战,其中个人隐私如何保护,是大众最为关注的问题。
事实上,真正好用的大数据技术,应该是用加工实现增值,用分析来指导决策,而非贩卖用户个性化隐私这种原始数据信息本身的低层次滥用。
中兴通讯首席架构师、业务总工程师罗圣美表示:“使用这些数据的企业,其实有两大类,一类是互联网企业,第二类是电信企业。企业有安全保护措施,有技术解决方案,做只针对群体,而不针对个体的信息挖掘,这是应遵循的基本原则。”
率鹏认为,在隐私保护问题上,大数据技术要重点强调符号化和用户特征这两个概念。“符号化,是当我们去识别一个用户时,用和他真实信息不相关的符号标记这个用户。符号通过算法来保证,是单向的识别,使我们能识别出两次登录的是同一个用户,却无法通过此符号反推出该用户在真实生活中的姓名、电话和住址,这就基本享受了大数据带来的优势,同时又规避了信息安全的风险。用户特征,是在大数据时代,企业感兴趣的往往是这个用户的特征,而不是家庭地址、电话号码真正敏感的信息。比如说,我希望知道你是一个20岁到30岁年龄段,生育过子女,有高等教育学历的女性,这些都是你的特征,但是我并不想知道你姓甚名谁,今年多大,有几个小孩。如果在数据使用过程中严格遵循符号化和用户特征原则,我们就能规避掉不良风险。”
除了技术以外,政策和立法才是大数据时代个人隐私保障的重要凭借。2012年12月28日,《全国人民代表大会常务委员会关于加强网络信息保护的决定》审议通过。2013年,工信部根据全国人大的决定,出台了关于互联网和电信网个人信息保护的条例,提出了数据保护的一系列要求。
数据需要保护,数据也需要交易。大数据的保护与交易需要遵循什么样的标准,是当前政策制定者面临的挑战。
张新生说:“有价值的数据是非常重要的资源,但前提是要建立交易规则。我国的几大互联网运营企业都在做大数据分析,并且都想把数据作为可交易的产品,这需要我们尽快建立数据交易有关的法律法规。”
何宝宏认为,目前的大数据分为两类。一类是公共数据,比如政府所掌握的数据,或者公益企业的数据,公共数据面临的是开放和共享的问题。一类是商业数据,商业性数据需交易,因为这是资产,交易产生新的价值。“标准和政策的制定是不断摸索的过程,需要随着市场去探索,我们已经深度地介入到关于目前国内数据交易的活动中,去探讨这方面的政策、标准制定。”
对于用户来说,提高信息安全意识、注意个人隐私保护也十分重要。不过,鉴于大数据时代个人隐私保护的困难程度,已有专家提出了“遗忘”的必要性。牛津大学教授、大数据领域权威专家维克托就在他的着作《删除》中表示,对于人类而言,遗忘一直是常态,而记忆才是例外。然而,由于数字技术与全球网络的发展,这种平衡已经被打破了。大量数字化的私人信息不仅可能在今天被滥用,在几年甚至几十年后仍然可能被滥用。
罗圣美说:“在大数据时代,建议国家相关部门在制定产业政策时,需要重点考虑涉及个人隐私的信息,采取删除、锁定,或者安全加密等多种级别的保密措施,避免个人隐私被检索、发现、滥用和扩散。”
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 SQL Server 安装、服务启动、数据库文件操作等场景中,经常会遇到 “实例已在使用” 类报错,不同触发场景的原因与处理方式差 ...
2026-06-29在Excel数据统计、财务核算、销售复盘、库存盘点等办公场景中,经常需要在数据透视表中实现一列数据乘以另一列数据的计算需求, ...
2026-06-29在数据分析中,指标是连接业务与数据的核心语言。它并非一个简单的数字,而是一个将模糊的业务需求(如“提升用户粘性”)转化为 ...
2026-06-29【核心关键词】大数据、零售商、消费者、供应链、运营、企业、产品、客户、数据模型、大数据平台、数据开发、系统运维、业务逻 ...
2026-06-26在物流配送、供应链履约、终端供货等业务场景中,送货率是衡量企业履约能力、服务质量、供应链稳定性的核心业务指标,直接关联客 ...
2026-06-26 很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度” ...
2026-06-26在数字化管理与数据化运营体系中,指标是连接原始数据与业务决策的核心载体。零散的原始数据只是无意义的数值堆砌,无法直接反映 ...
2026-06-25在Excel数据汇总、财务统计、业务复盘等日常办公场景中,经常需要完成逐行相乘、整体汇总求和的计算需求,最典型的场景就是:单 ...
2026-06-25 很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问 ...
2026-06-25【核心关键词】主数据、资产、供应商、现金流、企业、精细化、集团、数字化、中国、数据质量、数据管理、经营管理、地产行业、 ...
2026-06-24在数据分析、假设检验、AB测试、学术研究等统计场景中,显著水平(α)与P值(P-value)是判断统计结果是否具有统计学意义的两个 ...
2026-06-24小李刚入职了一家互联网公司的运营部门。第一次参加业务复盘会,运营主管问了一个看似简单的问题:“这个月新用户留存率下降了5 ...
2026-06-24在数字化转型全面渗透的产业背景下,数据分析已成为互联网、金融、零售、制造等几乎所有行业的核心岗位能力。很多初学者对数据分 ...
2026-06-23在企业并购、股权定价、投融资评估、资产核算等资本市场核心场景中,市场法是应用最广泛、市场认可度最高的企业价值评估方法。传 ...
2026-06-23 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-06-23【核心关键词】运营、证书、金融、客户、产品、软件、销售额、量化、科技、数据分析、金融行业、证券类软件、业务流程、金融机 ...
2026-06-22在企业方案选型、产品迭代评审、供应商筛选、运营效果复盘等决策场景中,单一指标的优劣判断往往无法支撑科学决策。一套转化效果 ...
2026-06-22 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-06-22【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18