京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据时代的结构和解构_数据分析师
很多人都知道,数字世界的发展和黑客非常有关系。比如微软的比尔·盖茨就做过黑客,最新的标志性人物Facebook的扎克伯格也干过这个事儿。Facebook早期的版本Facemash.com就偷偷地接入了哈佛大学的学生数据库,获取了学生证件照。扎克伯格让同学们根据这些照片投票选美,很是热闹了一阵子。
来自华中科技大学的几个学生也是很彻底地模仿了扎克伯格一回:他们设置了一个名为hust-facemash.com的网站,同样是偷偷摸摸地侵入学校的HUB(华中科技大学公共信息服务平台),把一大堆的女同学照片放到网上让人“选美”。与当年的Facemash所引发的舆论抨击一样,华中科大的这个Facemash同样引来了不少的担忧和批评。
核心问题就是“隐私”。担忧者认为,在学生档案里,不仅有照片,还有各种其他信息,比如电话住址之类。今天这个Facemash只是公布了照片,但其他信息在这些年轻人侵入系统后必然被一览无遗。这又怎不让人担心呢?而那几个学生声称,他们做这个东西的动机只是想提醒一下校方:嘿,你们的网络系统安全弱爆了!
动机论是很不靠谱的,因为谁也不知道他们在倒腾这玩意儿时究竟是抱着善意提醒的目的呢,还是恶搞玩上一玩,抑或想成为中国的扎克伯格?但结果是很明显的,不仅侵犯到了人家的隐私,而且对那些女孩来讲,自家照片在自家从未首肯的情况下被别人拿去和其他女孩子放在一起评头论足,总不是件令人愉快的事。
如果说中外两个Facemash的后果还不算太严重的话,那么,另外几起用户数据库被侵入就很严重了。韩国最大的社交网站Cyworld遭入侵,成为韩国取消实名制的动因之一。不久前,美国最大的职业社交网站Linkedin遭入侵,600万用户密码被公布在一个论坛上。中国亦有类似事件,据称波及千万用户之巨。我们把很多东西放在网上,而这些东西的安全性,看来很值得担忧。
这已经不再是隐私那么简单了。数字经济的高速发展,使得很多事的效率都在提高,当然也会带来一些负面效应。而在这诸多负面效应中,在我看来,最大的莫过于,其实系统是很脆弱的。
我们必须承认,依托于网络,每个人之间的“距离”变得更近了,我们越来越成其为一个整体。但重点就是这个“依托网络”。服务器记载着我们太多的东西,这个整体变得越来越结构化,只要攻破其中一点,其整体就会出现剧烈的动荡,受侵害人口动辄数十乃至数百万。过去的一个银行体系的被侵入和今天(假定的)Facebook被侵入,后果简直是天壤之别。
互联网诞生之初,走的就是“去中心化”道路,免费的网络服务器系统阿帕奇的构想,就是在美国遭受斩首式攻击时,有其他节点可以迅速补上成为中心控制。但这个互联网从web1.0、web2.0一路走来,进入大数据时代后,大量的用户数据被储存在服务器端。是的,节点越来越趋去中心化,但数据却越来越中心化。我们已经“让渡”了一些很重要的东西给机器,但机器,却并不牢靠。
加强安全性是一个方法。但正如福尔摩斯的创造者柯南道尔在《跳舞的小人》里写道:有人发明,就有人看懂。再强的安全体系,都有被侵入的可能。而之所以很多看似松松垮垮的系统没有被侵入的原因其实很简单:不值得。解密是有成本的,但如果标的物诱惑足够,成本便会相对变得小很多。又有什么样的系统是100%的安全呢。数据越来越集中化,使得这个标的物的诱惑,变得越来越大。
加强对黑客行为的处罚也是一个方法。华中科技大学的那几个学生会面临什么样的惩处尚不知晓,扎克伯格可是因为Facemash领了哈佛的留校察看处分的。一些后果并不严重的行为,小小惩戒一下即可。但类似Cyworld和Linkedin的被入侵,一个警告是完全没有用的。
不过,话也要说回来。数据集中化加强了整个社会的结构化,体系会变得越来越有利于既得利益者、掌权者和有钱人。漏洞的存在,对当事人是一种不幸,但对整个社会而言,或许又是一种不幸中的大幸:反抗成为一种可能。哈维尔所谓“无权势者的权力”,在今天这个社会,大抵就会具象成如此吧。
波澜壮阔的基于数据的结构和反抗(或又可称之为解构)在大数据时代已经悄然登场。人类社会,终归是在矛盾中一路前行的。但这种结构或者反抗,最终是否会彻底失控,谁也不知道。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、机器学习的实操场景中,聚类分析与主成分分析(PCA)是两种高频使用的统计与数据处理方法。二者常被用于数据预处理 ...
2026-02-24在聚类分析的实操场景中,K-Means算法因其简单高效、易落地的特点,成为处理无监督分类问题的首选工具——无论是用户画像分层、 ...
2026-02-24数字化浪潮下,数据已成为企业核心竞争力,“用数据说话、用数据决策”成为企业发展的核心逻辑。CDA(Certified Data Analyst) ...
2026-02-24CDA一级知识点汇总手册 第五章 业务数据的特征、处理与透视分析考点52:业务数据分析基础考点53:输入和资源需求考点54:业务数 ...
2026-02-23CDA一级知识点汇总手册 第四章 战略与业务数据分析考点43:战略数据分析基础考点44:表格结构数据的使用考点45:输入数据和资源 ...
2026-02-22CDA一级知识点汇总手册 第三章 商业数据分析框架考点27:商业数据分析体系的核心逻辑——BSC五视角框架考点28:战略视角考点29: ...
2026-02-20CDA一级知识点汇总手册 第二章 数据分析方法考点7:基础范式的核心逻辑(本体论与流程化)考点8:分类分析(本体论核心应用)考 ...
2026-02-18第一章:数据分析思维考点1:UVCA时代的特点考点2:数据分析背后的逻辑思维方法论考点3:流程化企业的数据分析需求考点4:企业数 ...
2026-02-16在数据分析、业务决策、科学研究等领域,统计模型是连接原始数据与业务价值的核心工具——它通过对数据的规律提炼、变量关联分析 ...
2026-02-14在SQL查询实操中,SELECT * 与 SELECT 字段1, 字段2,...(指定个别字段)是最常用的两种查询方式。很多开发者在日常开发中,为了 ...
2026-02-14对CDA(Certified Data Analyst)数据分析师而言,数据分析的核心不是孤立解读单个指标数值,而是构建一套科学、完整、贴合业务 ...
2026-02-14在Power BI实操中,函数是实现数据清洗、建模计算、可视化呈现的核心工具——无论是简单的数据筛选、异常值处理,还是复杂的度量 ...
2026-02-13在互联网运营、产品迭代、用户增长等工作中,“留存率”是衡量产品核心价值、用户粘性的核心指标——而次日留存率,作为留存率体 ...
2026-02-13对CDA(Certified Data Analyst)数据分析师而言,指标是贯穿工作全流程的核心载体,更是连接原始数据与业务洞察的关键桥梁。CDA ...
2026-02-13在机器学习建模实操中,“特征选择”是提升模型性能、简化模型复杂度、解读数据逻辑的核心步骤——而随机森林(Random Forest) ...
2026-02-12在MySQL数据查询实操中,按日期分组统计是高频需求——比如统计每日用户登录量、每日订单量、每日销售额,需要按日期分组展示, ...
2026-02-12对CDA(Certified Data Analyst)数据分析师而言,描述性统计是贯穿实操全流程的核心基础,更是从“原始数据”到“初步洞察”的 ...
2026-02-12备考CDA的小伙伴,专属宠粉福利来啦! 不用拼运气抽奖,不用复杂操作,只要转发CDA真题海报到朋友圈集赞,就能免费抱走实用好礼 ...
2026-02-11在数据科学、机器学习实操中,Anaconda是必备工具——它集成了Python解释器、conda包管理器,能快速搭建独立的虚拟环境,便捷安 ...
2026-02-11在Tableau数据可视化实操中,多表连接是高频操作——无论是将“产品表”与“销量表”连接分析产品销量,还是将“用户表”与“消 ...
2026-02-11