京公网安备 11010802034615号
经营许可证编号:京B2-20210330
大数据是个什么玩意_数据分析师
不过文章难懂,抽象,太长,我没有完全读到后面。主要观点大致是认为大数据不能代表未来大趋势。出于对大数据这个词的敏感,也想谈谈观点。
说实话,我有很多年以来比较讨厌来自信息领域的一些名词:数字地球、云计算、决策支持系统、专家系统、复杂性科学、数据挖掘、大数据。这些玩意一个名词接着一个名词,让人感觉总是炒一些新鲜的概念。其实上述名词确实也有一定的意义,但是它们发挥的科学推动作用不大。我为啥讨厌呢,是因为我认为是这些概念的受害者。因为我曾经是计算机粉丝,当然也喜欢学习研究这些玩意。最后发现我自己走了弯路,费了很多功夫阅读这些,什么真正的东西都没学会。
其实在这些名词出现以前,各学科人们早就在使用这些概念了。如数字地球,吸引了大批地理界、GIS界的年轻人,最后我们发现除了会编几个计算机图形可视化的程序外,其它一无所获。看着别人发表着大把的SCI,我们真纳闷,天天研究新概念,还不如研究老古懂学科。后来,我们发现地球科学领域的数据(遥感、气象资料)绝对是海量的,数据生产的速度远远超过了人们利用数据做研究的速度。Google地球也发布了。实际上数字地球确实是建成了,但很少有人说我们是在做数字地球。不谈数字地球的人做了不少数字地球的事,天天谈数字地球的人什么也没搞出来。
另外决策支持系统是个什么玩意,我读了很多这方面的书,感觉也很虚无飘渺。
曾经有一个叫做“元胞自动机”(CA)的概念也很流行在GIS界,但最终也不知如何应用该理论,没什么好的论文或成果发表出来。等到后来,我们了解了水文领域的分布式水文模型、大气领域的气候模式、流体领域的CFD和格子Boltzmann模型,发现按照CA的定义来看,上述模型其实都是CA的范畴,只是针对特定的专业性了。CA的概念远不如上述模型应用那样普及,专业性也不够强。不可否认的是,确实有少量学者开发出了CA模型,有一定的用处。
至于大数据,以前它相应的称呼应该是数据挖掘。包括刚刚仙逝的老邪院士为代表的很多遥感学者,都在分析海量遥感数据,难道这不是大数据?那些从事气候变化研究的相关学者天天都在利用海量资料分析各种气候指标,难道不是在数据挖掘?可是谁又在写论文时,把大数据和数据挖掘列为关键词呢?
当然,我也认识到了大数据这个词主要针对社会科学领域。社科领域的大数据特指那些形式杂乱、细碎、海量如牛毛的聊天信息、Email信息、网页新闻信息、广告信息,以及发表在期刊上的信息。这些数据不像遥感数据、大气数据那样可以以特定数据集的形式整理和存放。这就需要研究分析这些资料的人要有特定的数据整理能力。一种方法是使用一些软件,不过软件大都是针对特定形式的数据集,如文献计量分析软件。它们不能适应于各种杂乱数据。另一种方法就是取决于研究者自己的特殊能力了,这样的好处是不需要拘泥于现有软件,可以适应任何数据分析。比如使用python语言来自行编代码实施数据搜索。我认为自己是具备这个能力的!我不认为我是在吹牛。但是我却不从事这方面的研究。
虽然python语言不难,会用它的人极多,但事实证明不是每个从事科研的人都最终能学会的。
虽然我认为大数据这个词比较土,很一般化,但它在社科领域确实具有特定的意义。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-06-10在MySQL数据库日常查询、数据统计、后台接口开发、数据导出等场景中,开发者经常需要查询数据表除某几列之外的所有字段。例如查 ...
2026-06-09在Python网络请求、爬虫开发、接口测试、数据抓取等实操场景中,requests库是最常用的第三方请求工具,而content属性是requests ...
2026-06-09