京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据收集或比数据挖掘更有意义
按照今天信息技术的发达程度,数据收集看起来很容易。一个摄像头每天收集多少信息?空间跑着那么多卫星,它们每天收集多少信息?好像不用愁没有信息。而数据挖掘要从繁杂的信息中寻找知识,就很困难了。但是,事情可能不是那么简单。在某些情况下,数据收集可能比数据挖掘更难、更有意义。
不竟想起所谓“费米悖论(Fermi Paradox)”.1950年的一天,诺贝尔奖获得者、物理学家费米在和别人讨论飞碟及外星人问题时,突然冒出一句:“如果有外星人,他们为什么没在这里?”这句看似简单的问话,就是着名的“费米悖论”.如果认为在如此广阔的宇宙中(上百亿光年的空间,约700万亿亿颗恒星),在如此漫长的时间里(100亿~160亿年),全宇宙总共只诞生了太阳系的地球这唯一的文明,这听起来无论如何总是极端武断的。那么,总该有一个两个外星文明被我们发现,或到地球来访问过了吧?为什么它们至今仍然是沉默的呢?人类能用100万年的时间飞往银河系各个星球,那么,外星人只要比人类早进化100万年,现在就应该来到地球了。迄今为止,仍然缺乏任何被科学共同体接受的证据,能够证明地外文明的存在;另一方面,科学共同体也无法提出任何令人信服的证据,能够证明外星文明不存在,这就使得“费米悖论”成为一个极端开放的问题
我们学偏微分方程的时候,总是要先论证某一类方程解的存在性。知道解的存在,才能去求解。可是,不求出解来,怎么知道解是存在的呢?这就是一个悖论。对存在的数据集应用算法过去是产生新发现的有效方法,而现在新知识可以使用可用的材料资源创造财富,比累积新资源更有效。过去,生物学家,天文学家和宇宙学家从历史数据中找发现,考古学家艰难地去挖掘。现在,他们可以重建所有的废墟和人工制品,从卫星和航拍图像侦察到的表面跟踪想象出来。研究(Research)就真成了重新搜索(Re-Search)。
联想到马航MH370失联事件。2014年3月8日凌晨1时20分,由马来西亚吉隆坡飞往中国北京的马来西亚航空公司MH370航班与地面失去联系,机上239人中有154名中国籍乘客。此事已经过去35天,先后26个国家参加搜索,出动几百架次飞机和军舰、商船,花费超过5000万美元。先说在南海,折腾了10多天一无所获;有人根据卫星图像说是在吉尔吉斯西北部的塔拉斯州州府以南约30公里处的山谷里;后来又说是在印度洋;反复折腾,试图收集MH370的数据,但是,至今没找到。按理说,有关的数据多的是,即使是这35天的卫星数据、搜索飞机得到的数据,不可谓不大,不管你怎么去挖掘这些数据,你也得不到任何MH370的数据。这个例子说明,在某些情况下,数据收集比数据挖掘更难、更有意义,因为这种数据收集就是发现。新闻联播每天都播MH370搜索的消息。新闻联播1分钟值多少钱?做过广告的公司也许知道,反正很贵。也许会说,那是因为机上有154名同胞。可是,国内死人的事天天有,怎么没花这么多的笔墨?这问题很复杂。即使黑匣子找到了,各国都有自己的秘密,只能用各国都能接受的方式做报道。所以,这里的数据分析是和政治有关的,甚至说,数据收集的过程也与政治有关。不要认为,大数据能解决一切。而在数据收集中,硬件技术不可缺少。我们国家在硬件技术和生产方面应该承认差距,加强研究、制造和发展。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10