
大数据与大科学_数据分析师
最近去武汉参加第八届全国测试学术会议,包括硬件测试、软件测试,碰到许多老朋友和新朋友,大家议论了许多。我和大家交流了在CACM上看到的“Big data meets big science”,也颇有感触。
在斯坦福的国家加速器实验室,大气观测望远镜到2020年要安装一个32亿像素(3.2GP)的照相机,10年以后每晚每隔15秒摄取极高分辨率的天空图像。该系统需要存储10亿亿字节(100PB)的数据,相当于2000万个DVD。当然,通过这个照相机获得的原始数据比这还要多得多。这个照相机的视野里面有400亿~500亿天文目标。长久存储这些像素几乎是不可能的,只能实时处理和提取关键数据。大型科学仪器,从大型强子碰撞型加速装置到高级光束处理器和分子成像工具产生大量数据,是目前的并行超级计算机所无法处理的。
可目前看到的现实是:1.摩尔定律已经失效,因为晶体管尺寸已经达到物理极限。2.超级计算机已经不能再这样用CPU堆下去了。成千上万,甚至几十万的CPU、GPU堆起来的超级计算机,耗电惊人,而并行计算实际上很难实现。大部分时间,CPU闲着,而Memory忙得要命。3.冯·诺伊曼计算机体系结构非改不可了。存储—计算的方式已经不适用新情况。对于许多应用来说,实际的瓶颈不是处理时间,而是需要不断地存取存储器。
一个明显的事实是,虽然我国的天河超级计算机几次排名世界第一,但美国最近基本不参与这个排名的竞争,排第几也不关心了。
对于大数据的问题,怎么解决?科学家们主要采取三个途径:一个是从观测开始各环节设法减小数据集;一个是从私人企业学习基于云计算的经验;另一个是探索新技术,譬如量子计算。
量子计算对于破解密码、因子分解、量子物理模拟可能很有效,但是,对组合优化、航空调度、绝热算法是否有效,还很难说。所以,大科学产生大数据,大数据技术要靠大科学。物理学、光学、生物学、计算科学一起来,研究这些数据的收集、分发、存储、处理。不能单靠计算机。我曾撰文说:大数据技术靠计算机,大数据分析要靠各领域的专家,现在看来,大数据技术也要靠大科学的专家。
在这样一个创新的关键时刻,中国人应该有所作为。不要天天想着发SCI、投CNS、提职称、发牢骚,想想这些大问题吧!但是,我跟与会的朋友们说,不管计算机怎么变,容错计算是一个永恒的主题,在量子计算中,人们也在密切关注容错计算。高端容错计算机的实用价值就更不用说了,大家都懂得。
我想补充几句话:微纳电子产业现在还很兴旺,市场仍然很大;超级计算机,特别是其应用还是要搞,从科学研究的角度讲要有些前瞻性。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-18刚入职场或是在职场正面临岗位替代、技能更新、人机协作等焦虑的打工人,想要找到一条破解职场焦虑和升职瓶颈的系统化学习提升 ...
2025-07-182025被称为“AI元年”,而AI,与数据密不可分。网易公司创始人丁磊在《AI思维:从数据中创造价值的炼金术 ...
2025-07-18CDA 数据分析师:数据时代的价值挖掘者 在大数据席卷全球的今天,数据已成为企业核心竞争力的重要组成部分。从海量数据中提取有 ...
2025-07-18SPSS 赋值后数据不显示?原因排查与解决指南 在 SPSS( Statistical Package for the Social Sciences)数据分析过程中,变量 ...
2025-07-18在 DBeaver 中利用 MySQL 实现表数据同步操作指南 在数据库管理工作中,将一张表的数据同步到另一张表是常见需求,这有助于 ...
2025-07-18数据分析师的技能图谱:从数据到价值的桥梁 在数据驱动决策的时代,数据分析师如同 “数据翻译官”,将冰冷的数字转化为清晰的 ...
2025-07-17Pandas 写入指定行数据:数据精细化管理的核心技能 在数据处理的日常工作中,我们常常需要面对这样的场景:在庞大的数据集里精 ...
2025-07-17解码 CDA:数据时代的通行证 在数字化浪潮席卷全球的今天,当企业决策者盯着屏幕上跳动的数据曲线寻找增长密码,当科研人员在 ...
2025-07-17CDA 精益业务数据分析:数据驱动业务增长的实战方法论 在企业数字化转型的浪潮中,“数据分析” 已从 “加分项” 成为 “必修课 ...
2025-07-16MySQL 中 ADD KEY 与 ADD INDEX 详解:用法、差异与优化实践 在 MySQL 数据库表结构设计中,索引是提升查询性能的核心手段。无论 ...
2025-07-16解析 MySQL Update 语句中 “query end” 状态:含义、成因与优化指南 在 MySQL 数据库的日常运维与开发中,开发者和 DBA 常会 ...
2025-07-16如何考取数据分析师证书:以 CDA 为例 在数字化浪潮席卷各行各业的当下,数据分析师已然成为企业挖掘数据价值、驱动决策的 ...
2025-07-15CDA 精益业务数据分析:驱动企业高效决策的核心引擎 在数字经济时代,企业面临着前所未有的数据洪流,如何从海量数据中提取有 ...
2025-07-15MySQL 无外键关联表的 JOIN 实战:数据整合的灵活之道 在 MySQL 数据库的日常操作中,我们经常会遇到需要整合多张表数据的场景 ...
2025-07-15Python Pandas:数据科学的瑞士军刀 在数据驱动的时代,面对海量、复杂的数据,如何高效地进行处理、分析和挖掘成为关键。 ...
2025-07-15用 SQL 生成逆向回滚 SQL:数据操作的 “后悔药” 指南 在数据库操作中,误删数据、错改字段或误执行批量更新等问题时有发生。 ...
2025-07-14t检验与Wilcoxon检验的选择:何时用t.test,何时用wilcox.test? t 检验与 Wilcoxon 检验的选择:何时用 t.test,何时用 wilcox. ...
2025-07-14AI 浪潮下的生存与进阶: CDA数据分析师—开启新时代职业生涯的钥匙(深度研究报告、发展指导白皮书) 发布机构:CDA数据科 ...
2025-07-13LSTM 模型输入长度选择技巧:提升序列建模效能的关键 在循环神经网络(RNN)家族中,长短期记忆网络(LSTM)凭借其解决长序列 ...
2025-07-11