京公网安备 11010802034615号
经营许可证编号:京B2-20210330
中国离大数据“潮头”还差几步_数据分析师培训
“在中国,数据正日益成为决策的依据,创新的源泉,推动从制造到创造的转变。”阿里云总裁胡晓明在此间举行的“2015贵阳国际大数据产业博览会暨全球大数据时代贵阳峰会”上这样表示。与会的企业家和专家认为,中国发展大数据产业力度空前,但在新一轮技术变革中,要想勇立“潮头”,还需突破“各自为战”和“一哄而上”等障碍。
从IT到DT,中国的步伐越来越快
“从每一代信息技术变革来看,中国的步伐是越来越快。”京东大数据部副总经理邢志峰说,在传统的IT时代,中国是西方的“追随者”,不断学习先进的技术。在移动互联网时代,中国与国际社会“并驾齐驱”,其中腾讯、阿里巴巴等企业与国外同类企业不相上下。进入“互联网+”的DT时代,中国一些大数据企业和人才甚至处于国际“领跑”地位。
他说:“中国拥有全球最大的人口基数和数据量,背后的‘数据金矿’也最大。以前非常向往国际大企业的大数据人才,现在愿意在国内的企业发展。”据预测,2020年中国数据总量将达到8.4ZB,占全球数据总量的24%,届时将成为世界第一数据大国和“世界数据中心”。
业内人士认为,随着宏观产业环境的不断优化,中国大数据产业链正在加速形成。众多互联网企业围绕大数据展开的技术研发、应用创新取得进展,医疗卫生、金融、交通等传统行业也在积极利用大数据进行有效探索。
记者了解到,中国部分互联网公司在大数据应用方面处于全球领先水平,他们建立了大数据平台,在分布式系统、超大规模数据仓库、深度学习等关键技术上有所突破。数据采集。存储、处理、分析、服务的大数据产业体系日趋成熟。
工业和信息化部副部长怀进鹏在会议上表示,当前中国“无论是技术储备、产业基础和政策发展环境,都为大数据、云计算的发展创造了先机,也做好了重要的支撑和基础。”
强劲势头中存隐忧
此次博览会云集了来自北京、上海、浙江、贵州等地的上百家大数据企业。企业家们在畅想中国大数据前景时,对当前各地发展大数据产业“各自为战”和配套设施“一哄而上”的局面表示了担忧。
胡晓明说,现在各地互联网数据中心建设存在泛滥现象,有的地方,市、县、乡都在搞大数据、云计算,“全民大数据”容易导致新一轮的硬件建设,造成资源浪费,对数据集聚有负面作用,“并不是建起了数据中心就有数据”。
一些专家指出,在全球金融市场低迷、中国经济转型的背景下,发展大数据产业是一种“现实选择”。不少欠发达地区对此寄予“弯道超车”厚望,各地自行探索难以形成合力,发展过程中容易出现重复建设,对大数据产业健康发展埋下隐患。
同时,政府部门信息共享和公开,以及涉及个人隐私和商业机密的专门法律法规和政策环境不够完善。政府和垄断部门的信息共享和开放程度不够,众多“信息孤岛”造成大数据产业的数据资源不够丰富。而企业拥有的大数据技术和计算能力却无用武之地,陷入“巧妇难为无米之炊”状态。
在记者采访中多家企业反映,即使拿到公共大数据,但由于政府部门条线分割严重、缺乏数据存储规范标准,这些数据十分杂乱,融合成本高昂,企业难以承受。“很多记录下来的数据没有规范化,也没有对数据存储进行设计,即使在同一个行业,数据也是‘一人一个模样’。”百度大数据部副总裁陶海亮说。
香港城市大学教授马建和中国信息协会大数据专委会副主任委员文金言认为,目前中国大数据产业距离“潮头”的差距还表现在大数据处理工具是“他山之石”,一些知名企业用的都是国外的数据处理技术,自主核心技术突破还有待时日。
清晰定位防其“野蛮生长”
确立大数据思维被认为是突破大数据发展障碍的重要抓手。有专家指出,当前一些地方政府缺乏“数据治理”意识,形成了做决策靠经验判断的惯性思维。一项针对我国主要部委信息化部门的调查显示,近4成的部门负责人没有意识到大数据可以帮助提升业务能力。
此次产业博览会上,一些与会者提出,政府应制定清晰的大数据、云计算顶层设计。从数据主权、数据创新能力、关键技术、人才、数据研究、覆盖全行业的产业链、法制环境支持等关键要素入手,研究大数据发展趋势,评估大数据对政府、经济与社会运行所带来的革命性影响
同时,制定未来5年或更长时间的发展目标、发展原则、关键技术、重点任务、行动计划和保障措施等规划,以协同政府各部门、各行业主管单位、企事业单位和个人等各方面的力量,形成共同发展的氛围。
邢志峰说,解决“信息孤岛”问题,最为迫切的是政务公开,“越多政务数据被公开,就会创造越多的机会和价值”。政府应加快推进数据的分级和公开,同时采用政府购买服务的方式,带动数据资源成为社会治理,优化城市管理和经济决策的重要资源。
国家信息中心专家委员会副主任宁家骏认为,各地数据中心的建设规模应以产业实际需求为导向,做到精细化设计,针对性开发,促进大数据产业形成良好、可持续的发展生态环境,而不是任其“野蛮生长”。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 MySQL 实际应用中,“频繁写入同一表” 是常见场景 —— 如实时日志存储(用户操作日志、系统运行日志)、高频交易记录(支付 ...
2025-10-30为帮助教育工作者、研究者科学分析 “班级规模” 与 “平均成绩” 的关联关系,我将从相关系数的核心定义与类型切入,详解 “数 ...
2025-10-30对 CDA(Certified Data Analyst)数据分析师而言,“相关系数” 不是简单的数字计算,而是 “从业务问题出发,量化变量间关联强 ...
2025-10-30在构建前向神经网络(Feedforward Neural Network,简称 FNN)时,“隐藏层数目设多少?每个隐藏层该放多少个神经元?” 是每个 ...
2025-10-29这个问题切中了 Excel 用户的常见困惑 —— 将 “数据可视化工具” 与 “数据挖掘算法” 的功能边界混淆。核心结论是:Excel 透 ...
2025-10-29在 CDA(Certified Data Analyst)数据分析师的工作中,“多组数据差异验证” 是高频需求 —— 例如 “3 家门店的销售额是否有显 ...
2025-10-29在数据分析中,“正态分布” 是许多统计方法(如 t 检验、方差分析、线性回归)的核心假设 —— 数据符合正态分布时,统计检验的 ...
2025-10-28箱线图(Box Plot)作为展示数据分布的核心统计图表,能直观呈现数据的中位数、四分位数、离散程度与异常值,是质量控制、实验分 ...
2025-10-28在 CDA(Certified Data Analyst)数据分析师的工作中,“分类变量关联分析” 是高频需求 —— 例如 “用户性别是否影响支付方式 ...
2025-10-28在数据可视化领域,单一图表往往难以承载多维度信息 —— 力导向图擅长展现节点间的关联结构与空间分布,却无法直观呈现 “流量 ...
2025-10-27这个问题问到了 Tableau 中两个核心行级函数的经典组合,理解它能帮你快速实现 “相对位置占比” 的分析需求。“index ()/size ( ...
2025-10-27对 CDA(Certified Data Analyst)数据分析师而言,“假设检验” 绝非 “套用统计公式的机械操作”,而是 “将模糊的业务猜想转 ...
2025-10-27在数字化运营中,“凭感觉做决策” 早已成为过去式 —— 运营指标作为业务增长的 “晴雨表” 与 “导航仪”,直接决定了运营动作 ...
2025-10-24在卷积神经网络(CNN)的训练中,“卷积层(Conv)后是否添加归一化(如 BN、LN)和激活函数(如 ReLU、GELU)” 是每个开发者都 ...
2025-10-24在数据决策链条中,“统计分析” 是挖掘数据规律的核心,“可视化” 是呈现规律的桥梁 ——CDA(Certified Data Analyst)数据分 ...
2025-10-24在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22