京公网安备 11010802034615号
经营许可证编号:京B2-20210330
我所处的位置决定我看世界的角度。从这里望去,2016 年的分析领域令人振奋。有史以来,分析领域从未如此重要、如此有趣。
1. 机器学习在企业生根发芽
机器学习(Machine learning)的历史可以追溯到 1950 年,但直到最近,它都只是精英人才的领域并长期被人忽视。我预言机器学习会就此稳步发展,因为许多大型企业正在接纳机器学习。如今除了研究者和数字时代原住民,企业也在探索如何把机器学习变为生产力。在一些已经规范化的行业,模型解释性较差,曾导致模型难以应用。如今这些行业的从业者使用机器学习,寻找更多创造性的方法,从模型中选择变量,而这些变量之后能由常用工具进一步构建。机器学习从多个学科中获取营养,所以未来预计会产生更多跨学科的兴趣。回想去年 INFORMS 年会的主题,Dimitris Bertsimas 讲“现代优化视野下的统计与机器学习”( Statistics and Machine Learning via a Modern Optimization Lens )。我的同事 Patrick Hall 也对于“为什么是机器学习?为什么是现在?”(Why Machine Learning? Why Now?)这一话题给出了他的看法。
2. 物联网大潮降温,面对现实
根据 Gartner 公司的新科技周期理论(Hype Cycle)来看,物联网(Internet of Things, IoT)正处在科技周期的顶峰。但在 2016 年我预计物联网这个概念将有所降温,开始面对现实。如何采集是一个很实际的障碍——信息太多了。我的一个同事正在把我们新大楼的HVAC 暖通系统,作为一个物联网测试项目进行分析。这栋楼里到处都是传感器,但获取数据却并不容易。设施部门告诉他这是IT部门的职权,IT部门把他又踢到了制造商那里,因为 HVAC 收集数据之后发送给了制造商。“数据所有权”是一个在逐渐浮现的议题:你生产了数据,却无法获取它。如何证实自己的价值是物联网面对的更大挑战。物联网在企业级的整体生产应用依然有限。物联网给出的承诺无与伦比,所以在 2016 年让我们期待早期使用者们能解决问题,给出答案。
3. 大数据走出喧嚣,让模型变得丰富
大数据已经走出了喧嚣,产生了实际的价值。如今的建模者可以获取的数据种类前所未有地丰富(例如,非结构数据,地理空间数据,图像,声音),而这些数据使得模型可以变得更加丰富。大数据的另一新进展来自各类竞赛,这些竞赛超越了之前游戏化的形式,通过众包和数据分享产生了实际价值。拿前列腺癌 DREAM 挑战为例,参赛队伍使用四种临床诊断的匿名数据挑战开放的临床研究问题。这些数据来源众多,大部分是第一次公之于众。参赛队伍的数目史无前例,最终的获胜者战胜了之前此领域尖端研究者开发的模型。
4. 通过分析提高信息安全
随着物联网发展,传感器的广泛使用肯定让数码空间的犯罪分子感到兴奋。他们使用这些设备,用一种缓慢而低调的木马手段进行劫持。许多传统的侦查手段对此无效,因为侦查不再是寻找一个稀有事件的过程,而需要对情境中事件的累积进行理解。跟物联网一样,信息安全面对的一个挑战和数据有关。我预计先进的分析作为追踪数据的手段,能为侦查和预防做出新的贡献。很可惜,本文无法谈论大数据的合作中正在发展出的方法,因为我们不想让坏蛋知道我们是怎么发现它们的。这方面的许多优秀工作都是在高度安全的隔离环境中完成的。不过,2016 年 SAS 和其他各方仍会高度关注信息安全。
5. 分析驱动着企业与学界加强互动
北卡罗来纳州立大学的高级分析研究所(The Institute for Advanced Analytics, IAA)关注分析领域的硕士项目数量增长。新的硕士项目与日俱增。企业的招聘需求促进了增长,但同时我也看到了它们对于研究的兴趣。越来越多的企业在设立学术扩展部门,并表现出对于研究合作的浓厚兴趣。有时这种兴趣超越合作伙伴关系,转而直接雇佣学界名人。这些学界名人可能是休假期间来工作,或者在学界和企业往返。例如,机器学习顶尖研究者 Yann LeCun 曾在贝尔实验室工作,也曾是纽约大学的教授,曾是建立纽约大学数据科学中心的主管,现在在 Facebook 带领人工智能研究团队。INFORMS(运筹学与管理科学研究协会),通过为学界提供与分析有关的教学材料的方式,支持这种产学互动。2016 年 INFORMS 会为业界提供一个可查询的、分析领域(硕士)项目的数据库以促进双方往来,并提供新的 Associate Certified Analytics Professional 证书来帮助选拔毕业生。
本文来源:简书
转自:中国大数据
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27在数字化时代,企业积累的海量数据如同散落的珍珠,若缺乏有效的梳理与分类,终将难以发挥实际价值。CDA(Certified Data Analys ...
2026-02-27在问卷调研中,我们常遇到这样的场景:针对同一批调查对象,在不同时间点(如干预前、干预后、随访期)发放相同或相似的问卷,收 ...
2026-02-26在销售管理的实操场景中,“销售机会”是核心抓手—— 从潜在客户接触到最终成交,每一个环节都藏着业绩增长的关键,也暗藏着客 ...
2026-02-26在CDA数据分析师的日常工作中,数据提取、整理、加工是所有分析工作的起点,而“创建表”与“创建视图”,则是数据库操作中最基 ...
2026-02-26在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25