阿里数据科技研究院:算法是大数据的核心
这两天,阿里巴巴投入1500万元新启动了一个代号为“天池”的数据竞赛,选手们比拼如何利用现有大数据进行淘宝女装搭配的算法推荐、余额宝资金的流入流出预测等。其背后的推动者是被外界称为阿里巴巴最神秘部门IDST的负责人涂子沛,著有《大数据》和《数据之巅》。
3月25日,笔者在阿里巴巴西溪园区的会议室里对涂子沛进行了独家专访。军人出身的他,身上带有一股特殊的英气,这在IT圈里并不多见。
涂子沛去年年底从美国硅谷空降阿里巴巴出任副总裁,负责大数据的商业化创新研究。该消息引得业界广泛关注,但这个主要由科学家组成的新部门一直未向外界揭开神秘面纱。
在阿里内部,做数据研究工作的IDST几乎和集团的每一个BU(事业部)都有交集,这个扮演中转站角色的部门,要如何肩负起马云“让数据驱动未来”的商业梦想?
做其他部门不愿做、做不了的事
IDST(InstituteofDataScience&Technologies),数据科学与技术研究院,单从名称上看,就明显区别于互联网公司内部的事业部运营风格,如果把各事业部比喻成拼杀于战场上的江湖派,那么IDST则充满了学院风格,其员工也大多具有科学家背景。
作为负责人,涂子沛的名片上印的英文名字是Jack,和人们熟悉的JackMa(马云)同名,其职位只写了阿里巴巴集团副总裁,此外再没有任何如IDST等相关名头。
目前,这个部门大约有150名员工,分布在杭州、北京、硅谷和西雅图两岸四地,其中杭州有50人左右。在组织架构上,IDST分属于阿里云;层级关系上,涂子沛向阿里巴巴集团首席技术官王坚博士汇报,王坚就是IDST这个想法的最初设计师。
事实上,IDST的三名负责人都有来头。除了涂子沛,漆远是普渡大学计算机系和统计系两个系的终身教授,擅长机器学习和人工智能;金榕为美国密歇根州立大学终身教授,获得过美国国家科学基金会奖(NSFCareerAward)。涂子沛对记者说,在分工上,漆远带中国团队,金榕带美国团队,他负责商业和数据经济方面的研究。
涂子沛出国前在广州武警边防总队待了8年,后又在广东省经贸部门工作两年,其在政府方面的人脉也是马云看中的资源。要知道去年以来,阿里云披荆斩棘般地与全国十几个省份达成合作协议,与政府机构数据的对接对任何一个民间数据公司来说都如获至宝。
“IDST要做阿里其他部门不愿做也做不了的事情。”这是王坚对IDST的角色定位。何为不愿做?与那些营收增长立竿见影的业务部门相比,数据研究、机器学习、自然语言处理这些领域很难快速出成绩。涂子沛也说,既然是创新部门,就没有背负传统的绩效考核目标。何为做不了?单听这些前沿性的研究领域就知道门槛有多高。
类似的研究室在全球有实力的科技企业中生根发芽,像谷歌大脑,即googleX实验室,做的是人工智能、机器学习的研究,可应用到语音识别、无人汽车等领域;微软类似的深度学习系统名叫Adam(亚当);去年5月,前“谷歌大脑”、第一个让机器识别出“猫”的科学家吴恩达从硅谷回国,加盟百度深度学习研究院,推进人工智能研究。
从硅谷到中国,不只是科学家,大量云计算方面的高层人才正演绎着这个流动趋势,比如从甲骨文到阿里云。涂子沛认为,这股趋势背后说明,在大数据、云计算等前沿领域,中国与美国的差距微乎其微,越来越多的人看到了回国建功立业的机会。
每年投入1500万元办数据大赛
对大数据的分析和使用将对互联网公司和用户生活层面产生多大的改变?
去年,阿里巴巴举办了一次天猫算法推荐大赛,其中6名大学生组成的团队拿走了100万元的头奖,他们设计的算法效率超过了阿里巴巴工程师16.9%,这套算法随即被应用到“双11”中,通俗地讲就是让商品推荐变得更精准,内部预计这套算法给平台带来了上千万元的经济价值,这也让阿里见识到了外部新生力量的强大。
该项目的负责人、来自IDST部门的高级经理王一婷说,6个人中有一人即将入职阿里巴巴,一人靠这次的一炮而红开始创业,其他人还未毕业。26日刚启动的天池大赛与此类似,将持续一年时间,有“联赛”的意味,去年比赛有国内外共7276支队伍参加。
招揽人才、创新产品的商业化应用、推动大数据生态建设,这是IDST举办这类大赛的目的。这也得到了涂子沛的证实,他向本报记者透露,阿里每年在这个比赛上投入的资金在1500万元左右,其中最大的花费是计算成本,阿里拿出了1000台服务器专门提供给参赛者,项目还会对接风投,孵化选手们的创业梦想,“如果非要说这里边有什么商业利益的话,只有参赛者的算法被应用到阿里业务中这一点。”
这次天池大赛,选手们会围绕3个课题施展拳脚,其中之一是淘宝女装搭配,阿里将淘宝上的大数据脱敏后给到参赛者,后者需要设计一套算法,利用图像识别等技术让机器来搭配服饰,代替以往的人工挑选和搭配。当然,机器的“眼光”如何,最后还要经过消费者的评估。
还有针对资金规模高达5789亿元的余额宝,选手们要做的是精准预测其未来每天的资金流入流出情况,既保证用户的高收益,又避免大量赎回导致挤兑;此外,就是预测手机淘宝用户的购物喜好。
而像在虾米音乐上根据用户的喜欢推荐音乐等课题将放到下一次大赛中去落实。
一切业务数据化,一切数据业务化,马云最近一年在全球众多高端场合“布道”其数据观点。涂子沛称,中国目前拥有的数据量占全世界的14%,预计到2020年这一比例将为21%,但数据利用率不到0.4%,数据商业化的空间以及数据经济的未来价值已经显现。
数据开放和数据商业化,将是未来几年内不断延伸的两条交叉线。涂子沛说,以前写书、演讲,是知识传播,这次从美国举家搬到杭州,角色要求转变成了知识创新,将会更有挑战。
数据分析咨询请扫描二维码
CDA数据分析师在中国航信高科技产业园进行了面向测试度量的数据分析培训课程,培训人数近2 ...
2024-05-01CDA数据分析师走进深圳迈瑞生物医疗电子股份有限公司,在迈瑞总部展开了为期两天的培训,本次课程参训人员线上及线下近百人, ...
2024-05-01CDA数据分析师在合肥市对合肥阳光新能源科技有限公司开展了为期8天的企业内训。 合肥阳光新能源科技 ...
2024-05-01CDA数据分析师走进海尔大学,进行了《数据治理与数据中台建设的道与术》专题培训,培训现场爆满,近百人参加了此次培训。 ...
2024-05-01在中国银行苏州分行培训中心开始数据分析师培训,此次培训课程共10天内容,包括Excel、MySQL、概率论与数理统计、SPSS等内容, ...
2024-05-01从实际的业务需求出发,结合行业的典型应用特点,围绕实际的商业问题,探讨数据挖掘、机器学习模型在金融领域的应用,包括获客、信用评分、细分画像、交叉销售、反欺诈、违规识别、时序预测、运筹优化、流程挖掘九个方面,形成 ...
2024-05-01本次培训课程为线上+线下的模式,由于学员编程能力不一、部分学员没有编程基础,故提供统计学、python基 ...
2024-05-01华夏银行信用卡中心-机器学习培训 1、课程亮点 取材于业界一流企业和顶级咨询公司的行业实践;已经被证明是人人 ...
2024-05-01主 题:数据中台建设及数据分析应用主题分享 1. 数据中台市场洞察 2. 主流数据中台产品比较 3. 某企业数据中 ...
2024-05-01围绕“数据驱动”战略,全力打造我行 300 人数字化人才梯队,着力培养数字化管理人才、大数据专业团队 ...
2024-05-01在当今数据驱动的商业环境中,数据分析成为了企业决策的重要依据。通过对大量数据的收集、处理和分析,企业能够更好地理解市场 ...
2024-04-29在人工智能(AI)的世界里,提示词(Prompt)是一种强大的工具,它能够引导AI按照用户的需求产生特定的输出。本文将深入探讨AI ...
2024-04-29CDA立足未来职场,拓展前沿视野——对外经贸大学保险学院举办“三全育人大讲堂”分享行业最新动态。 ...
2024-04-294月2日,CDA数据分析师创始发起人兼协会理事长赵坚毅博士受邀在浙江万里学院举办了一场以“数字化能力在职场中的作用” ...
2024-04-29随机森林(Random Forests)现在机器学习中比较火的一个算法,是一种基于Bagging的集成学习方法,能够很好地处理分类和回归的问 ...
2022-12-23方差分析是数据分析中常用的一种统计分析方法,接下来让我们简单了解一下方差分析的基本思想和原理吧。 方差分析(Analysis ...
2022-12-23来源:关于数据分析与可视化 关于streamlit-aggrid 数据排序 表格样式的调整 数据 ...
2022-08-03作者:麦叔 定义 「把上面晦涩的概念汇成一句话就是:」 ❝ 回调函数就是一个被作为参 ...
2022-08-03现今,高学历人群日益增多,物以稀为贵的高学历光环淡去。无论本科生还是研究生,甚至博士生,求职竞争力都大不如前,就业压力越来越大。
2022-06-01某家企业10个人面试,有9个本科生……如何脱颖而出,除得体的举止和良好的沟通力外,证书成重要筹码,这也是很多人考证的关键所在。
2022-04-14