京公网安备 11010802034615号
经营许可证编号:京B2-20210330
阿里数据科技研究院:算法是大数据的核心
这两天,阿里巴巴投入1500万元新启动了一个代号为“天池”的数据竞赛,选手们比拼如何利用现有大数据进行淘宝女装搭配的算法推荐、余额宝资金的流入流出预测等。其背后的推动者是被外界称为阿里巴巴最神秘部门IDST的负责人涂子沛,著有《大数据》和《数据之巅》。
3月25日,笔者在阿里巴巴西溪园区的会议室里对涂子沛进行了独家专访。军人出身的他,身上带有一股特殊的英气,这在IT圈里并不多见。
涂子沛去年年底从美国硅谷空降阿里巴巴出任副总裁,负责大数据的商业化创新研究。该消息引得业界广泛关注,但这个主要由科学家组成的新部门一直未向外界揭开神秘面纱。
在阿里内部,做数据研究工作的IDST几乎和集团的每一个BU(事业部)都有交集,这个扮演中转站角色的部门,要如何肩负起马云“让数据驱动未来”的商业梦想?
做其他部门不愿做、做不了的事
IDST(InstituteofDataScience&Technologies),数据科学与技术研究院,单从名称上看,就明显区别于互联网公司内部的事业部运营风格,如果把各事业部比喻成拼杀于战场上的江湖派,那么IDST则充满了学院风格,其员工也大多具有科学家背景。
作为负责人,涂子沛的名片上印的英文名字是Jack,和人们熟悉的JackMa(马云)同名,其职位只写了阿里巴巴集团副总裁,此外再没有任何如IDST等相关名头。
目前,这个部门大约有150名员工,分布在杭州、北京、硅谷和西雅图两岸四地,其中杭州有50人左右。在组织架构上,IDST分属于阿里云;层级关系上,涂子沛向阿里巴巴集团首席技术官王坚博士汇报,王坚就是IDST这个想法的最初设计师。
事实上,IDST的三名负责人都有来头。除了涂子沛,漆远是普渡大学计算机系和统计系两个系的终身教授,擅长机器学习和人工智能;金榕为美国密歇根州立大学终身教授,获得过美国国家科学基金会奖(NSFCareerAward)。涂子沛对记者说,在分工上,漆远带中国团队,金榕带美国团队,他负责商业和数据经济方面的研究。
涂子沛出国前在广州武警边防总队待了8年,后又在广东省经贸部门工作两年,其在政府方面的人脉也是马云看中的资源。要知道去年以来,阿里云披荆斩棘般地与全国十几个省份达成合作协议,与政府机构数据的对接对任何一个民间数据公司来说都如获至宝。
“IDST要做阿里其他部门不愿做也做不了的事情。”这是王坚对IDST的角色定位。何为不愿做?与那些营收增长立竿见影的业务部门相比,数据研究、机器学习、自然语言处理这些领域很难快速出成绩。涂子沛也说,既然是创新部门,就没有背负传统的绩效考核目标。何为做不了?单听这些前沿性的研究领域就知道门槛有多高。
类似的研究室在全球有实力的科技企业中生根发芽,像谷歌大脑,即googleX实验室,做的是人工智能、机器学习的研究,可应用到语音识别、无人汽车等领域;微软类似的深度学习系统名叫Adam(亚当);去年5月,前“谷歌大脑”、第一个让机器识别出“猫”的科学家吴恩达从硅谷回国,加盟百度深度学习研究院,推进人工智能研究。
从硅谷到中国,不只是科学家,大量云计算方面的高层人才正演绎着这个流动趋势,比如从甲骨文到阿里云。涂子沛认为,这股趋势背后说明,在大数据、云计算等前沿领域,中国与美国的差距微乎其微,越来越多的人看到了回国建功立业的机会。
每年投入1500万元办数据大赛
对大数据的分析和使用将对互联网公司和用户生活层面产生多大的改变?
去年,阿里巴巴举办了一次天猫算法推荐大赛,其中6名大学生组成的团队拿走了100万元的头奖,他们设计的算法效率超过了阿里巴巴工程师16.9%,这套算法随即被应用到“双11”中,通俗地讲就是让商品推荐变得更精准,内部预计这套算法给平台带来了上千万元的经济价值,这也让阿里见识到了外部新生力量的强大。
该项目的负责人、来自IDST部门的高级经理王一婷说,6个人中有一人即将入职阿里巴巴,一人靠这次的一炮而红开始创业,其他人还未毕业。26日刚启动的天池大赛与此类似,将持续一年时间,有“联赛”的意味,去年比赛有国内外共7276支队伍参加。
招揽人才、创新产品的商业化应用、推动大数据生态建设,这是IDST举办这类大赛的目的。这也得到了涂子沛的证实,他向本报记者透露,阿里每年在这个比赛上投入的资金在1500万元左右,其中最大的花费是计算成本,阿里拿出了1000台服务器专门提供给参赛者,项目还会对接风投,孵化选手们的创业梦想,“如果非要说这里边有什么商业利益的话,只有参赛者的算法被应用到阿里业务中这一点。”
这次天池大赛,选手们会围绕3个课题施展拳脚,其中之一是淘宝女装搭配,阿里将淘宝上的大数据脱敏后给到参赛者,后者需要设计一套算法,利用图像识别等技术让机器来搭配服饰,代替以往的人工挑选和搭配。当然,机器的“眼光”如何,最后还要经过消费者的评估。
还有针对资金规模高达5789亿元的余额宝,选手们要做的是精准预测其未来每天的资金流入流出情况,既保证用户的高收益,又避免大量赎回导致挤兑;此外,就是预测手机淘宝用户的购物喜好。
而像在虾米音乐上根据用户的喜欢推荐音乐等课题将放到下一次大赛中去落实。
一切业务数据化,一切数据业务化,马云最近一年在全球众多高端场合“布道”其数据观点。涂子沛称,中国目前拥有的数据量占全世界的14%,预计到2020年这一比例将为21%,但数据利用率不到0.4%,数据商业化的空间以及数据经济的未来价值已经显现。
数据开放和数据商业化,将是未来几年内不断延伸的两条交叉线。涂子沛说,以前写书、演讲,是知识传播,这次从美国举家搬到杭州,角色要求转变成了知识创新,将会更有挑战。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28