京公网安备 11010802034615号
经营许可证编号:京B2-20210330
在 Booking 当数据科学家是怎样一种体验
Nishikant是Booking公司的一名高级数据分析师,在本文中他分享了自己在Booking从数据科学家新手到大师的发展历程。
求职
在迪拜做了3年咨询类工作之后,我作为一名数据科学家加入了Booking 。从咨询转行到数据科学领域是我职业生涯中的重大转变,现在看来我很高兴当初做了这一选择。
在面试时,我就对Booking的感觉特别好。我有机会与数据科学家交谈,面试官的背景非常多样,其中一位拥有天文学的博士学位,另一位是自己创业公司的首席技术官。
同时Booking的伙食特别好,这也是我选择Booking的原因之一。
入职
我还记得入职的第一天,同事问我”你对你的屏幕还满意吗?”这让我很意外,因为我以前工作时只配备了一台笔记本电脑。Booking之后给我配备了一台Mac、两个大屏幕以及其他一些酷炫的设备。
入职后不久,我参与的第一个入职项目涉及到分析大量文本,我需要从中得出业务见解。以前我只有结构化数据方面的经验,因此我对这个新挑战感到兴奋。我希望提高自己文本数据的水平,但不久之后我就遇到困难了,那就是Booking庞大的数据规模。
Booking每24小时订出150万个房间,同时有数百万人访问网站,这意味着数据科学家所接触的数据规模相当大。还好公司有使用Spark进行分布式计算的内部培训。通过培训,如今我能够在多台机器上运行分析。
项目
我的第二个项目是为合作网站构建推荐引擎。以前我只做过标准回归和分类模型,这是我第一次接触到协同过滤和分解机。
由于数据规模,我不得不用PySpark进行稀疏分布矩阵。在编写代码之后,我们进行了A / B测试,看这样是否会对我们的业务带来积极影响。这也是我第一次接触A / B测试,但幸运的是公司配有完备的实验工具和基础设施,从而让这一过程并不困难。通过多次迭代,我们顺利处理了冷启动问题,并成功完成了该项目。
Booking的数据科学家在Analytics Fair上展示项目
接下来是大量的项目,每个项目都有不同的挑战,作为数据科学家我需要不断地学习。例如,其中一个项目需要我将业务问题表示为加权网络图,并进行相关分析; 在另一个项目中,我需要从简单的数据分析中得出有价值的见解。
就这样过了两年半,我目前是Booking的高级数据科学家。现在我致力于研究人工智能产品的机器翻译,并通过部署神经网络和深度学习解决方案构建全面的生产系统。
团队构成
下面我打算介绍下Booking的团队构成。
我们采用“嵌入式”结构,数据科学家与业务紧密相连。我参与的团队中有开发人员、数据科学家、产品负责人和其他专家。团队结合所有的力量,将相关概念实施到具体产品。在日常运营中,我们遵循一定的准则:每日会议、回顾、待办事项、团队目标、KPI和OKR(目标和关键结果)。再加上每两周一次的会议,能够让团队稳步发展,并尽快学习。
正是与业务的紧密联系,Booking的数据科学家都有很强的沟通能力和商业意识,同时还有很强的专业技能。这些都是我们在面试求职者时要测试的基本技能。
出色的数据科学家
Booking共有120 多名数据科学家,而且社区在日益壮大。每位数据科学家都有不同的背景和技能强项。
有些人是数据科学新手,有些人则有丰富的工作经验; 有些人是贝叶斯派,有些人是频率学派; 有些人喜欢用R语言,有些人更喜欢用Python; 有些人喜欢用Vowpal Wabbit,有些人则喜欢使用Spark和H2O进行分布式计算。
这种多样性可以让大家彼此学习和进步。我们每周都会举行相关的聚会和会谈,当中我们会谈论最新的行业动向和研究论文,并结合解决Booking的实际问题。此外,公司还会定期举办相关技术培训,包括A / B测试、Git、Hive、Python、R、Spark、H2O、TensorFlow等内容。
Booking数据科学社区每周会谈
在我看来,在Booking工作最大的财富就是出色的数据科学社区,在当中我每天都能学习新事物,并且十分开心。
面对的挑战
同时我们也有面对一些挑战。
首先,由于我们的数据科学社区发展得非常快,这也为分享知识带来了难度。为了解决这个问题,我们尝试了很多方法,比如针对专业的话题(比如自然语言处理),黑客马拉松等方面展开讨论,从而更好地分享知识。
让数据科学家参与业务也有其不利之处。有时在日常工作中我们会缺少同事的相关反馈。为了解决这个问题,我们鼓励大家分享各自的成果,并与同事一起讨论他们的最新项目。同时我们也为新员工提供导师计划。
尽管我们已多次为数据科学社区做出贡献,但我们也希望将成果分享给外部。我们目前正在制定一些指导方案。
Booking的数据科学家们在船上聚会
最后我想说,在Booking当数据科学家非常愉快,而且从来不会缺少机遇与挑战。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10