京公网安备 11010802034615号
经营许可证编号:京B2-20210330
在世界杯预测时准确率超高的百度大数据预测在稳步推进时遇到了一个小障碍,尚处于内测的票房预测对《黄金时代》的预测与实际结果出现了偏差,被媒体长篇报道引发业内高度关注,笔者一直在观察大数据预测业务,对于百度预测《黄金时代》失利一事有自己的一些观点,不吐不快。
一、看待大数据预测失准要冷静客观
近年来,大数据一词频繁出现在各类媒体上,与大 数据相关的各种产业、产品也在蓬勃发展。今年2月,中关村管委会在《加快培育大数据产业集群推动产业转型升级的意见》发布会上表示,到2016年,中关村 大数据带动的产业规模将超过1万亿元,这还仅仅是中关村大数据产业的数字而已,放眼全球,大数据未来的钱景非常可观。尽管大数据概念被热炒,但与大数 据相关的各种产品其实尚处在初期探索阶段,比如利用大数据做预测,尽管百度预测此前在世界杯预测、黄金周旅游预测等产品上表现出比较高的准确率,但对预 测本身来说,出现失准的现象其实很正常。
具体到《黄金时代》票房预测这件事上,我们先来看看 百度的官方解释。百度对媒体的回应并没有将问题归结到工程师犯错,而是直接指出核心原因:因为我国电影市场上文艺片的历史票房数据很少,所以在针对 《黄金时代》进行预测时采用了通用的模型而没有针对文艺片单独建模,导致最终结果出现偏差。
拥有萧红、民国、文艺这些标签,《黄金时代》算得上 相对小众的电影,面向的观众并非主流人群。关于这类电影的任何数据都是少之又少,没有对应类型片的预测模型可供参考。百度在预测《黄金时代》时采取了通用 电影的模型,导致出现了较大偏差,未来如果要预测准确,最好的解决方式肯定是针对不同类型的电影单独建模,而据我了解,尚处在内测阶段的票房预测已经在进 行这方面的改进。
浏览百度预测平台(trends.baidu.com),百度票房预测的图标是灰色的,并没有正式上线,相反,经济指数、疾病、景点和赛事预测倒已全面上线投入使用。百度票房预测模型还需进一步完善,更多参数需要加入模型,比如影片属性、片长、排片量、场均票价等全方位维度都纳入考虑。
不过,从另一个角度来看,我认为,就算是百度票房预测正式上线之后出现预测失误,也非常正常,没有谁真正拥有水晶球,大数据预测无法确定某件事情必然会发生,它更多是给出一个概率,人类只有不断地去接近这一个概率。预测的前提就是要承认不确定性的存在。在不同领域不确定性大有不同。票房、股市恰恰就是更容易受人为影响的存在大力不确定性的领域,预测的难度会大过天气、旅游、交通、物价等。
因为一部《黄金时代》预测失利便质疑大数据预测本身,或者票房预测本身,是不合理的。百度此前在世界杯期间、在黄金周期间相对漂亮的预测结果,已经证明了大数据预测的价值,只不过面对票预测房这一全新的领域,需要更耐心地优化而已。那么,票房预测在中国真的没效吗?
二、预测的精髓在于沉淀和纠偏
《为什么大数据在预测《黄金时代》票房时不灵了?》一文的核心观点列举如下:1、中国票房数据沉淀太少;2、一些人为制造的数据对票房预测造成干扰;3、预测模型处于初级阶段,变量遗漏和样本偏差;4、影院经理预测靠谱,票房预测没有意义,电影预测谈大数据为之过早。
对于这些观点,只有第3点我表示认同,这是客观事 实,百度也承认处于内测阶段的票房预测模型存在不足尚需完善。但如果深思则会发现,世界上并无完美的预测模型,每个领域都是,下一秒要发生的事情会受到诸 多变量影响,有些变量是可提前纳入考虑的,有些变量就算考虑到却又是很难监控,变量遗漏和样本偏差是永远存在的预测问题,预测者只有不断地更新变量、纠偏 样本、升级模型才可以不断地保持预测足够接近真实。
在《大数据预测将会改变哪些行业?》 一文中,笔者总结大数据预测的逻辑基础是,每一种非常规的变化事前一定有征兆,每一件事情都有 迹可循,如果找到了征兆与变化之间的规律,就可以进行预测。 对于预测来说至关重要的两点是:从过往数据和经验中得到的规律,这映射到预测模型;可以实时监控的变化,映射到变量或者说实时数据。大数据预测与传统 预测的不同就在于:更具时效性、新型数据源、动态性预测以及规律性依赖。
对票房预测持消极态度的首先将问题归结为数据:电影数据沉淀太少、各家网络数据不通以及脏数据问题。
1、沉淀太少是杞人忧天。
中国票房数据沉淀太少可能是客观事实。但预测需要海量历史数据的原因在于从中发现规律。但倘若只有100年的票房数据,却并没有与影响这些票房数据的变量数据,对于挖掘规律其实并无帮助。
一个例子是百度在做世界杯预测时便与第三方数据公司合作得到大量历史数据进行挖掘,将球队、队员、场地等静态因素考虑在内同时引入舆情、欧赔指数等动态变量,最终实现接近准确的预测。
对于票房预测而言,就算得到中国80、90年代的票 房数据,而不是预测相关数据,对于票房规律的获取并无什么帮助,那时候并无互联网,电影市场早已面目全非。票房预测究竟需要什么数据?没有人可以告诉 我们答案。等到10年之后数据积累完全再来谈大数据预测,并不现实。因为今天不做,人们就不知道该收集、记录什么数据。况且谁又能指出10年与2年在时间 上的差距会对数据积累造成什么本质不同呢?
大数据预测的数据源优势正是在于它可以更全面及时地记录数据,并且收集到过往完全无法收集的数据比如用户的需求、舆情、情绪变化,或者说出行规律、电影票价、影院排期数据。因此与其去担忧传统数据沉淀不足还不如思考票房预测究竟需要哪些数据,究竟如何才能提升规律?
2、数据不通和脏数据是永恒问题。
网络数据不通是整个互联网都要面临的数据鸿沟问题, 没有哪一家拥有全网的数据,聚合全网数据进行预测几乎是不可能完成的任务,况且这根本没任何必要。如果说社交网络数据对预测很重要,那么中国只有腾讯才可 能做好预测实际并没有做。阿里淘宝指数已成为电商销量风向标、百度搜索指数对于各行各业同样具有重要的参考意义,因为它表征兴趣。每家掌握数据的性质 不同,但确实可通过合作去得到更多维度的数据,最终提升预测可靠性,但要各家直接打通数据壁垒是不现实的。
同理,脏数据以及噪音是整个互联网永远存在 的现象,就算是传统的采样调研难免也会遇到噪声样本进而被干扰。应对这个问题只有尽量过滤噪音数据,同时考虑到噪音对模型进行不断地纠正,并且增大预测结 果的误差范围。还有一个假设是,如果有脏数据对结果起到积极作用(比如让票房成绩更好),同样会有脏数据对结果起到消极影响。
百度搜索结果不排除有人为操作的数据,水军评论、豆瓣评分大家心知肚明,但文中所提及的百度商业化结果却根本算不上脏数据,因为百度要排除商业广告的影响轻而易举,况且这些数据对预测是十分有价值的,Google票房预测模型一部分便是基于广告点击数据。
3、影院经理不是预测而是影响票房。
影院经理确实可预测对应影院某部电影的票房结果。如果他们掌握拍期权甚至还可以直接影响、决定对应电影的局部票房。所有影院经理最终会对整体票房造成莫大的影响。这并不是一个因果关系,而是环环相扣:影院经理在预测票房的同时也影响着票房。
我们可以将影院经理对应到股市中的股民,股民对自己 所关注的股票价格有所预期,基于这个预期进行减仓或增持等操作。所有股民的博弈最终决定了股价的波动。但这并不意味着股民是最好的股票预测专家。在旅游、 交通、房价等领域均有类似的状况,参与者基于个体的预测,或者第三方预测结果去做出行动,进而影响结果。
这里想说明的是,将参与者与预测者放在一起本身就不 合适,参与者是十分重要的动态变量。《黄金时代》出现如此惨淡的票房很大程度便是票房经理不断降低预期进而减少排片所致。不过,百度未来与影院或者票房经 理合作倒确实可以提升预测准确率,一方面在线下升级模型,另一方面将票房经理的排期计划纳入监控范围,把百度数据+工程师的大数据预测升级为众包式的票房 预测,倒有可能。
最后我想说的是,因为一部电影的预测失利否定大数据 票房预测确实有待商榷,天气预报不断地沉淀不断地升级才能做到今天的准确率以及精细化,但仍有不准的时候,在影响我生活时我也曾愤怒地认为天气预报不考 虑,但大家都知道事实并非如此。票房预测刚刚开始,或许应该得到更多包容。从长远来看,通过不断的优化,如果票房预测产品最终能够达到一定的准确度,那么 对于整个电影产业将会提供非常重要的参考价值,比如对投资方、拍摄方、推广方提供更准确的数据参考,从而引导他们在宣传推广、剧情设置甚至是甄选演员等方 面做出更加准确、有利的判断。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
机器学习的本质,是让模型通过对数据的学习,自主挖掘规律、实现预测与决策,而这一过程的核心驱动力,并非单一参数的独立作用, ...
2026-03-27在SQL Server数据库操作中,日期时间处理是高频核心需求——无论是报表统计中的日期格式化、数据筛选时的日期类型匹配,还是业务 ...
2026-03-27在CDA(Certified Data Analyst)数据分析师的能力体系与职场实操中,高维数据处理是高频且核心的痛点——随着业务场景的复杂化 ...
2026-03-27在机器学习建模与数据分析实战中,特征维度爆炸、冗余信息干扰、模型泛化能力差是高频痛点。面对用户画像、企业经营、医疗检测、 ...
2026-03-26在这个数据无处不在的时代,数据分析能力已不再是数据从业者的专属技能,而是成为了职场人、管理者、创业者乃至个人发展的核心竞 ...
2026-03-26在CDA(Certified Data Analyst)数据分析师的能力体系中,线性回归是连接描述性统计与预测性分析的关键桥梁,也是CDA二级认证的 ...
2026-03-26在数据分析、市场研究、用户画像构建、学术研究等场景中,我们常常会遇到多维度、多指标的数据难题:比如调研用户消费行为时,收 ...
2026-03-25在流量红利见顶、获客成本持续攀升的当下,营销正从“广撒网”的经验主义,转向“精耕细作”的数据驱动主义。数据不再是营销的辅 ...
2026-03-25在CDA(Certified Data Analyst)数据分析师的全流程工作中,无论是前期的数据探索、影响因素排查,还是中期的特征筛选、模型搭 ...
2026-03-25在当下数据驱动决策的职场环境中,A/B测试早已成为互联网产品、运营、营销乃至产品迭代优化的核心手段,小到一个按钮的颜色、文 ...
2026-03-24在统计学数据分析中,尤其是分类数据的分析场景里,卡方检验和显著性检验是两个高频出现的概念,很多初学者甚至有一定统计基础的 ...
2026-03-24在CDA(Certified Data Analyst)数据分析师的日常业务分析与统计建模工作中,多组数据差异对比是高频且核心的分析场景。比如验 ...
2026-03-24日常用Excel做数据管理、台账维护、报表整理时,添加备注列是高频操作——用来标注异常、说明业务背景、记录处理进度、补充关键 ...
2026-03-23作为业内主流的自助式数据可视化工具,Tableau凭借拖拽式操作、强大的数据联动能力、灵活的仪表板搭建,成为数据分析师、业务人 ...
2026-03-23在CDA(Certified Data Analyst)数据分析师的日常工作与认证考核中,分类变量的关联分析是高频核心场景。用户性别是否影响商品 ...
2026-03-23在数据工作的全流程中,数据清洗是最基础、最耗时,同时也是最关键的核心环节,无论后续是做常规数据分析、可视化报表,还是开展 ...
2026-03-20在大数据与数据驱动决策的当下,“数据分析”与“数据挖掘”是高频出现的两个核心概念,也是很多职场人、入门学习者容易混淆的术 ...
2026-03-20在CDA(Certified Data Analyst)数据分析师的全流程工作闭环中,统计制图是连接严谨统计分析与高效业务沟通的关键纽带,更是CDA ...
2026-03-20在MySQL数据库优化中,分区表是处理海量数据的核心手段——通过将大表按分区键(如时间、地域、ID范围)分割为多个独立的小分区 ...
2026-03-19在商业智能与数据可视化领域,同比、环比增长率是分析数据变化趋势的核心指标——同比(YoY)聚焦“长期趋势”,通过当前周期与 ...
2026-03-19