京公网安备 11010802034615号
经营许可证编号:京B2-20210330
我们用“大数据”做空_数据分析师考试
不是标题党,确有其事,不过不是我们做空,是我们帮助客户做空,那还是我在律师事务所做专职律师时候的事。
大家如果对反垄断法有一定的了解的话,就知道如果两个(或以上)企业之间发生集中(比如兼并收购),且参与集中的企业达到一定的规模(比如营业额达到一定的标准),那么这个集中就必需先申报(比如在中国向商务部进行申报),待申报被批准后方能实施集中。反垄断申报的目的在于防止一个集中会破坏一个相关市场的竞争秩序,从而损害消费者的利益。举个例子,如果可口可乐和百事可乐集中合并为一个企业,那么这个集中就极有可能导致可乐市场的竞争秩序被扭曲和破坏——可乐市场的竞争因为两个主要竞争者的消逝而消逝了,那么可乐的价格就极有可能飙升,从而损害消费者的利益。
如果可口可乐和百事可乐要集中合并的话,那么这个集中合并一定得去相关市场的政府部门申报,与此同时就会有很多券商、对冲基金或者其他人来决定是否做多还是做空这两个公司的股票。如果这个集中被批准的可能性较大,那么做多这两个公司股票的基本面就大——虽然集中可能损害消费者利益,但对两个公司而言是利好,这两个公司的股价就会上涨,因此做多的赢面大。反言之,如果这个集中被拒绝的可能性较大,那么做空这两个公司股票的基本面就大——因为集中申报一旦被拒绝,那么参与集中的公司的股票就会下跌,因此做空的赢面大。当然我用这两个可乐巨头来举例可能太过典型而不具实际意义,因为它们的集中被否几乎就是板上钉钉的事。那我们就用一个实战例子来说事。不过这个例子还是与可口可乐有关。
2008年9月3日,可口可乐宣布计划以现金收购中国汇源果汁集团有限公司(01886.HK)。可口可乐公司建议收购要约为每股12.20港元,并等价收购已发行的可换股债券及期权。可口可乐在宣布之前已取得汇源三个股东签署的接受要约不可撤销承诺,三个股东共拥有汇源66%股份。如此项建议交易获得接纳, 可口可乐付出的对价约24亿美元。该交易若完成,将成为可口可乐到当时为止在中国金额最大的一笔收购交易,汇源果汁也将撤市。
上述消息宣布之后,汇源与可口可乐的股价均大幅上扬。但问题是可口可乐对汇源的收购属于中国反垄断法下应当予以申报的一次集中,该集中是否能得到商务部的批准成为这次交易的X因素,对此有对冲基金找到我们做分析,我们按照我们做此类业务的套路和方法收集了相关数据进行分析(至于是什么样的数据和什么样的分析方法我们在此就不说了)。不管怎样,我们最终的分析结果是商务部反垄断局将不会批准这次集中,幸运的是我们这次分析结果是正确的。相应地,听从我们的建议而做空的客户也就赚了钱。
7年前我们在做上述案例分析的时候,还没有所谓“大数据”或者“小数据”的概念。现在回过头来想想,我们当时(和现在)所做的无非也就是数据分析,当然了,所涉及的数据从总量上看也许不是那么地大,但是相对于具体项目而言已经足够大。当然,是不是一定可以把这些数据看成我们现而今所称的“大数据”也许值得商榷,我们以后另行撰文来讨论,这也是我在本文标题中把“大数据”加上引号的原因。不管怎样,考虑到商务部迄今为止在所有的 1000多件反垄断申报案件中只有2个未获申报,我们当时对概率如此之小的事件能够准确地预判还是令人值得骄傲的,这应当归功于我们收集数据的准确与分析的到位。
如果我们可以把上述成功做空看成是采用“大数据”所做的一个有效分析的话,那么“大数据”分析似乎具有以下几个特点,我们在这里就所谓的特点试图做一个归纳以达到抛砖引玉的目的:
- 大数据分析首先应当是商品。不管数据采集和分析的方法是怎样的,最后出来的产品应当有人化钱购买。没有商业价值的大数据或大数据分析产品是没有价值的,换言之是做不下去的。
-大数据分析产品的开发应当有针对性的客户。不同的客户对大数据分析产品的需求是不一样的。就拿法律行业的上述大数据为例,对大数据及大数据分析产品有直接需求的基本上是做涉外业务的律师事务所及国际大公司,所以上述大数据及大数据分析产品的工作语言基本上都是英语。
- 大数据分析的生命力在于它的准确性。以我们上述案件为例,可口可乐收购汇源被否,汇源股价在紧接着开盘的当天全天暴跌42%。而在这之前可口可乐天价收购汇源的消息曾刺激汇源股价狂飙近200倍。可口可乐在宣布收购汇源果汁之后,其在纽约证交所的股价曾一度出现强劲上升,但在后来的半年里股价下降了20%,这与其收购汇源失败不是没有关联的。可以想象如果我们当时的分析是不准确的,那么客户就得赔钱了。当然,我们这个案件的成功不能不说有一定的偶然性,那么大数据分析是不是有一定的容错?我相信是有的。如果大数据不会犯错,那其就等同于上帝了,但大数据的错误率太高,那么也就没有商业价值,甚至连娱乐价值也都没有了。
在文章最后问一个问题:用数据(不管是大还是小)分析出来的结论来做空算不算是恶意呢?也许这个问题有点“然并卵”。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13