京公网安备 11010802034615号
经营许可证编号:京B2-20210330
QQ大数据:年轻人逃离北上广了吗_数据分析师
早在2000年,诺贝尔经济学奖得主斯蒂格里茨就说过:21世纪影响人类进程有两件大事,一是以美国为首的新技术革命;一是中国的城市化。
当下中国已经有一个基本共识,就是没有城市化就没有中国的现代化。但是,出于精英阶层对大城市化和所谓“城市病”的恐惧;出于文人思维中区域均衡发展的乌托邦梦想;出于权力的傲慢与自负,当代中国的城市化进程一直存在着规律与规划撕裂、人口流动与政府导向背离等现象。它一方面导致人口净流出地区的过度投资和过度城市化,造成各种资源的巨大浪费。不把钱当钱,一直在搞小城镇大跃进,西部大开发,就地城镇化。另一方面导致人口净流入地区,尤其是流入大城市人口的各项基本自由和权利得不到保障,不把人当人,无视人的自由选择和自由迁徙权利,大城市想尽一切办法通过收容遣送(已废除)、户籍管制、学籍限制、产业强迁等往外“赶人”。
但事实证明以西部大开发和小城镇战略为代表的“区域均衡发展战略”是失败的。在产出和投入比中,东部一直最高,中部其次,西部和东北一直垫底;在经济发展上,西部与东部的差距越来越大。西部人口也持续外流。从国家统计局提供的数据看,在2001至2012年的11年中,河南、四川、安徽、贵州、广西等五个中西部省份出现了人口净减少。
而日前QQ基于8亿多活跃用户,通过大数据分析首次披露“逃离北上广”数据图。数据显示,2014年1月16日至2月1日,共计4907万人从北上广深四城回到全国各地,占四地总用户数的51%。节后,约1070万的人真正逃离了北上广深,逃离率为11%,其中,北京又以18%的逃离率成为人们最想逃离的城市。其余的人选择继续他们的打拼之路,再次离开亲人,义无反顾踏上回归北上广之路。
从2014年2月2日至2月25日,1994万用户在2014年首次从全国各地来到北上广深,新增率达到21%。其中近7成是18至29岁的年轻人,而北京凭借27%的涌入率,再次夺冠,成为人们最愿意来此打拼的城市。
解读规律探索规律坚守规律这样的知识求索,比解读政府工作报告往往更有意思也更有用,更能知道社会发展的潮流和方向。大数据是全数据,不带有任何取样的倾向性,也减少了取样的局限性。样本越大,真实准确率越高。有人提出,以QQ登录地作为统计根据,统计比例不会太科学,尤其是逃离部分,竞争力下降的中年以上农民工未必上QQ,这部分人处于自然规律和制造业萧条考量,应该才是逃离的主力,而新增部分应该是可信的,年轻人几乎很少不用QQ的。
这个分析有道理。也就是说,真正逃离北上广深的实际上不止11%,而“逃往”北上广深的21%,则比较接近真实数据。
但考虑到有关部门公布的2013年年末北京常住人口2114.8万;上海市常住人口2415.15万。广州估计1300万,深圳估计1100万左右,合计6930万,比QQ在这四城市的登录用户总数(4907÷51%=9621)还少2691万,当然这也许可以解释为多出部分为瞬间流动人口。再考虑到相当比例中年以上的农民工和中老年人不上QQ(这个比例也是确定的,就是QQ有8亿多活跃用户,全国13.7亿人,活跃用户与非活跃用户之比为8:5.7),因此我们可以推算,2013年底,北上广深四地活跃用户与非活跃用户分别为9621万和6855万。那么,包含瞬间流动人口在内,北上广深四城市2013年底的实际人口数量并非官方公布的6930万,而是高达1亿6476万。
考虑到北上广深的城市特征和年龄结构偏年轻的特征,而其余大量待在农村的人口不用QQ等,上述人口总数可以作适当修正,那么我们可以估计这四大城市的实际人口当也在1亿2000万上下,比官方公布的数据多出近一倍。
这个数据,可以从实际生活中得到验证。2013年某日在一个饭局上,某位从小和大大在一个大院里长大、其母亲对大大兄弟们还多有照顾的、对公共事务几乎不食人间烟火的生意人说,北京公安的朋友告诉他,北京的人口(含瞬间流动人口)实际上已经超过4千万。
为什么实际人口4千万,但官方数据只有2100多万?瞬间流动人口没有计入只是一部分原因(因为不可能那么多),还有一部分原因我猜是因为官方的主流意识形态一直在以资源有限理论控制大城市人口,实际人口与他们想控制的人口规模差别太大,将会揭示资源有限理论和人口控制理论的谎言破产。这个理论一破产,再提控制大城市人口就没有依据了,而且因为日积月累积重难返,他们将面临如何解决流动儿童就学、高考等巨大现实压力。
我们再来看“逃往”北上广深的人群。QQ大数据显示,1994万用户年后首次从全国各地来到北上广深四地。请注意,这里不含刚毕业的700多万大学生(学生6、7月才离校),大学生留在这四地的比例达到一半以上。智联招聘根据简历库数据分析显示,高校毕业生初次就业集中在北京、上海、广州、深圳四大城市的比例高达54.1%,毕业三年后在这四大城市就业的更是高达57.3%。
也就是说,每年北上广深四大城市新增就业人口将达到1994+350=2344万,而流出人口则近半。这2344万是个什么概念?国家统计局数据显示,2002年至2011年,中国城镇化率以平均每年1.35个百分点的速度发展,城镇人口平均每年增长2096万人。(2012年8月17日中国新闻网)也就是说,每年新进入北上广深四大城市的人口总量超过每年从农村进入城市的人口总量。
这样一分析,中国的城市化路径就变得很清晰了:中国的城市化过程,不仅是农村包围城市、农民成为市民的过程,而且是从小城市到大城市的过程。相当多人,包括大学毕业生,包括刚洗脚离田的青年农民,都是一步到位先进入大城市,然后其中一半左右的人,在经过大城市多年的熬煎与洗礼之后,因为种种原因再向中小城市分散。而大部分的人,则留在了大城市!QQ大数据表明,节后未返回北上广深的人群,大部分流向了山东、河南、湖南、安徽以及除广州深圳外的广东其他地区,在家乡附近的二三线城市找到了他们新的天地。
这一切说明了什么?说明市场规律不听领导和决策的指挥棒,反过来则说明决策不尊重公民自由、不尊重市场规律。如今我们三四线以下城市大跃进已经制造了大量空城,留下了巨额债务,给未来中国经济社会留下巨大隐患,但我们仍然在意气风发地“深入实施区域发展总体战略,优先推进西部大开发,全面振兴东北地区等老工业基地……”(《2014年政府工作报告》)我们仍然在以大无畏的精神说:“北京人口调控的当务之急是要痛下决心,坚决遏制住人口无序过快增长的势头,要抓好以业控人,坚决淘汰吸引流动人口过多的产业。”
城市化是经济自由和个人自由的必然结果,大城市化是资源节约、效率提高、人类自由与能量充分施展的必然要求和必然结果,也是浩浩荡荡势不可挡的全球性规律,顺之者繁荣昌盛,逆之者萧条衰败。任何把城市化当成经济增长、“城乡均衡发展”和“疏散大城市人口”的目的,最后都一定会遭遇失败的命运。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在使用Excel透视表进行数据汇总分析时,我们常遇到“需通过两个字段相乘得到关键指标”的场景——比如“单价×数量=金额”“销量 ...
2025-11-14在测试环境搭建、数据验证等场景中,经常需要将UAT(用户验收测试)环境的表数据同步到SIT(系统集成测试)环境,且两者表结构完 ...
2025-11-14在数据驱动的企业中,常有这样的困境:分析师提交的“万字数据报告”被束之高阁,而一张简洁的“复购率趋势图+核心策略标注”却 ...
2025-11-14在实证研究中,层次回归分析是探究“不同变量组对因变量的增量解释力”的核心方法——通过分步骤引入自变量(如先引入人口统计学 ...
2025-11-13在实时数据分析、实时业务监控等场景中,“数据新鲜度”直接决定业务价值——当电商平台需要实时统计秒杀订单量、金融系统需要实 ...
2025-11-13在数据量爆炸式增长的今天,企业对数据分析的需求已从“有没有”升级为“好不好”——不少团队陷入“数据堆砌却无洞察”“分析结 ...
2025-11-13在主成分分析(PCA)、因子分析等降维方法中,“成分得分系数矩阵” 与 “载荷矩阵” 是两个高频出现但极易混淆的核心矩阵 —— ...
2025-11-12大数据早已不是单纯的技术概念,而是渗透各行业的核心生产力。但同样是拥抱大数据,零售企业的推荐系统、制造企业的设备维护、金 ...
2025-11-12在数据驱动的时代,“数据分析” 已成为企业决策的核心支撑,但很多人对其认知仍停留在 “用 Excel 做报表”“写 SQL 查数据” ...
2025-11-12金融统计不是单纯的 “数据计算”,而是贯穿金融业务全流程的 “风险量化工具”—— 从信贷审批中的客户风险评估,到投资组合的 ...
2025-11-11这个问题很有实战价值,mtcars 数据集是多元线性回归的经典案例,通过它能清晰展现 “多变量影响分析” 的核心逻辑。核心结论是 ...
2025-11-11在数据驱动成为企业核心竞争力的今天,“不知道要什么数据”“分析结果用不上” 是企业的普遍困境 —— 业务部门说 “要提升销量 ...
2025-11-11在大模型(如 Transformer、CNN、多层感知机)的结构设计中,“每层神经元个数” 是决定模型性能与效率的关键参数 —— 个数过少 ...
2025-11-10形成购买决策的四个核心推动力的是:内在需求驱动、产品价值感知、社会环境影响、场景便捷性—— 它们从 “为什么买”“值得买吗 ...
2025-11-10在数字经济时代,“数字化转型” 已从企业的 “可选动作” 变为 “生存必需”。然而,多数企业的转型仍停留在 “上线系统、收集 ...
2025-11-10在数据分析与建模中,“显性特征”(如用户年龄、订单金额、商品类别)是直接可获取的基础数据,但真正驱动业务突破的往往是 “ ...
2025-11-07在大模型(LLM)商业化落地过程中,“结果稳定性” 是比 “单次输出质量” 更关键的指标 —— 对客服对话而言,相同问题需给出一 ...
2025-11-07在数据驱动与合规监管双重压力下,企业数据安全已从 “技术防护” 升级为 “战略刚需”—— 既要应对《个人信息保护法》《数据安 ...
2025-11-07在机器学习领域,“分类模型” 是解决 “类别预测” 问题的核心工具 —— 从 “垃圾邮件识别(是 / 否)” 到 “疾病诊断(良性 ...
2025-11-06在数据分析中,面对 “性别与购物偏好”“年龄段与消费频次”“职业与 APP 使用习惯” 这类成对的分类变量,我们常常需要回答: ...
2025-11-06