清华大学用大数据分析了9000条微博谣言,还在研究自动辟谣
社交媒体上的谣言总是让人猝不及防,有些甚至能在短时间造成不小的危害。比如,几天前,微信怎么也不会想到,因为一个年终回顾的HTML5页面被提前泄露,带来大量用户点击导致服务器瘫痪,然后引发了盗号的谣言。最后的结果是,短短的几个小时内,数百万人从微信提现,解绑银行卡。
社交媒体上都流传着哪些谣言?这些谣言都是谁发布的?为什么会有人相信并主动参与传播这些谣言?社交网络上的信息是海量的,这些问题似乎很难回答。不过最近,清华大学智能技术与系统国家重点实验室的研究人员借用了自然语言处理的帮助,对新浪微博上的谣言大数据进行了全面的分析,试图找出答案。
2012年5月,新浪微博设立了举报处理大厅,谣言占了不良信息中的一大部分。研究人员利用微博举报大厅公布的实时数据收集谣言信息。
他们收集了从2011年8月到2015年5月期间出现的9079条谣言,用函数模型对这些数据进行了预处理,发现了一些有趣的现象。
大部分微博谣言会在其发布的一个周内被举报并辟谣
第一,大多数微博谣言的影响力都比较小, 转发和评论数在500次以下的微博占到整体的84%。只有极少量的微博谣言具有极广的传播范围和强大的影响力 。
第二,谣言通常要传播一段时间后,才有可能遭到举报;同时, 由于传播速度快,大部分微博谣言会在其发布的一个周内被举报并辟谣 (88.9%)。
第三,大量举报谣言的用户, 所举报的谣言往往与自己相关. 例如, 微博用户 “美汁源饮料” 举报了 大量关于 “美汁源果粒橙” 饮料含有农药的谣言, 张家界纪委书记汪业元举报了大量关于 “汪业元发表 ‘对网络暴民杀无赦’ 的言论” 的谣言。
第四,大量发布谣言的用户,往往带有网络水军的性质,例如,有微博用户仅在几分钟的时间里发布了几十条微博, 其中大部分是谣言, 之后该用户就再未发过微博。
常识类谣言经常反复出现转发高峰
研究人员还根据谣言内容将其分成了5个分类:政治类谣言,例如钓鱼岛海域中日两国爆发海战;
经济类谣言,例如三星赔偿苹果几十车硬币;
欺诈类谣言,例如“四川藏区儿童需要御寒冬衣”,然后留下了一个虚假的联系电话;
社会生活类谣言,社会各界人物的花边新闻,例如六小龄童去世;
常识类谣言,例如阿司匹林能治疗心脏病。
这些谣言中,大部分属于社会生活类和政治类谣言 (约占70%)。而结合微博谣言发布、传播、高峰和消亡的过程还可以发现,不同的谣言出线转发峰值的情况也各部相同。
70%的谣言话题只有一个较大转发峰值,也就是说,被辟谣后,它们就会逐渐消亡。
另外,谣言的内容也和其转发峰值有关系:例如,常识类谣言由于受众广,辟谣难度较大,往往会反复被人们提及,出现多次爆发,约70%的常识类谣言通常有多个转发峰值。而关于名人或知名机构的谣言,由于关注人数众多,辟谣难度较小,因此发布之初就会出现较大转发峰值,但很快会被辟谣,约60%的此类谣言会在一个周内消亡。
人们为什么相信谣言
人们为什么会相信这些谣言呢?研究人员分析后将原因归结为两类:(1)知识受限,即缺乏专业知识而导致误信或无法辨认的谣言。例如,阿司匹林可以治疗急性心脏病;(2)时空受限谣言,即由于地域和时间限制无法辨认的谣言。例如, 有谣言称“杭州上城区一妇女喝了3罐可乐,两天后离开了这个世界。验尸结果是她死于细螺旋体病, 发病原因是直接用嘴对可乐罐饮用”。
自动辟谣框架
在对谣言进行分析之后,研究人员还试图建立一个自动辟谣机制。当然,在目前的技术条件下,自然语言处理技术还无法根据微博内容自动判断其是否为谣言。所以,研究人员的思路通过语义分析,自动根据谣言主题对其进行分类,然后发现最有可能判定该谣言的专家,推荐专家对疑似谣言进行鉴别。
研究人员的框架主要包括3个阶段的工作:
1. 谣言发布早期,通过用户举报和对可疑用户的监控建立疑似谣言的集合。一方面,将疑似谣言和谣言库中进行比对;另一方面, 对于在谣言库中没有匹配内容的谣言,通过查询该领域的专家库,推荐若干专家对该疑似谣言进行鉴别。
2. 谣言发布中期,通过自然语言处理技术分析疑似谣言的评论信息,通过社会网络分析技术分析疑似谣言的传播模式,判定该信息是否为谣言。
3. 谣言发布后期,对于判定为谣言的信息, 将其加入谣言库;对信息发布人进行可信性分析,确定其信用等级,将信用等级低于一定阈值的用户加入可疑用户库,在一段时间内对其发布的微博内容进行监控;对信息举报人和评论人进行专家发现,充实和更新该信息相关的知识领域的专家库。
当然,目前这一切还处于理论研究阶段,而建立可以用户库也需要以网站更严格地执行实名制为前提。用大数据、人工智能去对付谣言,前提是需要很多人交出更多的隐私,你愿意吗?
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析在当今信息时代发挥着重要作用。单因素方差分析(One-Way ANOVA)是一种关键的统计方法,用于比较三个或更多独立样本组 ...
2025-04-25CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-25在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-24以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《刘静:10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda ...
2025-04-23大咖简介: 刘凯,CDA大咖汇特邀讲师,DAMA中国分会理事,香港金管局特聘数据管理专家,拥有丰富的行业经验。本文将从数据要素 ...
2025-04-22CDA持证人简介 刘伟,美国 NAU 大学计算机信息技术硕士, CDA数据分析师三级持证人,现任职于江苏宝应农商银行数据治理岗。 学 ...
2025-04-21持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03