京公网安备 11010802034615号
经营许可证编号:京B2-20210330
清华大学用大数据分析了9000条微博谣言,还在研究自动辟谣
社交媒体上的谣言总是让人猝不及防,有些甚至能在短时间造成不小的危害。比如,几天前,微信怎么也不会想到,因为一个年终回顾的HTML5页面被提前泄露,带来大量用户点击导致服务器瘫痪,然后引发了盗号的谣言。最后的结果是,短短的几个小时内,数百万人从微信提现,解绑银行卡。
社交媒体上都流传着哪些谣言?这些谣言都是谁发布的?为什么会有人相信并主动参与传播这些谣言?社交网络上的信息是海量的,这些问题似乎很难回答。不过最近,清华大学智能技术与系统国家重点实验室的研究人员借用了自然语言处理的帮助,对新浪微博上的谣言大数据进行了全面的分析,试图找出答案。
2012年5月,新浪微博设立了举报处理大厅,谣言占了不良信息中的一大部分。研究人员利用微博举报大厅公布的实时数据收集谣言信息。
他们收集了从2011年8月到2015年5月期间出现的9079条谣言,用函数模型对这些数据进行了预处理,发现了一些有趣的现象。
大部分微博谣言会在其发布的一个周内被举报并辟谣
第一,大多数微博谣言的影响力都比较小, 转发和评论数在500次以下的微博占到整体的84%。只有极少量的微博谣言具有极广的传播范围和强大的影响力 。
第二,谣言通常要传播一段时间后,才有可能遭到举报;同时, 由于传播速度快,大部分微博谣言会在其发布的一个周内被举报并辟谣 (88.9%)。
第三,大量举报谣言的用户, 所举报的谣言往往与自己相关. 例如, 微博用户 “美汁源饮料” 举报了 大量关于 “美汁源果粒橙” 饮料含有农药的谣言, 张家界纪委书记汪业元举报了大量关于 “汪业元发表 ‘对网络暴民杀无赦’ 的言论” 的谣言。
第四,大量发布谣言的用户,往往带有网络水军的性质,例如,有微博用户仅在几分钟的时间里发布了几十条微博, 其中大部分是谣言, 之后该用户就再未发过微博。
常识类谣言经常反复出现转发高峰
研究人员还根据谣言内容将其分成了5个分类:政治类谣言,例如钓鱼岛海域中日两国爆发海战;
经济类谣言,例如三星赔偿苹果几十车硬币;
欺诈类谣言,例如“四川藏区儿童需要御寒冬衣”,然后留下了一个虚假的联系电话;
社会生活类谣言,社会各界人物的花边新闻,例如六小龄童去世;
常识类谣言,例如阿司匹林能治疗心脏病。
这些谣言中,大部分属于社会生活类和政治类谣言 (约占70%)。而结合微博谣言发布、传播、高峰和消亡的过程还可以发现,不同的谣言出线转发峰值的情况也各部相同。
70%的谣言话题只有一个较大转发峰值,也就是说,被辟谣后,它们就会逐渐消亡。
另外,谣言的内容也和其转发峰值有关系:例如,常识类谣言由于受众广,辟谣难度较大,往往会反复被人们提及,出现多次爆发,约70%的常识类谣言通常有多个转发峰值。而关于名人或知名机构的谣言,由于关注人数众多,辟谣难度较小,因此发布之初就会出现较大转发峰值,但很快会被辟谣,约60%的此类谣言会在一个周内消亡。
人们为什么相信谣言
人们为什么会相信这些谣言呢?研究人员分析后将原因归结为两类:(1)知识受限,即缺乏专业知识而导致误信或无法辨认的谣言。例如,阿司匹林可以治疗急性心脏病;(2)时空受限谣言,即由于地域和时间限制无法辨认的谣言。例如, 有谣言称“杭州上城区一妇女喝了3罐可乐,两天后离开了这个世界。验尸结果是她死于细螺旋体病, 发病原因是直接用嘴对可乐罐饮用”。
自动辟谣框架
在对谣言进行分析之后,研究人员还试图建立一个自动辟谣机制。当然,在目前的技术条件下,自然语言处理技术还无法根据微博内容自动判断其是否为谣言。所以,研究人员的思路通过语义分析,自动根据谣言主题对其进行分类,然后发现最有可能判定该谣言的专家,推荐专家对疑似谣言进行鉴别。
研究人员的框架主要包括3个阶段的工作:
1. 谣言发布早期,通过用户举报和对可疑用户的监控建立疑似谣言的集合。一方面,将疑似谣言和谣言库中进行比对;另一方面, 对于在谣言库中没有匹配内容的谣言,通过查询该领域的专家库,推荐若干专家对该疑似谣言进行鉴别。
2. 谣言发布中期,通过自然语言处理技术分析疑似谣言的评论信息,通过社会网络分析技术分析疑似谣言的传播模式,判定该信息是否为谣言。
3. 谣言发布后期,对于判定为谣言的信息, 将其加入谣言库;对信息发布人进行可信性分析,确定其信用等级,将信用等级低于一定阈值的用户加入可疑用户库,在一段时间内对其发布的微博内容进行监控;对信息举报人和评论人进行专家发现,充实和更新该信息相关的知识领域的专家库。
当然,目前这一切还处于理论研究阶段,而建立可以用户库也需要以网站更严格地执行实名制为前提。用大数据、人工智能去对付谣言,前提是需要很多人交出更多的隐私,你愿意吗?
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-05在数据库数据查询、业务报表统计、多表关联分析中,LEFT JOIN左连接是使用率最高的SQL关联查询语句。其核心特性是保留左表全部数 ...
2026-06-05 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-06-05任何一款产品从诞生、普及到最终退出市场,都会遵循一套固定的发展规律,这就是产品生命周期理论。在市场竞争日益激烈、产品迭代 ...
2026-06-04在Excel数据分析、办公统计、业务报表制作场景中,数据透视表是数据汇总、分类统计、快速复盘的核心工具,能够高效完成海量原始 ...
2026-06-04 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-06-04在问卷调查与社会科学数据分析中,卡方检验是最常用、最基础的非参数检验方法,广泛应用于市场调研、用户分析、行为统计、满意度 ...
2026-06-03【核心关键词】贷款、报表、课程、专业、建模、缺失值、营销、互联网、银行、办公自动化、数据分析、数据预处理、特征工程、贷 ...
2026-06-03 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-06-03逻辑回归是数据分析、机器学习、统计建模中应用最广泛的二分类预测模型,常用于风险判断、行为预测、归因分析等场景。在SPSS、Py ...
2026-06-02数字经济时代,市场竞争日趋同质化,用户消费需求愈发个性化、多元化,传统依托经验、粗放式、广撒网的营销模式弊端日益凸显。长 ...
2026-06-02 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-06-02在市场竞争日趋饱和、用户需求不断细分的当下,企业创业创新、产品迭代与市场拓展不再依赖经验决策,而是需要系统化、工具化的商 ...
2026-06-01【核心关键词】调度、岗位、数据库、企业、报表、培训、程序、数据分析、数据加工、业务部门、企业数据、调度工具、业务指标、 ...
2026-06-01 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-06-01在数据统计分析、数据清洗、异常值识别与数据分布研究中,箱型图是最直观、高效、专业的可视化分析工具。相较于柱状图、折线图仅 ...
2026-05-29Tkinter是Python内置的标准GUI图形界面库,具备无需额外安装、调用简单、兼容性强、轻量化高效等优势,是Python快速开发桌面小程 ...
2026-05-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-05-29【核心关键词】大数据、经理、专业、金融、客户、传统、建模、数据产品、互联网金融、产品经理、数据分析、金融行业、数据模型 ...
2026-05-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-05-28