京公网安备 11010802034615号
经营许可证编号:京B2-20210330
清华大学用大数据分析了9000条微博谣言,还在研究自动辟谣
社交媒体上的谣言总是让人猝不及防,有些甚至能在短时间造成不小的危害。比如,几天前,微信怎么也不会想到,因为一个年终回顾的HTML5页面被提前泄露,带来大量用户点击导致服务器瘫痪,然后引发了盗号的谣言。最后的结果是,短短的几个小时内,数百万人从微信提现,解绑银行卡。
社交媒体上都流传着哪些谣言?这些谣言都是谁发布的?为什么会有人相信并主动参与传播这些谣言?社交网络上的信息是海量的,这些问题似乎很难回答。不过最近,清华大学智能技术与系统国家重点实验室的研究人员借用了自然语言处理的帮助,对新浪微博上的谣言大数据进行了全面的分析,试图找出答案。
2012年5月,新浪微博设立了举报处理大厅,谣言占了不良信息中的一大部分。研究人员利用微博举报大厅公布的实时数据收集谣言信息。
他们收集了从2011年8月到2015年5月期间出现的9079条谣言,用函数模型对这些数据进行了预处理,发现了一些有趣的现象。
大部分微博谣言会在其发布的一个周内被举报并辟谣
第一,大多数微博谣言的影响力都比较小, 转发和评论数在500次以下的微博占到整体的84%。只有极少量的微博谣言具有极广的传播范围和强大的影响力 。
第二,谣言通常要传播一段时间后,才有可能遭到举报;同时, 由于传播速度快,大部分微博谣言会在其发布的一个周内被举报并辟谣 (88.9%)。
第三,大量举报谣言的用户, 所举报的谣言往往与自己相关. 例如, 微博用户 “美汁源饮料” 举报了 大量关于 “美汁源果粒橙” 饮料含有农药的谣言, 张家界纪委书记汪业元举报了大量关于 “汪业元发表 ‘对网络暴民杀无赦’ 的言论” 的谣言。
第四,大量发布谣言的用户,往往带有网络水军的性质,例如,有微博用户仅在几分钟的时间里发布了几十条微博, 其中大部分是谣言, 之后该用户就再未发过微博。
常识类谣言经常反复出现转发高峰
研究人员还根据谣言内容将其分成了5个分类:政治类谣言,例如钓鱼岛海域中日两国爆发海战;
经济类谣言,例如三星赔偿苹果几十车硬币;
欺诈类谣言,例如“四川藏区儿童需要御寒冬衣”,然后留下了一个虚假的联系电话;
社会生活类谣言,社会各界人物的花边新闻,例如六小龄童去世;
常识类谣言,例如阿司匹林能治疗心脏病。
这些谣言中,大部分属于社会生活类和政治类谣言 (约占70%)。而结合微博谣言发布、传播、高峰和消亡的过程还可以发现,不同的谣言出线转发峰值的情况也各部相同。
70%的谣言话题只有一个较大转发峰值,也就是说,被辟谣后,它们就会逐渐消亡。
另外,谣言的内容也和其转发峰值有关系:例如,常识类谣言由于受众广,辟谣难度较大,往往会反复被人们提及,出现多次爆发,约70%的常识类谣言通常有多个转发峰值。而关于名人或知名机构的谣言,由于关注人数众多,辟谣难度较小,因此发布之初就会出现较大转发峰值,但很快会被辟谣,约60%的此类谣言会在一个周内消亡。
人们为什么相信谣言
人们为什么会相信这些谣言呢?研究人员分析后将原因归结为两类:(1)知识受限,即缺乏专业知识而导致误信或无法辨认的谣言。例如,阿司匹林可以治疗急性心脏病;(2)时空受限谣言,即由于地域和时间限制无法辨认的谣言。例如, 有谣言称“杭州上城区一妇女喝了3罐可乐,两天后离开了这个世界。验尸结果是她死于细螺旋体病, 发病原因是直接用嘴对可乐罐饮用”。
自动辟谣框架
在对谣言进行分析之后,研究人员还试图建立一个自动辟谣机制。当然,在目前的技术条件下,自然语言处理技术还无法根据微博内容自动判断其是否为谣言。所以,研究人员的思路通过语义分析,自动根据谣言主题对其进行分类,然后发现最有可能判定该谣言的专家,推荐专家对疑似谣言进行鉴别。
研究人员的框架主要包括3个阶段的工作:
1. 谣言发布早期,通过用户举报和对可疑用户的监控建立疑似谣言的集合。一方面,将疑似谣言和谣言库中进行比对;另一方面, 对于在谣言库中没有匹配内容的谣言,通过查询该领域的专家库,推荐若干专家对该疑似谣言进行鉴别。
2. 谣言发布中期,通过自然语言处理技术分析疑似谣言的评论信息,通过社会网络分析技术分析疑似谣言的传播模式,判定该信息是否为谣言。
3. 谣言发布后期,对于判定为谣言的信息, 将其加入谣言库;对信息发布人进行可信性分析,确定其信用等级,将信用等级低于一定阈值的用户加入可疑用户库,在一段时间内对其发布的微博内容进行监控;对信息举报人和评论人进行专家发现,充实和更新该信息相关的知识领域的专家库。
当然,目前这一切还处于理论研究阶段,而建立可以用户库也需要以网站更严格地执行实名制为前提。用大数据、人工智能去对付谣言,前提是需要很多人交出更多的隐私,你愿意吗?
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16在机器学习无监督学习领域,Kmeans聚类因其原理简洁、计算高效、可扩展性强的优势,成为数据聚类任务中的主流算法,广泛应用于用 ...
2026-04-16在机器学习建模实践中,特征工程是决定模型性能的核心环节之一。面对高维数据集,冗余特征、无关特征不仅会增加模型训练成本、延 ...
2026-04-16在数字化时代,用户是产品的核心资产,用户运营的本质的是通过科学的指标监测、分析与优化,实现“拉新、促活、留存、转化、复购 ...
2026-04-15在企业数字化转型、系统架构设计、数据治理与AI落地过程中,数据模型、本体模型、业务模型是三大核心基础模型,三者相互支撑、各 ...
2026-04-15数据分析师的一天,80%的时间花在表格数据上,但80%的坑也踩在表格数据上。 如果你分不清数值型和文本型的区别,不知道数据从哪 ...
2026-04-15在人工智能与机器学习落地过程中,模型质量直接决定了应用效果的优劣——无论是分类、回归、生成式模型,还是推荐、预测类模型, ...
2026-04-14