
关于情感分析,你不得不知道的11件事
近来,关于情感分析的研究一直被大家所津津乐道,然而关于这项分析方法究竟有多大的实用性,则是众说纷纭。有人认为情感分析堪比打开人类市场研究新世界大门的钥匙,而另一些人则认为,这项技术只是骗人的万灵油,甚至与占卜无异。那么,究竟谁是对的呢?
相较而言,我(笔者)更倾向于站在前者的阵营中。基于文本分析,自动情感分析技术为基于李克特量表的传统分析方法(Likert-reliant methodologies)注入了新的动力,使得研究人员能通过社群倾听技术实时掌控客户反馈的倾向变化,并由此实现了对客户心声的深入挖掘。
对于后者的阵营,我认为他们对情感分析产生质疑的原因可能来自于对这种分析方法实现能力与局限性的认识扭曲。这样的认识扭曲也许是由于某些能力不足的解决方案供应商造成的,不过不管它们究竟来自何方,我都会倾力而为去揭穿它们,还原一个有真正实际意义的情感分析技术。
我们目标是鼓励适当的使用情感分析技术并防止滥用。为了做到这点,对市场教育的呼唤十分重要,我通过会议的形式做了很多这样的事,在今年7月15号到16号的纽约情感分析研讨会上,我特地点明了这样十一件情感分析研究者必须知道的事:
1)在情感分析中,通过直接匹配词典来查找词汇是一种简单明了的方法,也但略显粗俗。词的意思往往会根据句式、语境以及上下文之间的关联而发生变化,进行情感分析时我们需要将语言学与统计学的方法都应用到其中。
2)文档层面的情感分析或许正在面临过时。我们情感分析的目标应该关注于实体(entity)、概念(concept)以及主题(topic)的层面。(例如,一部iPhone6是一个实体,iPhone是一个概念范畴,而智能手机则是它所属的主题)
3)“情感”的一般语言定义包括态度(attitude)、意见(opinion)、感觉(feelings)和情绪(emotion)。最先进的情感分析技术可以让你超越正负面倾向得分的局限,根据情绪——如快乐、惊讶、恐惧、厌恶、愤怒、悲伤等对文本情感进行评价,而不是仅仅是一个表达程度的分数。
4)请将眼界放宽:情感分析是情感计算(Affective computing)大家族的一份子,这个家族涉及到了所有与人类情感相关、来自人类情感或是对人类情感产生影响的现象计算研究。情感分析与家族中的其他伙伴皆有所联系,但在技术和方法上有着较为明显的区别。
5)并非所有的情感都是平等的。不论是情感的倾向还是强度,我们都需要努力去理解。同时,研究情感如何转化为行动也具有同样重要的意义。
6)不论你是否在项目中使用了语言工程、统计模型与机器学习方法,在很多情况下,也许针对特定领域训练合适的模型,才是模型优化的关键。
7)必须注意那些有关于准确率的说法。对于模型的准确性,这世界上不存在绝对的衡量标准,因此在度量模型的准确性时,我们总会遇到各种各样的麻烦。正因如此,有的解决方案供应商们甚至可能在提出分析模型之后对模型准确性的测量过程避而不谈。一种公认可行的准确度测量方法是将模型结果与一份经过完全精准的人工注释/分类的语料进行对比,这也意味着我们需要让人工和机器同时去进行一项庞大的语料分析工作,再进行二者匹配程度的计算。但是当你真的去尝试这样的做法时,所谓人工一方作出的判断究竟是对是错,同样也很难说明清楚。与此同时,面向不同层面的文本分析软件之间也很难进行准确度的对比,例如有些软件只做了文档层面的分析,而另一些则能够对实体和概念进行了解析,我们能说在实体层面具有70%准确率的软件就优于在文档层面具有97%准确率的软件吗?
8)文本是最常见的情感数据来源,但它并不是唯一的一个。针对视频的面部编码技术,针对音频流的语音分析,都可以用于检测人类的情绪反应,而这些也都是更先进的情感状态评估方法。而有关人类情感分析下一个前沿领域也有可能是:神经科学、可穿戴仪器开发和生理学的其他研究手段。
9)语言是人类使用的最有活力和发展最快速的工具之一。计算机技术在社会中普及给了我们前所未有的语言表现能力,众所周知的表情符号(emoji)就是这一进程中的典型例子。表情符号不仅仅是人类语言的扩音器,它在发展过程中逐渐获得了自己的语法和特殊语义,从而自然而然地如潮水般涌入广大的网络社交媒体中。对于情感分析研究者来说,我们也应该紧跟时代发展的脚步,去针对各种新诞生的语言表达形式进行相关的挖掘与研究。
10)通过将行为表现与情感分析模型进行联系,或是根据人口与文化范畴对语料进行分类,能够帮助你提升分析与预测的能力。当你面对庞杂的大规模数据时,请毫不犹豫地运用这个方法。
11)一些先进的概念,如动机、影响、维护和催化,都是建立在对人类情感和行为进行建模以及社群网络分析的基础上的。在数据咨询行业,研究的最主要目标是对市场以及消费者进行解析,而这种解析的最终目标则是创造使消费者“行动起来”的条件。作为情感分析研究者,你需要面向上述概念开展你的工作。
好了,上面便是我个人(笔者)对情感分析这些事的理解,当你在开始设计下一项有关的调查研究时,或是当你不知道如何将社交媒体挖掘应用到你的研究中时,不妨考虑一下使用情感分析。多思考一些实际可行的情感算法也许会对你有所帮助,将它结合于行为分析或是其他先进的市场细分技术,可能会使你找到洞悉潜在客户行为的方法。总而言之,情感分析值得重视,它是绝对能够为你的市场研究带来一些令人眼前一亮的新东西的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
MySQL 服务器内存碎片:成因、检测与内存持续增长的解决策略 在 MySQL 运维中,“内存持续增长” 是常见且隐蔽的性能隐患 —— ...
2025-09-24人工智能重塑工程质量检测:核心应用、技术路径与实践案例 工程质量检测是保障建筑、市政、交通、水利等基础设施安全的 “最后一 ...
2025-09-24CDA 数据分析师:驾驭通用与场景指标,解锁数据驱动的精准路径 在数据驱动业务的实践中,指标是连接数据与决策的核心载体。但并 ...
2025-09-24在数据驱动的业务迭代中,AB 实验系统(负责验证业务优化效果)与业务系统(负责承载用户交互与核心流程)并非独立存在 —— 前 ...
2025-09-23CDA 业务数据分析:6 步闭环,让数据驱动业务落地 在企业数字化转型中,CDA(Certified Data Analyst)数据分析师的核心价值,并 ...
2025-09-23CDA 数据分析师:以指标为钥,解锁数据驱动价值 在数字化转型的浪潮中,“用数据说话” 已成为企业决策的共识。但数据本身是零散 ...
2025-09-23当 “算法” 成为数据科学、人工智能、业务决策领域的高频词时,一种隐形的认知误区正悄然蔓延 —— 有人将分析结果不佳归咎于 ...
2025-09-22在数据分析、金融计算、工程评估等领域,“平均数” 是描述数据集中趋势最常用的工具之一。但多数人提及 “平均数” 时,默认指 ...
2025-09-22CDA 数据分析师:参数估计助力数据决策的核心力量 在数字化浪潮席卷各行各业的当下,数据已成为驱动业务增长、优化运营效率的核 ...
2025-09-22训练与验证损失骤升:机器学习训练中的异常诊断与解决方案 在机器学习模型训练过程中,“损失曲线” 是反映模型学习状态的核心指 ...
2025-09-19解析 DataHub 与 Kafka:数据生态中两类核心工具的差异与协同 在数字化转型加速的今天,企业对数据的需求已从 “存储” 转向 “ ...
2025-09-19CDA 数据分析师:让统计基本概念成为业务决策的底层逻辑 统计基本概念是商业数据分析的 “基础语言”—— 从描述数据分布的 “均 ...
2025-09-19CDA 数据分析师:表结构数据 “获取 - 加工 - 使用” 全流程的赋能者 表结构数据(如数据库表、Excel 表、CSV 文件)是企业数字 ...
2025-09-19SQL Server 中 CONVERT 函数的日期转换:从基础用法到实战优化 在 SQL Server 的数据处理中,日期格式转换是高频需求 —— 无论 ...
2025-09-18MySQL 大表拆分与关联查询效率:打破 “拆分必慢” 的认知误区 在 MySQL 数据库管理中,“大表” 始终是性能优化绕不开的话题。 ...
2025-09-18DSGE 模型中的 Et:理性预期算子的内涵、作用与应用解析 动态随机一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明确:TIF 中的地名有哪两种存在形式? 在开始提取前,需先判断 TIF 文件的类型 —— ...
2025-09-17CDA 数据分析师:解锁表结构数据特征价值的专业核心 表结构数据(以 “行 - 列” 规范存储的结构化数据,如数据库表、Excel 表、 ...
2025-09-17Excel 导入数据含缺失值?详解 dropna 函数的功能与实战应用 在用 Python(如 pandas 库)处理 Excel 数据时,“缺失值” 是高频 ...
2025-09-16深入解析卡方检验与 t 检验:差异、适用场景与实践应用 在数据分析与统计学领域,假设检验是验证研究假设、判断数据差异是否 “ ...
2025-09-16