历史上的文学大数据分析_数据分析师
虽然大数据概念近些年才热起来,但早在19世纪,人们就见到了文学作品的定量分析的身影。
2014年7/8月号的《美国科学家》杂志发表了Brian Hayes的文章《文学与大数据一相逢》。他说,虽然大数据概念近些年才热起来,但早在19世纪,人们就见到了文学作品的定量分析的身影。
在计算机尚未问世时,英国统计学家G. Udny Yule和C.B. Williams就尝试过如何利用句长的差异来表征不同的文学风格,识别不同的作者。1964年,出现了史上第一个主题为“文学数据处理”的学术会议,参会者有150人,讨论题目包括“计算文体学”,还有在计算机辅助下就弥尔顿对雪莱之影响作出估计。更早的时候,Frederick Mosteller和David L. Wallace就曾对《联邦党人文集》中常见词的词频(例如also、an、by、of)进行统计分析,试图确定哪些文章是汉密尔顿写的,哪些文章是麦迪逊写的。
Brian Hayes特别想介绍的是19世纪美国的两位“数字人文学”先驱人物。一位叫Thomas Corwin Mendenhall(1841~1924),是科学家,曾任印第安纳州罗斯理工学院的院长、美国国家科学院院士和美国科学促进会会长。1887年,他在《科学》杂志发表一篇文章《文章的特征曲线》。他认为,正如光谱线的模式可以表明存在着某化学元素一样,通过“词谱”或“特征曲线”也能表征一篇文章。他以狄更斯的《雾都孤儿》和萨克雷的《名利场》为研究对象,看看两人的“词谱”差异大不大,结果发现,差异不足以区分开两个作者。
另一位先驱人物叫Lucius Adelno Sherman(1847~1933),他的博士论文题目是《古英语诗歌“猫头鹰与夜莺”的语法分析》,从中可以看出他喜欢定量研究。例如,他统计了这首诗歌中用了多少介词、连词和否定式表达。1893年,Sherman发表了一部著作《文学分析学:关于如何对英语散文与诗歌进行客观研究的手册》。《科学》杂志发表过一篇书评,称此书是“划时代”的作品。在书里,他想做的不仅仅是通过定量分析来区分作者,如Mendenhall所尝试过的,而且涉及更多内容。比如,他在讲授英语文学演变的过程中,注意到了一桩事实:从14世纪的诗人乔叟到17世纪的莎士比亚,再到19世纪的爱默生,文学家们写出的句子越来越简单,摆脱了过去那种“凝重”和繁复。他从每个作家的作品中抽取500个句子,统计其平均句长。16世纪初的Robert Fabyan平均句长为63个单词,19世纪的爱默生平均句长只有20.5个单词。
他在搜集基础数据方面是下了苦功夫的,比如某个暑假里,他花了三周的时间,从麦考莱的五卷本《英国史》中整理出了4万多个句子中的单词。当然,有学生给他帮忙,因为他是教授嘛。
按现在的标准来看,这些数字人文学的先驱所做的工作都很简单,也不是那么成功,但是其开拓之功是不容否认的。有先进信息技术的助力,相信21世纪的数字人文学研究一定能别开生面。
数据分析咨询请扫描二维码
CDA数据分析师在中国航信高科技产业园进行了面向测试度量的数据分析培训课程,培训人数近2 ...
2024-05-01CDA数据分析师走进深圳迈瑞生物医疗电子股份有限公司,在迈瑞总部展开了为期两天的培训,本次课程参训人员线上及线下近百人, ...
2024-05-01CDA数据分析师在合肥市对合肥阳光新能源科技有限公司开展了为期8天的企业内训。 合肥阳光新能源科技 ...
2024-05-01CDA数据分析师走进海尔大学,进行了《数据治理与数据中台建设的道与术》专题培训,培训现场爆满,近百人参加了此次培训。 ...
2024-05-01在中国银行苏州分行培训中心开始数据分析师培训,此次培训课程共10天内容,包括Excel、MySQL、概率论与数理统计、SPSS等内容, ...
2024-05-01从实际的业务需求出发,结合行业的典型应用特点,围绕实际的商业问题,探讨数据挖掘、机器学习模型在金融领域的应用,包括获客、信用评分、细分画像、交叉销售、反欺诈、违规识别、时序预测、运筹优化、流程挖掘九个方面,形成 ...
2024-05-01本次培训课程为线上+线下的模式,由于学员编程能力不一、部分学员没有编程基础,故提供统计学、python基 ...
2024-05-01华夏银行信用卡中心-机器学习培训 1、课程亮点 取材于业界一流企业和顶级咨询公司的行业实践;已经被证明是人人 ...
2024-05-01主 题:数据中台建设及数据分析应用主题分享 1. 数据中台市场洞察 2. 主流数据中台产品比较 3. 某企业数据中 ...
2024-05-01围绕“数据驱动”战略,全力打造我行 300 人数字化人才梯队,着力培养数字化管理人才、大数据专业团队 ...
2024-05-01在当今数据驱动的商业环境中,数据分析成为了企业决策的重要依据。通过对大量数据的收集、处理和分析,企业能够更好地理解市场 ...
2024-04-29在人工智能(AI)的世界里,提示词(Prompt)是一种强大的工具,它能够引导AI按照用户的需求产生特定的输出。本文将深入探讨AI ...
2024-04-29CDA立足未来职场,拓展前沿视野——对外经贸大学保险学院举办“三全育人大讲堂”分享行业最新动态。 ...
2024-04-294月2日,CDA数据分析师创始发起人兼协会理事长赵坚毅博士受邀在浙江万里学院举办了一场以“数字化能力在职场中的作用” ...
2024-04-29随机森林(Random Forests)现在机器学习中比较火的一个算法,是一种基于Bagging的集成学习方法,能够很好地处理分类和回归的问 ...
2022-12-23方差分析是数据分析中常用的一种统计分析方法,接下来让我们简单了解一下方差分析的基本思想和原理吧。 方差分析(Analysis ...
2022-12-23来源:关于数据分析与可视化 关于streamlit-aggrid 数据排序 表格样式的调整 数据 ...
2022-08-03作者:麦叔 定义 「把上面晦涩的概念汇成一句话就是:」 ❝ 回调函数就是一个被作为参 ...
2022-08-03现今,高学历人群日益增多,物以稀为贵的高学历光环淡去。无论本科生还是研究生,甚至博士生,求职竞争力都大不如前,就业压力越来越大。
2022-06-01某家企业10个人面试,有9个本科生……如何脱颖而出,除得体的举止和良好的沟通力外,证书成重要筹码,这也是很多人考证的关键所在。
2022-04-14