历史上的文学大数据分析_数据分析师
虽然大数据概念近些年才热起来,但早在19世纪,人们就见到了文学作品的定量分析的身影。
2014年7/8月号的《美国科学家》杂志发表了Brian Hayes的文章《文学与大数据一相逢》。他说,虽然大数据概念近些年才热起来,但早在19世纪,人们就见到了文学作品的定量分析的身影。
在计算机尚未问世时,英国统计学家G. Udny Yule和C.B. Williams就尝试过如何利用句长的差异来表征不同的文学风格,识别不同的作者。1964年,出现了史上第一个主题为“文学数据处理”的学术会议,参会者有150人,讨论题目包括“计算文体学”,还有在计算机辅助下就弥尔顿对雪莱之影响作出估计。更早的时候,Frederick Mosteller和David L. Wallace就曾对《联邦党人文集》中常见词的词频(例如also、an、by、of)进行统计分析,试图确定哪些文章是汉密尔顿写的,哪些文章是麦迪逊写的。
Brian Hayes特别想介绍的是19世纪美国的两位“数字人文学”先驱人物。一位叫Thomas Corwin Mendenhall(1841~1924),是科学家,曾任印第安纳州罗斯理工学院的院长、美国国家科学院院士和美国科学促进会会长。1887年,他在《科学》杂志发表一篇文章《文章的特征曲线》。他认为,正如光谱线的模式可以表明存在着某化学元素一样,通过“词谱”或“特征曲线”也能表征一篇文章。他以狄更斯的《雾都孤儿》和萨克雷的《名利场》为研究对象,看看两人的“词谱”差异大不大,结果发现,差异不足以区分开两个作者。
另一位先驱人物叫Lucius Adelno Sherman(1847~1933),他的博士论文题目是《古英语诗歌“猫头鹰与夜莺”的语法分析》,从中可以看出他喜欢定量研究。例如,他统计了这首诗歌中用了多少介词、连词和否定式表达。1893年,Sherman发表了一部著作《文学分析学:关于如何对英语散文与诗歌进行客观研究的手册》。《科学》杂志发表过一篇书评,称此书是“划时代”的作品。在书里,他想做的不仅仅是通过定量分析来区分作者,如Mendenhall所尝试过的,而且涉及更多内容。比如,他在讲授英语文学演变的过程中,注意到了一桩事实:从14世纪的诗人乔叟到17世纪的莎士比亚,再到19世纪的爱默生,文学家们写出的句子越来越简单,摆脱了过去那种“凝重”和繁复。他从每个作家的作品中抽取500个句子,统计其平均句长。16世纪初的Robert Fabyan平均句长为63个单词,19世纪的爱默生平均句长只有20.5个单词。
他在搜集基础数据方面是下了苦功夫的,比如某个暑假里,他花了三周的时间,从麦考莱的五卷本《英国史》中整理出了4万多个句子中的单词。当然,有学生给他帮忙,因为他是教授嘛。
按现在的标准来看,这些数字人文学的先驱所做的工作都很简单,也不是那么成功,但是其开拓之功是不容否认的。有先进信息技术的助力,相信21世纪的数字人文学研究一定能别开生面。
数据分析咨询请扫描二维码
自学数据分析可能看似一项艰巨的任务,尤其在开始时。但是,通过一些策略和方法,你可以系统地学习和掌握数据分析的相关知识和技 ...
2024-11-10Excel是数据分析领域中的一款强大工具,它凭借其灵活的功能和易用的界面,成为了许多数据分析师和从业者的首选。无论是简单的数 ...
2024-11-10在快速发展的商业环境中,数据分析能力已经成为许多行业的核心竞争力。无论是初学者还是经验丰富的专家,搭建一个有效的数据分析 ...
2024-11-10在如今的数据驱动世界,数据分析师在各行各业中扮演着至关重要的角色。随着企业越来越依赖数据决策,数据分析职位的需求不断增加 ...
2024-11-10在信息爆炸的时代,做出正确的数据分析方法选择变得尤为重要。这不仅影响到数据分析的准确性,更关系到最终的决策效果。本文将详 ...
2024-11-10在当今竞争激烈的市场环境中,准确地把握市场动态和消费者需求是企业成功的关键。数据分析以其科学严谨的方法论,成为市场研究的 ...
2024-11-09在数据驱动的世界中,准确的数据分析是成功决策的基石。然而,数据分析的准确性并非一蹴而就,它需要多种方法和步骤的综合应用。 ...
2024-11-09推动银行的数字化转型是一个复杂且多维度的过程,涉及从战略、技术、组织到业务的多方面综合考量。这不仅仅是技术层面的变革,更 ...
2024-11-09国有企业作为国家经济的重要支柱,在提升经济效益和市场竞争力方面扮演着关键角色。然而,面对日益激烈的市场竞争和复杂的经济环 ...
2024-11-09业务分析师(Business Analyst,简称BA)是现代企业中不可或缺的角色。他们不仅是需求分析的专家,更是企业战略规划中的重要参与 ...
2024-11-09银行业正面临着一场全方位的数字化革命,旨在提升服务效率和客户体验,同时优化运营和增收。在这篇文章中,我们通过分析一些成功 ...
2024-11-09数据挖掘技术正在重新定义现代市场营销的方式。对于企业来说,能够深入了解消费者行为、需求和偏好是实现精准市场营销的关键, ...
2024-11-09在当今数据驱动的世界中,数据分析可视化已经成为一种必不可少的技能。它不仅帮助专业的数据分析师更好地传达信息,也使复杂的数 ...
2024-11-09在如今的数据驱动时代,掌握数据分析的工具和方法不仅是提高工作效率的关键,也是开拓职业机会的重要技能。数据分析涉及从数据的 ...
2024-11-08在现代商业环境中,企业正在逐步认识到数据挖掘技术在客户行为分析中的重要性。通过深度分析客户数据,这项技术不仅可以帮助企业 ...
2024-11-08数据挖掘分析是从大量数据中发现隐藏模式和有用信息的过程。尤其是在图数据挖掘中,提供了分析复杂关系和结构的独特视角。图数据 ...
2024-11-08在当今快速发展的商业环境中,提高运营效率已成为企业取得成功的关键因素。企业需要通过优化工作流程、利用技术创新和提升员工技 ...
2024-11-08Python 是一门非常适合初学者学习的编程语言。其简洁明了的语法、丰富的功能库,以及广泛的应用领域,使其成为学习编程的理想选 ...
2024-11-08在当今快速变化的商业环境中,金融数字化已经成为中小企业(SMEs)发展的关键驱动力。通过采用数字工具和技术,中小企业能够提高 ...
2024-11-08中小企业在全球经济中扮演着重要角色,然而,面对数字化浪潮,这些企业如何有效转型成为一大挑战。数字化转型不仅是技术的升级, ...
2024-11-08