真题 · 论述类文本阅读

数字人文中的远读与细读

辨析数据化、远读与细读的关系,依概念边界和论证层次核验三道选择题。

导读

文体与题材:学术论述;数字人文的研究方法及人的阅读价值。

作者简介:王军,北京大学学者,研究涉及数字人文、古籍数字化与知识组织。

文本出处:摘编自王军《从人文计算到可视化——数字人文的发展脉络梳理》,《文艺理论与批评》2020年第2期;选入2021年全国乙卷。

内容脉络:材料先比较远读与细读,说明文学研究数据化带来的观察尺度变化,再讨论远读的类型及人的解释活动在其中的作用。论述随后转向单篇作品的阅读,进而提出评价标准与新问题,逐步考察数字方法的用途和限度。

内容主旨:计算方法能够提供大规模文本的统计与结构证据,人文研究仍需阅读、领域知识及意义解释;数字人文也拓展了提问的可能。

阅读重点:区分数据处理与内容理解、文本篇数与数据规模,重建远读与细读相互补充的论证。

原文

原文按结构分节;随文内容可定位至对应段落。

01 / 第1段

提出问题:数字人文的兴起促使研究者辨明远读与细读的关系。

1

对于人文研究来说,计算方法以往只是作为辅助手段而存在的,而今天已取得了不可替代的地位。一种新的人文研究形态应运而生,这就是“数字人文”。学者莫莱蒂曾设想一种建立在全部文学文本之上的世界文学研究,人们必须借助计算机对大规模的文学文本集合进行采样、统计、图绘、分类,描述文学史的总体特征,然后再做文学评论式的解读。为此,他提出了与“细读”相对的“远读”作为方法论。弄清计算机的远读与人的细读之间的差别,不仅能使我们清晰地界定计算方法在人文研究中的作用,而且可以帮助我们重新确立人的阅读的价值。

批注 · 札记 2

背景—方法—论题

弄清计算机的远读与人的细读之间的差别

本段分三层:计算方法地位的变化引出数字人文;莫莱蒂的设想引出远读;末句明确全文要回答的作用与价值问题。先界定论题,才能解释后文各段的论证功能。

采样不等于穷尽

进行采样、统计、图绘、分类

“全部文学文本”是研究视野或集合规模的设想,具体方法仍包含采样。因此不能将设想改写成必须逐篇穷尽所有文本。

02 / 第2段

界定机制:文本数据化便于计算,却可能损失语境中的丰富意义。

2

计算机是为科学计算而创造出来的,擅长的是“计数”,而非理解。要处理自然语言文本,计算机必须先将文本置换成便于计数的词汇集合,或者用更复杂的代数模型和概率模型来表示文本,这一过程被称为“数据化”。数据化之后所得到的文本替代物(集合、向量、概率)虽然损失了原始文本的丰富语义,但终究是可以计算的了。不过,尽管计算机能处理海量的语料,执行复杂的统计、分类、查询等任务,但它并不能理解文本的内容。

注释 · 批注 · 札记 3

概念:数据化

这一过程被称为“数据化”

把自然语言文本表示为便于运算的集合、向量或概率等形式。这里讨论的是研究方法中的文本表征,与简单扫描、保存电子副本不完全相同。

判断—说明—让步

虽然损失了原始文本的丰富语义

首句提出计数与理解的区别,中部说明数据化的条件与代价,末句以让步结构承认处理能力、重申理解的边界。不能从语义损失推出文本根本不可处理。

作者主张的范围

但它并不能理解文本的内容

应在本文采用的“计数/理解”区分中把握这个判断。阅读题考查对作者论证的准确重建;技术能力的历史变化与“理解”的定义,可以另外作为研究问题讨论。

03 / 第3段

分类与解释:对文本作统计分类后,研究者仍须解释数字背后的意义。

3

远读是数字人文的基石。大规模的文本集合上的远读,基本上可以归为两类:一是对文本集合整体统计特征的描述,一是对文本集合内在结构特征的揭示。例如,数字人文学者米歇尔等人对数百万册数字化图书进行多种词汇和词频统计,以分析英语世界的语言演变,这属于前者;莫莱蒂用地图、树结构来分别展示文学作品的地理特征和侦探故事的类型结构,这属于后者。无论是宏观统计描述还是内在结构揭示,都是超越文本具体内容的抽象表示,所得结果都是需要解读的。正如米歇尔所说,在巨量文本集合上得到的统计分析结果,为人文材料的宏观研究提供了证据;但是要解读这些证据,就像分析古代生物化石一样,是有挑战性的。对远读结果的解读,仍然是依赖学者在细读文本的基础上所建立起来的对本领域的认知和理解。一句话,人的阅读不可替代。

批注 2

总说与分类

一是对文本集合整体统计特征的描述

总说“基石”,继而分出整体统计与内在结构两类;米歇尔的词频统计、莫莱蒂的地图与树结构分别对应这两类。例证必须回扣其所支持的分类。

证据与解释

所得结果都是需要解读的

统计结果为研究提供证据,证据本身并不自动成为历史文化解释。转述米歇尔的话,同时说明远读的贡献与解释难度,继而推出人的细读不可替代。

04 / 第4段

补充范围:计算分析并非只适合大规模语料,也能用于单篇文本。

4

需要补充的是,当考察单篇文本的文本特征(例如计算一篇文档中所有单字的出现频率),或者分析其内部结构(例如提取一部小说中所有人物的对话网络)时,数据量也会增长到个人无法处理的程度。所以,上述对文本集合所做的讨论在单篇文本层面也是成立的。

批注 1

反例检验

在单篇文本层面也是成立的

小说人物对话网络可能包含大量关系。阅读对象是一篇还是多篇,不能单独决定是否采用计算方法;本段纠正以文本篇数划分两种方法的理解。

05 / 第5段

评价与拓展:数字人文既可回答已有问题,也能开启新的研究视角。

5

一个普遍存在的对数字人文的评判依据,是看数字人文能不能更好地回答传统人文学者所关心的问题。严格说来,只有当数据量或者数据精度超出了个人阅读理解的能力范围时,才有理由借助计算机来对文本或者文本集合的特征予以量化描述,进而提供给人去进行深入解读。数字人文不仅仅是新的手段和方法,更重要的是,它赋予我们提出新问题的能力。我们现在可以问,五千年来全人类使用最频繁的词是什么。透过这类问题,可以获得观察超长历史时段文化现象的新视角。

批注 · 札记 2

三个层次

一个普遍存在的对数字人文的评判依据

依次讨论常见评价标准、借助计算的条件、提出新问题的价值。后者拓展前者,并未否定传统人文问题的意义。

必要条件与方法价值

只有当数据量或者数据精度超出了个人阅读理解的能力范围时

在作者此处的论证中,超出个人处理能力是借助计算的理由;这不能改写成文本篇数多就是充分条件。区分必要条件与充分条件。

论证结构

辨析对象 判断依据与适用边界
中心问题 计算方法能做什么,人的阅读为什么仍然必要。全文不以“哪一种方法彻底取代另一种”为中心问题。
概念支点 数据化使文本成为可计算的表征;远读生成统计与结构证据;细读及领域认识参与结果解释。三者是不同分析层面的术语。
补充的作用 第4段不提出另一套机制,而是把前述机制扩展到单篇文本;如果删去它,读者容易误以为远读只适用于多篇集合。
结尾的推进 从能否回答传统问题推进到能否提出新的问题;“新”修饰研究视角和提问能力,不是只研究此前无人阅读的作品。

第1题 · 内容辨析

下列关于原文内容的理解和分析,不正确的一项是(3分)

A.在数字人文的概念提出之前,计算方法已被引入人文领域,在研究中发挥作用。

B.要实现莫莱蒂设想的世界文学研究,首先应进行大规模的文学文本集合的数据化。

C.选择远读还是细读的方法,取决于阅读的对象是大规模的文本集合还是单篇文本。

D.数字人文不仅为文本处理提供了新的手段和方法,而且为人文研究提供了新视角。

参考答案1展开 / 收起

参考作答

C。

审题与考查点

选出“不正确”的一项。核对时间先后、方法前提、对象范围和递进关系;不能只寻找原词复现。

文本分析

A项查看证据 ↗

正确。第1段先说明计算方法以往已作为辅助,再说明新的研究形态出现。因此“已被引入并发挥作用”是对前一事实的较宽概括,没有声称其早已占据今日的地位。

B项查看证据 ↗

正确。第1段的设想必须借助计算机处理文本集合;第2段指出,计算机处理自然语言文本必须先进行数据化。把这两条信息连接,可推出该研究的数据化前提。它不是把全部研究归结为单纯计数。

C项查看证据 ↗

错误。第4段明确指出单篇文本也会产生个人无法处理的数据量,前文讨论在单篇层面同样成立。该项把对象的篇数误当成方法选择的决定因素,并暗含远读与细读的简单二选一,忽略二者在研究中的分工。

D项查看证据 ↗

正确。第5段先肯定新的手段和方法,再强调提出新问题的能力,并以长历史时段的观察视角说明其意义。选项压缩了“新问题”这一中间环节,但保留了从方法到研究视角的递进。

知识点

信息转述与判断范围要求保持对象、关系与限定;必要条件与充分条件用于辨别方法选择的依据。

解题方法

先把各项拆为命题,再定位原文;遇到条件判断,主动寻找反例。第4段的“单篇文本”即检验 C 项的反例。

易误辨析

B 项跨第1、2段综合信息,不能因为没有一句原文与它完全相同就判错。A 项虽比“只是辅助手段”概括得宽,但未否定原文所述作用。

答案组织与检核

C。错误在于把“集合/单篇”设为方法选择的决定条件;单篇的数据量也可能超出个人处理能力。

第2题 · 论证分析

下列对原文论证的相关分析,不正确的一项是(3分)

A.文章区分“计数”与“理解”,是为了论证计算机不能处理某些特定类型的文本。

B.文章转述数字人文学者米歇尔本人的说法,有助于论证应该更全面地看待远读。

C.文章第四段讨论单篇文本层面的问题,对前文补充论证,使得论证更加周密。

D.文章同时肯定计算机远读和人的细读的作用,有助于避免人们对远读的误解。

参考答案2展开 / 收起

参考作答

A。

审题与考查点

本题判断论证行为与论证目的的对应,不仅判断所引信息是否出现。分别检查区分、引用、补充以及全文的肯定对象。

文本分析

A项查看证据 ↗

错误。第2段先承认计算机能够处理海量语料、执行复杂任务,再指出这种处理与内容理解有别。论证对象是“处理方式与理解能力”的差别,A 项却置换为“文本类型是否可处理”;这一目的还与已承认的处理能力不相应。

B项查看证据 ↗

正确。转述先说统计结果提供宏观研究的证据,再说解释证据仍有挑战。贡献与限度并述,使远读既不被否定,也不被夸大为能够自动生成全部理解的方法,因而支持“更全面地看待”。

C项查看证据 ↗

正确。前文以大规模文本集合为主要对象,第4段补入单篇的数据规模和关系结构,明确论述同样适用。补充消除了“远读仅能用于多篇”的潜在误解,周密性体现为适用范围得到说明。

D项查看证据 ↗

正确。第3段一面称远读为数字人文的基石,一面强调结果必须由拥有领域认识的学者解读。两方面合看,既承认计算证据的价值,又防止把计算等同于完整的人文解释。

知识点

论据与论证保证要求说明证据如何支持结论;分析性阅读要求把局部功能放回全文论题中判断。

解题方法

先写出某段“做了什么”,再写“为何这样做”。用这一对应关系核验选项中“为了”“有助于”“使得”等表达。

易误辨析

词句存在与论证目的成立是两个判断。原文确有“计数”和“理解”,不能因此接受 A 项附加的“特定类型文本不能处理”。

答案组织与检核

A。作者区分计数与理解,以说明计算处理与人的意义解释的差别;没有证明某些类型的文本不能被处理。

第3题 · 推论判断

根据原文内容,下列说法正确的一项是(3分)

A.人文研究的主体,在数字人文中实现了从具体的学者个人向计算机的转变。

B.远读不是要深化对文本内容的理解,而是要发掘文本集合的共同形式特征。

C.数字人文的价值,在于将历史上未被注意和阅读的文本都进行数据化并做研究。

D.和人的细读相比,远读的理念和做法体现出大数据时代文理融合的跨学科取向。

参考答案3展开 / 收起

参考作答

D。

审题与考查点

选出有充分根据的合理推断。区分原文可推出的关系与选项新增的排他判断、主体替换和全称要求。

文本分析

A项查看证据 ↗

错误。文本明确把远读结果的解释交给具备领域认知的学者,并强调人的阅读不可替代。工具和方法的变化不能推出研究主体已经转移给计算机。

B项查看证据 ↗

错误。远读直接生成抽象表示,并不等于其研究目的排除深化理解;第1段已说明总体特征描述之后还要文学评论式解读,第5段也将量化与深入解读连接。该项把方法的直接产物与研究目的混同,又用排他句式压缩功能;不能仅靠“共同形式”与“内在结构”的字面差异判错。

C项查看证据 ↗

错误。全文没有提出必须把所有未受注意的文本数据化的全称要求;第5段强调的是借新方法回答问题、提出新问题并形成新视角。第1段设想的研究范围也不能自动改写为这一唯一价值标准。

D项查看证据 ↗

正确。第1、2段涉及计算、统计以及代数和概率表征,第3、5段把这些结果连接到人文领域的理解与提问。结合两端,可概括出跨学科取向;此项突出远读的方法特征,并未否认人的细读参与研究。

知识点

文本证据与阅读推论区分事实与推断;信息概括与整合要求保留方法、对象与价值之间的关系。

解题方法

先辨认断言强度,再核查可推出性。遇到“不是……而是”“都”“转变”等,需检查它们新加的否定、全称范围和主体关系。

易误辨析

“内在结构”与“共同形式”不因字面不同就必定互斥。B 项更根本的问题是以排他形式否定深化理解的研究目的,并把方法功能缩减为单一方向。

答案组织与检核

D。计算机的量化分析与学者的人文阐释结合,支持文理融合的跨学科概括;这种概括没有声称人被计算机取代。

作者与版本资料

北京大学数字人文研究中心:王军,成员资料。

参考文献

  1. 2021年普通高等学校招生全国统一考试语文(全国乙卷),第1—3题。试卷存档。
  2. 王军:《从人文计算到可视化——数字人文的发展脉络梳理》,《文艺理论与批评》2020年第2期,第18—23页。试卷采用摘编文字。
  3. Franco Moretti. Distant Reading. Verso, 2013. 用于进一步比较“远读”概念的研究脉络,不替代试题所依据的文本。
  4. Adler, Mortimer J., and Charles Van Doren. How to Read a Book. Revised edition. Simon & Schuster, 1972. 参看分析阅读中结构、解释与批评三个层面的区分。

本文关联

信息转述与判断范围2 处阅读条目 →必要条件与方法价值 ↗

在作者此处的论证中,超出个人处理能力是借助计算的理由;这不能改写成文本篇数多就是充分条件。区分必要条件与充分条件。

知识点 ↗

信息转述与判断范围要求保持对象、关系与限定;必要条件与充分条件用于辨别方法选择的依据。

论据与论证保证1 处阅读条目 →知识点 ↗

论据与论证保证要求说明证据如何支持结论;分析性阅读要求把局部功能放回全文论题中判断。

分析性阅读1 处阅读条目 →知识点 ↗

论据与论证保证要求说明证据如何支持结论;分析性阅读要求把局部功能放回全文论题中判断。

文本证据与阅读推论1 处阅读条目 →知识点 ↗

文本证据与阅读推论区分事实与推断;信息概括与整合要求保留方法、对象与价值之间的关系。

信息概括与整合1 处阅读条目 →知识点 ↗

文本证据与阅读推论区分事实与推断;信息概括与整合要求保留方法、对象与价值之间的关系。

引用本文

刑赏忠厚之至论1 处阅读条目 →译读辨析 ↗

本文的“疑处从厚”与数字人文阅读题虽讨论不同问题,都要求先识别条件与对象,再判断命题范围;结构化阅读不能将两篇的价值主张混为一谈。

分析性阅读5 处阅读条目 →结构化细读 ↗

结构提要宜写明“内容与功能”。《荷塘月色》的“采莲联想”不只是出现古诗,还使眼前荷塘与理想中的江南生活相比较;数字人文选文的单篇文本段则通过补充范围,使前文论述更周密。

数字人文中的远读与细读 · 第2题选析 ↗

研习任务:下列对原文论证的相关分析,不正确的一项是(3分)

数字人文中的远读与细读 · 第2题选析 ↗

文本依据:“计算机是为科学计算而创造出来的,擅长的是‘计数’,而非理解”;“尽管计算机能处理海量的语料,执行复杂的统计、分类、查询等任务,但它并不能理解文本的内容”。

数字人文中的远读与细读 · 第2题选析 ↗

文本依据:“在巨量文本集合上得到的统计分析结果,为人文材料的宏观研究提供了证据;但是要解读这些证据,就像分析古代生物化石一样,是有挑战性的”。

数字人文中的远读与细读 · 第2题选析 ↗

查看完整解析与全部证据

信息转述与判断范围5 处阅读条目 →数字人文中的远读与细读 · 第1题选析 ↗

研习任务:下列关于原文内容的理解和分析,不正确的一项是(3分)

数字人文中的远读与细读 · 第1题选析 ↗

文本依据:“数据量也会增长到个人无法处理的程度”;“上述对文本集合所做的讨论在单篇文本层面也是成立的”。

数字人文中的远读与细读 · 第1题选析 ↗

文本依据:“数字人文不仅仅是新的手段和方法,更重要的是,它赋予我们提出新问题的能力”;“可以获得观察超长历史时段文化现象的新视角”。

数字人文中的远读与细读 · 第1题选析 ↗

查看完整解析与全部证据

排他结构与概括尺度 ↗

“不是 A,而是 B”不仅断言 B,还否定 A。核验时应分别检查两端,并区分直接产物与最终目的。数字人文第3题 B 项把抽象统计的产物与人文理解的目的混同;不能仅以选项和原文用词不同判错。

语篇的宏观结构2 处阅读条目 →数字人文中的远读与细读 ↗

文本依据:“需要补充的是”

数字人文中的远读与细读 ↗

完整题目 · 解析与证据

文本证据与阅读推论4 处阅读条目 →数字人文中的远读与细读 · 第3题选析 ↗

研习任务:根据原文内容,下列说法正确的一项是(3分)

数字人文中的远读与细读 · 第3题选析 ↗

文本依据:“对远读结果的解读,仍然是依赖学者在细读文本的基础上所建立起来的对本领域的认知和理解。一句话,人的阅读不可替代”。

数字人文中的远读与细读 · 第3题选析 ↗

文本依据:“描述文学史的总体特征,然后再做文学评论式的解读”;“无论是宏观统计描述还是内在结构揭示,都是超越文本具体内容的抽象表示,所得结果都是需要解读的”;“进而提供给人去进行深入解读”。

数字人文中的远读与细读 · 第3题选析 ↗

查看完整解析与全部证据

信息概括与整合4 处阅读条目 →数字人文中的远读与细读 · 第3题选析 ↗

研习任务:根据原文内容,下列说法正确的一项是(3分)

数字人文中的远读与细读 · 第3题选析 ↗

文本依据:“学者莫莱蒂曾设想一种建立在全部文学文本之上的世界文学研究”;“数字人文不仅仅是新的手段和方法,更重要的是,它赋予我们提出新问题的能力”。

数字人文中的远读与细读 · 第3题选析 ↗

文本依据:“或者用更复杂的代数模型和概率模型来表示文本”;“对远读结果的解读,仍然是依赖学者在细读文本的基础上所建立起来的对本领域的认知和理解”;“它赋予我们提出新问题的能力”。

数字人文中的远读与细读 · 第3题选析 ↗

查看完整解析与全部证据

文内诸因互解律1 处阅读条目 →实例细读 ↗

《数字人文中的远读与细读》第2题同时说计算机能处理海量语料、不能理解文本内容。“能处理”与“不能理解”针对不同操作层次,前后两句互相限定,而非互相否定。

阅读单位2 处阅读条目 →数字人文中的远读与细读 · 第1题 ↗

文本依据:“单篇文本”。

数字人文中的远读与细读 · 第1题 ↗

研读完整题目 · 核对参考解析

图尔敏论证模型2 处阅读条目 →数字人文中的远读与细读 ↗

文本依据:“只有当数据量或者数据精度超出了个人阅读理解的能力范围时”

数字人文中的远读与细读 ↗

完整题目 · 解析与证据

论据与论证保证4 处阅读条目 →数字人文中的远读与细读 · 第2题选析 ↗

研习任务:下列对原文论证的相关分析,不正确的一项是(3分)

数字人文中的远读与细读 · 第2题选析 ↗

文本依据:“计算机是为科学计算而创造出来的,擅长的是‘计数’,而非理解”;“尽管计算机能处理海量的语料,执行复杂的统计、分类、查询等任务,但它并不能理解文本的内容”。

数字人文中的远读与细读 · 第2题选析 ↗

文本依据:“在巨量文本集合上得到的统计分析结果,为人文材料的宏观研究提供了证据;但是要解读这些证据,就像分析古代生物化石一样,是有挑战性的”。

数字人文中的远读与细读 · 第2题选析 ↗

查看完整解析与全部证据

语言运用与信息阅读1 处阅读条目 →分析性阅读实例 ↗

数字人文中的远读与细读:2021年全国乙卷三道选择题,分别核验信息转述、论证功能与合理推断;阅读单位提供篇章到局部的分析框架。

全文检索

输入关键词,查找知识点、题组与课文。

按 Esc 关闭 · 支持标题与全文检索