数字化改编谱系构建:基于文本挖掘的《西厢记》情节单元数据库与版本承变可视化研究作者:雷建德
摘 要:针对《西厢记》从金代《董解元西厢记诸宫调》、元代王实甫杂剧到明清评点本、坊刻选本、域外翻刻本的多层文本流变问题,本文提出一套以文本挖掘与可视化技术为核心的数字化改编谱系构建方案。方案突破传统“折”的叙事单位,将全剧拆解为“事件-行动元”双层标注的最小情节单元,建立“底层语料库—中层单元库—上层关联库”三层架构的专题数据库;在量化比对层面,综合运用余弦相似度、DTW时序对齐算法、角色共现熵变分析与情感弧线挖掘,从单元留存率、文本相似度、结构排布、角色网络密度、情感温度等多维度测度版本间的承继强度与变异类型;在可视化呈现层面,设计桑基图、力导向网络图、热力分布图与时序演变动图组成的“宏观—中观—微观”三层递进视图,并配置交互检索功能。方案兼顾技术可行性与学术阐释深度,为古典戏曲版本谱系研究提供了一条可复制、可拓展的数字人文路径。
关键词:《西厢记》;文本挖掘;情节单元数据库;版本谱系;可视化流变;数字人文
一、引 言
《西厢记》的文本流变是中国古典戏曲史上最为复杂的案例之一。从金代董解元《西厢记诸宫调》奠基叙事框架,到元代王实甫杂剧确立经典形态,再经明代万历年间十余家书坊竞相刊刻、明清评点家的主观重构、民间折子选本的随意摘引,乃至日本、朝鲜的域外翻刻与改编,这一跨越四百余年的传播历程,不仅是单一作品的版本演化史,更是中国古典戏曲从“案头文学”向“商业出版”“舞台表演”多重形态转型的微观标本。
传统《西厢记》版本考据主要依赖学者对异文的目验比勘与风格判断,虽成果丰硕,却面临两个结构性困境:其一,当版本数量超过二十种、异文数量以万计之时,人工比对难以覆盖全局,大量承袭关系只能依赖有限样本推断;其二,版本间的差异不仅存在于文字层面,更表现为情节单元的组织方式、角色的功能权重、叙事节奏的情感曲线等深层结构变异,这些维度难以用传统的“底本—校本”框架充分描述。
数字人文方法的引入为解决上述困境提供了新的可能。近年来,文本挖掘与可视化技术在古典小说、戏曲研究中的应用逐步深入,但既有成果多聚焦于单一作品的词频统计或风格聚类,尚未有研究针对同一作品的多版本谱系,构建起以“情节单元”为基本单位、以“承继与变异”为核心问题的系统性数据库与可视化分析框架。本文正是由此切入,旨在建立一套从文本标注到谱系可视化的完整技术方案,探索以数据实证支撑版本源流考辨的新路径。
二、研究对象与数据基础
(一)纳入谱系的版本样本
为保证谱系的完整性与代表性,本文确定纳入以下层级版本:(1)金代董解元《西厢记诸宫调》(涵芬楼影印本);(2)元代王实甫《西厢记》元刊杂剧三十种本;(3)明代万历时期重要刊本,包括容与堂本、起凤馆本、继志斋本;(4)清代评改本,以金圣叹《贯华堂第六才子书西厢记》为代表;(5)明代民间折子选本,如《词林一枝》《八能奏锦》中摘录的《西厢记》折子;(6)域外翻刻本,包括日本、朝鲜刊行的《西厢记》改编本。上述版本覆盖“诸宫调—元杂剧—明坊刻—清评改—域外衍生”的完整文本链条,时间跨度自金代至清代中叶,类型涵盖说唱、杂剧、评点、选本、翻刻等多种形态。
(二)文本预处理
各版本底本在录入数据库前需完成以下清洗工作:异体字统一归并为标准繁体字形;对明显脱文依据通行校勘本补入并以特殊标记区分;将评点文字、批注文字与正文分离,建立独立的评注子库;统一各版本的分折、分段方式为标准化编号体系。经预处理后的文本进入底层语料库,作为后续拆解与标注的基础。
三、情节单元数据库搭建
(一)单元拆解规则与“双层标注体系”
传统戏曲研究以“折”或“出”为基本叙事单位,但“折”的体量过大,同一折内往往包含多个叙事动作与场景转换,难以精确标识版本间的细微变异。因此,本研究将拆解粒度下沉至“情节单元”——以叙事动作的转换和人物互动关系的起讫为边界,将连续文本切分为最小叙事片段。例如,“惊艳”一折可拆分为“张生游普救寺”“偶遇崔莺莺”“莺莺回顾”“张生寄居西厢”等若干单元。
在具体标注层面,采用双层标注体系:
表层(动作层) :以“动词+宾语”或“动词+场景”的格式标定情节核,格式为[场景]_[动作],如[长亭]_[赠鞭]、[寺警]_[解围]、[西厢]_[递柬]。此层标注旨在捕捉情节单元的外显行为特征,便于进行字面相似度比对。
深层(功能层) :参照普罗普民间故事“功能项”理论,结合中国古典戏曲叙事特征,将各类情节单元抽象为若干叙事功能类型,包括但不限于:相遇(初识)、阻碍(赖婚)、调停(红娘穿梭)、伪装(张生扮琴童)、考验(老夫人拷红)、结合(团圆)等,共计归纳31种功能编码。此层标注旨在揭示情节单元在叙事结构中的“位置”与“作用”,为跨版本的功能等价性判断提供依据——两个版本即使字面表述差异较大,只要功能编码相同,即可视为同一叙事节点的不同变体。
(二)多维度标签体系
每个情节单元录入数据库时须附加以下维度的标签信息:
基础标识类:单元唯一编号(scene_id)、所属版本(version)、所属折次(act)、出场人物列表(characters)、发生场景(location)。
变异特征类:标记该单元相对于前一历史版本的形态变化类型,分为保留(基本沿用)、删减(完全移除)、扩写(篇幅与细节增加)、简写(大幅压缩)、移位(调整在叙事序列中的位置)、新增番外(前代版本中不存在的新增单元)六类。
文本特征类:唱词字数、曲牌数量、典故引用次数、抒情性语句占比,用于后续的风格量化分析。
(三)数据库三层架构
数据库采用分层设计以兼顾数据存储的规范性与检索的灵活性:
底层——语料库:存储各版本经预处理后的全文数字化文本,按版本—折次—段落三级目录组织,支持原文调取与上下文查看。
中层——单元库:存储标注完毕的标准化情节单元数据集,每个单元记录包含原文片段、双层标签、多维属性,支持按版本、功能类型、变异类型、人物等字段进行结构化检索与筛选。
上层——关联库:存储单元与单元之间的跨版本对应关系。具体包括:同一叙事节点在不同版本中的形态差异记录(如“拷红”在董西厢、王西厢、金批本中的三种写法);衍生改写记录(如某明刊本对王本的扩写);跨选本摘引频次统计(如“长亭送别”在各坊刻选本中被收录的次数)。关联库是整个谱系分析的核心枢纽,承继与变异的量化比较均在此基础上展开。
四、文本挖掘:版本承继与变异的量化方法
(一)比对维度的设定
在关联库支持下,从以下四个维度测度版本间的承继与变异关系:
维度一:单元留存率。统计核心经典单元(如“琴挑”“递柬”“拷红”)在各版本中的保留占比,以及特定单元(如抒情性较强的“长亭送别”)在坊刻选本中被删减的比例。留存率反映各版本对叙事“主干”与“枝叶”的不同取舍策略。
维度二:文本相似度。采用余弦相似度算法,对同一情节单元在不同版本中的唱词、对白文本进行向量化比对。判定阈值为:相似度>0.8视为直系承袭底本;0.4~0.8视为适度改编改写;<0.4视为大幅重构或全新演绎。需说明的是,字面相似度对于经过同义替换或语序调整的文本可能存在低估,因此需结合功能层编码进行综合判定。
维度三:结构排布流变。通过计算各版本情节单元序列的编辑距离(Levenshtein Distance),量化单元顺序的调整幅度。进一步引入DTW(动态时间规整)算法,对不同折数版本(如20折本与16折本)的情节序列按功能编码进行时序对齐,精确识别出哪些单元发生了前置、后置、合并或拆分。例如,部分明刊本将“白马解围”由前部后置,以缩短战争场景、强化情爱主线,这一改编逻辑即可通过时序对齐结果加以确认。
维度四:角色网络变异。计算各版本每折中角色共现网络的聚集系数与中心度。当一个角色在不同版本中的网络位置发生显著变化时(如“郑恒”在元刊本中为边缘丑角,在明清传奇中与老夫人形成强连接),这种网络密度的偏移即成为角色功能变异的量化证据,反映的是版本对人物关系主次的重新安排。
此外,为捕捉叙事“气质”层面的变异,引入情感弧线挖掘:利用基于古代汉语语料微调过的BERT模型,对每折唱词进行情感极性评分,绘制各版本的“情绪温度曲线”。从“董西厢”的明朗欢快,到“王西厢”的深情婉转,再到金批本的哲思沉郁,情感曲线的整体抬升或下压,为版本风格的宏观比较提供了直观的量化依据。
(二)流变规律的初步挖掘结果示例
基于上述方法,对已标注样本的初步分析呈现出较为清晰的流变规律:
1. 董西厢→王实甫西厢:保留全部核心叙事单元,但删减了大段铺叙性唱词,合并了多支零散支线,叙事效率显著提升,体现了从“说唱”向“杂剧”体式转换的集约化趋势。
2. 万历坊刻本:在商业出版驱动下,完整保留“惊艳”“跳墙”等互动性强、视觉感突出的单元,而对“长亭送别”等文人心态的抒情段落则予以精简,篇幅取舍明显向读者趣味倾斜。
3. 金圣叹评改本:不追求情节的增删,而是通过调整单元叙事权重——放大“拷红”“长亭”的哲理内涵、微调人物对话细节——在表层情节不变的情况下完成了深层意蕴的重构。
4. 民间折子选本:完全抛弃完整叙事结构,仅抽取“琴挑”“递柬”等少数高频热门单元独立流传,情节单元由此脱离母体获得了独立的舞台生命。
五、谱系可视化呈现方案
(一)三层递进视图结构
可视化设计遵循“宏观概览—中观探查—微观细读”的认知逻辑,采用三层递进视图:
第一层:宏观流变图(桑基图) 。左侧节点列示王实甫本(或董解元本)的功能项序列,右侧分支流向各版本,线条宽度代表DTW算法计算出的继承权重,线条颜色标识变异类型(红色=增饰扩充,蓝色=删减压缩,黄色=位置移位)。此图用于快速把握各版本的整体承袭格局。
第二层:中观承继网络(力导向图) 。节点为各版本中的具体情节单元,两节点间以实线连接表示“直接承继”(相似度>0.7),以虚线连接表示“间接变异”(需跨版本溯源,如王本→金批本→日本翻刻本的三级传递)。点击任一节点,可高亮显示所有受其影响的子孙节点,追溯一个情节单元在数百年间的演化路径。
第三层:微观文本比对(并排平行台词) 。当用户在力导向图中点击某条变异边时,页面下方展开该情节单元在两版本中的原文片段,用不同色块高亮标出新增、删减或替换的关键意象词(如“黄花地”与“红叶林”的意象替换),实现“从宏观结构到一字一句”的无缝跳转。
(二)辅助视图与交互功能
在上述三层主视图之外,配套提供热力分布图(以热力色块标注各单元在不同时期的改写频次,色块越深代表改动幅度越大)和时序演变动图(按金—元—明—清时序自动演示情节单元的增删、移位全过程)。交互层面,支持点击任意节点调取对应情节单元的原文全文、跨版本差异比对表和改编成因注释,实现“看图溯源、查表校文”的一体化检索。
六、技术工具链与落地策略
本方案推荐采用以下工具链实现:古籍文本标注使用MARKUS平台,支持多人协作与版本管理;相似度计算与DTW对齐使用Python编程实现,调用Levenshtein库与scipy信号处理模块;可视化前端采用Vue.js框架配合G6图引擎,兼顾交互流畅性与可视化表达能力;静态宏观图可使用Gephi生成后嵌入展示页面。
在实施策略上,建议采取“核心突破、逐步扩展”的路径:优先选取“惊艳”“寺警”“赖婚”“拷红”“长亭”五个高潮场次进行深度标注与算法验证,在完整跑通“标注—对齐—可视化”闭环之后再向全本推广。这一策略既能快速产出阶段性成果以验证方法有效性,又能为后续大规模标注积累操作规范。
七、学术价值与拓展方向
本方案的核心学术价值体现在三个方面:
其一,方法论的革新。将传统版本考据中依赖学者个人经验的“承袭关系判断”,转化为可重复、可检验的量化指标(相似度阈值、留存率、对齐率、网络密度差),为版本源流研究中长期存在的“异本归属模糊”“承袭关系难以定论”等问题提供了数据实证的解决路径。
其二,谱系空间的补全。通过将域外翻刻本、民间折子选本纳入统一的数据库框架,明确其在整体流变链条中的位置,改变了以往研究多聚焦于王实甫本与金批本的局限,使《西厢记》的文本演化体系从“线性单线”拓展为“多元网络”。
其三,阐释深度的增进。可视化谱系不仅是数据呈现的工具,更是发现问题的平台。当研究者观察到“女性自主性”相关单元在明代中后期版本中集中出现扩写变异时,即可将版本流变与社会观念史进行关联分析,追问“社会观念驱动”与“舞台空间限制”何者构成了变异的主因——这正是数字人文区别于纯技术展示的学术旨归所在。
在后续拓展层面,数据库可进一步纳入民国改编本、当代戏曲改编本及影视改编作品,将时间轴延伸至现代;算法层面可引入深度学习模型,对“隐性改编”(如人物性格的微妙调整、主题意蕴的偏移等表层文字难以量化的变异)进行语义嵌入空间的对比分析,使“变异”的探测从字面深入内涵。
八、结 语
构建《西厢记》的数字化改编谱系,其目标不在于用技术替代学者的文本细读,也不止于绘制一幅精美的流变图景,而在于为古典戏曲的版本研究建立一种“可计算”的对话语言——让情节单元像基因片段一样被编码、比对、追踪,让承继与变异从模糊的印象描述转化为清晰的路径图景。当董解元的诸宫调、王实甫的杂剧、金圣叹的评改本、坊刻选本的折子在同一张网络图中各自就位、彼此勾连时,我们看到的不仅是一部作品的版本演化史,更是古典文学在数百年传播与接受过程中不断自我调整、自我重构的生动现场。这套方案虽以《西厢记》为个案,但其技术框架与分析方法具有向其他古典小说、戏曲多版本研究迁移的普遍适用性,期待能为数字人文领域的版本谱系研究提供一个可复制、可讨论的实践样本。
(作者系:世界非物质文化遗产研究院特邀院士、「中央电视台」CCTV《艺术名家》栏目特聘客座教授、中央新影中学生频道《强国丰碑》栏目艺术顾问、山西省品牌智库专家委员会副主任兼晋商品牌课题组副组长、山西永济普救寺景区文化顾问)
都市头条编辑:张忠信