点击右上角
微信好友
朋友圈

点击浏览器下方“
”分享微信好友Safari浏览器请点击“
”按钮

作者:唐宸(清华大学人文学院副教授)
随着古籍数字化工作的不断推进,大量古籍影像陆续公布,书目数据不断汇聚,知识图谱等数字人文技术开始进入整理与研究实践,古籍逐渐成为可被检索、比对、关联和计算的数字对象。但资源数量的增长并不意味着研究基础设施已经完善。当前古籍数字资源仍普遍存在分散建设、标准不一、平台隔绝和工具脱节等问题。《关于推进新时代古籍工作的意见》明确指出,要“积极开展古籍文本结构化、知识体系化、利用智能化的研究和实践,加速推动古籍整理利用转型升级”。有鉴于此,古籍数智化的下一阶段重心应当从资源积累转向以可信为核心的基础设施建设,使分散的建设成果相互衔接、协同运转,让技术介入的每一个环节都经得起学术检验。本文即从基础设施的智能化与研究范式的智能化两个层面,探讨这一转向的路径与边界。
古籍基础设施的智能化
古籍数智化基础设施应当使书目、影像、文本和知识数据彼此关联,使识别、校勘、比对、标注和分析等工具能够被连续调用,并以来源标注、版本控制、人工审核保障结果的可靠性。概言之,它是一套连接数据、工具、模型与研究规范的技术生态框架,而“可信”正是衡量这一框架的核心标尺。
书目、影像、文本和知识数据分别承担不同功能,也提供不同层次的研究价值。书目元数据解决资源发现和文献辨识问题;影像数据保存版式、行款、题跋、避讳等版本事实;全文文本便于字词检索、比对和计算;知识数据则将人物、时间、地点、作品、事件、职官等要素置入关联网络,为文献研究提供新的关联发现路径。近年来,一些平台已在此方向展开探索。例如,“中文古籍联合目录及循证平台”尝试构建书名、作者、版本、刻工、收藏机构等规范化实体,对不同类型的目录记录进行映射;“典津:全球汉籍影像开放集成系统”探索书目与影像数据的智能体辅助对齐并支持大模型调用与交互;“云四库智能问答”系统通过检索增强生成,让模型先调用相关工具从海量文本数据中寻找材料,再输出带有出处依据的回答;“唐宋文学编年地图”则从作家、作品、时间、空间四个维度全时空呈现作家的活动场景,从而建构出文学史知识图谱。此类实践表明,只有让不同层次的数据相互贯通,可被工具调用,古籍资源才能由孤立的数字对象转化为可持续服务于研究的基础设施。
古籍数字加工是由图像采集与预处理、文字识别、文本切分、异体处理、断句标点、分卷整理、实体标引、知识抽取、校勘比对和分析展示等工序组成的连续过程。过去,这些工作常常分散于不同软件、平台和个人电脑中,同一份数据也可能在不同环节被重复转换、重复标注。这不仅导致效率低下、错误频出,也使处理过程难以完整保存,进而影响研究路径和成果的复用。“识典古籍”“古联智能整理平台”等一系列平台已开始尝试将前述工序纳入上下游相互衔接的流程;“吾与点”等结构化数据系统则支持从古籍文本、书画图像中提取信息,形成知识库或知识图谱;“璇琮数字人文智慧平台”尝试降低技术门槛,使研究者能够在零代码的条件下依托大模型完成古籍数字人文应用研发工作。这些探索的价值皆在于形成可流转的工作流:前一环节所获得的结构化成果,能够成为后一环节的处理依据;最终生成的图表、结论和引文,也能够追溯至原始文献。总之,理想的工作流应当做到数据可流转、过程可记录、结果可复现、错误可反馈、专家可介入——此五“可”兼备,“可信”二字方有着落。
大语言模型的兴起确实为古籍整理与研究带来了新的可能,但古籍领域很难打造出一个无所不能的“万能模型”。目录检索、版本比对、文字识别、文本校勘、人物考辨、地名定位、图像分析等任务各有不同的知识基础和准确性要求,难以由同一种模型、同一种提示方式完成。因此,更值得重视的是“模型驾驭工程”(Harness Engineering)概念,即不再单纯追求更强大的模型,而是通过任务分解、数据检索、工具调用、结果校验、证据留存和人工复核等机制,将模型能力组织、约束和嵌入具体研究流程之中。模型负责理解问题、规划步骤和协调资源;目录库、影像库、全文库和知识库负责提供可靠材料;系统则保存引文、版本、来源、操作记录和修订痕迹。在这一框架下,通用旗舰模型、文言文专用模型、学科领域模型和多模态模型可以各司其职、相互配合。要使这种多模型、多工具协作机制稳定运行,还有必要建设开放协作的古籍数智化资源社区,通过统一的数据规范、应用程序接口(API)和可复用的技能服务,将分散的数据、工具连接起来。API解决数据库和工具如何被程序化访问的问题;本体和知识图谱帮助不同来源的数据进行对齐;模型上下文协议(MCP)等连接规范则可为模型调用外部数据和工具提供相对统一的方式。
古籍研究范式的智能化
古籍数智化基础设施建设的最终目的是改变古籍研究的工作方式和问题边界。它应当帮助研究者在明确资源范围和使用权限的前提下更充分地发现材料,更深入地组织证据,并在跨学科、跨语种的视野中提出新的研究问题。
传统文献研究历来重视“竭泽而渔”式的资料搜求,但在资源规模迅速扩大的条件下,仅凭个人经验反复检索,已难以应对跨馆藏、跨数据库和跨媒介的文献世界。数智化基础设施可以在研究者提出问题后,协助完成需求确认、多库查询、关键词扩展、版本聚合、引文追踪和关联推荐,从而提高资料发现的覆盖度。但“更充分发现”不等于承诺资料绝对穷尽。系统应当明确呈现其检索范围、数据缺失情况,避免将未被检出的材料误认为不存在。在不远的将来,目录查询、版本分析、文本校勘、文史考据等文献专家世代累积的经验方法,可以在尊重学术规范的前提下被整理为可复用的技能服务,将其中可程序化、可验证的部分沉淀下来,供不同研究者规范调用和不断改进。
当数据加工更加精细、关联关系更加丰富时,古籍研究便有可能由单篇、单书和个案阅读,拓展至群体、区域、网络和长时段的“远读”。“识典古籍深度研究助手”的探索显示,智能体可以围绕研究问题调用检索、阅读、比对和数据整理工具,汇集候选材料,形成带有初步证据链的数据集或研究备忘录。这类系统特别适合承担高重复性的工作,使学者得以将更多精力投入问题意识的提炼、材料的辨析、解释框架的建构和结论的论证。当然,我们必须看到,智能体生成的报告至多是研究综述式的起点,而不是学术结论本身。基础设施的价值,正在于让后续的深入研究建立在更充分、更透明、更便于核验的材料基础之上。
古籍数智化研究还将推动研究对象和研究方法的拓展。一方面,大模型在跨语言检索、翻译和信息对齐方面具有先天优势。以汉文典籍为中心,可以进一步关联英、日、韩、越等语种文献,考察典籍传播、知识译介与文明交流互鉴的复杂过程;另一方面,古籍数智化也使文献整理能够更深入地服务于历史地理、医学史、科技史、艺术史和社会史等跨学科研究。相同的古籍材料可以同时接受文本比对、时空分析、网络分析和图像研究等不同方法的检验。在这一方向上,清华大学团队正在研发的“时间轴”平台已作出初步探索。不过,跨学科并不意味着以技术术语替代学科问题。无论采用何种模型和方法,都应回到具体材料,尊重不同学科的证据标准和解释传统。数智化基础设施所提供的是更广阔的材料视野和更丰富的方法选择。
归根结底,“可信”不是某个单点技术的指标,而是数据、工具、模型与研究者协同运转的整体品质。随着人工智能技术的进一步发展,古籍研究者的角色将更多地转向问题设定、证据裁决、方法设计和解释创新。若图书馆、高校、科研机构、出版单位与技术团队能够建立长期协作和共同治理机制,古籍数智化便有可能超越单个项目与平台的生命周期,逐步凝聚起一个开放协作的学术共同体,让分散各处的古籍资源经由数据关联汇入国家文化大数据体系,为中华典籍的全球传播与跨文化研究提供坚实的基础支撑。
《光明日报》(2026年10月12日 13版)
