智能AI
morning
让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统
摘要
新智元报道 一片龟甲或牛肩胛骨摆在案头,裂纹穿过刻辞,几个字还缺了笔画。 研究者想确认其中一个生字,往往要翻检成百上千张拓片,比对青铜器铭文、战国文字和小篆的形体,再到古籍与现代论文里寻找用例。证据散在不同年代、不同载体和不同数据库中,一轮查证可能持续数日。 近日,来自华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,以辅助专家完成繁杂的甲骨文破译工作。 论文链接...
https
org
新智元报道
一片龟甲或牛肩胛骨摆在案头
裂纹穿过刻辞
几个字还缺了笔画
研究者想确认其中一个生字
往往要翻检成百上千张拓片
比对青铜器铭文
战国文字和小篆的形体
2026-08-03
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 一片龟甲或牛肩胛骨摆在案头,裂纹穿过刻辞,几个字还缺了笔画。 研究者想确认其中一个生字,往往要翻检成百上千张拓片,比对青铜器铭文、战国文字和小篆的形体,再到古籍与现代论文里寻找用例。证据散在不同年代、不同载体和不同数据库中,一轮查证可能持续数日。 近日,来自华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,以辅助专家完成繁杂的甲骨文破译工作。 论文链接:https://doi.org/10.1016/j.xinn.2026.101462 补充材料:https://arxiv.org/abs/2607.17849 代码网址:https://github.com/Yuliang-Liu/AlphaOracle Demo链接:http://vlrlabmonkey.xyz:7685/?lan=zh AlphaOracle先考察甲骨字形在历史上的演变轨迹,随后回到完整辞例和同类卜辞中,结合上下文进行检验,最后查阅古籍与研究文献加以佐证,形成完整的证据链条。 AlphaOracle的每一步释读分析均附有出处、候选答案和置信度,方便专家逐条复核,提供便捷、高效且可靠的智能辅助。论文已被《The Innovation》接收。 研究背景 甲骨文把商王朝的战争、农事、疾病、祭祀、天象和日常决策留在了三千多年前的骨片上。已发现的甲骨碎片超过15万片,至少包含4500个不同字形,得到较可靠释读的约有1500个。 余下约3000多个字像一扇尚未推开的门,门后藏着早期汉语的词义、地名、族名,也藏着商代社会运行的细节。甲骨文的释读,让三千多年前祖先的语言、观念与社会生活重新变得清晰可见,也使中华文明绵延不绝的历史脉络变得生动而璀璨。 甲骨文记录着商代社会的生活图景,是中华民族珍贵的文化瑰宝,也是探寻中华文明源流的重要依据。 然而,甲骨文破译与释读的过程困难且繁琐。专家释读未破译文字时,通常会分析文字的历史异体形态,从海量参考语料库中检索语境与文本对证材料,并结合多条铭文与传世文献对相关假说进行验证。这一过程既要求研究者具备广博的知识积累与丰富的研究经验,也需要他们长期收集、整理并反复比对大量文献资料。 依靠专家独立开展的相关研究虽取得诸多重要成果,但该模式耗费大量时间和人力,且相关评估过程往往依赖专家主观判断,高度依靠研究者个人学识,不易达成一致结论,难以规模化推进。 人工智能技术的迅速发展为辅助专家释读古文字带来了全新可能。以往的研究工作通常依据甲骨文字的孤立字形预测其对应的现代汉字。 然而,这类方法基本仅依托视觉信息,很少结合文本语境用法与传世文献进行交叉佐证。因此,尽管部分输出结果在字形层面看似合理,但却缺少语言学与史料层面的论证依据,能够给予专家的帮助十分有限。 这些挑战表明,亟需构建能够贯通破译各阶段、模拟专家推理过程的计算框架,并将其扩展于大规模语料分析,使相关推论建立在全面且可核查的证据基础之上。 工作亮点 团队提出首个完整模拟专家释读流程的人工智能系统AlphaOracle,将难以规模化、依赖个人经验的古文字考释流程,部分转化为可复核、可重复、可协作的计算框架。 AlphaOracle整合了大规模甲骨拓片、摹本、传世典籍和两万余篇相关研究,分析过程中产生的候选结果和证据来源都会被完整保留下来,最终汇集成一份可溯源和核查的辅助考释报告,可供专家逐项检验和讨论。 帮助学者从分散庞杂的材料中快速发现线索、汇集证据并比较不同解释,这一技术思路让人工智有潜力进入古文字研究的核心环节。 在86名领域专家和博士研究者参与的评估中,78.7%的参与者给予AlphaOracle较高评价,并认为其平均可节省约64%的分析时间。 研究方法 AlphaOracle沿着专家开展真实考释的思路,将甲骨拓片解析、字形演变分析、辞例检索与语境判断、传世文献和现代研究核验依次串联起来。 系统先从整字演变、部件构形和跨时代字形关系中提出多个候选释读,再到大规模甲骨材料中考察这些候选在不同卜辞中的分布和用法,最后从古代典籍与现代学术研究中寻找进一步的支持或质疑,形成完整的证据链。 AlphaOracle释读流程:先解析拓片,再依次完成形态分析、语境对齐和文献校验,最终形成可供专家核查的证据报告。 第一步:拓片解析 输入一张原始甲骨文拓片后,系统先完成字符检测、分类和句子重建。检测模型首先定位每个甲骨文字符,并通过一个分类器辨认已释字,并把仍有争议的未释字交给后续模块。 接着,系统把每一个字符看作节点,利用图神经网络并结合空间信息,同时判断句子的起点、终点和字符之间的连接关系,再据此恢复阅读顺序。最终拓片解析模型将甲骨拓片拆分为若干个带有阅读顺序、具备初步字符识别结果的独立语句。 第二步:形态分析 有了清晰的单字图像和读序,系统开始从历时演变与内部结构两个方向为未释字提出可能的若干个破译假设。 字形演变网络利用扩散模型模拟古代字形向后世形体的变化,并对多次生成结果进行识别和汇总; 部件演变网络拆解甲骨字形中的构件,并将其映射为汉字的IDS序列,根据部件的组合推测对应的汉字; 历史时期演变网络则把甲骨文、金文、战国文字、小篆和隶书等阶段放在同一条时间线上比较相似程度。 三个专家模型各自给出候选及概率,系统按照模型的可信程度加权,判断该字是否已有公认释读,再为未释字保留多个可能的破译答案和相应置信度。 第三步:语境对齐 形态分析给出的破译假设还要放回语句上下文中检验,并从其他相关拓片中寻找相似案例。 系统先从《甲骨文合集》、《甲骨文摹本大系》和《甲骨文校释总集》等数字化资料中依据图像信息和文本信息检索目标字符的全部已知用例,再用面向甲骨文训练的掩码语言模型分析前后搭配。 训练时,模型学习根据已知甲骨上下文补回被遮住的字;推理时,它一方面重新排列形态模块给出的多个候选,判断哪个放进句子最通顺,另一方面独立提出语义候选。 语境对齐还包含一个解释模型,经过监督微调和基于反馈的强化学习,用来汇总同一字在不同卜辞中的用法,并生成便于研究者核查的现代汉语说明。 第四步:文献佐证 经过字形与语境筛选的破译候选,随后将使用传世文献和现代研究论文进行进一步佐证。 系统所用资料包括25部古代传世文献和23,755篇权威现代研究,涵盖《说文解字》、先秦两汉典籍以及《古文字诂林》《甲骨文诂林》《甲骨文字林》等专业著作。 检索时,它会把异体字和近义词一并纳入查询,同时从文字语义和字形图像两条途径寻找相关材料。 不同文献的相关程度、资料权威性、文献类型和时代早晚都会影响证据权重,每条材料都保留书目信息和检索理由,便于研究者追查原文。 最后生成的综合报告依次呈现字形依据、语境用例和文献证据,指出当前支持度最高的读法及其可信度,也明确保留尚未解决的分歧。 总的来说,AlphaOracle会自己提出假设,并针对每一个假设收集相关证据,然后呈现给研究者。 整个过程系统只做少量必要的判断,但并不替代专家作出最终判断,其核心作用在于帮助研究者更高效地发现线索、核查证据和比较不同解释,并将最终的裁决权留给研究者。 实验结果与专家评估 甲骨文释读缺少公认的统一基准,因此论文把大问题拆成几个可测任务,并从组件性能和专家使用价值两方面评估Alp
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱