首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

噪声中的信号:生物医学文本分类的可审计可靠性层

摘要

arXiv:2608.28595v1 Announce Type: new Abstract: Biomedical NLP pipelines routinely presuppose clean input text, yet large-scale corpora assembled through automated PDF parsing harbour pervasive OCR-li...

and with that the layer clean OCR token level fully
2026-09-02 1 阅读 约2分钟阅读 Moustafa Yehia Hassan, Sharon Wong, Woh Kai Xuan
分享:
字号:
arXiv:2608.28595v1 公告类型:新 摘要:生物医学 NLP 管道通常以干净的输入文本为前提,但通过自动 PDF 解析组装的大规模语料库却存在普遍的类似 OCR 的伪影、标记拆分和合并、连字符残留和字符级损坏,这些会系统性地侵蚀词汇证据并降低下游分类器的性能。我们引入了一个保守的、完全可审计的拼写校正可靠性层,被认为是一个面向安全的预处理模块,而不是一个最大精度的校正器:在不确定的情况下,系统根据医学无害哲学放弃编辑。确定性架构将有界编辑距离候选生成与语料库衍生的 n-gram 评分以及一套保护领域关键术语的生物医学安全门结合起来。我们在内部评估该层,基于 2,104 个令牌级案例的手动策划基准,以及外部评估,基于三级 CORD-19 主题分类器(预防、治疗、流行病学),涵盖原则性四运行协议(清洁、嘈杂、恢复、安全)下的 10,000 个示例。从本质上讲,该层对合成错误的错误修复召回率达到 94.61%,对阴性对照的有害编辑为零。在下游,它恢复了大约 80.45% 的噪声引起的宏 F1 退化,将宏 F1 从 0.7654(噪声)提升到 0.7717(恢复),同时保持接近干净的性能(安全性:0.7721)。对 103 个使用 BioBERT 分类的现实世界 OCR 提取摘要进行的补充案例研究证实,变压器编码器对于轻微噪声似乎相对稳健,激发了未来的灰盒架构,该架构集成有界神经信号和 UMLS 词典,而不影响可审核性。该系统是完全确定性的、工件驱动的,并且在设计时考虑了部署和可审计性。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱