首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

对文档敏感度分类的经典模型和基于 Transformer 的模型进行基准测试

摘要

arXiv:2608.16928v1 Announce Type: new Abstract: Automatic sensitivity classification of organizational documents is a critical yet underserved problem, where the consequences of misclassification rang...

the classification leakage and sensitivity problem from based document that
2026-08-20 1 阅读 约1分钟阅读 Aleesha Zainab, Muhammad Ahmed Khalid, Faheem Ullah Khan, Asifullah Khan
分享:
字号:
arXiv:2608.16928v1 公告类型:新 摘要:组织文档的自动敏感度分类是一个关键但未得到充分解决的问题,错误分类的后果包括违反法规和安全漏洞。虽然基于人工智能的方法提供了手动审查的可扩展替代方案,但其可靠性从根本上取决于训练数据的完整性。该领域中一个普遍但未被充分报道的问题是标签泄漏:嵌入文档正文中的残留分类标记允许模型利用表面快捷方式而不是学习真正的基于内容的敏感度信号,从而产生夸大且不可靠的性能估计。本文通过介绍Strategy 16K来解决这个问题,Strategy 16K是一个精心构建的、泄漏控制的语料库,包含来自美国外交维基解密公共图书馆(PlusD)的16,000条外交电报,并提出了一个系统基准,评估涵盖经典机器学习和基于变压器的方法的六种模型架构。我们记录了一个扩展的泄漏消除协议,该协议可识别并消除嵌入在文档正文中的三类残留分类标记。在 clean benchmark 上,BERT 取得了最强的性能(准确率 = 89.14%,F1 = 89.33%),其次是 ELECTRA(准确率 = 88.57%,F1 = 88.90%)。在经典模型中,带有逻辑回归的 TF-IDF 以显着降低的计算成本实现了最强的性能。这些结果构成了 Wikileaks PlusD 在明确泄漏控制条件下构建的第一个完全可重复的敏感性分类基准。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱