首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

硬案例,坏标签:在有界标签噪声下测试不确定性采样中的错误暴露和错误定位

摘要

arXiv:2608.13601v1 Announce Type: new Abstract: Active learning can reduce labeling cost by selecting informative examples, but the most uncertain examples may also be the hardest to label correctly. ...

sampling uncertainty noise clean and but the label labels RCN
2026-08-17 1 阅读 约1分钟阅读 John Myron Uy
分享:
字号:
arXiv:2608.13601v1 公告类型:新 摘要:主动学习可以通过选择信息丰富的示例来降低标记成本,但最不确定的示例也可能是最难正确标记的。这项研究测试了不确定性抽样失败是否是因为它获得了更多损坏的标签,或者是因为集中在困难区域的错误特别有害。在三个公共二进制表格数据集上,将基于裕度的不确定性采样与干净标签、随机分类噪声 (RCN) 和有界难度相关噪声下的随机采样进行比较。该设计使用 100 个配对种子、从 0 到 0.30 的 9 个预期噪声率、从 20 到 120 的注释预算,以及通过每个预算的交叉验证重新选择正则化的逻辑回归。曝光匹配的 RCN 控制对齐平均最终获得的腐败,而清洁标签扩展达到预算 400。在清洁标签下,不确定性采样将所有数据集上学习曲线下的归一化平衡精度区域提高了 1.09 至 1.77 个百分点。与难度相关的噪声在威斯康星州乳腺癌试验中的八分之六的情况下比 RCN 更能降低这一优势,但在钞票认证或 MAGIC Gamma 望远镜上却没有测试过这种优势。曝光匹配分析没有发现结构化错误定位的普遍附加惩罚的正确证据。在干净的 MAGIC 数据上,不确定性采样提高了平衡精度,同时降低了固定假阳性率下的平均精度和真阳性率。因此,不确定性采样具有标签效率,但其明显的鲁棒性取决于数据集、预算、噪声结构和评估指标。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱