首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Leak It:从黑盒语言模型中提取训练数据的概率方法

2026-08-04 1 阅读 约2分钟阅读 Victor Maricato
分享:
字号:
arXiv:2608.00144v1 公告类型:新 摘要:语言模型上的成员推理(MIA)通常由聚合 ROC-AUC 来概括,但这种评估是混乱的:无模型的盲基线仅从表面文本中将成员与非成员分开。我们通过概率透镜研究黑盒、基于采样的训练数据泄漏,将 p(.|x) 中的 N 个样本视为输出分布的估计,并将泄漏信号视为其函数。我们将盲基线批评扩展到采样制度:在 WikiMIA 上,盲词袋分类器达到 AUC 0.97(5% FPR 时的 TPR 0.90),并且采样没有增加任何内容,而在 IID 桩分割 (MIMIR) 上,自我集中和金连续恢复都没有显着优于盲基线(增量 AUC 95% CI 包括零)。总体指标掩盖了真正的危害。相同的采样逐字提取训练数据,以获取盲攻击无法到达的文档尾部。在 Pythia-6.9B 上,500 个带有真实标识符的 Pile 文档中的 83 个(16.6%;带有电子邮件地址的文档中的 21.3%)复制了该精确标识符,并且在不匹配的前缀控制下未复制该标识符,因此每次泄漏都可归因于该文档,而不是全局通用字符串。每个文档的披露对于聚合 AUC 是不可见的,并且随着容量的增长而增长(从 410M 到 6.9B,从 5.6% 到 16.6%)。风险是不均匀的:代码中的标识符泄漏比散文强约 3 倍,尽管散文显然保持积极的状态,并且随着容量的增加而增长(4.0% 到 12.1%),而任意保留的延续的恢复仅限于代码(GitHub 上的成员差距为 +0.44,而散文上的成员差距最多为 +0.014)。温度和核心采样无关紧要,16 个令牌的前缀就足够了,而且我们检测到语料库重复数据删除没有减少。隐私审计应报告按域分解的每个文档的提取,而不是单个 AUC。我们发布了leakit,一个黑盒提取审计工具。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱