首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

无悔的隐私:差分隐私推理-时间对齐

摘要

arXiv:2608.26324v1 Announce Type: new Abstract: Best-of-N (BoN) sampling is the simplest and most widely deployed inference-time alignment strategy, but it suffers from two distinct problems: reward h...

the privacy and reward noise epsilon PrivITP alignment which that
2026-08-28 1 阅读 约2分钟阅读 Ishi Jain, Nandini Bhattad, Sayak Ray Chowdhury
分享:
字号:
arXiv:2608.26324v1 公告类型:新 摘要:Best-of-N (BoN) 采样是最简单且部署最广泛的推理时间对齐策略,但它存在两个明显的问题:奖励黑客,其中所选响应利用代理奖励模型中的错误,以及用于训练奖励模型的敏感人类偏好数据缺乏任何隐私保护。我们证明,在选择之前添加校准噪声来奖励分数的单一干预可以解决这两个问题。我们的第一个结果,PrivBoN,确定适当规模的 Gumbel 噪声同时提供 $\epsilon$ 差分隐私并实现 KL 正则化对齐。每当隐私预算超过临界阈值 $\epsilon^*$ 时,隐私规定的噪声就是遗憾最优正则化,并且隐私施加零额外对齐成本,与 Huang 等人的信息论天际线相匹配。 (2025)。由于 $\epsilon^*$ 取决于未知的覆盖系数,因此我们引入了私有推理时间悲观主义(PrivITP),它将 $\chi^2$ 正则化拒绝采样与两阶段高斯机制相结合。 PrivITP 实现了事后 $(\epsilon,\delta)$-DP,其隐私成本与响应数量 $n$ 无关,干净地将正则化参数与隐私参数解耦,并获得了噪声膨胀项的天际线。跨多种语言模型、数据集和奖励模型的实验证实了我们的结果:PrivBoN 和 PrivITP 是单调缩放的(与 BoN 不同,BoN 会降级超过关键的 $n$),并且 PrivITP 在同等隐私级别上匹配或优于 PrivBoN,在强隐私制度中收益最大。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱