智能AI
morning
星际争霸 II 中 AlphaStar 人工智能控制的运行时动作干扰
摘要
arXiv:2608.21398v1 Announce Type: new Abstract: A trained reinforcement learning policy does not determine the complete behavior that users encounter: deployment code still schedules, admits, suppress...
and
the
action
that
RAI
its
human
with
capability
control
2026-08-25
1 阅读
约2分钟阅读
Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao
字号:
arXiv:2608.21398v1 公告类型:新 摘要:经过训练的强化学习策略并不能确定用户遇到的完整行为:部署代码仍然会安排、承认、抑制或替换其建议的操作。我们贡献了\emph{运行时动作干扰}(RAI),这是一种人工智能控制机制,可以保留策略参数,同时调节动作节奏并在推理后过滤配置的动作模式。仅当 RAI 的冷却条件满足并且其内容检测器未标记该操作时,RAI 才会发布建议的操作;否则,它会调度一个空操作。探测器涵盖特定的有毒行为,包括工人单位的骚扰,而冷却时间控制行动率。我们在 AlphaStar actor.py 的复制中实现 RAI,并通过开源代码存储库提供实现和可重复性材料。我们在一项 \textit{StarCraft~II} 人类参与者研究中部署了 RAI,该研究比较了同一对手的高能力和速率受限动作的两个演示;我们在一份报告中保留了其能力主张,并在另一份报告中披露了它。在从 1 到 5 的响应等级中,我们观察到扣留索赔时的汇总公平性、信任度和毒性平均值为 3.90、3.50 和 2.00,而披露时为 2.62、4.31 和 2.85。在每个专业群体中,披露与感知公平性较低和感知毒性较高相对应,而新手和专家之间的信任度增加,但中间参与者之间的信任度下降。因此,我们的人工评估表明,即使配置的控制保持不变,通过 RAI 控制的对手的感知也会随着向用户提供的能力信息而发生很大变化。我们的结论是,人机评估必须将执行堆栈内的控制与能力披露分开,并将公平、信任和毒性作为人类经验的不同维度进行评估。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱