首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

代理人工智能的运行时治理:具有可信来源和故障关闭执行的动作边界控制

摘要

arXiv:2608.16891v1 Announce Type: new Abstract: Agentic AI systems request tool actions that can modify files, send messages, launch jobs, or change workflow state. This shifts the safety problem from...

Aegis and rows governed the side tool that governance model
2026-08-19 1 阅读 约1分钟阅读 Adam Mazzocchetti
分享:
字号:
arXiv:2608.16891v1 公告类型:新 摘要:代理 AI 系统请求可以修改文件、发送消息、启动作业或更改工作流程状态的工具操作。这将安全问题从有害的文本生成转移到有害的操作副作用。提示级治理可以塑造模型行为,但不会创建执行边界。我们引入了 Aegis,一个运行时治理系统,它将模型输出视为行动建议,并在工具执行之前通过可信决策层对它们进行调解。该模型提出;受信任的运行时决定。 Aegis 根据积极的政策状态评估提案,解决起源服务器端问题,在不确定性下失败,并通过参议院式的解决方案(一种基于法定人数的非单边授权路径)路由选定的案例。我们在一个重复的沙箱语料库上评估了 Aegis,该语料库涵盖 5 个运行系列、42 个任务、3 个条件以及每个系列 10 次重复。在 6,300 行中,即时策略调节产生了 79 个有风险的比较器路径泄漏行。在 2,100 个 Aegis 管理的行中,系统记录了零受管理的模拟工具应用程序和零受管理的风险副作用完成情况。所有 1,832 个 Aegis 尝试治理的行都保留了可信的 Aegis 解决的来源,所有 1,019 个参议院解决的行都有法定人数和最终签署的计数证据。这些结果并不能证明一般自主代理的安全性。他们支持更窄的系统声称,在这个评估的沙箱语料库中,运行时动作边界治理防止观察到的风险提案成为受治理的副作用。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱