首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

超越正确与错误:评估大型语言模型中的二阶社会推理

摘要

arXiv:2609.05437v1 Announce Type: new Abstract: Previous AI alignment efforts have focused primarily on first-order social norms -- teaching models what is socially acceptable or unacceptable (e.g., `...

and social norm regulation that new alignment order models not
2026-09-09 1 阅读 约1分钟阅读 Sunny Rai, Jinyi Kuang, Reyhan Jamalova, Annie Lou, Cristina Bicchieri, Niyati Malhotra, Victor Hugo Orozco-Olvera, Ana Maria Munoz-Boudet, Lyle H Ungar, Sharath C Guntuku
分享:
字号:
arXiv:2609.05437v1 公告类型:新 摘要:之前的人工智能调整工作主要集中在一阶社会规范上——教授什么是社会可接受或不可接受的模型(例如,“不要偷窃”)。然而,社会智力不仅取决于规范认知,还取决于预测谁将执行它以及如何执行(例如,公开羞辱甚至监禁)。这些二阶期望(称为元规范)控制着人们在社会规则被打破时的反应。我们引入了一种新的框架,用于从情绪评估和行为反应两个维度评估大型语言模型(LLM)中的元规范推理,并提出新的分类任务,即预测违规者的自我调节和观察者的其他调节。我们发布了一个多视角数据集 NormReact,包含 450 个违反规范的场景,并针对规范违反者的性别和观察者的社交亲密程度进行了手工注释的情绪和行为反应。目前的法学硕士描绘了一个更加严酷的社会世界:在六种模型中,他们高估了人类期望不采取行动的负面制裁,并且随着社交距离的增加,与人类判断的一致性恶化。这些发现表明,从冲突调解到政策模拟等规范敏感领域的人工智能系统,可能会产生扭曲的社会监管图景:过度体现惩罚,而低估现实世界中实际规范执行的容忍、克制和关系校准。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱