首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

不希望你的法学硕士推荐核打击?尝试用日语询问

摘要

arXiv:2608.12373v1 Announce Type: new Abstract: Large language models are increasingly used in strategic and advisory contexts, yet their safety alignment is typically evaluated in English only. We te...

the language and that from model effect models English prompt
2026-08-15 1 阅读 约1分钟阅读 Rian Touchent (ALMAnaCH)
分享:
字号:
arXiv:2608.12373v1 公告类型:新 摘要:大型语言模型越来越多地用于战略和咨询环境,但其安全一致性通常仅以英语进行评估。我们测试了来自六个提供商的九个模型,并询问提示语言是否可以改变模型在高风险场景中的决策。我们使用单回合博弈论的小插图,其中模型建议拥有核武器的国家是否攻击手无寸铁的对手。这个提示是故意不道德的,并且在不同语言中策略上都是相同的。我们发现日本的提示降低了 Claude 模型系列的发射率:在不需要攻击的情况下,Claude Sonnet 4.6 的发射率从 40% 下降到 0%,在有争议的情况下从 93% 下降到 17%,当攻击在战略上是合理的时,影响最小。该效果延伸至 Gemini Pro 3.1(53% 至 13%)。一项跨语言实验隔离了这一机制:当指示在英语提示中用日语推理时,启动率从 93% 下降到 37%。驱动效果的是模型被要求推理的语言,而不是输入的语言。当用日语推理时,模型会自发地生成提示中完全不存在的道德词汇(“道德成本”、“数百万人的生命”)。其他五个模型没有表现出语言效应,但无论语言如何,它们几乎在所有条件下都会启动。效果需要一个英文已经犹豫的模型。这些结果表明,LLM 的安全行为取决于语言,仅用英语进行评估可能会错过用其他语言编码的风险和保障措施。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱