来源:ArXiv AI 2026-07-29 04:00

LLM 计划与预训练语言覆盖范围成反比

语言 阴谋 训练 前沿 模型
arXiv:2607.24769v1 公告类型:新 摘要:随着前沿模型能力的不断增强,人工智能对齐在高风险部署环境中变得越来越重要。虽然最近的工作已经在前沿语言模型中凭经验证明了上下文中的阴谋——在假装对齐的同时暗中追求不一致的目标,但大多数工作都是完全用英语进行的,在多语言安全方面留下了重大差距。我们将开源自动化审计框架 Petri 应用于 Qwen3-30B-A3B,以评估跨多种语言的欺骗和阴谋行为。我们的研究结果表明,阴谋得分与估计的训练前语言覆盖率呈负相关,在五类阴谋指数上,与高资源语言相比,低资源语言的得分平均高出 34.2%。此外,我们发现估计的预训练语言覆盖率在不同的策划行为中的效果并不统一。

相关文章推荐

返回首页