AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-07-29 04:00
翻译成中文
LLM 计划与预训练语言覆盖范围成反比
语言
阴谋
训练
前沿
模型
arXiv:2607.24769v1 公告类型:新 摘要:随着前沿模型能力的不断增强,人工智能对齐在高风险部署环境中变得越来越重要。虽然最近的工作已经在前沿语言模型中凭经验证明了上下文中的阴谋——在假装对齐的同时暗中追求不一致的目标,但大多数工作都是完全用英语进行的,在多语言安全方面留下了重大差距。我们将开源自动化审计框架 Petri 应用于 Qwen3-30B-A3B,以评估跨多种语言的欺骗和阴谋行为。我们的研究结果表明,阴谋得分与估计的训练前语言覆盖率呈负相关,在五类阴谋指数上,与高资源语言相比,低资源语言的得分平均高出 34.2%。此外,我们发现估计的预训练语言覆盖率在不同的策划行为中的效果并不统一。
查看原始链接
相关文章推荐
快速工程已解决,但快速管理尚未解决
2026-07-29
使用 Amazon Bedrock AgentCore Identity 通过私钥 JWT 进行身份验证
2026-07-29
我们将在 Google Flow Music 中推出 Lyria 3.5,该版本在音乐性、歌词、人声和创意控制方面都取得了进步
2026-07-29
返回首页