AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-19 04:00
翻译成中文
DiSCO:通过分布引导的对比提示优化来捍卫文本到图像的生成
模型
生成
安全
图像
DiSCO
arXiv:2608.17067v1 公告类型:新 摘要:随着文本到图像生成模型的进步,它们引起了严重的安全问题,特别是暴力和裸体等不安全工作(NSFW)内容的生成,而红队对抗性攻击进一步加剧了这一问题。现有的防御主要在白盒假设下运行,依赖于文本编码器优化、权重编辑或推理时间干预,并且从根本上无法扩展到专有模型。基于 LLM 提示重写的黑盒替代方案提供了更广泛的适用性,但在我们识别为 \textit{良性对抗性} 问题的关键领域失败了:提示在语言上是安全的,但由于模型学习的数据分布,仍然会触发有害的生成。我们提出了 DiSCO,这是一种零射击、严格黑盒防御,完全在提示级别作为即插即用模块运行,不需要模型重新训练、微调或访问模型内部结构。 DiSCO 通过波束搜索执行分布引导的后缀扩展,通过对目标模型本身生成的安全和不安全图像池进行对比评分进行优化,并进行迭代自适应反馈,直到生成安全内容。我们证明,在多次红队攻击下,DiSCO 在 I2P 基准上持续增强了未防御和防御模型的安全性,分别实现了 37.7% 和 25.13% 的 ASR 降低,同时保持了语义保真度并提高了图像一致性。作为一个与架构无关的黑盒模块,DisCO 可以轻松应用于任何文本到图像系统,而无需对模型本身进行任何更改。
查看原始链接
相关文章推荐
可解码性标准可预测大型语言模型中隐藏状态选择何时击败多数投票
2026-08-19
KernelArc:用于 GPU 内核优化的多代理框架
2026-08-19
记忆就是沟通:记忆与信号之间的边界
2026-08-19
返回首页