来源:ArXiv AI 2026-09-04 04:00

DuplexSpeechBench-IFEval:评估全双工语音代理中的隐式指令遵循

角色 指令 行为 语音 全双工
arXiv:2609.03423v1 公告类型:新 摘要:全双工语音代理必须不断决定何时监听、反向通道、中断、处理语音重叠、发言和让步。现有的基准测试主要通过显式的回合管理指令来测试这些行为,而部署的代理通常是通过角色或角色进行配置的,必须从中推断出适当的对话行为。我们引入 DuplexSpeechBench-IFEval (DSB-IFEval),用于评估实时语音交互中的隐式指令跟随。 (DSB-IFEval) 包括 1,038 个测试用例,涵盖八种不同的助理角色,并评估五种指令遵循调节协议:默认行为、显式行为指令、角色隐含行为、组合角色-规则调节和指令冲突。我们使用确定性的指令依从性分数 (IAS) 来衡量实时楼层管理,并使用法学硕士判断的人物依从性分数 (PAS) 来衡量人物角色一致的内容。在六个实时语音系统中,我们发现了依赖于架构的权衡。像 F-Actor 和 PersonaPlex 这样的全双工模型对于对话行为是明确表述还是必须从角色推断更为敏感,在仅角色调节下,依从性分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 强烈遵守角色一致的内容,但它们的底层行为无法适应明确的和仅角色的指令,并且仍然受到一些主动操作的限制。我们进一步发现,即使系统可靠地遵循与其规定角色相冲突的指令,它们仍然难以在安全冲突下覆盖这些指令。这些结果表明,推断角色隐含的行为、在适当的对话时刻执行该行为以及解决竞争指令仍然是全双工语音代理面临的独特挑战。

相关文章推荐

返回首页