来源:ArXiv AI 2026-08-07 04:00

PD-GS:用于音频驱动头显的音素驱动 3DGS

音素 发音 音频 驱动 3DGS
arXiv:2608.05218v1 公告类型:新 摘要:3D 高斯喷射 (3DGS) 可以实现快速、逼真的头部说话渲染,但准确的嘴唇发音仍然难以实现:嘴巴运动通常过于平滑,并且可能违反双唇闭合等硬发音约束,从而产生臭名昭著的“漏嘴”伪像。一个关键的困难是,从回归目标下的连续声学嵌入中推断出简短、离散的发音事件,这使得预测偏向于平均嘴部配置。虽然现代自监督语音编码器提供了丰富的韵律和语音提示,但它们没有提供明确的、框架对齐的语言目标来可靠地消除闭包级别事件的歧义。我们提出 \textbf{Phoneme-Driven Gaussian Splatting (PD-GS)},它使用从自动 ASR 和强制对齐管道获得的时间对齐音素标记来增强 3DGS 说话者。我们的核心组件 \textbf{语言融合模块 (LFM)} 通过学习门自适应地将连续音频上下文与离散音素嵌入融合在一起,使模型能够保持平滑的音频驱动动态,同时加强对发音关键片段的音素指导。 PD-GS 纯粹使用图像重建和唇部标志监督从单目视频进行训练。在 HDTF 上,PD-GS 在比较基线 (LMD 2.66) 中实现了最佳的嘴唇几何形状,并定性地减少了具有挑战性的音素序列中的闭合违规,从而产生了语言上更忠实的神经化身。

相关文章推荐

返回首页