AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-07 04:00
翻译成中文
PD-GS:用于音频驱动头显的音素驱动 3DGS
音素
发音
音频
驱动
3DGS
arXiv:2608.05218v1 公告类型:新 摘要:3D 高斯喷射 (3DGS) 可以实现快速、逼真的头部说话渲染,但准确的嘴唇发音仍然难以实现:嘴巴运动通常过于平滑,并且可能违反双唇闭合等硬发音约束,从而产生臭名昭著的“漏嘴”伪像。一个关键的困难是,从回归目标下的连续声学嵌入中推断出简短、离散的发音事件,这使得预测偏向于平均嘴部配置。虽然现代自监督语音编码器提供了丰富的韵律和语音提示,但它们没有提供明确的、框架对齐的语言目标来可靠地消除闭包级别事件的歧义。我们提出 \textbf{Phoneme-Driven Gaussian Splatting (PD-GS)},它使用从自动 ASR 和强制对齐管道获得的时间对齐音素标记来增强 3DGS 说话者。我们的核心组件 \textbf{语言融合模块 (LFM)} 通过学习门自适应地将连续音频上下文与离散音素嵌入融合在一起,使模型能够保持平滑的音频驱动动态,同时加强对发音关键片段的音素指导。 PD-GS 纯粹使用图像重建和唇部标志监督从单目视频进行训练。在 HDTF 上,PD-GS 在比较基线 (LMD 2.66) 中实现了最佳的嘴唇几何形状,并定性地减少了具有挑战性的音素序列中的闭合违规,从而产生了语言上更忠实的神经化身。
查看原始链接
相关文章推荐
Matplotlib 与 Plotly:您应该选择哪种 Python 图表工具?
2026-08-07
Cohere Health 如何使用 Amazon Bedrock AgentCore 将临床政策数字化
2026-08-07
TReNDS 如何使用 Amazon Bedrock 自动进行根本原因分析
2026-08-07
返回首页