FacePlex:全雙工即時語音與臉部動作同步生成框架
自然的面對話需要即時語音與同步臉部動作。目前系統多只能單獨產生語音或依賴預先音訊製作臉部動畫。研究者提出 FacePlex,透過 Rolling Flow Matching 與 Rolling Cross-Attention 於串流環境下同時生成語音與臉部動作。實驗表明,該框架在唇形同步與動作真實度上超越音訊驅動基線,提升使用者體驗。
自然的面對話需要即時產生語音,同時同步臉部動作。現有系統大多只能單獨處理其中一項:全雙工語音模型能即時合成聲音,但不會產生臉部動作;音訊驅動的臉部動畫則只能根據已有音訊來動畫,無法同步生成。
FacePlex 架構概述
為了填補這個缺口,研究者先將全雙工共同語音與臉部動作生成形式化,讓語音 token 與臉部動作 token 在每一步同步產出。基於此,提出了 FacePlex,一個統一的即時串流框架,核心包含兩個新技術:
- Rolling Flow Matching:將 flow matching 調整為線上動作生成方式,在每個串流步驟提交新的動作幀,確保即時性。
- Rolling Cross-Attention:將即時音訊佇列與動作佇列相互耦合,使語音與臉部動作在生成過程中相互條件化,提升同步品質。
實驗與結果
研究團隊進行了廣泛的實驗、消融研究以及使用者測試。結果顯示,FacePlex 在即時串流限制下仍能產生高品質的唇形同步與自然的臉部動作,較傳統的音訊驅動臉部動畫基線在動作忠實度與視覺真實感上都有明顯提升。使用者測試亦證實,受測者對於 FacePlex 產出的互動感受更佳。
延伸閱讀
- 「HyperPotter」超圖框架結合高階交互與 O‑information 提升音訊深偽檢測效能
- LEAF‑X:以熵導向注意力提升 Transformer 語音辨識的可解釋性與時間定位精準度
- 指令向量導向大規模音頻語言模型:提升時間注意力與事件定位
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。