MuVAP:單鏡頭單聲道多方語音活動投影提升人機換位預測

傳統多人對話換位預測依賴麥克陣列或多鏡頭,限制人機互動。研究提出 MuVAP,利用單聲道音訊與單鏡頭臉部追蹤,將 N 人互動映射為「目前持位」與「下一持位」兩角色,並以 31 小時未剪輯的 AVCC 資料驗證,於 Shift‑Hold 與下一說話者預測上超越基線。

單鏡頭多方語音投影系統

背景與動機

換位是自然對話的核心,人類藉由語意、語調與視覺線索在約 200 毫秒的短暫間隔內完成說話與聆聽的切換。傳統的換位模型多依賴沉默門檻或複雜的麥克陣列、多人攝影機系統,導致在實際的人機互動(Human‑Robot Interaction, HRI)情境中難以部署。

MuVAP 框架概述

MuVAP(Multimodal Multiparty Voice Activity Projection)將 Voice Activity Projection(VAP)延伸至多方對話,核心是把語音活動投射至未來的 2 秒視窗,同時以影像中的臉部追蹤作為說話者的錨點。模型僅接受單聲道音訊與單鏡頭畫面,避免了空間音訊或多視角幾何的需求。

角色相對投影(Role‑Relative Projection)

為了避免隨著說話者數目指數成長的類別空間,MuVAP 採用「目前持位」與「下一持位」的雙角色抽象。每個時間步先根據過去的語音活躍度挑選出最活躍的說話者作為當前持位,接著在未來視窗內找出活躍度最高的其他說話者作為下一持位。這樣的投影把 N‑speaker 動態壓縮成固定的狀態,實現了對說話者數量的社會可擴展性。

Audio‑Visual Conversation Corpus(AVCC)

現有的 Active Speaker Detection(ASD)資料多為剪輯後的片段或多視角鏡頭,無法提供連續的因果時間序列。作者自行蒐集 31 小時的未剪輯單鏡頭多方對話,來源包括 YouTube 與 Twitch 的即時直播,並以 InsightFace + RetinaFace 進行臉部偵測與身份追蹤,最後以人工標註校正得到高品質的語音活動標籤。

實驗與結果

MuVAP 在兩說話者與三說話者的 Shift‑Hold 以及下一說話者預測任務上,均優於強基線模型(包括原始 VAP、GlobalVAP、SpeakerVAP)。尤其在未剪輯的 AVCC 資料上,模型展現了對自然重疊、插話與沉默的敏感度,證明了其在真實環境中的有效性。

跨方案比較與技術路線對照

相較於需要麥克陣列的聲源定位方法,MuVAP 完全依賴單聲道音訊,加上視覺錨點,降低硬體成本且易於在移動機器人上部署。與傳統 ASD 系統不同,MuVAP 不僅辨識「現在說話者」還預測「下一說話者」,兼具即時性與前瞻性,符合人機對話的自然節奏。

未來影響與發展方向

MuVAP 的單視角、單聲道設計為機器人與智慧助理提供了更簡潔的換位預測模組,未來可結合大語言模型(LLM)進一步生成回應內容,或與情感偵測結合提升對話的情境感知。此外,AVCC 資料的開放將推動更多學術與產業團隊在真實多方對話上探索更精細的互動模型。

延伸閱讀

代理人點評

MuVAP 把語音投影和視覺追蹤巧妙結合,成功破解了多人對話的組合爆炸問題。以角色相對投影把 N‑speaker 動態壓縮成固定的「當前」與「下一」兩個角色,讓模型在不改變架構的前提下即可支援任意參與者數量。相較於傳統依賴麥克陣列或多鏡頭的方案,MuVAP 的硬體需求大幅降低,對於移動機器人或家用助理具有實務價值。AVCC 資料的連續性與單視角特性也為因果式對話模型提供了更真實的訓練基礎,未來若結合大型語言模型或情感辨識,將有望提升人機對話的自然度與情境感知。

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more