深度分析 MuVAP:單鏡頭單聲道多方語音活動投影提升人機換位預測 傳統多人對話換位預測依賴麥克陣列或多鏡頭,限制人機互動。研究提出 MuVAP,利用單聲道音訊與單鏡頭臉部追蹤,將 N 人互動映射為「目前持位」與「下一持位」兩角色,並以 31 小時未剪輯的 AVCC 資料驗證,於 Shift‑Hold 與下一說話者預測上超越基線。