深度分析
MuVAP:單鏡頭單聲道多方語音活動投影提升人機換位預測
傳統多人對話換位預測依賴麥克陣列或多鏡頭,限制人機互動。研究提出 MuVAP,利用單聲道音訊與單鏡頭臉部追蹤,將 N 人互動映射為「目前持位」與「下一持位」兩角色,並以 31 小時未剪輯的 AVCC 資料驗證,於 Shift‑Hold 與下一說話者預測上超越基線。
深度分析
傳統多人對話換位預測依賴麥克陣列或多鏡頭,限制人機互動。研究提出 MuVAP,利用單聲道音訊與單鏡頭臉部追蹤,將 N 人互動映射為「目前持位」與「下一持位」兩角色,並以 31 小時未剪輯的 AVCC 資料驗證,於 Shift‑Hold 與下一說話者預測上超越基線。
深度分析
情境對話需維持可追溯且持久的共識表徵,以免語義細節被壓縮成模糊描述。研究提出「視覺支架」,將對話狀態增量外化為示意影像,結合風格即語意設計以標示確定性,同時保留文本摘要以覆蓋不可示意的信息。實驗顯示增量外化勝過一次性全文推理,混合多模態效果最佳。