深度分析
DialogueVPR:結合跨模態檢索與大型多模態語言模型的對話式視覺位置辨識
受人類以語言傳遞空間資訊的啟發,研究團隊提出 Dialogue Place Recognition(DlgPR)概念,將定位問題重新定義為一場互動式對話推理。系統結合跨模態漸進學習檢索器(CMPL)與大型多模態語言模型 DQ‑pilot,透過主動提問逐步釐清模糊描述,並以難度指標與位置檢索增益作為課程學習指導。
深度分析
受人類以語言傳遞空間資訊的啟發,研究團隊提出 Dialogue Place Recognition(DlgPR)概念,將定位問題重新定義為一場互動式對話推理。系統結合跨模態漸進學習檢索器(CMPL)與大型多模態語言模型 DQ‑pilot,透過主動提問逐步釐清模糊描述,並以難度指標與位置檢索增益作為課程學習指導。
深度分析
隨著生成式AI讓多模態假新聞更逼真,研究提出CORE框架以衝突導向推理讓大型多模態語言模型具備顯式衝突辨識能力,僅需少量或零樣本即可偵測新型偽造,實驗顯著超越現有方法。核心建構了14k筆衝突屬性語料庫,提供細粒度衝突因子與來源標註,藉此進行衝突感知訓練,提升模型在人類般的語意與物理不一致判斷上表現。