深度分析 「ALM2Vec」:基於音訊大型語言模型的通用音訊檢索向量框架 隨著音訊資料庫規模擴大,檢索需求提升。研究推出基於音訊大型語言模型的ALM2Vec,能在統一向量空間中支援音效、語音與音樂的跨模態檢索,並可依指令調整檢索焦點。實驗顯示其在音訊與語音檢索基準上達到或接近最佳表現,為未來多樣化音訊應用領域奠基。