深度分析
LakeQuest 基準:評估資料湖中的多模態檢索與 AI 代理人推理效能
研究指出現實資料湖缺乏有效評測環境,提出LakeQuest基準以表格、文字與元資料混合測試檢索與推理。測試顯示即使檢索正確,跨來源合成仍常失敗,凸顯未來需要更健全的多模態組合與證據追蹤機制。基準涵蓋AI/ML元資料、零售銀行與生醫藥物三大領域,測試11種模型發現檢索高但推理正確率僅約30%。
深度分析
研究指出現實資料湖缺乏有效評測環境,提出LakeQuest基準以表格、文字與元資料混合測試檢索與推理。測試顯示即使檢索正確,跨來源合成仍常失敗,凸顯未來需要更健全的多模態組合與證據追蹤機制。基準涵蓋AI/ML元資料、零售銀行與生醫藥物三大領域,測試11種模型發現檢索高但推理正確率僅約30%。
速報
面對多模態模型在文化與日常知識上的限制,研究提出OASIS資料集。它採用EverydayMMQA框架產生圖像、文字與語音問答,並以人工逐階驗證。資料含近九十萬張真實影像、逾一千四百八十萬組問答等,旨在評估模型的語境與文化推理能力。基準測試揭露多款模型尚有明顯差距。