大型語言模型規則蒸餾提升視覺問答推理解釋性

本研究提出一種從大型語言模型(LLM)蒸餾規則的方法,協助視覺問答(VQA)系統在面對新任務需求時快速擴充其邏輯推理模型。研究者以答案集合程式(ASP)作為推理理論的基礎,透過提示 LLM 產生並修正規則,並以少量 VQA 範例驗證與回饋。

大型語言模型規則蒸餾於視覺問答

研究動機與挑戰

視覺問答(VQA)要求系統同時處理影像與文字資訊,並進行推理。傳統端對端模型雖然效能佳,但在可解釋性與規則調整上受限。

方法概述

研究團隊以答案集合程式(ASP)作為推理理論的骨架,透過提示大型語言模型(LLM)產生新規則,以因應任務變更。流程包括:

1. 提供 LLM 初始 ASP 程式
2. 輸入少量 VQA 範例作為指示
3. LLM 生成擴充規則
4. 使用 ASP 求解器驗證並回饋錯誤
5. 迭代修正直至符合需求

實驗與結果

在多個公開 VQA 資料集上測試,只需少量(數十筆)範例即能誘導 LLM 產出正確規則。產生的規則在 ASP 求解器下能正確回答測試問題,且相較於純資料驅動的規則學習,開發成本更低。

結論與未來方向

規則蒸餾自 LLM 為 VQA 系統提供了一條可解釋且彈性的路徑,未來可擴展至其他多模態任務或結合更複雜的邏輯框架。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more