大型語言模型在語意記憶檢索上的探索度與人類仍有差距
本研究以語意流暢測驗比較人類與三款大型語言模型的搜尋行為,採用熵、步距與中心距三項指標量化。結果發現人類的語意搜尋更具變化與探索性,模型即使調整溫度亦只能在單一指標上對齊,無法同時複製人類的完整特徵,顯示目前模型仍缺乏平衡局部與全域探索的能力。
研究背景與方法
語意記憶檢索可視為在概念空間中的導航。研究者以口語流暢測驗(verbal fluency)收集 82 位受測者的產出,並讓三款大型語言模型(GPT‑4o、Gemini‑2.5‑Pro、Claude‑Sonnet‑4.5)在八種不同的溫度設定下產生相同任務的結果。
透過軌跡式自然語言處理指標,研究者量化了三個互補維度:
- 熵(entropy):步長的可預測性。
- 與下一項的距離(distance to next):連續語意步距。
- 與中心的距離(distance to centroid):全域散布程度。
主要發現
在人類受測者中,熵值較高、語意步距較大且全域散布較廣,顯示其搜尋過程較為變化且具探索性。相較之下,三款模型在所有溫度設定下皆呈現較低的熵、較小的步距與較窄的散布。
調整模型溫度雖能在個別指標上與人類匹配(例如在特定溫度下的熵值接近),但沒有任何單一設定能同時在三個維度上完整復刻人類的行為模式。
結論與意義
研究指出,人類語意搜尋在局部利用與全域探索之間維持一種獨特的平衡,現有的大型語言模型仍未能在架構上同時模擬這兩個面向。未來的模型設計或許需要加入更具彈性的探索機制,才能更貼近人類的語意檢索行為。
延伸閱讀
- 「SopriBench」與「Argus」:多模態跨貼文隱私洩漏基準與溯因推理框架解析
- SenBen:以場景圖與知識蒸餾構建可解釋的敏感內容審查基準
- FoodMonitor 基準:以逐幀定位與結構化生成評估廚房合規監測的多模態大語言模型
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。