深度分析 TALE:結合搜尋工具的 LLM 無參考評估方法與性能分析 隨著大型語言模型廣泛應用,傳統參考答案評估成本高且難以因應變動事實。研究提出TALE框架,讓模型透過工具自動搜尋、彙整外部證據來驗證回應。實驗顯示其在自由問答基準上與人類評分高度一致,提升評估可靠性。此方法減少對模型內部知識的依賴,並能即時因應快速變化的資訊,預示評估流程將向自動化與證據導向轉型。