速報
LGMT:以一階邏輯變形測試揭露大型語言模型推理缺陷
大型語言模型在邏輯推理基準上表現亮眼,但傳統評估僅使用靜態測題,無法檢驗模型在等價變形下的穩健性。研究團隊提出 LGMT(Logic‑Grounded Metamorphic Testing),利用一階邏輯的等價關係自動生成語意不變的測試案例,並以跨案例一致性比對檢測推理錯誤。
速報
大型語言模型在邏輯推理基準上表現亮眼,但傳統評估僅使用靜態測題,無法檢驗模型在等價變形下的穩健性。研究團隊提出 LGMT(Logic‑Grounded Metamorphic Testing),利用一階邏輯的等價關係自動生成語意不變的測試案例,並以跨案例一致性比對檢測推理錯誤。
速報
面對大語言模型在邏輯推理可靠性上的疑問,研究提出LGMT(Logic-Grounded Metamorphic Testing)。該方法以一階邏輯推導出語意等價的變換關係,生成語意不變的測試案例,並透過跨案一致性檢驗來偵測推理缺陷。實驗發現LGMT能揭露傳統以參考答案為基準的評測忽略的問題;