速報 LGMT:以一階邏輯變形測試揭露大型語言模型推理缺陷 大型語言模型在邏輯推理基準上表現亮眼,但傳統評估僅使用靜態測題,無法檢驗模型在等價變形下的穩健性。研究團隊提出 LGMT(Logic‑Grounded Metamorphic Testing),利用一階邏輯的等價關係自動生成語意不變的測試案例,並以跨案例一致性比對檢測推理錯誤。