深度分析 梯度編輯與 LoRA 結合:Epistemic Goggles 提升 LLM 虛構辨識能力的機制 研究指出,傳統在文件前後加上否定標示仍會讓大型語言模型相信虛構內容,作者提出Goggles模組於微調梯度中植入epistemic框架,實驗顯示模型能以約91%正確辨識虛構資訊,同時保持原有能力。此外,Goggles也能標記為Redwood AI安全評估,持續微調仍保留框架。