深度分析 機械式可解釋性與稀疏自編碼器:精準調整大型語言模型人格特質的方法 大型語言模型(LLM)雖能模擬人類的五大人格特質(OCEAN),但傳統的提示工程或微調方式常伴隨效能下降與資源消耗。研究團隊以稀疏自編碼器(SAE)在模型的殘差流中找出與特定人格相關的單義潛在方向,並利用加法向量在隱藏層施加微調。