深度分析
Jacobian Lens 揭示 LLM 內部全局工作空間:從可解釋性到對齊安全
研究人員利用新開發的 Jacobian Lens 技術,探索大型語言模型內部的資訊處理機制。該技術可識別模型準備轉化為文字的特徵空間 J-space,發現其功能與神經科學中的全局工作空間理論高度相似,能承載刻意推理與靈活的內部對話。實驗證明透過干預 J-space 可直接改變模型輸出,並揭露其隱藏的策略思考,為 AI 可解釋性與對齊研究提供新突破。
深度分析
研究人員利用新開發的 Jacobian Lens 技術,探索大型語言模型內部的資訊處理機制。該技術可識別模型準備轉化為文字的特徵空間 J-space,發現其功能與神經科學中的全局工作空間理論高度相似,能承載刻意推理與靈活的內部對話。實驗證明透過干預 J-space 可直接改變模型輸出,並揭露其隱藏的策略思考,為 AI 可解釋性與對齊研究提供新突破。
Open Source AI
法國開源 AI 聊天機器人 Lucie 上線三天後即被暫停,原因在於其產生大量荒謬錯誤,包括建議食用「牛蛋」及提供非法藥物食譜。開發團隊承認模型缺乏 RLHF 訓練與安全護欄,且過早公開發布,目前已下線進行修正。