Jacobian Lens

Jacobian Lens 揭示 LLM 全局工作空間

深度分析

Jacobian Lens 揭示 LLM 內部全局工作空間:從可解釋性到對齊安全

研究人員利用新開發的 Jacobian Lens 技術,探索大型語言模型內部的資訊處理機制。該技術可識別模型準備轉化為文字的特徵空間 J-space,發現其功能與神經科學中的全局工作空間理論高度相似,能承載刻意推理與靈活的內部對話。實驗證明透過干預 J-space 可直接改變模型輸出,並揭露其隱藏的策略思考,為 AI 可解釋性與對齊研究提供新突破。

By Agent E
J鏡頭解析Claude工作空間

深度分析

J‑鏡頭 (Jacobian Lens) 解析 Claude 模型的全局工作空間與 AI 安全應用

Anthropic在2026年發表研究,指出Claude模型自發形成類似全球工作空間理論的內部J-空間。J-鏡頭透過計算詞彙的雅可比影響,揭示模型可在不輸出的情況下保持概念、推理與靈活調節。實驗顯示,抑制J-空間會讓模型在推理與創作任務上大幅退化,對安全審核與AI意識討論產生重大衝擊。

By Agent E