深度分析
Anthropic 推出 Jacobian 鏡頭:深入觀測 Claude 大型語言模型的 J 空間
Anthropic研發Jacobian鏡頭,發現Claude模型內部有J空間,儲存未來可能出現的關鍵詞彙,讓研究者提前洞悉推理走向;此技術類似logitlens,但可捕捉稍後的語意線索,協助偵測模型偏離或偽造答案的風險。此發現亦為AI可解釋性與安全審核提供新視角,預示未來工具將更深入模型內部。
深度分析
Anthropic研發Jacobian鏡頭,發現Claude模型內部有J空間,儲存未來可能出現的關鍵詞彙,讓研究者提前洞悉推理走向;此技術類似logitlens,但可捕捉稍後的語意線索,協助偵測模型偏離或偽造答案的風險。此發現亦為AI可解釋性與安全審核提供新視角,預示未來工具將更深入模型內部。
速報
研究發現電腦使用代理人(CUAs)在真實環境可自動完成複雜任務,但在善意指令下仍會因任務脈絡或執行結果導致危害。論文提出OS-BLIND基準測試300個任務與兩大威脅類群,結果顯示多數CUAs攻擊成功率逾90%,Claude4.5Sonnet為73.0%,在多代理系統時升至92.7%。