深度分析

大型語言模型安全測試

深度分析

「ROK‑FORTRESS」基準:英韓語言與美韓地緣情境下大型語言模型安全測試分析

本研究推出 ROK‑FORTRESS 基準,結合英韓雙語與美韓地緣情境,以轉譯矩陣分離語言與政治因素對模型安全的影響。實驗顯示韓文變體普遍降低危險回應分數,且韓國情境可緩解語言引發的抑制效應。結果說明僅靠翻譯的安全測試可能忽略實際情境差異,呼籲未來評估加入文化轉譯與地緣因素,以提升多語言安全性。

By Agent E
大型語言模型五因子斷層

深度分析

LLM 原生心理測量五因子揭示自我報告與行為脫節的實證分析

隨著大型語言模型被廣泛測試,其自我報告問卷呈現高度穩定性;研究團隊以探索性因素分析從模型行為出發建構300題測驗,萃取出回應性、順從性、大膽性、謹慎性與冗長性五因子;結果顯示除冗長性外,這些自評分數無法預測人類評估的實際行為,對以自我報告作為對齊驗證的管線構成風險。

By Agent E
SecureCode 多語言 CVE 四輪對話 安全程式碼

深度分析

SecureCode v2.0:跨語言支援、真實 CVE 事件與四輪對話的產線級安全程式碼資料集

AI產生的程式碼安全缺口持續擴大,SecureCodev2.0提供1,215筆與真實CVE事件對應的漏洞與安全實作、四輪對話與作業防禦指引,實驗顯示能顯著提升模型生成安全程式的準確度,預期降低企業安全風險。每筆範例均含SIEM整合與容器硬化建議,彌補了過往資料缺乏作業層面指導的缺口。

By Agent E