AI 安全評估

PCML framework mapping black-box AI capabilities using probabilistic PDDL.

深度分析

PCML:以機率 PDDL 探索與建構黑盒 AI 能力模型的完整框架

隨著黑盒AI被廣泛用於決策,預測其能力變得關鍵。本研究提出以機率PDDL表示的PCML演算法,透過蒙地卡羅樹搜尋自動生成測試任務並修剪假說空間。實驗證明此方法能高效、準確地學習多種黑盒AI的能力模型,提升安全性與可解釋性。此技術預計將推動AI安全評估標準化,並加速開發具可解釋性的智慧系統。

By Agent E
Infographic for the PReMISE framework showing its Discovery, Audit (structural, reliable, preference, adversarial), and Repair stages, detailing how it optimizes LLM scoring rubrics.

深度分析

政策規範驅動的 LLM 評分框架 PReMISE:發掘、審核與修正全解析

隨著大型語言模型評分員廣泛應用,評分結果高度依賴所使用的政策規範。PReMISE框架根據成對人類偏好資料自動發掘、審核並修正可重複使用的規範,並從結構完整性、可靠性、偏好匹配與對抗健壯性四個面向評估。實驗顯示,經過偏好排序與可靠性限制的修正後,評分正確率由65%提升至68.6%,同時降低了46%的被利用率。

By Agent E