深度分析
OrderBench 基準測試:LLM 代理在語意可靠性的結構化輸出漏洞
一篇來自 ArXiv 的研究論文「When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents」指出,儘管大型語言模型(LLM)在 JSON Schema 與結構化輸出模式下能達到 100% 的語法有效性,但在實際交易場景中。
深度分析
一篇來自 ArXiv 的研究論文「When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents」指出,儘管大型語言模型(LLM)在 JSON Schema 與結構化輸出模式下能達到 100% 的語法有效性,但在實際交易場景中。
深度分析
大型語言模型(LLM)在分析個別文件時表現優異,但面對企業級資料集的跨實體分析問題,常因上下文超載、逐實體歸因遺失與順序工具呼叫的線性延遲而失效。
深度分析
在長回合代理任務中,傳統均勻抽樣浪費資源;PaTR透過任務導向的過程評分器,動態擴展有前景的分支並及早剪枝,於FrozenLake與SWE‑Bench提升9.3與5.0分,證明樹式展開提升探索效率。保留剪枝失敗樣本作負向訓練,提升GRPO相對優勢估計。
深度分析
隨著大型語言模型驅動的自主代理快速崛起,服務導向運算社群提出代理式服務導向運算(ASOC),主張將代理視為可組合、可治理的服務,提出六大工程原則與五面向研究藍圖,並比較現有LangGraph、CrewAI等框架與傳統微服務的差異,預期提升企業與社會部署的可信度與可觀測性。
深度分析
AI Agentic MCPscan 是一款以本機、離線為前提的 MCP 安全掃描工具,能自動偵測本機 MCP 伺服器的曝光、明文憑證、過寬工具範圍與未釘鎖套件,並依影響度給予優先修復建議。工具採 Apache‑2.0 授權,支援 Windows、macOS、Linux,並以純本機運作避免資訊外洩。
深度分析
隨著軟體複雜度提升,傳統漏洞修復難以應付。ContraFix透過產生對比PoC變種並插入狀態探針,抽取差異成修復規格,同時累積修復規格與變異策略作為技能庫。實驗顯示在SEC‑Bench與PatchEval上分別達84%與73.8%成功率,且成本僅為同類最佳方案的三分之一。
深度分析
硬體設計的LLM評估長期侷限於元件級,HWE-Bench提出首個倉儲級且以容器執行驗證的硬體錯誤修復基準。它以真實PR還原417項修復實例,讓代理在完整專案與原生模擬流程中執行並驗證補丁。最佳代理整體修復率達70.7%,在小型核心專案超過90%,但在複雜SoC專案降至65%以下,顯示專案範圍與缺陷分布是主要難點。