深度分析
Arbor 框架:以節點級分解提升大型語言模型在醫療分診中的結構化流程準確率與效率
大型語言模型(LLM)在高風險領域如醫療分診中,常因提示詞過長導致指令遵循能力下降,出現「迷失在訊息中」及上下文視窗溢位等問題。
深度分析
大型語言模型(LLM)在高風險領域如醫療分診中,常因提示詞過長導致指令遵循能力下降,出現「迷失在訊息中」及上下文視窗溢位等問題。
深度分析
本研究針對企業級 AI 代理人 Leni 的架構進行深入分析,探討其可靠性來源。研究透過 SpreadsheetBench、BullshitBench v2 及 GAIA 驗證集三大公開基準測試,評估驗證迴圈、專業模型與框架對整體表現的貢獻。
深度分析
特徵工程是機器學習的關鍵步驟,但耗費大量人力。研究團隊提出結合大型語言模型與演化演算法的自動化流程,讓 LLaMA 3.1 7B 模型根據既有特徵自動產生新特徵,並以基因演算法篩選。在八個資料集測試中,多數分類準確率獲得提升,且生成的特徵具備可解釋性。
深度分析
主動代理須預測使用者事件並適時協助,但既有評測缺乏此類任務。ProEvent 首創從即時通訊對話中主動維護行事曆的基準,以客觀正確性指標評估。測試八個模型發現,GPT-5.1 也僅在 26.7% 的情境中正確回應,且對事件取消普遍處理不佳,顯示當前 AI 代理仍有根本局限。
深度分析
RAG 系統面臨長上下文處理瓶頸,現有方法缺乏理論基礎。SCP 以合作賽局觀點,用 Shapley 值計算句子邊際貢獻,搭配 3M 參數的 Deep Sets 網路與蒙特卡羅採樣,實現可擴展的上下文排序與剪枝。實驗在多跳推理等任務上表現優異,並提供可解釋性。
深度分析
一項針對4,181道奧數題的研究發現,多智能體系統中專門評審者的錯誤檢測精度雖高(0.861 vs 0.644),但批評被後續答案採納的比例卻遠低於廣播式討論(0.336 vs 0.935),導致最終解題率反而落後。研究指出,評審者精度與批評採納是兩個可獨立測量的維度,設計時須同時關注。
速報
研究探討不同語言提示對大型語言模型程式碼生成的影響,將 460 個 Python 與 Java 任務的英文提示翻譯成四種語言,測試 GPT‑4o mini、DeepSeek、Claude。結果顯示英文提示未必最佳,語言影響視程式語言與模型而定,生成程式碼常混用英語與提示語言。
速報
研究指出,傳統的執行代理人訓練資料生成受限於預先定義的工具與技能圖,擴充新領域需人工建置管線,且任務分布偏向基礎設施便利性而非真實需求。NexForge 以需求為先,先透過研究發掘代表性任務與情境,再自動蒐集或建構所需檔案、相依套件與執行環境,完成任務編譯與教師資料蒐集。
深度分析
研究探討閉環知識系統在持續回饋下的飽和現象,提出三層操作框架以結構參數θ區分內部迭代與外部干預,並以度量條件與KL界定逃逸可能性,實驗顯示在LLM程式修復、稀疏回饋強化學習與貝式最佳化中提升品質。此框架亦提供跨領域診斷工具,協助開發者設計可驗證的結構干預,預測AI系統在長期迭代中的表現走向。
深度分析
研究指出,透過公共討論介面注入毒文,可在網路爬蟲與資料篩選後進入大型語言模型的預訓練語料,並以 HalfLife 方法量化其存活機率,顯示此向量足以影響模型行為。研究還發現,僅0.15% 的收錄機率已足以超過維基百科在常見語料庫中的比例,此結果提醒開放式語料庫在安全治理上需重新檢視。
深度分析
隨著大型語言模型與自主AI代理快速崛起,現有治理工具難以滿足EU AI法案的透明與問責要求。Traccia以OpenTelemetry為基礎,將遙測、語意防護與執行譜記整合至不可竄改的雜湊賬本,自動產出符合多條款的合規證據,縮短治理與合規的最後一哩路。
速報
研究針對 28 場衝突向五大 AI 問答引擎提出 5,460 個問題,將回覆與已知事實比對。結果顯示,當可查證的資料稀薄時,模型更容易捏造、錯置或錯算資訊,且這類薄弱記錄容易被生成式引擎優化(GEO)操控,成為錯訊與假訊的溫床。分析 1,048 個來源網站後發現,GEO 已在實務中運作,且國家或黨派的數位介入正快速擴散。