深度分析
以知識圖譜驅動的槽位對齊:KARMA 與 SPA 在 LLM 偏好優化中的成效
隨著大型語言模型推理需求增長,KARMA 透過知識圖譜產生結構對齊的對比樣本,並以 SPA 在實體槽位層面進行偏好學習,實驗顯示在生醫、化學與計算機領域的推理基準上皆超越傳統序列或標記層級方法。KARMA 枚舉符合模式的圖路,利用重複度作為支持選擇,SPA 亦可選用槽位感知遮蔽注意力提升效能。
深度分析
隨著大型語言模型推理需求增長,KARMA 透過知識圖譜產生結構對齊的對比樣本,並以 SPA 在實體槽位層面進行偏好學習,實驗顯示在生醫、化學與計算機領域的推理基準上皆超越傳統序列或標記層級方法。KARMA 枚舉符合模式的圖路,利用重複度作為支持選擇,SPA 亦可選用槽位感知遮蔽注意力提升效能。
深度分析
研究指出安全對齊在大型語言模型中未區分領域,導致網路安全操作受限。作者利用正交投影從模型權重中移除特定拒絕向量,對1兆參數Kimi K2進行領域特定消除。結果顯示網路安全拒絕率從100%降至7%,而其他領域的安全防護仍基本保留。此外,研究發現安全訓練方式與模型架構是影響領域特定消除成效的關鍵因素。
深度分析
大型語言模型安全性需求提升,研究提出MAG框架在每筆輸入前加固定指令,利用激活幾何差異抽取推理特徵,證實可預測模型判斷並以單向量操控決策,提升資料選擇精度至94.7%Top‑1。MAG可比較八種操作子,發現部分特徵線性表徵強,適用向量導向調整模型行為;在選擇訓練資料時,RFD相似度超傳統激活相似度。
速報
科學方程式發掘需要結合廣泛的領域先驗與嚴謹的數值驗證。傳統符號回歸提供數值基礎,但搜尋空間龐大;而多數語言模型系統直接讓模型產出或挑選公式。研究團隊測試了不同的角色分工,將大型語言模型設定為方程式作者、候選決策者或搜尋控制器,並與端到端語言模型及純數值基線比較。
深度分析
隨著大型語言模型在醫學領域的應用深化,傳統計算基準僅支援單一工具且需明示目標計算器。研究團隊推出MedCalc‑Pro,收錄2268例、77種計算器,涵蓋單、多人與嵌套計算情境,並建構多工具選擇與依賴關係的代理框架。實驗顯示該框架在所有測試任務上均優於現有方法。
深度分析
本研究探討評估語言對Agent-as-a-Judge判斷的影響,將評分提示本地化至英、阿、土、中文、印語,測試六種大型語言模型於55項開發任務。結果顯示,不同語言會改變模型排名,GPT‑4o在英文表現最佳,而Gemini在阿拉伯語與印地語領先,突顯語言是評估的重要變數。
速報
大型語言模型在邏輯推理基準上表現亮眼,但傳統評估僅使用靜態測題,無法檢驗模型在等價變形下的穩健性。研究團隊提出 LGMT(Logic‑Grounded Metamorphic Testing),利用一階邏輯的等價關係自動生成語意不變的測試案例,並以跨案例一致性比對檢測推理錯誤。
深度分析
在關係式概念學習中,缺乏適當的謂詞是ILP的瓶頸。ADVENT結合大型語言模型與Prolog逐步驗證,自動發明具語意的輔助謂詞,並累積於知識池供跨任務重用。實驗顯示成功率由零提升至80%,且知識池可再提升最高31個百分點。此方法顯示LLM能在結構化推理中創新,預期推動跨領域符號學習與可解釋AI新趨勢。
速報
研究團隊推出首個同時評測 Word、Excel、PowerPoint 的基準 OCB,分為結構視覺測試與跨領域專業問答兩條軌道。測試以原子化判斷方式由多個 LLM 評審打分,最先進系統在專業問答上僅達 59.3% 左右,提升深度效益有限,升級產品等級才有小幅提升。
速報
隨著大型語言模型在使用者端的應用日益增多,傳統僅依賴靜態個人檔案或文字訊號的個人化方法已無法捕捉使用者在不同領域查詢時的專業程度差異。研究團隊提出 ExPerT,一套以查詢為單位的個人化系統,透過同時解析查詢文字與打字動態,推斷使用者的領域專業度,並根據推斷結果調整回應的細節、術語與概念深度。
深度分析
研究指出推理模型在產生長鏈思考時會使 KV 快取快速膨脹,導致記憶體壓力與解碼延遲。作者提出 Kara 以滑動視窗雙向注意力挑選關鍵 KV,並透過 Token2Chunk 形成彈性區塊。實驗顯示在多項數學推理基準上,記憶體使用下降且吞吐量提升。此技術有望降低模型在雲端部署的成本,並促進開源社群在高效推論上的創新。
速報
研究團隊將遞迴特徵機器(Recursive Feature Machine, RFM)演算法結合探測器初始化,成功在數秒內於推理型與非推理型大型語言模型(如 Qwen 3、Qwen 2.5)中找出多維度的拒絕子空間。相較於傳統子空間抽取方法,RFM 不僅計算效率更佳,且在消融測試中表現更優。