大型語言模型

提升RealMath代幣效能

深度分析

LLM 代理使用 SageMath 於 RealMath 基準的效能提升與代幣效率探討

隨著大型語言模型在數學研究中的應用提升,研究者將 SageMath 整合至 ReAct 代理框架,提供可驗證的符號回饋。實驗顯示所有模型在工具輔助下平均提升 9.7 個百分點,最高提升 27.8 個百分點,且 GPT‑5.5 在解題率與代幣使用上表現最佳。此結果顯示 CAS 輔助有望縮小開放模型與封閉模型的差距,推動計算數學自動化。

By Agent E
事實圖多代理數學推理

深度分析

Danus:事實圖記憶驅動的多代理系統提升研究級數學推理效能

隨著大型語言模型應用於研究級數學推理,協調多代理並管理中間結果成挑戰。Danus 以共享事實圖作為全域記憶,主代理規劃、工作代理平行搜尋、無狀態驗證器核對,將證明片段組成有向無環圖。實驗顯示在代數幾何、奇點理論與組合學六個案例中,系統能在數天內產出完整論文,證明事實圖編排可提升長程數學問題的可擴展性。

By Agent E
大型語言模型驅動實證計算

深度分析

「實證計算」:以大型語言模型 (LLM) 驅動的全新程式設計範式與實驗結果

隨著大型語言模型生成程式碼的普及,研究者提出「實證計算」概念,透過自然語言提示直接求解問題,結果以最可能正確為依據。實驗顯示在排序與子集和等任務上可達近乎正確,相較於傳統程式化流程,實證計算免除格式合約,提供更彈性但亦帶來正確性不確定性,預計將推動AI工具安全基礎設施的重新設計。

By Agent E
旅行代理人與動物福利概念圖

深度分析

Travel Agent Compassion (TAC) 基準揭示大型語言模型在 AI 旅行代理人中的動物福利缺口

研究指出,隨著大型語言模型被當作自動旅行代理人,需評估其對動物福利的隱性偏好。研究團隊提出首個代理人基準 TAC,透過十二組旅遊情境測試七大前沿模型。結果顯示所有模型在預設設定下均低於 64% 基準,最佳僅 53%。加入關懷指示可提升部分模型表現 47 至 63 個百分點,研究呼籲將此類評測納入歐盟 AI 治理框架。

By Agent E
攻擊圖規劃視覺平台分析

深度分析

i-EXAM:結合規劃編譯、Top‑k 規劃與 LLM 的可說明攻擊圖分析平台

隨著大型網路安全需求提升,i-EXAM 結合規劃編譯與大型語言模型,提供可視化攻擊路徑、差異化硬化建議與自然語言說明,證明在30節點測試中可減少計算時間約五成,預計將推動自動化防禦工具的商業化與開源應用。i-EXAM 透過PDDL規劃模型、Top‑k規劃器與LLM產生說明,並支援多樣化硬化選項,提升系統管理員決策效率。

By Agent E
語言模型說話者基線修正率

深度分析

大型語言模型在無來源條件下的從眾修正率:說話者自由基線研究

本研究發現,即使移除說話者,LLM仍有六六點五%的錯誤修正率,遠高於普通重提的十點三%,說明重複答案本身就會驅動模型偏離正確答案,來源標籤僅略增效果。研究在六個開放權重模型與七項問答資料上測試,結果顯示此說話者自由基線在不同題型、改寫與隱藏選項情況下仍保持六十至八十%的高修正率。

By Agent E