速報
多範式LLM代理人架構解析:Generator‑Evaluator、ReAct與記憶擴充實作
研究背景:大規模語言模型代理人快速演進但缺少整合多種互動範式的統一架構。本文比較Generator‑Evaluator、ReAct與記憶擴充互動,並在開源框架中實作五階段處理流程及六維評估。結果指出預審能揭露需求缺漏,ReAct穩定但增加工具重複呼叫,對抗式討論多用於內容精修。
速報
研究背景:大規模語言模型代理人快速演進但缺少整合多種互動範式的統一架構。本文比較Generator‑Evaluator、ReAct與記憶擴充互動,並在開源框架中實作五階段處理流程及六維評估。結果指出預審能揭露需求缺漏,ReAct穩定但增加工具重複呼叫,對抗式討論多用於內容精修。
速報
研究指出現代人工智慧普遍缺乏元認知。研究提出MetaKGEnrich,一套自動化流程:由種子查詢建構知識圖譜、以七種圖譜指標偵測稀疏區域、生成針對性問題並網路檢索佐證回填,最後擷取並評估回覆品質。實驗在三個公開資料集上顯示多數問題的答案品質獲得提升。
速報
在自駕系統逐漸把深度學習模型部署到受限邊緣平台時,掌握在資源退化下的硬體行為變得關鍵。
速報
大型語言模型成為網頁代理與資訊系統核心,將自然語言轉為嚴謹結構格式至關重要。本研究提出Structure-BiEval框架,透過確定性中介表示分離結構與內容,採內容語意準確度與標準化樹編輯距離為量化指標。測試顯示模型在結構化表現上差異明顯且深度遞迴仍具挑戰。
速報
部署中的強化學習缺乏運行時可靠性理論。研究提出雙可預測性P,一個資訊理論指標,量化代理與環境互動轉換不確定性為共同可預測性的效率。實驗顯示P普遍被抑制,且能更早偵測耦合異常。以資訊數位孿生IDT監測,可在低延遲下顯著提高耦合退化偵測率,勝過僅靠獎勵監控。
速報
研究團隊提出VideoGameBench,一套以10款90年代真實遊戲評測視覺語言模型(VLMs)感知、空間導航與記憶管理能力的基準。模型只取得原始畫面與高階目標與控制說明,三款遊戲保密以檢驗一般化。實驗顯示前沿模型在即時互動下多半難以超過開局,推理延遲為主要瓶頸;
速報
大型語言模型常被用作論文第一讀者、但易錯認細項。作者提出Paper.json作為PDF伴隨檔,定義穩定主張ID、明確不宣稱清單、逐圖實驗指令與定義ID,並主張手寫最低合規可在不到一小時內完成。實作含驗證器,示範工具可檢查合規性並促進可重現性。社群儘保留擴充彈性。
速報
團隊研究機體與控制器共同優化的耦合問題。將形態優化視為演化,控制器視為終身學習,並以拉馬克式遺傳移轉學得參數。在虛擬軟體機器人上以貝氏優化與強化學習驗證,發現拉馬克式僅在環境改變同時具衝突且不可預測時劣於達爾文式;加入環境感測能恢復其優勢,幫助控制泛化。
速報
理解多人視訊社會互動需解析細微非語言訊號。研究提出GRASP資料集,將注視、指向手勢與其組合轉為290K問答並分類,並以Social Grounding Reward做為學習訊號,引導模型推理互動參與者,實驗呈現於GRASP-Bench的績效提升。
速報
研究發現概念啟動向量(CAV)與TCAV測試具高度隨機性。作者推導主要CAV變種的分布,指出標準TCAV分數依賴不連續指示函數,導致變異不衰減。提出α‑TCAV,用參數化平滑函數取代指示符,建立機率化框架並提出具體調參建議以改善效率與校準。
速報
大型語言模型訓練仰賴上千GPU集群,研發與除錯難以在生產規模重現。PrismLLM以切片化構建高保真執行圖,捕捉計算、通訊與依賴。採混合模擬:部分ranks執行原始程式,其他以虛擬參與者回放。實驗顯示迭代時間誤差約0.58%,峰值GPU記憶體誤差低於0.01%,能以極少實體GPU模擬至8192顆。
速報
現有科學設計評估只看終點忽略學習軌跡。本研究提出LEAPBench一套55項任務以最佳至今曲線下面積(AUC)衡量軌跡並以經典貝式優化及文獻審核為參照。結果顯示改為軌跡評分後在相同截點下53%任務改變最佳模型判斷且LLM未勝過貝式基準。離線強化學習以此指標作獎勵在保留任務中有表現提升。