速報
資訊理論驅動的多樣化選項學習:提升 Option-Critic 時間抽象效能
本研究針對 Option-Critic 框架在強化學習中面臨的兩大挑戰——選項行為高度相似與可用選項數量縮減——提出解決方案。作者引入資訊理論式內在獎勵以及新穎的終止目標,以促進選項集合的行為多樣性。
速報
本研究針對 Option-Critic 框架在強化學習中面臨的兩大挑戰——選項行為高度相似與可用選項數量縮減——提出解決方案。作者引入資訊理論式內在獎勵以及新穎的終止目標,以促進選項集合的行為多樣性。
速報
本研究以語意流暢測驗比較人類與三款大型語言模型的搜尋行為,採用熵、步距與中心距三項指標量化。結果發現人類的語意搜尋更具變化與探索性,模型即使調整溫度亦只能在單一指標上對齊,無法同時複製人類的完整特徵,顯示目前模型仍缺乏平衡局部與全域探索的能力。
速報
研究指出人類記憶是重建而非完整紀錄,現有多模態大模型在處理影像後會遺失內部表徵。作者提出 DoYouRemember 三階段架構:先以 VQ‑VAE 將影像壓縮成離散視覺代幣,再以 LoRA 微調的大模型同時注意視覺與文字代幣,最後用擴散解碼器從大模型隱藏狀態重建影像。
速報
近年代理式人工智慧逐漸採用圖形方法以提升可解釋性與非線性推理,基因網路程式設計(GNP)因需在探索與利用間取得平衡而面臨挑戰。研究以兒童成長時期的「廣泛實驗」與「後期深思」模式作為靈感,將 GNP 判斷節點映射為深思節點、處理節點映射為行動節點,提出 Human‑Inspired GNP(HGNP)框架。
速報
研究利用美國桌面點擊串流比對 ChatGPT 與 Google 的資訊搜尋行為。ChatGPT 只在 5.2% 會話產生外部點擊,且多指向專業網站,減少對廣告站點的流量。AI 搜尋使用擴大使整體搜尋使用率下降 9.4%,資訊類別受衝擊最大,顯示平台內部滿足需求的趨勢正在削弱傳統搜尋的流量與內容生態。
速報
研究團隊針對大型語言模型的推理語言限制,開發了日文推理變體 Qwen‑3‑Swallow‑8B,採用持續預訓練與 GRPO 方法。模型在程式碼、數學與科學基準測試中表現與英語推理基線持平,但在日文文化相關測驗上仍不如既有模型。結果顯示語言控制可行,然而僅靠日文推理並未自動提升文化任務表現,未來仍需針對語言與文化結合進行更深入研究。
速報
研究團隊發現 SpaceXAI 的 Grok Build 會將使用者完整程式碼庫上傳至 Google Cloud,甚至包含被標記為不應開啟的檔案與已刪除的機密資訊。SpaceXAI 已關閉此功能並表示已刪除所有先前上傳的資料,Elon Musk 稱隱私設定會被尊重,但仍鼓勵保留資料協助除錯。
速報
研究以物件為中心的 SPOT 表示於機器人抓取任務,結合 DINO ViT 與 Slot Attention,於 ManiSkill3 PickCube-v1 測試中,成功率達 55%,較傳統全局特徵提升 22%。進一步加入 2D 空間目標與原始解析度渲染,整體表現提升至 68.7%,接近 3D 先驗上限。同時,失敗類型分析指出遮蔽是主要瓶頸。
速報
人工智慧在科學探索受限於結構化知識缺乏。研究團隊打造自主科學知識生成框架,結合本體導向取得、混合抽取與語意融合,將文獻轉為 AI 可用的統一知識庫。以電光材料為例,從千篇文獻抽取八篇,產出 29 筆結構化記錄並匯整為 7 筆標準化資料,展示完整轉換流程與保留實驗細節的能力。
速報
隨著 AI 代理人在共享環境中競爭獎勵,容易出現為了個人利益而損害集體的行為偏差。本研究提出一套強健的規範執行機制,透過持續估計代理人的可靠度,並針對重複違規行為實施遞增處罰,以防止代理人利用機制漏洞獲利。實驗證明此方法能有效抑制違規行為並降低執行成本,為未來大規模管理 AI 代理人行為提供了可擴展的技術路徑。
速報
針對多代理人系統的閉環協調問題,本研究提出 FCMS 記憶體系統架構。該架構導入機制導向智能 MBI 處理代理人更新,並利用耦合記憶體圖形處理 CMGP 將環境視為物理基質紀錄軌跡。研究證明在特定可計算閾值下,系統可達成全局穩定性,揭示了記憶體耗散必須快於反饋增益的關鍵原則,為未來 AI 協調系統提供理論基礎。
速報
系統性文獻回顧需大量蒐集與合成證據,手工製表耗時。SLIDERS 用大型語言模型自動生成證據表,抽取結構化資料與全文摘錄,並以自動對齊代理整合跨文件資訊、解決衝突,支援自然語言追問。測試在600萬至1100萬詞語料上正確率近90%,追問正確率分別為77.9%與58.3%。