速報
以社會規範為基礎的 LLM 協調模型:行人與車輛互動突破
研究團隊以行人與車輛的動態互動為測試平台,從 3,456 例人類互動中抽取三大社會規範原則:結果可預測性、價值對齊與利益感知。將這些原則嵌入大型語言模型(LLM)後,模型在與人類的閉環協調任務中總得分提升近四倍,且比人與人互動高出 43%。
速報
研究團隊以行人與車輛的動態互動為測試平台,從 3,456 例人類互動中抽取三大社會規範原則:結果可預測性、價值對齊與利益感知。將這些原則嵌入大型語言模型(LLM)後,模型在與人類的閉環協調任務中總得分提升近四倍,且比人與人互動高出 43%。
速報
SpaceXAI 在公司上市後首次發布新模型 Grok 4.5,定位為可同時處理程式編寫、應用開發、辦公自動化、研究寫作等多種知識工作任務的「工作馬」型 AI。官方稱其具備雙倍的 token 效率,輸入代價每百萬 token 2 美元、輸出每百萬 token 6 美元,較競爭對手更具成本優勢。
速報
研究指出,當AI模型被限定執行特定任務時,會出現類似注意盲點的現象,抑制同時存在的安全訊號。實驗涵蓋放射科影像與自動駕駛文字,報告率最高下降0.92,且專屬排除指令可完全阻斷報告。此發現揭示評測安全與實際安全的脫節,呼籲採用完整報告評估以降低風險。
速報
視覺擴散模型在創意 AI 領域展現高品質、多樣化的生成能力,但也會記憶訓練資料,導致在推論時重現相似的概念、內容或風格,衍生出隱私、安全與版權等議題。本文系首篇系統性回顧,將相關研究分為三大類:揭露(偵測複製案例的方法)、理解(探討產生機制與影響因素)以及緩解(提出降低或消除複製的策略),並延伸討論醫療等實務領域的衝擊。
速報
研究者針對未來人工智慧代理人可能抗拒關機的風險,提出「POST-Agents 提案」。該提案要求訓練代理人只在相同長度的軌跡間滿足偏好(POST),並證明在結合其他條件下可導出「中立性+」原則:代理人在期望效用最大化時不考慮軌跡長度的機率分布。
速報
研究團隊針對在高頻寬超算叢集(如 NVIDIA NVL72/576、華為 CloudMatrix384)上部署 Mixture-of-Experts(MoE)模型時遭遇的三大通訊瓶頸,提出 UBEP(Unified‑Bus Expert Parallelism)通信函式庫。
速報
研究以Putnam社會資本理論為基礎,開發LLM多代理模擬平台SocaSim,結合社群網路、信任與規範演化,重現宏觀模式並解析微觀因果。結果顯示平台可在智慧長照情境下提供可解釋的過程分析。此方法亦為社會科學與計算科學的跨領域合作提供新範式。
速報
研究團隊開發了首個能在高度動態、具複雜物理互動環境中運作的多人世界模型。與傳統單人模型不同,它以多位玩家的行動序列為條件,能正確歸因場景變化並在任意組合動作下保持一致性。模型以 10,000 小時的公開機器人遊戲資料訓練,使用 5 億參數的潛在擴散架構,單顆 Nvidia B200 GPU 即可即時產生四人對戰,達到每秒 20 幀。
速報
音訊智慧涵蓋理解、推理與生成。研究團隊推出 Audex,採單一解碼器將音訊投射至文字嵌入,並統一處理文字與量化音訊 token,訓練資料逾 470 億 token。實驗顯示 Audex 在語音辨識、翻譯、語音合成等多項音訊任務上創下新紀錄,且保留文字模型的推理與長上下文能力,模型已開源供研究。
速報
本研究以四名開發者重建同一全端 Web 應用,分為三個階段:部分 AI 輔助(GitHub Copilot)、全 AI 工作流程(GitHub Copilot)以及全 AI 工作流程(AWS Kiro)。
速報
本研究重新檢視持續學習(Continual Learning, CL)的核心目標,指出過度追求知識保留可能阻礙在非靜態環境中的即時適應。
速報
隨著生成式人工智慧技術的成熟,兒童性侵害的風險出現新變相。研究指出,AI 被濫用製作兒童性虐待影像、協助性剝削,且現有的安全機制因資料存取、透明度與評估方式受限,難以應對。本文分析了資料集審核、紅隊測試與微調防護等環節的技術瓶頸,並列出從資料蒐集、模型設計、部署到長期維護的 15 項關鍵問題。