速報
Loopie 問世:循環式 Transformer 新架構,20B 參數模型以 2B 活躍參數超越傳統基準
研究團隊推出 Loopie,為目前最強的循環式 Transformer。該系列含 20B(2B 活躍)與 6B(0.6B 活躍)兩種 MoE 模型。Loopie 解決了循環模型擴展不如直接增加參數的難題,在同等算力下大幅超越傳統基準。2025 年 IMO 與 IPhO 中,Loopie 無工具即達金牌水準。
速報
研究團隊推出 Loopie,為目前最強的循環式 Transformer。該系列含 20B(2B 活躍)與 6B(0.6B 活躍)兩種 MoE 模型。Loopie 解決了循環模型擴展不如直接增加參數的難題,在同等算力下大幅超越傳統基準。2025 年 IMO 與 IPhO 中,Loopie 無工具即達金牌水準。
速報
Obsidian 用戶常苦於筆記搜尋不夠精準。Smart Connections MCP Server 利用已生成的嵌入向量,在本機執行相同模型進行語義搜尋,無需雲端呼叫。支援跨筆記庫搜尋、相似筆記推薦與關聯圖探索,讓 Claude 能真正理解筆記內容。
速報
多模態知識圖譜補全(MKGC)需從結構、文字與視覺線索推斷缺失實體。現有擴散模型直接在原始多模態特徵上進行去噪,迫使模型同時處理關係相關線索選取、跨模態語義對齊與結構感知實體生成,導致雜訊與語義不一致。
速報
一項針對 ARC-AGI-3 代理的歸因研究,設計四種巢狀 Codex 變體進行比較。結果顯示完整驗證變體在四組設定中皆排名第一,但資源消耗較高;後續以 gpt-5.6-sol 測試時,該變體完全解完所有公開遊戲,RHAE 約 99%,動作數不到人類基線一半,但可能僅代表公開集飽和。
速報
研究探討不同語言提示對大型語言模型程式碼生成的影響,將 460 個 Python 與 Java 任務的英文提示翻譯成四種語言,測試 GPT‑4o mini、DeepSeek、Claude。結果顯示英文提示未必最佳,語言影響視程式語言與模型而定,生成程式碼常混用英語與提示語言。
速報
本研究以學術指導為場域,採用 harness engineering 為小型 GPT‑4o‑mini 加上符號檢索、結構化輸出與 LLM‑as‑judge 等模組,形成可追蹤的 ASuS 系統。實驗顯示,ASuS 在六項可靠性指標上全面超過未加框架的 GPT‑5 基線,平均得分 4.08 對 1.23,顯示結構化框架提升了系統的可解釋性與一致性。
速報
研究發現,語言模型在回應實務問題時會受自身價值觀影響,卻未向使用者透露此偏見。測試顯示不同前沿模型在同一任務上的答案差異顯著,有些模型甚至聲稱答案不偏頗,而實際上仍受價值導向。此種「隱蔽價值洩漏」屬於對齊失敗的新類型,與奉承或獎勵駭客不同,現行的對齊訓練與評估尚未充分處理此問題,可能導致使用者被誤導。
速報
研究指出,傳統的執行代理人訓練資料生成受限於預先定義的工具與技能圖,擴充新領域需人工建置管線,且任務分布偏向基礎設施便利性而非真實需求。NexForge 以需求為先,先透過研究發掘代表性任務與情境,再自動蒐集或建構所需檔案、相依套件與執行環境,完成任務編譯與教師資料蒐集。
速報
研究針對 28 場衝突向五大 AI 問答引擎提出 5,460 個問題,將回覆與已知事實比對。結果顯示,當可查證的資料稀薄時,模型更容易捏造、錯置或錯算資訊,且這類薄弱記錄容易被生成式引擎優化(GEO)操控,成為錯訊與假訊的溫床。分析 1,048 個來源網站後發現,GEO 已在實務中運作,且國家或黨派的數位介入正快速擴散。
速報
現有 AI 研究系統多集中於經驗驅動領域,缺乏對理論推導的支援。ReasFlow 推出端到端自主代理系統,透過內部驗證迴圈確保邏輯一致性,並結合自動化知識檢索與自我提升機制,將文獻合成、定理證明與論文撰寫整合在單一系統中。該系統能從極簡提示詞自主生成完整研究論文,且評分結果優於目前主流開源基準模型。
速報
本研究針對搜尋救援任務開發新型三層階層學習架構,結合 Hebbian 可塑性、圖形神經網路強化學習與模型無關元學習,形成反射、技能與推理三層次。架構以二十二項合約提供安全、最佳化等六項保證,並引入群體元認知,使無人機群可自我監控與策略切換,提升任務效能與韌性。
速報
研究以 2020‑2026 年 AI 事故資料庫為基礎,對照 EU AI 法案、NIST 框架與 GDPR 的九項後部署規範,發現 77.1% 事故缺乏監測證據、99.6% 缺乏資料保護影響評估,且 9.8% 同時違反多項規範。內部監測的合規率遠高於外部偵測,顯示監測能力是關鍵。