速報
AI 生成兒童性侵內容的風險與防護:15 大未解挑戰
隨著生成式人工智慧技術的成熟,兒童性侵害的風險出現新變相。研究指出,AI 被濫用製作兒童性虐待影像、協助性剝削,且現有的安全機制因資料存取、透明度與評估方式受限,難以應對。本文分析了資料集審核、紅隊測試與微調防護等環節的技術瓶頸,並列出從資料蒐集、模型設計、部署到長期維護的 15 項關鍵問題。
速報
隨著生成式人工智慧技術的成熟,兒童性侵害的風險出現新變相。研究指出,AI 被濫用製作兒童性虐待影像、協助性剝削,且現有的安全機制因資料存取、透明度與評估方式受限,難以應對。本文分析了資料集審核、紅隊測試與微調防護等環節的技術瓶頸,並列出從資料蒐集、模型設計、部署到長期維護的 15 項關鍵問題。
速報
視覺語言模型(VLM)在多任務上表現優異,但大量視覺代幣的計算成本高企。研究者提出 TORINO(Token Reduction via Interpretable concept Overlap),透過稀疏自編碼器(SAE)將視覺代幣映射至可解釋的潛在空間,利用概念激活的重疊程度將語義相近的代幣分組,進而以剪枝或合併方式縮減代幣數量。
速報
目前的大型語言模型在推論時完全依賴輸入,缺乏內建記憶與自我調整能力。研究提出三項機制:結構張力作為內生損失函數,驅動模型向內部自洽;離線回饋迴路提供沙盒式自我處理循環,讓模型在無外部輸入下維持動態靜止電位;推論時可塑性允許在不改變預訓練權重的前提下重構上下文拓撲,並遵循可審計、可逆與拓撲連續性的治理規範。
速報
科學方程式發掘需要結合廣泛的領域先驗與嚴謹的數值驗證。傳統符號回歸提供數值基礎,但搜尋空間龐大;而多數語言模型系統直接讓模型產出或挑選公式。研究團隊測試了不同的角色分工,將大型語言模型設定為方程式作者、候選決策者或搜尋控制器,並與端到端語言模型及純數值基線比較。
速報
面對管理大量品牌時缺乏標準化流程的挑戰,開源專案 Digital Marketing Pro 提供了一套 AI 行銷插件解決方案。該工具整合 158 項技能與 25 個專家代理人,透過 12 階段策略流程與 61 個步驟的結構化分析,實現高效的品牌審計。此專案支援多種 AI 編輯器與 CLI 工具,並符合歐盟 AI 法案合規要求,讓行銷團隊能快速建立一致且可審計的行銷策略。
速報
針對 AI Agent 長期記憶管理困難,新專案 Memoria 推出類似 Git 的版本控制機制。該技術透過 MatrixOne 的 Copy-on-Write 實現記憶快照、分支與回溯功能,確保記憶數據完整性並降低 AI 幻覺。此舉讓 AI 代理的記憶狀態可被追蹤與稽核,為開發者提供更精確的長期上下文管理手段,提升 AI 應用的穩定性與可靠度。
速報
大型語言模型在邏輯推理基準上表現亮眼,但傳統評估僅使用靜態測題,無法檢驗模型在等價變形下的穩健性。研究團隊提出 LGMT(Logic‑Grounded Metamorphic Testing),利用一階邏輯的等價關係自動生成語意不變的測試案例,並以跨案例一致性比對檢測推理錯誤。
速報
針對 AI 程式助手是否能透過增加工具提升軟體品質,一項最新研究透過 90 次獨立運行構建即時回顧看板來驗證。研究測試了不同模型等級、推理努力程度及測試工具的影響,發現頂尖模型表現優異,而低成本模型得分較低。結果顯示增加測試工具僅提升成本而未改善功能,但提高推理努力能顯著提升首次成功率,顯示推理能力才是解決失敗的核心。
速報
研究團隊推出首個同時評測 Word、Excel、PowerPoint 的基準 OCB,分為結構視覺測試與跨領域專業問答兩條軌道。測試以原子化判斷方式由多個 LLM 評審打分,最先進系統在專業問答上僅達 59.3% 左右,提升深度效益有限,升級產品等級才有小幅提升。
速報
隨著大型語言模型在使用者端的應用日益增多,傳統僅依賴靜態個人檔案或文字訊號的個人化方法已無法捕捉使用者在不同領域查詢時的專業程度差異。研究團隊提出 ExPerT,一套以查詢為單位的個人化系統,透過同時解析查詢文字與打字動態,推斷使用者的領域專業度,並根據推斷結果調整回應的細節、術語與概念深度。
速報
研究團隊將遞迴特徵機器(Recursive Feature Machine, RFM)演算法結合探測器初始化,成功在數秒內於推理型與非推理型大型語言模型(如 Qwen 3、Qwen 2.5)中找出多維度的拒絕子空間。相較於傳統子空間抽取方法,RFM 不僅計算效率更佳,且在消融測試中表現更優。
速報
隨著 AI 原生應用的興起,購物體驗正從頁面與資訊流瀏覽轉向以意圖為導向的 LLM 代理人。現有的設計多將大型語言模型包裹在搜尋與推薦管線上,導致語意理解與商品空間執行之間出現斷層。為解決此瓶頸,研究團隊提出 ShopX,將意圖理解、執行規劃與基於語意 ID(SID)的商品操作統一於單一基礎模型。