速報
Psych LM:在地運算的記憶語料庫與檢索增強生成架構
Psych LM為一個在iOS上驗證性的示範應用,提出以本地執行語言模型配合專用的本地優先執行環境,解決情感導向支援對長期脈絡的需求。系統將對話自動轉換為結構化的記憶卡(事實、目標、事件),並以語義向量檢索動態注入提示,達成近乎無限的脈絡感知。
速報
Psych LM為一個在iOS上驗證性的示範應用,提出以本地執行語言模型配合專用的本地優先執行環境,解決情感導向支援對長期脈絡的需求。系統將對話自動轉換為結構化的記憶卡(事實、目標、事件),並以語義向量檢索動態注入提示,達成近乎無限的脈絡感知。
速報
本報導說明一項針對不完全資訊博弈的樹搜尋新法MAPLE(Multi-State Aggregated PoLicy Evaluation)。MAPLE在單一搜尋樹內,對多個從信息集中抽樣的世界狀態進行策略與價值評估的匯總,結合了PIMC與IS-MCTS的優勢,同時將計算成本保持在可控範圍。
速報
面對大語言模型在邏輯推理可靠性上的疑問,研究提出LGMT(Logic-Grounded Metamorphic Testing)。該方法以一階邏輯推導出語意等價的變換關係,生成語意不變的測試案例,並透過跨案一致性檢驗來偵測推理缺陷。實驗發現LGMT能揭露傳統以參考答案為基準的評測忽略的問題;
速報
從學術 PDF 擷取結構化資料不易,單頁常混合自由文字與表格,還會受 Unicode 編碼影響。本研究以印尼高教的選課表(KRS)為案例,比較三種策略:純 LLM、正規表達式+LLM 的混合決定性流程,以及以 Camelot 為主、LLM 備援的管線。
速報
後設異常檢測是可靠機器學習的關鍵挑戰。論文提出以Bregman散度為基礎的理論框架,將密度估計擴展到指數族分布,並提出ConjNorm方法,以尋找最佳範數係數p,透過重要性抽樣解析估計配分函數。實驗在CIFAR-100與ImageNet-1K上的FPR95顯示顯著提升。
速報
前沿人工智慧團隊以「模型規範」設定語言模型期望行為。本研究提出模型規範中期訓練(MSM):在預訓練後、微調前以合成文件教授規範內容,塑造模型從示範資料的泛化方向。應用於自我保存與目標護衛規範時,Qwen3-32B的代理性錯誤率由54%降至7%,優於一項推理式基準14%。
速報
研究指出大型語言模型偏重生成合乎分配的後續文本而非驗證與來源是否一致。本研究提出以對齊拓撲構建參考與輸出之二分圖,並用圖神經網路透過訊息傳遞學習對齊結構。實驗在四組幻覺與問答資料集上達到最新領先表現。其方法優於包括GPT-4o在內的現有比較方法。
速報
定價談判因買方偏好隱藏而具挑戰性。研究提出PrefBench,一個模擬器基準,將賣方限制為回傳嚴格JSON動作並隱藏買方變數。作者在7,500個回合測試零-shot大型語言模型,模型成交率超過0.99但利潤表現弱於簡單讓步啟發式。表明結構化動作與高成交率不等於利潤最優。
速報
研究問:文明能持續做多少等級的計算?作者提出認知卡達謝夫尺度,以總功率、投入比率、能量轉運算效率與腦等價處理率四項參數估算人工智慧級別。以2024–2026年硬體效率為基準,指出當代人類接近行星級運算,恆星級則超出直覺想像。此外,誰能取得資源將比能效或能量更關鍵。
速報
大型人工智慧系統面臨有限GPU與頻寬分配問題。研究提出可計算公平分配(CFD),把Boltzmann-Softmax當成機率性資源分配機制,並將逆溫參數β作為可控變數以調節效率與公平。動態上以AHC++依據主導性偏差實時調整β;模擬顯示在外部衝擊下可抑制極端壟斷,代理數增100倍時執行時間增5.5倍。
速報
大型語言模型已被用於撰寫軟體、法律文件與臨床紀錄,但計算能力受圖靈、阿羅及無免費午餐定理等基本限制。研究提出確定性地平線(Deterministic Horizon)理論,主張極限由模型架構決定,可在部署前由層數與嵌入寬度預估;在多個Transformer架構中觀察到關鍵推理深度介於19到31。
速報
ArXiv 提出 Research Math Agents(RMA),一套專為研究級數學問題設計的代理人化自動推理框架。RMA 將證題求解拆解為問題分析、文獻檢索與理解、公平比較、知識庫建構與證明驗證等專責模組;