Transformer
Transformer 學習 Cubing:以 MCTS、SFT 與 DPO 強化 Cube-and-Conquer 的分割策略
SAT為關鍵且具挑戰性的問題。本文提出以transformer為基礎的神經符號後訓練框架,結合MCTS生成偏好資料與教師推理痕跡,採監督微調(SFT)再以直接偏好優化(DPO)精調。最終4B參數模型於100個競賽基準獲得pass@5=53,表現匹敵最佳符號啟發式。
Transformer
SAT為關鍵且具挑戰性的問題。本文提出以transformer為基礎的神經符號後訓練框架,結合MCTS生成偏好資料與教師推理痕跡,採監督微調(SFT)再以直接偏好優化(DPO)精調。最終4B參數模型於100個競賽基準獲得pass@5=53,表現匹敵最佳符號啟發式。
深度分析
超圖能表徵超出二元關係的高階互動,但現有方法多仰賴已觀察到的超邊傳遞訊息,無法辨識子集缺席所帶來的組成性差異。
深度分析
研究探討深度學習與非平衡化學中觀察到的相變現象,提出「驅動資訊系統」的雙場框架,將熵產生率與資訊準勢ΦI作為關鍵場。作者辨識兩個次序參數:對抗性崩解閾值與自參照耦合閾值,指出它們聯同表示複雜度構成普適類別,並提出三項可被檢驗的實驗預測。涵蓋從化學前生物選擇到 transformer 參數空間的案例比較,並指出此視角能區分單場理論的可行性。
深度分析
研究發現RoPE在Transformer長上下文存在根本性限制。隨著上下文長度增加,RoPE對位置的偏好與對詞彙的排序會變得不可預測。理論證明位置反轉與詞彙反轉的機率逼近一半,位置或詞彙替換可能不改變注意力分數。實驗於多個大型模型與延展技巧下皆現象一致,顯示需開發全新位置編碼機制以因應長上下文需求。
深度分析
一項研究提出以「融合—裂變」向量群體動力學模型,可在對話歷程中以可估算的基底向量預測 AI 何時偏離可取行為。方法把交談向量與「可取/不可取」兩類基底做群體競爭分析,跨模型、跨規模驗證準確。結果顯示此公式能提供實時預警,補強既有安全機制。可移植於多種ChatGPT類架構與應用場景。
深度分析
研究探討大型語言模型是否在生成文本時進行隱性規劃。研究用平均激活差向量介入中間激活,改變押韻與問答的最終詞生成;實驗以押韻詩與問答為例。結果指出自1B參數模型起顯著可觀察到規劃跡象,且可透過激活操控改變生成傾向,對模型控制與安全具指標性意義。
深度分析
本文驗證標準softmax-attentionTransformer可在前向傳遞中近似解高斯核kernelridgeregression;關鍵在於將softmax視為行歸一化的核矩陣運算,並以ReLUMLP處理token層的標量更新;理論與實驗皆顯示其行為與預條件Richardson迭代相符,並提供深度與寬度的誤差刻畫。
深度分析
研究提出首個針對GIMPLE與LLVMIR互譯的LLM模型IRIS‑14B,透過14億參數學習映射,較既有大型模型提升最高44%正確率,顯示資料驅動翻譯有望成為編譯器跨工具鏈新方案。此技術可減少手工規則維護成本,促進GCC與LLVM生態系統互補,並為未來神經符號混合編譯器提供可擴展的互通層。
深度分析
Mask2Cause以逆向變數嵌入與鄰接限制遮罩注意力在單次前向傳播中直接學習因果圖,支援均值與變異度因果,於多項基準測試中達到最高AUROC,且可將預測模型參數削減逾七成,顯示其在高維時間序列因果探索與模型壓縮上的優勢。與CUTS+、CausalFormer方法相比,Mask2Cause省去訓練成本。
深度分析
本文報導一項首度大規模的機制性研究,針對六種最先進的表格型轉換器(Tabular Foundation Models, TFMs)逐層分析推理過程。研究以表徵相似度、分離度、探測分類器與層級干預(跳層、重複、交換)等六類實驗,揭示多數模型在深度方向存在重複與迭代精煉現象,且早期層即可形成可用表徵。
深度分析
隨著AI影片生成模型快速崛起,成人內容的審查成為新挑戰。研究提出在CogVideoX擴散模型的去噪潛在張量上掛載輕量探測器,直接於內部表示即時判別。實驗顯示此方法在測試集達97.29%F1,且僅增加4‑6毫秒延遲,顯著優於傳統像素解碼後分類。
深度分析
隨著大型轉換模型在程式合成上展現高效能,研究以算術文法構建可控測試環境,指出多樣化語意與語法抽樣可提升外部分布表現,且純轉換模型在語法外推時跌超30%。研究亦發現,隨算力指數增長,效能提升僅呈對數線性關係,暗示僅靠規模擴大無法突破外推瓶頸。