深度分析
模型合併 vs 聯合多任務強化學習:任務向量幾何分析揭示兩者表現無顯著差異
一項研究在 AppWorld 基準上比較模型合併與聯合多任務強化學習,發現合併後的專家模型在任務目標完成率上與聯合訓練模型無統計差異。任務向量幾何分析顯示專家向量近乎正交,導致支援集或符號合併方法退化為均勻平均。結果表明在該設定下合併足以匹敵聯合訓練,但需注意指標敏感性。
深度分析
一項研究在 AppWorld 基準上比較模型合併與聯合多任務強化學習,發現合併後的專家模型在任務目標完成率上與聯合訓練模型無統計差異。任務向量幾何分析顯示專家向量近乎正交,導致支援集或符號合併方法退化為均勻平均。結果表明在該設定下合併足以匹敵聯合訓練,但需注意指標敏感性。
深度分析
隨著大型語言模型向文件理解延伸,解析多樣版面成關鍵挑戰。Infinity-Parser2 結合可控合成引擎與八任務聯合強化學習,打造 500 萬筆雙語資料集,同時優化版面、表格與公式解析。測試顯示其 Pro 版在 olmOCR-Bench 取得 87.6% 與 ParseBench 74.3% 新紀錄,凸顯跨任務學習效益。