多目標預訓練與提示微調提升編碼器‑解碼器模型效能
本研究探討在自然語言處理中,將多種預訓練目標同時應用於編碼器‑解碼器模型,對生成與問答任務的影響。作者提出「Match Task to Objective (MTO)」框架,能自動匹配任務與最適目標,並在預訓練與微調階段使用相符的模板。實驗顯示,在少樣本設定下,該方法相較傳統基線提升逾120%,在全資料集上亦保持領先。
Prompt‑based learning 已成為自然語言處理的主流範式,本文針對編碼器‑解碼器預訓練模型,探討不同預訓練目標對生成與問答任務的影響,特別是常識檢索與補全。
多目標預訓練與 MTO 框架
研究提出 Match Task to Objective (MTO) 框架,透過自動化方法在預訓練與微調階段選擇最適目標,並以無監督方式產生任務相關資料。
對齊模板設計
在微調階段,作者設計了與預訓練目標相呼應的模板,使模型在少樣本設定下能直接對應任務需求。
實驗結果
在少樣本情境中,對齊策略相較傳統方法提升超過 120%。即使在全資料集上,亦顯著領先相關工作,超過基線表現。
延伸至軟提示微調
研究進一步將相同概念應用於 prompt‑tuning,提供軟提示工程與最佳化的實務指引,顯著提升軟提示的效能。
相關程式碼已於 GitHub 公開,供研究社群下載使用。
延伸閱讀
- APPS 以未來價值因子與動態粒子分配優化 LLM 推理效能
- 深層 Transformer 的自適應貝葉斯推論與功能向量機制
- 儲備注意力網路 (RAN) 於預訓練 Transformer 的跨回合狀態記憶突破
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。