DeepSeek‑R1‑8B 結合 LoRA 與 NEFTune 提升金融實體命名辨識效能
金融領域的實體命名辨識(NER)對於將非結構化的財報與新聞轉換為結構化知識圖譜至關重要。一般的大型語言模型常因缺乏金融專業知識而誤分類或忽略領域特徵。
研究背景
金融報告與新聞多為非結構化文字,若能將其中的公司、日期、金額等資訊正確抽取,便能快速建構知識圖譜,提升資訊檢索與決策效率。傳統的大型語言模型因缺乏金融領域的專業語料,常出現實體誤分類或忽略特定模式的問題。
技術方法
本研究選用開源模型 DeepSeek‑R1‑8B,並採取兩項輕量化微調技術:
- Low‑Rank Adaptation(LoRA):在每層 Transformer 中插入低秩矩陣,僅調整少量參數以適應金融語境。
- Noisy Embedding Fine‑Tuning(NEFTune):訓練時向嵌入向量加入均勻噪聲,提升模型對未見樣本的泛化能力。
資料方面,我們將 1,693 句已標註的金融文本轉換為「指令‑輸入‑輸出」三元組,作為模型的微調資料。
實驗結果
在七大實體類別(公司、日期、地點、金額、人名、產品、數量)上測試,僅使用 LoRA 的 DeepSeek‑R1‑8B 即取得 0.901 的 micro‑F1 分數。加入 NEFTune 後,分數提升至 0.912,明顯優於 Llama3‑8B、Qwen3‑8B、百川2‑7B、T5 以及 BERT‑Base 等基線模型。
結論與未來方向
LoRA 與 NEFTune 的結合證明了在大型語言模型上以低成本微調即可顯著提升金融實體辨識效能。未來可擴展至更多金融子領域,或結合多語言資料進一步提升跨語言的實體抽取能力。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。