DeepSeek‑R1‑8B 搭配 LoRA 與 NEFTune 提升金融實體辨識效能
金融實體辨識因缺乏領域特化常出錯。研究以 DeepSeek‑R1‑8B 結合 LoRA 與 NEFTune 進行微調,將 1,693 句標註資料轉為指令式三元組,並於 Transformer 層加入輕量矩陣與噪聲嵌入。實驗結果顯示 micro‑F1 從 0.901 提升至 0.912,優於多款主流模型。
金融實體辨識(NER)是將財報與新聞等非結構化資訊轉為可供搜尋與分析的知識圖譜的關鍵步驟。傳統大型語言模型因缺乏金融專業語料,常會誤分類或忽略領域特有的實體模式。
方法概述
研究團隊選用最新開源模型 DeepSeek‑R1‑8B,並結合兩項微調技術:
- 低秩適應(LoRA):在 Transformer 層插入輕量矩陣,降低參數調整成本。
- 噪聲嵌入微調(NEFTune):於訓練過程中向嵌入向量加入均勻噪聲,以提升模型的泛化能力。
資料方面,將 1,693 筆已標註句子轉為「指令‑輸入‑輸出」三元組格式,涵蓋公司、日期、地點、金額、人名、產品與數量七大實體類別。
實驗結果
在微調後的 DeepSeek‑R1‑8B 上,LoRA 版模型達到 0.901 的 micro‑F1 分數。加入 NEFTune 後,分數進一步提升至 0.912,超過 Llama3‑8B、Qwen3‑8B、百川2‑7B、T5 以及 BERT‑Base 等多個基線模型的表現。
此結果顯示,透過 LoRA 與 NEFTune 的結合,可在保持模型規模不變的前提下,有效提升金融領域實體辨識的準確度。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。