深度分析
「DharmaOCR」利用直接偏好最佳化降低 OCR 文字退化率
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
大型語言模型在將自然語言翻譯成最佳化程式時常出現執行成功卻語意錯誤的沉默失敗。ReLoop結合四階段結構化生成與求解器參數擾動的行為驗證,能在模型內部即防止錯誤並在執行後捕捉遺漏,於五種模型與三項基準測試中將正確率從22.6%提升至31.1%,執行成功率達到100%。
深度分析
大型語言模型面對含糊請求時常自行選擇單一解讀,造成使用者不悅與安全疑慮。研究提出一次生成列舉多重意圖與答案的結構化回應,透過雙重強化學習同時提升含糊輸入的召回與明確輸入的精確。實驗證明此法在對話問答與語意解析上覆蓋率高於基線,並提升模型透明度與效率。