深度分析
「DharmaOCR」利用直接偏好最佳化降低 OCR 文字退化率
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
一項由Dharma發表的實驗針對企業OCR任務比較了專門化小模型與大型通用API。研究透過分階段微調與對齊,將模型訓練歷史移向目標任務,並評估品質、成本與生產穩定性。結果顯示在該領域內,經過專門化的小模型在準確度、推理成本與文本退化率等面向均勝過多數商業前沿API,改變了採購與模型選擇的策略考量。