深度分析
「DharmaOCR」利用直接偏好最佳化降低 OCR 文字退化率
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。
深度分析
隨著OCR模型在實務部署中常出現文字重複迴圈的退化問題,DharmaAI提出將模型自產的失敗輸出作為拒絕樣本,透過直接偏好最佳化(DPO)二階段訓練。實驗顯示,五大模型族群的退化率平均下降59.4%,最高降至87.6%,且不影響辨識品質,為結構化生成任務提供可行的失敗抑制方案。
深度分析
一項由Dharma發表的實驗針對企業OCR任務比較了專門化小模型與大型通用API。研究透過分階段微調與對齊,將模型訓練歷史移向目標任務,並評估品質、成本與生產穩定性。結果顯示在該領域內,經過專門化的小模型在準確度、推理成本與文本退化率等面向均勝過多數商業前沿API,改變了採購與模型選擇的策略考量。