深度分析 「DharmaOCR」利用直接偏好最佳化降低 OCR 文字退化率 研究針對 OCR 任務的文字退化問題,採用直接偏好最佳化(DPO)將模型自我產生的重複循環視為拒絕樣本,結合自動評分器形成偏好對。實驗在五大模型族群上皆降低退化率,平均減少 59.4%,最高達 87.6%。此方法顯示結構化生成任務可透過失敗輸出作為訓練訊號,提升可靠性。