深度分析 FormalASR:端到端中文語音直接生成正式書面文本的模型與實驗評估 自動語音辨識多以逐字稿為目標,難直接供文件使用。FormalASR 透過兩組 0.6B、1.7B 的端到端模型,將中文語音直接轉寫為正式書面語,免除後端大語言模型。實驗顯示相較於逐字基線,字元錯誤率降低最高 37.4%,且適合在裝置上部署,於 WenetSpeech‑Formal 與 Speechio‑Formal 測試中均有提升。