深度分析 Best‑of‑N TTS 推理之跨家族 ASR 評估偏差與 Rank Ensemble 效能分析 本研究探討Best‑of‑N TTS推理中,驗證器的評分會因所使用的自動語音識別(ASR)家族而大相逕庭。透過在LibriSpeech‑PC測試集上比較Whisper、wav2vec2.0與HuBERT等三大族系,提出跨家族排名集成與雙評估者三角測量,以降低WER並避免偏差。實驗顯示跨族集成可將平均WER降至1.61%,相較基線減少12%。