深度分析
全雙工語音代理人評分實驗:Gemini 2.5 Flash 與人工評分的秩相關度分析
本研究探討Gemini2.5Flash大型語言模型能否在全雙工客服語音代理人中取代人工評分,使用209場雙聲道對話與57段擾動音檔,結果顯示在五項指標上與三位人工評審的相關性相當,兩項略低,唯一一項幾乎無相關。部署時建議對音訊清晰度低於4分的通話交由人工審核,以免排序偏差。
深度分析
本研究探討Gemini2.5Flash大型語言模型能否在全雙工客服語音代理人中取代人工評分,使用209場雙聲道對話與57段擾動音檔,結果顯示在五項指標上與三位人工評審的相關性相當,兩項略低,唯一一項幾乎無相關。部署時建議對音訊清晰度低於4分的通話交由人工審核,以免排序偏差。
深度分析
研究以真實STEM課程逾百筆提問為樣本,評估多代理教學(3專家並行+合成器)在Vertex AI三種吞吐層級的延遲與成本。結果發現Priority PayGo於整體併發範圍維持穩定低延遲,Provisioned低併發最短但於高併發出現飽和,建議依流量可預測性選擇層級。