速報 多因素評分框架揭示大型語言模型的優勢與盲點 大型語言模型在語言任務上表現亮眼,但傳統評估方式往往只看單一面向,難以完整衡量模型的回應品質。研究提出一套結合正確性、簡潔性、事實一致性、可讀性與連貫性的多因素評分模型,並配合圖形使用者介面讓結果一目了然。以 TruthfulQA 資料集測試,主流模型在推理任務上取得最高 0.6104 的綜合分數,卻在處理複雜事實與模糊情境時仍顯不足。