深度分析
LLM 評審與人類讀者對假新聞評估的系統性鴻溝:代理有效性研究
大型語言模型(LLM)生成假新聞的風險評估,常以 LLM 評審代替人類讀者。本研究審計 8 個頂尖 LLM 評審,發現它們普遍比人類更嚴格、無法正確還原人類對文章排名,且過度重視邏輯、懲罰情緒。評審間一致性高於與人類的一致性,顯示內部共識不代表有效代理人類反應。
深度分析
大型語言模型(LLM)生成假新聞的風險評估,常以 LLM 評審代替人類讀者。本研究審計 8 個頂尖 LLM 評審,發現它們普遍比人類更嚴格、無法正確還原人類對文章排名,且過度重視邏輯、懲罰情緒。評審間一致性高於與人類的一致性,顯示內部共識不代表有效代理人類反應。
深度分析
零售業對話式 AI 代理人需要超越單純文字比對的評估方式。本研究提出 GenAI Evaluation 治理管線,利用 LLM-as-a-judge 實現多維度自動評分,並導入選擇性重新評估機制以降低計算成本並提升完整度。透過對 200 萬筆真實對話紀錄的測試,分類任務 F1 分數達 0.93,證明該框架能提供可審計且可擴展的品質監控方案。
LLM-as-a-judge
大型語言模型在心理健康諮詢中容易產生幻覺與遺漏,而傳統 LLM-as-a-judge 方法準確率僅 52%。研究團隊提出新框架,結合人類專家經驗與 LLM 提取特徵,從五個維度檢測幻覺與遺漏,顯著提升檢測率與透明度,為高風險醫療 AI 應用提供更可靠的評估基準。