深度分析 LLM 評審與人類讀者對假新聞評估的系統性鴻溝:代理有效性研究 大型語言模型(LLM)生成假新聞的風險評估,常以 LLM 評審代替人類讀者。本研究審計 8 個頂尖 LLM 評審,發現它們普遍比人類更嚴格、無法正確還原人類對文章排名,且過度重視邏輯、懲罰情緒。評審間一致性高於與人類的一致性,顯示內部共識不代表有效代理人類反應。