深度分析
累積訊息效應 (AMEL):大型語言模型判斷偏差的實驗分析與實務因應
隨著大型語言模型被廣泛用作程式碼審查、內容審核等自動評分工具,研究者發現先前對話的正負評價會顯著影響模型的後續判斷,稱為累積訊息效應(AMEL)。實驗示例,負向歷史比正向歷史產生約1.6倍的偏差,且在不確定的題目上偏差更大。建議在高風險評估時使用全新上下文或平衡批次,以降低此偏誤。
深度分析
隨著大型語言模型被廣泛用作程式碼審查、內容審核等自動評分工具,研究者發現先前對話的正負評價會顯著影響模型的後續判斷,稱為累積訊息效應(AMEL)。實驗示例,負向歷史比正向歷史產生約1.6倍的偏差,且在不確定的題目上偏差更大。建議在高風險評估時使用全新上下文或平衡批次,以降低此偏誤。
大型語言模型
研究以三份線上調查作為基礎,將受訪者的網路、人口與態度特徵餵入大型語言模型,模擬錯資訊信念與分享行為。結果顯示模型能捕捉分佈趨勢,卻系統性放大信念與分享的關聯,且忽略個人網路特徵。此偏差顯示LLM在社會科學模擬上的限制,適合用於辨識與人類判斷的差異。