大型語言模型人工群聚:以LLM模擬群體智慧降低估算誤差
研究團隊以 960 筆手動提示,測試三款商業大型語言模型(GPT‑5、Gemini 2.5 Pro、Claude Sonnet 4.5)在八項估算任務中的內部抽樣與跨模型聚合效應。
研究團隊針對大型語言模型(LLM)是否能模擬人類群體智慧,進行了系統性實驗。實驗使用 960 筆手動執行的提示,涵蓋三款商業模型:GPT‑5、Gemini 2.5 Pro 與 Claude Sonnet 4.5,並在八項估算任務上測試同模型內部抽樣與跨模型聚合的效能。
實驗設計與方法
每項任務均以多次提示產生預測,然後分別採取單一模型內部的多樣本聚合(intra‑model)以及不同模型之間的結果合併(inter‑model)。聚合方式包括簡單平均與加權平均等策略,旨在觀察是否能降低預測誤差。
主要結果
結果顯示,無論是同模型抽樣還是跨模型聚合,都能持續降低平均絕對百分比誤差(MAPE),最高減少幅度達 37 個百分點。Spearman 相關係數在 0.242 至 0.568 之間,且全部顯著 (p<0.001),說明相對信心區間寬度與相對估算誤差呈正相關,暗示 LLM 在評估不確定性時具備一定的元認知意識。
實務與研究意涵
此研究證實,透過人工群聚的方式,LLM 可在決策支援與預測任務中提升準確性,為組織導入多模型或多樣本策略提供了實證依據。未來可進一步探索不同領域的聚合方法與成本效益,擴大 AI 驅動決策的應用範圍。
延伸閱讀
- SocioHack 基準:評估 RLHF 大型語言模型的獎勵與社會駭客行為
- Anthropic Opus 4.8 與 Fable 5 安全測試:適應式迭代攻擊成功率分別 11.5% 與 6.1%
- Anthropic Claude 提示注入測試顯示 31.5% 原始成功率與防護後 0.5%:業界安全基線解析
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。