速報 GPTNT 基準測試:多人協作解炸彈挑戰揭露大型語言模型的合作盲點 隨著多模態模型被廣泛應用於人機協作,研究者以《Keep Talking and Nobody Explodes》開發 GPTNT 基準,測試兩代理人在時間限制與資訊不對稱下的即時溝通能力。結果顯示,現有大型語言模型無法即時拆除炸彈,顯示在狀態追蹤與錯誤恢復上仍有缺口,對未來協作 AI 發展具警示意義。