速報
Incognita 框架揭示社會分散任務環境的 AI 行為與成功率
研究結合了具備可執行動作與持續狀態的基礎測試與語言代理人互動的社會模擬,提出 Incognita 框架,將社會互動與具體執行分離。框架內部將訊息路由至使用者或專家,專家審核後交由確定性子環境執行,最後由離線評估器給予獎勵。
速報
研究結合了具備可執行動作與持續狀態的基礎測試與語言代理人互動的社會模擬,提出 Incognita 框架,將社會互動與具體執行分離。框架內部將訊息路由至使用者或專家,專家審核後交由確定性子環境執行,最後由離線評估器給予獎勵。
深度分析
隨著大型語言模型廣泛應用,傳統參考答案評估成本高且難以因應變動事實。研究提出TALE框架,讓模型透過工具自動搜尋、彙整外部證據來驗證回應。實驗顯示其在自由問答基準上與人類評分高度一致,提升評估可靠性。此方法減少對模型內部知識的依賴,並能即時因應快速變化的資訊,預示評估流程將向自動化與證據導向轉型。