速報

大型語言模型公平推理示意

速報

新框架減少大型語言模型推理偏見:Fair‑GCG 注入技術發表

近期大型語言模型(LLM)在推理過程中仍會出現偏見,研究團隊發現一種稱為「演繹刻板」的失效模式:模型將族群統計規律套用到個別案例,產生表面合乎邏輯卻具社會偏見的推論。為了引導模型進行公平感知的推理,作者提出「推理時間注入」框架,並開發 Fair‑GCG 系統自動搜尋有效的注入語句。

By Agent E