新穎預先註冊協議防止大型語言模型研究 p‑hack
大型語言模型(LLM)在資料生成與標註上越來越常見,但研究者可透過調整提示詞、解碼參數或輸出格式來進行 p‑hack,導致結果不可靠。研究團隊提出一套預先註冊實驗與可用模型的流程:先在現有模型上確定分析方法,將實驗計畫與未來可接受的模型清單公開登記,然後在登記後首個符合條件的新模型上執行確認分析。
大型語言模型(LLM)已廣泛用於產生、分類與註解資料,這些輸出常成為後續假說檢驗的基礎。然而,研究者可以藉由微調提示詞、解碼參數或輸出格式,讓模型產生符合預期的結果,形成所謂的 p‑hack。
預先註冊協議概述
為降低此類操控風險,研究團隊提出一套流程:首先在現有模型上完成實驗設計與分析計畫,接著公開登記此計畫以及一組未來可能使用的合格模型清單。之後,等到登記後首個符合條件的新模型發布時,直接在該模型上執行確認性分析。
此做法的關鍵在於,新模型在註冊時尚未存在,研究者無法針對其進行特別調整;同時,對一個模型有效的 hack 設定往往無法直接搬到另一個模型上。
實驗驗證
研究者在兩個真值已知的任務上測試此協議,涵蓋四家供應商的二十個模型與十一種 LLM 分析配置。結果顯示,協議能阻止約 73.9% 與 72.7% 的 hack 成功轉移。
進一步的壓力測試亦證實,該協議在多種情境下仍具顯著緩解效果。
自我驗證
研究團隊自行遵循此流程,先行登記實驗,然後在首次符合條件的新模型上執行。七個在先前模型上成功的 hack 中,有六個在新模型上失效,驗證了協議的實際效用。
延伸閱讀
- SocioHack 基準:評估 RLHF 大型語言模型的獎勵與社會駭客行為
- Anthropic Opus 4.8 與 Fable 5 安全測試:適應式迭代攻擊成功率分別 11.5% 與 6.1%
- Anthropic Claude 提示注入測試顯示 31.5% 原始成功率與防護後 0.5%:業界安全基線解析
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。