Reforge:以來源追蹤建立可靠的函式層級基準測試管線
大型語言模型在逆向工程的應用持續擴大,但編譯最佳化使二進位與原始碼對齊變得不可靠。研究提出 Reforge 管線,從 C 原始碼經 DWARF 解析到反編譯,建立函式層級真實值,並以八層信心篩選。測試顯示高信心函式比例隨最佳化下降,未考慮此因素會高估模型效能。
背景
大型語言模型(LLM)正被越來越多的安全研究者用於逆向工程任務,甚至直接嵌入即時的攻防工作流中。然而,現有的基準測試多把函式層級的真實值視為已解決的前置作業,卻未說明在最佳化後的二進位中有多少函式能可靠評估。
Reforge 管線
研究團隊開發了 Reforge,一套可追蹤來源的管線,從 C 原始碼編譯取得 DWARF 除錯資訊,接著進行語法抽取、對齊與反編譯,最終產出函式層級的基準真實值。對齊的不確定性被建模為八道信心門檻,並分為三層級的篩選。
微測試結果
在受控的微基準測試中,隨著編譯器最佳化等級提升,高信心可用函式的比例從 87.2% 降至 65.9%。若僅比較配對成功的函式,會因存活偏差(survivorship bias)而高估最佳化帶來的效能衰減。
LLM 函式命名評估
研究以七款當前主流的 LLM 進行函式命名測試,結果顯示,未考慮對齊不確定性的評估會誤導模型表現的判斷,凸顯在基準設計時加入不確定性意識的重要性。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。