Harness Engineering:以小型GPT‑4o‑mini打造高可靠性學術指導系統
本研究以學術指導為場域,採用 harness engineering 為小型 GPT‑4o‑mini 加上符號檢索、結構化輸出與 LLM‑as‑judge 等模組,形成可追蹤的 ASuS 系統。實驗顯示,ASuS 在六項可靠性指標上全面超過未加框架的 GPT‑5 基線,平均得分 4.08 對 1.23,顯示結構化框架提升了系統的可解釋性與一致性。
大型語言模型在單次提示下能產出流暢答案,但要將其作為領域決策系統的可靠元件仍相當困難。為縮短此落差,研究者提出 harness engineering——在 LLM 核心周圍有意設計決定性支架,如符號過濾、檢索、結構化 I/O、LLM‑as‑judge 迴路、人工介入門檻、持久狀態與稽核追蹤。
案例:學術指導系統
學術指導結合高風險建議、長期問責與結構化作業流程。研究比較了兩個系統:
- ASA:使用 GPT‑5 聊天機器人,未加入任何支架。
- ASuS:將較小的 GPT‑4o‑mini 包裹於 LangGraph 架構,加入符號‑語意檢索、結構驗證輸出、有限次重試的 LLM‑as‑judge、人工介入門檻、具決定性的加權風險評分與 LLM 敘事、以及每個節點的 SQLite 稽核追蹤。
評估以六個支架機制維度(落實、可解釋性、一致性、流程完整性、認知負擔、約束遵守)為基礎,採用盲測十位評分者的混合評分,並輔以 2×2 模型‑支架消融實驗。
主要結果
儘管基礎模型較小,ASuS 在所有維度上均優於 ASA。十位評分者的合併平均分為 4.08(ASuS)對 1.23(ASA),且 8 位評分者在 α=0.05 的配對 Wilcoxon 測試中拒絕虛無假設。消融實驗顯示,支架的結構性貢獻在模型規模上基本不受影響。
研究萃取出七種常見的 harness‑engineering 模式,認為在可靠性、可追溯性與機構一致性比開放式流暢度更重要的情境下,harness engineering 可挑戰「模型越大越好」的慣性思維。
延伸閱讀
- MORPHOGEN:以 GENFORM 衡量多語言大型模型的語法性別形態能力
- 以大型語言模型評估醫療回應完整性:方法、失敗模式與臨床限制
- WorldDB:以遞歸向量圖譜與內容可尋址結構建構長期代理記憶引擎
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。