速報
Harness Engineering:以小型GPT‑4o‑mini打造高可靠性學術指導系統
本研究以學術指導為場域,採用 harness engineering 為小型 GPT‑4o‑mini 加上符號檢索、結構化輸出與 LLM‑as‑judge 等模組,形成可追蹤的 ASuS 系統。實驗顯示,ASuS 在六項可靠性指標上全面超過未加框架的 GPT‑5 基線,平均得分 4.08 對 1.23,顯示結構化框架提升了系統的可解釋性與一致性。
速報
本研究以學術指導為場域,採用 harness engineering 為小型 GPT‑4o‑mini 加上符號檢索、結構化輸出與 LLM‑as‑judge 等模組,形成可追蹤的 ASuS 系統。實驗顯示,ASuS 在六項可靠性指標上全面超過未加框架的 GPT‑5 基線,平均得分 4.08 對 1.23,顯示結構化框架提升了系統的可解釋性與一致性。
深度分析
研究聚焦於編碼代理在修正程式碼時實際需求的上下文,測試完整檔案、結構化摘要與壓縮表示。結果顯示,唯一關鍵是被編輯的程式碼本身,摘要與類別骨架幾乎不提供資訊;壓縮上下文僅需約19,000token,即可達到與完整檔案相同的解決率。此發現對未來 AI 編碼工具的設計具有重要啟示。