深度分析
APEX 資料導向提升大型語言模型提示工程效能的實驗分析
大型語言模型對提示詞極為敏感,研究者提出 APEX 框架,以動態將測試資料分為 Easy、Hard、Mixed 三層,聚焦於 Mixed 層的可改進訊號,並同時優化突變與選擇流程。實驗在 5,000 次評估預算下,於 IFBench、SimpleQA Verified 與 FACTS Grounding 基準上,分別在 Gemini 2.5 Flash 提升 11.2%、在 Gemma 3 27B 提升 6.8%。此資料導向方法顯示提升提示詞效能的關鍵在於智慧選取樣本,而非僅增強演化演算法本身。