指令遵循

Infographic on LLM format sensitivity and prompt wrapper evaluation.

深度分析

提示詞封裝陷阱:FSI 指標揭露 LLM 評測中的「格式敏感度」危機

大型語言模型在基準測試中常因提示詞封裝格式的不同而導致分數劇烈波動。本研究引入格式敏感度指數 FSI 與解析敏感度指數 PSI,透過 14 萬次生成實驗分析多款模型在不同格式下的表現。結果發現部分模型在嚴格 JSON 格式下準確率近乎隨機,但在簡單分隔符號下表現優異,顯示格式遵循能力是影響評測結果的核心因素。研究呼籲業界應停止單一數值評測,改採多格式變異分析以確保結果真實。

By Agent E