深度分析 SLMJury:小型語言模型在自動評分中的效能與成本平衡分析 本研究針對小型語言模型作為評分裁判進行系統性測試,提出SLMJury框架以10與8192兩種預算評估16款0.6B‑14B模型,發現快速判斷在數學任務表現優於深度推理,而在一般推理任務則相反,且小模型在抗干擾測試中變異不超0.55%,顯示可在成本與效能間取得平衡。