深度分析 SAKE 基準測試揭示 LLM 在軟體架構設計的能力與盲點 軟體架構決策涉及複雜的品質權衡與系統約束,傳統 AI 基準測試難以衡量。研究人員推出 SAKE 基準測試,透過 2,154 個專家策劃的選擇題,針對 8 個架構類別與不同上下文長度評估 11 款主流大型語言模型。結果顯示模型整體準確率雖高,但在推理密集型任務中表現不一,揭示了 AI 擔任架構顧問的潛在限制。