深度分析 「UOJ‑Bench」評測大型語言模型的程式碼生成、破解與修復能力 研究以競程平台 UOJ 為基礎,推出 UOJ‑Bench 評測大型語言模型的程式碼生成、破解與修復能力。測試顯示即使單次推論模型仍無法發現超過半數錯誤;透過測試時間擴展可提升至 90% 以上,但計算成本高。此結果暗示 LLM 可成為判題系統的輔助工具,需權衡效能與資源。