深度分析 WorkBench 基準測試:Claude Opus 4.8 以 89% 完成率領先,安全與成本同步提升 WorkBench基準評估工作代理人效能與安全。2026年以ClaudeOpus4.8完成89%任務,意外有害行為降至2.5%。顯示模型在能力與安全上同步提升,且開源模型成本大幅下降。從43%任務完成率提升至89%,有害行為從26%降至2.5%,同時開放權重模型使每次測試成本降低超過十倍。