深度分析 AI 代理人基準測試:transformers CLI 與 Skill 對大型與小型模型效能比較 AI代理人逐漸取代手動編程,研究以transformers為例設計工具基準,測試CLI與Skill在不同模型上的表現,結果顯示大型模型效率提升,小型模型可能下降,提醒庫維護者兼顧各尺寸模型需求,此基準同時捕捉代理人執行流程、代碼行數與錯誤率,提供庫開發者調整API與文件的依據。