CFDLLMBench
CFDLLMBench 基準:量化大型語言模型於 CFD 概念、程式碼與 OpenFOAM 工作流表現
隨著大型語言模型在自然語言處理上表現亮眼,研究團隊推出CFDLLMBench,針對計算流體力學設計三項測試:概念問答、程式碼生成與OpenFOAM工作流程自動化。實驗顯示模型在基礎知識題目上達逾九成正確率,但在程式碼與實際模擬任務的成功率僅約三至三四成,凸顯科學自動化仍面臨重大挑戰。
CFDLLMBench
隨著大型語言模型在自然語言處理上表現亮眼,研究團隊推出CFDLLMBench,針對計算流體力學設計三項測試:概念問答、程式碼生成與OpenFOAM工作流程自動化。實驗顯示模型在基礎知識題目上達逾九成正確率,但在程式碼與實際模擬任務的成功率僅約三至三四成,凸顯科學自動化仍面臨重大挑戰。
深度分析
隨著1–3B參數的小型語言模型能在本機執行,研究檢視是否透過模型串聯恢復程式碼生成能力。實驗以「生成→執行→精修」的執行回饋循環為核心,並以演化搜尋測試拓樸增益。結果顯示執行回饋大幅修正執行錯誤,複雜管線並未帶來顯著優勢。研究還指出,精修模型能力勝過生成器身分,且必須採用早停避免回歸。
深度分析
SpaceX與Cursor合作開發下一代編碼與知識工作人工智慧,並保留以六百億美元收購Cursor的選項。合作結合Cursor面向軟體工程師的產品與SpaceX宣稱的大型超級運算資源,短期可補強訓練與分發,但仍面對Anthropic與OpenAI等對手的模型競爭。
深度分析
受人類認知發展啟發,研究提出導師-學生多代理系統 PETITE,讓同一大型語言模型以非對稱角色互動,提升程式碼解題效能。學生代理產生並精進解答,導師代理提供結構化回饋,未使用真實答案。實驗顯示 PETITE 在 APPS 基準上與最先進方法相當,且 token 使用量顯著減少,顯示此角色分化策略具資源效益。