多語言提示影響大型語言模型程式碼生成:GPT‑4o mini、DeepSeek、Claude測試
研究探討不同語言提示對大型語言模型程式碼生成的影響,將 460 個 Python 與 Java 任務的英文提示翻譯成四種語言,測試 GPT‑4o mini、DeepSeek、Claude。結果顯示英文提示未必最佳,語言影響視程式語言與模型而定,生成程式碼常混用英語與提示語言。
大型語言模型(LLM)在相同程式設計任務上,使用不同自然語言提示會產生不同的程式碼,這種現象稱為語言偏見。過去多聚焦於一般文字生成,對程式碼品質與編程慣例的影響則少有探討。
研究方法
研究團隊挑選 460 個程式碼任務,平分為 Python 與 Java(各 230 件),原始提示為英文。團隊將這些提示翻譯成中文、印地語、西班牙語與義大利語,並人工校正以保留技術意涵。
三款 LLM——GPT‑4o mini、DeepSeek、Claude——分別接受各語言提示,產出程式碼後以以下面向評估:
- 功能正確性:測試通過率。
- 結構品質:使用已建立的程式碼度量指標。
- 靜態分析:檢測潛在問題。
- 詞彙特徵:辨識識別子與註解中使用的語言。
主要發現
(i)英文提示並未 consistently 產出最高的功能正確性或程式碼品質;
(ii)提示語言的影響取決於程式語言與使用的 LLM,某些組合在特定語言下表現較佳;
(iii)生成的程式碼常在註解與字串常值中混用英語與提示語言,形成語言混雜現象。
意涵與未來方向
此研究提供了首個多語言程式碼生成基準,讓研究者能系統性探討語言偏見對程式碼品質的影響。未來可據此設計更具韌性的多語言程式碼生成系統,減少語言混雜與品質波動。
延伸閱讀
- Stable Audio 3 技術剖析:SAME 自編碼器、變長潛在擴散與對抗式後訓練
- 零樣本語音克隆呈現風格轉移:實驗證實同質化與信任效應
- ReasonAudio 資料集:評估文字→音訊檢索的邏輯與時間推理能力
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。