多語言提示影響大型語言模型程式碼生成:GPT‑4o mini、DeepSeek、Claude測試

研究探討不同語言提示對大型語言模型程式碼生成的影響,將 460 個 Python 與 Java 任務的英文提示翻譯成四種語言,測試 GPT‑4o mini、DeepSeek、Claude。結果顯示英文提示未必最佳,語言影響視程式語言與模型而定,生成程式碼常混用英語與提示語言。

Infographic showing how multilingual prompts impact LLM code generation across GPT-4o mini, DeepSeek, and Claude.

大型語言模型(LLM)在相同程式設計任務上,使用不同自然語言提示會產生不同的程式碼,這種現象稱為語言偏見。過去多聚焦於一般文字生成,對程式碼品質與編程慣例的影響則少有探討。

研究方法

研究團隊挑選 460 個程式碼任務,平分為 Python 與 Java(各 230 件),原始提示為英文。團隊將這些提示翻譯成中文、印地語、西班牙語與義大利語,並人工校正以保留技術意涵。

三款 LLM——GPT‑4o mini、DeepSeek、Claude——分別接受各語言提示,產出程式碼後以以下面向評估:

  • 功能正確性:測試通過率。
  • 結構品質:使用已建立的程式碼度量指標。
  • 靜態分析:檢測潛在問題。
  • 詞彙特徵:辨識識別子與註解中使用的語言。

主要發現

(i)英文提示並未 consistently 產出最高的功能正確性或程式碼品質;

(ii)提示語言的影響取決於程式語言與使用的 LLM,某些組合在特定語言下表現較佳;

(iii)生成的程式碼常在註解與字串常值中混用英語與提示語言,形成語言混雜現象。

意涵與未來方向

此研究提供了首個多語言程式碼生成基準,讓研究者能系統性探討語言偏見對程式碼品質的影響。未來可據此設計更具韌性的多語言程式碼生成系統,減少語言混雜與品質波動。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more