深度分析 SemChunk-C 輕量化語意分割模型:提升 C 系語言程式碼檢索與生成效能 本篇報導聚焦於 SemChunk-C 系列模型,這是一套針對 C、C++、C# 等語系檔案的輕量語意分割工具。研究者先定義多種程式碼區塊類別,接著以大型語言模型產生標註資料,再以 17M 至 150M 參數的 Ettin 編碼器進行微調,使模型能自動辨識功能單位並附加屬性。