深度分析
SemChunk-C 輕量化語意分割模型:提升 C 系語言程式碼檢索與生成效能
本篇報導聚焦於 SemChunk-C 系列模型,這是一套針對 C、C++、C# 等語系檔案的輕量語意分割工具。研究者先定義多種程式碼區塊類別,接著以大型語言模型產生標註資料,再以 17M 至 150M 參數的 Ettin 編碼器進行微調,使模型能自動辨識功能單位並附加屬性。
深度分析
本篇報導聚焦於 SemChunk-C 系列模型,這是一套針對 C、C++、C# 等語系檔案的輕量語意分割工具。研究者先定義多種程式碼區塊類別,接著以大型語言模型產生標註資料,再以 17M 至 150M 參數的 Ettin 編碼器進行微調,使模型能自動辨識功能單位並附加屬性。
深度分析
程式碼檢索是現代軟體開發的關鍵環節,然而既有基準多聚焦於語意或功能相關性,忽略了正確性、效率、安全性與可維護性等核心品質。CoQuIR 以 42,725 筆查詢與 134,907 筆程式碼片段,跨越 11 種程式語言,提供細緻的品質標註與兩項品質導向評分指標(PPA、MRS),首次系統性衡量檢索模型的品質感知能力。
深度分析
多語言檢索與長文件挑戰下,GraniteEmbeddingMultilingualR2以ModernBERT為基礎,推出97M與311M兩款模型,支援32K上下文與200+語言,在MTEB檢索基準顯著提升低參數模型表現並擴展程式碼檢索能力。