深度分析 CuraWeb:多重訊號驅動的資料篩選框架,兼顧品質與多樣性 大型語言模型(LLM)的預訓練資料品質至關重要,但現有篩選流程(如 FineWeb-Edu、DCLM)過度專注單一品質指標,導致資料分布狹窄、長尾知識流失。為解決此問題,研究團隊提出 CuraWeb 框架,將傳統線性篩選轉為品質、冗餘度與多樣性的聯合最佳化。