速報 BluTrain:全新 C++ 深度學習訓練框架提升效能與記憶體效率 深度學習大規模訓練的瓶頸在系統實作。BluTrain 以純 C++/CUDA 建構原生張量與自動微分模組,並加入分散執行與 MLIR 編譯器。實測在 8 顆 RTX 6000 Ada GPU 上,吞吐量 407K token/s、記憶體減少 22%,驗證損失略低於 PyTorch,顯示效能與資源利用雙贏。