深度分析 利用 CUDA 串流與事件實作非同步持續批次,提升大型語言模型推論效能 隨著大型語言模型推論需求提升,傳統的同步批次會讓CPU與GPU交替閒置,造成近四成的效能損失。透過CUDA非同步串流將批次準備與計算平行化,使用三條獨立串流與事件同步,可將推論時間縮短約24%。此改寫不需改變模型或新增核,僅靠硬體協調提升效能。