Rust openinfer:純 Rust 與 CUDA 打造高效能 LLM 推論引擎 隨著大型語言模型需求激增,openinfer以純Rust與CUDA實作LLM推論引擎,拋棄PyTorch與框架跑時,支援Qwen3至兆參數Kimi‑K2,展現與主流開源推論框架相當的效能與可擴展性。完全使用Rust編寫,所有CUDA kernel與排程自行手寫,提供企業級部署的可行方案。