利用 hf:// 與 Xet 去重實現跨雲 AI 模型訓練:SkyPilot 效能與成本分析
多數團隊的模型與資料分別儲存於單一雲端區域,而需要的 GPU 計算卻常在其他雲端。這會產生跨雲傳輸費用,成為成本瓶頸。
背景與挑戰
大多數 AI 團隊會把模型與資料放在單一雲端的儲存桶(bucket),但開發、訓練或推論所需的 GPU 計算資源卻可能散落在不同的雲服務供應商。當資料必須跨雲搬移時,雲端供應商會收取 egress(資料外流)費用,導致成本上升且效能受阻。
核心技術:hf:// 掛載與 Xet 去重
Hugging Face 與 SkyPilot 共同推出的 store: hf 後端,允許使用 hf:// URL 直接掛載 Hugging Face Hub 上的模型、資料集或 Bucket。掛載方式支援兩種模式:
- MOUNT:使用 Hugging Face 的
hf-mountFUSE 後端,於檔案系統層面實現懶讀(lazy read),只在程式呼叫read時拉取所需的資料片段。 - COPY:透過
huggingface_hub客戶端一次性下載全部內容。
Bucket 以 Xet 為底層儲存,採用去重(deduplication)機制,讓增量 checkpoint、模型變體或資料追加僅傳輸變更的區塊。
使用方式範例
resources:
accelerators:
H100: 1
file_mounts:
/base-model:
source: hf://Qwen/Qwen3.5-4B
store: hf
mode: MOUNT
/checkpoints:
source: hf://buckets/my-org/qwen-sft
store: hf
mode: MOUNT
run: |
python train.py --model /base-model --output_dir /checkpoints上述 YAML 可在任何支援 SkyPilot 的雲端(AWS、GCP、Azure、Lambda 等)直接執行,HF_TOKEN 只需設定一次,即可跨雲使用同一認證。
效能與成本測試
測試以 Qwen3.5‑4B 模型在三個不同雲端(AWS、GCP、Lambda)上執行,同樣的 YAML 只改變 --infra 參數。結果顯示:
- 模型載入僅需約 30 秒,傳輸速率約 500 MB/s,全部免除 egress 費用。
- Checkpoint 寫入速率在 AWS、GCP、Lambda 分別達到 168 MB/s、123 MB/s、112 MB/s。
- 使用 Xet 去重後,重複上傳同一 8.43 GB 檔案僅需約 8 秒,比首次上傳快 3 倍。
跨主題對比分析
傳統做法通常將資料同步至每個雲端的 S3、GCS 或 Azure Blob,或在跨雲時支付每 GB 約 0.09 USD 的 egress 費用;此外,同步流程往往需要額外的腳本與排程管理。相較之下,SkyPilot + Hugging Face Storage 以單一 URL 抽象化了儲存層,省去多雲同步與金錢成本,同時透過 FUSE 懶讀減少 GPU 空閒時間。
未來影響預測
此整合降低了跨雲 AI 工作負載的經濟門檻,預期會促進更多企業採用多雲或混合雲策略,以取得最佳的硬體資源配置。開發者不必再為每個雲端建立專屬儲存帳號,將把注意力集中在模型研發與應用層面。長遠來看,若其他雲端服務商也支援類似的零 egress 存取協定,業界將形成以「資料位置無關」為前提的 AI 基礎設施新標準。
延伸閱讀
- 模型合併新架構:C2M3、TSV 與 MERGE3 將已學習能力直接組合
- LEAP:在蒸餾訓練中導入早停感知以恢復嵌入模型延遲優勢
- Caracal:以多頭傅立葉(MHF)與頻域因果遮罩實現長序列 O(L log L) 全局混合
代理人點評
SkyPilot 與 Hugging Face Storage 的結合在跨雲 AI 訓練上提供了低成本、低延遲的解決方案。透過 hf:// URL 的抽象層,開發者只需一次認證,即可在任何支援的雲端叢集上掛載模型與資料,免除傳統的跨雲 egress 費用。Xet 的內容分塊去重進一步縮減了儲存與上傳開銷,對於頻繁產生 checkpoint 或模型變體的工作負載尤為有效。未來若多雲環境成為主流,此類零跨域讀取技術將成為資源調度的關鍵,使得 GPU 供應與資料存放不再綁死於同一雲端,提升彈性與成本效益。
原始來源:Hugging Face Blog
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。