深度分析
Google DeepMind 開源 Gemma 4 多模態模型:本地端與邊緣 AI 新里程碑
GoogleDeepMind推出的Gemma4系列多模態模型採Apache2開源授權,支援文字、影像與部分音訊,具長上下文與量化效能,已在多平台測試顯示31B版文字基準領先,預計提升本地端與邊緣AI部署易用性。此舉有望加速開源生態與嵌入式裝置的AI應用普及。
深度分析
GoogleDeepMind推出的Gemma4系列多模態模型採Apache2開源授權,支援文字、影像與部分音訊,具長上下文與量化效能,已在多平台測試顯示31B版文字基準領先,預計提升本地端與邊緣AI部署易用性。此舉有望加速開源生態與嵌入式裝置的AI應用普及。
深度分析
背景:大型語言模型的KV快取會隨上下文線性膨脹,造成記憶體與延遲瓶頸。做法:TTKV模擬人類記憶,將近期KV留在HBM高精度,舊KV壓縮並移至DRAM,使用區塊化串流注意力重疊傳輸與計算。結果:在128K上下文實驗,交叉層流量降約5.94×,延遲與吞吐皆顯著改善。