深度分析
VideoSEMA:以 Mamba-like 結構優化視訊理解的運算效率
針對視訊理解中運算成本過高的挑戰,研究團隊提出 VideoSEMA 模型。該技術採用空間-時間分離注意力框架,在空間端導入類 Mamba 的 SEMA 模組以降低複雜度,時間端則維持標準注意力機制。實驗顯示,VideoSEMA 在 K400 與 SSv2 數據集上的準確率優於同規模的 Transformer 與 Mamba 模型,且能更穩定地處理高解析度視訊輸入。
深度分析
針對視訊理解中運算成本過高的挑戰,研究團隊提出 VideoSEMA 模型。該技術採用空間-時間分離注意力框架,在空間端導入類 Mamba 的 SEMA 模組以降低複雜度,時間端則維持標準注意力機制。實驗顯示,VideoSEMA 在 K400 與 SSv2 數據集上的準確率優於同規模的 Transformer 與 Mamba 模型,且能更穩定地處理高解析度視訊輸入。
深度分析
本研究探討低頻(<20 kHz)聲波對商用相機的機械共振效應,證實此類聲學干擾能破壞影像穩定機制,導致 YOLOv11 等物件偵測模型出現誤判、遺漏或虛假偵測。實驗以不同頻率掃描找出 20‑30 Hz 與 155‑180 Hz 為高危共振頻段,偵測率下降近 10%。
YOLO
本研究針對足球比賽影片開發電腦視覺分析系統,結合目標偵測、SAM2 分割與關鍵點 CNN 模型,利用同質映射將相機座標轉為實際場地座標,最終產出球員速度、跑動距離與熱點圖等戰術指標,為教練提供可操作的數據。