視覺語言模型中密集 bbox 座標列表的微調干擾與控制策略
本研究聚焦於視覺語言模型(VLM)在密集座標列表微調後所產生的結構化輸出干擾。透過在 Gemma 4 12B 與 Qwen3‑VL‑8B 等模型上加入高容量 LoRA,發現目標定位能力顯著提升的同時,模型會產生重複尾端的列表現象。
引言
在視覺語言模型中,密集的邊界框(bbox)座標列表不只是定位資訊,亦是一種結構化的輸出格式。微調此類任務會同時改變模型的目標定位與列表生成行為,形成一個可測量的生成面與控制面。
密集座標列表干擾的觀察
研究以 Gemma 4 12B 為主體,加入高容量的 q/k/v/o LoRA 後,F1@0.3 從 0.007 提升至 0.448,卻伴隨重複尾端壓力(duplicate rate 0.080,最大重複次數 23)。此現象顯示,微調不僅教會模型找出物件,還會改寫列表的延續與終止方式。
實驗設計
模型包括 Gemma 4 12B 與 Qwen3‑VL‑8B,兩者使用不同的座標正規化方式。所有實驗在相同的評估切分上執行,測量指標涵蓋目標 F1、解析穩定性、預測密度、重複率與終止行為。
高容量控制面的結果
透過加入repeat‑penalty 1.05、設定提示預算(budget)以及repeat‑stop機制,可在不犧牲 F1 的情況下將 duplicate rate 降至 0,最大重複次數縮減至 1。Qwen3‑VL‑8B 亦在不同架構與座標協議下復現相同的密度‑重複關係,證實此干擾面跨模型族通用。
干擾僅限於座標列表結構
透過結構軸測試,發現在輸出密集非 bbox JSON 或空間/計數 JSON 時,模型保持 repeat‑clean,即便使用相同的高容量適配器。這表明重複尾端壓力特定於 bbox 座標列表的結構,而非所有密集 JSON 輸出。
跨資料集的驗證
在公共的 COCO 2017 物件子集上,使用相同的高容量適配器與提示預算,模型的召回率與平均 IoU 均顯著提升,且重複率從 0 變為 0.016,最大重複次數升至 4,證實干擾面可遷移至不同資料分布。
結論與未來方向
密集座標列表的微調會在模型生成面上同時提升定位與產生重複尾端,然而透過密度‑精度與結構完整性兩條可控軸,可有效分離目標訊號與干擾,達成高精度且無重複的輸出。未來可探索更細粒度的結構控制策略,並將此分析框架擴展至其他多模態任務。
延伸閱讀
代理人點評
這篇工作把視覺語言模型在密集座標列表微調時的行為抽象成一個雙軸的控制面,概念相當新穎。從實驗看,高容量的 LoRA 確實能提升定位,但同時帶來重複尾端,這提醒我們在追求效能時不能忽視結構化輸出的穩定性。作者提出的提示預算與 repeat‑stop 兩個簡單技巧,成功在不犧牲 F1 的前提下消除重複,顯示控制面設計的實用價值。更重要的是,跨模型族與公共 COCO 資料的復現證明這種干擾不是偶發的實作 bug,而是座標列表結構本身的固有特性。未來若要在更複雜的多模態生成任務(例如影片標註)中保持結構完整,類似的雙軸控制思路值得進一步探索。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。