深度分析 視覺語言模型中密集 bbox 座標列表的微調干擾與控制策略 本研究聚焦於視覺語言模型(VLM)在密集座標列表微調後所產生的結構化輸出干擾。透過在 Gemma 4 12B 與 Qwen3‑VL‑8B 等模型上加入高容量 LoRA,發現目標定位能力顯著提升的同時,模型會產生重複尾端的列表現象。