深度分析 「ActiveVision」基準揭示大型多模態語言模型的主動視覺觀測瓶頸 研究指出人類視覺需主動觀測,推出 ActiveVision 基準測試大型多模態語言模型的迭代視覺推理能力。實驗發現即使最先進模型也只能正確解答約十分之一,且在多項任務上得分為零;相較之下三位人類受測者平均正確率達九十六點一百分比,顯示目前模型在主動觀測上仍有明顯不足。