深度分析 「Rank‑Then‑Act」:利用視覺‑語言模型排序實現無獎勵強化學習新範式 本研究提出Rank‑Then‑Act(RTA)框架,利用視覺‑語言模型在洗牌影片上以群組相對政策優化學習進度排序,並以Spearman排序相關作為唯一獎勵,於離散與連續控制任務均達到或超越既有影片獎勵基線,顯示僅靠影片序列的序數訊號即可驅動政策學習。