VibeThinker
開源小模型 VibeThinker‑1.5B/3B 透過 SSP 技術實現高效可驗證推理
WeiboAI於2025年開源VibeThinker-1.5B與2026年推出3B版本,採用Spectrum-to-Signal原則與多階段後訓練,結合監督微調、強化學習與自我蒸餾。實驗顯示1.5B在三項數學基準上超越400倍規模的DeepSeekR1,3B在可驗證推理上達到表現,凸顯小模型推理可能。
VibeThinker
WeiboAI於2025年開源VibeThinker-1.5B與2026年推出3B版本,採用Spectrum-to-Signal原則與多階段後訓練,結合監督微調、強化學習與自我蒸餾。實驗顯示1.5B在三項數學基準上超越400倍規模的DeepSeekR1,3B在可驗證推理上達到表現,凸顯小模型推理可能。
深度分析
研究聚焦於多代理語言模型在長期策略互動中的獎勵分配問題,提出延遲步驟獎勵與資格門控機制,配合非同步批次與課程式對手抽樣,使訓練更穩定且樣本效率高。實驗顯示 8 億參數開源模型在 MindGames Arena 兩項賽事均奪冠,表現媲美或超越 GPT‑5。