深度分析
Hybrid Open‑Ended Tri‑Evolution (HOTE):結合提問、解答與評分的深度研究框架
深度研究是AI向通用智慧邁進的關鍵,但傳統模型受限於固定參數與可驗證任務。研究者提出HybridOpen‑EndedTri‑Evolution(HOTE)框架,結合提問者、解答者與評分者三模組,採用工具與非工具雙模式強化學習,使模型在開放式長文研究任務中自我演化。實驗顯示8B模型經HOTE訓練後,在HealthBench、ResearchQA與DeepResearchBench等三大基準上超越8‑32B開源模型,且訓練時間僅為傳統方法的一半,證明此方法在效能與效率上具顯著優勢。