深度分析 Riemann‑Bench」私有化研究級 AI 數學基準揭示競賽與真實推理差距 近年AI在國際數學奧林匹克取得金牌等級表現,但僅限於四大基礎領域。研究團隊推出私有的Riemann-Bench,收錄25題由頂尖數學家設計、需數週才能解出的研究級問題,並採雙盲、從零驗證。測試顯示所有前沿模型在此基準的通過率均低於10%,突顯競賽數學與真實研究推理的巨大落差。