深度分析 SciTrek 基準測試:長上下文語言模型在科學文獻推理上的真實挑戰 長上下文語言模型(LCLM)在科學文獻處理上備受期待,但現有基準測試多聚焦於非科學文本或簡單資訊檢索任務,缺乏對多文件資訊整合與推理的評估。為此,研究團隊提出 SciTrek,一個以科學文章為基礎的問答基準測試,透過將問題轉化為 SQL 查詢,自動產生包含明確推理步驟的問答對,可擴展至百萬 token 的上下文長度。