PreScience 資料集:AI 科學預測新基準與 LACER 評分指標
研究團隊推出 PreScience 資料集,彙整近十萬篇最新 AI 研究論文及其作者、引用與主題標籤,形成 502,000 筆完整記錄。資料集支援七項預測任務,包括貢獻生成、合作夥伴預測、先前工作挑選、引用次數與未來結合預測,以及主題趨勢預測。
資料集與任務概述
PreScience 資料集以近十萬篇最新 AI 研究論文為核心,結合作者出版歷史與引用鏈結,總計 502,000 筆記錄。每筆資料包含標題、摘要、去辨識化作者身分、重要參考文獻、主題標籤、引用走勢與時間切點的中繼資料。
七項預測任務
資料集設計了七個示範任務:貢獻生成、合作夥伴預測、先前工作挑選、引用次數預測、未來組合預測以及兩種主題趨勢預測。這些任務可用於評估模型在科學預測與文獻分析上的能力。
基線模型與新評分指標
研究者測試了從簡單啟發式、嵌入方法到最先進的大型語言模型與代理系統的多種基線。為了更好衡量生成貢獻描述的品質,提出了 LACER——基於大型語言模型的相似度指標,其與人類評分的相關性高於既有指標。
合成論文的品質分析
透過任務模型生成 12 個月的合成論文後,發現這些合成作品在多樣性與新穎性上系統性低於同期間的人類研究,顯示目前的生成技術仍有提升空間。
資料與程式碼公開
PreScience 資料集與相關程式碼已於 Hugging Face 與 GitHub 公開,供研究社群下載與使用。
延伸閱讀
- MemTier:在 OpenClaw 外掛下以分層記憶、PPO 檢索權重緩解 BM25 檢索瓶頸
- Mask2Cause:以逆向變數嵌入與可微分鄰接遮罩優化 Transformer 因果學習
- PLOT:以最佳傳輸定位神經網路中的因果變數
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。