IdeaGene-Bench:新型科學譜系推理與生成基準
科學研究常需在前人基礎上演化。IdeaGene-Bench 以 Idea Genome 物件與 GenomeDiff 描述論文譜系,提供 1,961 條金標準追蹤與六種演化動態。測試顯示大型語言模型在譜系推理上僅有 27.3% 精確度,且結構化資訊會重排系統表現。
科學創意往往不是從空白開始,而是繼承、修補與重新組合既有概念。為了評估 AI 是否能理解這種譜系結構,研究團隊推出 IdeaGene-Bench(IG-Bench),作為科學譜系推理與譜系導向創意生成的基準。
IdeaGene 框架與 GenomeDiff
在 IG-Bench 中,每篇論文或提案被抽象為一組最小化、具型別、以證據為根據的「Idea Genome」物件。GenomeDiff 用來對齊這些物件,記錄六種演化動態:繼承、突變、遺失、外部導入、以及新插入。
基準規模與評測方式
基準資料包含 1,961 條金標準譜系追蹤、1,085 個策劃好的 Idea Genome 物件,以及 920 組成對的 GenomeDiff 記錄,涵蓋十個科學領域。評測分為兩部分:
- IG-Exam:42 種任務類型、1,029 個實例,測試閉式譜系推理,包括譜系抽象、繼承追蹤、演化推理與譜系驗證。
- IG-Arena:以譜系條件下的 Population‑Evolution Score(PES)評估生成,要求新提案能作為給定譜系群體的合理後代,具備正確繼承、意義差異與未來選擇價值。
實驗結果
在 14 種基於大型語言模型的 AI 科學家上進行測試,發現系統在譜系推理上存在組合瓶頸。最強模型的精確度僅為 27.3%,且加入結構化譜系上下文後,系統排名出現重新排列,並非普遍提升。
延伸閱讀
- 大型語言模型文化對齊評估:多語言敘事道德生成實驗與結果
- 大型語言模型幽默對齊基準:以 Cards Against Humanity 測試結果分析
- OmniBehavior:首個以真實資料建構的跨情境長時序使用者行為模擬基準
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。