BeyondArena:首套全方位表格資料基礎模型基準平台

表格基礎模型評測散見各處,研究團隊推出 BeyondArena 整合多任務與多規模資料集,並以 Data Foundry 框架統一管理。測試結果顯示,現有模型在小型 IID 資料表現佳,卻在非 IID、大規模或高維度情境下仍被傳統樹模型領先,凸顯未來研究方向。

Infographic for BeyondArena platform, benchmarking table foundation models and conventional methods.

表格資料的基礎模型近來在學術與產業界都相當熱門,然而評測軟體與流程分散,使得研究者難以在同一平台上比較不同模型的表現。

BeyondArena:統一的全方位基準

為填補此缺口,研究團隊推出 BeyondArena,首個支援 IID、時間序列與分群等多樣任務類型的統一基準。資料集涵蓋不同樣本大小、特徵維度,並包含文字特徵與高基數類別特徵,來源跨足多個領域。

Data Foundry:資料蒐集與管理框架

配合 Data Foundry Python 框架與統一的 metadata schema,研究者可以更方便地整理、描述與載入表格資料,用於預測式機器學習的評測。

實驗結果概覽

在 11 種模型與 142 個精選資料集上進行測試,結果顯示:

  • 基礎模型在小至中等規模的 IID 資料上表現突出。
  • 傳統的樹模型與深度學習模型在非 IID、較大規模或高維度資料上仍佔優勢。

此結果說明,現有的表格基礎模型尚未完全克服資料分布變化與規模挑戰。

未來展望

BeyondArena 為模型研究指明方向,鼓勵開發能在更嚴苛、真實世界情境下表現穩健的基礎模型,推動表格資料機器學習向真正的基礎化前進。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more