IPO Finance Agent:突破長文件檢索,提升 IPO 盡職調查效能

Finance Agent v2 只支援定期報告,無法處理長篇 IPO 招股說明書。研究者開發 IPO Finance Agent,加入上下文檢索與 IPO 專屬題庫,提升長文件問答能力。測試顯示 Zhipu GLM-5.2 正確率 79.8%,成本效益佳的 Xiaomi MiMo-2.5 Pro 亦表現優異。

IPO長文件檢索盡職調查

Finance Agent v2(由 Vals AI 開發)長期被當作評估 Anthropic Claude 與 OpenAI ChatGPT 等前沿語言模型在金融任務上表現的基準。然而,它僅聚焦於上市公司定期報告(SEC 10‑K、10‑Q),且使用的檢索方式僅是簡單的分段抓取,無法因應 IPO 盡職調查的特殊需求。

IPO 盡職調查的挑戰

SEC S‑1 招股說明書的內容遠較定期報告龐大,結合歷史財務報表、公司治理、會計處理、資金募集敘述以及承銷風險揭露等多元資訊,文件長度往往超過數百頁。原本的 Finance Agent v2 在處理 SpaceX S‑1 時,因文件過長根本無法產出任何回應。

IPO Finance Agent 的兩大改進

為了解決上述問題,研究者提出 IPO Finance Agent,從兩個方向延伸原框架:

  • 任務領域:從定期報告擴展至 IPO 盡職調查,並建立 1,000 題 IPO‑diligence 問題集,公開 70 題(SpaceX S‑1)供 reproducibility 使用。
  • 檢索架構:採用上下文檢索(contextual retrieval),即在長文件中動態定位相關段落,符合產業實務的文件檢索流程。

自動化評估管線

團隊還設計了 evaluator‑optimizer pipeline,先從模型答案抽取事實,再自動生成評分標準,最後由大型語言模型(LLM)迭代修正缺漏、幻覺與冗餘,僅在人類專家審核最終稿。

實驗結果

在 1,000 題測試集上,表現最佳的模型 Zhipu GLM‑5.2 正確率達 79.8%。成本效益最高的 Xiaomi MiMo‑2.5 Pro 以每次查詢 0.05 美元取得 77.2% 正確率,顯著優於 Finance Agent v2 領先者 Google Gemini 3.5 Flash(57.9%,每次查詢 2.51 美元)以及 MiniMax M3(48.3%,每次查詢 0.32 美元)。

資源開放

相關程式碼與資料已於 GitHub 釋出,網址為 https://github.com/benstaf/ipoagent,方便研究社群進一步驗證與延伸。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more