IPO Finance Agent:突破長文件檢索,提升 IPO 盡職調查效能
Finance Agent v2 只支援定期報告,無法處理長篇 IPO 招股說明書。研究者開發 IPO Finance Agent,加入上下文檢索與 IPO 專屬題庫,提升長文件問答能力。測試顯示 Zhipu GLM-5.2 正確率 79.8%,成本效益佳的 Xiaomi MiMo-2.5 Pro 亦表現優異。
Finance Agent v2(由 Vals AI 開發)長期被當作評估 Anthropic Claude 與 OpenAI ChatGPT 等前沿語言模型在金融任務上表現的基準。然而,它僅聚焦於上市公司定期報告(SEC 10‑K、10‑Q),且使用的檢索方式僅是簡單的分段抓取,無法因應 IPO 盡職調查的特殊需求。
IPO 盡職調查的挑戰
SEC S‑1 招股說明書的內容遠較定期報告龐大,結合歷史財務報表、公司治理、會計處理、資金募集敘述以及承銷風險揭露等多元資訊,文件長度往往超過數百頁。原本的 Finance Agent v2 在處理 SpaceX S‑1 時,因文件過長根本無法產出任何回應。
IPO Finance Agent 的兩大改進
為了解決上述問題,研究者提出 IPO Finance Agent,從兩個方向延伸原框架:
- 任務領域:從定期報告擴展至 IPO 盡職調查,並建立 1,000 題 IPO‑diligence 問題集,公開 70 題(SpaceX S‑1)供 reproducibility 使用。
- 檢索架構:採用上下文檢索(contextual retrieval),即在長文件中動態定位相關段落,符合產業實務的文件檢索流程。
自動化評估管線
團隊還設計了 evaluator‑optimizer pipeline,先從模型答案抽取事實,再自動生成評分標準,最後由大型語言模型(LLM)迭代修正缺漏、幻覺與冗餘,僅在人類專家審核最終稿。
實驗結果
在 1,000 題測試集上,表現最佳的模型 Zhipu GLM‑5.2 正確率達 79.8%。成本效益最高的 Xiaomi MiMo‑2.5 Pro 以每次查詢 0.05 美元取得 77.2% 正確率,顯著優於 Finance Agent v2 領先者 Google Gemini 3.5 Flash(57.9%,每次查詢 2.51 美元)以及 MiniMax M3(48.3%,每次查詢 0.32 美元)。
資源開放
相關程式碼與資料已於 GitHub 釋出,網址為 https://github.com/benstaf/ipoagent,方便研究社群進一步驗證與延伸。
延伸閱讀
- SEFD:以 MultiMarkdown 重建 SEC EDGAR 檔案的版面忠實語料庫
- 「TypewriterLM」:首款以 1913 年前英語語料與詞彙限定指令微調的歷史語言模型全解析
- UAF 統一音訊前端大模型:一次性整合 VAD、說話者辨識與 ASR 的全雙工語音系統
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。