深度分析
Granite 4.0 3B Vision:以 ChartNet、DeepStack 與 LoRA 加速企業文件視覺語言理解
IBM推出的Granite4.03BVision專為企業文件理解設計。它結合ChartNet合成資料、DeepStack視覺注入與LoRA模組化佈署,強化圖表、表格與語義鍵值擷取能力。模型在多項圖表與表格基準上達到領先或接近領先的成績,便於整合至文件處理流水線。
深度分析
IBM推出的Granite4.03BVision專為企業文件理解設計。它結合ChartNet合成資料、DeepStack視覺注入與LoRA模組化佈署,強化圖表、表格與語義鍵值擷取能力。模型在多項圖表與表格基準上達到領先或接近領先的成績,便於整合至文件處理流水線。
深度分析
大型語言模型精調成本高昂,本研究提出TiTok以代替傳統資料依賴的KD方法。TiTok透過源模型帶與不帶LoRA的預測對比,計算token級別的“過量差異”,以挑選合成樣本與關鍵token進行訓練。實驗顯示TiTok在多種轉移場景下整體優於現有方法,提升穩定性與效率。
多模態大型語言模型
符號回歸旨在從觀測資料萃取可解釋的數學表達式,但傳統方法難以以自然語言直接納入專家先驗。
速報
背景:在少量昂貴基礎模型與大量衍生策略的情境下,MinT以LoRA adapter為單位管理策略生命周期。做法:維持基礎模型常駐、以匯出adapter進行rollout、更新、評估與回滾,並沿Scale Up(支援1T級密集與MoE)、Scale Down(僅移動小型adapter以降低步驟量)與Scale Out(將耐久可位址性與CPU/GPU工作集分離)三軸擴展。結果:MinT實現百萬級策略目錄管理與千級活躍adapter波次,並在共享大模型上訓練與部署選定修訂。
深度分析
聯邦低秩調適(FedLoRA)為大模型在分散私有資料上微調提供通訊與隱私優勢,但實務環境下客戶端在計算、記憶與資料分布上存在異質,導致不同客戶端採用不同的LoRA秩。本文揭示在異秩設置下常見的「秩崩潰」現象──全球更新的能量逐步集中在最小共用秩,造成高秩方向被逐輪稀釋而降低整體表現。
深度分析
本研究提出Gate-and-Merge,一套針對視覺語言模型(VLM)進行組合化個人化的零次學習框架。每個使用者自定義概念以輕量化LoRA適配器與專屬概念token獨立學習,基底模型保持凍結。推論時透過門控機制估計文本與視覺線索,選擇性啟動相關模組,並在權重空間合併經稀疏化與符號一致性的更新以抑制干擾。
ECoG
在資料稀少下,研究探討把預訓練頭皮 EEG 模型轉移至侵入性 ECoG 的可行性。CORTEG 結合 EEG backbone、KNNSoftFourier 電極空間適配器與低頻/高γ 雙流 token 化,並採 LOO 微調快速校準。結果在兩項 ECoG 迴歸任務上達到競爭或更佳平均皮爾森相關,且能在單 GPU 用 10–30 分鐘校準新病人。
深度分析
IBM發布Granite4.03BVision,針對企業文件視覺語言理解優化。它以ChartNet合成圖表資料、DeepStack分層視覺注入與LoRA模組化設計為核心,提升表格、圖表與語義鍵值抽取能力。基準測試顯示在圖表與表格抽取上表現優異,便於整合Docling構建端到端文件處理流程。
深度分析
在缺乏人工標註資料的情境下,GOAT提出一套自動化訓練流程,直接以目標系統的API文件為原料,構建具互依性的API依賴圖,並抽樣執行可行子圖來生成目標導向任務的合成訓練資料。核心流程包含文件解析、相似度過濾、LLM語意驗證與實際API執行檢核,最後聯合微調語言模型與密集檢索器。
深度分析
REALM提出一套跨模態視覺編碼器,將事件相機輸出的稀疏非同步事件流映射到已預訓練的RGB基礎模型(如DUNE)的潛在流形。方法在輸入端加入輕量的事件嵌入器,並以LoRA(低秩適配)最小化修改主幹,保留動態場景的語義與幾何先驗。這使得原本專為影像訓練的線性頭與複雜解碼器(例如MASt3R)能夠直接在事件資料上零次應用。
深度分析
隨著LLM微調需求激增,消費者等級GPU受限於記憶體與PCIe頻寬。RoundPipe以無狀態工作者池和輪詢分派方式,突破重量綁定問題,實現近零氣泡管線。實驗顯示在8×RTX4090上可提升1.5至2.2倍吞吐,並支援在單卡上微調235B模型。此技術也為小型團隊打開了大模型訓練的大門
深度分析
IBM推出的Granite4.03BVision為企業文件提供緊湊的視覺語言模型,透過ChartNet合成圖表資料集、DeepStack視覺特徵注入與LoRA模組化設計,提升表格、圖表與鍵值抽取精度,並在多項基準測試中領先同類模型,在企業AI流程中顯著提升效率。