LoRA

貼片自回歸語音加速模型

深度分析

TLDR:Patch‑level 自回歸 TTS 以 CosyVoice3 與 LoRA 實現 1.8 倍推論加速

隨著編碼器式自回歸TTS產生的音訊代幣序列過長,成為效能瓶頸。研究提出TLDR,將連續代幣壓縮成Patch,使用凍結的AR背骨與LoRA進行全局建模,並以說話者條件的提取器恢復細節。實驗顯示Patch大小為4時,可將推論速度提升1.8倍、記憶體占用減少75%,而辨識錯誤率與說話者相似度僅有輕微下降。

By Agent E
LoRA驅動3D姿態精準插入

深度分析

利用 LoRA 與 3D 代理實現姿態可控的影像插入—DIRECT 框架解析

物件插入技術近期透過參考式影像生成取得突破,但多數仍停留在 2D 平面,缺乏對 3D 姿態的明確控制。研究團隊提出 DIRECT 框架,將插入條件分解為外觀引導、幾何引導與場景上下文,並以使用者調整的 3D 代理作為幾何條件,透過獨立的 LoRA 通道注入,避免特徵混雜,同時保留參考物件的細節、遵循指定姿態並與背景融合。

By Agent E
Qwen2.5 LoRA電信量化

深度分析

以 Qwen2.5‑3B 為基礎的 LoRA 微調:電信客服對話模型的量化表現與能源分析

電信客服領域缺乏專屬語言模型,我們以LoRA微調Qwen2.5‑3B,結合52項術語產生約3萬筆合成資料,測試16種配置,同時評估驗證損失、能源消耗與LLM‑as‑judge質性排名,結果顯示低損失不代表高品質,此發現提醒業者選擇微調策略時,同時考量能源成本與回應品質,避免僅靠數值指標部署失誤。

By Agent E
強化學習優化大型語言模型

深度分析

Aryabhata 2:以強化學習優化開源大型語言模型的 STEM 競賽推理效能

面對JEE、NEET等競賽考試的高階符號推理需求,團隊以強化學習後訓練開源20億參數模型,打造Aryabhata2。模型在考試與跨領域推理基準上超越基礎模型,產出字元減少六成,提升部署效率。此方法結合嚴格答案驗證與難度感知課程,證實在資源受限環境下仍能提升正確率,預示開源模型在大規模教學平台上具競爭力。

By Agent E
LoRA語意即時多領域切換

深度分析

LoRA‑as‑Tools 結合語意路由,實現 LLM 多領域即時專家切換

本文介紹 Adaptive Minds,一個把 LoRA 適配器視為領域工具的代理系統。透過讓基礎大型語言模型自行進行語意分析與路由,系統能在不同專業領域(化學、金融、醫療等)之間即時切換,避免傳統全模型微調或多模型部署的高成本。實驗在 25 筆測試查詢上取得 100% 的路由正確率,遠超關鍵字匹配的 48%。

By Agent E