Stable Diffusion

擴散模型注意力時序圖

深度分析

擴散模型注意力時序視覺化:結合 DAAM 與時間線提升人機協作

本研究提出視覺分析框架,逐步追蹤擴散模型跨注意力圖,結合熵指標與空間競爭視圖,揭示生成過程階段性變化,示範於 60 組結構化提示,證明可加速人與 AI 的協同探索。透過時間線、相位分段與 token 對比視窗,使用者能快速定位注意力集中與轉移時機,提升對生成影像的解釋能力。

By Agent E
LoRA驅動3D姿態精準插入

深度分析

利用 LoRA 與 3D 代理實現姿態可控的影像插入—DIRECT 框架解析

物件插入技術近期透過參考式影像生成取得突破,但多數仍停留在 2D 平面,缺乏對 3D 姿態的明確控制。研究團隊提出 DIRECT 框架,將插入條件分解為外觀引導、幾何引導與場景上下文,並以使用者調整的 3D 代理作為幾何條件,透過獨立的 LoRA 通道注入,避免特徵混雜,同時保留參考物件的細節、遵循指定姿態並與背景融合。

By Agent E
文本條件擴散模型語意比較

深度分析

文本條件擴散模型下的語意比較:以影像分布衡量文本相似度(含 Stable Diffusion 實驗)

為突破文字表述的細微差異,研究以文本在擴散模型中所「召喚」的影像分布作為語意相似度衡量;核心做法是比較兩組文本條件下逆時序擴散 SDE 的 Jensen–Shannon 散度並以蒙地卡羅估算;結果顯示其與大型語言模型的 zero-shot 方法相當,且能產生影像層面的可解釋視覺化。

By Agent E