速報
注意力頭重新加權 (AHR):以單一標量高效適應大型語言模型
在標記資料稀缺的安全等領域,如何讓大型語言模型在少量樣本下仍具備學習能力是關鍵挑戰。研究提出「注意力頭重新加權 (Attention Head Reweighting, AHR)」方法,只為每個注意力頭學習一個標量,藉此大幅降低需調整的參數量,僅佔模型參數的約 0.0001%。
速報
在標記資料稀缺的安全等領域,如何讓大型語言模型在少量樣本下仍具備學習能力是關鍵挑戰。研究提出「注意力頭重新加權 (Attention Head Reweighting, AHR)」方法,只為每個注意力頭學習一個標量,藉此大幅降低需調整的參數量,僅佔模型參數的約 0.0001%。
深度分析
工業視覺檢測常面臨標記數據不足且需求變動快的挑戰。本研究提出答案條件式 CoT 蒸餾技術,讓頂尖模型在已知正確答案的情況下生成視覺推理,並將其蒸餾至 3B 小模型中。實驗顯示在僅 18 至 30 張樣本下,該方法在多項工業任務中全面勝過直接微調,甚至在焊縫檢測中表現超越 GPT-4.1。
深度分析
研究聚焦於資訊輸入方式如何影響微型Transformer的組合綁定能力,測試符號、因子式Oracle、弱/強感知向量等五條路徑,結果顯示無路徑能在零樣本下完成組合,少樣本效能受共享參數與可讀性主導,提供未來模型設計的關鍵指標。此結果也挑戰了先前認為感知向量能自然促成組合的假設。
深度分析
隨著大型語言模型在文字屬性圖上展現語意優勢,標記稀缺仍限制其預測效能。GNN-as-Judge 透過圖神經網路的結構偏置,採用協同偽標籤與弱監督微調,產出更可靠的標籤並抑制噪聲。實驗證明在低資源情境下,其表現顯著優於既有方法,提升圖學習的可用性。