深度分析 TF‑RefusalBench:評估與減輕 LLM 在四語言刑事法庭文件中的過度對齊 研究以瑞士聯邦最高法院公開判決為基礎,建立TF-RefusalBench多語系刑事法翻譯與摘要基準,揭示模型過度對齊在拒絕、警告與內容正確性間的複雜互動,並證實系統提示與去除拒絕指令可大幅降低過度對齊,同時維持任務表現。研究同時指出,不同模型與語言組合的行為差異顯著,翻譯任務較少拒絕但警告較多,摘要則相反。