深度分析
CPU 可行的幻覺偵測:輕量 NLI 與語意相似度方法全方位基準測試
本研究探討在無GPU、僅使用CPU可行的公開模型下,如何偵測大型語言模型產生的幻覺。評估五種輕量方法於問答、對話與摘要三項任務,發現方法表現隨任務差異,問答最佳為相似度與NLI組合,對話則以NLI為首,但在摘要上全部接近隨機。此結果為資源受限研究者提供實務選擇指引。
深度分析
本研究探討在無GPU、僅使用CPU可行的公開模型下,如何偵測大型語言模型產生的幻覺。評估五種輕量方法於問答、對話與摘要三項任務,發現方法表現隨任務差異,問答最佳為相似度與NLI組合,對話則以NLI為首,但在摘要上全部接近隨機。此結果為資源受限研究者提供實務選擇指引。
深度分析
在 AI 生成百科 Grokipedia 推出之際,研究者以 17,790 對英語條目比較其與 Wikipedia 的文本與結構。分析發現 Grokipedia 文章較長、引用密度低,且呈現兩極化分布,右傾新聞來源集中於歷史與宗教條目。此結果暗示 AI 生成的百科在透明度與來源驗證上仍面臨挑戰。