深度分析
大型語言模型的地緣政治背書效應:GPT‑5、Claude Sonnet、Gemini 2.5 Flash 與 DeepSeek 評分實驗分析
本研究檢驗大型語言模型在評估國際經濟與安全政策時,是否因隨機標示的美國、歐盟、中國或俄羅斯背書而產生分數差異。以 GPT‑5、Claude Sonnet、Gemini 及 DeepSeek 四款模型,分別在僅給分與附加說明兩種條件下測試。結果顯示西方背書普遍得到較高分,且說明需求會改變評分走向,突顯模型內建的地緣政治偏見。
深度分析
本研究檢驗大型語言模型在評估國際經濟與安全政策時,是否因隨機標示的美國、歐盟、中國或俄羅斯背書而產生分數差異。以 GPT‑5、Claude Sonnet、Gemini 及 DeepSeek 四款模型,分別在僅給分與附加說明兩種條件下測試。結果顯示西方背書普遍得到較高分,且說明需求會改變評分走向,突顯模型內建的地緣政治偏見。
深度分析
長期任務常使大型語言模型代理失效。研究推出跨領域 HORIZON 基準,利用 3100+ 軌跡分析 GPT‑5 與 Claude 等模型的效能退化,並以 LLM‑as‑Judge 管線驗證失效歸因。結果顯示隨任務延伸失效顯著,提供未來提升長期代理可靠性的方向。