生成式搜尋引用能見度的統計不確定性:三大平台實證分析
本研究探討生成式搜尋引擎的引用能見度指標在不同查詢時間的變異性,指出以單次測量得到的點估計可能誤導。研究者在 Perplexity Search、OpenAI SearchGPT 與 Google Gemini 三平台上,針對三個消費產品主題進行每日與十分鐘高頻率的重複抽樣。
研究動機與背景
AI 驅動的答案引擎本質上是隨機的,對相同查詢在不同時間可能給出不同答案,甚至引用不同來源。現行的領域能見度衡量大多使用單次抽樣的點估計,將結果視為固定值。
研究方法
本研究針對 Perplexity Search、OpenAI SearchGPT 與 Google Gemini 三個生成式搜尋平台,選取三個消費性產品主題,進行兩種抽樣策略:
- 每日收集:連續九天每平台各一次。
- 高頻抽樣:每十分鐘一次,持續一定時段。
藉由重複抽樣,觀測引用來源的變化。
主要發現
引用分布符合冪律形態,且在不同抽樣間呈現顯著變異。使用自助抽樣法計算的信賴區間顯示,多數看似顯著的領域差異其實落在測量噪音範圍內。進一步的排名穩定性分析發現,即使是常被引用的領域,其排名在不同樣本間亦不穩定,說明單次可見度指標過於精準,容易誤導。
結論與建議
引用能見度應以樣本估計方式呈現,並附上不確定性估計。研究提供了實務上達成可解釋信賴區間所需的抽樣大小參考,建議未來在生成式搜尋的效能報告中加入此類統計資訊。
延伸閱讀
- LLM 對社群網路意見動力學的影響:偏誤、放大與平台設計的角色
- 融合—裂變向量群體動力學預測對話式 AI 行為偏移:基底向量實時預警方法
- xeno-reproduction 與 LLM 結構感知框架:量化並誘導生成多樣性
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。