掌握 AI 搜尋的每一步

會牽動你排名和 AI 引用的每個變化,加上該怎麼應對——趁還沒讓你付出代價之前。免費,每週三次。

GEO 快報 · DATA

ChatGPT、Copilot、Google、Perplexity 回答同一個問題,引用的網頁幾乎沒有重疊——要說品牌在 AI 答案裡缺席,先一個引擎一個引擎查過

2026-09-19可信度: Medium English →

拿同一個購買問題去問 ChatGPT、Microsoft Copilot、Google 和 Perplexity,再任挑兩個引擎的答案來對,多數時候兩邊連一個共同引用的網址都沒有。這是獨立研究者 Benjamin Tannenbaum 在 2026 年 9 月 19 日貼上 arXiv(cs.IR)的一份觀察式稽核量出來的結果。他在 2026 年 6 月 6 日把 15 組固定的商業查詢丟進這四個引擎,一共記下 589 次引用觀察,涵蓋 528 個不重複網址、356 個網域。不管從哪個層次看,重疊率都貼近零。同一提問下,引擎兩兩比對的網址重疊(用 Jaccard 相似度計算)平均只有 0.0079,中位數是零。84.9% 的引擎配對,一個共同引用的網址都沒有。96.4% 的網址只出現在單一引擎,而配對過的隨機基準預測的重疊率是 12.7%。單一引擎只抓得到四引擎聯集網址的 11.4% 到 42.6%。答案最前面那幾條更是完全分家:60 組兩兩比較裡,前五名網址的重疊全部是零。另一項檢查發現,同一個引擎自己跟自己也對不上:比較 2026 年 6 月 5 日和 6 日,單一引擎的網址集合平均一天就換掉 67.0%。論文的結論對準的是一種特定工具:不連接實際引擎的「頁面分數」,只能估計頁面和查詢合不合,量不到決定一個頁面在某個引擎上會不會真的被引用的那兩步,也就是曝光和引用選擇。

來源: arXiv(cs.IR):Tannenbaum, B.〈Scoring With the Engine: Retrieval Exposure, Cross-Engine Divergence, and the Limits of Engine-Agnostic GEO Scores〉(完整引用見下方)。

可信度:中等。 這是一篇單一作者的 arXiv 預印本,還沒經過同行評審;樣本是單日、15 組查詢的快照,另加一組兩天的同引擎比較,目前也還沒有別的媒體或研究者獨立驗證。它還是過得了可查證 artifact 的門檻,因為方法、查詢數和完整統計數字都公開寫出來,原則上誰都能重跑一次。

事實要點:

  • 2026 年 6 月 6 日:15 組固定商業查詢在 ChatGPT、Copilot、Google、Perplexity 四個引擎上執行,共產生 589 次引用觀察(528 個不重複網址、356 個網域)。
  • 跨引擎重疊:兩兩 Jaccard 相似度平均 0.0079;84.9% 的引擎配對零共同引用網址;60 組兩兩比較中,前五名網址重疊全部是零。
  • 單一引擎只涵蓋四引擎聯集網址的 11.4%–42.6%;96.4% 的網址只出現在一個引擎。
  • 另一項 2026 年 6 月 5 日到 6 日的同引擎比較發現,單一引擎的網址集合日間變動率平均達 67.0%。
操盤手視角

對要把「AI 能見度」數字報給老闆或客戶的行銷主管而言,這份研究比論文標題講的範圍窄,但也更好用。它真正檢驗的,是一個頁面分數能不能預測某個引擎會不會引用那一頁。不問引擎就算出來的分數,講不出哪個引擎會引用這一頁;四個引擎被問同一個問題,交回來的是四份幾乎各自獨立的引用清單。一套逐一查詢各引擎、每個引擎各列一行的追蹤工具,做的正是這份數據要求的量法。綜合分數拿來看方向,仍然是有用的領先指標;但光靠它,撐不起「我們有被引用」或「我們沒被引用」這句話,因為 Tannenbaum 記下的引用裡,96.4% 只出現在一個引擎上。

代價更高的錯,其實出在反方向。團隊拿最重要的購買問題問一次 ChatGPT,沒看到自家品牌,就宣布「AI 能見度出問題」,這等於只在某一天抽了一個引擎。這份數據裡,84.9% 的引擎配對毫無交集,單一引擎自己的引用清單連續兩天比下來也換掉了 67.0%。那個「沒有」,只是從四份一直在變的清單裡抽出來的一次結果。(這個保留也適用在這篇快報本身:整份數據就是某個六月天跑的 15 組查詢,論文還沒有人審過。方向比小數點可信。)

建議行動:

  • 翻出上一份交給老闆或客戶的 AI 能見度報告,看引用數有沒有按引擎(ChatGPT、Copilot、Google AI Overviews、Perplexity)分開列;如果只有一個綜合分數,下次報告週期前,請追蹤工具或供應商補上各引擎的拆分。
  • 這禮拜請團隊把前 10–15 個核心買家意圖查詢,在四個引擎上重跑,而且不只跑一天;還沒跑完以前,別把某一次「沒被引用」當成全站的問題。
  • 本月只要把綜合能見度分數交給客戶或高層,就在旁邊記下判斷依據:這是方向性指標,要跟各引擎的實際引用清單一起看。
資料來源

arXiv (cs.IR): Tannenbaum, B. "Scoring With the Engine: Retrieval Exposure, Cross-Engine Divergence, and the Limits of Engine-Agnostic GEO Scores." Submitted 19 Sep 2026. https://arxiv.org/abs/2609.22655