AI 與自動化

45 篇研究打臉 GEO:只改寫內文,反讓 AI 檢索掉 16%

2026.07.29 · 111 次瀏覽
45 篇研究打臉 GEO:只改寫內文,反讓 AI 檢索掉 16%

arXiv 7/15 批判性綜述評分 45 篇研究:那個「GEO 提升 40% 曝光」只是固定情境下的單一實驗室指標,真正跨引擎有效的只有「相關性」與「檢索排名」兩件老事。

分享:

2026 年 7 月 15 日,一篇上傳到 arXiv 資訊檢索分類、編號 2607.14035 的批判性綜述,把整個 GEO(生成引擎優化)產業最愛掛在嘴邊的那句話拆了。作者 Olivier Martinez 系統性回顧了 2023 年 11 月到 2026 年 7 月間的 45 篇研究,用「證據強度」逐篇評分,結論很冷:沒有任何一種被審視的 GEO 技巧,能在跨平台上對「自然被檢索到的機率」或「實際流量」產生穩定效果。更刺眼的是一個反直覺數字——在一個叫 SAGEO Arena 的端到端實驗(171,003 份文件、2,700 條查詢)裡,只改寫頁面內文,會讓重排序後的 top-10 出現率下降約 16%。你以為在做優化,其實在做減法。

為什麼這件事現在爆出來很關鍵?過去 18 個月,GEO 從一個學術名詞變成一條預算科目。AI 聊天機器人的轉介流量從 2024 年初每月不到百萬次,暴增到 2025 年 9 月的 2.3 億次以上;Adobe 的調查則顯示 98% 的行銷人對自己的 AI 優化路線沒有清楚把握。真空地帶被工具商填滿,而他們的招牌口號幾乎都源自同一個數字:「GEO 可提升 40% 曝光」。這句話出自 2024 年 SIGKDD 那篇 奠基性 GEO 論文——但綜述指出,那 40% 其實是「位置加權字數(PAWC)」這個單一指標,在「五份文件已經被餵進生成器」的固定情境下,從 19.3 升到 27.2 的相對值,跟「多 40% 的人會點你」毫無關係。

把同類公司拉出來比,脈絡更清楚。Profound、Evertune、Scrunch、Semrush 這些 AEO/GEO 追蹤工具過去一年累計募資已破 2 億美元,市面上光是「AI 引用追蹤」工具就有 33 家在賣。它們共同販售的是「可被 AI 引用」的承諾,而綜述恰恰指出:實驗能證明「已在上下文裡的文件」會改變被引用方式,卻幾乎無法證明「這頁會不會先被檢索到」,更別說「會不會帶來點擊與成交」。整個類別不是在整併,而是在一個尚未被證實的前提上快速擴張。

中小企業與接案工作室會被影響嗎?會,而且是好消息。如果昂貴的 GEO 訂閱買到的多半是「實驗室指標」,那你其實不需要它。這篇要解的是:這份綜述具體推翻了什麼、留下哪兩件真正有效的事、三類讀者今天該怎麼做,以及不花一毛 SaaS 訂閱,怎麼把「被 AI 引用」這件事做對。

事件細節與完整數字

這份 18 頁、含 8 張表的綜述,核心不是給你戰術,而是給你一把「證據尺」。它把「AI 能見度」拆成一個向量——可檢索性、上下文曝光、被引用機率、實際貢獻度、忠實度、以及最終的點擊或轉換——並主張:一個手法可能改善其中一格、卻同時破壞另一格,把它們壓成單一分數,就是用推銷指標冒充商業結果。幾個關鍵發現:

  • 改寫內文會反噬:SAGEO Arena 實驗中,只優化內文使 top-20 出現率降約 9%、重排後 top-10 降約 16%、最終引用降約 6%。機制很單純——你提高了「被選中後的引用機率」,卻降低了「先被選中的機率」,總帳是負的。
  • 通用小撇步跨域失效:C-SEO Bench(兩任務、六領域、約 1,900 查詢、16,360 份文件)中,54 組「手法 × 領域」只有 3 組顯著為正,問答任務一組都沒有;電商情境 15 條啟發式有 10 條中性或負向。
  • 真正有效的只有兩件老事:一個 25.2 萬次試驗、跨 6 個模型、18 個因子的大型實驗指出,決定「第一個被引用」的主因是「查詢—文件相關性」與「在上下文中的位置」,其餘技巧邊際效益很小。
  • 引用資料極不穩定:Google AI Mode 每週更換 56% 的引用來源、ChatGPT 更換 74%;任何「單週引用截圖」都不足以當策略依據。
  • 流量證據最薄弱:一項對照研究顯示 ChatGPT 轉介原始成長 5.7 倍,但扣掉平台本身成長後,真正歸因效果只剩 1.82 倍(95% 信賴區間 1.31–2.54),且保守安慰劑檢定結果不顯著。

三類讀者的立刻行動

  • 品牌主/中小企業老闆:先別為「保證上 AI 引用」的訂閱買單。把預算放回兩個被證實的槓桿——內容跟使用者查詢的相關性、以及你在傳統搜尋的排名。綜述引用的獨立分析把「URL 可被抓取」與「搜尋排名」列為 AI 引用的兩個最高預測因子(9.5 與 9.4 分)。這兩件事你本來就該做。
  • 行銷/SEO 操作者:停止追逐「單週引用分數」。改成跨引擎、跨查詢措辭、含未優化對照組的量測,並在報告裡標明你量的是「被餵進上下文後的改寫效果」還是「真實流量」。把可驗證、有日期、正確標註的事實(價格、定義、統計)放進頁面——這是綜述少數認可的中度有效手法,但前提是數字為真,捏造統計會提高被複用率卻降低答案正確度。
  • 開發者/接案商:這是服務化的好時機。與其賣「GEO 魔法」,不如賣「可被機器讀取的內容地基」:乾淨的資訊架構、可被抓取的 URL、schema.org 結構化標記、快的頁面、清楚的來源標註。順帶幫客戶建一個「跨引擎能見度量測 + 未優化對照」的儀表板,比賣沒被證實的曝光更誠實、也更難被淘汰。

GEO/AEO 追蹤工具比較表

工具定位大致價格務實提醒
Profound企業級 AI 品牌能見度追蹤企業報價(高)數據漂亮,但多為「引用份額」,注意分母陷阱
Evertune模型層品牌提及分析企業報價跨模型比較有價值,單週數據仍不穩
ScrunchAI 搜尋能見度監測中高,月訂閱適合持續監測,別當成「optimize 就會漲」
Semrush(AI 追蹤模組)SEO 老牌加 AI 引用追蹤已有帳號可加購和既有 SEO 工作流整合度高,CP 值相對好

共同盲點:這些工具擅長「量測你被引用多少」,卻無法保證「optimize 就會漲」。綜述的警告正是——別把儀表板上的引用份額,當成流量會跟著漲的證據。

不會告訴你的事

1. 「被引用」不等於「被正確代表」。綜述回顧的忠實度研究指出,早期生成引擎裡只有 51.5% 的句子被引用來源完整支持、74.5% 的引用真的支持它所附的論點。你被引用了,可能指向一頁根本不支持該說法的內容——甚至是 AI 生成的內容回灌系統。

2. 每個引擎的來源名單根本不一樣。一項 4,706 條查詢的稽核顯示,Google AI Overviews 引用的網域有 53% 不在自然搜尋 top 10、27% 連 top 100 都沒有;Google 自然結果、AIO、Gemini 三者的 URL 重疊度僅 0.11–0.18。沒有「一個全域排名」可以 optimize,只追一個平台,你只看到約三分之一的能見度。

3. 白帽優化和操縱共用同一條管道。因為兩者都在改「引擎讀到的文字」。綜述記錄:間接注入可讓目標在某商用搜尋 API 上抬升約 3 名;偏好操縱攻擊能把一台虛構相機的推薦率從 34.0% 拉到 59.4%。今天有效的激進手法,明天就可能被判為垃圾,且懲罰會同時波及傳統與 AI 搜尋。

不花 SaaS 訂閱的中小商家替代方案

  • 先把「檢索」做對,而不是先改內文:確認你的頁面能被抓取(robots、狀態碼、可讀 HTML),這是綜述點名的第一預測因子,且完全免費。
  • 用結構化標記把事實餵清楚:schema.org 結構化資料標記文章、作者、日期、價格與定義,讓引擎讀得懂「可驗證、有日期」的事實。
  • 自建跨引擎抽查表:用 Google Sheet 記下同一組查詢,每週手動在 ChatGPT、Gemini、Perplexity 各問一次,記錄「有沒有被引用、被引用什麼」——用免費工人智慧複製昂貴儀表板的核心價值,還順便看到跨引擎差異。
  • 相信 Google 官方那句話:Google 在其 官方文件明確表示,為 AI 搜尋優化就是為搜尋體驗優化——好的 SEO 就是好的 AI 曝光地基,不必另買一套魔法。

常見問題 FAQ

那我以後都不用管 GEO 了嗎?

不是。GEO 是真實現象,只是「已被檢索的內容能影響答案」這件事有效、而「改寫就能提升被檢索與流量」這件事沒被證實。把力氣放在相關性與傳統排名,等於同時把 GEO 的兩個真正槓桿做好。

「GEO 提升 40% 曝光」到底錯在哪?

那 40% 是單一指標(位置加權字數)在「文件已被餵進上下文」的實驗室設定下的相對增幅,不代表多 40% 的人會點你,也不代表你更容易先被檢索到。綜述把這句話列在最低信賴等級、當成一般性主張予以否決。

中小企業有必要買 Profound、Scrunch 這類工具嗎?

多數不必。它們擅長量測、不擅長保證成長。若真要追蹤,選能整合進既有 SEO 工作流的(如 Semrush 加購模組),或自建免費的跨引擎抽查表,投報率更合理。

把價格、統計數字塞進頁面有用嗎?

有中度效果,但有前提:數字必須為真、有日期、正確標註。綜述提醒,捏造統計會提高被複用率卻降低答案正確度,長期反噬品牌信任。

我的觀點

主流敘事是「AI 搜尋來了,你得趕快買 GEO 工具做優化」。我的判斷相反:未來 12–18 個月,多數獨立 GEO 工具會面臨一次估值修正,因為它們賣的核心承諾——「optimize 就會被引用、流量就會漲」——正被學術證據系統性否定。當一個類別累計募資破 2 億,卻連「這會不會帶來點擊」都拿不出穩定因果證據時,泡沫的味道就出來了。對 ScriptWalker 這種接案工作室,這反而是明確的服務化機會:不要賣「GEO 魔法」,要賣「可被機器讀取、可被驗證、可被量測」的內容地基——乾淨的技術 SEO、結構化資料、快的頁面,外加一個誠實的跨引擎量測儀表板。當市場終於認清 40% 是實驗室數字,能靠「真本事而非話術」交付的工作室,會接收到那些被過度承諾傷過一次的客戶。

資料來源

分享:
AI 與自動化 返回文章列表