Key Takeaways
- Chunk 是 AI 檢索與引用的基本單位,只要是語意完整的段落就是好 Chunk,沒有標準字數。
- AI 往往優先選擇標題下的段落,最好每段開門見山、單獨抽出也能成立。
- GEO 建立在 SEO 基本功之上:Title、URL、Meta、Schema 先做對,再談 Chunk 優化。
- 自然語言 URL 的引用率是 89.78%,參數式網址只有 81.11%——建議用小寫英文撰寫 URL slug,避免中文編碼問題。
- GPT 每次引用的文章不一定相同,不需要追求過度優化,有價值的好文章才能穩定提升引用機率。
Chunk 是什麼?資訊自給自足的完整語塊
Chunk 是「完整語意的段落單位」,沒有一定的字數。
以方便但不完整的定義,你可以說這就是「文章的一個完整段落」。
對 LLM(大型語言模型,ChatGPT、Gemini、Claude 背後的核心技術)而言,Chunk 是 AI 搜尋系統撈資料、引資料的單位,它不會整篇文章讀完才引用,通常只會打包被切好的那一段。
AI 搜尋、GEO 都與 Chunk 息息相關,GEO 是 LLM 搜尋資料的引用優化方式,而 Chunk 則是 LLM 處理資料的引用單位。
只要跟 AI 找資料有關的內容,都勢必會碰到 Chunk 的處理技術。
用生活化的比喻來說:團訂餐點。
餐廳的套餐由複數單品組成,一個套餐就是完整的餐點,可能包含炸雞、薯條、可樂,有不同規模的套餐可以選擇。
- 套餐本身自足(Chunk 內語意自足)
- 套餐只是菜單上的一部份商品(Chunk 是全文的一個段落)
- 套餐品質與單品類型 → 店家處理(如何撰寫資訊)
- 套餐上架的文字描述長度 → 外送平台決定(Chunk 切分技術與後台系統相關)
- 套餐的銷售狀況 → 消費者決定(要不要買單是 LLM 的事)
將 LLM 想像成日理萬機的秘書,它超忙、事情超多,還要負責團訂餐點,需要快速解決訂餐問題。
A 店家:拿到幾十道散裝餐點,要自己核對有沒有缺單、自己拼成一餐。
B 店家:拿到的是包裝好的套餐,內容完整、可以直接外帶。
兩家的菜單它都會看到,但真正被端上桌(被引用)的,幾乎都是 B 店家的套餐。
Chunk 的由來與心理學名詞挪用
Chunk 在 AI 工程中是第三手用語,原本是心理學用詞,中文翻譯成「組塊」或「語塊」。
在劍橋字典裡最原始的用法是「一大塊、厚塊」,例如 a chunk of meat 就是一大塊有厚度的肉塊(薄片不算)、a chunk of text 就是一大段文字。
1956 年,心理學家 Miller 發表了一篇經典研究,發現人腦短期記憶一次只能裝 7±2 個東西,也就是五到九個。
當你在記東西的時候,即使嘴上唸唸有詞,也會轉身就忘記剛剛在唸什麼,又要回去看資料——這就是因為人腦記憶容量有限。
可是人的大腦有個聰明的辦法解決:只要把零散的小東西打包成一組,當成一個東西記,就不再是五到九個字,而是五到九「 組 」字。
電話號碼就是最好的例子,沒有人把十個數字一顆一顆背,多數是背成「0912」、「345」、「678」三組,你在唸電話號碼的時候,嘴巴就會很自然找到適配的停頓點。
當十個數字變三組韻律,腦袋就能裝得下了——這種分組的動作,心理學就稱為 Chunking。
幾十年後,工程師要讓機器讀文章,也遇到一模一樣的難題:機器一次也吞不下整篇,得先切成一塊一塊處理。
因此幫這個動作命名的時候,工程師直接借走了現有的心理學用詞。
而且對話用 AI 被要求的 KPI 也是有效的自然語言,因此 AI 必須按照人類的習慣去切 Chunk,這樣產出的每一塊內容,才具備完整的前因後果。
Chunking 實作:SEO 文章怎麼寫才容易被 AI 引用?
結論先行:
GEO 或 AEO 都建立在 SEO 之上,只要做好 SEO 基本功,並具備 EEAT 、獨特數據、深度觀點,就會增加引用機率,尤其是有憑有據又能協助讀者作判斷的中立內容。
開門見山、資訊完整
開門見山:直接在首段講出完整答案,AI 跟現代讀者沒有耐心讀包袱。
↑上面這句就是開門見山的範例。
每寫完一段,可以問自己一句:這段單獨拿出去,別人看得懂嗎?
這不是假設性的檢查,因為 AI 往往優先選擇標題下的段落,不一定會讀完整篇。
字數範圍會因為不同模型、不同時間而異,但基本原則通用:一段一個問題、一個完整的答案。
該有的名詞、條件、數字,段落裡自己要有,不依賴上一段才能成立。
舉例而言:
「這樣做之後,效果提升了不少」——單獨看,不知道誰做了什麼、提升了多少。
「網站改用自然語言網址後,引用率從 81.11% 提升到 89.78%」——單獨看,資訊完整。
前者只能活在原文的上下文裡,後者到哪裡抽出來都能當成答案。
AI 友善:SEO 標題、表格、清單
H2、H3 是索引記號,不是粗體跟大小寫的裝飾文字。
標題的工作有四個:
- 對應使用者意圖
- 讓讀者知道文章主題有哪些
- 提供讀者可跳轉的連結
- 將長篇內容分類、製造喘息空間
對 AI 而言,最重要的是的「使用者意圖」,其次是「文章主題」。
當搜尋工具可以快速匹配使用者的問題,並且描述底下那一區在講什麼時,機器可以瞬間定位,打包走已經裝好的 Chunk。
以人類的生活情境舉例,今天有位爸爸拿到了一張購物清單,上面寫:1 歲寶寶的奶粉 2 罐。
當他走進大賣場,首先他要找到頭上的標示吊牌「嬰幼用品」(H1),再來找到專門放奶粉的櫃子(H2),因為嬰幼用品也有奶嘴、奶瓶、尿布,如果這間大賣場沒有標籤,或是全部放在一起,爸爸就要找很久才找到奶粉。
優秀整齊的 H2 告示牌 :適合 1 歲寶寶喝的奶粉
亂七八糟的 H2 告示牌 :這裡有奶粉也有牛奶,但其實寶寶不適合喝動物奶!
「人類幼兒不適合動物奶」的資訊雖然正確,但它不該在賣場的指路標上。
對 AI 而言,友善的 SEO 標題(H1、H2、H3)與 Meta 標題、描述,就是這些大賣場的路標,寫得清楚它可以很順利進去找到要的奶粉——但如果標示寫得亂七八糟,AI 看不懂,它就轉身跑去下間大賣場了。
表格和清單也是天生的好 Chunk,符合人類與 AI 的閱讀方式。
它們本來就是切好的,一列就是一個資訊單位,抽取資訊最省力。
只要需要列舉三項以上、或每個項目有多個屬性要對照時,用表格或子彈式列點,不要串成一大段文字。
筆者自己曾撰寫過生活向的比較文章,就是以大量表格結構 x AI 資訊缺口去設計,皆有在 GEO 與 AIO 引用出現——單一案例雖不能當通則,但至少表格對引用的友善度已經驗證。
契訶夫之槍:哪些句子該留著?哪些該刪掉?
資訊量為零的句子,就不需要存在。
判斷標準:讀者讀完,有沒有立刻知道新的資訊。
「在現今數位時代,隨著科技快速發展」——讀完這一句,然後呢?
關鍵就在這個「然後呢?」——因為答案是零,實際上這就是一句廢話。
鋪墊在 SEO 與 AI 搜尋中沒有任何作用,反而會浪費爬蟲預算,因為 AI 不需要故事帶來的情緒高潮,它只要有用的資訊,越精準、越乾淨越好(方便理解的比喻或個人經驗除外)。
契訶夫之槍是一種文學手法,但被廣泛應用在各種創作中:「請將一切與故事無關的事物,都從故事中移除。如果你說第一幕中有把槍掛在牆上,那麼在第二幕或第三幕中,這把槍必須發射,不然就沒必要掛在那。」
Chunk 過度優化的常見錯誤
在碰到 Chunk 概念之後,最容易犯的錯是矯枉過正。
把完整的長句硬拆成碎片、同一個關鍵字一段塞五次——資訊量沒有變多,閱讀的節奏卻變得破破爛爛。
AI 檢索的評分核心是段落內的語意相關,不是關鍵字的出現次數。
該做的只有 3 件事:
- 讓人類方便閱讀,避免寫一大段擠在一起的長句
- 段落內容符合標題
- 資訊有用、自洽
Chunk 不是新技術:Google 段落排名的演進
Chunk 不是新時代用詞,也不是為 AI 發明的密技。
它就是 SEO 基本功——易讀性 x 清楚的段落 x 有用的資訊。
機器是照著人類的文本訓練:人類覺得好讀的,它就好切、好檢索、好引用。
SEO 一直以來的主要核心概念都只有一件事情:為了人類儲備正確的知識。
所有 Google 的演算法演變、AI 工程的出現,全都是為了服務使用者——只要理解這一點,剩下的內容都是錦上添花。
精選摘要是什麼?跟 AI 精選摘要不一樣嗎?
精選摘要(Featured Snippet):文章直接抽取頁面中的一段內容,放在搜尋結果最上面。
因為使用者只想快速知道答案,簡單幾句話就好,不想看落落長的文章,希望搜尋引擎立刻找到準確答案。
從 2014 年就因應使用者習慣與需求出現了,只是以往是將文章原汁原味搬運,現在則大量被 AI overview (AI 精選摘要)取代。
AI 精選摘要會有兩個 SEO 相關欄位:引用的文章來源、引導你對話進入 AI mode 的對話框。
理論上使用者在開頭就能得到解答,想辦法擠進引用區的技術稱為 AEO(不是 AIO,很容易拼錯),不只文章,也包含圖片、影片、商家檔案等多元元素。
順帶一提,因應而生的被害狀況稱為零點擊搜尋,也就是原本那些在首頁的其他文章應該要有人點,但 Google 的 AI 摘要直接攔截走點擊……只給曝光。
也因此現在的 CTR 依據,已經不能用幾年前的 CTR 去當標準——大家 CTR 幾乎是全部一起下降的,連 YMYL 產業也遇到一樣的狀況。
Passage Ranking 段落排名是什麼?
以往搶首頁是在站點 vs 站點的基礎上,讓文章 vs 文章——現在多拉出一個比賽叫段落 vs 段落。
也就是 Chunk vs Chunk。
在2021 年,Google 上線了 Passage Ranking,中文翻譯是「段落排名」。
以前排名是整個網頁一起計算的:網頁整體表現好,才排得上去。
現在 Google 可以只抽網頁中間的某一段,就算整篇表現普通、站點偏小,但只要其中一段把某個問題答得特別好,那一段就能自己出來競爭長尾關鍵字。
寫好 Chunk 就有希望被人看見。
這對內容經營很友善,它代表一篇文章不必段段完美,但每一段的努力都有機會被單獨看見。
(附註:雖然 Google 否認,但業界普遍還是認為網站權重對 Chunk 排名會有影響)
Google 怎麼看 Chunk?
Google 的官方說法是:不用特地切 Chunk,對搜尋結果沒有幫助。
這句話可以分兩個層面來看:「Google 說的是真的嗎?」以及「那對 LLM 來說也是一樣嗎?」
簡單來說,對 Google 而言可能是這樣,在 SEO 上有其他的考量——但對 LLM,也就是對 GEO 而言,Chunk 仍非常重要。
所有 AI 技術都是黑箱,只能從原理、公開文件與運作邏輯去推斷。
Google 的意思「有可能」是指:不需要為了 Chunk 本末倒置,想辦法把文章切爛;只要本來寫好 SEO 就好,機器會自己去適配理解。
因為所有的資訊檢索勢必會碰到 Chunk 的技術限制,它是運行的基礎,不可能說車子開上路,有沒有輪胎都 OK。
只是差在有些人是輪胎有氣就好,有些人會連輪胎廠牌都有要求。
Chunk 的技術原理:AI 怎麼找資料?
AI 引用網頁的標準是什麼?
沒有任何一家模型公開過 AI 引用網頁的標準,所有坊間 GEO 相關數據都來自第三方機構的實驗設計。
但可以從已知的 SEO 理論推測方向:在單一 Chunk 內,至少滿足方便檢索、內容正確、有人背書的條件。
- 方便檢索:如果 AI 找不到網站,或看不懂段落主題,就不會引用 Chunk。
- 內容正確:AI 要對使用者負責,不小心講錯是一件事情,但它們不會找明擺錯誤的資訊。
- 有人背書:如果 AI 講錯話,至少生成來源有憑有據。
這大致上可以對應到 SEO 的「技術 SEO」、「內容 SEO」以及「E-E-A-T」。
理論上當今天網站正常可索引、內容正確(最好有數據證明)、有權威證書或強烈的實體訊號,就已經把 80% 被 AI 引用的可能性握在手上。
附註:所有保證 GEO 絕對引用的行銷公司都有問題,因為技術上不可能 100%,連 Ahrefs 都做不到。
關於背書,有一段 GPT 相關的 GEO 軼事分享。
免責聲明:這件事情沒有任何官方證據,也不能斷定後續模型開發確實受此影響,純屬筆者個人觀察與使用體驗。
Open AI 因為旗下產品 GPT 曾經很愛亂講話(俗稱 AI 幻覺),在美國打了非常多場官司。
從 4o 到現今 5.6 sol 的模型發展,可說少不了這些法律「助力」。
以往 AI 偏好張口就來,而在 GPT 5 系列開始出現「絕對不把話說死」跟「絕對要引用網站來背書,尤其是官方權威網站資料」的傾向。
推測是至少當 GPT 說錯話也有跡可循,使用者可以判斷是有人本來就在亂說話,還是 GPT 在黑白來。
其他公司是否借鑒同行慘況只能腦補,不過同在一個產業,對手的官司就是免費教材。
不只 GPT 出現過問題,Google 的 AI 產品 Bard(現已更名為 Gemini)也曾因為 AI 幻覺,使 Alphabet 股價當天跌約 8%,市值蒸發近千億美元。
——當時 Bard 在 Demo 宣傳影片中,將天文學事實講錯(「第一張系外行星照片」實際是歐洲南方天文台 2004 年拍的,不是韋伯望遠鏡)。
AI 幻覺一直是 AI 工程的大問題,引用來源可以有效降低(不是根絕)發生機率。
Query Fan-out 是什麼?
Query Fan-out 是 AI 搜尋機制之一:將主要問題像扇子一樣展開,延伸許多小問題(扇面),並形成支撐主問題的完整扇狀結構。
假設有人問「兔子可以吃蘋果嗎」,AI 會先判斷出相關的一連串小問題:兔子的消化系統怎麼運作、蘋果的糖分高不高、蘋果籽有沒有毒、一次建議吃多少?
然後 AI 再根據這些小問題分頭去查網路上的 Chunk,一題一題找答案,最後再組合成完整回覆。
整個運作過程雖然只需要幾秒鐘,但實際上卻在後台運行了數百次搜尋動作。
這對 SEO 的意義重大:當你想提升 GEO 機率,SEO 佈局不再是針對大型關鍵字,而是想辦法提升站內長尾關鍵字的覆蓋率、提升 Chunk 品質,並且盡量去滿足口語化與 PAA 的搜尋需求。
當一篇文章能回答的小問題越多,被撈到的入口就越多。
Title、URL
AI 撈搜尋結果的時候,第一眼看到的是標題、網址,還有一小段摘要——就像店鋪的自我介紹。
它會先看名稱,判斷這是哪個網站、Title 與 URL 在講什麼,再決定要不要進去撈資料。
如果名稱跟它手上的問題需求對不起來,內文寫得再好,這扇門都不會被打開。
就像是如果你今天想買五金配件,不會進便當店去找;想找在地美食推薦,也不會打開一篇標題寫著「0056 與 0050 投資比較」的文章,AI 也是如此。
因此現在流行在網站根目錄放一個 llms.txt,這份文件等同電子名片,AI 路過找資料就會先撈這個文件來看——不過目前沒有直接證據 llms.txt 一定會提高 AI 引用機率,但了勝於無。
Ahrefs 分析了 140 萬筆 ChatGPT 提問,根據數據:被引用頁面的標題與問題語意相似度是 0.602,沒被引用的是 0.484,差異極大。
網址是不是自然語言也有影響:自然語言網址(像 /dog-apple-guide)的引用率是 89.78%,參數式網址(像漢字或是 /p?id=8871)只有 81.11%。
光是 URL 的設計,就讓 GEO 引用差了 8 個百分點。
因此 GEO 的引用順序依然與 SEO 基礎一樣,先把 Title、URL、Meta 跟 Schema 處理完後,才考慮文章本身的架構與 Chunk 優化。
Embedding 與 RAG 檢索是什麼?
Embedding 是一種向量技術,將每段文字轉換成一個「語意座標」。
可以想像成一張巨大的地圖:意思相近的詞語,會住在地圖上相鄰的位置。
AI 的本質是機率模型,它逐 token 在眾多的方向中選擇「最常出現路徑」,再串成一系列文字——而在生成之前找資料、比對語意靠的就是 Embedding 與 RAG 檢索。
以諺語舉例,諺語是最強的語意向量,例如說第一句話是「An apple a day」,無論是人類或 AI ,都會基於知識訓練接上「keeps the doctor away」。
機器不懂中文也不懂英文,可是它會量距離——問題的座標離哪段文字最近,就把那段抓出來。
Embedding 就像是一張自己畫好的藏寶圖,使用者的問題解答就是寶藏。
而「查地圖→拿到資料→照資料回答」的過程叫做 RAG 。
RAG 拆開來是三個步驟:
- Retrieval:去外面抓資料(通常根據 Embedding 定義出的座標)
- Augmented:把抓到的內容塞給模型當參考
- Generation:模型照著參考生成回答
因此 AI 並不是把整個網路背下來,常見謬認是「AI 什麼都知道」,實際上更多情況它是開書考,直接現場連網路去找資料。
而 SEO 文章,就是它翻開的那本書裡的某一頁。
Chunking 有哪些切法?
工程師處理內容時,有四種主流的切法。
- Fixed-size:每固定字數切成一段,不管句子有沒有講完。最陽春,但成本最低
- Recursive:先照段落切,段落太大再照句子切,像先分大塊、再分小塊
- Semantic:先讀懂語意,在話題轉換的地方分段。最貼近人的閱讀,也最花運算
- Sliding window + overlap:讓每一塊的頭尾互相重疊一小段,避免前後文接不起來
每家系統採用的切法都不一樣,而且工程團隊為了節省成本、加快速度,隨時可能調整。
認識它們的目的,只是理解機器在做什麼,不建議研究模仿,因為成效太低。
今天猜中「某家每 500 個 token 切一段」,下個月它可能就換了做法。
如果把心力花在猜切法上,是一場永遠追不完的賽跑,坊間普遍共識是 150 ~ 300 字內就可以了,低於或超過也不要緊,真正重要的還是文章的整體內容品質。
不管從哪裡切開,只要文字段落本身有價值,內容精簡扼要、語意邊界清楚,這樣切出來的每一塊都是完整的 Chunk。
AI 工程中還有個名詞叫做 surprisal(驚訝值),意思是「下一個元素有多難預測」。
surprisal 的高峰常常就是 Chunk 的邊界,因為 Chunk 內部的元素彼此高度可預測,所以 Chunk 內的 surprisal 很低;一跨到 Chunk 邊界,可預測性掉下來,surprisal 就突然升高。
嬰兒切分「詞」的方式也是使用 surprisal spike 找 Chunk 邊界。
換句話說,對 LLM 而言,它們會自己根據自然語言段落找到 Chunk 的切分方式——前提是文章寫得很好讀。
如果想找反面案例,可以去看看普魯斯特的《追憶似水年華》,他那個年代沒有 LLM,但他撰寫的方式非常 Anti-Chunking。
反而後人整理的「瑪德蓮時刻」成了經典 Chunking 案例。
Chunk 相關常見問題
文章加 FAQ 對 SEO 有用嗎?
Google 已停止顯示 FAQ rich results,一開始只保留給醫療與權威機構,後續也全數移除。
官方立場是文章內容本身清楚即可。
即使如此,FAQ 依然值得寫,因為每一題天生就是一個自足的 chunk:一個明確的問題,配一個完整的答案。
它同時對接搜尋引擎的 People Also Ask,也對接 AI fan-out 拆出來的小問題。
條件只有一個:答案要真的有資訊量,不能把問題換個說法重講一次。

至於 FAQ Schema 標記本身,Ahrefs 2026 年的對照研究追蹤了近兩千個加上 schema 的頁面,發現 AI 引用量沒有顯著變化。
不過業界普遍還是會加,理由很單純:因為加了不扣分,成本趨近於零,那就當保險。
Google 官方 SEO 指南可以信任嗎?
方向可信,細節不好說。
官方說法與市面實測滿常打架的,尤其是在操作層的細節,像是對 AI 內容的容忍度、連結權重的計算方式。
但「寫對人類有用的正確內容」這個方向,一直都是 SEO 核心。
從上個世紀剛出來的 Google 搜尋引擎就一直強調人本核心,而市面實測與任何行銷學也都一直支持「從使用者角度出發」的概念。
Chunk 剛好站在多者的交集上:官方跟消費者都需要好讀有用的簡單段落,第三方實測也顯示段落引用真的有效,理論上 LLM 也確實使用 Chunk 作為引用單位。
GEO/AI Search 流量真的很高嗎?
流量很低,價值很高。
Ahrefs 實測自家網站:AI 搜尋只佔總流量的 0.5%,卻貢獻了 12.1% 的註冊,換算下來轉化率是傳統搜尋的 23 倍。
原因是 AI 先替網站過濾掉隨便逛逛的訪客,會點進來的人,多半已經讀過摘要、帶著明確的意圖。
不過 23 倍是 B2B 的極端值:跨產業平均大約 4 到 5 倍,低考慮度的電商可能只有 1.3 倍。
另外筆者個人觀察與猜測:由於現代人交友模式改變,對 LLM 容易產生擬社會關係與情感依賴,因此會產生近似以往「朋友推薦肯定有效」的口碑盲推。
以前長輩會說:「我朋友推薦我這個保健食品!」
現代人只是換成:「GPT 推薦我這個保健食品!」
日本年輕社群甚至會暱稱 GPT 為 チャッピー(Chappy/恰比) ,當成生活中非常重要的好朋友——這種情感關係,可能也是為什麼 GEO 帶來的流量雖然低,變現價值卻如同網路黃金。
SEO 文章每段應該寫多長?
沒有標準數字,因為標準不是字數,而是語意完整:一段回答一個問題,脫離上下文仍然成立。
有些答案兩句就完整了,有些需要八句才說得清楚。
與其數字數,不如檢查段落裡的主詞、條件、數字有沒有到齊。
Chunking 跟 Passage Ranking 是同一件事嗎?
不是,但方向相同。
Passage Ranking 是 Google 的排名機制:讓網頁中的單一段落,可以獨立參與排名。
Chunking 是檢索系統的處理動作:把內容切成小塊,方便計算與抽取。
一個發生在排名端,一個發生在檢索端。
對 SEO 而言,兩者要求的是同一件事—— 每個段落,都要能被獨立理解 。
圖片、影片也能被 AI 引用嗎?
可以,而且是趨勢,但路徑和文字不一樣。
圖片跟影片也是 Chunk,因為 Chunk 的本質是「引用單位」,多媒體只是換了一種分組方式。
圖片靠 Alt 與圖說這些文字描述被切進檢索系統;
圖片依賴 ALT 文字,影片則是仰賴語音轉文字檔技術(或 SRT 字幕外掛),當影片被引用時,抓的是逐字稿的某一段——這就是影片版的 Chunk,這也是為什麼字幕檔比影片畫質會更影響引用狀況。
另外,由於資訊轉檔的科技進步,以往無法引用的媒體內容,現在都會在搜尋頁面上出現。
甚至 GSC 本身已經追加數據追蹤的功能,可以在同個介面新增 Youtube/IG/Threads 等來源,追蹤 Google 的多媒體引用次數。
Meta 家也在 2025 年年底開放了爬蟲引用,社群媒體的聲量在台灣突飛猛進,社群 SEO 與實體品牌經營,儼然成為未來 SEO 的主要戰場之一。
Google 官方實際上也常將 Youtube 影片與圖片放到 SERP,尤其是教學類內容(像是怎麼織毛線),這種需要跟著操作的內容,特別容易出現在搜尋結果。
三件事加強影音引用機率:
- 替圖片寫具體的 alt 與圖說(描述畫面內容,不是塞關鍵字)
- 替影片提供完整字幕或逐字稿
- 上 ImageObject 和 VideoObject 結構化資料。
Chunk、Snippet 與段落差在哪裡?
- Chunk : AI 系統切的,把整篇文章拆成固定大小的片段做向量檢索,讀者從頭到尾看不到它;
- Snippet :搜尋引擎切的,從頁面挑出一小段顯示在搜尋結果上,讓人決定要不要點進來;
- 段落:作者切的,服務人類的閱讀節奏。
三者不一定相同,但也有可能相同。
你精心安排的段落,可能被 chunking 從中間截斷;一個 chunk 也可能橫跨兩個主題不同的段落,讓檢索到的內容前言不搭後語。
因此 GEO 寫作的實務建議仍是讓 Chunk 自足:讓每個段落語意完整(主詞寫清楚、不依賴上一段的代名詞、一段講完一件事)。
這樣不論系統在哪裡切分,被抓到的片段都能獨立成立。
AI 為什麼不引用我的文章?
可能性非常多,常見可能包含但不限於「架構亂七八糟」、「內容沒有新意」、「網站權威不夠」、「競品網站寫太強」。
但寫得好是提升引用機率,而非百發百中。
根據 Ahrefs 研究:ChatGPT 每次回答會撈回幾十個網址,最後只引用大約一半。
另一半被讀過、被參考過,然後安靜地留在資料庫,等 Web Search 工具跑完,連點開思考鏈都看不到引用了哪些網站。
最明顯的例子是 Reddit,雖然 ChatGPT 撈了超過 1,600 萬筆 Reddit 內容,用來理解話題、感受大家的共識。
但引用率只有 1.93%——一百筆裡面,被列出來的不到兩筆,它跟論壇學習,然後把引用留給機構網站。
另外瘋狂刷新同一篇文章的更新日期,卻沒改變文章品質也沒有用。
語意相關仍是最重要的決勝點。
在研究中,比較同一批撈取頁面的更新日期,實際被引用頁面的年齡中位數大約 500 天,等於一年四個月前的內容,與更新日期沒有強關聯。
但如果你的標題是「2024 父親節推薦十大禮物!」這類就另當別論……無論是使用者還是 AI,都對最新年份的資料比較有興趣。