Cyrus
16
8 月

第 5 章:搜尋引擎如何運作?——檢索、索引、排名三階段完整解析

第 5 章:搜尋引擎如何運作?——檢索、索引、排名三階段完整解析

Cyrus

一句話講晒

Crawl → Index → Rank。爬蟲抓網頁 → 存入索引資料庫 → 演算法排順序。SEO 就係圍繞呢三個環節做優化。

為什麼要搞懂搜尋引擎運作原理?

做 SEO 最忌「知其然而不知其所以然」。如果你不理解 Google 是怎麼「看到」你的網站、怎麼「理解」你的內容、怎麼「決定」你的排名,你的所有優化動作都可能只是猜測。理解運作原理,你才能:

  • 判斷「為什麼我的新頁面還沒被收錄」
  • 診斷「為什麼改了內容排名沒變」
  • 避開「做了優化反而排名下降」的陷阱

��一階段:檢索(Crawling)——Google 如何「發現」你的網站

爬蟲的運作方式

Google 使用一個名為 Googlebot 的自動化程式(爬蟲),它像一個不知疲倦的圖書管理員,24 小時不停地在網路上「逛網站」。爬蟲的工作流程是:

起點 URL → 下載頁面 → 解析頁面中的所有連結 → 將新連結加入待抓取佇列 → 重複循環

爬蟲如何發現新頁面?

  1. 從已知 URL 出發:Google 維護著一個龐大的已知網址清單
  2. 透過連結發現:當爬蟲訪問一個頁面時,會抓取頁面中的所有超連結,加入待抓取清單
  3. 透過 Sitemap:網站主動提交 XML 網站地圖,告訴 Google 所有頁面的位置
  4. 透過 URL 提交:在 Google Search Console 中手動提交個別網址

影響檢索效率的關鍵因素

因素 說明 優化建議
檢索預算(Crawl Budget) Google 分配給每個網站的爬取資源是有限的 避免大量低質量頁面浪費預算
網站速度 爬蟲也受頁面載入速度影響 優化伺服器回應時間和頁面載入速度
內部連結結構 良好的內部連結幫助爬蟲發現更多頁面 確保每個重要頁面都有內部連結指向
Robots.txt 設定 錯誤設定可能阻止爬蟲訪問重要頁面 定期檢查 robots.txt,不要誤擋關鍵資源
JavaScript 渲染 依賴 JS 動態生成的內容可能無法被爬蟲「看見」 使用 SSR(伺服器端渲染)或預渲染技術

檢索階段常見問題

  • 孤兒頁面(Orphan Page):沒有任何內部連結指向的頁面,爬蟲幾乎不可能發現
  • 深層頁面:需要點擊多次才能到達的頁面,爬蟲可能不會爬那麼深
  • 無限空間頁面:如篩選器產生的大量 URL 變體,會浪費檢索預算

第二階段:索引(Indexing)——Google 如何「理解」你的網站

索引是什麼?

爬蟲抓取到頁面之後,Google 會對內容進行解析、分析、分類,然後存入一��巨大的資料庫——這就是「索引」。只有被成功索引的頁面,才有資格出現在搜尋結果中。

想像 Google 的索引是一間全世界最大的圖書館��每本「書」(網頁)都被分類、貼上標籤、建立摘要,當有人來查資料時,圖書管理員(搜尋引擎)就能快速從索引中找到相關的書。

索引過程中的關鍵步驟

  1. 內容解析(Parsing)
    – 解析 HTML 結構
    – 提取文字內容
    – 識別圖片、影片等多媒體(透過 alt text)
    – 執行並解析 JavaScript(如有)

  2. 內容理解(Understanding)
    – 判斷頁面語言
    – 識別核心主題和子主題
    – 分析內容品質與原創性
    – 理解實體(人物、地點、事物)之間的關係

  3. 訊號提取(Signal Extraction)
    – 頁面速度
    – 行動裝置相容性
    – HTTPS 安全狀態
    – 結構化資料

  4. 分類與儲存
    – 將頁面歸入相關主題類別
    – 儲存到分散式索引資料庫

為什麼頁面沒有被索引?

原因 診斷方式
Noindex 標籤 檢查頁面 <head> 中是否有 <meta name="robots" content="noindex">
Canonical 指向其他頁面 檢查 canonical 標籤是否正確
內容質量過低 Google 判斷為「低品質」或「薄內容」
重複內容 多個頁面內容高度相似
Robots.txt 阻擋 檢查 robots.txt 是否阻擋了該 URL
伺服器問題 檢查頁面是否返回 4xx 或 5xx 狀態碼
新網站信號不足 新成立的網站需要時間建立信任

「已檢索但未索引」是 Google Search Console 中最常見的問題之一。大部分情況代表 Google 認為該頁面不值得被索引——需要檢查內容品質和獨特性。

第三階段:排名(Ranking)——Google 如何「排序」你的網站

排名的本質

當用戶輸入查詢詞,Google 會在不到一秒鐘的時間內,從數十億個已索引頁面中,選出最相關、最有用的結果,並按照相關性排序。這個過程涉及 超過 200 個排名因素

什麼是演算法?

演算法不是一本「食譜」——你無法照著步驟做就保證排第一。它更像一個動態的評分系統

排名分數 = 相關性分數 × 權威性分數 × 用戶體驗分數 × 其他信號

核心排名因素解析

A. 相關性(Relevance)

子因素 影響方式
關鍵字匹配 頁面內容是否包含用戶搜尋的詞彙及其語意相關詞
內容深度 是否完整涵蓋主題的各個面向
內容新鮮度 資訊是否最新(特別是新聞、時事類查詢)
搜尋意圖匹配 內容類型(資訊型/交易型)是否與用戶意圖相符
結構化資料 Schema 標記是否能幫助搜尋引擎理解內容

B. 權威性(Authority)

子因素 影響方式
反向連結數量 有多少外部網站連結到你的頁面
反向連結品質 這些連結來自高權重的網站還是垃圾網站
連結相關性 連結來源網站的內容是否與你的頁面主題相關
E-E-A-T 信號 作者背景、網站聲譽、內容準確性

C. 用戶體驗(User Experience)

子因素 影響方式
Core Web Vitals LCP、INP、CLS 三個核心指標
行動裝置友善 在手機上的顯示和操作體驗
HTTPS 網站是否使用安全連線
沒有侵入式插頁廣告 彈出式廣告是否影響閱讀
頁面載入速度 整體載入時間

D. 用戶互動信號(User Interaction Signals)

子因素 影響方式
點擊率(CTR) 在 SERP 中被點擊的比例
停留時間(Dwell Time) 用戶點擊後停留在頁面上的時間
跳出率(Bounce Rate) 用戶是否只瀏覽一個頁面就返回搜尋結果
Pogosticking 用戶在搜尋結果和不同頁面之間來回跳轉

三階段示意圖

┌──────────┐    ┌──────────┐    ┌──────────┐
│  Crawl   │───▶│  Index   │───▶│  Rank    │
│  檢索     │    │  索引     │    │  排名     │
└──────────┘    └──────────┘    └──────────┘
     │               │               │
     ▼               ▼               ▼
 爬蟲訪問網頁    內容存入資料庫    演算法排序
 發現新 URL      解析與分類       回傳 SERP
 跟隨連結        提取信號         給用戶

SEO 實戰對照:每個階段你該做什麼

階段 你該做什麼 對應工具
檢索 提交 Sitemap、優化內部連結、確保 robots.txt 正確、加快頁面速度 GSC、Screaming Frog
索引 提交 URL 至 GSC、避免 noindex 誤用、處理 canonical 問題、消滅重複內容 GSC 涵蓋範圍報告
排名 關鍵字策略、內容優化、建立反向連結、改善 Core Web Vitals Ahrefs、SEMrush、Lighthouse

重點回顧

  1. Crawl → Index → Rank:記住這三個階段,每個 SEO 問題都能歸類到其中一個環節
  2. 檢索是前提:如果爬蟲根本找不到你的頁��,後面的優化都沒有意義
  3. 索引是門檻:被「檢索」不代表被「索引」,低品質內容會被 Google 拒絕收錄
  4. 排名是結果:超過 200 個因素共同決定排名,沒有單一魔法按鈕
  5. 用戶才是最終裁判:所有演算法的最終目標都是服務用戶,創造好內容才是根本
上一章:SEO 基礎名詞辭典 回索引 下一章:SERP 搜尋結果頁全解析