靜態 SEO 部署
robots.txt、XML Sitemap 與 hreflang:分開檢查 SEO 契約
這些檔案協助 crawler 理解網站,但都不能證明網址存在、是 canonical 或一定收錄。請分別檢查各項契約及正式回應。
內容更新: · 維護者與修正回報
爬取許可不是存取控制或 noindex
robots.txt 是公開 crawler 指引。選擇正確 user-agent 群組、檢查最明確的命中路徑;支援的匹配方言中,明確度相同時 Allow 優先。大小寫、百分比編碼、萬用字元及結尾錨點都重要;不支援的指令應另查文件。
被禁止爬取的網址仍可能被搜尋引擎知道;禁止爬取也可能讓 crawler 看不到頁面的 noindex。私密資源應以真正的身分驗證及授權保護,而不是 robots.txt。離線測試無法證明正式檔案狀態、位置或 crawler 快取副本。
Sitemap 列出候選,不驗證頁面存在
urlset 列頁面網址,sitemapindex 列 sitemap 網址。使用正確命名空間、XML 跳脫與完整網址。lastmod 應描述真正的重要修改,不是排程建置執行時間;重複或語法正確的項目都不能證明 canonical 或網址可用。
協定允許每檔最多 50,000 項、解壓後 50 MiB。本機檢視器刻意採較小的瀏覽器處理限制,不是另訂協定規則;不抓取索引或頁面、不處理 gzip、不驗證所有擴充 Schema,也不能取代 Search Console。
語言對應需要完整且一致的集合
使用支援的語言碼、選用文字或地區子標籤、完整網址,並明確選擇 x-default 替代頁。地區本身不是語言標籤;例如 zh-TW 與 zh-Hant 可描述繁體中文對應,es-419 則不是 Google 支援的地區碼。
每個對應頁都要列出自己與互返 alternate。複製產生的映射,不能證明遠端互返、頁面語言或可收錄性。各語言 canonical 應指向真正偏好網址;不要只因英文是預設語言,就把所有已翻譯內容 canonical 到英文。
資料可信度