robots.txt 測試器:命中規則與爬取判定
以提供的網址與 crawler 測試貼上的規則,檢查命中行及優先序,不爬取網站。
正在啟用本機工具…
1. 提供 robots.txt
僅分析提供的文字,視為 URL origin 的 robots.txt;不抓取網站。上限 1 MiB UTF-8、10,000 行、5,000 規則;每條路徑 2,048 字元、32 個 *,比對最多 2,000,000 步,超限整筆拒絕。
RFC 9309 路徑語意+Google 分組模式:product token 不分大小寫,最明確群組合併;路徑區分大小寫、最長匹配、Allow 同長度優先。支援 * 與結尾 $,比對 path+query,忽略 fragment;UTF-8 與 percent octets 正規化。未支援的指令列警告。此處不模擬 Google 500 KiB 抓取截斷;允許爬取不代表可索引,也不是權限控制。
2. 命中規則與原因
貼上規則與 URL 後測試。
如何使用這個工具
貼上 robots.txt、指定 crawler 與網址,再檢查選中的群組、命中規則及決定結果的行。部署前閱讀支援的匹配方言。
不適合用在什麼情況
允許爬取不保證收錄。robots.txt 是公開指引,不是存取控制;貼上文字不能證明正式檔案位置、HTTP 狀態或 crawler 行為。
閱讀實作指南 →