เครื่องมือทดสอบ robots.txt และเช็กกฎการครอว์
ดึงไฟล์ robots.txt สด ๆ จากเว็บไซต์ใดก็ได้ หรือจะวางไฟล์ของคุณเอง แล้วทดสอบว่า URL ที่ต้องการถูกครอว์ได้หรือไม่ เครื่องมือฟรีนี้ตีความกลุ่ม User-agent กฎ Allow/Disallow และบรรทัด Sitemap เหมือนที่ Google ทำจริง คือกฎที่ตรงยาวที่สุดชนะ รองรับ wildcard (*) และ end-anchor ($) เต็มรูปแบบ เหมาะสำหรับนัก SEO นักพัฒนา และเจ้าของเว็บที่อยากได้ผลตัดสิน อนุญาต หรือ ถูกบล็อก ที่ชัดเจน
ทดสอบ URL
ใส่ path บนเว็บนี้ หรือ URL เต็มบนโฮสต์เดียวกัน
| กฎที่ตรงกัน | |
|---|---|
| กลุ่มที่ตรงกัน | |
| path ที่ทดสอบ (encoded) Google เทียบกฎกับ path แบบ percent-encoded เราจึงทดสอบในรูปนั้น | |
คำเตือนจากการตรวจไฟล์
กลุ่ม User-agent
| User-agent | จำนวน |
|---|
Sitemap
ไม่มีบรรทัด Sitemap: ในไฟล์นี้
เนื้อหา robots.txt
ทดสอบ robots.txt ของเว็บใดก็ได้
ดึง robots.txt สด ๆ หรือวางไฟล์เอง แล้วเช็กว่า URL ถูกครอว์ได้โดย Googlebot และบอทอื่น ๆ หรือไม่
วิธีใช้งาน
- ใส่ URL เว็บไซต์แล้วกดดึง เราจะประกอบเป็น {origin}/robots.txt ให้ หรือจะวางไฟล์ที่มีอยู่ก็ได้
- ดูไฟล์ดิบพร้อมเลขบรรทัด คำเตือนจากการตรวจ กลุ่ม User-agent และ Sitemap ที่ประกาศไว้
- พิมพ์ path หรือ URL เต็มที่ต้องการเช็ก แล้วเลือกครอว์เลอร์ (ค่าเริ่มต้นคือ Googlebot)
- กดทดสอบเพื่อดูผล อนุญาต หรือ ถูกบล็อก พร้อมบรรทัดกฎที่ตรงกันแบบเป๊ะ ๆ
- คัดลอกสรุปผลทดสอบไปแชร์กับทีมหรือแปะในทิกเก็ตงานได้
ฟีเจอร์เด่น
- ดึง robots.txt ฝั่งเซิร์ฟเวอร์ และแสดงไฟล์ดิบพร้อมเลขบรรทัด
- จับคู่กฎแม่นยำแบบ Google กฎที่ยาวที่สุดชนะ เสมอกันให้ Allow ชนะ รองรับ wildcard * และ $
- ทดสอบกับ Googlebot, Googlebot-Image, Googlebot-News, Bingbot, Twitterbot, facebookexternalhit หรือกำหนดเอง
- เตือนปัญหาในไฟล์ เช่น คำสั่งที่ไม่รู้จัก กฎที่อยู่ก่อน User-agent ตัวแรก และปัญหา BOM
- รองรับ path ภาษาไทยและ UTF-8 โดยทดสอบในรูป percent-encoded ที่ Google ใช้เทียบจริง
- อธิบายสถานะเชิงข้อมูล ไฟล์หาย (404) คืออนุญาตทั้งหมด ส่วน 5xx ซ้ำ ๆ คือห้ามครอว์ทั้งเว็บ
คำถามที่พบบ่อย
ถ้าเว็บไม่มี robots.txt จะเกิดอะไรขึ้น?
ไฟล์หายหรือ 404 ไม่ใช่ข้อผิดพลาด ครอว์เลอร์จะถือว่าได้รับอนุญาตให้ครอว์ทั้งเว็บ เครื่องมือจะแสดงเป็นสถานะเชิงข้อมูล "อนุญาตทั้งหมด" ไม่ใช่ error
เมื่อทั้ง Allow และ Disallow ตรงกัน จะตัดสินอย่างไร?
ตามกติกาของ Google กฎที่เจาะจงที่สุดคือกฎที่มี path ตรงกันยาวที่สุดจะชนะ หากยาวเท่ากัน Allow จะชนะ เครื่องมือจะแสดงบรรทัดที่ตัดสินผลให้เห็นเสมอ
รองรับ wildcard และเครื่องหมาย $ ท้าย path ไหม?
รองรับ * แทนอักขระกี่ตัวก็ได้ และ $ ใช้ยึดกฎไว้ที่ท้าย path ของ URL ตรงตามความหมายของ Google และ RFC 9309 ทำให้ทดสอบกฎอย่าง Disallow: /*.pdf$ ได้ถูกต้อง
ทำไมต้องทดสอบ URL ภาษาไทยในรูป percent-encoded?
Google เทียบกฎ robots.txt กับ path แบบ percent-encoded ดังนั้น URL ภาษาไทยจะถูกจับคู่ในรูป %E0%B8… เครื่องมือจึง encode path ที่คุณทดสอบแบบเดียวกัน และแสดงทั้งรูปอ่านง่ายและรูป encoded
robots.txt ตอบกลับ 5xx หมายความว่าอย่างไร?
5xx ครั้งเดียวอาจเป็นแค่ชั่วคราว แต่ถ้า robots.txt ตอบ 5xx ต่อเนื่อง Google จะตีความว่า "ห้ามครอว์ทั้งหมด" ซึ่งอาจทำให้ทั้งเว็บหลุดดัชนี เครื่องมือจะเตือนเมื่อพบข้อผิดพลาดฝั่งเซิร์ฟเวอร์เพื่อให้คุณรีบแก้