Robots.txt
Tóm tắt
Tệp text ở root domain hướng dẫn Google bot nào được vào, trang nào không — sai một dòng có thể "xóa" cả website khỏi Google.
Giải thích đơn giản
Robots.txt giống như biển chỉ dẫn ở cổng nhà — ghi rõ khách (Google) được vào phòng nào, phòng nào cấm. Nhưng nếu treo nhầm biển "cấm vào" ở cổng chính, không ai thăm nhà bạn nữa.
Robots.txt là tệp text ở root domain (example.com/robots.txt) hướng dẫn web crawlers trang nào được crawl và trang nào không. Sử dụng User-agent, Allow, Disallow directives. Không phải cơ chế bảo mật — chỉ là hướng dẫn.
Cấu trúc cơ bản: User-agent chỉ định bot, Disallow chặn đường dẫn, Allow cho phép exception trong Disallow. Sitemap directive trỏ đến XML sitemap. Crawl-delay (Bing hỗ trợ, Google không) hạn chế tốc độ crawl.
Lỗi phổ biến: Disallow: / chặn toàn bộ site, block CSS/JS (Google cần render trang), hoặc quên cập nhật sau khi chuyển domain/restructure. Robots.txt không ngăn được indexing nếu có backlinks — dùng noindex thay vì Disallow cho trang không muốn index.
⚡Tại sao quan trọng
Robots.txt sai có thể block Google crawl toàn bộ site — mất toàn bộ traffic organic. File này cũng chỉ đường đến sitemap.xml, giúp Google phát hiện trang mới nhanh hơn. Với AI crawlers (GPTBot, ClaudeBot), robots.txt là cách kiểm soát quyền truy cập AI.
🔍AiSEO kiểm tra thế nào
AiSEO tải và phân tích robots.txt: kiểm tra có block Googlebot không, xác minh sitemap reference, phát hiện lỗi cú pháp, kiểm tra AI crawler directives (GPTBot, ClaudeBot, Bingbot).
Điểm AiSEO
Đóng góp tối đa 10 điểm trong nhóm Common Files. Robots.txt tồn tại: 3đ, không block Googlebot: 3đ, có sitemap reference: 2đ, cú pháp hợp lệ: 2đ.
Độ khó sửa
Biên tập viên: Không áp dụng | Lập trình viên: Dễ | AI Agent: Dễ