Robots.txt Generator | Bingo Web Rabbit

Robots.txt Generator


Mặc định - Tất cả robot:  
    
Độ trễ thu thập:
    
Thư mục trang: (để trống nếu không có) 
     
Robot tìm kiếm: Google
  Google Image
  Google Mobile
  MSN Search
  Yahoo
  Yahoo MM
  Yahoo Blogs
  Ask/Teoma
  GigaBlast
  DMOZ Checker
  Nutch
  Alexa/Wayback
  Baidu
  Naver
  MSN PicSearch
   
Thư mục bị hạn chế: Đường dẫn tương đối với thư mục gốc và phải kết thúc bằng dấu gạch chéo "/"
 
 
 
 
 
 
   



Bây giờ hãy tạo tệp "robots.txt" trong thư mục gốc. Sao chép văn bản ở trên và dán vào tệp văn bản.


Trình tạo Robots.txt Miễn phí

Tạo một tệp robots.txt chuẩn cho trang web của bạn mà không cần viết mã từ đầu.

Công cụ miễn phí này giúp bạn xây dựng các quy tắc thông báo cho bot của công cụ tìm kiếm biết phần nào trên trang web của bạn được phép thu thập dữ liệu và phần nào nên bỏ qua. Hãy điền các tùy chọn, tạo tệp và tải tệp lên thư mục gốc trên trang web của bạn’s.

Tệp Robots.txt là gì?

Robots.txt là một tệp văn bản đơn giản nằm trong thư mục gốc của trang web của bạn (ví dụ: https://yoursite.com/robots.txt).

Khi các công cụ tìm kiếm như Google truy cập trang web của bạn, chúng sẽ tìm tệp này để hiểu các hướng dẫn thu thập dữ liệu được cung cấp cho các bot khác nhau.

Bạn có thể sử dụng tệp này để:

  • Cho phép thu thập dữ liệu các trang quan trọng
  • Chặn các phần riêng tư, quản trị hoặc trùng lặp
  • Chỉ đường cho bot tới sơ đồ trang web (sitemap) XML của bạn
  • Giảm bớt việc thu thập dữ liệu không cần thiết trên các trang web lớn

Tệp này không ẩn các trang khỏi người dùng và không phải là công cụ bảo mật. Nó chỉ cung cấp các hướng dẫn thu thập dữ liệu mà các bot công cụ tìm kiếm tuân thủ có thể làm theo.

Tại sao bạn có thể cần một tệp Robots.txt

Không phải mọi trang web nhỏ đều cần một tệp robots.txt phức tạp, nhưng nó sẽ trở nên hữu ích khi:

  • Bạn có các trang quản trị hoặc trang đăng nhập mà bạn không muốn bị thu thập dữ liệu
  • Trang web của bạn tạo ra nhiều URL trùng lặp hoặc được lọc
  • Bạn muốn quản lý việc thu thập dữ liệu trên các khu vực thử nghiệm hoặc dàn dựng (staging)
  • Bạn vận hành một trang web lớn và muốn quản lý hoạt động thu thập dữ liệu
  • Bạn sử dụng WordPress và muốn quản lý quyền truy cập vào một số thư mục hệ thống nhất định

Một tệp robots.txt được viết tốt có thể giúp các công cụ tìm kiếm tập trung thu thập dữ liệu vào các khu vực trên trang web mà bạn muốn chúng truy cập.

Cách sử dụng Trình tạo này

How to Use This Generator
  1. Chọn hành vi mặc định cho tất cả các robot (cho phép hoặc không cho phép).
  2. Thêm thời gian trễ thu thập dữ liệu (crawl-delay) nếu cần (tùy chọn).
  3. Nhập URL sitemap của bạn nếu có.
  4. Chọn các công cụ tìm kiếm cụ thể nếu bạn muốn áp dụng các quy tắc khác nhau.
  5. Thêm bất kỳ thư mục hoặc đường dẫn nào bạn muốn chặn.
  6. Tạo tệp.
  7. Sao chép văn bản và lưu thành robots.txt.
  8. Tải tệp lên thư mục gốc của trang web của bạn.

Sau khi tải lên, hãy mở https://yourdomain.com/robots.txt trong trình duyệt của bạn và kiểm tra xem tệp có tải chính xác không. Bạn cũng có thể sử dụng công cụ Kiểm tra URL (URL Inspection) của Google Search Console để kiểm tra xem các URL cụ thể có được Google truy cập hay không. Hãy nhớ rằng robots.txt kiểm soát việc thu thập dữ liệu và không trực tiếp xóa một trang khỏi kết quả tìm kiếm của Google.

Những điều quan trọng cần ghi nhớ

  • Một sai sót nhỏ có thể chặn các trang quan trọng không thể thu thập dữ liệu.
  • Luôn kiểm tra kỹ các quy tắc đã tạo trước khi tải lên.
  • Không bao giờ sử dụng robots.txt để ẩn nội dung nhạy cảm. Thay vào đó, hãy sử dụng tính năng bảo vệ bằng mật khẩu thích hợp hoặc các điều khiển noindex phù hợp.
  • Robots.txt và sơ đồ trang web XML hoạt động cùng nhau nhưng phục vụ các mục đích khác nhau.
  • Sau khi tải lên một tệp robots.txt mới, hãy cho các công cụ tìm kiếm một chút thời gian để nhận ra các thay đổi.

Giải thích đơn giản về các Chỉ thị phổ biến

Chỉ thị (Directive) Chức năng
User-agent Chỉ định bot nào sẽ áp dụng quy tắc.
Disallow Chặn một trang hoặc thư mục khỏi việc thu thập dữ liệu.
Allow Cho phép truy cập vào một trang hoặc đường dẫn, hữu ích cho các ngoại lệ.
Sitemap Cho các bot công cụ tìm kiếm biết vị trí sơ đồ trang web XML của bạn.
Crawl-delay Đề xuất khoảng dừng giữa các yêu cầu của trình thu thập dữ liệu. Khả năng hỗ trợ có thể khác nhau tùy theo công cụ tìm kiếm.

Công cụ miễn phí liên quan

Lưu ý
Trình tạo này tạo ra một tệp robots.txt tiêu chuẩn dựa trên các tùy chọn bạn chọn. Luôn xem xét kỹ mã cuối cùng trước khi xuất bản. Các quy tắc không chính xác có thể ngăn các công cụ tìm kiếm truy cập vào nội dung quan trọng trên trang web của bạn.