Bỏ qua đến nội dung

Tệp robots.txt là gì: Cách chặn và cho phép bot thu thập dữ liệu website

Robots.txt là tệp văn bản đặt ở thư mục gốc website để gửi nội quy cho bot tìm kiếm. Nó giống biển hiệu lịch sự, không phải tường lửa — cần kết hợp mật khẩu và noindex để bảo vệ thật sự.

Phong Nguyen
Phong Nguyen

PNTECH Writer · 17/08/2026

0 lượt xem10 phút đọc

Tệp robots.txt là gì: Cách chặn và cho phép bot thu thập dữ liệu website

Robots.txt là tấm biển "Cấm vào" đặt trước cửa website

Bạn không thể chặn Google khỏi website hoàn toàn, nhưng bạn có thể treo một tấm biển "Cấm vào" cho những khu vực nhất định — và tấm biển đó tên là robots.txt. Đây là một tệp văn bản rất nhỏ, đặt ngay ở "cửa nhà" website, nơi các bot (chương trình tự động quét web) ghé đọc trước khi bắt đầu khám phá các trang bên trong. Bài viết này giúp bạn đặt tấm biển đúng chỗ, viết vài dòng chỉ thị đầu tiên và tránh những sai lầm khiến cả website bị bot bỏ qua.

Điểm quan trọng nhất cần nhớ ngay từ đầu: robots.txt không phải tường lửa hay ổ khóa. Nó giống biển hiệu lịch sự — bot "lịch sự" sẽ tôn trọng, nhưng bot xấu hoặc người cố tình vẫn có thể bỏ qua hoàn toàn. Nếu bạn cần bảo vệ dữ liệu thật sự, hãy dùng mật khẩu, xác thực hai yếu tố hoặc tường lửa.

Robots.txt nằm ở đâu trong quy trình SEO

Robots.txt là một tệp văn bản thuần túy (giống file .txt bạn mở bằng Notepad), chứa vài dòng chỉ thị đơn giản. Khi một bot của Google hoặc công cụ tìm kiếm khác ghé website của bạn, bước đầu tiên nó làm là mở tệp này để xem "nội quy" trước khi đi vào các trang bên trong.

Đây chính là lý do bạn cần quan tâm ngay từ khi website vừa lên mạng: nếu bạn không tạo tệp này, bot vẫn mặc định vào tất cả các trang — bao gồm cả trang quản trị đang thử nghiệm hoặc đường dẫn nhạy cảm. Ngược lại, nếu bạn viết sai một ký tự, cả website có thể biến mất khỏi Google. Bạn có thể tìm hiểu kỹ hơn về vị trí của robots.txt trong toàn bộ quy trình thu thập dữ liệu qua bài Cách công cụ tìm kiếm hoạt động (crawling – indexing – ranking).

Vị trí đặt tệp và cách xem của người khác

Robots.txt chỉ có hiệu lực khi được đặt đúng một vị trí duy nhất: thư mục gốc của website, tức là khi bạn gõ tenmiencuaban.com/robots.txt thì tệp phải hiện ra ngay. Nếu bạn lỡ đặt nó vào thư mục con (ví dụ tenmiencuaban.com/admin/robots.txt), bot sẽ bỏ qua hoàn toàn — bạn tưởng đã chặn, nhưng thực ra chưa chặn gì cả [S1][S3].

Một điểm thú vị: tệp robots.txt là công khai, bất kỳ ai cũng xem được chỉ bằng cách gõ đường dẫn vào trình duyệt [S3][S5]. Bạn có thể thử ngay bây giờ với bất kỳ website lớn nào — gõ tenmienbatky.com/robots.txt và xem họ đang cho phép, chặn những gì. Điều này dẫn đến một cảnh báo quan trọng mà chúng ta sẽ nói kỹ ở phần sau: đừng bao giờ liệt kê đường dẫn nhạy cảm trong tệp này, vì bạn đang "khai báo" chúng với cả thế giới.

Đọc một tệp robots.txt: cấu trúc cơ bản

Một tệp robots.txt điển hình gồm ba phần: phần giới thiệu (ghi chú cho người đọc), phần khai báo sitemap (nếu có), và phần chỉ thị chính. Dưới đây là các "từ khóa" bạn sẽ gặp thường xuyên:

  • User-agent: tên của bot mà bạn muốn nói chuyện. Dấu * nghĩa là "nói với tất cả bot" [S1].
  • Disallow: đường dẫn mà bot không được vào. Ví dụ Disallow: /thu-muc cấm bot quét thư mục đó [S1][S3].
  • Disallow để trống (chỉ gõ Disallow: không kèm đường dẫn) nghĩa là cho phép tất cả [S1].
  • Allow: cho phép một đường dẫn cụ thể, ngay cả khi thư mục cha đang bị chặn [S1].
  • Crawl-delay: yêu cầu bot chờ vài giây giữa các lần quét. Google không chính thức hỗ trợ chỉ thị này [S1][S2].
  • Dấu #: ghi chú cho người đọc, bot sẽ bỏ qua dòng này [S4].

Ngoài ra, Google còn hỗ trợ hai ký tự đặc biệt gọi là "wildcard" — * (đại diện cho chuỗi bất kỳ) và $ (đánh dấu kết thúc URL) — để viết chỉ thị linh hoạt hơn [S1]. Tuy nhiên, mức hỗ trợ của các bot khác như Bing, GPTBot hay Common Crawl có thể khác nhau, nên bạn cần kiểm tra lại trên tài liệu chính thức của từng bot trước khi áp dụng.

Minh họa tệp robots.txt như tấm biển trước cửa website

Ba tình huống viết nhanh cho người mới

Bạn không cần viết dài. Hầu hết website cá nhân hoặc shop nhỏ chỉ cần một trong ba mẫu dưới đây là đủ dùng trong vài tháng đầu.

Tình huống 1: Chặn toàn bộ khi đang làm web

Khi bạn đang dựng web và chưa muốn Google vào xem, hãy dùng hai dòng đơn giản:

User-agent: *
Disallow: /

Dòng đầu nghĩa là "nói với mọi bot", dòng thứ hai nghĩa là "cấm vào toàn bộ website" [S4][S8]. Khi web đã sẵn sàng, bạn chỉ cần sửa hoặc xóa tệp này.

Tình huống 2: Cho phép toàn bộ

Mặc định, nếu bạn không tạo tệp robots.txt, bot vẫn vào tất cả các trang. Tuy nhiên, bạn nên tạo một tệp rỗng và khai báo sitemap để chủ động hơn [S2]:

User-agent: *
Disallow:
Sitemap: https://tenmiencuaban.com/sitemap.xml

Dòng Disallow để trống chính là cách nói "cho phép tất cả" một cách tường minh. Khai báo sitemap giúp Google biết nơi lấy danh sách trang đầy đủ — bạn có thể đọc thêm sự khác biệt giữa các loại sitemap trong bài HTML sitemap vs XML sitemap.

Tình huống 3: Chặn một thư mục cụ thể

Đây là tình huống phổ biến nhất: bạn muốn Google vào trang sản phẩm, trang blog, nhưng không vào khu vực quản trị hoặc trang thử nghiệm. Ví dụ:

User-agent: *
Disallow: /admin/
Disallow: /test/
Disallow: /includes/

Trước khi áp dụng, hãy tự hỏi: thư mục đó có thật sự cần được ẩn khỏi Google không, và nó có đang hiển thị công khai trên trang chủ không [S4][S7]. Nếu câu trả lời là "không quan trọng", bạn có thể không cần chặn — để bot vào còn giúp Google hiểu cấu trúc website của bạn tốt hơn.

Robots.txt giống biển hiệu lịch sự trước cửa hàng — bot "lịch sự" sẽ tôn trọng, nhưng nó không thay thế được ổ khóa hay tường lửa.

Những sai lầm phổ biến nhất

Sai lầm đầu tiên và nguy hiểm nhất: tin rằng robots.txt là tường lửa. Nó không phải. Bot xấu hoàn toàn có thể phớt lờ tệp này và vào website bạn bình thường [S1]. Nếu bạn cần bảo vệ trang quản trị, hãy dùng mật khẩu thật.

Sai lầm thứ hai: liệt kê đường dẫn nhạy cảm trong Disallow. Vì tệp này công khai, bạn đang vô tình "khai báo" với cả thế giới rằng "đường dẫn bí mật nằm ở đây" [S3][S5]. Cách bảo vệ đúng là đặt mật khẩu, không phải liệt kê trong robots.txt.

Sai lầm thứ ba: gõ nhầm Disallow: / khi website đã chạy. Một dấu gạch chéo duy nhất có thể khiến Google không vào được bất kỳ trang nào [S4]. Sai lầm thứ tư: gõ sai chính tả như Disalow — cả tệp trở nên vô hiệu, bot mặc định vào hết [S3].

Sai lầm thứ năm và cũng phổ biến nhất: nhầm robots.txt với noindex. Hai khái niệm này hoàn toàn khác nhau — robots.txt chặn bot quét trang, còn noindex chặn trang hiển thị trên kết quả tìm kiếm [S1][S2]. Nếu bạn muốn một trang biến mất khỏi Google, hãy dùng thẻ meta noindex, không dùng robots.txt. Một điểm cần lưu ý: nếu trang bị Disallow nhưng có backlink từ nơi khác, Google vẫn có thể lập chỉ mục trang đó dù không có mô tả — cách diễn đạt chính xác theo tài liệu Google hiện hành cần được xác minh thêm trước khi tư vấn cho khách hàng.

Bảo vệ thật sự thì dùng gì

Nếu bạn cần bảo vệ khu vực quản trị hoặc dữ liệu nhạy cảm, hãy dùng mật khẩu mạnh, bật xác thực hai yếu tố, thiết lập tường lửa ứng dụng, dùng HTTPS và hạn chế IP truy cập [S1]. Robots.txt là lớp đầu tiên để nói "xin đừng vào đây" — nhưng để chắc chắn, bạn cần các lớp bảo mật thật sự phía sau.

Checklist trước khi đăng tệp robots.txt đầu tiên

Trước khi lưu và đẩy tệp lên website, hãy chạy qua sáu câu hỏi sau:

  1. Tệp có đang nằm đúng thư mục gốc chưa? (tenmiencuaban.com/robots.txt)
  2. Bạn có đang vô tình gõ Disallow: / chặn cả website không?
  3. Bạn có đang "khai báo" đường dẫn nhạy cảm nào không?
  4. Mục tiêu thật sự là chặn quét hay ẩn khỏi kết quả tìm kiếm? Nếu là ẩn, hãy dùng noindex.
  5. Bạn đã kiểm tra lại bằng công cụ trong Google Search Console chưa? (Công cụ kiểm tra Robots.txt Tester cũ đã được thay bằng báo cáo trong phần Pages hoặc URL Inspection — cần xác minh lại trạng thái cập nhật 2025–2026).
  6. Cú pháp và giá trị chính thức có thể thay đổi — hãy kiểm tra lại trên Technical SEO tổng quan (sitemap, tốc độ, cấu trúc) hoặc trang Google Search Central trước khi áp dụng cho khách hàng.

Ngoài ra, nếu bot gặp lỗi khi quét website, bạn nên hiểu cách đọc các mã lỗi để biết khi nào nên chặn, khi nào nên mở — bài mã lỗi HTTP Googlebot gặp phải sẽ giúp bạn phân biệt 404 mềm, 500 và 503.

Minh họa người dùng đang kiểm tra tệp robots.txt trên laptop

Tóm lại: bắt đầu từ đâu

Nếu bạn vừa đưa website lên mạng và chưa có tệp robots.txt, hãy tạo một tệp đơn giản với hai dòng cho phép tất cả, kèm khai báo sitemap — đó là điểm khởi đầu an toàn. Khi đã có trang quản trị hoặc trang thử nghiệm cần ẩn, hãy thêm từng dòng Disallow một, mỗi lần một thư mục, rồi kiểm tra lại bằng Google Search Console.

Robots.txt là công cụ đơn giản nhưng dễ sai. Hãy đối xử với nó như tấm biển trước cửa hàng — rõ ràng, lịch sự và đúng chỗ — và nhớ rằng bảo vệ thật sự luôn cần thêm mật khẩu, xác thực và tường lửa phía sau.

  • sitemap XML
  • noindex
  • SEO cơ bản
  • thu thập dữ liệu
  • chặn bot Google
  • robots.txt
  • tệp robots.txt
  • Google Search Console

Xem phần mềm — hoặc nhận tư vấn

Đọc xong thì chọn: phần mềm PN, công cụ khuyên dùng, hoặc nhờ mình làm theo nhu cầu.