Nếu trình duyệt mở được một trang WordPress nhưng Yandex không thấy trang đó, đừng vội thay toàn bộ robots.txt hoặc xóa mọi chỉ dẫn SEO. Hãy chọn một URL công khai thật và kiểm tra lần lượt bốn lớp: robots.txt, mã HTML, HTTP header và cài đặt WordPress hoặc plugin SEO.
Sau bài này, bạn có một phiếu kiểm tra cho URL mẫu, biết lớp nào đang cấm bot hoặc yêu cầu không lập chỉ mục, đồng thời có cách sửa và kiểm tra lại mà vẫn giữ đường lui. SaibABC.Com chỉ là bối cảnh minh họa; bài viết không khẳng định website này đã được kết nối, xác minh hoặc có trạng thái thực tế trong Yandex.
Giới hạn: gỡ chỉ dẫn chặn không bảo đảm URL sẽ được lập chỉ mục hoặc xuất hiện ngay trong kết quả tìm kiếm. Bài này chỉ giúp xác định và xử lý các lớp chỉ dẫn kỹ thuật trong phạm vi một URL.
Phân biệt bị cấm thu thập dữ liệu với bị yêu cầu không lập chỉ mục
| Lớp kiểm soát | Dấu hiệu | Ảnh hưởng chính |
|---|---|---|
| robots.txt | Disallow | Hướng dẫn bot không thu thập một đường dẫn hoặc khu vực. |
| HTML | <meta name="robots" content="noindex"> | Yêu cầu công cụ tìm kiếm không đưa trang vào chỉ mục. |
| HTTP header | X-Robots-Tag: noindex | Đặt chỉ dẫn lập chỉ mục từ phản hồi máy chủ, kể cả với tệp không phải HTML. |
| WordPress hoặc plugin SEO | Tùy chọn không lập chỉ mục hoặc không cho công cụ tìm kiếm lập chỉ mục | Có thể sinh meta robots hoặc thay đổi robots.txt. |
robots.txt không phải cơ chế bảo vệ dữ liệu riêng tư. Nội dung cần hạn chế người xem phải dùng đăng nhập, phân quyền hoặc biện pháp kiểm soát truy cập phù hợp, không chỉ dựa vào chỉ dẫn dành cho bot. Yandex cũng lưu ý rằng trang bị chặn trong robots.txt vẫn có thể được biết đến hoặc xuất hiện trong một số trường hợp (theo yandex.com).
Chuẩn bị URL và nhật ký kiểm tra
Nơi thao tác: trình duyệt và bảng quản trị website. Bạn cần một bài viết hoặc trang công khai thật, chẳng hạn [URL bài viết công khai]. Không biến ký hiệu này thành URL của SaibABC.Com khi chưa kiểm tra địa chỉ chính thức.
- Mở URL trong cửa sổ riêng tư, không đăng nhập quản trị.
- Ghi địa chỉ cuối cùng sau chuyển hướng, gồm
http/httpsvà có hoặc không cówww. - Ghi ngày kiểm tra, công cụ đã dùng và bằng chứng thu được.
- Nếu định sửa, sao chép giá trị hoặc cấu hình cũ trước khi thay đổi.
URL kiểm tra: [URL bài viết công khai]
Ngày kiểm tra: [YYYY-MM-DD]
robots.txt: [Cho phép / Bị chặn / Chưa xác định]
meta robots: [Không có noindex / Có noindex / Chưa xác định]
X-Robots-Tag: [Không có noindex / Có noindex / Chưa xác định]
WordPress/plugin: [Đã kiểm tra / Chưa kiểm tra]
Kết luận và hành động tiếp theo: [...]
Kiểm tra robots.txt
Mở đúng tệp của website
Nơi thao tác: thanh địa chỉ trình duyệt. Thay tên miền mẫu bằng phiên bản chính thức đã kiểm tra:
https://ten-mien-cua-ban.example/robots.txt
Tệp thường nằm ở thư mục gốc. Nếu URL chuyển hướng, yêu cầu đăng nhập, trả lỗi hoặc hiển thị nội dung khác với cấu hình bạn biết, hãy ghi hiện trạng thay vì sửa ngay.
Tìm các nhóm như:
User-agent: *
Disallow: /
Disallow: / trong nhóm áp dụng cho mọi bot là dấu hiệu website đang cấm thu thập toàn bộ đường dẫn. Tuy nhiên, hãy kiểm tra đúng nhóm User-agent, đường dẫn và nguồn sinh file trước khi kết luận. Plugin, CDN hoặc máy chủ có thể đang tạo robots.txt động.
Dùng Robots.txt analysis của Yandex
Điều kiện: website đã được thêm và xác minh trong Yandex Webmaster. Nơi thao tác: Yandex Webmaster, khu vực có tên tương đương Tools → Robots.txt analysis; tên mục có thể khác theo ngôn ngữ hoặc phiên bản.
- Chọn đúng website, khớp giao thức và tiền tố
www. - Đọc nội dung robots.txt mà công cụ nhận được.
- Nhập URL mẫu vào ô kiểm tra URL.
- Ghi lại nguyên văn kết quả cho URL đó.
Kết quả “không cho phép” là bằng chứng URL khớp một chỉ dẫn chặn trong file đang được công cụ phân tích. Lưu ảnh chụp giao diện thật nếu có quyền sử dụng; không dùng ảnh AI giả làm bằng chứng. Không thay toàn bộ robots.txt bằng mẫu trên mạng, vì có thể xóa dòng Sitemap hoặc mở lại khu vực đang được chủ động loại khỏi thu thập dữ liệu (theo yandex.com).
Kiểm tra noindex trong HTML
Nơi thao tác: trình duyệt ở trạng thái không đăng nhập.
- Mở URL mẫu trong cửa sổ riêng tư.
- Nhấp phải, chọn Xem mã nguồn trang hoặc View page source.
- Tìm
noindex,nofollowvàrobots. - Kiểm tra thẻ trong phần
<head>.
<meta name="robots" content="noindex">
<meta name="robots" content="noindex, nofollow">
<meta name="yandex" content="noindex">
nofollow không đồng nghĩa với noindex. Hãy ghi đúng giá trị nhìn thấy. Nếu thẻ chỉ xuất hiện khi đăng nhập quản trị mà không có trong mã nguồn công khai, đó chưa phải bằng chứng bot bên ngoài nhận được chỉ dẫn đó.
Kiểm tra X-Robots-Tag trong HTTP header
Nơi thao tác: DevTools của trình duyệt. Mở URL công khai, nhấn F12 hoặc Inspect, chọn Network, tải lại trang, chọn yêu cầu tài liệu chính có loại Document, rồi mở Headers.
Tìm X-Robots-Tag. Nếu thấy noindex hoặc none, ghi lại toàn bộ giá trị và URL phản hồi. Không chọn nhầm yêu cầu CSS, JavaScript hoặc ảnh. Với PDF và tệp không có phần <head>, HTTP header có thể là nơi đặt chỉ dẫn lập chỉ mục.
Nếu không quen kiểm tra header, hãy nhờ quản trị hosting, CDN hoặc máy chủ. Không sửa theme để xử lý một chỉ dẫn đang được thêm ở lớp máy chủ.
Kiểm tra WordPress và plugin SEO

Cài đặt toàn website
Nơi thao tác: WordPress → Settings → Reading. Tìm tùy chọn tương đương Discourage search engines from indexing this site. Nếu tùy chọn đang bật trên website công khai, ghi lại trước khi sửa. WordPress có thể sinh noindex,nofollow khi tùy chọn này được bật; hãy xác nhận bằng mã HTML công khai thay vì chỉ nhìn ô cài đặt (theo WordPress.org).
Không kết luận mọi URL đều mở chỉ vì ô này đã tắt. Theme, plugin SEO, plugin staging, CDN hoặc mã tùy chỉnh có thể đặt chỉ dẫn riêng.
Cài đặt của bài viết hoặc trang
Nơi thao tác: màn hình chỉnh sửa URL mẫu và khu vực của plugin SEO đang hoạt động. Tìm các mục có ý nghĩa như “cho phép lập chỉ mục”, “hiển thị trong kết quả tìm kiếm”, “Robots meta” hoặc “Advanced robots”. Tên menu phụ thuộc plugin và phiên bản.
Chỉ thay đổi khi bạn xác định đúng URL và hiểu giá trị cũ. Sau khi lưu, làm mới hoặc xóa cache theo quy trình của website, rồi kiểm tra lại mã nguồn công khai và HTTP header. Nếu plugin có bản xem trước, đó chỉ là gợi ý; HTML và header thực tế mới là kết quả cần xác nhận.
Nếu cần đọc lại cách Yandex hiển thị cảnh báo và chọn khu vực kiểm tra, xem cách đọc bảng điều khiển Yandex Webmaster trong series.
Chẩn đoán trước khi sửa
| Dấu hiệu | Nguồn cần kiểm tra | Hành động an toàn |
|---|---|---|
| Robots.txt cấm URL | Disallow khớp đường dẫn hoặc nhóm bot. | Lưu file hiện tại, xác định nguồn sinh file rồi mới sửa đúng dòng. |
HTML có noindex | WordPress, plugin SEO, theme hoặc mã tùy chỉnh. | Kiểm tra cài đặt toàn website và URL riêng. |
Header có X-Robots-Tag: noindex | Máy chủ, CDN, lớp bảo mật hoặc cấu hình loại tệp. | Chuyển cho người quản trị kiểm tra đúng lớp. |
| Không thấy chỉ dẫn chặn | Sai URL, chuyển hướng, lỗi HTTP, cache hoặc dữ liệu Yandex chưa cập nhật. | Kiểm tra URL cuối cùng, phản hồi máy chủ và trạng thái trong Webmaster. |
| Website còn ở môi trường thử nghiệm | Staging hoặc tùy chọn không lập chỉ mục còn sót. | Đối chiếu môi trường trước khi mở chỉ dẫn. |
Trình duyệt mở được trang không chứng minh bot nhận cùng phản hồi: CAPTCHA, đăng nhập, giới hạn IP, lỗi máy chủ hoặc chuyển hướng khác có thể tạo kết quả khác.
Sửa, xác minh và hoàn tác
- Ghi hiện trạng: lưu robots.txt, meta robots, header, URL, thời gian và người thực hiện.
- Sửa đúng nguồn: Reading của WordPress, plugin SEO, file sinh robots.txt hoặc cấu hình máy chủ tương ứng.
- Chỉ thay đổi một lớp mỗi lần: nếu sửa nhiều nơi cùng lúc, bạn không biết nguyên nhân nào đã thay đổi kết quả.
- Làm mới cache theo quy trình: không xóa hàng loạt plugin bảo mật hoặc CDN chỉ vì một lần kiểm tra thất bại.
- Kiểm tra từ bên ngoài: mở lại robots.txt, chạy lại URL trong Robots.txt analysis, xem mã nguồn riêng tư và kiểm tra header của tài liệu chính.
- Ghi trạng thái: “đã sửa nhưng chưa được Yandex đánh giá lại” nếu mới gỡ chỉ dẫn. Không ghi “đã lập chỉ mục” chỉ vì đã gỡ chặn.
Đường lui: khôi phục đúng giá trị robots meta, file hoặc tùy chọn đã lưu trước đó. Không xóa hàng loạt bản ghi DNS, plugin bảo mật hay cấu hình máy chủ để xử lý một cảnh báo chưa xác định.
Nếu gặp lỗi truy cập, chuyển hướng hoặc phản hồi khác nhau giữa trình duyệt và bot, xem quy trình tìm đúng điểm hỏng khi xác minh Yandex thay vì tắt toàn bộ bảo mật.
Bài tập kiểm tra một URL công khai
Chọn một bài viết thật trên website bạn quản lý. Nếu chưa có URL đã xác minh, giữ nguyên [URL bài viết công khai] trong nhật ký và dừng ở bước chuẩn bị.
- Ghi URL cuối cùng sau khi mở ở cửa sổ riêng tư.
- Mở robots.txt và chạy URL qua Robots.txt analysis nếu website đã sẵn sàng trong Yandex Webmaster.
- Tìm
noindexvànonetrong mã nguồn HTML. - Kiểm tra
X-Robots-Tagcủa phản hồi HTML chính. - Mở Settings → Reading và robots meta của plugin SEO đang hoạt động.
- Ghi riêng từng lớp: “cho phép”, “bị chặn”, “có noindex”, “không có bằng chứng” hoặc “chưa kiểm tra”.
Bài tập đạt yêu cầu khi bạn trả lời được: bot có được phép thu thập URL không, HTML có noindex không, header có chỉ dẫn chặn không và cài đặt nào tạo ra kết quả đó. Nếu thiếu bằng chứng, ghi “chưa xác định” thay vì đoán.
Những hiểu nhầm cần tránh
- Trang mở với tôi nên bot cũng truy cập được: chưa chắc, vì bot có thể nhận lỗi, CAPTCHA, yêu cầu đăng nhập hoặc chuyển hướng khác.
- robots.txt và noindex là một: không phải; một lớp liên quan đến thu thập dữ liệu, lớp kia chủ yếu liên quan đến lập chỉ mục.
- Bỏ noindex là trang xuất hiện ngay: không có bảo đảm; Yandex còn phải truy cập, xử lý và đánh giá URL.
- Báo cáo trống nghĩa là bị chặn: có thể chỉ là chưa có dữ liệu, sai website, sai URL hoặc bộ lọc không phù hợp.
- robots.txt bảo vệ dữ liệu riêng tư: không an toàn; dữ liệu riêng tư cần cơ chế kiểm soát truy cập.
Nếu robots.txt không chặn nhưng URL vẫn có vấn đề, kiểm tra phản hồi máy chủ và trạng thái URL trong công cụ tương ứng của Yandex thay vì chỉ lặp lại việc sửa file (theo yandex.com).
Bước tiếp theo
Kết quả của bài này là phiếu kiểm tra cho một URL, không phải bằng chứng URL đã được lập chỉ mục. Hãy giữ URL, ngày kiểm tra, trạng thái từng lớp, bằng chứng và cấu hình cũ. Bước tiếp theo là dùng phiếu này để đọc trạng thái cụ thể của URL trong Yandex Webmaster:
Cách kiểm tra bài viết đã được Yandex lập chỉ mục hay chưaNguồn tham khảo
- Using robots.txt — Yandex Webmaster.
- Robots.txt analysis — Yandex Webmaster.
- How do I prohibit indexing of a site or pages? — Yandex Webmaster.
- How do I check if a site is accessible to users and indexing robots? — Yandex Webmaster.
- Settings Reading screen — WordPress.org Documentation.
- wp_robots_noindex() — WordPress Developer Resources.

