Robots & Sitemap: Checklist 10 phút kiểm tra website có bị kẹt lên Google

Website công ty đôi khi “không thấy trên Google” không phải vì nội dung, mà vì Googlebot không vào đọc được hoặc Google đang giữ sai bản link chính. Bài này dùng khi website công ty không thấy trên Google, lên rất chậm, hoặc lên sai phiên bản sau deploy/migrate/chỉnh kỹ thuật. 

1. Lộ trình 10 phút để khoanh vùng lỗi

Trong 10 phút, bạn sẽ chốt website đang kẹt ở:

  • cửa vào cho bot
  • điều kiện để lên Google
  • hay sitemap dẫn Google đi sai chỗ

Với website công ty lớn, hay vướng thêm lớp bảo mật/CDN và đa ngôn ngữ (VI/EN).

Chuẩn bị 30 giây

4 mốc thao tác

  • Phút 1: mở robots.txt
  • Phút 3: test URL đại diện
  • Phút 6: mở sitemap
  • Phút 10: nếu có Search Console, kiểm URL để chốt bằng bằng chứng

Đầu ra sau 10 phút

Sau khi làm xong các bước 2.1–2.4, bạn phải kết luận đúng 1 trong 5 câu dưới đây:

  • Bot chưa vào được vì robots đang chặn.
  • Bot bị chặn/giới hạn bởi lớp bảo mật/CDN.
  • Trang tự cấm lên Google (noindex).
  • Google bị chỉ giữ sai bản link (canonical/redirect rối).
  • Sitemap thiếu hoặc bẩn — chỉ kết luận câu này khi 1–4 đều ổn.

2. Checklist 10 phút theo từng bước

2.1 Phút 1 — Mở robots.txt để xem có đang “chặn cửa” không

Nếu robots.txt chặn bot, Googlebot khó vào đọc trang → trang lên chậm hoặc không ổn định (hay gặp sau deploy/migrate).

Cách làm (1 phút)

Chỉ cần nhìn 3 chỗ

  • User-agent: *
  • Các dòng Disallow:
  • Dòng Sitemap:

Kết luận nhanh

  • Disallow: / → gần như chặn toàn site (ưu tiên sửa trước mọi thứ)
  • Có Disallow: trỏ vào trang nội dung quan trọng (vd /ve-wecan-group/, /lien-he/) → đang chặn nhầm
  • Chỉ có Disallow: /wp-admin/ → robots ổn, sang bước 2.2

Lưu ý dễ bỏ sót

  • Nếu thấy chặn /wp-content/, /wp-includes/, /assets/, /static/ → bot có thể đọc trang nhưng khó tải CSS/JS
  • Nếu robots có khối User-agent: Googlebot riêng → phải kiểm thêm khối đó

Nếu robots báo lỗi

  • 404 → file không tồn tại/đường dẫn sai
  • 403 → có thể bị lớp bảo mật/CDN chặn truy cập

Kết luận: Robots ổn mà vẫn kẹt thì đừng sửa robots nữa, chuyển sang kiểm điều kiện lên Google.

2.2 Phút 3 — Test 1 URL đại diện: trang có đủ điều kiện “lên Google” không

Chọn 1 trang đại diện như “Về WeCan Group” hoặc “Liên hệ”, rồi kiểm 4 thứ: mở được – không tự cấm – bản link chính – nhảy vòng.

A. Trang có mở bình thường không (30 giây)

Mở:

Nếu gặp 404/403/429 → chụp màn hình + ghi URL (bằng chứng mạnh nhất để giao dev/CDN)

Lưu ý lỗi hay gặp cần nhấn thêm 200 nhưng nội dung “lạ” (bị chuyển sang trang khác, trang trắng, trang yêu cầu xác minh) → vẫn coi là “kẹt”, vì Googlebot có thể gặp đúng màn đó. Chụp lại màn hình.

B. Có “nhảy vòng” không (1 phút)

Thử:

Nhảy qua 2–3 kiểu (www/non-www, http/https, có/không dấu /) → redirect rối. Lúc này bạn cần ghi lại 2 thứ:

  • URL nhập
  • URL cuối.

Lưu ý lỗi Redirect về trang chủ: mở trang con nhưng bị đá về homepage → thường do rule redirect sai hoặc page bị unpublish/permission. Đây là lỗi cực hay gặp khi migrate.

C. Trang có tự cấm lên Google không (2 phút)

  • Chuột phải → View page source
  • Ctrl+F tìm noindex
    • Có noindex → trang tự cấm lên Google
    • Không thấy → qua bước D

Nếu nghi ngờ noindex nằm ở header/CDN (không thấy trong source), ưu tiên chốt bằng Search Console ở bước 2.4.

D. Google đang giữ “bản link chính” nào (1 phút)

  • Ctrl+F tìm canonical
  • Tìm dòng <link rel=”canonical” href=”…”>

So sánh href với URL đang mở:

  • Khớp → ổn
  • Trỏ sang trang khác/ngôn ngữ khác/trang chủ → đang trỏ nhầm

Lưu ý lỗi hay gặp như:

  • Canonical trỏ về trang chủ (rất hay gặp do lỗi template):
    → trang con sẽ rất khó lên Google vì Google bị “chỉ” giữ homepage.
  • Canonical trỏ về bản www/non-www khác trong khi redirect lại ngược chiều
    → tạo vòng tín hiệu, Google chọn “bản khác” hoặc index chậm.

E. Nếu có VI/EN (1 phút)

  • Bản VI nên canonical về VI
  • Bản EN nên canonical về EN

Kết luận: Đừng đổ lỗi sitemap trước khi bạn chắc trang đại diện không bị noindex, không bị chặn truy cập, và canonical không trỏ nhầm.

2.3 Phút 6 — Mở sitemap: có “đủ nhánh” và “sạch” không

Sitemap giúp Google đi đúng đường. Nếu sitemap thiếu trang quan trọng hoặc chứa nhiều URL rác, trang quan trọng sẽ lên chậm.

Cách mở sitemap (1 phút)

Sitemap “mở được” khi

  • Hiện XML có <url> hoặc <sitemap>
  • Nếu 404/403 → ghi lại + chụp màn hình

Kiểm “đủ nhánh” trong 60 giây

  • Ctrl+F tìm:
    • ve-wecan-group
    • lien-he
    • tin-tuc / news / blog (nếu có)

Không thấy các trang cơ bản → sitemap thiếu/không phản ánh đúng site.

Nhận biết URL rác

  • URL có dấu ? dài
  • URL search/filter nội bộ
  • URL tag/author/search…
  • URL mở ra 404 hoặc nhảy vòng

Kết luận: Sitemap tốt là đủ trang cần lên và ít URL rác, không phải càng nhiều càng tốt.

2.4 Phút 10 — Nếu có Search Console: chốt bằng kiểm tra URL

Đây là nơi khóa tranh cãi bằng bằng chứng.

Cách làm

Chỉ cần đọc 3 dòng

  • URL có đang xuất hiện trên Google không
  • Googlebot có vào đọc được gần đây không
  • Google đang giữ “bản link chính” nào

Nếu không có Search Console, bạn vẫn đủ bằng chứng từ robots + view source + sitemap.

Kết luận: Search Console để chốt bằng chứng, không phải để đoán.

3. Sơ đồ khoanh vùng lỗi (gặp A → kết luận B → giao đúng người)

Nếu bạn thấy… Kết luận nhanh Giao ai xử lý
Robots có Disallow: / hoặc chặn nhầm trang nội dung Kẹt cửa vào cho bot Dev
URL hay gặp 403/429/xác minh, lúc được lúc không Bị chặn/giới hạn bởi CDN/WAF Dev/CDN
View Source có noindex hoặc Search Console báo bị chặn hiển thị Trang tự cấm lên Google Dev/SEO
Canonical trỏ sai hoặc redirect/canonical đánh nhau Google giữ sai bản link Dev/SEO
Sitemap thiếu trang quan trọng hoặc nhiều URL rác/URL lỗi Google đi sai đường SEO/Dev

4. Làm theo thứ tự này để khỏi sửa vòng

Làm theo 5 bước này để khoanh vùng nhanh lỗi “kẹt lên Google” trên website công ty. Mỗi bước chỉ cần 3 thao tác ngắn, đủ để bạn chốt đúng nhóm lỗi và giao dev/agency xử lý.

Bước 1: Chốt “cửa vào” trước (robots + tự cấm)

  • Mở /robots.txt xem có chặn toàn site
  • View Source 1 URL, tìm noindex
  • Sửa xong, test lại 2 URL đại diện

Bước 2: Thấy 403/429/xác minh thì xử lý CDN/WAF sớm

  • Reload 3 lần, thử thêm tab ẩn danh
  • Ghi mã lỗi + chụp màn hình làm bằng chứng
  • Nhờ Dev/CDN mở đường cho trang public

Bước 3: Dọn “bản link chính” và giảm nhảy vòng

  • Chọn 1 bản link chuẩn: https + www/không www
  • Thử www/non-www, http/https xem nhảy mấy lần
  • Kiểm canonical có khớp URL đang mở

Bước 4: Dọn sitemap sau cùng (đủ nhánh, ít rác)

  • Lấy link sitemap từ robots.txt rồi mở
  • Ctrl+F tìm About/Contact/News có nằm trong sitemap
  • Bấm thử 3 URL: không 404, không nhảy vòng

Bước 5: Test theo nhóm trang để khỏi bỏ sót

  • Test About, Contact, 1 trang News/Press
  • Test 1 cặp VI/EN cùng chủ đề (nếu có)
  • Test 1 PDF quan trọng (nếu có)

5. Mẫu tin nhắn gửi dev/agency

Tiêu đề: Website kẹt lên Google — cần kiểm robots/noindex/canonical/sitemap

Khu vực bị ảnh hưởng: (Giới thiệu / Liên hệ / Tin tức / toàn site / nhóm trang…)

Ngôn ngữ: (VI / EN / cả hai)

Robots: https://wecan-group.com/robots.txt → (OK / có chặn / chặn nhầm: …)

Sitemap: (dán link sitemap) → (mở được / 404 / 403 / thiếu nhánh / nhiều URL rác)

URL test #1: https://wecan-group.com/ve-wecan-group/

  • Status: … | URL cuối: … | noindex: có/không | canonical: …

URL test #2: https://wecan-group.com/lien-he/

  • Status: … | URL cuối: … | noindex: có/không | canonical: …

Kết luận 1 câu: (kẹt robots / kẹt CDN-WAF / kẹt noindex / kẹt canonical-redirect / sitemap thiếu-bẩn)

Dev/agency xử lý (tối đa 3 việc): (1)… (2)… (3)…

SEO làm tiếp sau khi fix: (submit URL / rà lại sitemap / rà lại internal link / theo dõi Search Console…)

Đính kèm: ảnh robots + ảnh source (noindex/canonical) + ảnh lỗi 403/429 (nếu có)

6. 3 hiểu nhầm cần làm rõ

Mở robots.txt rồi là chắc lên Google?

Không. Robots chỉ mở cửa cho bot. Muốn lên Google còn phụ thuộc noindex, canonical/redirect, và bot có bị CDN chặn không.

Sitemap sai là web tụt?

Không tụt ngay, nhưng Google đi sai đường: ghé nhầm chỗ, bỏ sót trang quan trọng, hoặc mất thời gian vì URL rác.

Sửa xong bao lâu Google cập nhật?

Không có mốc cố định. Cách chắc nhất là test lại URL đại diện và theo dõi Search Console (nếu có) để biết Google đã đọc lại/chọn lại chưa.

Liên hệ Wecan Group

Nếu sau checklist 10 phút bạn vẫn chưa chốt được nguyên nhân website “kẹt lên Google”, hãy để Wecan Group hỗ trợ bạn rà soát độc lập và xử lý từ cấu trúc, kỹ thuật đến đo lường.

Địa chỉ:

  • Trụ sở chính: Tầng 9, Tòa nhà Hồ Gươm Plaza, 102 Trần Phú, Hà Đông, Hà Nội.
  • Chi nhánh TP. Hồ Chí Minh: Tầng 2, Tòa nhà Itaxa, 126 Nguyễn Thị Minh Khai, Phường Xuân Hòa, TP. Hồ Chí Minh.

Hotline: 024.6664 0261 – 098.44.66.909 (Mr. Nam)

Email: [email protected]