Dọn rác index trong 1 giờ để Google crawl đúng trang cần lên

Nếu Google crawl nhiều trang rác (search, lọc tin tức/sự kiện/tuyển dụng, URL có tham số), các trang quan trọng sẽ crawl chậm. Bài này hướng dẫn dọn rác index trong 60 phút, theo checklist dễ làm và an toàn cho người vận hành kỹ thuật cơ bản.

1. Bạn có đang bị “index bloat” và Google crawl sai trang không?

Nếu GSC tăng Indexed nhưng traffic không tăng, kèm Duplicate/Crawled/Discovered nhiều và URL dạng search/lọc/tham số xuất hiện dày, bạn đang bị index bloatGoogle crawl nhiều trang rác.

1.1. Mở GSC và lấy URL mẫu theo nhóm lỗi

Bạn chỉ cần lấy vài chục URL mẫu để nhìn ra “dạng URL” đang gây rác. Đừng cố thống kê hết, chỉ cần đủ mẫu để thấy lặp.

  • Vào GSC → Indexing → Pages
  • Mở các nhóm: Duplicate, Crawled – currently not indexed, Discovered – currently not indexed, và Indexed
  • Mỗi nhóm copy khoảng 20 URL ra một sheet

Ví dụ minh hoạ

  • https://wecan-group.com/search?q=…
  • https://wecan-group.com/news?topic=…
  • https://wecan-group.com/events?location=…
  • https://wecan-group.com/careers/jobs?department=…
  • https://wecan-group.com/…?…utm_source=…

1.2. Nhận diện “dạng URL” gây rác trong 60 giây

Nếu nhiều URL giống nhau ở phần thư mục hoặc tham số, bạn đã tìm ra đúng điểm cần sửa. Mục tiêu là đặt tên được 3–5 “dạng URL” để áp rule theo template.

Những dạng URL hay gặp trên website công ty lớn:

  • Trang tìm kiếm: /search hoặc ?s=
  • Trang lọc listing (news/events/jobs): ?topic=, ?year=, ?location=, ?department=
  • URL có tracking: utm_, gclid, fbclid
  • Phân trang sâu: ?page=2 hoặc /page/2

1.3. 5 khu vực hay “phình index” nhất trên corporate site

Trên corporate site, rác index thường đến từ search + listing có lọc + tracking. Nếu xử đúng 1–2 khu vực lớn nhất, bạn thường giảm rác nhanh nhất.

Bạn có thể đối chiếu theo nhóm trang:

  • Tìm kiếm nội bộ (search)
  • Tin tức/Insights (lọc theo chủ đề/năm)
  • Sự kiện (lọc theo địa điểm/loại)
  • Tuyển dụng (lọc phòng ban/địa điểm)
  • Tài nguyên/PDF (file tải + tham số tracking)

2. Checklist 60 phút để dọn rác index

Trong 1 giờ bạn làm 4 việc: chốt dạng URL rác → chọn cách xử lý cho từng dạng → dọn sitemap & link nội bộ → kiểm tra lại bằng URL Inspection để tránh noindex nhầm.

2.1. Chốt 3–5 dạng URL rác lớn nhất (0–10 phút)

Ưu tiên những dạng URL đang nằm trong mục Indexed vì nó đang “ăn crawl” thật. Bạn chỉ cần chốt ít nhưng đúng, không cần chốt hết.

  • Từ sheet URL mẫu, gom theo nhóm:
    • Search
    • Lọc listing (news/events/jobs)
    • Tracking params
    • Pagination
  • Mỗi nhóm giữ lại 2 URL đại diện để test sau

Ví dụ ghi nhanh (minh hoạ):

  • Search: https://wecan-group.com/search?q=…
  • News filter: https://wecan-group.com/news?topic=…
  • UTM: https://wecan-group.com/services/…?…utm_source=…

2.2. Chọn cách xử lý cho 4 dạng “gây rác” phổ biến nhất (10–25 phút)

Với website giới thiệu công ty, gần như luôn đúng: index trang listing gốc và trang detail; còn search và trang lọc theo query thì không nên index.

Thiết lập gợi ý (rải tự nhiên keyword phụ):

  • Search nội bộ → đặt noindex,follow, và không đưa vào sitemap
  • Trang lọc theo query (news/events/jobs) → noindex filter (noindex,follow) + canonical về trang listing gốc (không tham số)
  • Tracking (utm/gclid/fbclid) → canonical về URL sạch, tránh internal link có UTM
  • Pagination → giữ trang 1; trang sâu tùy quy mô, tránh tạo thêm biến thể sort/view

Lưu ý thực tế: phần “lọc theo query” thường là nguồn tạo URL nhiều nhất, nên xử lý nó trước sẽ giảm index bloat nhanh.

2.3. Dọn sitemap và giảm link nội bộ dẫn bot vào rác (25–40 phút)

Nếu sitemap còn URL rác hoặc menu/footer vẫn link mạnh tới trang lọc, Google vẫn crawl sai. Đây là bước “đổi hướng” Googlebot nhanh nhất trên site công ty lớn.

Gợi ý sitemap “đáng SEO” (áp dụng cho corporate):

  • Nên có:
    • Trang dịch vụ/giải pháp (Services/Solutions)
    • Trang ngành/khách hàng (Industries)
    • Case studies/Projects/Portfolio
    • Resources landing (trang mô tả tài liệu)
    • Tin tức chi tiết (nếu bạn có chiến lược SEO/PR)
  • Nên loại:
    • /search*
    • mọi URL có ?topic=, ?location=, ?department=, ?year=
    • URL có utm_, gclid, fbclid
    • tag pages mỏng (nếu tồn tại)

Các vị trí hay bơm rác (rất thường gặp):

  • Footer/sidebar có danh sách topic/tag quá nhiều
  • Module “related topics/tags”
  • Bộ lọc tạo link crawlable cho mọi lựa chọn

2.4. Áp cấu hình trong CMS hoặc chuẩn bị nội dung gửi dev (40–55 phút)

Nếu bạn có quyền cấu hình cơ bản, thường bạn làm được phần noindex template và dọn sitemap. Nếu site dùng CMS enterprise, cách nhanh nhất là gửi dev danh sách dạng URL + cách xử lý + URL test.

Nếu làm được ngay trong CMS/plugin:

  • Noindex trang search
  • Noindex các trang listing có query lọc
  • Loại các URL có query khỏi sitemap

Nếu không chắc cấu hình nào đang áp dụng lên template, hãy dừng ở đây và gửi dev theo mẫu 4.3 để tránh làm chồng chéo.

2.5. Test lại bằng URL Inspection để chắc chắn “không phá SEO” (55–60 phút)

Bạn chỉ cần test 4 URL: 2 URL rác và 2 URL quan trọng. Nếu URL quan trọng bị noindex hoặc canonical sai, bạn cần dừng lại và rollback ngay.

Gợi ý bộ test (thay bằng URL thật của bạn):

2 URL rác:

  • https://wecan-group.com/search?q=…
  • https://wecan-group.com/news?topic=…

2 URL quan trọng:

  • https://wecan-group.com/services/… (hoặc solutions)
  • https://wecan-group.com/case-studies/… (hoặc projects)

3. Bảng quyết định: thấy URL dạng này thì xử lý thế nào?

Chỉ cần nhìn URL là bạn trả lời được: có nên index không, canonical về đâu, có đưa vào sitemap không. Phần này giúp bạn khỏi phải “tự nghĩ” khi xử rác.

3.1. Search nội bộ (/search, /?s=)

Search tạo vô hạn URL và hiếm khi là landing SEO ổn định. Cách an toàn là không cho index.

  • Thiết lập: noindex,follow
  • Sitemap: không đưa vào
  • Kiểm tra: URL Inspection không “Index allowed”

3.2. Lọc News/Insights bằng query (/news?topic=…)

Trang lọc thường trùng listing và nhân bản vô hạn. Bạn giữ index listing gốc và bài chi tiết, còn trang lọc thì không index.

  • Thiết lập: noindex filter (noindex,follow)
  • Canonical: về /news/ (không tham số)
  • Sitemap: loại khỏi sitemap

3.3. Lọc Events (/events?location=…)

Tương tự news: lọc theo query gần như không có giá trị SEO riêng. Nên giữ event detail và events listing gốc.

  • Thiết lập: noindex,follow
  • Canonical: về /events/
  • Sitemap: loại khỏi sitemap

3.4. Lọc Jobs (/careers/jobs?department=…)

Trang lọc tuyển dụng thay đổi liên tục và tạo URL vô hạn. Thường bạn chỉ cần “career hub” và “job detail”.

  • Thiết lập: noindex,follow
  • Canonical: về /careers/jobs/
  • Sitemap: loại khỏi sitemap

3.5. Tracking params (utm_, gclid, fbclid)

Tracking không nên tạo phiên bản URL SEO. Điều quan trọng nhất là canonical về URL sạch và không gắn UTM trong link nội bộ.

  • Thiết lập: canonical URL sạch
  • Việc cần làm: rà lại menu/footer/banner nội bộ có gắn UTM không
  • Sitemap: chỉ submit URL sạch

4. Hướng dẫn thao tác cho WordPress

Bạn chỉ cần làm 2 việc: kiểm soát index của search/lọc theo query và làm sitemap sạch.

4.1. WordPress (nếu site content chạy WP)

Nếu site dùng WP, bạn có thể noindex search/tag mỏng và làm sitemap sạch ngay trong plugin SEO.

  • Noindex: search results, tag mỏng (nếu có)
  • Giảm link rác: tắt tag cloud/related tags nếu bơm link quá nhiều
  • Kiểm tra: sitemap không còn search/tag mỏng

4.2. Mẫu gửi dev (bạn chỉ việc điền URL thật)

Nếu bạn gửi dev đúng format, khả năng làm nhanh và ít sai cao hơn. Dưới đây là mẫu một trang.

Mẫu nội dung bạn gửi cho dev:

  • Mục tiêu: giảm index bloat, ưu tiên crawl vào Services/Solutions + Case Studies/Projects
  • Noindex (meta robots) cho:
    • /search*, /?s=*
    • /news?*, /events?*, /careers/jobs?*
  • Canonical:
    • URL lọc theo query → canonical về listing gốc không query
    • URL có utm_*|gclid|fbclid → canonical về URL sạch
  • Sitemap:
    • Include: services/solutions, industries, case studies/projects, resources landing
    • Exclude: search, mọi URL có query, URL có tracking
  • Test (URL Inspection): cung cấp 8 URL + kết quả mong đợi

5. Noindex có ảnh hưởng SEO không?

Noindex không làm tụt SEO nếu bạn áp đúng vào search/trang lọc/query. Rủi ro chỉ xảy ra khi bạn noindex nhầm trang dịch vụ/case study hoặc sitemap vẫn submit URL noindex.

3 trường hợp bạn cần phân biệt

Bạn sẽ an toàn nếu phân biệt đúng: noindex trang rác, noindex nhầm trang quan trọng, và chặn robots quá sớm khiến Google không đọc được noindex.

  • Noindex rác: thường giúp giảm index bloat
  • Noindex nhầm: tụt traffic nhanh
  • Chặn robots quá sớm: kết quả khó đoán

3 kiểm tra trước khi “chốt”

Trước khi xong, bạn chỉ cần làm 3 kiểm tra để giảm mạnh rủi ro.

  • URL noindex: không nằm trong sitemap
  • Trang quan trọng: vẫn “Index allowed”
  • URL Inspection: canonical không bị chọn sai

6. Theo dõi 7–14 ngày sau khi dọn

Sau 7–14 ngày, bạn cần thấy URL có query ngừng tăng và các trang dịch vụ/case study được crawl/index ổn định hơn. Nếu không đổi, thường là sitemap hoặc link nội bộ vẫn bơm rác.

KPI theo “nhóm trang cần lên”

Bạn chỉ cần đo 2 thứ: URL có ? trong Indexed giảm/đứng lại và một nhóm trang quan trọng có trạng thái index/canonical ổn định.

  • Pages: URL có ? trong Indexed còn tăng không
  • URL Inspection: 10 trang quan trọng (dịch vụ/case study) có canonical đúng không
  • Nếu có crawl stats: bot có bớt vào search/filter không

Nếu 14 ngày không cải thiện, bạn nên kiểm tra gì trước?

Nếu chưa cải thiện, thường là sitemap vẫn submit rác hoặc footer/sidebar vẫn link mạnh tới trang lọc.

Thứ tự kiểm tra:

  1. Sitemap còn URL có query/tracking không
  2. Footer/sidebar có link lọc/topic hàng loạt không
  3. Canonical listing gốc (news/events/jobs) có ổn không

7. FAQ – Câu hỏi thường gặp

Nếu bạn làm theo checklist 60 phút và test 4 URL, bạn sẽ tránh phần lớn rủi ro. Phần này trả lời đúng các câu hỏi người dùng thường gõ Google.

1) Trang tag có nên index không?

Chỉ nên index tag nếu tag đó là một “hub” có nhu cầu tìm kiếm và đủ nội dung. Nếu tag mỏng hoặc sinh hàng loạt, hãy noindex tag và loại khỏi sitemap.

2) Trang category có nên index không? (trên corporate site hiểu là “trang listing/hub”)

Trên website công ty lớn, “category” thường là trang listing/hub (news listing, resources listing, career hub). Bạn nên index trang hub gốc, còn các biến thể lọc theo query thì noindex filter.

3) Google crawl nhiều trang rác phải làm sao nếu site không có nút cấu hình?

Hãy gom pattern URL rác và gửi dev theo mẫu 4.3. Chỉ cần noindex search + noindex filter query + sitemap sạch là đã giảm crawl rác rõ rệt.

4) Có nên chặn robots.txt cho toàn bộ URL có dấu “?” không?

Không nên chặn bừa vì có thể chặn nhầm URL cần thiết. Cách an toàn là cấu hình noindex trước, test ổn, rồi mới cân nhắc chặn đúng pattern gây hại nhất.

Kết luận

Bạn chỉ cần nhớ 3 bước: chốt 3–5 dạng URL rác, chọn đúng “nút xử lý” (noindex/canonical/sitemap/link), rồi test 2 URL rác + 2 URL quan trọng bằng URL Inspection. Làm đúng, Google sẽ bớt crawl rác và tập trung vào trang cần lên.

Liên hệ Wecan Group

Nếu sau checklist bạn vẫn chưa xác định được pattern URL rác và cách xử lý (sitemap, internal link, noindex/canonical), Wecan Group có thể audit độc lập và đưa ra checklist triển khai phù hợp nền tảng website, giảm index bloat mà không làm tụt SEO.

Thông tin liên hệ:

  • Trụ sở chính: Tầng 9, Tòa nhà Hồ Gươm Plaza, 102 Trần Phú, Hà Đông, Hà Nội
  • Chi nhánh TP. Hồ Chí Minh: Tầng 2, Tòa nhà Itaxa, 126 Nguyễn Thị Minh Khai, Phường Xuân Hòa, TP. Hồ Chí Minh
  • Hotline: 024.6664.0261 – 0984.466.909 (Mr. Nam)
  • Email: [email protected]