Audit SEO kỹ thuật 30 phút để biết website có đang tự phá SEO không

Mục lục

Bài này giúp bạn tự audit SEO kỹ thuật trong 30 phút để biết website có đang tự chặn Google crawl/index, chọn sai trang chuẩn (canonical), hay bị sitemap và trang rác làm lãng phí crawl. Làm xong bạn có 1 trang report kèm URL bằng chứng để giao team sửa ngay.

1. Chuẩn bị trong 3 phút để audit không bị thiếu dữ liệu

Website công ty hay sai nhất là xem nhầm GSC property và nhầm “bản chuẩn” của URL. Chốt đúng property, đúng hệ thống domain/subdomain, và 5 URL đại diện trước khi bắt đầu.

1.1. Xác nhận bạn đang audit đúng GSC property

Nếu bạn đang xem sai property, mọi số Indexed/Not indexed đều sai. Ưu tiên Domain property để nhìn đủ www + /en/ + mọi phần nội dung liên quan.

Thao tác làm nhanh trong GSC

  • Vào Google Search Console
  • Góc trên trái chọn đúng website (dropdown property)
  • Bấm Cài đặt (biểu tượng bánh răng) → Cài đặt thuộc tính / Property settings
  • Nhìn mục Loại thuộc tính
    • Nếu thấy “Domain property” → ok
    • Nếu thấy “URL-prefix property” → ghi chú “đang xem 1 prefix, có thể thiếu dữ liệu”

Bạn cần chốt 3 thứ (ghi vào đầu report)

  • Mô hình URL: 1 domain + thư mục ngôn ngữ như /en/ (hoặc có subdomain).
  • Loại property: Domain property hay URL-prefix property.
  • “Bản chuẩn” URL: www hay non-www, https bắt buộc, redirect có nhất quán không.

Thao tác xác nhận “bản chuẩn” (không cần tool)

  • Mở 2 link trên trình duyệt:
    • http://domain.com
    • https://domain.com
    • https://www.domain.com
  • Quan sát thanh địa chỉ sau khi tải xong: nó bị chuyển về 1 bản duy nhất không (ví dụ luôn về https + www)

Ví dụ với Wecan Group, site có cả bản tiếng Việt và tiếng Anh dạng thư mục /en/ (ví dụ trang chủ EN).

1.2. Chốt 5 URL để test đúng tầng nội dung

Đừng test URL linh tinh. Chọn 5 URL đại diện cho các tầng hay lỗi nhất của website công ty: giới thiệu, dự án/portfolio, ngành/nhóm nội dung, và 1 URL có PDF hoặc tham số tracking nếu bạn có.

Thao tác lấy 5 URL trong 2 phút

  • Mở website, lấy link từ menu chính (About, Projects, Industries).
  • Lấy 1 URL dưới /en/ và 1 URL không có /en/ (để test cặp ngôn ngữ).
  • Tìm PDF: vào trang About/Company Profile → bấm nút tải → copy link file .pdf
  • Nếu cần URL có UTM: lấy từ GA4 (mục Pages/landing page) hoặc từ link bạn từng share qua ads/email.

Gợi ý 5 URL mẫu theo Wecan Group (bạn thay bằng URL tương đương trên site bạn audit)

2. Chẩn đoán tổng quan trong 5 phút bằng GSC Pages

Đừng chỉ nhìn tổng Not indexed. Với website công ty, hãy tách theo tầng nội dung để biết tầng nào đang bị loại khỏi index nhiều nhất và tầng nào bị Google chọn “trang chuẩn” khác.

2.1. Cách tách tầng nhanh để biết “tầng nào đang chết”

Trong Pages, lọc theo mẫu URL/thư mục. Mục tiêu 5 phút là trả lời 2 câu: tầng nào Not indexed nhiều nhất và tầng nào bị Google chọn trang chuẩn khác nhiều nhất.

Thao tác lọc theo tầng trong GSC

  • Menu trái → Lập chỉ mục → Trang (Pages)
  • Ở bảng/biểu đồ, bấm vào tab Không được lập chỉ mục (Not indexed) hoặc Được lập chỉ mục (Indexed) để xem tổng quan
  • Bấm vào một lý do (ví dụ “Trang thay thế, Google chọn trang chuẩn khác”) để mở danh sách URL mẫu
  • Dùng ô tìm kiếm trong danh sách URL (nếu có) hoặc copy vài URL mẫu ra note, rồi nhóm theo thư mục:
    • có /en/ không
    • có /nganh/ không
    • có /Featured-Projects/ không
    • có đuôi .pdf không

Các tầng bạn nên tách (tuỳ site, nhưng thường sẽ có)

  • Giới thiệu: kiểu /ve-wecan-group/
  • Dự án/portfolio: kiểu /en/Featured-Projects/
  • Ngành/nhóm nội dung: kiểu /en/nganh/…/
  • Tài liệu: PDF hoặc /downloads/, /assets/
  • Ngôn ngữ: /en/ vs không có /en/

Ghi ngay vào report

  • “Tầng bị loại khỏi index nhiều nhất là … (dựa trên URL mẫu của lý do X)”
  • “Tầng hay bị chọn trang chuẩn khác là … (dựa trên lý do canonical)”

2.2. 4 pattern và ví dụ kết luận thực chiến

Chỉ cần match 4 pattern, nhưng áp vào từng tầng để khỏi đoán mò.

Thao tác để “match pattern” trong 1 phút

  • Trong báo cáo Trang, bấm lần lượt 4 nhóm lý do sau (nếu xuất hiện), rồi mở danh sách URL mẫu để xem nó rơi vào tầng nào:
    • Nhóm bị chặn (robots/noindex)
    • Nhóm canonical (Google chọn trang chuẩn khác / Alternate)
    • Nhóm “Đã phát hiện nhưng chưa lập chỉ mục” (Discovered)
    • Nhóm “Đã crawl nhưng chưa lập chỉ mục” (Crawled)

Cách đọc nhanh

  • “bị chặn lập chỉ mục” tăng mạnh → thường do cấu hình chặn theo template hoặc theo thư mục
  • “trang thay thế, Google chọn trang chuẩn khác” tăng mạnh → thường do trùng nội dung giữa EN/VN hoặc giữa HTML/PDF
  • “đã phát hiện nhưng chưa lập chỉ mục” kéo dài → thường do quá nhiều URL phụ/rác khiến bot không ưu tiên
  • “đã crawl nhưng chưa lập chỉ mục” kéo dài → thường do trùng lặp/tín hiệu yếu ở tầng đó

Ví dụ suy luận theo cấu trúc Wecan Group

  • Nếu nhóm URL /en/nganh/…/ nằm nhiều trong “chưa lập chỉ mục” → nghi trang listing theo ngành tạo nhiều trang na ná hoặc phân trang
  • Nếu URL .pdf xuất hiện trong nhóm canonical hoặc có nhiều PDF được index → nghi PDF đang cạnh tranh với trang HTML giới thiệu dự án/giải pháp

3. Test URL Inspection 5 phút theo “3 cặp trùng” hay gặp ở website công ty

Test 1 URL là chưa đủ. Website công ty hay trùng theo 3 kiểu: bản ngôn ngữ, bản HTML vs PDF, và bản có tham số tracking. Bạn phải test theo cặp mới thấy Google đang chọn bản nào làm trang chuẩn.

3.1. 6 điểm phải nhìn + ghi rõ bạn đang so cặp nào

Khi dán URL vào URL Inspection, bạn chỉ cần tập trung vào 6 điểm, và thêm 1 dòng “URL cặp so sánh” để kết luận không bị mơ hồ.

Thao tác kiểm tra URL (URL Inspection)

  • Menu trái → Kiểm tra URL
  • Dán URL A → Enter → chờ báo cáo hiện “URL nằm trên Google” hoặc lý do không nằm trên Google
  • Bấm vào dòng Lập chỉ mục trang (mũi tên xổ xuống) để xem chi tiết
  • Tìm 2 dòng quan trọng:
    • Trang chuẩn do người dùng khai báo (User-declared canonical)
    • Trang chuẩn do Google chọn (Google-selected canonical)
  • Ghi lại thêm: Lần thu thập dữ liệu gần nhất (Last crawl) và Trạng thái (Indexed/Not indexed)

6 điểm cần nhìn

  • Trang có được phép lập chỉ mục không
  • Có dấu hiệu bị chặn không (robots/noindex)
  • Trang chuẩn do site khai báo
  • Trang chuẩn do Google chọn
  • Lần crawl gần nhất
  • Trạng thái index

Cách ghi vào report (để so cặp dù chỉ có 1 ô nhập)

  • Dòng 1: “URL A vs URL B”
  • Dòng 2: “Google chọn canonical = …” (ghi đúng URL)
  • Dòng 3: “Kết luận: A bị đè bởi B / A và B tách vai đúng”

3.2. Cặp ngôn ngữ: /en/ vs không /en/

Hãy test 1 trang tiếng Anh và 1 trang tiếng Việt tương đương. Nếu Google chọn bản EN làm trang chuẩn cho bản VN, bạn cần rà lại cấu hình ngôn ngữ và quy tắc “trang chuẩn”.

Thao tác so cặp ngôn ngữ đúng cách

  • Chọn 2 URL cùng chủ đề (một bản /en/, một bản không có /en/)
  • Chạy URL A trong URL Inspection → ghi “Google-selected canonical”
  • Chạy URL B trong URL Inspection → ghi “Google-selected canonical”
  • So 2 kết quả:
    • Nếu bản VN có Google canonical = bản EN → bản VN đang bị đè

Ví dụ cặp bạn có thể dùng để test trên Wecan Group

  • Trang EN dưới /en/ (ví dụ trang chủ EN)
  • Trang VN tương ứng (trang chủ VN)

Cách ghi kết luận ngắn gọn

  • “Google chọn bản EN làm trang chuẩn khi audit bản VN → ưu tiên kiểm cấu hình ngôn ngữ + quy tắc canonical/hreflang.”

3.3. Cặp HTML vs PDF: trang giới thiệu vs tài liệu tải về

Nếu site có PDF, hãy test một trang HTML và file PDF có nội dung gần giống. Khi Google ưu tiên PDF, người dùng vào kết quả tìm kiếm dễ bị đưa thẳng vào PDF.

Thao tác lấy link PDF từ trang HTML

  • Mở trang HTML (About/Company Profile/Press)
  • Ctrl+F gõ “pdf” hoặc bấm nút Download
  • Chuột phải → Copy link address (link thường kết thúc bằng .pdf)

Thao tác so cặp HTML vs PDF

  • URL Inspection chạy URL HTML → xem Google-selected canonical
  • URL Inspection chạy URL PDF → xem Google-selected canonical
  • Kết luận:
    • Nếu ở báo cáo của HTML, Google canonical trỏ về PDF → PDF đang “đè” HTML
    • Nếu cả hai index nhưng PDF nhận nhiều hiển thị → cần kiểm thêm Performance (phần Trang)

Ví dụ trên Wecan Group

  • Trang HTML: https://wecan-group.com/en/Featured-Projects/ hoặc https://wecan-group.com/ve-wecan-group/
  • PDF profile: …/Wecan-Group-Profile_2022.pdf

Cách kết luận đúng kiểu giao việc

  • “PDF đang được chọn làm bản ưu tiên hơn HTML → cần điều chỉnh để HTML là trang chính, PDF là tài nguyên phụ.”

3.4. Cặp URL sạch vs URL có tham số tracking (?utm_, ?ref=)

Lấy 1 URL sạch và 1 URL có UTM/ref. Nếu Google chọn bản có tham số làm trang chuẩn, bạn đang tự tạo trùng lặp và làm index “bẩn”.

Thao tác lấy 1 URL có UTM nhanh

  • Nếu bạn có GA4: vào Reports → Engagement → Pages and screens, tìm trang hay được vào từ campaign/email rồi lấy URL có UTM
  • Nếu không có GA4: lấy từ link bạn từng chạy ads/email hoặc link share nội bộ

Thao tác so cặp

  • Chạy URL sạch trong URL Inspection → ghi canonical
  • Chạy URL có UTM trong URL Inspection → ghi canonical
  • Kết luận:
    • Nếu canonical của URL có UTM không trỏ về URL sạch → cần chuẩn hoá

Cách ghi kết luận

  • “Trang có tham số không trỏ về URL sạch → cần chuẩn hoá canonical về URL sạch, tránh index bản tracking.”

4. Nhóm lỗi phá index mức độ cao 10 phút

Nhóm này là lỗi “tắt công tắc” hoặc làm Google hiểu sai trang: chặn index, trang chuẩn nhảy bản, chuyển hướng loạn. Gặp nhóm này thì xử lý trước mọi thứ khác.

4.1. Chặn index do robots/noindex theo môi trường và template

Website công ty hay dính chặn nhầm vì rule còn sót từ staging/uat hoặc vì template gắn chế độ “không lập chỉ mục” cho cả nhóm trang.

Soát robots.txt theo thư mục nhạy cảm

Mở domain.com/robots.txt và tìm các rule chặn theo thư mục.

Thao tác soát robots.txt trong 2 phút

  • Mở: https://domain.com/robots.txt
  • Tìm nhanh bằng Ctrl+F các từ:
    • Disallow:
    • search
    • pdf
    • download
  • Copy 1–2 dòng Disallow nghi vấn vào report (để team sửa đúng chỗ)

Bạn cần ghi rõ 2 thứ vào report

  • Rule đang chặn gì (đường dẫn cụ thể)
  • Nhóm trang bị ảnh hưởng (tài liệu / tin / danh mục / dự án…)

Soát “không lập chỉ mục” theo template (không chỉ theo 1 URL)

Đừng kiểm 1 trang. Hãy kiểm theo nhóm template: 1 trang giới thiệu, 1 trang listing, 1 trang chi tiết, 1 trang tuyển dụng (nếu có).

Thao tác check noindex nhanh (không cần tool)

  • Mở trang → chuột phải View page source → Ctrl+F tìm noindex
  • Nếu không thấy, vẫn phải xác nhận bằng URL Inspection (vì có thể bị chặn bằng header)

Thao tác check noindex bằng URL Inspection (đáng tin hơn)

  • Kiểm tra URL → mở phần chi tiết “Lập chỉ mục trang”
  • Tìm dòng liên quan “được phép lập chỉ mục” / dấu hiệu chặn

Ví dụ chọn theo Wecan Group

  • Giới thiệu: /ve-wecan-group/
  • Listing dự án: /en/Featured-Projects/
  • Listing ngành: /en/nganh/Finance-and-Banking/

Kết luận viết cho team sửa

  • “Nhóm template X đang đặt chế độ không lập chỉ mục → ảnh hưởng Y URL → cần chỉnh ở template, không sửa lẻ.”

4.2. Trang chuẩn và chuyển hướng: bắt lỗi nhảy bản, về homepage, và chuyển hướng theo quốc gia

Website công ty hay sai 2 kiểu: trang chuẩn nhảy sang bản khác (ngôn ngữ/PDF) hoặc nhiều trang con lại trỏ về trang chủ. Nếu có chuyển hướng theo quốc gia/thiết bị, phải test bằng URL Inspection vì góc nhìn Googlebot có thể khác người dùng.

Test 3 trang đại diện để bắt “trang chuẩn nhảy hệ”

Chọn 3 trang đại diện cho 3 tầng: giới thiệu, dự án, ngành. Với mỗi trang, ghi lại: site khai báo trang chuẩn là gì và Google chọn trang chuẩn là gì.

Thao tác ghi canonical đúng chỗ trong URL Inspection

  • Kiểm tra URL → mở mục chi tiết “Lập chỉ mục trang”
  • Lấy 2 dòng:
    • “User-declared canonical”
    • “Google-selected canonical”
  • Dán vào report theo 2 cột: “site khai báo” vs “Google chọn”

Gợi ý 3 trang mẫu theo Wecan Group

  • /ve-wecan-group/
  • /en/Featured-Projects/
  • /en/nganh/Finance-and-Banking/

Kết luận phải viết được theo format

  • “Google đang chọn bản B thay vì bản A → A sẽ khó lên → cần chỉnh quy tắc canonical/định tuyến.”

Cảnh báo chuyển hướng theo quốc gia: chỉ tin URL Inspection

Nếu site tự chuyển người dùng sang bản ngôn ngữ, bạn không được kết luận bằng việc tự mở trình duyệt.

Thao tác kiểm chuyển hướng dưới góc nhìn Googlebot

  • Vẫn dùng URL Inspection (vì đó là góc nhìn Google)
  • Nếu thấy Google-selected canonical luôn trỏ về bản khác ngôn ngữ bạn đang audit, hoặc “Trang đã chuyển hướng” xuất hiện trong chi tiết → đưa vào report

Kết luận mẫu

  • “Chuyển hướng khiến Googlebot thấy bản khác người dùng → nguy cơ index lộn ngôn ngữ → cần rà logic chuyển hướng.”

5. Crawl waste và index rác 7 phút: sitemap nhiều tầng, search/tag/event/PDF

Website công ty hay lãng phí crawl vì nhiều sitemap con và nhiều trang phụ như search nội bộ, tag listing, phân trang, media/PDF. Dọn đúng loại rác sẽ trả crawl budget về cho trang chính.

5.1. Sitemap: kiểm sitemap-index và sitemap theo tầng

Đừng chỉ xem 1 sitemap. Hãy kiểm sitemap-index có trỏ đủ sitemap con không, rồi kiểm riêng sitemap của listing và sitemap tài liệu (PDF) nếu có.

Thao tác kiểm sitemap trong GSC

  • Menu trái → Lập chỉ mục → Sơ đồ trang web (Sitemaps)
  • Xem danh sách sitemap đã khai báo và trạng thái (Thành công/Lỗi)
  • Bấm vào từng sitemap để xem:
    • Số URL được phát hiện
    • Ngày đọc lần cuối
  • Copy 5 URL mẫu trong sitemap (mở sitemap ra trình duyệt nếu cần) để xem nó có chứa /tag/, /page/, .pdf, tham số ? không

Những câu hỏi phải trả lời trong 3 phút

  • Sitemap tổng có trỏ đủ các sitemap con không
  • Sitemap listing có nhét tag/pagination không
  • Sitemap tài liệu có đang “đè” sitemap trang HTML không

Ví dụ minh hoạ: Wecan Group có file PDF profile công khai, đây là loại URL dễ lọt vào sitemap tài liệu hoặc bị Google ưu tiên nếu HTML tương tự.

5.2. Phát hiện rác index bằng 5 câu search nhanh (copy là dùng)

Chạy 5 câu dưới đây để lộ rác index nhanh, rồi ghi lại mẫu URL rác phổ biến nhất.

Thao tác

  • Mở Google (không phải GSC)
  • Copy từng câu và dán tìm
  • Ghi lại 5 URL đầu tiên xuất hiện (đó là mẫu rác điển hình)
    • site:wecan-group.com inurl:search
    • site:wecan-group.com inurl:?q=
    • site:wecan-group.com inurl:/tag/
    • site:wecan-group.com inurl:/page/
    • site:wecan-group.com filetype:pdf

Quy tắc quyết định nhanh

  • Search nội bộ: gần như luôn không nên index
  • Tag listing: chỉ giữ nếu có trang hub mạnh và nhu cầu tìm kiếm thật
  • PDF: index được, nhưng không nên để PDF cướp top của trang HTML

6. Loãng tín hiệu 5 phút: title template lỗi và cannibal “giới thiệu” bị nhân bản

Khi không bị chặn index mà vẫn index sai hoặc rank không ổn, thường là do tín hiệu loãng: title bị trùng do template, hoặc nhiều trang “giới thiệu” na ná nhau khiến Google phân vân.

6.1. Test nhanh title template kiểu “Page Title | Company Name”

Title dạng “{Tên trang} | {Tên công ty}” là bình thường. Vấn đề là khi “Tên trang” bị rỗng hoặc lặp theo taxonomy → thành trùng hàng loạt.

Thao tác test title trùng trong 2 phút

  • Mở 1 trang hub quan trọng (ví dụ Projects)
  • Copy đúng Title (nhìn trên tab trình duyệt) hoặc copy 1 đoạn đặc trưng sau dấu |
  • Dán lên Google theo mẫu:
    • site:domain.com “đoạn title đó”
  • Nếu ra quá nhiều kết quả giống nhau → title template đang lỗi hoặc các trang đang không phân biệt được

Ưu tiên sửa title cho:

  • Trang giới thiệu/hub chính
  • Trang dự án/hub dự án
  • Trang ngành/hub ngành
  • Trang press/news hub (nếu có)

6.2. Cannibal nhẹ: nhiều trang “giới thiệu” na ná nhau

Website công ty rất hay có nhiều URL kiểu /about/, /company/, /who-we-are/ hoặc bản ngôn ngữ khác nhau nói cùng một ý.

Thao tác phát hiện cannibal nhanh

  • Dùng Google search:
    • site:domain.com about
    • site:domain.com “who we are”
  • Mở 3–5 kết quả đầu, nhìn xem chúng có cùng intent “giới thiệu công ty” không
  • Nếu cùng intent → ghi list URL vào report để “phân vai”

Cách phân vai (ghi đúng để team làm)

  • Chọn 1 trang làm “giới thiệu chính” (hub)
  • Các trang còn lại phải:
    • khác biệt thật sự theo nội dung/đối tượng
    • liên kết nội bộ rõ vai trò (hub ↔ trang phụ)
    • tránh tình trạng trang phụ copy hub

Ví dụ: trang giới thiệu Wecan Group là /ve-wecan-group/ (ứng viên “giới thiệu chính” bản tiếng Việt).

7. Report 1 trang và ticket hoá để không bị treo

Audit xong phải ra 1 trang report giao việc được. Với website công ty, nếu thiếu người phụ trách, tác động, và phạm vi ảnh hưởng, report rất dễ bị để đó.

7.1. Mẫu report 1 trang (ghi ngắn nhưng đủ giao việc)

Chia 3 mức độ

  • Cao: chặn index, canonical nhảy bản (EN/PDF), chuyển hướng gây index lộn, lỗi server
  • Trung bình: sitemap bẩn, rác index từ search/tag/pagination, PDF cướp top
  • Thấp: title template trùng, nhiều trang giới thiệu na ná

Thao tác để lấy “bằng chứng”

  • Với lỗi theo tầng: chụp màn hình trong Trang (Pages) tại đúng lý do + danh sách URL mẫu
  • Với lỗi từng URL: chụp màn hình trong Kiểm tra URL phần có 2 dòng canonical
  • Với rác index: lưu lại 5 kết quả tìm kiếm Google (URL mẫu)

7.2. Format dòng lỗi chuẩn có Owner + Impact + Scope

  • Lỗi: “Google chọn PDF làm bản ưu tiên hơn trang HTML dự án”
  • Bằng chứng: URL Inspection cho thấy Google-selected canonical trỏ về URL PDF (ví dụ Wecan-Group-Profile_2022.pdf)
  • Tác động: người dùng vào SERP bị đưa vào PDF, khó điều hướng, khó đo lường
  • Phạm vi: các trang có link PDF tương tự (ước lượng theo Pages/URL list)
  • Người xử lý: web platform / SEO / content ops
  • Việc cần làm: làm rõ HTML là trang chính, PDF là tài nguyên; kiểm lại theo cặp HTML vs PDF

Liên hệ Wecan Group

Trước khi scale traffic, hãy chắc chắn website đã sẵn sàng về cấu trúc, kỹ thuật và đo lường. Wecan Group hỗ trợ tư vấn, rà soát và xử lý giúp bạn toàn bộ.

Địa chỉ:

  • Trụ sở chính: Tầng 9, Tòa nhà Hồ Gươm Plaza, 102 Trần Phú, Hà Đông, Hà Nội.
  • Chi nhánh TP. Hồ Chí Minh: Tầng 2, Tòa nhà Itaxa, 126 Nguyễn Thị Minh Khai, Phường Xuân Hòa, TP. Hồ Chí Minh.

Hotline: 024.6664 0261 – 098.44.66.909 (Mr. Nam)

Email: [email protected]