Crawl và Index là hai bước khác nhau trong cách công cụ tìm kiếm xử lý website. Một URL có thể được Google biết đến nhưng chưa crawl, đã crawl nhưng chưa index, hoặc đã index nhưng không xếp hạng cho truy vấn bạn kỳ vọng.
Hiểu đúng hai khái niệm này giúp tránh cách xử lý sai như liên tục bấm Request Indexing trong khi URL đang bị noindex, canonical sang trang khác hoặc gần như không có internal link.
Nếu cần đặt Crawl và Index trong bức tranh SEO tổng thể trước khi đi sâu vào chẩn đoán kỹ thuật, xem Search Engine Optimization (SEO) là gì.
Crawl là gì?
Crawl là quá trình crawler phát hiện và truy cập URL để lấy nội dung cùng các tín hiệu kỹ thuật. URL có thể được phát hiện qua internal link, sitemap, backlink hoặc dữ liệu crawler đã biết trước đó.
Khả năng crawl chịu ảnh hưởng bởi HTTP status, robots.txt, server response, internal link và số lượng URL website tạo ra. Một URL nằm trong sitemap chưa có nghĩa sẽ được crawl ngay.
Index là gì?
Index là quá trình hệ thống xử lý nội dung và quyết định có lưu URL như một tài liệu có thể được cân nhắc cho kết quả tìm kiếm hay không. Đủ điều kiện index không đồng nghĩa chắc chắn được index.
Noindex, lỗi máy chủ, soft 404, canonicalization, nội dung duplicate hoặc trang không có giá trị độc lập có thể ảnh hưởng việc URL được chọn vào chỉ mục.
Crawl, Render, Index và Ranking khác nhau ra sao?
| Lớp | Câu hỏi chính |
|---|---|
| Crawl | Crawler có truy cập được URL không? |
| Render | Nội dung và liên kết quan trọng có xuất hiện sau khi dựng trang không? |
| Index | URL có được lưu để cân nhắc cho Search không? |
| Ranking | URL có phù hợp để hiển thị cho truy vấn cụ thể không? |
Dấu hiệu URL chưa được crawl
- URL không có internal link và chỉ có trong sitemap.
- robots.txt chặn đường dẫn cần truy cập.
- Server trả lỗi hoặc phản hồi không ổn định.
- Website tạo quá nhiều URL tham số, filter hoặc URL ít giá trị.
Dấu hiệu URL đã crawl nhưng chưa index
- URL Inspection cho thấy Google đã truy cập nhưng chưa chọn index.
- Trang có noindex.
- Canonical trỏ sang URL khác.
- Nội dung gần như trùng với trang khác.
- Trang giống soft 404 hoặc không có nhiệm vụ riêng.
Nếu URL không có nhiệm vụ riêng hoặc đang trùng search task với URL khác, cần xử lý search intent và URL owner trước khi chỉ tập trung Request Indexing; xem Content SEO là gì.
Quy trình chẩn đoán URL không lên Google
- HTTP: URL trả 200, redirect hay lỗi?
- Robots: robots.txt có chặn crawler không?
- Noindex: meta robots hoặc X-Robots-Tag có yêu cầu noindex không?
- Canonical: URL khai báo canonical về đâu?
- Sitemap: URL có nằm trong sitemap ưu tiên nếu dự kiến index không?
- Internal link: có trang liên quan nào dẫn tới URL không?
- Render: nội dung chính có xuất hiện trong rendered HTML không?
- Search Console: đối chiếu crawl/index thực tế.
Nếu vấn đề nằm ở canonical, xem Canonical là gì. Nếu đang phân biệt robots, noindex và sitemap, xem Robots.txt, Noindex và Sitemap khác nhau thế nào.
Nếu URL đã index nhưng website vẫn không cải thiện thứ hạng hoặc impression, cần chuyển sang lớp chẩn đoán rộng hơn về intent, nội dung, Onpage, internal link và UX; xem 10 lý do website không lên top Google và cách chẩn đoán.
Request Indexing có giải quyết được không?
Request Indexing hữu ích sau khi sửa một URL quan trọng, nhưng không phải nút ép index. Nếu nguyên nhân gốc là noindex, canonical sai, nội dung trùng hoặc trang rất ít giá trị, gửi lại nhiều lần không xử lý nguyên nhân.
Sitemap giúp gì cho Crawl và Index?
Sitemap giúp crawler phát hiện các URL ưu tiên. Nó không đảm bảo URL được index. Sitemap nên chứa các URL canonical, indexable và trả HTTP 200. Xem Sitemap là gì để kiểm tra chi tiết.
Internal Link ảnh hưởng như thế nào?
Internal link giúp discovery và làm rõ quan hệ giữa các URL. Một URL quan trọng nhưng không có internal link thường là tín hiệu kiến trúc chưa tốt, ngay cả khi URL có trong sitemap.
Crawl Budget có phải vấn đề của mọi site?
Không. Phần lớn website nhỏ và vừa nên ưu tiên sửa URL rác, redirect chain/loop, tham số không cần thiết và internal link trước khi coi crawl budget là dự án riêng.
Checklist xử lý URL chưa index
- URL trả 200 và nội dung hợp lệ.
- Không bị robots.txt chặn nhầm.
- Không có noindex ngoài ý muốn.
- Canonical phù hợp với URL owner.
- Có internal link từ trang liên quan.
- Có trong sitemap nếu là URL canonical dự kiến index.
- Rendered content đầy đủ trên mobile.
- Nội dung có nhiệm vụ riêng, không chỉ là bản sao của URL khác.
Đọc tiếp trong cụm Technical SEO
Đặt Crawl/Index trong toàn bộ hệ thống tại Technical SEO là gì. Khi cần audit toàn bộ nền tảng kỹ thuật, dùng checklist kỹ thuật SEO website.
Kết luận
Crawl trả lời “crawler có truy cập được không”, còn index trả lời “URL có được lưu để phục vụ Search không”. Khi URL không xuất hiện trên Google, hãy chẩn đoán theo thứ tự HTTP → robots → noindex → canonical → sitemap → internal link → rendering thay vì chỉ request indexing.
Nguồn tham khảo
- Google Search Central — Crawling and indexing documentation.
- Google Search Console — URL Inspection documentation.