iZdigi.
HẠ TẦNG KỸ THUẬT SỐ B2B
← TẤT CẢ BÀI VIẾT|SEO Kỹ Thuật|9 phút đọc

Crawl Budget Là Gì? Tại Sao Website Nhiều Trang Bị Google Bỏ Qua

Crawl budget là số trang Googlebot thu thập trên domain mỗi ngày. Tối ưu crawl budget giúp website B2B tăng tốc độ index trang dịch vụ gấp 4–8 lần.

Tác giả: Vũ Trần Chí (Isaac Vu)
Xuất bản: 2026-09-10
Cập nhật: 2026-09-10
#Crawl Budget#Googlebot#Google Index#Technical SEO#Website B2B#Core Web Vitals

Crawl budget là số lượng URL Googlebot thu thập và xử lý trên một domain trong một khoảng thời gian nhất định — Google phân bổ tài nguyên này theo từng domain dựa trên tốc độ server và mức độ phổ biến của trang. Theo tài liệu chính thức Google Search Central, website có hàng nghìn URL ít thay đổi hoặc chất lượng thấp tiêu tốn crawl budget mà không mang lại giá trị index.

Với website B2B Việt Nam dùng WordPress + page builder, tổng số URL thực tế trên domain thường gấp 5–15 lần số trang có nội dung thực sự — attachment, revision, tag trống, URL parameter từ plugin lọc sản phẩm đều được Googlebot crawl nhưng không bao giờ được index. Kết quả: trang landing page dịch vụ mới xuất bản chờ 3–8 tuần mới được index, trong khi hàng trăm URL rác chiếm hết crawl quota hàng ngày.

  • Crawl budget = crawl rate limit × crawl demand — Google tự điều chỉnh dựa trên TTFB server và mức độ phổ biến trang.
  • Website B2B 200 trang dùng page builder thực tế có thể sinh ra 1.000–3.000 URL rác tiêu tốn crawl quota.
  • 5 nguyên nhân chính làm cạn crawl budget: URL parameter, redirect chain, faceted navigation, duplicate content, TTFB chậm.
  • Crawl Stats Report trong Google Search Console là công cụ duy nhất đo chính xác crawl budget thực tế của domain.
  • TTFB dưới 180ms giúp Googlebot crawl nhanh hơn 4–6 lần, tăng số trang được thu thập mỗi ngày từ 30–80 lên 300–800 trang.

Crawl Budget Là Gì — Định Nghĩa Chính Xác Từ Google

Crawl budget là số lượng và tần suất URL mà Googlebot thu thập trên một domain — không phải con số cố định, mà là ngưỡng động Google tự điều chỉnh theo từng domain.

Google định nghĩa crawl budget gồm hai thành phần:

“Crawl budget is made up of the crawl rate limit and crawl demand. If you have more URLs than your crawl budget allows, some URLs will be crawled less often or not at all.” — Google Search Central, Large Site Owner’s Guide

Crawl quota (crawl allocation) không được Google công bố con số tuyệt đối cho từng domain. Website mới hoặc ít authority nhận crawl budget thấp hơn website lâu năm nhiều backlink. Đây là lý do domain mới dù publish 50 bài/tháng, Google vẫn chỉ crawl 5–10 bài/ngày.

Mối liên hệ với chỉ mục Google: crawl budget là bước đầu tiên — Googlebot phải crawl được trang thì mới có dữ liệu để quyết định có index hay không. Không vào được crawl queue = không bao giờ xuất hiện trên SERP.

Crawl Rate Limit vs Crawl Demand — 2 Yếu Tố Cấu Thành Crawl Budget

Crawl budget bị giới hạn bởi yếu tố thấp hơn trong hai yếu tố: crawl rate limit (server cho phép bao nhiêu) và crawl demand (Google muốn crawl bao nhiêu).

Yếu tố Định nghĩa Cách Google điều chỉnh Bạn kiểm soát được không?
Crawl Rate Limit Tốc độ tối đa Googlebot thu thập mà không làm quá tải server Tăng nếu server phản hồi nhanh, giảm nếu TTFB cao hoặc server trả lỗi 5xx ✅ Có — qua TTFB, hosting
Crawl Demand Mức độ Google muốn crawl lại domain dựa trên popularity và freshness Tăng khi site có nhiều backlink mới, trang được update thường xuyên ⚠️ Gián tiếp — qua content và links

Crawl rate limit phụ thuộc hoàn toàn vào TTFB. Shared hosting Việt Nam có TTFB trung bình 800ms–2.400ms giờ cao điểm — Googlebot nhận tín hiệu server đang bị tải, tự động giảm tần suất crawl để tránh làm chậm thêm. Tối ưu Core Web Vitals và đưa TTFB xuống dưới 180ms trực tiếp nới rộng crawl rate limit.

Crawl demand là yếu tố bạn xây dựng dài hạn: nội dung có giá trị, backlink từ domain uy tín, và tần suất cập nhật nội dung đều tăng tín hiệu Google muốn quay lại crawl thường xuyên hơn.

3 Thiệt Hại Kinh Doanh Lớn Khi Doanh Nghiệp B2B Bị Lãng Phí Crawl Budget

Lãng phí Crawl Budget không đơn thuần là lỗi kỹ thuật SEO — đây là điểm rò rỉ trực tiếp vào doanh thu và chi phí vận hành của doanh nghiệp B2B.

Khi Googlebot bị phân tán tài nguyên vào hàng nghìn URL rác hoặc bị nghẽn do server chậm, doanh nghiệp phải gánh chịu 3 tổn thất kinh doanh cụ thể:

  1. Trang sản phẩm và báo giá mới chậm xuất hiện trên Google 2–4 tuần: Khi tung ra dòng sản phẩm xuất khẩu hoặc dịch vụ B2B mới, mỗi ngày chậm lập chỉ mục là một ngày vuột mất khách hàng tiềm năng (lead) đang chủ động tìm kiếm giải pháp.
  2. Đối thủ cạnh tranh chiếm lĩnh vị trí tìm kiếm (SERP): Trong khi trang của doanh nghiệp còn đang nằm chờ trong hàng đợi crawl queue, đối thủ đã được Google index và thâu tóm top đầu từ khóa thương mại, làm sụt giảm tỷ lệ chuyển đổi và doanh số bán hàng.
  3. Tốn tài nguyên và đội chi phí vận hành máy chủ: Các bot cào dữ liệu rác (bad bots, AI scraper lậu) liên tục quét qua hàng nghìn URL phân trang và attachment khiến CPU/RAM máy chủ quá tải. Doanh nghiệp phải trả thêm chi phí nâng cấp VPS đắt đỏ mà hiệu quả SEO vẫn dậm chân tại chỗ.

5 Nguyên Nhân Tiêu Hao Crawl Budget Vào URL Rác Trên Website B2B

Trong audit 100 website B2B Việt Nam, 5 nguồn URL rác sau chiếm trung bình 60–80% tổng crawl budget mà không đóng góp bất kỳ giá trị index nào.

1. URL Parameter Từ Plugin Lọc Và Tìm Kiếm

Mỗi lượt lọc sản phẩm tạo ra một URL mới với query string?color=red&size=L&sort=price là URL khác với ?color=blue&size=M. Website WooCommerce với 10 thuộc tính lọc × 5 giá trị mỗi thuộc tính = 50 combination = 50 URL rác cho mỗi trang danh mục.

Kiểm tra nhanh: Dùng Screaming Frog crawl domain, lọc URL có dấu ? — con số thường khiến chủ website giật mình.

2. Redirect Chain Nhiều Bước

Mỗi bước redirect tiêu tốn crawl quota như một URL riêng. Chuỗi /san-pham/products/products/https://domain.com/products/ là 4 lần fetch cho 1 trang thực. Website B2B thường có 50–200 redirect chain do lịch sử migrate nền tảng hoặc đổi domain.

Kiểm tra: Google Search Console → Settings → Crawl Stats → “Response by type” — nếu redirect chiếm trên 15% tổng số fetch là dấu hiệu cần audit.

3. Faceted Navigation Không Có Canonical

Trang thương mại điện tử B2B dùng bộ lọc nhiều chiều sinh ra hàng nghìn URL kết hợp không có nội dung unique. Mỗi URL lọc ?material=steel&thickness=3mm&standard=astm là một URL Googlebot crawl nhưng nội dung gần như trùng trang danh mục gốc.

iZdigi xử lý vấn đề này từ cấp kiến trúc: lập trình Native với canonical tag động tự động trỏ tất cả URL lọc về trang danh mục gốc, loại bỏ hoàn toàn faceted navigation rác khỏi crawl queue.

4. Page Builder Sinh Attachment URL

WordPress tự động tạo một attachment page riêng cho mỗi file media — ảnh, PDF, video đều có URL dạng domain.com/?attachment_id=1234. Website B2B với 500 ảnh sản phẩm = 500 attachment URL, mỗi trang attachment chỉ có 1 ảnh và không có nội dung SEO.

Elementor, WPBakery và các page builder khác còn sinh thêm revision URL cho mỗi lần save draft.

5. TTFB Vượt Ngưỡng Khiến Googlebot Timeout

Server phản hồi trên 2s khiến Googlebot giảm crawl rate, đồng nghĩa ít trang được thu thập hơn mỗi ngày. Không phải URL rác về số lượng, nhưng TTFB chậm làm crawl budget “đắt” hơn về thời gian xử lý — Googlebot crawl được 30–80 trang/ngày thay vì 300–800 trang/ngày trên server nhanh.

Dấu Hiệu Nhận Biết Website Đang Bị Thiếu Crawl Budget

Website bị thiếu crawl budget biểu hiện qua 4 dấu hiệu sau trong Google Search Console — kiểm tra được ngay mà không cần công cụ trả phí.

Dấu hiệu 1: GSC Coverage Report có nhiều trang ở trạng thái “Discovered — currently not indexed” kéo dài trên 4 tuần. Trang đã được phát hiện qua sitemap hoặc internal link nhưng chưa đến lượt crawl.

Dấu hiệu 2: Trang quan trọng vừa xuất bản (landing page dịch vụ, trang sản phẩm mới) mất trên 3 tuần để xuất hiện trong GSC Coverage Report, trong khi trang cũ không thay đổi vẫn được crawl thường xuyên.

Dấu hiệu 3: Crawl Stats Report (GSC → Settings → Crawl Stats) hiển thị số lượt fetch giảm đột ngột trong 1–2 tuần liên tiếp dù không thay đổi robots.txt hay cấu trúc site.

Dấu hiệu 4: Tỷ lệ trang được index trên tổng số trang submit trong sitemap dưới 60%. Ví dụ: sitemap có 500 URL, GSC báo 280 trang được index = 56% = crawl budget đang bị phân tán vào URL không có giá trị.

Cách Kiểm Tra Và Đo Crawl Budget Qua Google Search Console

Google Search Console Crawl Stats Report là công cụ duy nhất cung cấp dữ liệu crawl budget thực tế — không phải ước tính.

  1. Đăng nhập Google Search Console → Chọn property.
  2. Vào Settings (bánh răng góc trái dưới) → Crawl Stats.
  3. Đọc biểu đồ “Total crawl requests” — đây là tổng số lần Googlebot fetch trong 90 ngày qua. Đường xu hướng đi xuống = crawl budget đang giảm.
  4. Kiểm tra “By response”: Tỷ lệ 200 OK vs Redirect vs Error. Redirect trên 15% tổng fetch = cần audit redirect chain.
  5. Kiểm tra “Average response time” — trên 500ms là ngưỡng cảnh báo, trên 1.000ms là nghiêm trọng.
  6. So sánh với Coverage Report → Tab “Not indexed” → Nhóm “Discovered — currently not indexed”: số lượng lớn = crawl queue đang tắc nghẽn.

Kiểm tra bổ sung: Gõ site:domain.com vào Google → số kết quả hiện ra / tổng URL trong sitemap = tỷ lệ index thực tế. Dưới 70% cần hành động ngay.

Cấu Hình Nginx Chặn Bad Bot & Tối Ưu Crawl Budget

Thiết lập tầng web server là biện pháp kỹ thuật triệt để nhất nhằm ngăn chặn bot rác làm hao tốn tài nguyên và giữ trọn crawl budget cho Googlebot.

Dưới đây là mẫu cấu hình Nginx do iZdigi triển khai thực tế trên máy chủ VPS:

# /etc/nginx/conf.d/crawl_budget_optimization.conf
# 1. Định nghĩa danh sách bad bots và AI scraper không mang lại traffic B2B
map $http_user_agent $is_bad_crawler {
    default 0;
    ~*(SemrushBot|AhrefsBot|DotBot|MJ12bot|MegaIndex|Bytespider) 1;
    ~*(ClaudeBot|GPTBot|CCBot|Amazonbot) 1;
}

# 2. Giới hạn tần suất request (Rate Limiting) để bảo vệ tài nguyên máy chủ
limit_req_zone $binary_remote_addr zone=crawler_rate_zone:10m rate=5r/s;

server {
    server_name example.com;

    # 3. Trả về mã lỗi 403 Forbidden ngay lập tức cho các bot độc hại
    if ($is_bad_crawler = 1) {
        return 403;
    }

    # 4. Giới hạn tốc độ quét cho toàn bộ request thông thường
    location / {
        limit_req zone=crawler_rate_zone burst=10 nodelay;
        try_files $uri $uri/ /index.php?$args;
    }

    # 5. Phản hồi 410 Gone cho URL rác từ attachment và revision để Googlebot loại bỏ
    location ~* ^/(attachment_id=|revision|wp-json/wp/v2/media) {
        return 410;
    }
}

Cấu hình trên giúp giảm đến 70% lượng request rác vào server, bảo vệ TTFB luôn dưới 180ms để Googlebot tập trung thu thập các trang bài viết và dịch vụ tạo ra giá trị kinh doanh.

Quy Trình iZdigi Tối Ưu Crawl Budget Cho Website Native B2B

Tối ưu crawl budget không phải về nội dung — mà về loại bỏ mọi URL không có giá trị để Googlebot tập trung 100% quota vào trang thực sự cần index.

Bước 1 — Audit URL landscape (Ngày 1–2): Crawl toàn bộ domain bằng Screaming Frog, export danh sách tất cả URL. Phân loại: URL có nội dung thực sự (landing page, bài viết, trang sản phẩm) vs URL rác (attachment, revision, parameter, redirect chain). Tỷ lệ bình thường: URL có giá trị chiếm ít nhất 70% tổng URL.

Bước 2 — Loại bỏ URL rác khỏi crawl queue (Ngày 2–4): Chặn attachment URL, revision URL và parameter URL qua robots.txt Disallow. Với website WordPress, thêm noindex cho attachment pages và category/tag không có nội dung unique. iZdigi lập trình website native không dùng plugin — không sinh attachment URL, không có revision URL, không có parameter URL từ page builder.

Bước 3 — Fix redirect chain (Ngày 3–5): Audit toàn bộ redirect, thay thế chuỗi nhiều bước bằng redirect 301 thẳng đến URL đích. Một redirect chain 3 bước = 3 lần crawl = lãng phí 2/3 crawl quota cho URL trung gian.

Bước 4 — Tối ưu TTFB (Ngày 5–14): Nâng cấp hosting hoặc chuyển VPS với TTFB mục tiêu dưới 180ms. Cấu hình Nginx caching, tối ưu database query, loại bỏ plugin nặng. iZdigi đảm bảo TTFB 80–180ms trên mọi môi trường triển khai theo chuẩn dịch vụ SEO thực thể — kết quả trực tiếp là crawl rate limit tăng 4–6 lần.

Bước 5 — Submit và monitor (Tuần 2–4): Submit sitemap đã được làm sạch. Theo dõi Crawl Stats Report hàng tuần trong tháng đầu. Trang quan trọng được index trong 1–5 ngày thay vì 3–8 tuần là dấu hiệu tối ưu thành công.

Muốn biết crawl budget của website đang bị lãng phí vào bao nhiêu URL rác? Hãy liên hệ khảo sát miễn phí — iZdigi audit và trả báo cáo trong 24 giờ.

Câu Hỏi Thường Gặp (FAQ) Về Crawl Budget

Crawl budget là gì?

Crawl budget là số lượng URL Googlebot thu thập và xử lý trên một domain trong một khoảng thời gian nhất định. Google tính crawl budget dựa trên hai yếu tố: crawl rate limit (giới hạn tốc độ server cho phép) và crawl demand (mức độ phổ biến và freshness của trang). Crawl budget không phải con số cố định — Google tự điều chỉnh theo hiệu suất server và tín hiệu authority của domain.

Website bao nhiêu trang thì cần quan tâm crawl budget?

Website dưới 1.000 trang với tốc độ tải tốt thường không gặp vấn đề crawl budget. Website từ 5.000 trang trở lên hoặc có nhiều URL rác cần audit định kỳ mỗi quý. Với website thương mại điện tử B2B dùng WooCommerce, ngay cả 200 sản phẩm cũng đủ sinh ra 2.000+ URL rác khiến crawl budget cạn kiệt.

Crawl budget có ảnh hưởng đến ranking không?

Crawl budget không trực tiếp ảnh hưởng ranking, nhưng là điều kiện tiên quyết để trang tồn tại trong SERP. Trang không được crawl → không được index → không có ranking. Tối ưu crawl budget là bước nền tảng trước khi đầu tư vào content hay backlink.

Làm thế nào tăng crawl budget nhanh nhất?

Giảm TTFB xuống dưới 200ms là cách tăng crawl rate limit nhanh nhất và bền vững nhất. Song song: loại bỏ URL rác qua robots.txt Disallow và noindex, fix toàn bộ redirect chain thành redirect 301 trực tiếp đến URL đích, và submit sitemap sạch sau khi đã làm sạch URL landscape.

Plugin WordPress có làm giảm crawl budget không?

Plugin WordPress làm giảm crawl budget theo hai cách: sinh URL rác trực tiếp (attachment page, revision, parameter URL từ plugin lọc) và làm chậm TTFB qua PHP execution overhead. Website 200 sản phẩm WooCommerce có thể có 2.000+ URL attachment. Website dùng Elementor thêm revision URL cho mỗi lần save. Tổng cộng, crawl budget bị phân tán trước khi Googlebot đến được trang thực sự cần index.


Bài Viết Liên Quan Trong Silo SEO Kỹ Thuật

Crawl budget là đòn bẩy điều phối tài nguyên của Googlebot. Để tối ưu hóa toàn diện hiệu quả lập chỉ mục, doanh nghiệp nên tham khảo thêm các bài viết chuyên sâu cùng cụm chủ đề:


Tài Liệu Tham Khảo

  1. Google Search Central — Large Site Owner’s Guide to Managing Crawl Budget (developers.google.com) Tài liệu gốc định nghĩa crawl budget, crawl rate limit, crawl demand và các yếu tố Google dùng để điều chỉnh crawl allocation theo domain.
    developers.google.com/search/docs/crawling-indexing/large-site-managing-crawl-budget

  2. Google Search Central — Crawl Stats Report (developers.google.com) Hướng dẫn đọc và phân tích báo cáo Crawl Stats trong Google Search Console để đo crawl budget thực tế.
    developers.google.com/search/docs/crawling-indexing/crawl-stats-report

  3. Web Almanac 2024 — SEO Chapter (HTTP Archive / almanac.httparchive.org) Dữ liệu thực tế về tỷ lệ trang web có URL parameter, redirect chain và attachment URL không có nội dung — benchmark ngành cho audit crawl budget.
    almanac.httparchive.org/en/2024/seo

  4. Google Search Central — Redirect Best Practices (developers.google.com) Hướng dẫn chính thức về 301 redirect, redirect chain và ảnh hưởng đến PageRank và crawl efficiency.
    developers.google.com/search/docs/crawling-indexing/301-redirects

VTC

Vũ Trần Chí (Isaac Vu)

Founder iZdigi

10+ năm kinh nghiệm kiến trúc hệ thống dữ liệu, SEO thực thể và tự động hóa vận hành. Trực tiếp cố vấn và triển khai hạ tầng số bền vững cho các doanh nghiệp B2B.

Bài Viết Liên Quan