Skip to main content

AEO Audit Score — Blog

Khi GPTBot crawl fail, nguyên nhân phổ biến nhất với web Việt là ba nhóm: bị chặn trong robots.txt hoặc tường lửa, nội dung chỉ hiển thị sau khi JavaScript chạy khiến bot đọc ra trang trống, và máy chủ chặn nhầm bot do cấu hình chống spam quá gắt. Cách xử lý là kiểm tra lần lượt từng lớp: robots.txt → khả năng render không cần JS → cấu hình server/CDN, rồi mở đúng chỗ đang chặn.

Đây là vấn đề rất hay gặp ở Việt Nam vì nhiều website dùng nền tảng nặng JavaScript, dùng CDN chặn bot mạnh tay, hoặc sao chép cấu hình bảo mật mà không rà lại. Bài này hướng dẫn chẩn đoán và khắc phục theo đúng bối cảnh web Việt.

GPTBot crawl fail nghĩa là gì?

“Crawl fail” là khi GPTBot cố truy cập website của bạn nhưng không lấy được nội dung hữu ích — có thể bị từ chối truy cập, nhận về trang lỗi, hoặc nhận về trang trống không có nội dung thật. Hậu quả: nội dung của bạn không được đưa vào dữ liệu mà AI dùng để trả lời, nên bạn khó được ChatGPT nhắc đến. Đây là lỗi ở lớp nền — nghiêm trọng vì nó vô hiệu hóa mọi tối ưu khác. Muốn hiểu vai trò của GPTBot, đọc GPTBot / ClaudeBot là gì.

Ba nguyên nhân phổ biến ở web Việt và cách sửa

1. Bị chặn trong robots.txt

Đây là nguyên nhân đơn giản và phổ biến nhất. Mở tencongty.com/robots.txt và tìm các dòng chặn GPTBot. Nếu thấy User-agent: GPTBot theo sau là Disallow: /, hoặc một Disallow: / áp cho tất cả bot, thì bot đang bị khóa.

Cách sửa: Xóa dòng Disallow chặn GPTBot, hoặc khai báo rõ cho phép. Sau khi sửa, kiểm tra lại file để chắc thay đổi đã có hiệu lực. Lưu ý cân nhắc chủ đích: chỉ mở nếu bạn muốn AI đọc nội dung của mình.

2. Nội dung chôn sau JavaScript

Nhiều website Việt dựng bằng framework hiện đại (React, Vue, Angular) hoặc trình tạo trang nặng JS. Vấn đề: một số bot AI không chạy JavaScript hoặc chạy hạn chế, nên khi vào trang chúng chỉ thấy một khung HTML gần như trống, nội dung thật chưa được render.

Cách kiểm tra: Tắt JavaScript trong trình duyệt rồi mở trang; hoặc xem “view source” (mã nguồn gốc, không phải DOM đã render) — nếu không thấy nội dung chính trong đó, bot cũng sẽ không thấy.

Cách sửa: Áp dụng server-side rendering (SSR) hoặc static generation để nội dung có sẵn trong HTML ngay từ đầu; hoặc dùng pre-rendering cho bot. Đây thường là việc cần lập trình viên hỗ trợ.

3. Server hoặc CDN chặn nhầm bot

Nhiều dịch vụ CDN và tường lửa ứng dụng web (WAF) mặc định chặn hoặc thử thách các truy cập tự động để chống spam, DDoS. GPTBot có thể bị dính vào diện này và bị chặn dù robots.txt cho phép.

Cách kiểm tra: Xem log truy cập server để tìm các request từ user-agent GPTBot bị trả về mã lỗi (403, 429…). Nếu thấy, CDN/WAF đang chặn.

Cách sửa: Vào cấu hình CDN/WAF, thêm GPTBot và các bot AI khác vào danh sách cho phép (allowlist). Với các nền tảng phổ biến, thường có mục quản lý bot riêng để bật/tắt từng loại.

Quy trình chẩn đoán theo thứ tự

Kiểm tra lần lượt để khoanh vùng nhanh:

  • Bước 1: Mở robots.txt — có chặn GPTBot không? Nếu có, sửa trước.
  • Bước 2: Xem mã nguồn gốc trang (không render JS) — nội dung chính có ở đó không? Nếu không, xử lý rendering.
  • Bước 3: Xem log server/CDN — request của bot có bị trả lỗi không? Nếu có, chỉnh allowlist.
  • Bước 4: Sau khi sửa, dùng công cụ audit để xác nhận bot đã đọc được nội dung.

Đây chính là Nhóm 1 trong checklist tối ưu web để AI cite — lớp nền tảng phải thông trước khi làm gì khác.

Câu hỏi thường gặp

Làm sao biết GPTBot đã đọc được sau khi tôi sửa?

Cách trực tiếp là kiểm tra log server, tìm các request thành công (mã 200) từ user-agent GPTBot sau thời điểm bạn sửa. Cách gián tiếp là dùng công cụ audit AEO mô phỏng bot để xác nhận nội dung được đọc ra đầy đủ. Cần lưu ý bot không truy cập lại ngay lập tức, nên có thể mất một thời gian mới thấy request mới.

Website WordPress có hay bị GPTBot crawl fail không?

WordPress render nội dung ở phía server nên phần lớn không gặp lỗi “trang trống do JavaScript” như các site SPA. Vấn đề với WordPress thường nằm ở robots.txt (do plugin SEO cấu hình) hoặc ở CDN/tường lửa chặn bot. Kiểm tra hai chỗ này trước là hợp lý.

Tôi nên mở cho tất cả bot AI hay chỉ GPTBot?

Tùy chiến lược, nhưng nếu mục tiêu là được nhiều AI nhắc đến, nên mở cho các bot AI phổ biến như GPTBot, ClaudeBot, PerplexityBot và cân nhắc Google-Extended. Mỗi bot phục vụ một hệ AI khác nhau, nên chặn bot nào là tự loại mình khỏi AI đó.

Kết luận

GPTBot crawl fail là lỗi nền tảng nhưng thường dễ sửa một khi tìm đúng nguyên nhân. Với web Việt, hãy soi ba nghi phạm quen thuộc: robots.txt, JavaScript rendering, và CDN/WAF chặn nhầm. Sửa xong lớp này, các nỗ lực AEO khác mới bắt đầu có ý nghĩa.

Nghi ngờ bot AI không đọc được website của bạn? Chạy audit AEO miễn phí tại aeoauditscore.com — công cụ mô phỏng bot để phát hiện chính xác chỗ đang fail.