← Trang chủ
What Changed

Chặn AI học từ website mà không biến mất khỏi Google Search

Cloudflare vừa tách Search, Training và Agent thành các quyết định khác nhau. Với chủ website, khác biệt quan trọng nhất là không dùng Block khi mục tiêu thực sự chỉ là từ chối AI training.

Ngày 15/9/2026, Cloudflare đổi cách chủ website kiểm soát crawler. Điểm đáng chú ý không nằm ở việc có thêm một nút mới, mà ở chỗ Search, Training và Agent giờ được tách thành ba mục đích khác nhau. Nếu website của bạn vẫn cần Google, Bing hay Apple tìm thấy nội dung, lựa chọn giữa Block và Disallow AI Training không còn là chi tiết kỹ thuật nhỏ.

Cloudflare nói rõ rằng từ thay đổi này, Block áp dụng cả với các crawler dùng chung cho tìm kiếm và AI training, gồm Googlebot, Bingbot và Applebot. Vì vậy, nếu mục tiêu của bạn chỉ là không cho nội dung được dùng để training, bấm Block toàn bộ có thể đi xa hơn điều bạn định làm.

Ba loại truy cập, ba quyết định

Cloudflare phân loại hành vi crawler thành ba nhóm. Search là crawl để xây chỉ mục tìm kiếm. Training là crawl để huấn luyện hoặc tinh chỉnh mô hình. Agent là tác nhân được người dùng yêu cầu truy cập một trang, chẳng hạn một công cụ duyệt web thay mặt người dùng.

Sự tách biệt này quan trọng vì cùng một chủ website có thể muốn ba câu trả lời khác nhau: cho phép công cụ tìm kiếm lập chỉ mục, từ chối dùng nội dung để training, nhưng vẫn cân nhắc riêng việc agent truy cập. Trước đây, crawler dùng chung cho nhiều mục đích khiến lựa chọn này khó tách.

Cloudflare đưa thêm Disallow AI Training cho mục Training. Theo mô tả của hãng, thiết lập này dùng Bot Preference Sync để công bố lựa chọn không training trong robots.txt. Với những mixed-use crawler mà Cloudflare xếp loại Accountable, crawler vẫn có thể truy cập cho Search. Các crawler chỉ phục vụ training của Amazon, Anthropic, Meta và OpenAI được Cloudflare chặn mà không cần chặn crawler tìm kiếm tương ứng.

Đây là tuyên bố và cơ chế do Cloudflare mô tả cho sản phẩm của họ; nó không có nghĩa một dòng robots.txt tự nó có thể cưỡng chế mọi bot trên Internet. Chính Cloudflare lưu ý rằng robots.txt chỉ công bố preference, còn lớp mạng mới có thể nhận diện và chặn crawler không tuân thủ.

Khi nào Block là quá mạnh

Hãy hình dung một website bán hàng nhỏ vẫn sống nhờ khách tìm thấy trang sản phẩm qua search. Chủ site không muốn nội dung sản phẩm trở thành dữ liệu training, nhưng vẫn muốn Googlebot lập chỉ mục. Với mục tiêu đó, Block không phải lựa chọn tương đương với Disallow AI Training.

Từ 15/9, Cloudflare nói Block và Block on pages with ads áp dụng cả mixed-use crawler. Nếu chọn Block, Googlebot, Bingbot và Applebot có thể bị chặn khỏi site, bao gồm mục đích Search. Còn Disallow AI Training được thiết kế cho trường hợp muốn giữ Search nhưng từ chối Training trong phạm vi các crawler và cơ chế mà Cloudflare hỗ trợ.

Điều này cũng giải thích vì sao tên gọi “Block AI Bots” đang được bỏ dần. Một nhãn chung không còn mô tả đủ quyết định mà chủ website thực sự cần đưa ra.

Website cũ có cần đổi ngay không?

Cloudflare cho biết phần lớn trường hợp không cần thao tác ngay vì cấu hình hiện tại được migrate. Nhưng “không cần làm gì” không đồng nghĩa “không cần hiểu cấu hình sau migration”.

Với domain trước đây chưa dùng ba control riêng, legacy Block AI ở trạng thái Block hoặc Block on pages with ads được chuyển thành Search = Allow, Training = Disallow AI Training và Agent = Block on pages with ads. Nếu trước đây bạn đã cấu hình riêng Search/Training/Agent, Cloudflare nói họ giữ hiệu ứng thực tế của lựa chọn cũ; ví dụ Training = Block được migrate thành Disallow AI Training.

Một lượt kiểm tra hợp lý sau migration là mở phần AI Crawl Control/Bot Management và đọc ba dòng Search / Training / Agent như ba quyết định riêng. Nếu Search đang là Block, hãy chắc rằng bạn thật sự muốn crawler tìm kiếm không truy cập. Nếu Training là Disallow AI Training, hãy hiểu đây là lựa chọn từ chối training chứ không phải lệnh cấm mọi loại AI access. Agent vẫn là một control khác.

Có một ngoại lệ đáng nhớ: Bing

Không nên đọc tên Disallow AI Training rồi kết luận mọi mixed-use crawler đã nhận cùng một tín hiệu ngay lập tức. Cloudflare ghi rằng Googlebot có Google-Extended và Applebot có Applebot-Extended để thể hiện lựa chọn liên quan training. Với Bing, Microsoft đang xây cơ chế tôn trọng lựa chọn no-training qua robots.txt ở cấp site/domain và mục tiêu mà Cloudflare nêu là đầu năm 2027.

Cho tới khi hỗ trợ đó hoạt động, Cloudflare nói chọn Disallow AI Training chưa tự động truyền lựa chọn no-training tới Bing qua robots.txt. Chủ website muốn opt out với Bing hiện vẫn cần xem các control mà Bing cung cấp, như NOARCHIVE và công cụ quản trị liên quan.

Đây là lý do bài này không thể rút gọn thành “bật một nút là xong”. Cấu hình mới giúp tách mục đích rõ hơn, nhưng mức thực thi vẫn phụ thuộc crawler và cơ chế mà từng nhà vận hành hỗ trợ tại thời điểm đó.

Quyết định thực tế cho chủ website

Nếu website của bạn dùng Cloudflare, câu hỏi đầu tiên không nên là “có chặn AI không?” mà là bạn muốn chặn mục đích nào.

Muốn giữ khả năng được tìm thấy qua search nhưng từ chối training: kiểm tra Training và cân nhắc Disallow AI Training. Muốn crawler đó không truy cập site cho cả search lẫn training: khi ấy Block mới phản ánh đúng mục tiêu. Còn truy cập của agent cần được xem riêng, vì Cloudflare hiện không cung cấp một lựa chọn Disallow tương đương cho Agent và cho biết chuẩn biểu đạt preference cho agent vẫn chưa ổn định.

Sự thay đổi nhỏ trong bảng điều khiển vì thế dẫn tới một nguyên tắc hữu ích hơn: đừng dùng một nút chặn chung cho ba mục đích khác nhau. Trước khi thay đổi, ghi lại trạng thái Search, Training và Agent hiện tại; sau khi đổi, kiểm tra lại robots.txt và khả năng crawler tìm kiếm truy cập site nếu search visibility là quan trọng với bạn.

Nguồn

  • Cloudflare, 15/9/2026 — “Have it both ways: stay discoverable in search while disallowing AI training.” Nguồn chính cho thay đổi control, migration, ý nghĩa của Disallow AI Training, tác động của Block và giới hạn hiện tại với Bing.

Nguồn tham khảo

  1. blog.cloudflare.com