Quay lại danh sách

Lưu Lượng AI Vừa Vượt Qua Con Người Trên Web Mở — Dữ Liệu Mới Cho Thấy Nó Trích Dẫn Trang Sâu Của Bạn Nhưng Lại Điều Hướng Người Dùng Về Trang Chủ

Đăng ngày 29 thg 7, 20267 phút đọc
AI AgentsDeveloper ToolsBackend

Trong tuần từ 27–28/7/2026, ba bộ dữ liệu độc lập cùng chỉ ra một phát hiện không mấy dễ chịu cho bất kỳ ai đang vận hành một website hay API: các hệ thống AI được xây trên dữ liệu trình duyệt và tìm kiếm giờ đây trích dẫn nội dung bằng cách đào sâu vào cấu trúc trang — nhưng khi thực sự gửi trả lưu lượng truy cập giới thiệu (referral traffic), phần lớn lại đổ về trang chủ chứ không phải trang đã được trích dẫn. Bài tổng hợp ngày 28/7 của VentureBeat, dựa trên nghiên cứu của Similarweb, Ahrefs và AI Traffic Study với 6,77 triệu phiên của Previsible, đưa ra con số cụ thể cho khoảng cách này, chỉ vài ngày sau khi Cloudflare và HUMAN Security cùng xác nhận lưu lượng tự động và AI agent đã vĩnh viễn vượt qua lưu lượng con người trên web mở. Với các nhà phát triển, đây không phải một chú thích marketing — mà là tín hiệu cho thấy kiến trúc thông tin, robots.txt và kiểm soát truy cập API giờ cần được thiết kế cho một đối tượng người dùng đa số là máy móc.

Sự Lệch Pha Giữa Trích Dẫn Và Lưu Lượng Truy Cập

Dữ liệu của Similarweb cho thấy 65% URL mà ChatGPT trích dẫn trong câu trả lời nằm sâu hai đến ba cấp thư mục trong cấu trúc trang — các trang tài liệu chuyên sâu, bài so sánh, thông số sản phẩm cụ thể. Thế nhưng 58,8% lưu lượng truy cập giới thiệu thực tế mà các nền tảng AI gửi trả lại lại đổ về trang chủ. AI Traffic Study lần thứ ba của Previsible, rút ra từ 6,77 triệu phiên truy cập được AI giới thiệu trên 166 website thuộc các lĩnh vực SaaS, thương mại điện tử, tài chính, pháp lý, y tế, bảo hiểm, giáo dục và xuất bản trong giai đoạn từ tháng 11/2024 đến tháng 5/2026, phát hiện cùng một khuôn mẫu từ một góc nhìn khác: 28,8% lượt giới thiệu từ ChatGPT đổ về trang tìm kiếm nội bộ của website — một bề mặt điều hướng mà phần lớn các nhà xuất bản đã ngừng đầu tư kỹ lưỡng vì trước đây Google vẫn làm thay việc định tuyến đó. Chính dữ liệu phân tích của Ahrefs cũng kể một câu chuyện y hệt: hơn 80% lưu lượng do AI dẫn đến của họ đổ về trang chủ, trang sản phẩm và các công cụ miễn phí, chứ không phải phần nội dung biên tập dài mà các mô hình AI thực sự trích dẫn khi trả lời câu hỏi.

Bot Đã Vượt Qua Con Người, Và Khoảng Cách Vẫn Đang Nới Rộng

Sự lệch pha này nằm chồng lên một dịch chuyển lớn hơn đã ngã ngũ từ đầu tháng 6: dữ liệu Cloudflare Radar cho thấy request tự động chiếm 57,5% lưu lượng web dạng HTML so với 42,5% từ con người — lần đầu tiên lưu lượng máy móc được xác nhận chiếm đa số trên web mở. Báo cáo bot tháng 7 của Cloudflare cho thấy AI crawler chiếm khoảng 20,3% lưu lượng bot đã xác thực, cộng thêm 6,5% từ các bot AI-search, và hơn một nửa trong số toàn bộ request của AI crawler — 52,3% trong 28 ngày tính đến 22/6 — tồn tại thuần túy để phục vụ việc huấn luyện mô hình, chứ không phải để trả lời một truy vấn thực tế của người dùng. Fastly, ở một phép đo riêng, ghi nhận tốc độ tăng trưởng request AI nhanh gấp khoảng 6,5 lần tốc độ tăng trưởng lưu lượng con người trong cùng giai đoạn. Điều này không chỉ giới hạn ở các trang liên quan đến tìm kiếm: các agentic browser như Comet của Perplexity hay Atlas của OpenAI hiện đang tạo ra một phần ngày càng lớn trong lưu lượng đó bằng cách hành động trực tiếp thay mặt người dùng, chứ không chỉ crawl theo lịch.

Vì Sao robots.txt Không Còn Là Tệp 'Thiết Lập Một Lần Rồi Quên'

Bài viết hướng đến nhà phát triển của WorkOS, dựa trên cùng bộ dữ liệu, rút ra kết luận mang tính vận hành: robots.txt không còn là một cấu hình thụ động, mà là một quyết định cấp phép nội dung và kiểm soát truy cập chủ động. Các đội ngũ giờ phải quyết định một cách có chủ đích crawler nào được phép truy cập hoàn toàn, crawler nào bị chặn, và crawler nào chỉ được phép phục vụ AI-search — nhóm ít nhất còn trả lại một phần lưu lượng giới thiệu để đổi lấy dữ liệu huấn luyện mà nó lấy đi. Công cụ để hành động theo quyết định đó đã tồn tại sẵn — dashboard AI Insights và công cụ quét mức độ 'sẵn sàng cho agent' của Cloudflare cho biết chính xác điều gì đang crawl một website và nó có trả lại gì hay không — và một mô hình truy cập phân tầng đang dần hình thành để đáp lại: truy cập miễn phí cho khách truy cập là con người, truy cập có xác thực hoặc tính phí cho AI crawler, được thực thi qua chính các cơ chế kiểm soát AI gateway và endpoint gắn API key mà các đội đã dùng để giới hạn tốc độ (rate limiting).

Con Số Của Chính Ahrefs Nói Gì Về Cách Sửa Thực Sự

Cách khắc phục không chỉ nằm ở kiểm soát truy cập — mà còn ở kiến trúc thông tin. Ahrefs phát hiện các trang dùng URL slug bằng ngôn ngữ tự nhiên được mô hình AI trích dẫn với tỷ lệ 89,78%, so với 81,11% ở các trang không dùng cách đặt tên đó — một khoảng cách đủ lớn để tự nó trở thành một yếu tố xếp hạng. Kết hợp với dữ liệu về độ sâu trích dẫn, kịch bản hành động ngụ ý cho bất kỳ đội nào duy trì tài liệu, trang so sánh hay benchmark là hãy viết để được trích dẫn trực tiếp — với các nhận định cụ thể, tiêu đề mô tả rõ ràng, mỗi phần một sự kiện — thay vì viết cho một con người đang lướt nhanh để đi đến nút kêu gọi hành động (CTA), bởi chính loại trang được tối ưu cho CTA lại là loại nội dung nông, gần giống trang chủ mà hệ thống AI hiện đang bỏ qua khi quyết định nên trích dẫn gì.

Ý Nghĩa Với Nhà Phát Triển Và Đội AI Ngay Lúc Này

Nếu bạn đang duy trì một website công khai, tài liệu, hay API, tất cả những điều trên hội tụ thành ba việc cụ thể. Thứ nhất, hãy đo lường riêng lưu lượng truy cập giới thiệu từ AI — phần lớn cấu hình GA4 hiện vẫn gán sai hoặc bỏ sót loại lưu lượng này vì các nền tảng AI thường loại bỏ hoặc thay đổi referrer header, nên AI Insights của Cloudflare hay một công cụ theo dõi chuyên biệt như của Previsible là cách duy nhất để thấy được sự phân chia thực sự. Thứ hai, hãy xem robots.txt và danh sách crawler được phép như một hạng mục rà soát theo quý, chứ không phải một ô cần tích vào ngày ra mắt sản phẩm, đặc biệt nếu bạn đang phục vụ nội dung tốn kém để sản xuất nhưng rẻ để một mô hình nạp vào một lần rồi không bao giờ gửi trả khách truy cập nào nữa. Thứ ba, nếu chính bạn đang xây một sản phẩm agentic — bất cứ thứ gì định tuyến qua Comet, Atlas, hay một agent trình duyệt dựa trên Claude — hãy giả định rằng các website bạn đang gọi tới đã bắt đầu giới hạn hoặc kiểm soát tốc độ lưu lượng phi con người khác với sáu tháng trước, và xây dựng logic retry cùng fallback tương ứng.

Kết Luận

Web mở đã vượt qua một ngưỡng trong năm nay, khi số lượng máy móc đọc nó đã vượt qua số lượng con người, và dữ liệu mới nhất cho thấy những cỗ máy đó không đọc theo cách con người vẫn đọc — chúng trích dẫn những câu trả lời hẹp, sâu, cụ thể, trong khi gửi trả bất kỳ lưu lượng nào có được về trang nông nhất trên website. Đây là một vấn đề kiến trúc thực sự, không phải vấn đề marketing: những đội vẫn xem robots.txt là thứ soạn sẵn và xem cấu trúc website là chuyện của SEO đang tối ưu cho một phần lưu lượng thực tế không còn chiếm đa số nữa.