Tôi mở Yandex Webmaster và thấy một con số khó có thể bỏ qua: 2.000 trang đã biến mất khỏi tìm kiếm Yandex chỉ sau một đêm. Dự án có khoảng 8.000 trang, nghĩa là gần 25% không còn được hiển thị là đang tham gia tìm kiếm.
Phản ứng đầu tiên của tôi rất đơn giản: SEO có thể rất khắc nghiệt. Nhưng bài học hữu ích hơn cần chính xác hơn. Một cú giảm đột ngột ở số “trang trong tìm kiếm” là một quan sát, không phải chẩn đoán. Con số là thật. Nguyên nhân vẫn chưa được xác định.
Điều tôi thực sự có thể xác nhận
Lúc đó tôi có ba dữ kiện: Yandex Webmaster cho thấy giảm 2.000 trang, dự án có khoảng 8.000 trang và thay đổi xuất hiện chỉ sau một đêm. Tôi không có bằng chứng rằng Yandex phạt website, crawling bị lỗi hay một thay đổi kỹ thuật cụ thể đã gây ra sự sụt giảm.
Phân biệt này quan trọng vì Yandex tách nhiều trạng thái mà chúng ta dễ gom chung thành “indexing”. Một URL có thể được crawl nhưng vẫn bị loại khỏi tìm kiếm. Yandex cũng cho biết cơ sở dữ liệu của robot có thể chứa những trang hiện không thể hiển thị trong kết quả. Vì vậy câu hỏi hữu ích không chỉ là “crawler có thấy URL này không?”, mà là “trang này có tham gia tìm kiếm không, và nếu không thì trạng thái nào giải thích việc bị loại?”
Yandex mô tả các trạng thái này trong tài liệu chính thức về các trang tham gia tìm kiếm và các trang bị loại.
Crawling, tham gia tìm kiếm, ranking và traffic là những vấn đề khác nhau
Sự cố này nhắc tôi rằng rất dễ trộn bốn lớp: crawling, được đưa vào hệ thống tìm kiếm, tham gia kết quả và thứ hạng hoặc traffic thực tế. Chúng liên quan với nhau nhưng không tương đương.
- Crawling: robot có tải URL hay không.
- Tham gia tìm kiếm: Yandex hiện có coi trang đủ điều kiện xuất hiện hay không.
- Ranking: trang đứng ở đâu với từng truy vấn cụ thể.
- Traffic: còn phụ thuộc nhu cầu, snippet, CTR, mùa vụ và nhiều yếu tố khác.
Vì thế, giảm 25% số trang tham gia tìm kiếm không tự động có nghĩa traffic giảm 25%. Nó cũng không chứng minh lỗi crawling hay hình phạt thuật toán.
Vì sao quy mô sụt giảm vẫn quan trọng
Hai nghìn URL đủ lớn để tìm một mẫu chung thay vì coi đó là vài trang ngẫu nhiên. Tôi sẽ kiểm tra xem các URL bị ảnh hưởng có cùng thư mục, template, loại nội dung, cấu hình canonical, mã HTTP, mô hình internal linking hay giai đoạn xuất bản hay không.
Phân đoạn như vậy hữu ích hơn nhiều so với nhìn một con số tổng. Nếu phần lớn trang bị loại có cùng một đặc điểm kỹ thuật, phạm vi điều tra sẽ hẹp lại. Nếu mất mát trải trên các khu vực không liên quan, giả thuyết sẽ khác. Đây là chiến lược điều tra, không phải tuyên bố về nguyên nhân thật trong trường hợp của tôi.
Tôi sẽ kiểm tra gì trước khi đổ lỗi cho thuật toán
- Xác minh chỉ số. Đảm bảo thay đổi thực sự nằm ở “trang trong tìm kiếm”, sau đó xem danh sách bị loại và ngày thay đổi.
- Xem lý do bị loại. Yandex Webmaster có thể báo giá trị/nhu cầu thấp, non-canonical,
noindex, redirect hoặc lỗi. Những trạng thái đó là bằng chứng; đoán từ biểu đồ thì không. - Nhóm các URL bị ảnh hưởng. So sánh thư mục, template, loại trang, ngôn ngữ, phần được tạo tự động và thời gian xuất bản.
- Kiểm tra nền tảng kỹ thuật trên mẫu. Mã HTTP, robots directives, canonical, redirect, khả năng truy cập và HTML robot thực sự nhận.
- Tách thay đổi index khỏi ranking và traffic. Tham gia tìm kiếm, impressions, clicks và analytics sessions trả lời những câu hỏi khác nhau.
- Sau đó mới lập giả thuyết nhân quả. Nếu cấu hình, deployment, cập nhật template hoặc pattern nội dung trùng với các trang bị ảnh hưởng, nó trở thành ứng viên, chưa phải bằng chứng.
Yandex khuyến nghị kiểm tra lý do loại cụ thể và sau khi sửa một vấn đề thực sự thì gửi trang để crawl lại. Quy trình này chắc chắn hơn nhiều so với nhìn thấy một con số lớn rồi tìm câu chuyện để giải thích.
Những điều tôi sẽ không khẳng định từ sự cố này
Tôi sẽ không viết rằng “Yandex phạt website”, vì tôi chưa chứng minh điều đó. Tôi cũng không nói crawler đơn giản là “khó tính hơn”, vì câu đó che giấu nhiều trạng thái kỹ thuật khác nhau. Tôi không gọi 2.000 trang là mất vĩnh viễn và không giả định tất cả biến mất cùng một lý do khi chưa xem trạng thái.
Bài học tôi giữ lại
Mất 2.000 trên 8.000 trang khỏi tìm kiếm chỉ sau một đêm vẫn là cú sốc lớn. Nhưng kết luận hữu ích không phải “SEO là ngẫu nhiên”. Hệ thống tìm kiếm có nhiều lớp trạng thái, và cần xác định lớp nào thay đổi trước khi giải thích tại sao.
Quy tắc thực tế của tôi rất đơn giản: ghi lại quan sát trước, để nguyên nhân mở, rồi thu hẹp giả thuyết bằng bằng chứng ở cấp độ trang. Con số là 2.000. Nguyên nhân vẫn là một câu hỏi.