Trí tuệ nhân tạo tạo ra bài toán mới cho người làm SEO: nội dung cần được máy hiểu để có cơ hội xuất hiện, nhưng tài sản độc quyền cũng cần được bảo vệ khỏi sao chép tự động. Cách tiếp cận phù hợp không phải che giấu nội dung tùy tiện, mà là phân tầng quyền truy cập, phân biệt mục tiêu tìm kiếm với mục tiêu huấn luyện, đồng thời giữ trải nghiệm nhất quán cho người dùng và công cụ tìm kiếm. Bài viết giúp bạn xây dựng chiến lược an toàn, minh bạch và có thể đo lường.
Tác nhân trí tuệ nhân tạo đang thay đổi bài toán SEO như thế nào?
Website trước đây chủ yếu tối ưu cho người dùng và công cụ tìm kiếm truyền thống. Hiện nay, một lớp truy cập mới xuất hiện khi các hệ thống trí tuệ nhân tạo thu thập thông tin để phục vụ tìm kiếm, trả lời câu hỏi hoặc xử lý yêu cầu của người dùng.
Điều này tạo ra một mâu thuẫn đáng chú ý. Bạn muốn nội dung xuất hiện trong câu trả lời của hệ thống trí tuệ nhân tạo, bởi một lượt nhắc đến có thể mở rộng độ nhận diện thương hiệu. Tuy nhiên, nếu toàn bộ nghiên cứu độc quyền, dữ liệu nội bộ hoặc phương pháp chuyên môn đều được cung cấp mà không có chiến lược quản trị, lợi thế thông tin có thể bị sao chép và tái sử dụng.
Mục tiêu không phải ngăn mọi tác nhân trí tuệ nhân tạo tiếp cận website. Mục tiêu là xác định nội dung nào cần được khám phá, nội dung nào cần được trích dẫn và nội dung nào cần được bảo vệ.
Cloaking có phải giải pháp an toàn cho SEO?
Google định nghĩa cloaking là hành vi cung cấp nội dung khác nhau cho người dùng và công cụ tìm kiếm nhằm thao túng thứ hạng hoặc đánh lừa người dùng. Chính sách này áp dụng cho hệ thống tìm kiếm của Google, vì vậy người làm SEO không nên xem việc nhận diện tác nhân rồi cung cấp trải nghiệm khác biệt như một chiến thuật SEO mặc định. Chính sách nội dung rác của Google
Google cũng lưu ý rằng những website sử dụng JavaScript hoặc công nghệ khó truy cập cần triển khai theo hướng giúp cả người dùng và công cụ tìm kiếm tiếp cận nội dung, thay vì sử dụng kỹ thuật che giấu. Điều này đặc biệt quan trọng với những trang đang cần thứ hạng và lưu lượng tìm kiếm tự nhiên.
| Mục tiêu | Cách tiếp cận phù hợp | Rủi ro cần lưu ý |
|---|---|---|
| Tăng khả năng được tìm thấy | Cho phép truy cập nội dung cần xuất hiện | Giảm khả năng được khám phá nếu chặn sai |
| Bảo vệ dữ liệu độc quyền | Kiểm soát quyền truy cập và phân tầng dữ liệu | Có thể ảnh hưởng khả năng hiển thị nếu triển khai sai |
| Hỗ trợ tác nhân | Cung cấp nội dung có cấu trúc rõ ràng | Dữ liệu có thể bị sử dụng ngoài mục đích mong muốn |
Tác nhân trí tuệ nhân tạo có đọc được JavaScript không?
Một nghiên cứu của Vercel và MERJ phân tích hoạt động của các tác nhân trí tuệ nhân tạo cho thấy nhiều tác nhân phổ biến không thực thi JavaScript giống cách Googlebot thực hiện. Nghiên cứu ghi nhận GPTBot đã tạo ra 569 triệu yêu cầu trong mạng lưới Vercel trong một tháng, còn Claude tạo ra 370 triệu yêu cầu trong cùng khoảng thời gian.
Phân tích cũng cho thấy GPTBot và Claude có thể tải tệp JavaScript nhưng không thực thi chúng. GPTBot tải JavaScript trong khoảng 11,5 phần trăm yêu cầu được nghiên cứu, còn Claude ở mức 23,84 phần trăm. Gemini lại sử dụng hạ tầng của Google nên có khả năng xử lý JavaScript theo cách khác.
Các số liệu này mô tả dữ liệu do Vercel và MERJ quan sát, không nên được xem là tỷ lệ cố định cho mọi website hoặc mọi tác nhân.
Vì sao cấu trúc Markdown có thể hữu ích cho tác nhân?
HTML được xây dựng để trình duyệt hiển thị giao diện cho con người. Một trang có thể chứa menu, biểu tượng, thành phần giao diện, mã JavaScript và nhiều lớp cấu trúc không mang nhiều giá trị đối với hệ thống cần đọc nội dung.
Markdown có cấu trúc đơn giản hơn, nhờ vậy tác nhân có thể nhận biết tiêu đề, đoạn văn, danh sách và liên kết với ít thành phần thừa hơn. Cloudflare đã triển khai tính năng Markdown for Agents cho phép website cung cấp nội dung Markdown khi tác nhân gửi yêu cầu phù hợp. Cloudflare cho biết một bài viết của chính họ giảm từ 16.180 token ở phiên bản HTML xuống 3.150 token ở phiên bản Markdown, tương đương mức giảm khoảng 80 phần trăm. Nguồn Cloudflare
Điểm đáng chú ý
Markdown không phải cách để bảo vệ nội dung. Đây là cách giúp nội dung được cấu trúc rõ hơn cho tác nhân. Nếu mục tiêu của bạn là tăng khả năng được hệ thống trí tuệ nhân tạo hiểu và sử dụng, cấu trúc nội dung sạch có thể trở thành một phần của chiến lược kỹ thuật.
Nên bảo vệ loại nội dung nào?
Không phải mọi nội dung đều có giá trị giống nhau. Một bài giải thích khái niệm phổ biến có thể được xuất bản rộng rãi để tăng khả năng khám phá thương hiệu. Ngược lại, một bộ dữ liệu được doanh nghiệp đầu tư nhiều tháng để xây dựng có thể là tài sản cạnh tranh.
Nên ưu tiên khả năng khám phá
- Bài hướng dẫn cơ bản
- Nội dung giải thích khái niệm
- Trang dịch vụ
- Nội dung hỗ trợ quyết định
- Nghiên cứu công khai nhằm tạo nhận diện
Cần quản trị quyền truy cập
- Dữ liệu nghiên cứu độc quyền
- Cơ sở dữ liệu trả phí
- Thông tin khách hàng
- Tài liệu nội bộ
- Phương pháp có giá trị cạnh tranh
Case study: Cloudflare chuyển nội dung sang Markdown cho tác nhân
Cloudflare cung cấp một ví dụ thực tế về cách doanh nghiệp có thể thích ứng với sự thay đổi của hoạt động thu thập dữ liệu. Thay vì tập trung vào việc che giấu nội dung khỏi tác nhân, Cloudflare phát triển cơ chế cho phép tác nhân yêu cầu phiên bản Markdown của trang.
| Phiên bản HTML | 16.180 token |
| Phiên bản Markdown | 3.150 token |
| Mức giảm | Khoảng 80 phần trăm |
Giá trị của mô hình này nằm ở việc tối ưu cách phân phối nội dung thay vì tạo một phiên bản bí mật chỉ dành cho một nhóm tác nhân. Khi tác nhân yêu cầu định dạng Markdown, máy chủ có thể trả về nội dung có cấu trúc gọn hơn. Người dùng vẫn tiếp tục nhận trải nghiệm HTML thông thường.
Cloudflare cũng cho biết hệ thống có thể truyền tín hiệu về cách nội dung được phép sử dụng. Cách tiếp cận này phù hợp hơn với tư duy quản trị nội dung dài hạn, bởi chủ website có thể thể hiện mong muốn sử dụng dữ liệu thay vì chỉ dựa vào nhận diện tác nhân. Tài liệu Cloudflare về Markdown for Agents
OpenAI đang khuyến nghị website quản lý truy cập như thế nào?
OpenAI hiện hướng dẫn nhà xuất bản kiểm soát khả năng khám phá website thông qua robots.txt và các cơ chế quản trị truy cập. Nếu website muốn nội dung được phát hiện, hiển thị và trích dẫn trong ChatGPT, OpenAI khuyến nghị không chặn OAI SearchBot khỏi những trang cần được khám phá. Hướng dẫn chính thức của OpenAI
Điểm này rất quan trọng với chiến lược SEO. Nếu một bài viết được tạo ra nhằm thu hút người dùng từ tìm kiếm bằng trí tuệ nhân tạo, việc chặn tác nhân tìm kiếm có thể đi ngược mục tiêu ban đầu. Bạn cần phân biệt rõ nội dung muốn được khám phá với tài sản cần kiểm soát quyền truy cập.
Hãy quyết định quyền truy cập dựa trên mục tiêu kinh doanh của từng nhóm nội dung, thay vì chặn toàn bộ tác nhân chỉ vì lo ngại sao chép.
Khung chiến lược bảo vệ nội dung dành cho người làm SEO
Bước 1: Phân loại tài sản nội dung
Hãy lập danh sách những nội dung đang có trên website và chia thành nhóm công khai, nhóm cần được khám phá để tạo lưu lượng và nhóm có giá trị độc quyền. Cách phân loại này giúp đội SEO và đội kỹ thuật thống nhất mục tiêu trước khi thay đổi quyền truy cập.
Bước 2: Xác định mục tiêu của từng tác nhân
Không phải mọi tác nhân đều phục vụ cùng một mục đích. Có tác nhân phục vụ tìm kiếm, có tác nhân hỗ trợ người dùng, có tác nhân phục vụ huấn luyện hoặc xử lý dữ liệu. Bạn cần đọc tài liệu chính thức của từng nền tảng trước khi thiết lập chính sách.
Bước 3: Ưu tiên khả năng trích dẫn cho nội dung cần nhận diện
Những bài viết hướng tới khả năng xuất hiện trong câu trả lời của trí tuệ nhân tạo nên có cấu trúc rõ ràng, thông tin chính xác và nguồn tham khảo đáng tin cậy. Việc bảo vệ quá mức có thể khiến nội dung mất cơ hội được khám phá.
Bước 4: Bảo vệ tài sản độc quyền bằng quyền truy cập
Dữ liệu khách hàng, cơ sở dữ liệu riêng hoặc tài liệu nội bộ cần được quản lý bằng cơ chế xác thực và cấp quyền phù hợp. Đây là bài toán quản trị dữ liệu, không nên biến thành một chiến thuật nhằm đánh lừa công cụ tìm kiếm.
Bước 5: Kiểm tra lại trải nghiệm của Google
Mọi thay đổi kỹ thuật liên quan đến tác nhân đều cần được kiểm tra với công cụ tìm kiếm chính. Google khuyến nghị chủ website kiểm tra cách nội dung được truy cập và hiển thị nếu website phụ thuộc vào JavaScript.
Bước 6: Đo lường trước và sau thay đổi
Hãy theo dõi lượt hiển thị, lượt truy cập tự nhiên, truy cập từ hệ thống trí tuệ nhân tạo, lượt trích dẫn, truy vấn thương hiệu và chuyển đổi. Khi dữ liệu thay đổi bất thường, bạn sẽ có cơ sở xác định liệu nguyên nhân đến từ quyền truy cập, khả năng thu thập dữ liệu hay chất lượng nội dung.
Hộp ghi nhớ
- Không xem cloaking là chiến thuật SEO mặc định.
- Nội dung cần được tìm thấy nên ưu tiên khả năng khám phá.
- Tài sản độc quyền cần được quản trị bằng quyền truy cập phù hợp.
- Markdown có thể giúp tác nhân xử lý nội dung hiệu quả hơn.
- Quyền truy cập của từng tác nhân cần dựa trên tài liệu chính thức.
- Luôn kiểm tra tác động tới Google trước khi triển khai thay đổi kỹ thuật.
Dữ liệu từ Google Keyword Planner nên được dùng thế nào?
Với chủ đề này, bạn có thể kiểm tra các nhóm truy vấn liên quan đến bảo vệ nội dung, tác nhân trí tuệ nhân tạo, trình thu thập dữ liệu trí tuệ nhân tạo, tối ưu nội dung cho tác nhân và Markdown cho tác nhân. Tuy nhiên, không nên tự gán lượt tìm kiếm cho những cụm từ này khi chưa có bản xuất dữ liệu từ tài khoản Google Ads.
Google xác nhận chỉ số lượt tìm kiếm trung bình phụ thuộc vào khoảng thời gian, vị trí và mạng tìm kiếm được lựa chọn. Vì vậy, dữ liệu dành cho thị trường Việt Nam cần được lấy với vị trí Việt Nam và khoảng thời gian mà chiến dịch thực tế sử dụng. Tài liệu Google Keyword Planner
| Nhóm truy vấn | Ý định | Dữ liệu nên lấy |
|---|---|---|
| Bảo vệ nội dung | Thông tin | Lượt tìm kiếm trung bình |
| Trình thu thập dữ liệu trí tuệ nhân tạo | Kỹ thuật | Lượt tìm kiếm trung bình |
| Tối ưu nội dung cho tác nhân | Giải pháp | Lượt tìm kiếm trung bình |
| Markdown cho tác nhân | Kỹ thuật | Lượt tìm kiếm trung bình |
Checklist trước khi thay đổi quyền truy cập
- Đã xác định tài sản độc quyền
- Đã xác định nội dung cần được trích dẫn
- Đã phân loại dữ liệu công khai
- Đã kiểm tra robots.txt
- Đã kiểm tra khả năng thu thập dữ liệu
- Đã kiểm tra cách Google hiển thị nội dung
- Đã ghi nhận dữ liệu trước thay đổi
- Đã theo dõi truy cập từ trí tuệ nhân tạo
- Đã theo dõi chuyển đổi
- Đã đọc tài liệu chính thức của nền tảng
- Đã xác định người chịu trách nhiệm kỹ thuật
- Đã có phương án hoàn tác khi xảy ra lỗi
Kết bài
Khi trí tuệ nhân tạo tham gia mạnh hơn vào quá trình khám phá và tổng hợp thông tin, quyền kiểm soát nội dung trở thành một phần của chiến lược SEO. Bạn không nên xem kỹ thuật che giấu là giải pháp mặc định, bởi Google có thể coi việc hiển thị khác nhau nhằm thao túng kết quả là vi phạm chính sách. Hướng bền vững hơn là phân loại tài sản nội dung, cho phép trang cần trích dẫn tiếp cận phù hợp, bảo vệ dữ liệu độc quyền bằng cơ chế cấp quyền rõ ràng và đo lường tác động trước khi thay đổi hệ thống.