Chuyển tới nội dung
Khóa học SEO tiêu chuẩn
  • Trang chủ
  • Giới thiệu
    • Giới thiệu VietMoz Academy
    • Cơ sở vật chất
    • Hoạt động cộng đồng
  • Chương trình học
    • Lịch tuyển sinh
    • Khóa học SEO tiêu chuẩn
    • Google Marketing
      • Khóa học Adwords Pro Sales
      • Khoá học Google Map Premium
      • Khóa học SEO HCM Special
      • Khóa học GA4 from Zero to Hero
    • Thực hành quảng cáo Facebook
      • Khóa học Winning Facebook Ads
      • Khóa học Facebook Marketing
    • Khoá học kinh doanh thương mại điện tử trên sàn Shopee
    • Marketing tinh gọn
      • Marketing Fundamentals
      • Khoá học MSP – Thực hành xây dựng chiến lược marketing
      • Khoá học Digital Masterclass
      • Khóa học Sale Promotion
  • Blog
    • Tin tức
    • Cách làm SEO
      • SEO Cafe – Tin tức SEO mới nhất
      • Wiki SEO – Thư viện kiến thức quan trọng
      • SEO Guide – Hướng dẫn làm SEO
      • SEO Case Study
      • Resource – Công cụ & Template
    • Blog Marketing
    • Kiến thức Google Adwords
    • Blog Facebook Marketing
    • Blog Content
  • Liên hệ
    • Đăng ký học
    • Hướng dẫn thanh toán
    • Bản đồ đường đi
Mục lục nội dung
1 Cách kiểm tra trùng lặp nội dung bằng python trên bảng dữ liệu CSV với pandas
1.1 Bước một, chuẩn bị và đọc dữ liệu đầu vào
1.2 Bước hai, dùng hàm duplicated để khoanh vùng bản ghi lặp
1.3 Bước ba, lọc kết quả và giữ lại bản ghi cần thiết
2 Cách phát hiện nội dung trùng lặp bằng python trong văn bản với cấu trúc tập hợp
2.1 Bước một, chuẩn hóa chuỗi văn bản
2.2 Bước hai, duyệt qua danh sách và ghi nhận phần tử đã gặp
2.3 Bước ba, xuất kết quả để đối chiếu thủ công
3 Cách tìm bài viết trùng lặp bằng python thông qua so khớp gần giống
3.1 Bước một, tính điểm tương đồng giữa hai đoạn văn bản
3.2 Bước hai, chọn ngưỡng phù hợp với mục tiêu audit
3.3 Bước ba, xuất báo cáo bắt cặp ra tệp Excel
4 Cách quét thư mục tìm file nội dung trùng lặp bằng mã băm
4.1 Bước một, tính mã băm cho từng tệp
4.2 Bước hai, duyệt toàn bộ thư mục và nhóm tệp theo mã băm
4.3 Bước ba, xử lý và lưu trữ kết quả trùng lặp
Mục lục nội dung
1 Cách kiểm tra trùng lặp nội dung bằng python trên bảng dữ liệu CSV với pandas
1.1 Bước một, chuẩn bị và đọc dữ liệu đầu vào
1.2 Bước hai, dùng hàm duplicated để khoanh vùng bản ghi lặp
1.3 Bước ba, lọc kết quả và giữ lại bản ghi cần thiết
2 Cách phát hiện nội dung trùng lặp bằng python trong văn bản với cấu trúc tập hợp
2.1 Bước một, chuẩn hóa chuỗi văn bản
2.2 Bước hai, duyệt qua danh sách và ghi nhận phần tử đã gặp
2.3 Bước ba, xuất kết quả để đối chiếu thủ công
3 Cách tìm bài viết trùng lặp bằng python thông qua so khớp gần giống
3.1 Bước một, tính điểm tương đồng giữa hai đoạn văn bản
3.2 Bước hai, chọn ngưỡng phù hợp với mục tiêu audit
3.3 Bước ba, xuất báo cáo bắt cặp ra tệp Excel
4 Cách quét thư mục tìm file nội dung trùng lặp bằng mã băm
4.1 Bước một, tính mã băm cho từng tệp
4.2 Bước hai, duyệt toàn bộ thư mục và nhóm tệp theo mã băm
4.3 Bước ba, xử lý và lưu trữ kết quả trùng lặp

Hướng dẫn dùng Python phát hiện nội dung trùng lặp

Đăng vào 26/07/2026 bởi Khánh LinhDanh mục: Uncategorized
Mục lục nội dung
1 Cách kiểm tra trùng lặp nội dung bằng python trên bảng dữ liệu CSV với pandas
1.1 Bước một, chuẩn bị và đọc dữ liệu đầu vào
1.2 Bước hai, dùng hàm duplicated để khoanh vùng bản ghi lặp
1.3 Bước ba, lọc kết quả và giữ lại bản ghi cần thiết
2 Cách phát hiện nội dung trùng lặp bằng python trong văn bản với cấu trúc tập hợp
2.1 Bước một, chuẩn hóa chuỗi văn bản
2.2 Bước hai, duyệt qua danh sách và ghi nhận phần tử đã gặp
2.3 Bước ba, xuất kết quả để đối chiếu thủ công
3 Cách tìm bài viết trùng lặp bằng python thông qua so khớp gần giống
3.1 Bước một, tính điểm tương đồng giữa hai đoạn văn bản
3.2 Bước hai, chọn ngưỡng phù hợp với mục tiêu audit
3.3 Bước ba, xuất báo cáo bắt cặp ra tệp Excel
4 Cách quét thư mục tìm file nội dung trùng lặp bằng mã băm
4.1 Bước một, tính mã băm cho từng tệp
4.2 Bước hai, duyệt toàn bộ thư mục và nhóm tệp theo mã băm
4.3 Bước ba, xử lý và lưu trữ kết quả trùng lặp
Hướng dẫn dùng Python phát hiện nội dung trùng lặp

Cẩm nang kỹ thuật cho người làm SEO

Hướng dẫn dùng Python phát hiện nội dung trùng lặp

Bốn phương pháp thực chiến giúp bạn kiểm tra trùng lặp nội dung bằng python, áp dụng ngay cho công việc audit website.

Bạn đang tìm một cách chủ động để xử lý tình trạng bài viết bị sao chép hoặc trùng lặp ngay trên chính website của mình phải không? Bài viết này tổng hợp cho bạn bốn phương pháp phổ biến, giúp bạn phát hiện nội dung trùng lặp bằng python một cách nhanh chóng và có căn cứ. Từ việc kiểm tra trùng lặp nội dung bằng python trên bảng dữ liệu, so khớp văn bản gần giống, cho tới quét toàn bộ thư mục tài liệu, mỗi phần đều có từng bước cụ thể kèm đoạn mã minh họa để bạn áp dụng ngay vào quy trình audit của mình.

Google từng chia sẻ rằng khoảng 25 đến 30 phần trăm nội dung trên toàn bộ web hiện là nội dung trùng lặp, phần lớn đến từ việc trích dẫn, chia sẻ lại đoạn văn giữa các trang.

Con số này cho thấy việc rà soát trùng lặp không phải công việc thừa thãi mà là bước bắt buộc trong quy trình chăm sóc nội dung. Theo thống kê từ SEMrush, những website tồn tại lượng lớn nội dung trùng lặp có thể chịu mức sụt giảm lưu lượng truy cập tự nhiên trung bình lên tới 27 phần trăm, đồng thời có tới 64 phần trăm người làm marketing thừa nhận gặp khó khăn với vấn đề trùng lặp nội dung. Với các trang thương mại điện tử, tỉ lệ còn cao hơn khi 50 phần trăm website loại này gặp trùng lặp do mô tả sản phẩm và trang danh mục lặp lại nhau.

Cách kiểm tra trùng lặp nội dung bằng python trên bảng dữ liệu CSV với pandas

Nếu dữ liệu website của bạn được xuất ra dưới dạng bảng, chẳng hạn danh sách URL, tiêu đề, thẻ H1 hay mô tả meta, thư viện pandas chính là công cụ nhanh nhất để rà soát trùng lặp. Chỉ với vài dòng lệnh, bạn có thể quét toàn bộ tập dữ liệu và khoanh vùng chính xác những bản ghi bị lặp lại, thay vì phải dò từng dòng bằng mắt thường.

Bước một, chuẩn bị và đọc dữ liệu đầu vào

Bạn cần một tệp CSV chứa các cột quan trọng như URL, tiêu đề trang, thẻ H1, mô tả meta. Sau đó dùng hàm read_csv của pandas để nạp toàn bộ dữ liệu vào một bảng gọi là DataFrame, sẵn sàng cho bước xử lý tiếp theo.

import pandas as pd

df = pd.read_csv(“data.csv”)

Bước hai, dùng hàm duplicated để khoanh vùng bản ghi lặp

Hàm duplicated trả về giá trị đúng hoặc sai cho từng dòng, cho biết dòng đó có bị lặp so với dòng khác hay không. Bạn có thể chỉ định kiểm tra trên một cột riêng lẻ như URL, hoặc kiểm tra trùng hoàn toàn trên tất cả các cột nếu muốn rà soát toàn diện hơn.

duplicates = df[df.duplicated(subset=[“url”], keep=False)]
print(duplicates)

Bước ba, lọc kết quả và giữ lại bản ghi cần thiết

Sau khi có danh sách các dòng trùng lặp, bạn có thể quyết định giữ bản ghi đầu tiên, bản ghi cuối cùng, hoặc loại bỏ toàn bộ nhóm trùng bằng tham số keep trong hàm drop_duplicates, tùy theo mục đích làm sạch dữ liệu của mình.

Hộp ghi nhớ. Khi tệp dữ liệu quá lớn, bạn nên rà soát trùng lặp theo từng nhóm nhỏ, ví dụ theo từng danh mục sản phẩm, thay vì so sánh toàn bộ hàng triệu dòng cùng lúc. Cách làm này giúp tiết kiệm đáng kể thời gian xử lý và bộ nhớ máy tính.

Cách phát hiện nội dung trùng lặp bằng python trong văn bản với cấu trúc tập hợp

Với những đoạn nội dung ngắn như tiêu đề bài viết, câu mô tả hay đoạn giới thiệu sản phẩm, bạn không nhất thiết phải dùng đến pandas. Cấu trúc tập hợp trong python, gọi là set, cho phép bạn nhận diện các chuỗi trùng khớp tuyệt đối một cách gọn nhẹ và dễ hiểu.

Bước một, chuẩn hóa chuỗi văn bản

Trước khi so sánh, bạn cần loại bỏ khoảng trắng thừa ở đầu và cuối chuỗi, đồng thời chuyển toàn bộ văn bản về chữ thường. Nếu bỏ qua bước này, hai câu giống nhau nhưng khác cách viết hoa có thể bị đánh giá nhầm là không trùng lặp.

Bước hai, duyệt qua danh sách và ghi nhận phần tử đã gặp

seen = set()
duplicates = set()

for t in normalized:
    if t in seen:
        duplicates.add(t)
    else:
        seen.add(t)

Mỗi khi gặp một chuỗi đã tồn tại trong tập seen, python sẽ đưa chuỗi đó vào tập duplicates. Cách tiếp cận này chạy rất nhanh vì việc kiểm tra một phần tử có nằm trong set hay không gần như tức thời, phù hợp khi bạn cần xử lý hàng chục nghìn dòng văn bản ngắn.

Bước ba, xuất kết quả để đối chiếu thủ công

Bạn nên in danh sách duplicates ra màn hình hoặc ghi vào tệp riêng, kèm theo vị trí dòng gốc trong dữ liệu, để đội biên tập dễ dàng truy ngược và chỉnh sửa nội dung bị lặp.

Cách tìm bài viết trùng lặp bằng python thông qua so khớp gần giống

Trong nhiều trường hợp, hai bài viết không giống nhau tuyệt đối mà chỉ được chỉnh sửa nhẹ vài từ. Đây gọi là near duplicate, và cách xử lý phù hợp là dùng thuật toán so khớp mờ, tiêu biểu là thư viện difflib có sẵn trong python.

Bước một, tính điểm tương đồng giữa hai đoạn văn bản

from difflib import SequenceMatcher

score = SequenceMatcher(None, a.lower(), b.lower()).ratio()

Hàm ratio trả về một con số trong khoảng từ không đến một, thể hiện mức độ giống nhau giữa hai chuỗi. Điểm số càng gần một, hai đoạn văn bản càng có khả năng là bản chỉnh sửa của nhau.

Bước hai, chọn ngưỡng phù hợp với mục tiêu audit

Theo kinh nghiệm thực tế, ngưỡng 0.9 thường được dùng để bắt các phiên bản chỉnh sửa nhẹ, trong khi nhiều nền tảng phân tích SEO cho rằng những trang chia sẻ từ 70 đến 80 phần trăm nội dung trở lên thường bị xem là có vấn đề trùng lặp thực sự. Bạn nên thử nghiệm với vài ngưỡng khác nhau trên tập dữ liệu mẫu trước khi áp dụng chính thức.

Bước ba, xuất báo cáo bắt cặp ra tệp Excel

Bạn có thể lưu toàn bộ các cặp bài viết vượt ngưỡng vào một bảng riêng, gồm chỉ số dòng, điểm tương đồng và nội dung gốc, sau đó xuất ra tệp Excel bằng pandas.ExcelWriter để đội nội dung dễ dàng rà soát và chỉnh sửa từng cặp.

Cách quét thư mục tìm file nội dung trùng lặp bằng mã băm

Khi bạn cần kiểm tra hàng trăm tệp tài liệu, bài viết xuất bản hoặc file export nội bộ, việc so sánh từng ký tự sẽ rất tốn thời gian. Giải pháp hiệu quả hơn là tính mã băm cho mỗi tệp, bởi hai tệp có nội dung giống hệt nhau chắc chắn sẽ cho ra cùng một mã băm.

Bước một, tính mã băm cho từng tệp

import hashlib

def file_hash(filepath, chunk_size=8192):
    hasher = hashlib.sha256()
    with open(filepath, “rb”) as f:
        while chunk := f.read(chunk_size):
            hasher.update(chunk)
    return hasher.hexdigest()

Bước hai, duyệt toàn bộ thư mục và nhóm tệp theo mã băm

Hàm os.walk cho phép bạn duyệt qua tất cả thư mục con, tính mã băm từng tệp rồi lưu vào một từ điển. Khi gặp mã băm đã tồn tại, đường dẫn tệp hiện tại sẽ được xem là bản sao của tệp đã ghi nhận trước đó.

Bước ba, xử lý và lưu trữ kết quả trùng lặp

Danh sách các cặp tệp trùng lặp nên được sắp xếp theo mã băm rồi xuất ra bảng tính, kèm theo kích thước tệp và đường dẫn đầy đủ, giúp bạn quyết định giữ lại tệp nào và xóa bỏ tệp nào một cách có căn cứ.

Để bạn dễ hình dung sự khác biệt giữa bốn phương pháp, bảng tổng hợp dưới đây trình bày mục đích sử dụng và tốc độ xử lý tương ứng của từng cách.

Phương pháp Thư viện chính Phù hợp với Độ chính xác
Bảng dữ liệu CSV pandas URL, tiêu đề, thẻ H1 Trùng tuyệt đối
Chuỗi ngắn set Tiêu đề, mô tả meta Trùng tuyệt đối
So khớp gần giống difflib Bài viết chỉnh sửa nhẹ Tương đối, theo ngưỡng
Quét thư mục tệp hashlib Tài liệu, file export Trùng tuyệt đối

Ngoài bốn phương pháp kể trên, quy trình audit chuyên nghiệp thường phối hợp cả kỹ thuật kỹ thuật lẫn quản trị nội dung. Danh sách gợi ý dưới đây tổng hợp những việc bạn nên làm song song với việc chạy script python.

  • Rà soát và gắn thẻ canonical cho những trang có nội dung tương tự nhau, bởi 56 phần trăm website hiện chưa sử dụng thẻ canonical đúng cách, dẫn tới lỗi lập chỉ mục.
  • Viết lại phần mô tả sản phẩm thay vì sao chép từ nhà cung cấp, vì 65 phần trăm chuyên gia SEO khuyến nghị làm mới nội dung mô tả sản phẩm để tránh trùng lặp.
  • Thiết lập lịch kiểm tra định kỳ thay vì chỉ audit một lần, giúp phát hiện sớm nội dung mới phát sinh trùng lặp.
  • Kết hợp liên kết nội bộ hợp lý giữa các trang liên quan để giảm thiểu tình trạng cạnh tranh từ khóa giữa chính các trang trong cùng website.

Một mức benchmark thường được các công cụ phân tích khuyến nghị là giữ tỉ lệ nội dung trùng lặp dưới 5 phần trăm để đạt hiệu quả SEO tốt, trong khi mức trên 15 phần trăm được xem là đáng lo ngại.

Việc kết hợp cả bốn phương pháp giúp bạn xây dựng một quy trình audit toàn diện, bao phủ từ cấp độ dữ liệu bảng, văn bản ngắn, bài viết dài cho đến tệp tài liệu lưu trữ. Bạn hoàn toàn có thể đóng gói các hàm này thành một công cụ dòng lệnh dùng lại nhiều lần cho các dự án khác nhau, giúp tiết kiệm đáng kể thời gian mỗi khi cần rà soát website mới.

Việc phát hiện nội dung trùng lặp bằng python không đòi hỏi kiến thức lập trình quá phức tạp, chỉ cần bạn nắm vững bốn kỹ thuật cốt lõi vừa trình bày. Bạn có thể bắt đầu từ phương pháp đơn giản nhất là pandas cho dữ liệu bảng, rồi dần mở rộng sang so khớp gần giống và quét tệp bằng mã băm khi khối lượng công việc tăng lên. Áp dụng đều đặn quy trình này vào lịch audit định kỳ sẽ giúp website của bạn duy trì chất lượng nội dung ổn định và cải thiện hiệu quả xếp hạng trên công cụ tìm kiếm một cách bền vững.

Khánh Linh
Khánh Linh
1055 bài đăng
Khánh Linh
Khánh Linh
1055 bài đăng
  • VietMoz xin chào!

TRUNG TÂM ĐÀO TẠO VIETMOZ ACADEMY

Địa chỉ: Số 18 ngõ 11 Thái Hà, Đống Đa, Hà Nội
Điện thoại: (0246) 292 3344 – (0246) 291 2244
Hotline: 098 380 3333
Email: info@vietmoz.com

Google Partners Chung nhan Tin Nhiem Mang
DMCA.com Protection Status

Truy cập nhanh

  • Hướng dẫn thanh toán
  • Cơ sở vật chất
  • Chính sách bảo mật thông tin
  • Tổng quan về Digital Marketing
  • Tìm hiểu Marketing là gì
Bản quyền © bởi Trung tâm đào tạo VietMoz Academy. Tối ưu bởi Code Tốt.
  • Trang chủ
  • Giới thiệu
    • Giới thiệu VietMoz Academy
    • Cơ sở vật chất
    • Hoạt động cộng đồng
  • Chương trình học
    • Lịch tuyển sinh
    • Khóa học SEO tiêu chuẩn
    • Google Marketing
      • Khóa học Adwords Pro Sales
      • Khoá học Google Map Premium
      • Khóa học SEO HCM Special
      • Khóa học GA4 from Zero to Hero
    • Thực hành quảng cáo Facebook
      • Khóa học Winning Facebook Ads
      • Khóa học Facebook Marketing
    • Khoá học kinh doanh thương mại điện tử trên sàn Shopee
    • Marketing tinh gọn
      • Marketing Fundamentals
      • Khoá học MSP – Thực hành xây dựng chiến lược marketing
      • Khoá học Digital Masterclass
      • Khóa học Sale Promotion
  • Blog
    • Tin tức
    • Cách làm SEO
      • SEO Cafe – Tin tức SEO mới nhất
      • Wiki SEO – Thư viện kiến thức quan trọng
      • SEO Guide – Hướng dẫn làm SEO
      • SEO Case Study
      • Resource – Công cụ & Template
    • Blog Marketing
    • Kiến thức Google Adwords
    • Blog Facebook Marketing
    • Blog Content
  • Liên hệ
    • Đăng ký học
    • Hướng dẫn thanh toán
    • Bản đồ đường đi
Gõ để tìm