Data Science
Data Mining Là Gì? Quy Trình 7 Bước Từ Dữ Liệu Thô Đến Quyết Định
Data mining là quy trình 7 bước đi từ dữ liệu thô đến quyết định kinh doanh: đặt mục tiêu, chọn dữ liệu, làm sạch, biến đổi, lưu trữ, khai phá và đánh giá. Bài viết giải thích từng bước kèm ví dụ bán lẻ và 6 lỗi thường gặp.
PNTECH Writer · 12/09/2026

Data Mining Là Gì — Và Tại Sao Cần Một Quy Trình Rõ Ràng?
Bạn có một tệp Excel hàng chục nghìn dòng ghi lại khách hàng, đơn hàng, lượt truy cập web… nhưng không phải cứ mở ra là biết ai sắp nghỉ mua hàng, hay ai sẽ chi nhiều hơn vào tháng tới. Data mining (hay khai phá dữ liệu) chính là cách bạn đi từ đống dữ liệu thô đó đến câu trả lời có thể hành động — không phải bằng phép màu, mà bằng một quy trình 7 bước có thứ tự mà bất kỳ ai cũng có thể học.
Hiểu đơn giản: data mining là một nhánh của data science là gì và quy trình tổng thể, tập trung riêng vào việc tìm ra quy luật (pattern), mối liên hệ (relationship) hoặc dự đoán (prediction) từ một tập dữ liệu lớn để trả lời một câu hỏi kinh doanh cụ thể. Đầu ra không chỉ là một con số — mà là một quyết định: nên giữ chân khách nào, nên bỏ sản phẩm nào, nên nhắm nhóm khách nào trong quảng cáo kế tiếp. Nếu bạn muốn đi từ nền tảng rộng hơn trước khi đào sâu vào khai phá, hãy xem qua lộ trình mastering data science để có bức tranh toàn cảnh.
Data mining không phải là một thuật toán — nó là một workflow có trình tự, và phần lớn công sức thực sự nằm ở khâu làm sạch và biến đổi dữ liệu, không phải lúc chạy mô hình.
Trước Khi Bắt Đầu, Hãy Tính "Đáng Hay Không"
Nhiều người mới học data science có xu hướng lao ngay vào phần mềm và thuật toán. Nhưng bước số 0 — bước mà nếu thiếu, cả dự án dễ đổ vỡ — chính là cost-benefit trade-off: phân tích dữ liệu luôn tốn tiền, tốn thời gian, tốn công sức thu thập và xử lý. Câu hỏi đặt ra không phải "Có thể làm được không?" mà là "Làm xong thì quyết định nào sẽ khác đi, và khác đi đáng bao nhiêu tiền?".
Một điểm quan trọng cần nhớ: độ chính xác càng cao thì chi phí đầu tư càng tăng theo — nhưng giá trị thêm lại giảm dần. Ví dụ, dự đoán churn (tỷ lệ khách nghỉ mua) chính xác 70% có thể đã đủ để bạn chạy chiến dịch giữ chân, nhưng để đẩy lên 85% bạn có thể phải tốn gấp đôi thời gian và tiền thu thập dữ liệu sạch hơn. Đó gọi là diminishing returns — lợi ích biên giảm dần. Nếu câu trả lời cho câu hỏi "đáng không?" là không, thì dừng lại ở đây, đừng đi tiếp.
Quy Trình Data Mining 7 Bước — Đi Từ Câu Hỏi Đến Quyết Định
Toàn bộ quy trình data mining là một chuỗi 7 bước lặp lại (iterative), nghĩa là bạn có thể quay lại bước trước nếu bước sau cho thấy dữ liệu chưa đủ tốt. Dưới đây là từng bước theo thứ tự cần đi.
Bước 1: Đặt Mục Tiêu Rõ Ràng
Mục tiêu phải là một câu hỏi kinh doanh, không phải một câu hỏi kỹ thuật. Thay vì "dùng thuật toán X", hãy đặt: "Trong 6 tháng tới, nhóm khách nào có khả năng nghỉ mua cao nhất để tôi ưu tiên chăm sóc?". Mục tiêu rõ cũng giúp bạn biết cần độ chính xác bao nhiêu là đủ, từ đó cân đối chi phí ở bước 0.
Bước 2: Chọn Dữ Liệu
Bạn cần quyết định: dùng dữ liệu đã có sẵn (lịch sử bán hàng, log hệ thống) hay phải khảo sát/thu thập mới (gọi điện khách, lập biểu mẫu). Dữ liệu có sẵn rẻ hơn nhưng có thể thiếu trường quan trọng; dữ liệu mới đầy đủ hơn nhưng tốn thời gian. Đây là lý do bước 1 quan trọng: mục tiêu rõ sẽ cho bạn biết cần trường nào.
Bước 3: Tiền Xử Lý Dữ Liệu (Preprocessing)
Đây thường là công đoạn tốn thời gian nhất — nhất là với doanh nghiệp nhỏ đã có database khách hàng nhiều năm. Bạn cần: bỏ các cột không liên quan, phát hiện giá trị nhập sai ô (ví dụ tuổi 200, số điện thoại 12 chữ số), và đặc biệt là xử lý missing data (ô trống). Với dữ liệu bán lẻ, có khi 60–70% thời gian dự án rơi vào khâu này. Chi tiết kỹ thuật có ở bài tiền xử lý dữ liệu chi tiết.
Một cảnh báo quan trọng: missing data có thể là ngẫu nhiên (khách bỏ sót một ô vì lười điền) hoặc có hệ thống (khách thu nhập cao thường từ chối khai báo thu nhập). Nếu bạn cứ thấy ô trống là xóa luôn, rất có thể bạn đang vô tình loại bỏ nhóm khách hàng quan trọng nhất và kết quả sẽ bị thiên lệch (bias).

Bước 4: Biến Đổi Dữ Liệu (Transformation & Reduction)
Sau khi dữ liệu sạch, bạn thường cần "định dạng lại" để mô hình dễ học hơn. Có ba việc hay gặp:
Thứ nhất, gộp cột liên quan. Ví dụ thay vì giữ ba cột lương, thu nhập cho thuê nhà, trợ cấp, bạn gộp thành một cột tổng thu nhập — gọn hơn và thường có nghĩa hơn cho bài toán phân nhóm khách hàng. Từ cột tổng này, bạn có thể phân thành các nhóm thấp / trung / cao để dễ so sánh.
Thứ hai, giảm số biến khi dữ liệu quá nhiều cột. Một kỹ thuật phổ biến là PCA (Principal Component Analysis) — nói dễ hiểu: PCA giúp bạn chọn ra vài đặc điểm nổi bật nhất của khách hàng thay vì giữ tất cả. Giống như xem ảnh chụp nhóm lớp, bạn chỉ cần nhớ vài đặc điểm dễ nhận ra nhất (tóc ngắn, đeo kính, hay cười) thay vì nhớ từng đường nét trên khuôn mặt từng người.
Thứ ba, đổi biến liên tục sang nhóm: thu nhập 7.500.000 đ/tháng có thể không khác gì 7.700.000 đ/tháng về mặt hành vi mua, nhưng "nhóm thu nhập trung bình" thì có. Việc gom nhóm giúp mô hình bớt nhiễu.
Bước 5: Lưu Trữ Dữ Liệu An Toàn
Sau khi làm sạch và biến đổi, dữ liệu cần được lưu ở một server bảo mật, có khả năng đọc/ghi nhanh, và đặc biệt ưu tiên bảo vệ dữ liệu cá nhân (theo Nghị định 13/2023 về bảo vệ dữ liệu cá nhân tại Việt Nam, doanh nghiệp xử lý dữ liệu cá nhân phải có biện pháp kỹ thuật phù hợp — cần kiểm tra quy định cập nhật trên trang chính thức). Một cảnh báo thường gặp ở SME: dữ liệu bán hàng nằm ở máy chủ A, dữ liệu khách hàng nằm ở máy chủ B, dữ liệu tương tác web lại nằm ở máy chủ C — khi phân tích sẽ rất khó nối lại với nhau.
Bước 6: Khai Phá — Bắt Đầu Từ Biểu Đồ, Rồi Mới Đến Mô Hình
Đừng nhảy thẳng vào thuật toán. Hãy bắt đầu bằng visualization (vẽ biểu đồ) để xem xu hướng bằng mắt thường: biểu đồ đường thể hiện doanh thu theo tháng, biểu đồ phân tán thể hiện tuổi khách và giá trị đơn hàng, biểu đồ cột so sánh tỷ lệ nghỉ mua giữa các nhóm. Rất nhiều insight xuất hiện ngay ở bước này mà không cần mô hình phức tạp.
Khi biểu đồ không đủ trả lời câu hỏi ở bước 1, lúc đó hãy chuyển sang các nhóm mô hình: parametric (giả định dữ liệu theo một dạng phân phối nào đó — ví dụ hồi quy tuyến tính), non-parametric (không giả định dạng phân phối — ví dụ cây quyết định), hoặc machine learning phức tạp hơn. Bạn có thể xem thêm tổng quan thuật toán ở bài thuật toán data science cơ bản.

Bước 7: Đánh Giá — Đừng Tin Mô Hình Ngay Lần Đầu
Bước đầu tiên để kiểm tra mô hình là in-sample forecast: dự đoán lại trên chính tập dữ liệu đã dùng để huấn luyện. Ví dụ đời thường: học sinh học xong bài, giáo viên hỏi lại đúng các câu trong bài đó — nếu trả lời đúng hết thì học sinh ít nhất đã nhớ được pattern. Đây chưa phải kiểm tra chính xác nhất (vì học sinh có thể chỉ học thuộc), nhưng là bước sàng lọc nhanh để loại bỏ mô hình hỏng hoàn toàn.
Sau đó, bạn cần lấy feedback từ stakeholder (người ra quyết định, người hiểu nghiệp vụ) để xem kết quả có hợp lý với thực tế kinh doanh không. Và quan trọng nhất: quy trình là lặp lại. Nếu kết quả chưa đủ tốt, bạn quay lại bước 3 (làm sạch kỹ hơn), bước 4 (biến đổi khác đi), hoặc thậm chí bước 1 (đặt lại mục tiêu) — chứ không phải dừng lại sau một lần chạy.
In-sample forecast giống như hỏi lại học sinh đúng bài vừa học — chưa chắc đã hiểu sâu, nhưng nếu trả lời sai ngay câu quen thuộc thì mô hình có vấn đề từ đầu.
Một Ví Dụ Đời Thường: Cửa Hàng Bán Lẻ Muốn Giữ Chân Khách
Giả sử bạn quản lý một chuỗi cửa hàng bán lẻ vừa và nhỏ, đã có sẵn database khách hàng 3 năm (mã khách, số đơn, tổng chi, kênh mua, khu vực). Bạn muốn biết: nhóm khách nào sắp nghỉ mua để chăm sóc trước?
Ở bước 3 (tiền xử lý), bạn phát hiện khoảng 12% dòng có giá trị thiếu — đặc biệt ở trường "nghề nghiệp" và "khu vực". Bạn kiểm tra và thấy nhóm khách ở khu vực ngoại thành thường bỏ trống trường "nghề nghiệp" — không phải ngẫu nhiên mà là do hệ thống (giao diện form chưa tối ưu cho thiết bị cũ). Bạn không xóa các dòng này, mà đánh dấu riêng và tiếp tục.
Ở bước 4, bạn gộp "lương + thu nhập phụ + trợ cấp" thành một cột tổng thu nhập, rồi phân thành ba nhóm thấp / trung / cao để dễ so sánh với tần suất mua hàng. Bạn cũng dùng PCA để rút gọn hơn 20 trường mô tả khách xuống còn 5 đặc điểm nổi bật nhất, giúp mô hình không bị quá tải.
Ở bước 6, bạn vẽ biểu đồ thấy ngay: nhóm khách mua lần cuối cách đây hơn 4 tháng và từng mua ở kênh online có tỷ lệ nghỉ cao bất thường. Từ đó bạn xây mô hình dự đoán churn cho nhóm này, rồi chạy in-sample forecast ở bước 7 để xem mô hình có nhận ra đúng các khách đã nghỉ trong quá khứ không. Nếu nhớ được, bạn chuyển sang kiểm tra trên tập dữ liệu mới hơn và lấy feedback từ đội ngũ chăm sóc khách hàng.

6 Lỗi Hay Gặp Khi Mới Bắt Đầu Data Mining
Qua nhiều dự án nhỏ với SME và sinh viên mới học, có một số lỗi lặp đi lặp lại mà bạn nên tránh:
- Nhảy vào khai phá khi chưa có mục tiêu: mở phần mềm, nạp dữ liệu, chạy thuật toán — nhưng không biết đang trả lời câu hỏi gì. Kết quả là một đống biểu đồ đẹp mà không ai dùng.
- Săn độ chính xác tuyệt đối: quên mất cost-benefit; đẩy accuracy lên 95% khi 80% đã đủ cho quyết định kinh doanh, gây lãng phí chi phí.
- Bỏ qua làm sạch: dữ liệu bẩn cho kết quả bẩn, dù thuật toán có mạnh đến đâu.
- Xóa missing data mà không kiểm tra: dẫn đến thiên lệch, đặc biệt khi missing data có hệ thống như ví dụ khách thu nhập cao.
- Dữ liệu rải nhiều server: không thể nối được đơn hàng với khách hàng với hành vi web, nên mọi phân tích chỉ mang tính mảnh vỡ.
- Dừng sau một vòng phân tích: data mining là quy trình lặp — lần đầu thường chưa tốt, cần quay lại bước 3 hoặc 4 để cải thiện.
Tóm Lại Quy Trình 7 Bước
Để bạn dễ nhớ và áp dụng ngay, dưới đây là bản tóm gọn quy trình:
| Bước | Tên gọi | Việc cần làm |
|---|---|---|
| 1 | Đặt mục tiêu | Viết câu hỏi kinh doanh rõ ràng, tính cost-benefit. |
| 2 | Chọn dữ liệu | Dùng dữ liệu sẵn có hay cần thu thập mới. |
| 3 | Tiền xử lý | Bỏ cột thừa, sửa lỗi nhập, xử lý missing data cẩn thận. |
| 4 | Biến đổi | Gộp cột liên quan, giảm biến (PCA), phân nhóm nếu cần. |
| 5 | Lưu trữ | Một server bảo mật, dễ đọc/ghi, bảo vệ dữ liệu cá nhân. |
| 6 | Khai phá | Visualization trước, sau đó mới đến mô hình thống kê hoặc machine learning. |
| 7 | Đánh giá | In-sample forecast, feedback stakeholder, lặp lại nếu cần. |
Lời Kết
Data mining nghe phức tạp nhưng thực chất là một workflow có trình tự mà ai cũng có thể học, kể cả khi bạn chưa từng chạy một mô hình nào. Điểm mấu chốt là đừng bỏ qua khâu đặt mục tiêu và làm sạch dữ liệu — đây là hai chỗ quyết định 80% chất lượng câu trả lời cuối cùng. Phần thuật toán chỉ là công cụ; workflow mới là thứ giúp bạn đi từ dữ liệu thô đến quyết định có thể hành động. Nếu bạn muốn xem quy trình này áp dụng vào một tập dữ liệu cụ thể ra sao, hãy đọc tiếp bài data mining từ một data set đi qua 7 bước đến quyết định.
Tags
- quy trình data mining
- data science cơ bản
- dự đoán khách hàng
- xử lý dữ liệu
- kpi dữ liệu
- làm sạch dữ liệu
- doanh nghiệp nhỏ
Câu hỏi thường gặp
Tiếp theo
Xem phần mềm — hoặc nhận tư vấn
Đọc xong thì chọn: phần mềm PN, công cụ khuyên dùng, hoặc nhờ mình làm theo nhu cầu.
