Công cụ AI
Phát hiện bất thường trong dữ liệu sản xuất bằng Machine Learning với Claude (Excel + PowerPoint)
Hướng dẫn dùng Claude trong Excel để phát hiện máy bất thường trong dữ liệu sản xuất bằng Isolation Forest, đóng gói kết quả thành slide executive summary trên PowerPoint — không cần biết lập trình.
PNTECH Writer · 25/09/2026

Có một chiếc máy "bình thường" nhưng tổng thể rất đáng nghi
Bạn có một bảng dữ liệu vận hành nhà máy với ba cột: độ rung, nhiệt độ, số tháng đã chạy. Nhìn từng cột một thì chiếc máy nào cũng ổn. Nhưng khi ghép cả ba chỉ số vào cùng một dòng, có một chiếc bỗng nhiên trở nên rất khác biệt — kiểu "rung hơi cao, nhiệt hơi cao, vận hành cũng hơi lâu", mỗi thứ một chút. Mắt thường và Excel cơ bản rất khó thấy trường hợp này, vì từng biến số riêng lẻ đều không vượt ngưỡng cảnh báo.
Đó chính là lý do bài này tồn tại. Mình sẽ hướng dẫn bạn — một người làm marketing, vận hành hoặc chủ doanh nghiệp nhỏ, không biết lập trình — cách nhờ Claude chạy một thuật toán machine learning (học máy, tức là phần mềm tự tìm quy luật từ dữ liệu) đơn giản ngay trong Excel để chỉ ra đúng những ca đáng điều tra. Xong rồi mình sẽ đóng gói kết quả thành slide executive summary (slide tóm tắt cho lãnh đạo, đi thẳng vào điểm chính) bằng Claude trong PowerPoint, để bạn mang đi họp tuần mà không cần thuê data scientist.
Một chiếc máy có thể "bình thường" trên từng chỉ số riêng lẻ, nhưng bất thường khi nhìn tổng thể — và chỉ có thuật toán đa biến mới thấy được điều đó.
Bộ dữ liệu sản xuất trông như thế nào
Giả sử bạn xuất từ hệ thống SCADA (phần mềm giám sát máy móc theo thời gian thực) hoặc từ file Excel do đội bảo trì gửi, bạn sẽ có một bảng kiểu thế này cho mỗi chiếc máy: độ rung (vibration, đơn vị mm/s), nhiệt độ vỏ máy (temperature, đơn vị °C), và số tháng đã hoạt động (months of operation). Mỗi dòng là một chiếc máy, mỗi cột là một chỉ số.
Với bộ dữ liệu kiểu này, có hai khái niệm hay bị trộn lẫn mà bạn cần phân biệt ngay từ đầu:
- Outlier (điểm cực trị): là một điểm có giá trị quá khác so với phần còn lại. Ví dụ trong lớp học, nếu mọi người cao 1m60 đến 1m75, một bạn 1m95 được xem là outlier.
- Anomaly (mẫu hành vi lạ): là một điểm hoặc một mẫu dữ liệu có hành vi bất thường theo ngữ cảnh. Cùng bạn 1m95 đó, nếu đang chơi bóng rổ thì bình thường, nhưng đang xếp hàng vào lớp mẫu giáo thì rất đáng nghi — đó là anomaly.
Tóm lại: outlier là "to quá hoặc nhỏ quá", còn anomaly là "lạ trong bối cảnh nào đó". Anomaly có thể không phải outlier nào cả khi bạn chỉ nhìn từng biến riêng lẻ, nhưng khi kết hợp nhiều biến lại thì nó lộ ra ngay.

Claude trong Excel xử lý bài toán này như thế nào
Claude trong Excel là một add-in (tiện ích bổ sung cài thêm vào Excel) cho phép bạn nói chuyện với mô hình AI ngay trong bảng tính, bằng tiếng Việt hoặc tiếng Anh, mà không cần mở thêm cửa sổ nào. Khi bạn yêu cầu phân tích, Claude sẽ tự viết và chạy đoạn mã Python ở bên trong Excel để xử lý dữ liệu, rồi trả kết quả về lại bảng tính cho bạn.
Để hình dung, hãy tưởng tượng bạn bước vào một quán phở, bạn chỉ cần nói "cho tôi một tô phở bò tái, ít hành". Người phục vụ sẽ tự vào bếp, nấu đúng món đó, rồi bưng ra cho bạn. Bạn không cần biết công thức nấu, không cần biết nồi nào đang sôi. Claude trong Excel cũng vậy: bạn chỉ cần gõ "tìm các máy có hành vi bất thường trong bảng này", Claude sẽ tự chọn thuật toán phù hợp, tự xử lý dữ liệu, và trả về cho bạn một bảng kết quả. Bạn không cần viết một dòng code nào.
Đây là lý do Claude trong Excel phân tích dữ liệu trở thành công cụ rất phù hợp cho marketer và người vận hành: bạn tập trung vào câu hỏi kinh doanh, còn phần tính toán kỹ thuật để AI lo.
Cách 1: Phương pháp đơn biến — nhanh nhưng dễ bỏ sót
Phương pháp đơn biến (univariate, nghĩa là chỉ xét từng biến số một cách tách biệt) là cách truyền thống, dễ hiểu nhất. Bạn tính trung bình và độ lệch chuẩn của từng cột, rồi đánh dấu những dòng nào vượt quá một ngưỡng nhất định.
Một cách đơn biến phổ biến là Z-score. Hiểu đơn giản: bạn lấy giá trị của một chiếc máy, trừ đi trung bình của toàn bộ nhóm, rồi chia cho độ lệch chuẩn (một con số thể hiện mức "phân tán" của nhóm). Kết quả cho biết chiếc máy đó cách trung bình bao nhiêu lần độ lệch chuẩn. Ví dụ trong lớp có 30 bạn, cân nặng trung bình 55kg, độ lệch chuẩn 5kg. Một bạn nặng 70kg sẽ có Z-score bằng (70 − 55) / 5 = 3, tức là nặng hơn trung bình 3 lần độ lệt chuẩn — rất đáng chú ý.
Khi áp dụng vào bảng dữ liệu sản xuất và nhờ Claude chạy, kết quả minh họa thường như sau:
- 4 cực trị được phát hiện ở cột độ rung (rung quá cao so với phần còn lại).
- 19 bản ghi 0 tháng hoạt động — tức là máy mới lắp, chưa chạy bao lâu nhưng đã có dấu hiệu lạ.
- Tổng cộng 166 anomalies khi gộp lại — một con số khá lớn.
Nhìn con số 166, bạn sẽ thấy ngay vấn đề: phương pháp đơn biến "quăng lưới" quá rộng, vì nó chỉ nhìn từng cột một. Một chiếc máy có rung hơi cao một chút, kết hợp với nhiệt hơi cao một chút và đã vận hành khá lâu — ba thứ đều không vượt ngưỡng riêng lẻ — sẽ không bao giờ được cảnh báo. Mà chính những ca "ba thứ một chút" này mới là ca đáng điều tra nhất.
Cách 2: Isolation Forest — đa biến thắng rõ ràng
Isolation Forest là một thuật toán machine learning thuộc nhóm "phát hiện bất thường đa biến" (multivariate anomaly detection, nghĩa là xét nhiều biến số cùng lúc). Để giải thích cho dễ, hãy tưởng tượng bạn đi chợ mua trái cây. Bạn đặt một quả táo giữa đống táo — quả nào cũng giống nhau, rất khó tách riêng. Nhưng nếu có một quả cam nằm giữa đống táo, bạn chỉ cần vài lần "rẽ nhánh" là tách được nó ra ngay. Isolation Forest hoạt động đúng theo cơ chế đó: dữ liệu bình thường thì khó tách, dữ liệu bất thường thì dễ tách — và thuật toán đếm xem mỗi điểm cần "rẽ nhánh" bao nhiêu lần để cô lập.
Khi nhờ Claude trong Excel chạy, bạn chỉ cần gửi một yêu cầu kiểu: "Hãy chạy Isolation Forest trên 3 cột vibration, temperature, months_of_operation để phát hiện bất thường. Trước khi chạy, hãy xóa các bản ghi trùng lặp." Claude sẽ tự viết đoạn Python, chạy thuật toán, và ghi kết quả vào một worksheet (sheet trong Excel) mới để bạn xem.
Kết quả minh họa thường rất khác so với đơn biến:
- 39 anomalies được đánh dấu — ít hơn 166 rất nhiều, nhưng chất lượng hơn.
- 239 bản ghi trùng lặp bị loại trước khi chạy, đảm bảo mỗi chiếc máy chỉ được tính một lần.
- 5 ca "đơn biến bỏ sót" được phát hiện thêm — tức là có những chiếc máy mà Z-score không cảnh báo, nhưng Isolation Forest lại chỉ ra được vì nhìn cả ba chỉ số cùng lúc.

Một tham số quan trọng: contamination
Trong Isolation Forest có một tham số gọi là contamination — hiểu đơn giản là "tỷ lệ bất thường mà bạn kỳ vọng trong dữ liệu". Mặc định thường là 5%, tức là thuật toán sẽ giả định khoảng 5% số dòng là bất thường.
Nhưng 5% không phải lúc nào cũng đúng. Nếu bạn làm trong ngân hàng, phát hiện giao dịch gian lận, có thể bạn muốn giảm xuống 1% vì gian lận rất hiếm, mỗi ca đều đáng điều tra. Nếu bạn làm trong nhà máy, kiểm tra chất lượng sản phẩm thô, có thể bạn muốn nâng lên 8% để bắt nhiều ca nghi ngờ hơn, tránh bỏ sót. Tóm lại: contamination càng cao thì thuật toán cảnh báo nhiều hơn, càng thấp thì chỉ cảnh báo những ca rất rõ ràng.
Bài học quy trình: luôn ghi kết quả ra worksheet mới
Có một lỗi rất hay gặp khi dùng Claude trong Excel: bạn nhờ chạy phân tích lần thứ hai trên cùng một sheet, và kết quả mới ghi đè lên kết quả cũ. Bạn mất luôn danh sách 39 ca hôm trước, mà không biết lần này contamination khác hay mô hình khác. Để hình dung, giống như bạn nấu nồi canh hôm qua rất ngon, hôm nay bạn dùng lại đúng nồi đó mà không rửa, nêm gia vị mới lên — kết quả là một món không giống ai.
Để tránh chuyện này, hãy làm theo checklist 3 bước trước mỗi lần chạy mô hình:
- Backup worksheet: copy sheet hiện tại sang một bản "v1", "v2" trước khi nhờ Claude xử lý.
- Đặt tên rõ ràng: ví dụ "IsolationForest_5pct_2026-01-15" để sau này biết lần đó chạy với tham số nào.
- Ghi chú tham số: trong một ô trống đầu sheet, ghi rõ contamination, số dòng đầu vào, số dòng trùng bị loại.
Phân tích dữ liệu là một hành trình nhiều lần chạy, không phải một lần duy nhất. Không có worksheet dự phòng, bạn sẽ mất khả năng so sánh giữa các lần thử.
Đóng gói kết quả thành slide executive summary bằng Claude trong PowerPoint
Có danh sách 39 ca đáng điều tra rồi, bước tiếp theo là truyền thông cho lãnh đạo hoặc khách hàng. Đây là lúc bạn cần đến Claude trong PowerPoint — một add-in tương tự, cho phép bạn dựng slide bằng câu lệnh thay vì kéo thả thủ công.
Quy trình rất đơn giản: bạn upload file Excel (hoặc bảng kết quả) vào PowerPoint, rồi gửi yêu cầu kiểu: "Hãy tạo một bộ slide executive summary về kết quả phát hiện bất thường trong dữ liệu sản xuất, tập trung vào 39 ca đáng điều tra". Claude sẽ dựng một bộ slide có cấu trúc dashboard (bảng điều khiển trực quan) khá quen thuộc:
- Slide đầu: tóm tắt chính — một câu kết luận lớn, ví dụ "Có 39 ca bất thường trên tổng số 1.200 máy, tập trung ở dây chuyền B".
- Slide giữa: biểu đồ trực quan — biểu đồ scatter (phân tán) tô màu các ca bất thường, hoặc bảng top 10 ca ưu tiên xử lý.
- Slide cuối: khuyến nghị ở góc dưới phải — gợi ý hành động tiếp theo, ví dụ "Lên lịch kiểm tra dây chuyền B trong tuần này".
Một bước nhỏ nhưng hay bị quên
Sau khi Claude dựng xong, mỗi slide thường có một textbox trống nằm chồng lên nội dung — đây là "khung gợi ý" mà add-in để lại. Trước khi trình chiếu, bạn cần xóa hoặc di chuyển các textbox trùng này ra ngoài slide, nếu không chúng sẽ che mất biểu đồ hoặc số liệu quan trọng.
Và một lưu ý về tư duy: đừng bày nguyên "nồi canh" lên bàn tiệc. Tức là đừng đưa nguyên bảng 39 dòng vào slide, mà hãy tóm gọn thành 3–5 insight lớn, kèm biểu đồ và một con số dễ nhớ. Người nghe slide thường chỉ nhớ một đến hai điểm — hãy chọn đúng điểm bạn muốn họ nhớ.

Tóm tắt & checklist hành động
Nếu bạn chỉ nhớ được vài điểm sau khi đọc xong bài này, hãy nhớ năm điểm này:
- Anomaly không phải outlier: outlier là "to hoặc nhỏ quá", anomaly là "lạ trong bối cảnh". Cùng một con số, có thể là outlier trong phân tích này nhưng hoàn toàn bình thường trong phân tích khác.
- Đơn biến nhanh nhưng bỏ sót: Z-score, IQR (khoảng giữa hai phần tư) chỉ nhìn từng biến một, rất dễ bỏ qua các ca "ba chỉ số một chút" mà tổng thể rất đáng nghi.
- Đa biến (Isolation Forest) chính xác hơn: xét nhiều biến cùng lúc, phát hiện được các ca mà đơn biến bỏ sót. Kết quả minh họa là 39 ca thay vì 166 ca, và trong đó có 5 ca đơn biến không thấy.
- Tinh chỉnh contamination theo ngành: ngân hàng thường 1%, nhà máy có thể 5–8%. Con số này không cố định, hãy thử và đánh giá lại.
- Luôn backup worksheet trước khi chạy và đóng gói thành slide cho lãnh đạo sau khi phân tích — hai thói quen này tiết kiệm rất nhiều thời gian khi cần tra lại hoặc trình bày.
Lưu ý về giá và tính năng 2025–2026
Cả Claude trong Excel và Claude trong PowerPoint đều là các add-in tương đối mới, và giá gói cũng như tính năng có thể thay đổi theo từng bản cập nhật của hãng. Trước khi mua hoặc gia hạn, bạn nên kiểm tra trang chính hãng của Anthropic để xác nhận gói nào (Pro, Team, Enterprise) hỗ trợ add-in Excel/PowerPoint, mức phí hiện tại, và có cần cấu hình tài khoản doanh nghiệp hay không. Nếu bạn đang dùng bản Excel/PowerPoint thuộc Microsoft 365 Personal thay vì Business, một số add-in cũng có thể không khả dụng — đây là điểm cần verify trước khi triển khai cho cả team.
Còn nếu bạn muốn đi sâu hơn vào nhánh Claude trong Excel với một bài toán khác — ví dụ dự báo tài chính nhiều kịch bản thay vì phát hiện bất thường — bạn có thể tham khảo thêm bài đi sâu hơn vào dự báo tài chính và dashboard để so sánh quy trình và thấy cùng một công cụ có thể áp dụng cho nhiều bài toán kinh doanh khác nhau.
Tags
- SCADA
- Isolation Forest
- Z-score
- anomaly đa biến
- machine learning cơ bản
- executive summary
- Claude trong Excel
- Claude trong PowerPoint
- dữ liệu sản xuất
- phát hiện bất thường
Câu hỏi thường gặp
Tiếp theo
Tool mình đã dùng thật
Xem danh sách tool và dịch vụ đã dùng trong công việc — kèm lý do nên cân nhắc và khi nào không cần.