Trả lời nhanh: Bảo trì dự đoán (predictive maintenance, PdM) là cách bảo trì dựa trên dữ liệu đo tình trạng thực tế của máy (độ rung, nhiệt độ, dòng điện, dầu) để phát hiện sớm dấu hiệu suy giảm và ước tính khi nào máy sẽ hỏng. Nhờ đó, doanh nghiệp sửa đúng lúc, có kế hoạch, thay vì chờ hỏng.
Điểm chính
- Có 4 chiến lược bảo trì: sửa khi hỏng, phòng ngừa theo lịch, theo tình trạng (CBM) và dự đoán (PdM). Nhà máy tốt dùng kết hợp cả bốn, không dồn hết vào PdM.
- PdM chỉ hiệu quả khi dạng hỏng có “dấu hiệu báo trước” đủ sớm. Đường cong P-F giúp bạn kiểm tra điều này trước khi mua cảm biến.
- Một hệ thống PdM đi qua 6 khối chức năng mà ISO 13374 mô tả: thu thập, xử lý, phát hiện, đánh giá, dự báo, khuyến nghị. Đầu ra cuối cùng phải là lệnh công việc trong CMMS, không chỉ là biểu đồ.
- Hướng dẫn của Bộ Năng lượng Hoa Kỳ (2010) ước tính PdM tiết kiệm 8% đến 12% so với chỉ bảo trì phòng ngừa. Con số thực tế phụ thuộc mức độ “sửa khi hỏng” hiện tại của bạn.
- Nên thí điểm trên 1 thiết bị trọng yếu, đo KPI trước và sau (MTBF, MTTR, giờ dừng máy ngoài kế hoạch) rồi mới mở rộng.
Mục lục
- Bảo trì dự đoán là gì?
- 4 chiến lược bảo trì khác nhau thế nào?
- Đường cong P-F là gì và vì sao cần hiểu trước khi làm PdM?
- Bảo trì dự đoán hoạt động như thế nào?
- Có những kỹ thuật giám sát tình trạng nào?
- Chuẩn ISO nào liên quan đến bảo trì dự đoán?
- Đo hiệu quả bảo trì dự đoán bằng KPI nào?
- Lợi ích thực tế của bảo trì dự đoán đến đâu?
- Khi nào doanh nghiệp nên triển khai bảo trì dự đoán?
- Lộ trình thí điểm bảo trì dự đoán trên 1 thiết bị trọng yếu
- Triển khai bảo trì dự đoán cần tính những chi phí nào?
- Những sai lầm thường gặp khi làm bảo trì dự đoán
- Bảo trì dự đoán nằm ở đâu trong nhà máy thông minh?
- Câu hỏi thường gặp
Bảo trì dự đoán là gì?
Bảo trì dự đoán, còn gọi là bảo trì dự báo, tiếng Anh là predictive maintenance (viết tắt PdM), là chiến lược bảo trì dựa trên việc đo và phân tích tình trạng thực tế của thiết bị để biết trước khi nào cần can thiệp. Câu hỏi PdM trả lời không phải “đã đến hạn bảo dưỡng chưa” mà là “máy này đang khoẻ đến đâu, và còn chạy được bao lâu”.
Hướng dẫn thực hành vận hành và bảo trì (O&M Best Practices Guide, bản 3.0, tháng 8/2010) do Phòng thí nghiệm Quốc gia Tây Bắc Thái Bình Dương (PNNL) soạn cho Bộ Năng lượng Hoa Kỳ (US DOE) định nghĩa PdM là các phép đo phát hiện sự khởi đầu của quá trình suy giảm, cho phép loại bỏ hoặc kiểm soát nguyên nhân trước khi trạng thái vật lý của bộ phận xuống cấp đáng kể. Tài liệu này cũng nhấn mạnh điểm khác cốt lõi: bảo trì phòng ngừa dựa trên lịch thời gian hoặc giờ chạy máy, còn bảo trì dự đoán dựa trên tình trạng thực tế của máy.
Ví dụ minh hoạ: một nhà máy bao bì có máy nén khí cấp khí cho cả xưởng. Cách cũ là thay vòng bi mỗi 12 tháng dù vòng bi còn tốt, hoặc chờ máy kêu to rồi mới dừng. Với PdM, một cảm biến rung đo liên tục. Khi phổ rung xuất hiện tần số đặc trưng của lỗi vòng bi và biên độ tăng dần, hệ thống ước tính còn khoảng vài tuần trước khi vượt ngưỡng nguy hiểm. Đội bảo trì đặt vòng bi, lên lịch thay vào ca nghỉ cuối tuần. Xưởng không phải dừng đột ngột giữa đơn hàng.
Bảo trì dự đoán, bảo trì dự báo và PdM có khác nhau không?
Không. Đây là ba cách gọi của cùng một khái niệm. “Bảo trì dự đoán” và “bảo trì dự báo” đều là bản dịch của predictive maintenance. Một số tài liệu tiếng Việt còn gọi là “bảo trì tiên đoán”. Trong nhà máy, kỹ sư thường nói tắt là PdM để phân biệt với PM (preventive maintenance, bảo trì phòng ngừa).
4 chiến lược bảo trì khác nhau thế nào?
Muốn hiểu đúng bảo trì dự đoán, bạn cần đặt nó cạnh ba chiến lược còn lại. Mỗi chiến lược trả lời câu hỏi “khi nào can thiệp” theo một cách khác nhau.
| Tiêu chí | Sửa khi hỏng (reactive, run-to-failure) | Phòng ngừa theo lịch (preventive, PM) | Theo tình trạng (condition-based, CBM) | Dự đoán (predictive, PdM) |
|---|---|---|---|---|
| Căn cứ để can thiệp | Máy đã hỏng hoặc dừng | Lịch thời gian, giờ chạy, số chu kỳ | Chỉ số đo vượt ngưỡng cảnh báo | Xu hướng dữ liệu cho thấy sắp vượt ngưỡng, kèm ước tính thời gian còn lại |
| Thời điểm sửa | Bất ngờ, thường vào lúc bất lợi | Cố định, có thể quá sớm hoặc quá muộn | Khi có dấu hiệu bất thường | Trước khi hỏng, vào thời điểm chủ động chọn |
| Dữ liệu cần có | Gần như không | Khuyến nghị nhà sản xuất, lịch sử bảo trì | Đo định kỳ hoặc liên tục một vài thông số | Đo liên tục hoặc dày, lịch sử dài, dữ liệu sự cố để huấn luyện mô hình |
| Đầu tư ban đầu | Thấp nhất | Thấp đến trung bình | Trung bình | Cao nhất (cảm biến, nền tảng, nhân lực phân tích) |
| Rủi ro chính | Dừng máy ngoài kế hoạch, hư hỏng lan sang bộ phận khác, mất an toàn | Thay phụ tùng còn tốt, vẫn hỏng bất ngờ giữa hai kỳ bảo dưỡng | Ngưỡng đặt sai: báo động giả hoặc báo quá muộn | Mô hình sai, dữ liệu kém, đầu tư không thu hồi được nếu chọn sai thiết bị |
| Phù hợp với | Thiết bị rẻ, có dự phòng, hỏng không ảnh hưởng an toàn | Hỏng theo tuổi thọ rõ ràng: dầu, lọc, dây curoa, bộ phận mài mòn đều | Thiết bị quan trọng có thông số đo được | Thiết bị trọng yếu, dừng máy rất đắt, dạng hỏng có dấu hiệu báo trước |
CBM và PdM: ranh giới nằm ở đâu?
Hai khái niệm này hay bị dùng lẫn. Nhiều tài liệu xem PdM là một dạng nâng cao của bảo trì theo tình trạng (CBM). Cách phân biệt dễ nhớ:
- CBM trả lời “hiện tại máy có bất thường không”. Ví dụ: nhiệt độ ổ trục vượt 80 độ C thì phát cảnh báo.
- PdM trả lời thêm “khi nào sẽ đến mức phải dừng”. Ví dụ: với tốc độ tăng nhiệt hiện tại, ổ trục sẽ chạm ngưỡng sau khoảng 15 ngày.
Trong thực tế, phần lớn chương trình PdM bắt đầu từ CBM: đo, đặt ngưỡng, theo dõi xu hướng. Khi đã có đủ dữ liệu lịch sử, đội kỹ thuật mới thêm mô hình dự báo thời gian còn lại.
Không phải thiết bị nào cũng cần bảo trì dự đoán
Một điểm ít bài viết nhắc tới: mục tiêu không phải là đưa toàn bộ nhà máy lên PdM. Hướng dẫn O&M của US DOE dẫn một nghiên cứu cho thấy cơ sở trung bình tại Mỹ dành hơn 55% nguồn lực bảo trì cho sửa khi hỏng, 31% cho phòng ngừa, 12% cho dự đoán và 2% cho việc khác. Trong khi đó, các cơ sở hoạt động tốt nhất có cơ cấu dưới 10% sửa khi hỏng, 25% đến 35% phòng ngừa và 45% đến 55% dự đoán.
Nghĩa là ngay cả nơi làm tốt vẫn để một phần thiết bị chạy đến hỏng. Đó là những thiết bị rẻ, có dự phòng, hỏng không gây hậu quả lớn. Cách tiếp cận phân bổ có chủ đích này gọi là bảo trì tập trung vào độ tin cậy (reliability-centered maintenance, RCM).
Đường cong P-F là gì và vì sao cần hiểu trước khi làm PdM?
Đường cong P-F (P-F curve) là công cụ quan trọng nhất để quyết định có nên áp dụng bảo trì dự đoán cho một dạng hỏng hay không. Nó mô tả tình trạng của thiết bị theo thời gian, với hai mốc:
- P (potential failure, hỏng tiềm ẩn): thời điểm sớm nhất có thể phát hiện dấu hiệu suy giảm bằng một kỹ thuật đo nào đó.
- F (functional failure, hỏng chức năng): thời điểm thiết bị không còn làm được chức năng yêu cầu.
Khoảng thời gian từ P đến F gọi là khoảng P-F (P-F interval). Đây là “cửa sổ” để bạn đặt phụ tùng, xếp lịch, chuẩn bị nhân lực. Ba hệ quả thực tế:
- Kỹ thuật phát hiện càng sớm, cửa sổ càng rộng. Phân tích rung thường bắt được lỗi vòng bi sớm hơn nhiều so với việc chờ ổ trục nóng lên hay phát ra tiếng ồn.
- Chu kỳ đo phải ngắn hơn khoảng P-F. Nếu lỗi chỉ cần 2 tuần để đi từ P đến F mà bạn đo rung mỗi tháng một lần, bạn rất dễ bỏ lỡ. Khi đó cần đo dày hơn hoặc lắp cảm biến đo liên tục.
- Không có điểm P thì không có PdM. Một số dạng hỏng xảy ra gần như tức thời, không có dấu hiệu báo trước đo được, ví dụ hỏng linh kiện điện tử do xung điện. Với những dạng này, đầu tư cảm biến không giúp dự đoán; giải pháp nằm ở thiết kế dự phòng hoặc bảo vệ.
Đường cong P-F cũng giải thích vì sao bảo trì theo lịch không đủ: nhiều dạng hỏng không liên quan chặt chẽ đến tuổi thiết bị. Thay phụ tùng theo lịch cứng không ngăn được chúng, đôi khi còn làm tăng rủi ro do lỗi lắp đặt sau mỗi lần tháo ra lắp lại.
Bảo trì dự đoán hoạt động như thế nào?
Một hệ thống bảo trì dự đoán là một chuỗi khép kín: từ cảm biến trên máy đến lệnh công việc trong tay kỹ thuật viên, rồi quay ngược lại để mô hình học từ kết quả thực tế.
Bước 1: Đo bằng cảm biến
Cảm biến gắn trên máy đo các đại lượng phản ánh sức khoẻ: gia tốc rung trên vỏ ổ trục, nhiệt độ cuộn dây hoặc bề mặt, dòng điện và điện áp cấp cho động cơ, áp suất, lưu lượng, mẫu dầu bôi trơn. Với máy móc cũ, cảm biến thường được gắn thêm từ bên ngoài (retrofit) mà không phải can thiệp vào bộ điều khiển.
Không phải lúc nào cũng cần cảm biến cố định. Nhiều chương trình bắt đầu bằng đo định kỳ: kỹ thuật viên cầm máy đo rung cầm tay hoặc camera nhiệt đi tuyến (route) mỗi tuần. Cảm biến đo liên tục chỉ nên dùng cho thiết bị trọng yếu hoặc dạng hỏng có khoảng P-F ngắn.
Bước 2: Thu thập và truyền dữ liệu
Dữ liệu được gom qua gateway, bộ ghi dữ liệu hoặc PLC rồi đẩy về máy chủ trong nhà máy hay nền tảng đám mây. Hạ tầng phía sau chính là Internet vạn vật trong công nghiệp (IIoT); bạn có thể đọc thêm về các lớp thiết bị, kết nối và giao thức trong bài IoT là gì.
Tín hiệu rung lấy mẫu ở tần số cao tạo ra rất nhiều dữ liệu thô. Vì vậy nhiều hệ thống xử lý sơ bộ ngay cạnh máy, chỉ gửi đặc trưng đã tính sẵn về trung tâm. Đây là bài toán điển hình của điện toán biên: giảm băng thông, giảm độ trễ và vẫn chạy được khi mất kết nối Internet.
Bước 3: Xử lý tín hiệu và phát hiện bất thường
Dữ liệu thô được làm sạch, lọc nhiễu, chuẩn hoá theo điều kiện vận hành (tải, tốc độ, nhiệt độ môi trường). Với tín hiệu rung, kỹ thuật phổ biến là biến đổi Fourier nhanh (FFT) để chuyển tín hiệu theo thời gian sang phổ tần số. Hệ thống so sánh với mức nền (baseline) đo khi máy còn tốt. Lệch khỏi mức nền là dấu hiệu đầu tiên đáng chú ý.
Bước 4: Chẩn đoán và dự báo thời gian còn lại (RUL)
Phát hiện bất thường mới chỉ là “có chuyện”. Bước chẩn đoán trả lời “chuyện gì”: mất cân bằng, lệch trục, lỏng chân đế hay mòn vòng bi. Sau đó, bước dự báo ước tính thời gian sử dụng còn lại (remaining useful life, RUL): còn bao nhiêu ngày, giờ chạy hoặc chu kỳ trước khi chạm ngưỡng không chấp nhận được.
RUL luôn là một khoảng ước tính kèm độ bất định, không phải một con số chắc chắn. Một hệ thống tốt nói “còn khoảng 10 đến 20 ngày, độ tin cậy trung bình” thay vì “hỏng vào ngày 15”.
Bước 5 và 6: Khuyến nghị và lệnh công việc trong CMMS
Kết quả dự báo cần chuyển thành việc cụ thể: thay gì, trước ngày nào, cần phụ tùng và nhân lực gì. Việc này được đưa vào hệ thống quản lý bảo trì bằng máy tính (computerized maintenance management system, CMMS) dưới dạng lệnh công việc (work order). CMMS lo xếp lịch, giao việc, kiểm tra tồn kho phụ tùng và ghi lại kết quả. Ở nhiều doanh nghiệp, CMMS là một phân hệ của hệ thống ERP, nên việc đặt mua vật tư và hạch toán chi phí bảo trì diễn ra trên cùng một nền tảng.
Sau khi sửa, kỹ thuật viên ghi nhận tình trạng thực tế: vòng bi có mòn thật không, mức độ ra sao. Thông tin này quay về làm “nhãn” để kiểm tra mô hình dự báo đúng hay sai. Đây là vòng phản hồi giúp hệ thống chính xác dần theo thời gian.
Machine learning giúp gì cho bảo trì dự đoán?
Không phải hệ thống PdM nào cũng cần trí tuệ nhân tạo. Nhiều chương trình hiệu quả chỉ dùng ngưỡng cảnh báo và đường xu hướng. Học máy phát huy tác dụng khi có nhiều thiết bị, nhiều tín hiệu và quan hệ phức tạp mà con người khó theo dõi bằng mắt. Các hướng tiếp cận phổ biến:
| Cách tiếp cận | Làm gì | Cần dữ liệu gì | Khi nào phù hợp |
|---|---|---|---|
| Ngưỡng và xu hướng | Cảnh báo khi vượt ngưỡng, ngoại suy đường xu hướng để ước tính thời điểm chạm ngưỡng | Dữ liệu đo theo thời gian, ngưỡng từ nhà sản xuất hoặc chuẩn ngành | Bước khởi đầu cho mọi chương trình |
| Phát hiện bất thường (không giám sát) | Học “trạng thái bình thường” rồi báo khi dữ liệu lệch khỏi đó | Chỉ cần dữ liệu lúc máy chạy tốt | Khi chưa có lịch sử hỏng hóc, thiết bị mới đưa vào giám sát |
| Phân loại lỗi (có giám sát) | Nhận diện loại lỗi từ mẫu tín hiệu | Dữ liệu đã gán nhãn theo từng loại lỗi | Khi có đủ ca hỏng đã được chẩn đoán đúng |
| Hồi quy RUL | Ước tính thời gian còn lại | Nhiều chuỗi dữ liệu chạy đến hỏng hoặc đến lúc thay | Thiết bị số lượng lớn, giống nhau (đội xe, dàn bơm, quạt) |
| Mô hình vật lý hoặc lai | Kết hợp hiểu biết cơ học, nhiệt học với dữ liệu đo | Thông số thiết kế, dữ liệu vận hành | Thiết bị đắt, ít ca hỏng để học |
Nếu bạn chưa quen các khái niệm học có giám sát, không giám sát hay mô hình hồi quy, bài machine learning là gì giải thích chi tiết. Lưu ý thực tế: điểm nghẽn của PdM thường không nằm ở thuật toán mà ở dữ liệu. Máy tốt thì ít hỏng, nên dữ liệu hỏng hóc để mô hình học luôn khan hiếm.
Có những kỹ thuật giám sát tình trạng nào?
Mỗi kỹ thuật đo “nhìn” thấy một nhóm dạng hỏng khác nhau. Chọn kỹ thuật phải xuất phát từ dạng hỏng cần ngăn, không phải từ thiết bị nào đang được chào bán.
| Kỹ thuật | Phát hiện tốt | Thiết bị điển hình | Hạn chế |
|---|---|---|---|
| Phân tích rung (vibration analysis) | Mất cân bằng, lệch trục, lỏng cơ khí, lỗi vòng bi, lỗi bánh răng | Động cơ, bơm, quạt, máy nén, hộp số | Cần người đọc phổ có kinh nghiệm; kém hiệu quả với máy chạy rất chậm |
| Nhiệt hồng ngoại (infrared thermography) | Tiếp điểm điện lỏng, quá tải, ma sát, cách nhiệt hỏng, tắc nghẽn | Tủ điện, máy biến áp, ổ trục, lò, đường ống | Chỉ thấy nhiệt bề mặt; phụ thuộc độ phát xạ, góc chụp, tải lúc đo |
| Siêu âm (ultrasound) | Rò khí nén, rò hơi, thiếu bôi trơn, phóng điện, lỗi vòng bi giai đoạn sớm | Hệ thống khí nén, van, bẫy hơi, ổ trục tốc độ thấp | Nhạy với nhiễu môi trường; cần kỹ thuật viên được đào tạo |
| Phân tích dầu (oil analysis) | Hạt kim loại mài mòn, nhiễm nước, nhiễm bẩn, dầu xuống cấp | Hộp số, hệ thống thuỷ lực, động cơ đốt trong, tuabin | Kết quả có độ trễ nếu gửi mẫu ra phòng thí nghiệm; lấy mẫu sai cho kết quả sai |
| Phân tích dòng điện động cơ (motor current signature analysis, MCSA) | Gãy thanh rotor, lệch khe hở không khí, một số lỗi tải phía sau động cơ | Động cơ cảm ứng, đặc biệt ở vị trí khó tiếp cận để gắn cảm biến rung | Khó diễn giải với biến tần và tải thay đổi liên tục |
| Thông số quá trình | Hiệu suất giảm, tắc lọc, mòn cánh bơm | Bơm, máy nén, nồi hơi, chiller | Bị ảnh hưởng bởi thay đổi điều kiện sản xuất |
Phân tích rung
Đây là kỹ thuật được dùng rộng rãi nhất cho máy quay. Mỗi loại lỗi để lại “dấu vân tay” riêng trên phổ rung. Mất cân bằng thường làm tăng biên độ ở tần số bằng tốc độ quay (1X). Lệch trục thường đi kèm thành phần ở 2X. Lỗi vòng bi tạo ra các tần số đặc trưng tính được từ hình học của vòng bi. Nhờ vậy, kỹ thuật viên không chỉ biết máy “rung mạnh hơn” mà còn biết vì sao.
Nhiệt hồng ngoại
Camera nhiệt cho hình ảnh phân bố nhiệt độ mà không cần chạm vào thiết bị. Kỹ thuật này đặc biệt hữu ích cho hệ thống điện: một đầu cốt bắt lỏng có điện trở tiếp xúc cao hơn, nóng hơn các pha còn lại. So sánh giữa các pha hoặc giữa các thiết bị giống nhau thường đáng tin hơn so với một con số nhiệt độ tuyệt đối.
Siêu âm
Thiết bị siêu âm thu âm thanh tần số cao ngoài ngưỡng nghe của người. Nó hữu ích để tìm rò rỉ khí nén, kiểm tra bẫy hơi và theo dõi tình trạng bôi trơn của ổ trục. Kỹ thuật viên có thể dùng siêu âm để tra mỡ “vừa đủ” thay vì theo định lượng cố định, tránh cả thiếu lẫn thừa mỡ.
Phân tích dầu
Dầu bôi trơn là “máu” của máy. Mẫu dầu cho biết hai điều: bản thân dầu còn tốt không (độ nhớt, mức oxy hoá, nhiễm nước) và máy có đang mòn không (hàm lượng sắt, đồng, nhôm… tăng bất thường). Phân tích dầu kết hợp với phân tích rung thường cho bức tranh đầy đủ về hộp số và hệ thống thuỷ lực.
Phân tích dòng điện động cơ (MCSA)
MCSA đo dòng điện cấp cho động cơ, thường từ tủ điện, rồi phân tích phổ để tìm dấu hiệu lỗi. Ưu điểm lớn là không cần tiếp cận thân máy, phù hợp với động cơ chìm, động cơ ở vị trí nguy hiểm hoặc khó trèo tới. Kỹ thuật này bổ sung, không thay thế phân tích rung.
Chuẩn ISO nào liên quan đến bảo trì dự đoán?
Bảo trì dự đoán không có một “chuẩn PdM” riêng, nhưng có bộ tiêu chuẩn về giám sát tình trạng và chẩn đoán máy do Tiểu ban kỹ thuật ISO/TC 108/SC 5 phụ trách. Hai chuẩn nền tảng nên biết:
| Tiêu chuẩn | Tên đầy đủ | Nội dung chính | Tình trạng |
|---|---|---|---|
| ISO 17359:2018 | Condition monitoring and diagnostics of machines — General guidelines | Hướng dẫn quy trình chung khi thiết lập một chương trình giám sát tình trạng cho máy, kèm tham chiếu tới các chuẩn liên quan. Áp dụng cho mọi loại máy. | Ấn bản 3, tháng 1/2018; được xem xét và xác nhận còn hiệu lực năm 2023 |
| ISO 13374-1:2003 | Condition monitoring and diagnostics of machines — Data processing, communication and presentation — Part 1: General guidelines | Hướng dẫn chung cho đặc tả phần mềm xử lý, truyền và trình bày thông tin giám sát, chẩn đoán tình trạng máy | Ban hành tháng 3/2003; được xác nhận còn hiệu lực năm 2025 |
ISO 17359: khung để lập chương trình
ISO 17359 trả lời câu hỏi “bắt đầu từ đâu”. Theo phần giới thiệu ISO công bố, chuẩn đưa ra các thủ tục chung cần cân nhắc khi thiết lập một chương trình giám sát tình trạng cho máy và chỉ ra các chuẩn liên quan cần dùng trong quá trình đó. Tinh thần chung là đi từ thiết bị và dạng hỏng đến phương pháp đo, rồi đến tiêu chí cảnh báo và hành động bảo trì. Với doanh nghiệp mới bắt đầu, đây là khung tham chiếu tốt để không nhảy thẳng vào mua cảm biến.
ISO 13374: sáu khối chức năng của phần mềm giám sát
Bộ ISO 13374 gồm nhiều phần, mô tả cách xử lý và trao đổi dữ liệu giám sát tình trạng. Điểm đáng chú ý là nó chia hệ thống thành sáu khối chức năng với đầu vào, đầu ra chung. Tổ chức MIMOSA xây dựng đặc tả mở OSA-CBM như một bản hiện thực của đặc tả chức năng ISO 13374, bổ sung cấu trúc dữ liệu và giao diện để phần mềm của nhiều nhà cung cấp ghép được với nhau.
| Khối | Tên tiếng Anh | Làm gì |
|---|---|---|
| DA | Data Acquisition | Thu thập dữ liệu từ cảm biến, chuyển sang dạng số |
| DM | Data Manipulation | Xử lý tín hiệu, tính đặc trưng (ví dụ phổ FFT, giá trị hiệu dụng) |
| SD | State Detection | So sánh với mức nền, phát hiện trạng thái bình thường hay bất thường |
| HA | Health Assessment | Đánh giá sức khoẻ hiện tại, chẩn đoán lỗi |
| PA | Prognostic Assessment | Dự báo diễn biến và thời gian sử dụng còn lại |
| AG | Advisory Generation | Đưa ra khuyến nghị hành động cho vận hành và bảo trì |
Khi đánh giá một giải pháp PdM, bạn có thể dùng sáu khối này làm danh mục kiểm tra: giải pháp làm tốt khối nào, khối nào còn trống, và đầu ra của khối AG có đi vào CMMS của bạn hay không.
Các tiêu chuẩn ISO là tài liệu có bản quyền. Bài viết chỉ tóm tắt phạm vi theo thông tin công bố của ISO. Khi cần áp dụng chính thức, ví dụ để đưa vào hợp đồng hay hồ sơ đánh giá, doanh nghiệp nên mua bản đầy đủ và kiểm tra phiên bản hiện hành.
Đo hiệu quả bảo trì dự đoán bằng KPI nào?
Không đo trước khi làm thì không chứng minh được hiệu quả sau khi làm. Hãy ghi nhận các chỉ số dưới đây cho thiết bị thí điểm ít nhất vài tháng trước khi triển khai.
| KPI | Cách tính | Ý nghĩa với PdM | Xu hướng mong muốn |
|---|---|---|---|
| MTBF (mean time between failures) | Tổng thời gian vận hành / số lần hỏng | Thời gian trung bình giữa hai lần hỏng; PdM tốt giúp giảm số lần hỏng bất ngờ | Tăng |
| MTTR (mean time to repair) | Tổng thời gian sửa chữa / số lần sửa | Sửa có kế hoạch, có sẵn phụ tùng thường nhanh hơn sửa đột xuất | Giảm |
| Tỷ lệ dừng máy ngoài kế hoạch | Giờ dừng ngoài kế hoạch / thời gian sản xuất theo kế hoạch | Chỉ số “đau” nhất với sản xuất, dễ quy ra tiền | Giảm |
| OEE (overall equipment effectiveness) | Độ sẵn sàng × Hiệu suất × Chất lượng | PdM tác động trực tiếp lên độ sẵn sàng, gián tiếp lên chất lượng | Tăng |
| Tỷ lệ công việc có kế hoạch | Giờ công bảo trì có kế hoạch / tổng giờ công bảo trì | Cho biết đội bảo trì đã thoát khỏi vòng “chữa cháy” chưa | Tăng |
| Chất lượng cảnh báo | Số cảnh báo đúng / tổng số cảnh báo; số lần hỏng không được báo trước | Đo độ tin cậy của chính hệ thống PdM | Tăng tỷ lệ đúng, giảm bỏ sót |
Ví dụ minh hoạ: một máy chạy 6.000 giờ trong năm, hỏng 4 lần, tổng thời gian sửa 48 giờ. MTBF = 6.000 / 4 = 1.500 giờ. MTTR = 48 / 4 = 12 giờ. Nếu năm sau, nhờ PdM, máy chỉ hỏng đột xuất 1 lần và 2 lần sửa có kế hoạch mỗi lần 6 giờ, bạn có số liệu cụ thể để so sánh.
OEE là chỉ số tổng hợp của cả nhà máy, không riêng bảo trì. Cách tính chi tiết và mức tham chiếu được trình bày trong bài sản xuất thông minh.
Lợi ích thực tế của bảo trì dự đoán đến đâu?
Hai nguồn được trích dẫn nhiều nhất, và các con số cần đọc đúng bối cảnh:
- Hướng dẫn O&M của US DOE (bản 3.0, 2010): ước tính chương trình PdM vận hành tốt tiết kiệm 8% đến 12% so với chỉ dùng bảo trì phòng ngừa; còn bảo trì phòng ngừa tiết kiệm 12% đến 18% so với chỉ sửa khi hỏng. Với cơ sở còn phụ thuộc nhiều vào sửa khi hỏng, mức tiết kiệm có thể vượt 30% đến 40%. Tài liệu cũng dẫn các khảo sát độc lập về mức trung bình trong công nghiệp khi triển khai PdM: lợi tức đầu tư khoảng 10 lần, giảm 25% đến 30% chi phí bảo trì, loại bỏ 70% đến 75% sự cố hỏng hóc, giảm 35% đến 45% thời gian dừng máy, tăng 20% đến 25% sản lượng.
- McKinsey (bài “Manufacturing: Analytics unleashes productivity and profitability”, 14/08/2017): bảo trì dự đoán thường giảm 30% đến 50% thời gian dừng máy và kéo dài tuổi thọ máy thêm 20% đến 40%.
Các con số trên là mức trung bình từ khảo sát và kinh nghiệm tư vấn ở nước ngoài, đã khá cũ, không phải cam kết cho mọi nhà máy. Mức lợi ích của bạn phụ thuộc vào điểm xuất phát (đang sửa khi hỏng hay đã bảo trì phòng ngừa bài bản), mức độ trọng yếu của thiết bị và việc đội bảo trì có hành động theo cảnh báo hay không. Hãy dùng chúng để đặt giả thuyết, rồi kiểm chứng bằng KPI của chính bạn.
Ngoài con số, các lợi ích hay bị bỏ qua gồm:
- An toàn: giảm sự cố hỏng nặng như vỡ trục, cháy động cơ, rò rỉ áp lực.
- Tồn kho phụ tùng: biết trước cần gì, khi nào, nên không phải trữ nhiều “phòng khi”.
- Năng lượng: máy lệch trục, thiếu bôi trơn, rò khí nén đều tiêu tốn điện năng hơn.
- Hiệu quả nhân lực: làm thêm giờ đột xuất giảm, kỹ thuật viên chuyển từ chữa cháy sang cải tiến.
Hướng dẫn của US DOE cũng nêu thẳng các nhược điểm: phải đầu tư thiết bị chẩn đoán, đầu tư đào tạo nhân sự, và mức tiết kiệm “không dễ thấy” với ban lãnh đạo. Điểm cuối cùng là lý do bạn cần đo KPI trước và sau ngay từ đầu.
Khi nào doanh nghiệp nên triển khai bảo trì dự đoán?
Hãy tự kiểm tra 6 điều kiện dưới đây. Càng nhiều câu trả lời “có”, càng nên bắt đầu.
- Có thiết bị trọng yếu: dừng máy làm ngưng cả dây chuyền, ảnh hưởng an toàn, môi trường hoặc cam kết giao hàng.
- Chi phí dừng máy đo được: bạn biết một giờ dừng mất bao nhiêu sản lượng, bao nhiêu tiền.
- Dạng hỏng có dấu hiệu báo trước: lịch sử cho thấy máy hỏng do mòn, lệch, thiếu bôi trơn, quá nhiệt, tức là có điểm P đo được.
- Tiếp cận được dữ liệu: lắp được cảm biến, đọc được dữ liệu từ PLC hoặc ít nhất đi tuyến đo định kỳ.
- Có quy trình lệnh công việc: cảnh báo có người nhận, có người quyết định, có người làm. CMMS hoặc ít nhất một quy trình giao việc rõ ràng.
- Có người chịu trách nhiệm: một kỹ sư độ tin cậy hoặc trưởng bảo trì được giao theo dõi, không để hệ thống “không ai sở hữu”.
Ngược lại, nếu đội bảo trì đang mất phần lớn thời gian chữa cháy, chưa có lịch bảo trì phòng ngừa cơ bản, chưa ghi lịch sử hỏng hóc, hãy làm những việc nền tảng đó trước. PdM không thay thế được kỷ luật bảo trì cơ bản.
Lộ trình thí điểm bảo trì dự đoán trên 1 thiết bị trọng yếu
Lộ trình dưới đây là gợi ý cho một dự án thí điểm khoảng 3 đến 6 tháng, bám theo tinh thần của ISO 17359. Thời gian thực tế tuỳ quy mô và mức sẵn sàng của dữ liệu.
- Chọn thiết bị: chấm điểm mức độ trọng yếu theo hậu quả khi hỏng (sản lượng, an toàn, chi phí sửa) và tần suất hỏng. Chọn 1 thiết bị, hoặc 1 nhóm thiết bị giống nhau, điểm cao nhất. Máy nén khí, bơm chính, quạt hút lớn, hộp số băng tải thường là ứng viên tốt.
- Đo hiện trạng (baseline): gom lịch sử hỏng hóc 1 đến 2 năm, tính MTBF, MTTR, giờ dừng ngoài kế hoạch, chi phí sửa. Không có số này thì không có thước đo thành công.
- Phân tích dạng hỏng: liệt kê các dạng hỏng chính, nguyên nhân, hậu quả (cách làm thường gọi là FMEA). Với mỗi dạng hỏng, hỏi: có dấu hiệu báo trước không, phát hiện bằng kỹ thuật nào, khoảng P-F ước chừng bao lâu.
- Chọn kỹ thuật và điểm đo: từ bước 3, chọn rung, nhiệt, dầu, dòng điện hay kết hợp. Quyết định đo định kỳ hay liên tục dựa trên khoảng P-F.
- Lắp đặt và thu dữ liệu nền: lắp cảm biến, kiểm tra chất lượng tín hiệu, ghi dữ liệu khi máy chạy tốt ở các chế độ tải khác nhau.
- Đặt ngưỡng và quy tắc cảnh báo: bắt đầu bằng ngưỡng từ khuyến nghị nhà sản xuất, chuẩn ngành và mức nền thực tế. Chỉ thêm mô hình học máy khi đã có đủ dữ liệu.
- Nối vào quy trình bảo trì: mỗi mức cảnh báo tương ứng một hành động, người chịu trách nhiệm và thời hạn. Cảnh báo phải tạo được lệnh công việc trong CMMS.
- Vận hành và ghi nhận: mỗi lần can thiệp, chụp ảnh, ghi tình trạng thực tế của chi tiết tháo ra. Đây là dữ liệu quý nhất để đánh giá độ chính xác.
- Đánh giá và quyết định mở rộng: so KPI trước và sau, tính chi phí thực tế. Nếu đạt, nhân rộng sang nhóm thiết bị tiếp theo theo thứ tự trọng yếu.
Triển khai bảo trì dự đoán cần tính những chi phí nào?
Bài viết không đưa ra con số giá cụ thể vì chi phí phụ thuộc rất lớn vào số điểm đo, loại cảm biến, hạ tầng hiện có và nhà cung cấp. Thay vào đó, đây là danh sách hạng mục để bạn yêu cầu báo giá đầy đủ, tránh bỏ sót.
| Nhóm chi phí | Gồm những gì | Hay bị bỏ sót |
|---|---|---|
| Thiết bị đo | Cảm biến rung, nhiệt, dòng điện; máy đo cầm tay; camera nhiệt; bộ lấy mẫu dầu | Phụ kiện gá lắp, cáp, pin, hiệu chuẩn định kỳ |
| Hạ tầng kết nối | Gateway, mạng không dây hoặc có dây trong xưởng, thiết bị biên | Thi công trong môi trường bụi, ẩm, nhiễu điện từ; tủ bảo vệ |
| Phần mềm và nền tảng | Nền tảng giám sát, lưu trữ dữ liệu, bản quyền phân tích | Phí thuê bao theo số điểm đo hoặc số thiết bị, tăng khi mở rộng; phí lưu trữ dữ liệu dài hạn |
| Tích hợp | Kết nối với CMMS, ERP, hệ thống SCADA hoặc MES | Công sửa đổi quy trình, phân quyền, kiểm thử |
| Con người | Đào tạo kỹ thuật viên, chuyên gia phân tích rung, kỹ sư dữ liệu | Thời gian của đội bảo trì trong giai đoạn thí điểm; chi phí giữ chân người đã được đào tạo |
| Dịch vụ thuê ngoài | Phân tích dầu tại phòng thí nghiệm, dịch vụ đo rung định kỳ, chẩn đoán từ xa | Phí theo mẫu, theo lần đo; thời gian chờ kết quả |
| An ninh mạng OT | Phân vùng mạng, kiểm soát truy cập từ xa, giám sát | Rủi ro khi mở kết nối từ mạng sản xuất ra Internet |
Khi tính hiệu quả, hãy so sánh tổng chi phí trên với chi phí tránh được: giờ dừng máy ngoài kế hoạch nhân với giá trị mỗi giờ, chi phí sửa chữa lớn khi hỏng nặng, phụ tùng thay sớm không cần thiết, làm thêm giờ đột xuất. Kết nối thiết bị sản xuất vào mạng cũng mở thêm bề mặt tấn công, vì vậy nên xem xét các nguyên tắc trong bài an ninh mạng ngay từ khi thiết kế.
Những sai lầm thường gặp khi làm bảo trì dự đoán
- Bắt đầu từ công nghệ thay vì từ dạng hỏng. Mua cảm biến rung cho mọi máy trong khi vấn đề lớn nhất là tiếp điểm điện quá nhiệt.
- Không đo hiện trạng trước khi làm. Sau một năm không ai chứng minh được hệ thống mang lại gì, ngân sách bị cắt.
- Cảnh báo không có người nhận. Dữ liệu đẹp trên màn hình nhưng không sinh lệnh công việc, không ai chịu trách nhiệm xử lý.
- Quá nhiều báo động giả. Ngưỡng đặt quá chặt, không tính đến thay đổi tải. Sau vài tuần, đội vận hành bỏ qua mọi cảnh báo, kể cả cảnh báo đúng.
- Kỳ vọng AI dự báo ngay từ đầu. Không có lịch sử hỏng hóc đã gán nhãn thì mô hình dự báo thời gian còn lại khó đáng tin. Hãy đi từ ngưỡng và xu hướng.
- Bỏ qua chất lượng dữ liệu. Cảm biến gắn sai vị trí, lỏng chân, sai đơn vị, đồng hồ thời gian lệch giữa các hệ thống.
- Triển khai quá rộng ngay từ đầu. Phủ hàng trăm thiết bị cùng lúc khiến đội nhỏ không xử lý nổi luồng cảnh báo.
- Không ghi nhận kết quả sau khi sửa. Mất vòng phản hồi, hệ thống không bao giờ chính xác hơn.
Bảo trì dự đoán nằm ở đâu trong nhà máy thông minh?
Bảo trì dự đoán là một trong những ứng dụng dễ chứng minh hiệu quả nhất của sản xuất thông minh, bên cạnh kiểm tra chất lượng bằng thị giác máy, tối ưu năng lượng và truy xuất nguồn gốc. Kiến trúc tổng thể, gồm thiết bị, kết nối, phần mềm vận hành, dữ liệu và bản sao số, được trình bày trong bài smart manufacturing là gì. Ở tầm rộng hơn, PdM là ví dụ cụ thể của việc kết hợp IoT, dữ liệu lớn và trí tuệ nhân tạo mà cuộc cách mạng công nghiệp lần thứ tư đặt ra. Với nhiều doanh nghiệp, đây là dự án thí điểm đầu tiên giúp chứng minh giá trị của dữ liệu trong nhà xưởng.
Câu hỏi thường gặp
Bảo trì dự đoán và bảo trì phòng ngừa khác nhau thế nào?
Bảo trì phòng ngừa làm theo lịch thời gian hoặc giờ chạy máy, bất kể máy đang tốt hay xấu. Bảo trì dự đoán làm khi dữ liệu đo cho thấy máy đang suy giảm và ước tính được thời điểm cần can thiệp. Hai cách này bổ sung cho nhau, không loại trừ nhau.
Bảo trì theo tình trạng (CBM) có phải là bảo trì dự đoán?
Gần giống nhưng không hoàn toàn. CBM phát cảnh báo khi chỉ số vượt ngưỡng ở hiện tại. PdM đi thêm một bước: dự báo xu hướng để ước tính còn bao lâu nữa sẽ chạm ngưỡng. Nhiều tài liệu xem PdM là dạng nâng cao của CBM.
PdM viết tắt của gì?
PdM là viết tắt của predictive maintenance, tức bảo trì dự đoán. Cách viết có chữ “d” thường giúp phân biệt với PM (preventive maintenance, bảo trì phòng ngừa).
Doanh nghiệp nhỏ có áp dụng được bảo trì dự đoán không?
Có, nếu bắt đầu đúng quy mô. Một xưởng nhỏ có thể dùng máy đo rung cầm tay và camera nhiệt đi tuyến hàng tuần cho vài thiết bị quan trọng nhất, ghi kết quả vào bảng theo dõi. Không nhất thiết phải có nền tảng IoT hay AI ngay từ đầu.
Bảo trì dự đoán có bắt buộc dùng AI không?
Không. Ngưỡng cảnh báo, đường xu hướng và chuyên gia đọc phổ rung đã là bảo trì dự đoán. AI và học máy giúp mở rộng quy mô và phát hiện các mẫu phức tạp khi số thiết bị, số tín hiệu lớn.
Máy móc cũ có làm bảo trì dự đoán được không?
Được. Phần lớn cảm biến rung, nhiệt, dòng điện có thể gắn thêm bên ngoài mà không can thiệp vào bộ điều khiển. Thực tế, máy cũ thường là ứng viên tốt vì đã có lịch sử hỏng hóc và đội bảo trì hiểu rõ các dạng hỏng của chúng.
RUL là gì?
RUL (remaining useful life) là thời gian sử dụng còn lại ước tính của thiết bị hoặc chi tiết trước khi đạt ngưỡng không chấp nhận được. RUL luôn là một khoảng ước tính kèm độ bất định.
Bao lâu thì thấy hiệu quả của bảo trì dự đoán?
Không có con số chung. Hiệu quả phụ thuộc tần suất hỏng của thiết bị thí điểm: máy hỏng vài lần mỗi năm sẽ cho thấy khác biệt nhanh hơn máy vài năm mới hỏng một lần. Vì vậy nên chọn thiết bị thí điểm có lịch sử hỏng hóc rõ ràng và theo dõi KPI liên tục.