Blog

2026.08.26

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày

Bảo trì theo tình trạng (CBM) không tự giảm thời gian dừng máy chỉ vì nhà máy đã lắp cảm biến và có dashboard. Nếu cảnh báo không trở thành công việc bảo trì có người chịu trách nhiệm, dự án chỉ tạo thêm dữ liệu. Nếu ngưỡng quá nhạy, đội ngũ sẽ bỏ qua cảnh báo. Bài viết này kết nối mức độ quan trọng của tài sản, failure mode, baseline, ngưỡng động, work order, an ninh OT, FAT/SAT và PoC 90 ngày thành một quy trình quyết định có thể kiểm chứng cho nhà máy tại Thái Lan.

CBM là một vòng vận hành khép kín, không chỉ là dự án đo lường

ISO 17359:2018 đưa ra các thủ tục chung để thiết lập chương trình giám sát tình trạng. Trang ISO cho biết phiên bản này đã được rà soát và xác nhận vào năm 2023, hiện vẫn còn hiệu lực. Đây không phải bảng ngưỡng cho một loại cảm biến. Vì vậy, thứ cần mua không phải chỉ là “12 cảm biến”, mà là một chương trình phát hiện failure mode phù hợp, hỗ trợ quyết định, tạo công việc an toàn và chứng minh thiết bị đã trở lại trạng thái chấp nhận được.

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày - figure 1
Công đoạnĐầu vào bắt buộcBằng chứng đầu raVai trò chịu trách nhiệm
Chọn đối tượngDanh mục, lịch sử dừng, criticalityDanh sách chọn/loại và lý doSản xuất, bảo trì
Thiết kếFMEA, hồ sơ sửa, bản vẽBản đồ failure mode–signalKỹ thuật, độ tin cậy
ĐoVị trí, đơn vị, chu kỳ, trạng tháiChuỗi dữ liệu đã kiểm chất lượngOT, nhà cung cấp
Chẩn đoánBaseline, ngưỡng, quy tắc giảm lặpCảnh báo có lý doNgười chẩn đoán
Hành độngƯu tiên, thời hạn, điều kiện an toànWork order và ownerĐiều phối bảo trì
Đóng việcNội dung sửa, đo lại, nguyên nhânBằng chứng phục hồi và bài họcQuản lý bảo trì

Mục tiêu nghiệm thu PoC là bằng chứng vòng này chạy được. Một màn hình đẹp nhưng công việc không được đóng chưa phải là chuyển đổi số bảo trì.

Tách criticality khỏi khả năng phát hiện failure mode

Criticality cho biết hậu quả khi thiết bị hỏng; detectability cho biết tín hiệu đã chọn có tiền dấu vật lý hay không. Một máy rất quan trọng nhưng thường dừng do PLC, kẹt vật liệu hoặc thao tác có thể không nhận nhiều giá trị từ rung động đơn lẻ.

NhómHậu quảKhả năng phát hiệnXử lý trong PoC
ACaoCaoƯu tiên; nối với phụ tùng và lịch sử việc
BCaoThấp/chưa biếtPhân tích cơ chế hỏng trước
CTrung bìnhCaoTốt cho học và chỉnh ngưỡng
DThấpThấpLoại, duy trì kiểm tra định kỳ

Điểm số nên gồm an toàn, chất lượng, môi trường, giao hàng, máy dự phòng, thời gian sửa và thời gian mua phụ tùng tại Thái Lan. Sau đó nối mỗi failure mode với tiền dấu và hành động.

Failure modeTiền dấu kỳ vọngDữ liệu ngữ cảnhHành độngGiới hạn
Mất cân bằngThành phần tần số quay tăngTốc độ, tảiVệ sinh/cân bằngTải làm biên độ thay đổi
Lệch trụcRung dọc trục và harmonic đổiKhớp nối, nhiệt độKiểm tra alignmentCộng hưởng có thể giống nhau
LỏngHarmonic và waveform biến dạngBệ, lịch sử siếtKiểm tra bu-lông/bệGắn cảm biến kém có biểu hiện tương tự
Hỏng ổ lănXung cao tần, envelopeTốc độ, loại vòng biKiểm tra bôi trơn/lập kế hoạch thayPhụ thuộc bandwidth và cách gắn
Quá nhiệtXu hướng nhiệt tăngNhiệt môi trường, tảiKiểm tra làm mát/bôi trơnNhiệt độ không tự chỉ ra nguyên nhân
Điện/điều khiểnDòng điện và event logPLC/VFDChẩn đoán điệnRung có thể không thấy

ISO 13379-1:2025 đề cập khái niệm chung, đặc tính kỹ thuật và hướng dẫn chọn phương pháp chẩn đoán; không bắt buộc một mô hình AI. Hãy hỏi nhà cung cấp failure nào nằm trong/ngoài phạm vi, input và giả định vận hành là gì, kết quả được giải thích thế nào.

Xây baseline theo trạng thái vận hành, không theo số ngày “kỳ diệu”

Kế hoạch minh họa dành 28 ngày cho baseline đầu tiên. Đây là giả định kế hoạch, không phải thời gian tối thiểu của ISO. Một tháng chỉ có một mức tải vẫn có thể không đủ. Cần tách khởi động, chạy ổn định, tải cao/thấp, đổi sản phẩm, vệ sinh và idle. Máy variable-speed phải so sánh trong cùng dải tốc độ; bơm cần flow hoặc vị trí van, máy nén cần phân biệt load/unload.

Kiểm soát baselineĐiều kiện chấp nhậnVí dụ không đạtKhắc phục
Dữ liệu thiếuTrong giới hạn thỏa thuậnNội suy im lặng khi gateway mấtSửa truyền thông và đồng bộ giờ
Trạng tháiPhân loại các trạng thái chínhTrộn startup với steady stateTách mô hình theo trạng thái
Gắn cảm biếnGhi hướng, điểm, kiểu cố địnhGắn lên vỏ cheDi chuyển và thu lại
Đơn vị/thang đoNguồn và màn hình nhất quánNhầm g với mm/sKiểm tra chuyển đổi/hiệu chuẩn
Mốc khỏeBảo trì xác nhận thời đoạn khỏeHọc máy đang xuống cấp là bình thườngTạo lại sau sửa
Thời gianPLC, gateway, CMMS khớpLệch múi giờChuẩn hóa NTP và hiển thị

ISO 20816-3:2022 đánh giá rung cho máy công nghiệp trong phạm vi nêu rõ: công suất trên 15 kW và tốc độ 120–30.000 r/min. Không được sao chép các giá trị đó sang động cơ nhỏ, máy tốc độ thấp, trạng thái chuyển tiếp hay máy ngoài phạm vi. Cần phối hợp tiêu chuẩn phù hợp, hướng dẫn nhà sản xuất và baseline riêng. Xem thêm hướng dẫn chẩn đoán thiết bị bằng cảm biến rung.

Biến ngưỡng động và kiểm soát cảnh báo giả thành tiêu chí nghiệm thu

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày - figure 2

Ngưỡng động phải so sánh các trạng thái tương đương: cùng tốc độ, tải, sản phẩm hoặc mode. Câu “AI tự điều chỉnh” chưa thể nghiệm thu. Phải nêu cửa sổ học, thời đoạn loại trừ, tần suất cập nhật, hard limit, phê duyệt con người, phiên bản mô hình và rollback.

Nên có ít nhất hai mức. Warning bắt đầu xác minh; alarm thay đổi kế hoạch bảo trì hay quyết định vận hành. Kết hợp số mẫu liên tiếp, thời gian duy trì, nhiều tín hiệu và trạng thái. Không nối trực tiếp analytics alarm với emergency stop nếu chưa có thiết kế an toàn riêng.

Chỉ sốĐịnh nghĩaMục tiêu PoC minh họaLưu ý
True positiveCảnh báo đúng tình trạng cần xử lýÍt sự cố có thể không đủ tính tỷ lệChỉ fault injection khi an toàn
False alertKiểm tra xong không cần hành động≤0,25/máy/tuầnVí dụ, không phải benchmark
MissSau đó thấy tiền dấu nhưng không báoHướng tới 0 critical missGhi mẫu số và thời gian quan sát
Thời gian xác nhậnAlert đến lúc owner xemTrong 4 giờ làm việcĐiều chỉnh theo ca
Chuyển thành việcAlert hợp lệ có quyết định theo dõi100% được ghiGhi lý do nếu không cần việc
Đóng việcĐo lại sau sửa≥90% đúng hạnPhân loại việc trễ

Các con số trên chỉ là mục tiêu kế hoạch, không phải trung bình ngành. Phân loại từng alert: xuống cấp thật, thay đổi vận hành, lỗi cảm biến/truyền thông, việc đã biết, hoặc bằng chứng chưa đủ. Mọi thay đổi ngưỡng cần có owner, lý do, giá trị trước/sau, thiết bị bị ảnh hưởng, phê duyệt và ngày hiệu lực.

Chuyển cảnh báo thành work order và đóng sau khi đo lại

Cảnh báo nên có tên máy, điểm đo, đơn vị, trạng thái, chênh lệch baseline, tốc độ thay đổi, failure mode nghi ngờ, bước xác minh, ưu tiên, hạn và biểu đồ. Khi độ tin cậy thấp, hãy đề xuất đo cầm tay hoặc kiểm tra bôi trơn, không ra lệnh thay ngay.

Trạng tháiOwnerHồ sơ bắt buộcĐiều kiện chuyển
MớiMonitorThời gian, máy, bằng chứngKiểm tra trùng/việc đã kế hoạch
Đang xemChẩn đoánWaveform, trạng thái, hiện trườngQuyết định hành động
Đã lập kế hoạchPlannerViệc, phụ tùng, dừng máy, safetyPhê duyệt và sẵn sàng
Đã làmKỹ thuật viênChi tiết, ảnh, kết quả đoCó thể đo lại
Đã xác minhChẩn đoánGiá trị trước/sau, tồn tạiPhục hồi hoặc làm lại
Đã đóngQuản lýNguyên nhân, bài học, cập nhật danh mụcBằng chứng đủ

Giữ cùng alert ID trong CMMS/ERP. PoC có thể bắt đầu bằng CSV có kiểm soát. Sửa xong chưa phải đóng: phải đo lại trong điều kiện so sánh được và xác nhận trở về baseline. Dữ liệu trước/sau là labeled data rất giá trị. Xem thêm so sánh bảo trì dự đoán và bảo trì phòng ngừa.

Thiết kế an ninh OT bằng phân đoạn, quyền tối thiểu và phục hồi

NIST SP 800-82 Rev. 3 bàn về an ninh OT đồng thời ghi nhận các ràng buộc hiệu năng, độ tin cậy và an toàn. Phân đoạn sensor/gateway, server giám sát và kết nối IT/cloud; chỉ cho phép luồng cần thiết. Tài khoản nhà cung cấp phải định danh cá nhân, quyền tối thiểu và hết hạn. Hỗ trợ từ xa cần yêu cầu, phê duyệt, giới hạn thời gian, log và vô hiệu hóa sau phiên.

Kiểm soátFATSATBằng chứng vận hành
Danh mục tài sảnModel, version, ownerKhớp thực tếLịch sử thay đổi
Luồng mạngPort và hướngTest allow/denyReview firewall
Tài khoảnQuyền và ngày hết hạnLogin/disableRà soát định kỳ
Thời gianThiết kế NTPPLC/GW/cloud khớpTheo dõi drift
BackupPhạm vi, lịch, bảo vệTạo thành côngHồ sơ kiểm thử
RestoreQuy trình và ownerPhục hồi cấu hình mẫuDiễn tập phục hồi

NIST SP 1339 được công bố tháng 6/2026, yêu cầu backup được tích hợp với change management, tạo và kiểm thử thường xuyên, đồng thời rà soát trong diễn tập phục hồi. Với CBM, phạm vi gồm cấu hình gateway, sensor mapping, ngưỡng, phiên bản mô hình, dashboard, interface và lịch sử việc. Có file chưa chứng minh phục hồi được; hãy restore và đối chiếu tag, đơn vị, ngưỡng và thời gian.

FAT/SAT phải kiểm chức năng, dữ liệu, workflow và recovery

FAT dùng input mô phỏng trước khi lắp tại hiện trường. SAT dùng cảm biến, mạng, trạng thái và người dùng thật. “Dashboard mở được” là chưa đủ.

Lĩnh vựcVí dụ FATVí dụ SATBằng chứng
Chức năngInput, đơn vị, warning/alarmTín hiệu và notification thậtTest case, screen, log
Chất lượng dữ liệuMissing/range/time faultNgắt/kết nối lạiBáo cáo tỷ lệ thiếu
Chẩn đoánWaveform và state mô phỏngGiá trị khỏe/sự kiện đã biếtSo sánh kỳ vọng/thực tế
WorkflowAlert, approval, job IDMột vòng ngoài hiện trườngWork order và closure
SecurityDeny và auditFirewall/remote sessionAccess record
RecoveryTạo backupRestore cấu hình mẫuThời gian và đối chiếu
Tài liệu/đào tạoProcedure, registerBài thực hành người dùngVersion và hồ sơ học

Viết expected result trước test: ở state A, khi signal X thỏa Y trong Z mẫu thì gửi warning cho role P, chặn trùng N phút và lưu audit. Mất dữ liệu nghiêm trọng, quyền quá mức, restore thất bại hoặc workflow không đóng được phải giữ trạng thái chưa nghiệm thu.

PoC 90 ngày với ba cổng quyết định

Bảo trì theo tình trạng (CBM) 2026: Bản thiết kế nghiệm thu 90 ngày - figure 3

90 ngày là thời gian minh họa, không phải chuẩn thị trường hay bảo đảm. Sự cố thật có thể ít nên phải đánh giá cả data quality, replay sự kiện đã biết, tải alert, đóng việc, recovery và năng lực người dùng.

Thời gianViệc chínhCâu hỏi tại gateĐầu ra
Ngày 1–15Danh mục, criticality, lịch sử, FMEA, khảo sát mạngFailure mục tiêu đo được không?12 tài sản và failure-signal map
Ngày 16–30FAT, lắp đặt, SAT, kiểm security và notificationLắp an toàn và tạo dữ liệu đáng tin không?FAT/SAT, bản vẽ, flow matrix
Ngày 31–45Thu baseline theo trạng thái, phần 1Nhận diện được các trạng thái chính không?Báo cáo chất lượng đầu, state tag, loại trừ
Ngày 46–60Hoàn tất và phê duyệt baseline 28 ngày“Bình thường” có thể so sánh và phê duyệt không?Baseline 28 ngày đã duyệt, warning đầu
Ngày 61–75Review false alert, việc, thay đổiĐội ngũ xử lý nổi không?Change log và closure
Ngày 76–90Recovery drill, kiểm kỹ năng, reviewScale, modify hay stop?Nghiệm thu và kế hoạch tiếp

Đến ngày 30 phải hoàn tất FAT, lắp đặt và SAT. Nếu dữ liệu thiếu, thời gian, đơn vị hoặc notification chưa đạt, không bắt đầu thu baseline vào ngày 31. Cửa sổ minh họa 28 ngày chạy từ ngày 31 đến 58; ngày 59–60 dành cho rà soát và phê duyệt state tag, khoảng loại trừ và chất lượng. Scale khi vòng chạy được, rủi ro lớn đã đóng và tài sản tiếp theo có failure mode đã kiểm chứng. Modify khi giả thuyết giá trị còn nhưng cần sửa data, state tag hoặc workflow. Stop khi failure chính không hiện trong tín hiệu, công việc không đóng, hay security/recovery không đạt. Một quyết định dừng có bằng chứng vẫn là kết quả PoC tốt.

Dùng kinh tế minh họa một cách thận trọng

Đây là kịch bản kế hoạch minh họa 12 tài sản, không phải giá thị trường, kết quả khách hàng hay cam kết.

Chi phíGiả định (THB)Phép tính
Sensor, gateway, software420.000Ngân sách giả định
Integration, training, FAT/SAT280.000Khối lượng giả định
Dự phòng105.000(420.000 + 280.000) × 15%
Review nội bộ93.6006 giờ/tuần × 13 × 1.200
Tổng 90 ngày898.600Tổng các khoản trên

Nếu tránh 2 sự kiện, mỗi sự kiện 5 giờ với tác động giả định 70.000 THB/giờ, tổn thất tránh được là 2 × 5 × 70.000 = 700.000 THB. Nếu bỏ được 12 lần thay định kỳ không cần thiết, mỗi lần 12.000 THB, thêm 144.000 THB. Lợi ích gộp minh họa là 844.000 THB; 844.000 − 898.600 = âm 54.600 THB tại ngày 90. Không nên ép ROI thành dương. PoC còn mua bằng chứng về khả năng phát hiện, tải alert, closure và recovery.

Tiêu chí quyết địnhMở rộngĐiều chỉnh và tiếp tụcDừng hoặc dùng cách khác
Phù hợp failure modeFailure chính có tiền dấu quan sát đượcCần bổ sung tín hiệu cho một phần phạm viFailure chính nằm ngoài hiện tượng đang đo
Chất lượng dữ liệuỔn định và tái lập đượcSửa truyền thông hoặc state tagKhông thể duy trì độ tin cậy khi vận hành
Tải công việc của đội ngũXử lý alert trong SLA đã thống nhấtThiết kế lại suppression hoặc ownerCông việc thường xuyên quá hạn
Security và recoveryĐạt yêu cầuCòn corrective action giới hạnRủi ro trọng yếu chưa được giải quyết
Kinh tếVẫn hợp lý khi thay giả địnhKéo dài quan sát trước cam kếtCó phương án khác tốt hơn rõ ràng

Thông cáo chính thức BOI/OSOS nửa đầu năm 2026 ghi nhận khoảng 13,1 tỷ THB hồ sơ máy móc, tự động hóa và robot trong 82 dự án, cùng 132 hồ sơ Smart and Sustainable Industry trị giá khoảng 17,2 tỷ THB. Đây chỉ là bối cảnh đầu tư. Điều kiện và phê duyệt tùy từng dự án; phải xác nhận riêng và không đưa ưu đãi vào ngân sách trước khi được duyệt.

10 câu hỏi dành cho nhà cung cấp CBM

  1. Failure mode nào nằm trong và ngoài phạm vi hệ thống?
  2. Các giả định về tín hiệu, vị trí gắn, sampling và trạng thái vận hành là gì?
  3. ISO 20816-3 áp dụng chính xác cho thiết bị và phạm vi nào?
  4. Quy tắc baseline, khoảng loại trừ và học lại là gì?
  5. Ai phê duyệt thay đổi dynamic threshold và có rollback phiên bản không?
  6. False alert, miss và trường hợp thiếu bằng chứng được phân loại, báo cáo thế nào?
  7. Alert được theo dõi đến work order đã đóng và phép đo sau sửa thế nào?
  8. OT zone, data flow, remote access và thời gian lưu log được thiết kế ra sao?
  9. Nội dung nào được backup và restore trong FAT/SAT?
  10. Bằng chứng nào quyết định mở rộng, điều chỉnh hoặc dừng sau 90 ngày?

Câu hỏi thường gặp

CBM có giống predictive maintenance không?

Không hoàn toàn. CBM dùng tình trạng quan sát để kích hoạt bảo trì; predictive có thể dự báo trạng thái tương lai hoặc remaining life. CBM vẫn có giá trị nếu quyết định và việc được đóng có kiểm soát.

Maintenance DX có nên bắt đầu bằng cảm biến?

Nên bắt đầu từ lịch sử sự cố, criticality, failure mode và workflow, rồi mới chọn tín hiệu và vị trí gắn.

Có thể chỉ dùng ISO để đặt ngưỡng rung động cơ không?

Không. ISO 20816-3 hữu ích trong phạm vi của nó. Cần phối hợp vị trí đo, trạng thái vận hành, thông tin nhà sản xuất và baseline riêng.

Bao nhiêu false alert là chấp nhận được?

Không có một con số chung. Đặt mục tiêu PoC theo criticality, ca làm và năng lực review; phân tích nguyên nhân thay vì chỉ tắt cảnh báo.

PoC không có sự cố thật có phải thất bại không?

Không nhất thiết. Vẫn có thể kiểm data quality, known event, workflow, restore và kỹ năng. Nhưng không được tuyên bố detection rate hay savings chưa quan sát.

CBM có tự động được ưu đãi BOI không?

Không. Dữ liệu BOI chỉ là bối cảnh; eligibility và approval phải xác nhận riêng cho từng dự án.

Kết luận

CBM thành công khi nối criticality và vật lý hư hỏng với baseline theo trạng thái, ngưỡng có change control, cảnh báo có hành động, xác minh sau sửa, phân đoạn OT và recovery đã kiểm thử. FAT/SAT và PoC 90 ngày phải tạo bằng chứng cho cả ba lựa chọn hợp lệ: mở rộng, điều chỉnh hoặc dừng.

TOMAS TECH có thể hỗ trợ nhà máy tại Thái Lan và ASEAN chọn tài sản, lập failure-signal map, thiết kế FAT/SAT và tiêu chí nghiệm thu 90 ngày trước khi chốt sản phẩm. Có thể gửi lịch sử dừng máy và ràng buộc mạng quatrang liên hệ.

Tài liệu tham khảo