设备预测性维护 · PHM 设备健康管理

设备预测性维护,
让每一次检修都有状态依据

融合设备运行数据、故障记录与维修知识,通过 AI预测性维护尽早发现状态变化,辅助团队安排检查、备件与检修窗口。

适配不同设备与数据条件,预测结果用于辅助运维决策。

设备健康概览

运行状态 · 示例视图

1 项待检查

监测设备

128

运行正常

116

关注设备

12

主轴振动趋势

设备 · CNC-07 / 主轴轴承

趋势升高
08:0012:0016:0020:00

建议结合润滑记录与计划停机窗口检查主轴轴承;处置结论可回填设备档案。

01

多源状态感知

从传感器、PLC/SCADA 到设备台账,统一关联设备与工况。

02

PHM 风险研判

规则、统计分析与模型组合,呈现异常证据和风险等级。

03

运维任务闭环

预警经人工确认后进入点检、工单、备件与复机复盘。

Industry challenges

设备运维的难点,不只是发现故障

从设备异常到恢复生产,往往跨越数据、判断、人员、备件和审批多个环节。单独增加监测点,不能自动形成维护能力。

01 / 生产连续性与交付风险

故障发生后才响应

关键设备突发停机,影响上下游节拍;故障定位、备件准备和人员到场都从故障发生后才开始。

02 / 维护成本与设备可用率

计划检修难匹配真实状态

统一周期容易造成过度保养,也可能错过个别设备的异常劣化;检修窗口与生产计划相互挤占。

03 / 告警噪声与重复排查

设备数据与维修过程脱节

传感器、PLC/SCADA、设备台账、报警和维修工单分散在不同系统,异常难关联到工况和历史处置。

04 / 响应效率与经验传承

经验、备件和人员难协同

诊断经验依赖个人,检修发现没有沉淀;备件库存、技师资质与工单计划往往需要人工反复协调。

Overall solution

以设备健康为主线,连接数据与维护业务

在现有工业控制和业务系统之上增加 PHM 分析与协同层,不替代 PLC/SCADA 的实时控制职责;预警先供运维研判,再按权限进入工单和资源调度。

设备感知层
传感器与仪表
PLC / SCADA
CNC、泵、电机、风机

采集振动、温度、电流、压力、流量、转速、运行状态与告警事件。

边缘接入与数据层
工业网关与协议适配
设备台账 / MES
维修与点检历史

统一设备编码、时间戳和数据质量,补充产品、工艺、负载与启停状态等上下文。

PHM 健康分析层
规则与统计基线
异常检测 / 故障诊断
健康评分 / RUL

结合设备机理和数据成熟度输出健康趋势、风险级别、异常证据与检查建议。

维护决策与协同层
EAM / CMMS 工单
库存与采购
资质、排班与审批

把确认后的预警转为分级点检或维修任务,协调备件、人员和检修窗口。

现场执行与反馈层
移动点检与维修
复机验证
设备档案 / 指标看板

回填检查、根因、维修、更换和复机结果,形成可追溯的维护闭环。

贯穿治理OT/IT 分区 · 身份权限 · 数据质量 · 审批审计
维护结果回流故障根因 · 更换记录 · 复机验证 → 更新设备档案与健康基线

Business blueprint

形成“监测—研判—决策—执行—复盘”业务闭环

蓝图同时定义系统动作和岗位责任:算法负责提供证据与建议,设备、生产和维护负责人按授权完成风险判断与现场处置。

01

监测

设备信号与运行事件进入统一设备档案,按设备层级和工况持续观察。

02

研判

规则和模型发现偏离,结合故障知识、报警码与维修历史形成风险说明。

03

决策

按设备关键度、故障影响和置信程度分级;高风险或低置信结果转人工确认。

04

执行

生成点检/维修建议,协同工单、备件、人员资质、排班与必要的审批。

05

复盘

现场回填根因、措施、用料、停机和复机验证结果,更新设备档案与分析基线。

设备与生产

设备工程师确认故障模式;生产人员提供工况、产品和停机影响。

维护与供应链

维护主管接收分级任务,结合人员资质、备件库存和检修窗口安排执行。

管理与安全

管理者审核高风险动作;IT/OT 管理员负责接入边界、权限、留痕和运行保障。

Connected AI modules

从设备健康延伸到企业服务与经营

预测性维护可作为设备数据入口,与知识、服务、分析和客户流程协同。各模块依据数据权限、设备编码和接口条件按需对接。

AI 知识库

把设备手册、点检标准、故障码和历史维修方案变成可检索的维护知识。

协同链路

预警设备与故障特征 → 检索相关依据 → 输出带来源的排查建议

AI 客服

面向设备售后与服务请求,结合产品资料和服务记录辅助受理、补齐故障信息并转交服务人员。

协同链路

客户报障与设备信息 → 知识辅助问诊 → 形成服务工单线索

AI 问数

围绕设备台账、告警和工单数据查询停机、维修、重复故障和备件等运营指标。

协同链路

结构化设备与工单数据 → 自然语言查询 → 指标与趋势分析

精益生产

结合设备健康、停机事件、产线节拍和瓶颈信息,辅助协调检修窗口与生产计划。

协同链路

设备状态与停机记录 → 关联产线计划 → 评估维护窗口和产能影响

AI 数字员工

协助汇总异常证据、生成检查清单、准备工单草稿和复盘报告,并按权限交由人员确认。

协同链路

告警与分析结果 → 任务编排与草稿 → 人工审批和执行反馈

AI CRM

关联客户、设备装机、服务合同和维保记录,帮助服务与客户团队安排保内跟进和设备服务计划。

协同链路

客户与装机档案 → 设备健康/服务事件 → 客户跟进与服务计划

AI 数字孪生

把设备实时状态、空间位置和 PHM 风险映射到虚拟设备模型,帮助运维人员查看现场上下文。

协同链路

设备遥测与健康结果 → 孪生模型映射 → 现场状态可视化与维护定位

AI 采购

把维保计划、备件库存和设备风险纳入采购需求评估,辅助准备关键备件与供应计划。

协同链路

检修计划与备件缺口 → 采购需求评估 → 供应风险与到货跟踪

AI CNC

面向 CNC 主轴、刀具和关键加工设备,结合振动、负载、循环与维修记录辅助安排点检和维护窗口。

协同链路

CNC 工况与维修记录 → 健康趋势识别 → 点检、检修与复机复核

实际协同范围以企业授权和已接入接口为准;建议先统一设备、客户与工单标识,再开放只读分析或人工确认的任务流,避免未经审批的告警直接触发控制动作。

From signals to action

把设备信号变成运维行动

从状态感知到任务复盘,打通数据、判断和现场处置。平台能力可按设备类型、数据基础与管理流程分阶段落地。

01

设备状态监测

汇总振动、温度、电流、压力与设备运行状态,建立关键设备的健康基线,持续观察趋势变化。

02

异常识别与预警

识别偏离正常工况的信号和组合征兆,按设备、产线与风险等级推送告警,减少无效噪声。

03

健康评估与寿命估计

结合运行时长、负载和历史维修记录评估部件健康状态,为检修窗口和备件计划提供参考。

04

维保任务闭环

将告警转为检查建议和维保任务,记录处置过程与结果,让经验持续回流到设备档案。

Assets & failure modes

围绕关键设备与关键部件建模

预测效果取决于设备机理、数据质量和故障样本。先选影响产线、维修成本高或存在安全风险的设备,明确要监测的部件和失效模式。

设备类型典型对象可用信号关注风险
加工与成型设备

CNC、注塑机、冲压设备、压缩机

主轴振动、负载电流、温度、循环时间

轴承磨损、刀具异常、过载、精度漂移

旋转与流体设备

电机、泵、风机、空压机

振动、温升、压力、流量、启停状态

不平衡、轴系偏移、润滑不足、堵塞泄漏

产线与公用工程

输送线、冷却系统、变压器、空调机组

运行时长、能耗、温湿度、告警与停机事件

传动异常、能效劣化、部件老化、异常停机

表中对象与信号为常见示例。实际采集项、采样频率和诊断结论需根据设备规格、现场工况及数据接入条件确定。

How diagnosis works

不止越限报警,而是解释“为什么要关注”

把工况上下文、信号变化和设备知识结合起来,输出可供工程师复核的异常证据与下一步检查方向。诊断结果是决策参考,不代替现场安全判断。

01

工况对齐

把传感器值与设备启停、产品型号、工艺阶段和负载上下文关联,避免把正常工况切换误判为故障。

02

趋势与异常检测

结合阈值、变化率、统计特征和时序模型,发现越限、漂移、波动加剧及多信号联动等异常。

03

故障研判

关联设备结构、报警码、点检标准、维修记录与知识库,整理可能原因、证据和建议检查顺序。

04

风险与寿命评估

综合异常程度、发展趋势、设备关键度与历史样本,给出风险等级;具备数据条件时再评估部件剩余寿命。

多源数据

实时测点、报警事件、工单、点检与备件记录

机理与模型

设备规则、统计特征、时序分析与故障知识

可执行输出

风险等级、异常证据、检查建议和处置记录

Algorithm selection

算法没有“万能款”,要看数据与故障阶段

规则、统计方法和机器学习可以组合使用。先解决能否稳定发现问题,再逐步提高诊断粒度;只有在有足够退化和寿命标签时,才把 RUL 作为主要目标。

方法常见技术适用问题优势局限与风险数据前提

阈值与专家规则

上下限、变化率、持续时间、报警码组合

保护边界明确、故障机理已知,或需要快速建立首批告警的设备。

上线快、逻辑直观、易解释和审计,可作为安全边界与模型告警的基础。

固定阈值难适应工况差异;单变量规则可能漏掉缓慢漂移或多信号组合异常。

设备规格、正常范围、专家经验及可靠的测点。

统计过程控制

控制图、EWMA、CUSUM、趋势与频谱特征

关注均值偏移、波动增大、渐进劣化等变化,且设备运行工况相对可分组的场景。

对小幅、持续变化较敏感;统计量和控制界限便于工程人员理解。

基线和工况分组很关键;设备切换、季节变化或分布变化会影响告警质量。

连续历史测点、稳定的时间戳,以及设备状态或负载等工况标签。

无监督异常检测

Isolation Forest、聚类、Autoencoder

故障标签少,但正常运行数据较多,希望发现未预先定义的异常组合。

不依赖大量故障标签,可从多变量关系中发现偏离已知正常模式的状态。

发现“不同”不等于定位故障;新工况、脏数据和正常模式混杂可能带来误报,需人工复核。

覆盖代表性正常工况的多变量时序数据、设备状态和数据质量标记。

监督式故障分类

随机森林、XGBoost、1D-CNN、时序分类模型

轴承、齿轮箱、泵等已有较稳定故障分类,并积累了可关联的检修标签。

可针对已知故障类型学习信号特征,输出类别或风险概率,辅助缩小排查范围。

依赖准确且有代表性的故障标签;类别不平衡、设备差异和工况变化会降低泛化能力。

同步的传感器数据、明确的故障类别、故障时间及检修确认结果。

退化建模与 RUL

退化趋势回归、生存分析、序列模型、机理退化模型

轴承、刀具、滤芯等有渐进磨损过程、需要估计剩余使用寿命的部件。

在数据与工况适用时,可将健康趋势转化为寿命区间或风险窗口,支持检修和备件计划。

需要定义失效终点并处理维修更换带来的状态重置;样本不足时寿命估计不稳定,必须呈现不确定性。

长期退化记录、运行工况、失效或更换时间、维修和部件更换记录。

建议的选型顺序

先用工程规则和统计基线建立可解释告警;故障标签较少时,评估无监督异常检测;积累可靠故障类别后,再验证监督分类;具备完整退化和更换记录后,才评估 RUL。关键设备可将机理规则、模型分数和现场确认组合,避免让单一模型直接决定停机。

算法名称仅用于说明常见方法类别。实际模型、阈值、采样频率和部署位置需经数据审查与现场验证后确定。

Use cases & value

从设备预警,落到生产与维护价值

同一算法在不同设备上的价值并不相同。要把异常识别转成点检、备件或排产动作,再用试点前后的运营数据验证。

SCENARIO 01

CNC 主轴与关键运动部件

监测与研判

信号:振动、主轴电流、温度、转速、加工负载与刀具/工艺信息。

跟踪轴承与主轴状态变化,结合工况区分切削负载变化和设备异常;对刀具磨损等场景需结合加工过程数据验证。

维护动作与价值路径

把主轴检查、精度复核和部件更换安排到合适窗口,降低突发停机及异常加工风险。

建议跟踪指标

非计划停机时长、主轴故障间隔、异常加工/报废记录。

SCENARIO 02

电机、泵与风机

监测与研判

信号:振动、电流、温升、压力、流量、启停与负载。

识别不平衡、轴承异常、过载、流量变化等征兆;结合设备结构和现场检查确认根因。

维护动作与价值路径

按设备风险和产线影响安排点检与维修,减少重复巡检和无计划抢修。

建议跟踪指标

设备 MTBF、维修工时、重复故障率、能耗/单位产出。

SCENARIO 03

空压机与冷却公用系统

监测与研判

信号:排气温度、压力、流量、加载率、启停频次、功率和告警。

分析压力与负载趋势、频繁启停和能耗异常,辅助发现泄漏、散热或部件状态问题。

维护动作与价值路径

优先保障影响多条产线的公用设备,并为保养窗口、容量调度和能耗排查提供依据。

建议跟踪指标

公用系统停机、压力稳定性、单位供气/冷量能耗、维修成本。

SCENARIO 04

输送线与连续产线

监测与研判

信号:电机电流、速度、节拍、PLC 报警、工位阻塞与停机事件。

把部件状态和上下游停机事件关联,区分单机故障、物料阻塞与工艺节拍变化。

维护动作与价值路径

按瓶颈工位和停线影响排序维修优先级,减少故障传播造成的整线等待。

建议跟踪指标

产线非计划停机、故障影响工位数、MTTR、计划维修占比。

上述为可验证的价值路径,不代表固定收益承诺。试点应预先约定统计口径、对照周期和排除因素,例如计划停机、产量变化、设备大修及工艺调整。

Maintenance loop

从数据接入到
维修经验沉淀

不要求一次性替换现有系统。先围绕关键设备和高频故障建立监测与处置流程,再逐步扩展到更多产线。

了解 AI 数字孪生
01

筛选关键设备

结合设备关键度、故障影响、维修成本和数据可得性,选择优先验证的设备与部件。

02

梳理数据条件

盘点传感器、PLC/SCADA、MES、点检记录和维修工单,确认采样频率与数据质量。

03

建立状态基线

按设备型号、工艺阶段和负载区间分析历史数据,形成可解释的正常运行参考。

04

小范围验证

与现场工程师共同复核告警、故障案例和误报漏报,逐步调整阈值与诊断策略。

05

接入日常运维

将预警分级、派单、备件和检修结果纳入现有流程,持续复盘并扩展设备范围。

Solution case walkthrough

多站点加油站设备维护闭环

方案案例

业务背景与建设目标

针对站点分散、液位传感器与潜油泵等设备巡检半径大、异常发现依赖人工、维修人员和备件协调链条长的场景,规划接入设备状态、告警、台账、维修工单和备件信息。

目标是把异常线索转为可核实、可派工、可追溯的维护流程,并在满足安全制度的前提下减少故障后的临时协调。

闭环涉及

设备监测 · 站点复核 · 维修工单 · 备件库存 · 技师资质 · 现场复机验证

01

发现异常

站点液位传感器或潜油泵运行数据出现持续偏移/异常波动,平台关联设备档案、告警和运行工况,生成待复核风险提示。

02

现场确认

站长或维护人员核对仪表读数、设备状态和安全规程;系统展示相关历史维修记录与检查清单,避免模型告警直接触发危险动作。

03

协同派工

确认需要处理后,创建带设备、故障现象和建议步骤的工单;结合备件库存、技师资质和巡检路线安排处理计划。

04

复机与复盘

现场记录检查/更换结果并验证信号恢复;同步更新设备档案、工单和备件消耗,供后续告警与维护策略复盘。

建议用于项目验收的指标

异常发现至现场确认时长
紧急维修工单占比
故障平均修复时间
设备可用率与非计划停机
备件缺货等待与紧急采购

本案例依据设备维护方案中的行业场景整理,用于说明业务蓝图,不代表已上线或验收的客户项目;目前没有可公开核验的量化成效。真实客户案例需在获得授权后补充项目周期、基线、验收口径和对照结果。

Solution value

方案价值:从生产连续性到维护成本

价值不由算法分数或告警数量单独决定,而来自更早确认、更合理地安排维护,并把检修结果持续回流。建议先建立基线,再按设备类别、班次与统计周期验证变化。

生产连续性

更早识别关键设备状态变化,为检修争取计划窗口,降低故障扩散和非计划停机风险。

验证指标:设备可用率、非计划停机时长、受影响工位数

维护资源效率

按风险和设备关键度排序任务,把人力优先投入高影响设备,减少无差别巡检与重复排查。

验证指标:抢修工单占比、维修工时、平均响应与修复时间

备件与资产成本

结合设备健康、维修计划和采购周期准备关键备件,评估预防更换与故障后维修的成本差异。

验证指标:紧急采购、缺件等待、库存占用、单台设备维护成本

知识与风险治理

把故障证据、根因、处置步骤和审批记录纳入设备档案,减少经验随人员流动而丢失。

验证指标:重复故障率、预警闭环率、记录完整率与审计覆盖

建议的试点运营指标

非计划停机

统计故障停机时长、次数及其对产线和产能的影响。

平均故障间隔 MTBF

观察设备可靠性趋势,并按设备类别和运行时长统一口径。

平均修复时间 MTTR

跟踪从故障确认到恢复运行的时间,识别诊断、备件或协同瓶颈。

预警处置闭环率

衡量预警是否被确认、派单、检查并回填结果,而不只统计告警数量。

指标口径需与企业现有设备管理制度保持一致。结果受设备状态、数据覆盖、检修策略和生产计划等因素共同影响。

ROI 核算建议

项目净收益估算 = 可归因的停机损失减少 + 可核验的维修/备件净节省 - 项目投入

核算时纳入传感器、集成、平台和持续运维成本;通过可比设备或同设备前后周期对照,并剔除产量、计划停机、设备大修和工艺变化等影响。

Pilot readiness

试点前,先把问题定义清楚

场景定义越具体,越容易判断需要哪些数据、由谁复核,以及怎样衡量改善。

01

目标设备

设备型号、关键部件、设备层级、产线位置及关键度是否明确?

02

目标故障

优先关注哪些失效模式?故障表现、影响范围和可接受的检查提前量是什么?

03

数据来源

传感器和控制器有哪些测点?数据采样、时间戳、设备编码和缺失情况如何?

04

历史证据

能否取得报警、点检、故障、维修、更换件和停机记录,并关联到具体设备?

05

处置责任

谁确认预警、执行检查、安排工单,并回填维修结论与实际故障?

FAQ

关于设备预测性维护

从已有数据开始评估,不需要把所有设备和系统一次性改造到位。

什么是设备预测性维护?也叫预测性设备维护或 AI预测性维护吗?+

是的,这些说法都指基于设备运行状态、工况和维修历史识别异常趋势,并辅助安排点检、检修和备件计划的维护方式。AI预测结果用于运维决策辅助,仍需结合现场检查和安全规程确认。

没有安装振动传感器,也能开始吗?+

可以先评估已有 PLC/SCADA、设备控制器、点检表和维修工单中的可用数据。对缺少关键状态量的设备,再按诊断目标规划补充传感器。

需要积累很多故障数据才能上线吗?+

不一定。初期可从设备台账、专家规则、报警码和状态趋势入手;有代表性的故障与维修记录后,再逐步验证监督式诊断和寿命评估。

系统会自动控制或停机吗?+

页面所述能力用于状态监测和运维决策辅助。是否联动工单、控制系统或停机策略,应由企业结合安全规范、权限和现场验证单独确定。

如何减少误报并验证效果?+

按设备与工况建立基线,结合持续时间、变化趋势和多信号证据分级告警;试点期间由运维人员标注处置结果,并定期复盘误报、漏报和告警闭环情况。

面向现场的渐进式落地

从一台关键设备开始

结合现有传感器、设备档案与维修流程,梳理适合优先验证的设备和故障场景。

移动端