设备维护发展史:从坏了再修到TPM与预测性维护
在许多工厂里,设备维护仍然是一场与故障赛跑的工作:机器停了,维修人员赶到现场;生产线催得越急,维修压力越大;设备重新启动后,大家松一口气,直到下一次故障再次发生。
这种「坏了再修」的做法并不新鲜。事实上,在人类大部分生产历史中,维护本来就是如此。只是随着工业系统越来越复杂,设备故障造成的影响从一台机器不能工作,逐渐扩大到整条生产线停顿、订单延期、安全事故和供应链中断。企业也因此不断改变对维护的理解。
设备维护的发展,大致经历了纠正性维护、预防性维护、生产维护、全面生产维护以及预测性维护等阶段。它不是一条新方法完全取代旧方法的直线,而是企业随着设备复杂程度、生产组织方式和数据能力变化,不断增加新的管理手段。
今天的工厂依然需要故障维修,也可能同时使用定期保养、状态监测、操作员自主维护和人工智能预测。真正成熟的维护管理,不是追逐最新名词,而是为不同设备选择合适的维护方式。
工业化以前:设备坏了才修
在工业革命以前,生产工具通常比较简单,许多工作依靠手工完成。工具损坏后,工匠进行修理或更换便可以继续工作。设备之间的联系不强,一件工具发生故障,一般不会让一条由数十道工序组成的生产线立即停下来。
这种方式后来被称为「纠正性维护」(Corrective Maintenance)。当故障严重、必须立即处理时,也常被称为紧急维护。它的基本逻辑很直接:只要设备还能使用,就继续运行;等到出现故障,再投入人力和零件进行修复。
在当时的生产条件下,这种做法未必不合理。机器结构简单,修理成本可能不高,顾客对交期的要求也没有现代供应链那么严格。与其提前花费时间维护每一件工具,不如在损坏后处理。
不过,也有少数企业较早认识到定期维护的价值。约在1800年前后,法国蒙哥尔费造纸厂已经安排固定时间清洁和维护工具,据记载每年约有35天用于相关工作。蒙哥尔费家族后来因为发明热气球而更为人熟悉,但其工厂的做法也说明,即使在现代维护制度形成之前,部分经营者已经注意到设备保养与稳定生产之间的关系。
工业革命:安全推动预防性检查
工业革命带来了蒸汽机、锅炉和大型机械,也改变了设备故障的后果。一件手工具损坏,可能只是延迟某位工匠的工作;高压锅炉发生爆炸,却可能造成多人伤亡和严重财产损失。
锅炉事故使人们逐渐认识到,有些故障不能等到发生以后再处理。设备必须在运行期间接受检查,及早发现腐蚀、裂纹、压力异常和结构缺陷。维护的目标开始从恢复设备功能,扩展到预防灾难性事故。
德国技术监督体系TÜV的发展便与锅炉安全有关。1865年的严重锅炉爆炸进一步推动了相关检查和监督组织的建立。这个阶段的维护重点仍然不是全面提高生产效率,而是控制高风险设备,避免人员伤亡。
这段历史揭示了一个至今仍然重要的原则:维护策略首先应考虑故障后果,而不只是故障发生概率。即使某种失效很少发生,只要一旦发生便可能造成人员伤亡、环境污染或重大损失,企业就不能仅以「发生机会很低」为理由忽略它。
大规模生产兴起:预防性维护逐渐形成
随着工厂规模扩大,工序之间的联系变得更紧密。一台关键设备停机,不再只是影响单个操作,而可能令上游物料堆积、下游人员等待,甚至使整条装配线无法继续运行。供应链变得复杂、产品种类增加后,故障造成的间接成本也越来越高。
企业因此开始思考:既然故障代价如此高,是否可以在设备损坏前进行检查、更换或调整?这就是预防性维护(Preventive Maintenance,PM)或计划维护的基本思想。
亨利·福特的工厂大量运用预防性维护的观念。1919年的福特T型车使用手册也建议车主经常检查行走系统、车轮间隙、螺栓和螺母,并在发现维修或调整需要时尽快处理。其逻辑很清楚:及时花费少量时间处理异常,可以避免未来更长的延误或道路事故。
预防性维护常以时间或使用量为基础。例如设备每运行500小时进行检查,每三个月润滑一次,每年更换某个零件。这种方法比完全被动等待故障更有计划,也更容易安排维修人员、备件和停机窗口。
但预防性维护也带来新的难题。设备可能出现的故障很多,企业不可能也没有必要预防每一种故障。如果更换周期定得过短,仍有使用价值的零件会被提前报废,维护成本和停机时间反而增加;周期定得过长,又可能来不及阻止故障。
所以,预防性维护的关键从来不只是「增加保养次数」,而是决定哪些设备需要维护、维护什么、采用什么方法、多久一次,以及应该储备哪些备件。这些问题在今天仍然是维护管理的核心。
第二次世界大战以后:维护开始系统化
第二次世界大战期间,飞机、车辆和军事装备的可靠性直接影响任务能否完成。复杂装备需要在高强度环境下维持可用状态,促使维修计划、故障分析、备件供应和可靠性管理受到更多重视。
战争结束后,维护领域出现了许多新术语和方法。纠正性维护、维护预防、生产维护、主动维护和以可靠性为中心的维护等概念陆续形成。美国航空业发展的可靠性中心维护(Reliability-Centered Maintenance,RCM),强调根据设备功能、失效模式和故障后果选择维护任务,而不是对所有部件采用同一种固定保养方式。
这些名称之间存在差异,但它们背后反映的是同一个变化:维护开始从维修部门的技术工作,发展为涉及安全、可靠性、成本、生产计划和设备生命周期的管理体系。
企业不再只问「机器坏了怎样修」,而是开始追问:「为什么会坏?」「哪些故障最值得预防?」「怎样在可靠性与成本之间取得平衡?」「能否在设备设计阶段便减少维护需要?」
其中,「维护预防」(Maintenance Prevention)与「预防性维护」很容易混淆。预防性维护是在设备投入使用后,通过检查和保养避免故障;维护预防则更强调在设备设计和采购阶段改善结构,使机器更可靠、更容易清洁、检查和维修。前者是在使用阶段管理设备,后者试图从源头降低未来维护负担。
TPM在日本形成:维护不再只是维修部门的责任
第二次世界大战以后,日本企业积极吸收欧美的工业管理方法,并结合自身生产现场不断改进。生产维护的思想也在这一时期传入日本,并于20世纪60年代后期逐渐发展为全面生产维护(Total Productive Maintenance,TPM)。
中岛清一(Seiichi Nakajima)是推动TPM形成的重要人物。他曾前往美国和欧洲学习生产维护,并与日本设备维护协会(Japan Institute for Plant Maintenance,JIPM)共同发展相关体系。
TPM带来的重要变化,不是为传统维修工作换一个名称,而是重新划分设备管理责任。在过去,操作人员负责生产,维修人员负责修理,两者界限分明。操作人员可能只关心产量,设备出现异常便交给维修部门;维修人员则长期处于救火状态,没有足够时间处理反复发生的根本问题。
TPM强调「自己的设备由自己爱护」。操作人员需要参与清洁、润滑、紧固、点检和早期异常发现,专业维修人员则把精力放在计划维护、技术诊断、复杂修理和可靠性改善上。
这种做法后来被称为自主维护。它并不是把专业维修工作全部转移给操作员,更不是为了减少维修人员,而是利用操作员每天接触设备的优势,让漏油、异响、振动、松动、温升和磨损等异常更早暴露。
一台设备通常不会毫无征兆地突然失效。许多严重故障在发生前已经出现轻微异常,只是现场没有看见、没有记录,或看见后没有及时处理。TPM通过清洁、点检、目视管理和标准化,把这些异常转化为可以采取行动的信息。
从「修机器」转向追求设备综合效率
TPM中的「Total」包含更广泛的管理含义。它关注设备整个生命周期,强调生产、维修、工程、质量和管理人员共同参与,并追求减少影响设备效率的各种损失。
设备能够启动,并不代表设备正在有效生产。机器可能因为故障停机,也可能因换模和调整损失时间;运行过程中可能速度低于设计水平,还可能生产出返工品和废品。只看「有没有开机」,会忽略许多隐藏损失。
因此,TPM常与设备综合效率(Overall Equipment Effectiveness,OEE)结合。OEE从开动率、性能效率和质量率三个方面观察设备实际创造合格产出的能力。它把故障、换模、短暂停机、速度降低和质量损失放在同一个框架中,让改善团队看见设备损失究竟发生在哪里。
TPM也把维护与持续改善连接起来。反复发生的故障不能只靠一次次修理,应通过根本原因分析、设备改造、作业标准调整和人员训练消除。维修记录也不应该只证明完成过哪些工作,而应帮助企业判断故障模式、重复问题和改善优先次序。
维护工作的结构化发展
尽管TPM在20世纪60年代末已经形成,很多企业的维护工作在较长时期内仍以故障后抢修为主。大约从1960年至1980年,维护管理才在更多组织中逐渐变得正规和系统化,相关标准、岗位、计划和认证也不断增加。
这一阶段,企业开始建立设备台账、维护周期、工作单、备件清单和故障记录。维修工作可以提前排入生产计划,维护成本也开始被统计和分析。随着计算机化维护管理系统出现,企业能够更系统地管理工单、设备履历、维修时间和备件库存。
制度化带来了稳定性,但也可能产生新的形式主义。有些企业拥有完整的维护计划和大量表格,却没有根据设备风险和实际状态调整任务;维护人员按周期完成检查,反复故障仍未得到解决;OEE被用于比较和问责,却没有帮助团队找到损失原因。
维护管理的成熟程度,不能只看制度数量,而要看它是否减少故障、降低风险、缩短维修时间,并支持稳定交付。
预测性维护:在故障发生前判断设备状态
随着传感器、工业网络、数据储存和分析技术发展,预测性维护(Predictive Maintenance,PdM)逐渐受到重视。其目标是在设备发生功能故障之前,通过状态数据识别劣化趋势,选择更合适的维修时间。
常见方法包括振动分析、温度监测、润滑油分析、超声波检测、电流分析和热成像。例如,轴承磨损可能引起特定频率的振动变化;电气连接松动可能产生异常温升;润滑油中的金属颗粒可能反映内部部件正在磨损。
与固定周期更换相比,状态监测能减少过早维护,也有机会在故障前发出警示。工业4.0进一步推动企业收集大量设备数据,并运用算法和人工智能寻找复杂模式,希望预测剩余使用寿命或故障概率。
不过,安装传感器并不等于建立了预测性维护。数据必须准确、稳定并与具体失效模式相关;企业还需要知道警报出现后由谁判断、何时停机、准备什么零件以及怎样安排生产。如果缺少行动机制,再精密的监测也只会产生更多无人处理的数据。
预测模型也不可能准确预报所有故障。随机发生的电子元件失效、外来撞击、操作错误或没有明显劣化过程的故障,未必能靠趋势分析提前发现。预测性维护是维护策略的一部分,并不是消除所有故障的万能技术。
各类维护方式并不是互相取代
从历史名称看,人们容易产生一种印象:纠正性维护已经过时,所有设备都应该实施预防性、预测性或TPM维护。真实情况并非如此。
对于价格低廉、容易更换、故障后果很小,而且没有明显预警征兆的部件,坏了再换可能是最经济的策略。为一只普通照明灯安装复杂传感器并预测剩余寿命,通常没有必要。
对于涉及人身安全、环保风险或重大停线损失的设备,企业则需要更严格的检查、预防和状态监测。某些具有明确磨损周期的部件适合定期更换;能够通过振动、温度或油液状态观察劣化的设备,则可能适合预测性维护。
TPM也不是一个单独的维修周期,而是建立全员参与、损失识别和持续改善机制的管理体系。企业完全可以在TPM框架下,对不同设备分别采用故障后维修、定期维护或状态维护。
选择策略时,应综合考虑设备关键程度、故障后果、故障发生规律、检测能力、维护成本、备件交期和生产安排。维护方式越先进,不代表经营效果一定越好;与设备风险不相称的维护,同样是一种浪费。
企业应该怎样建立更成熟的维护体系?
优思学院认为,维护改善不宜从采购昂贵系统或安装大量传感器开始,而应先掌握设备现状。企业需要知道哪些设备真正影响安全、质量和交付,过去发生过哪些故障,每次停机多长时间,故障是否重复,以及维修过程中最常等待什么。
接着,可以根据设备关键程度建立分级管理。关键设备需要明确的预防维护、备件保障和应急方案;一般设备可以采用较简单的计划维护;低风险、容易替换的部件则可能保留故障后更换策略。
现场基础也很重要。设备长期存在脏污、漏油、松动、缺少润滑和标识不清时,直接引入人工智能预测并不能解决基本问题。清洁、点检、润滑标准、异常标签、故障记录和快速反馈,往往是更具成本效益的起点。
维护部门与生产部门还需要共同管理停机损失。生产人员不能为了短期产量不断推迟必要保养,维修人员也不能只根据技术方便安排停机。双方应根据订单、风险和设备状态决定维护窗口,并以整体交付结果而非部门指标判断成效。
当基本数据可靠、工作流程稳定后,企业再逐步引入状态监测和预测模型,成功机会会更高。数字化应该建立在良好管理基础上,用于加快发现和判断,而不是代替现场管理。
结语:维护的目标不是让维修部门更忙
从工业化以前的「坏了再修」,到工业革命时期的安全检查,再到预防性维护、TPM和预测性维护,设备维护的发展反映了生产系统不断复杂化的过程。
机器越昂贵,工序联系越紧密,顾客对交期要求越高,企业就越不能把设备故障当成维修部门临时处理的小事。维护逐渐成为安全管理、生产计划、质量保证、成本控制和持续改善共同组成的系统工作。
TPM的重要贡献,是让企业认识到设备稳定不能单靠少数维修专家。操作人员需要发现日常异常,维修人员需要提升专业诊断能力,工程人员需要改善设备设计,管理层则要为必要的维护时间和资源作出取舍。
预测性维护为企业提供了新的工具,但维护管理的基本问题没有改变:哪些故障值得预防?如何发现异常?什么时候采取行动?怎样用合理成本保持设备所需功能?
维护体系是否先进,不应以术语多少、传感器数量或软件价格判断。真正有价值的结果,是设备更安全、故障更少、维修更快、质量更稳定,生产能够按顾客需要持续交付。