В статье говорится, что главная проблема надёжности состоит не в самом факте отказа, а в повторяющемся исправлении его симптомов без устранения дефекта. В качестве иллюстрации автор приводит горизонтальный центробежный насос, по которому за 11 месяцев было оформлено четыре корректирующих заказа на замену подшипников. Бригада сократила среднее время восстановления с 22 до 16 часов, и руководитель завода считал это успехом. Однако автор расценивает ситуацию иначе: спецификация подшипников и детали были правильными, персонал знал порядок работ, но никто не измерял соосность валов, не проверял интервал смазки относительно фактических скорости и температуры работы и не фиксировал режим отказа достаточно подробно. Поэтому не было замечено, что подшипники выходили из строя в одном месте, одним способом и с периодичностью, указывающей на механический фактор воздействия.

Материал подчёркивает, что это типичная картина оценок надёжности: предприятие создаёт работоспособную систему управления отказами, не задаваясь вопросом, должны ли эти отказы продолжаться. Исследование Nowlan and Heap 1978 года, выполненное для U.S. Department of Defense на данных по обслуживанию коммерческой авиации, приводится как базовый вывод: 89% отказов компонентов не имеют статистической связи с возрастом. То есть такие отказы не определяются календарным сроком или наработкой так, как предполагает традиционное обслуживание по времени; их вызывают условия — качество монтажа, рабочая среда, практика смазки и точность либо неточность предыдущего вмешательства. На этом фоне многие заводы выполняют корректирующее обслуживание для неидентифицированных режимов отказа и оборудования, формально не оценённого по риску отказа: ремонт сделан, а первопричина не изменилась, поэтому отказ возвращается.

В публикации также приведены два показателя масштаба проблемы: 3 215 руководителей предприятий, опрошенных ABB в 2023 году, сообщили о средней стоимости незапланированного простоя $125K/hr; кроме того, 80% трудозатрат на корректирующие работы год за годом приходится менее чем на 5% активов. По мнению автора, эта концентрация не является невезением: она указывает на дефекты, которые так и не были устранены.

Для объяснения организационного механизма автор обращается к понятию «нормализация отклонений», введённому социологом Diane Vaughan. Небольшие отступления от установленной практики начинают восприниматься как нормальные, если сразу не приводят к катастрофическим последствиям. Например, техник пропускает проверку соосности, поскольку «раньше проблем не было»; при повторении такого подхода всей бригадой в течение месяцев это становится фактическим стандартом. Последующий отказ тогда не оказывается неожиданностью, а становится предсказуемым результатом практики, отошедшей от инженерной основы. Вопрос, таким образом, не в том, отказывает ли оборудование, а в том, меняет ли корректирующая работа что-либо в причине отказа.

Статья разделяет корректирующие действия на два типа. Устранение симптома возвращает актив в работу, закрывает заказ-наряд и улучшает среднее время восстановления. Но если не устранена первопричина — например, неверная спецификация смазочного материала, неточный зазор при сборке или непроверенная соосность, создающая аномальную нагрузку на подшипник, — актив предсказуемо вернётся в очередь работ. Устранение режима отказа, напротив, ликвидирует дефект: необходимо выяснить причину, документировать вывод и изменить процедуру, спецификацию, требование к обучению либо стандарт детали. Тогда соответствующий заказ-наряд не возвращается.

Сравнение подходов в материале построено вокруг разных критериев успеха. При коррекции симптома цель — «отремонтировать и вернуть в эксплуатацию», а мерой служит скорость восстановления; заказ закрывается после перезапуска актива, первопричина предполагается или игнорируется, тот же отказ повторяется через 6–18 месяцев, а бэклог обслуживания со временем растёт. При устранении дефекта задача — предотвратить повторение, измерять снижение повторных отказов и закрывать заказ только после документирования первопричины. Механизм отказа выводится из системы, а бэклог имеет тенденцию к снижению. Авторы указывают, что различие определяется прежде всего не техническим мастерством, а организационными ожиданиями и метриками: команда рационально оптимизирует скорость, если от неё требуют скорости, и устранение, если оценивают частоту повторений и закрытие первопричин.

Для смены культуры с исправления симптомов на устранение дефектов публикация предлагает шесть взаимосвязанных дисциплин. Первая — видимость дефектов. На многих площадках существует невидимый бэклог: операторы замечают состояния оборудования, руководители их обходят, но никто формально не фиксирует. Даже базовый реестр дефектов создаёт общий приоритизированный обзор разрыва между текущим состоянием актива и проектным стандартом, даёт эксплуатации канал для передачи наблюдений и позволяет направлять усилия до следующего отказа. Видимые дефекты можно приоритизировать, а проблемы, существующие лишь в неформальных разговорах, — нет.

Вторая дисциплина — анализ первопричин для всех повторяющихся дефектов, хотя формальный анализ не требуется при каждом отдельном случае. Авторы предлагают включить вопрос «почему?» в стандартную корректирующую работу, фиксировать данные о режиме отказа в CMMS и APM, регулярно рассматривать повторные отказы и отличать симптом от механизма. Повторный выход подшипника из строя — симптом; механизмом может быть несоосность вала, неверная спецификация смазки или проникновение загрязнения через уплотнение. Устранять следует именно механизм, поскольку работа только с симптомом переносит следующий отказ в расписание.

Третья практика — точное выполнение работ по документированному стандарту, основанному на проектных требованиях. Подшипник, установленный с неверной посадкой с натягом, на вал с непроверенной соосностью и со смазкой, не соответствующей условиям работы, будет отказывать предсказуемо. Причина здесь, как отмечает статья, не обязательно в небрежности техника, а в несоответствии исполнения инженерному стандарту, необходимому для данного актива. Для прецизионного обслуживания нужны письменные процедуры, калиброванные инструменты и понимание диапазонов допусков, отделяющих соответствие спецификации от подхода «достаточно близко». При этом персоналу часто не хватает не желания работать по стандарту, а самого стандарта, выделенного времени или правильного оснащения.

Четвёртая дисциплина связана с развитием компетенций. Знание и навык — не одно и то же: техник может понимать важность соосности валов, но не иметь повторяемой практики лазерной центровки в полевых условиях — в сжатые сроки, на активе под производственным давлением и при ещё тёплой после предыдущей смены муфте. Способность формируется через целенаправленную практику, структурированную обратную связь и подтверждённую компетентность, а не через разовое обучение с немедленным выводом в работу. Пробелы в навыках названы структурной, а не личностной проблемой; их предлагается закрывать наставнической практикой, проверкой техники в поле и честной оценкой соответствия каждого сотрудника документированному стандарту.

Пятая практика — межфункциональная ответственность. Дефекты могут возникать в нескольких функциях: эксплуатация выводит оборудование за проектные параметры, обслуживание неточно выполняет работу, инженерная служба выбирает компоненты без учёта рабочего контекста, закупки заменяют детали без проверки эквивалентности проекту. Поэтому устранение дефектов не может быть задачей одной функции. Требуется, чтобы эксплуатация, обслуживание, инженерия надёжности и руководство завода разделяли набор метрик по состоянию оборудования, а не ориентировались только на выпуск продукции и число корректирующих работ. Когда надёжность становится общей бизнес-ответственностью, а не показателем отдела обслуживания, появляются условия для разговоров, предотвращающих отказы.

Шестая дисциплина — обучающаяся система. Каждый отказ является данными, а каждое корректирующее действие — наблюдением. Если история работ достаточно детальна и включает режим отказа, вероятную причину и состояние при ремонте, закономерности становятся заметны по активам и во времени. Если же заказ закрывают записью вроде «компонент заменён, возвращён в эксплуатацию», организация ничего не усваивает и начинает каждый идентичный отказ с нуля. Поэтому дисциплина ведения CMMS, по формулировке материала, — не административная нагрузка, а способ превратить индивидуальный опыт в институциональное знание и затем сократить число отказов. Критической точкой для накопления либо потери улучшений является связь между корректирующим действием и документированным закрытием первопричины.

Авторы отмечают, что эффект не появляется за один квартал: наблюдаемая ими траектория до самоподдерживающегося изменения занимает 12–24 месяца. В первые 1–6 месяцев реестры дефектов показывают объём ранее невидимого бэклога, расследования первопричин отнимают время, которого трудно найти в реактивном графике, требования к точности кажутся обременительными, а данные CMMS выглядят плохо, поскольку становятся честными. К 12-му месяцу небольшая группа активов, потреблявшая основную долю корректирующих трудозатрат, начинает сокращаться по мере последовательного устранения наиболее частых режимов отказа. У планировщиков появляется больше времени на инструментальную работу, экстренные вызовы реже срывают плановые задания, а операторы раньше сообщают о состояниях оборудования, поскольку видят, что их наблюдения приводят к действиям.

В период 18–24 месяцев бэклог меняет состав: в нём больше проактивных и меньше реактивных работ. Стоимость эксплуатации активов начинает снижаться не из-за сокращения расходов на обслуживание, а потому, что требуется меньше корректировок. Показатели MTBF, OEE и частота незапланированных простоев начинают отражать реальное улучшение, а не просто более быстрый отклик. В заключении статья противопоставляет распространённый вопрос «как лучше реагировать на отказы?» более ценному для горизонта 3–5 лет: устраняет ли предприятие режимы отказа, создающие эту работу, или выполняет ту же работу быстрее.

Итоговая рекомендация материала состоит в том, чтобы измерять не только скорость восстановления, но и повторяемость; закрывать заказ-наряд не с момента перезапуска, а после документирования и формального устранения первопричины; после каждого значимого отказа спрашивать, что нужно изменить, чтобы этот случай стал последним. Автор добавляет, что на каждой посещённой им площадке люди знают проблемные активы — например, три насоса с грубой работой, теплообменник, протекающий при каждой остановке, или редуктор, регулярно повреждающий уплотнения. Обычно недостаёт структуры для действий: времени, документированных процедур и организационного ожидания, что работа завершена только после закрытия первопричины. Переход от «исправить снова» к «исправить в последний раз» автор считает доступным любому заводу, который готов построить соответствующие системы.