Надёжная КнигаНадёжность — новости
ТОиР и надёжность · Мир

Систематическая ошибка выжившего: как долгоживущие компоненты вводят в заблуждение при принятии решений по техническому обслуживанию

Оригинальное название: Survivor Bias: When Long-Life Components Mislead Maintenance Decisions

Статья предупреждает, что единичные компоненты, проработавшие необычно долго, не должны сами по себе служить основанием для увеличения интервалов замены. На примере семи отказов в диапазоне 1 300–2 600 часов Наработки и трёх продолжающих работать единиц на отметке 3 000 часов автор показывает, как анализ надёжности всей популяции выявляет рост возрастного риска, который не отражает простой показатель MTBF. Решение об изменении интервала следует принимать с учётом вероятности отказа, его последствий, допустимого риска и целей бизнеса, а применяемый метод должен соответствовать ремонтопригодности объекта.

Редакционный пересказ: Reliability.newsИсточник: HomeАвтор оригинала: Jayson Stephen Carganilla

В статье рассматривается типичная логика пересмотра периодичности замены: некоторые компоненты неизменно переживают установленный интервал обслуживания, и это порождает вопрос, не слишком ли рано их заменяют. В качестве характерного аргумента приводится наблюдение: отдельные единицы продолжают работать свыше 3 000 часов. Автор признаёт, что такой вопрос разумен, но подчёркивает: сам по себе он ещё не доказывает необходимость продлить интервал.

Рассмотренный набор данных включает семь событий отказа при Наработке от 1 300 до 2 600 часов и три цензурированные справа единицы, которые всё ещё работали на 3 000 часах. Кривая функции надёжности R(t) показывает, что в ранний период вероятность сохранения работоспособности остаётся относительно высокой, затем после примерно 1 000–1 500 часов снижается быстрее и приближается приблизительно к 50% около 2 000 часов. По мнению автора, такое поведение согласуется с популяцией, у которой возрастает риск отказов, связанных с возрастом.

Функция плотности вероятности f(t) характеризует относительную вероятность отказов по мере накопления Наработки. В данном примере отказы сосредоточены приблизительно в диапазоне 1 500–2 500 часов. Материал подчёркивает, что эта концентрация означает не случайное распределение отказов по сроку эксплуатации: популяция, по-видимому, входит в область возрастного износа.

Интенсивность отказов h(t), определяемая как f(t)/R(t), показывает мгновенную условную частоту отказов при условии, что компонент дожил до момента t. В построенной LogNormal-модели кривая интенсивности резко растёт в ранней фазе старения, а затем постепенно выравнивается. Это означает рост мгновенного риска отказа с возрастом, увеличение риска эксплуатации актива и переход популяции в режим, где преобладает износ. Хотя конкретная LogNormal-модель в итоге достигает пика и начинает сглаживаться, ключевым наблюдением остаётся наличие поведения с возрастающей частотой отказов. Авторы указывают, что именно этого критически важного вывода не способен показать один лишь MTBF.

Когда обсуждается увеличение интервала обслуживания, внимание нередко сосредотачивают на выживших активах, а отказавшие единицы считают исключениями. Однако анализ надёжности требует рассматривать всю популяцию. Поэтому ключевой вопрос сформулирован не как «какой максимальный срок уже достигнут», а как «какую вероятность отказа организация готова принять при увеличении интервала».

Данные этого примера свидетельствуют о повышении возрастного риска отказа. Продление интервала может позволить получить дополнительный Срок службы от части компонентов, но одновременно способно повысить вероятность незапланированных отказов, остановок производства, аварийных работ по техническому обслуживанию и совокупного риска по всему парку. В статье говорится, что этот компромисс необходимо оценивать осознанно, а не принимать как подразумеваемый. Интервалы обслуживания должны определяться поведением надёжности на уровне популяции, последствиями отказа, допустимым риском и бизнес-целями.

Самый долгоживущий актив обычно наиболее заметен, но несколько таких выживших не отменяют тенденцию старения. Поэтому периоды обслуживания следует основывать на надёжности всей популяции и приемлемой вероятности отказа, а не на максимальном сроке, достигнутом небольшим числом компонентов.

Автор отдельно ограничивает применимость приведённого анализа данных о наработке до отказа. Он предназначен для неремонтопригодных изделий, расходуемых компонентов либо систем, которые после замены восстанавливаются до состояния «как новые». Для действительно ремонтопригодных систем моделирования обычным одноцикловым распределением наработки часто недостаточно. В таких случаях в качестве в целом более подходящих методов названы Crow-AMSAA NHPP (Non-Homogeneous Poisson Process), ROCOF (Rate of Occurrence of Failures) и модели Duane.

В завершение материал предлагает руководителям по надёжности и техническому обслуживанию определить, какой фактор имеет наибольший вес при пересмотре интервалов профилактического обслуживания: долгоживущие выжившие единицы, исторические данные об отказах, целевые показатели надёжности, последствия отказа, оптимизация соотношения затрат и риска или иной фактор.

Открыть оригинал ↗