Когда надёжность становится вопросом безопасности — Reliability Solutions
Оригинальное название: When Reliability Becomes a Safety Issue - Reliability Solutions
Статья утверждает, что благополучные показатели охраны труда, включая TRIR и LTIR, могут скрывать растущий риск технологических аварий, связанный с состоянием активов. Автор противопоставляет производственную безопасность и безопасность процессов, приводит аварию BP Texas City как пример опасности ориентации на неверные индикаторы и предлагает шестикомпонентную программу управления состоянием активов, которую руководство должно рассматривать как вопрос уровня совета директоров и исполнительной команды.
Материал начинается с тезиса, что зелёная панель показателей безопасности и TRIR (Коэффициент общего травматизма) на уровне отраслевого бенчмарка ещё не означают отсутствия больших рисков для предприятия. Автор описывает типичный ход ежеквартальных совещаний совета директоров: Total Recordable Incident Rate снизился, число инцидентов с потерей рабочего времени тоже, травм рук - вместе с ними, все хорошо. Затем обсуждение переключается на капитальные затраты, производительность или квартальный прогноз. Однако, как подчёркивается в статье, в таких обсуждениях редко задают вопрос, отражают ли эти цифры риск, способный поставить под угрозу само существование предприятия.
Автор разделяет безопасность на две категории с принципиально разным финансовым масштабом последствий. Охрана труда охватывает поскальзывания, падения, удары предметом, нарушения lockout-tagout и другие персональные инциденты. Для неё применяются TRIR, LTIR и сообщения о почти-инцидентах; улучшения достигаются за счёт СИЗ, обучения и поведенческих программ. Эти события реальны и требуют внимания, но, по мнению автора, редко угрожают существованию компании.
Вторая категория — безопасность процессов, также названная состоянием активов. Она относится к катастрофическим отказам: разрыву сосуда, выбросу углеводородов, разрушению конструкции или неуправляемой реакции. Здесь контролируются состояние активов, режимы отказов оборудования, герметичность и конструкционная надёжность; используются соблюдение требований к инспекциям, частота отказов и опережающие индикаторы по критическому оборудованию. Такие события редки, но их последствия измеряются человеческими жизнями, годами потерянного выпуска, регуляторными рисками и мировыми соглашениями на суммы в девять и десять знаков. В статье говорится, что именно они исторически обусловили крупнейшие промышленные потери.
Ключевой риск состоит в том, что показатели охраны труда и безопасности процессов меняются независимо друг от друга. Предприятие может улучшать первую и одновременно ухудшать вторую, не замечая этого на привычной панели. В качестве показательного случая приводится авария BP Texas City 2005 года: погибли 15 работников, 170 получили травмы, а объём одних только мировых соглашений превысил $2,1 млрд — без учёта штрафов, ремонта, отложенного производства и репутационного ущерба. По данным статьи, U.S. Chemical Safety Board заключил, что BP измеряла безопасность «преимущественно показателями охраны труда в ущерб мониторингу показателей безопасности процессов». Внутренний отчёт BP также назвал среди способствовавших факторов плохое состояние оборудования и недостаточность расходов на обслуживание. Иными словами, панель была зелёной, тогда как завод уже претерпевал деградацию.
Автор дополнительно сопоставляет этот случай с мировым соглашением по Deepwater Horizon на $20,8 млрд, названным крупнейшим урегулированием экологического ущерба в истории США. Материал также отмечает, что механическое состояние входит в число наиболее часто упоминаемых факторов в анализах инцидентов безопасности процессов.
Проблема, по оценке автора, носит не просто измерительный, а структурный характер. Срок службы оборудования в тяжёлой промышленности составляет 20–40 лет, поэтому решение отложить работы по надёжности в текущем году может не проявиться отказом в том же году, а дать последствия через несколько управленческих циклов. Сокращение затрат на обслуживание на 15% сразу улучшает квартальный P&L, но ухудшение состояния активов может проявиться только через 3–7 лет. Поэтому риск легко остаётся вне поля зрения менеджмента, ориентированного на более короткие циклы.
Статья указывает, что страховой рынок уже уделяет этому больше внимания, чем многие советы директоров. Страховщики в тяжёлой промышленности анализируют программы состояния активов, записи механических инспекций и показатели надёжности при андеррайтинге. Для объектов со слабыми данными по надёжности увеличение премии на 50% год к году, по словам автора, больше не является необычным. Одновременно усиливается регуляторный риск: повторные нарушения и пробелы в управлении состоянием активов, которые десять лет назад могли привести к штрафу, теперь способны обернуться соглашением о принудительных мерах, остановкой производства или уголовной ответственностью высшего руководства.
Вместо разрозненных действий — аудита, внедрения программной платформы, RCM-воркшопа либо найма дополнительных инспекторов — автор предлагает выстраивать постоянную программу, увязанную с реальным управлением бизнесом. После многолетней работы с руководителями производств в тяжёлой промышленности автор пришёл к модели из шести взаимосвязанных элементов. Их следует внедрять совместно, как единую систему, и поддерживать в многолетнем горизонте, а не реализовывать как одноразовый проект.
Первый элемент — независимая базовая оценка критических активов, программы надёжности, практик обслуживания и компетенций персонала. Её задача не в оценке команды, а в создании для руководства ясной и обоснованной картины разрывов. Авторы указывают, что самооценки обычно подтверждают уже существующие взгляды руководства, тогда как независимая оценка способна выявить то, чего сотрудники внутри организации не могут увидеть.
Второй элемент — система критичности активов. Не всё оборудование несёт одинаковый риск: на типичном объекте тяжёлой промышленности примерно 10–15% оборудования концентрирует 80% риска для безопасности процессов и непрерывности бизнеса. Активы следует ранжировать по последствиям отказа — для безопасности, окружающей среды, производства и соблюдения регулирования — и направлять строгость контроля туда, где она наиболее нужна. Автор относит к сфере суждения руководителей определение критических активов и уровня инвестиций, который должен следовать из такого статуса.
Третий элемент — стратегия надёжности, соответствующая режиму отказа. Для каждого критического актива следует спрашивать не только о периодичности PM, но и о режимах отказа и стратегии, которая действительно им противодействует. Обслуживание по времени, мониторинг состояния, предиктивная аналитика, эксплуатация до отказа и редизайн могут быть применимы в разных ситуациях. Суть reliability-centered maintenance, как сформулировано в материале, — сопоставить верную стратегию с конкретным режимом отказа и документировать решение, чтобы оно не зависело от человека, который будет занимать должность в следующем году.
Четвёртый элемент — подтверждённая компетентность персонала. Программа зависит от техников и инженеров, которые её исполняют. В авиации и атомной энергетике компетентность подтверждают, а не предполагают; в большинстве предприятий тяжёлой промышленности, отмечает автор, это не так. Предлагаемая система включает определённые навыки для каждой критической роли, практические оценки вместо одних письменных тестов, документированные подтверждения и повторяющийся цикл верификации. Этот компонент определяет эффективность остальных пяти, поскольку работы по состоянию активов выполняются непосредственно на рабочем месте, а не в зале заседаний.
Пятый элемент — небольшой, обоснованный набор опережающих индикаторов, видимых руководству. Запаздывающие показатели сообщают о том, что уже пошло не так, тогда как опережающие должны указывать на приближающуюся проблему. В статье предлагается докладывать исполнительной команде долю критических активов с актуальной оценкой состояния, выполнение PM именно на критическом оборудовании, просроченный объём инспекций, скорость закрытия замечаний по механическому состоянию и завершение обучения по компетенциям критических задач. Эти индикаторы не заменяют TRIR, а должны располагаться рядом с ним, показывая совету директоров реальный риск безопасности процессов.
Шестой элемент — управление и непрерывное улучшение. Проект превращается в программу при наличии назначенного владельца на исполнительном уровне, определённого ритма обзоров — обычно ежеквартально на уровне руководства и ежемесячно на уровне операций — а также формального механизма, возвращающего результаты проверок, почти-инциденты и инциденты в стратегию для её обновления. Без такого контура даже сильная техническая работа деградирует через два или три года из-за смены людей и приоритетов. При его наличии программа накапливает эффект: каждый год дисциплинированного исполнения делает следующий проще и дешевле.
Когда все шесть элементов работают совместно, обзоры обслуживания перестают быть отчётами о статусе и становятся обсуждением риска. Команда надёжности перестаёт восприниматься только как центр затрат и начинает участвовать вместе с инженерной функцией в решениях по капиталу. Страховщики при продлении полисов задают другие вопросы и всё чаще дают иные ответы. Главное практическое изменение, по словам автора, — сокращение промежутка между появлением проблемы состояния и осведомлённостью руководителя: с лет до недель. Тем не менее зрелость серьёзной программы на объекте с типичным исходным уровнем требует 18–36 месяцев.
Материал подчёркивает, что запуск программы — исполнительный акт, хотя её создание и является операционной работой. Она не закрепится, если кто-то наверху не задаст ожидания, не выделит ресурсы и не позволит теме исчезнуть с повестки под давлением текущего квартала. Автор предлагает вынести на ближайший исполнительный обзор четыре вопроса: какие опережающие индикаторы безопасности процессов отслеживаются помимо TRIR и кто за них отвечает; когда критические активы в последний раз проходили независимую оценку надёжности и состояния и что она выявила; соответствовали ли за три последних года расходы на обслуживание и надёжность старению активов либо происходило скрытое недоинвестирование; и что обнаружил бы крупный страховщик при аудите программы состояния активов и повлияло бы это на продление полиса.
Если на эти вопросы нет ясных ответов от конкретно назначенных владельцев, автор считает это работой для руководства, а не задачей, которую можно просто делегировать. Надёжность активов редко представляют как тему безопасности для совета директоров, но, по выводу статьи, в тяжёлой промышленности это необходимо. Худшие исторические инциденты были обусловлены не нарушениями охраны труда, а деградацией механического состояния, пока внимание было направлено на неправильные индикаторы. Хорошо управляющие этим риском руководители не просто требуют больше отчётов: они меняют содержание обсуждений на исполнительном уровне, ставят состояние активов в одну повестку с финансовыми результатами и обеспечивают участие руководителей обслуживания в принятии решений по капиталу и рискам.