SeniorДалее: Лидерство в надёжности
Руководите инженерией надёжности в масштабе
- Определять стратегию надёжности для продуктов и платформ
- Классифицировать сервисы по бизнес-критичности
- Устанавливать единые стандарты SLI и SLO для всей организации
- Создавать политики бюджета ошибок и управления релизами
- Моделировать сквозную доступность с учётом зависимостей сервисов
- Выявлять критические зависимости и системные риски отказов
- Проектировать отказоустойчивые мультизональные и мультирегиональные системы
- Оценивать архитектуры active-active и active-passive
- Устанавливать стандарты аварийного восстановления и график тестирования
- Возглавлять реагирование на крупные инциденты и кросс-командную техническую координацию
- Проектировать устойчивые графики дежурств и модели эскалации
- Улучшать коммуникацию по инцидентам с техническими и бизнес-заинтересованными сторонами
- Формировать эффективную культуру обучения после инцидентов
- Приоритизировать работу по надёжности на основе рисков и влияния на бизнес
- Строить долгосрочные прогнозы ёмкости и спроса
- Руководить инженерией производительности и масштабируемости
- Проектировать централизованные платформы наблюдаемости
- Устанавливать стандарты телеметрии, хранения данных и кардинальности
- Создавать самообслуживаемые возможности надёжности для команд разработки
- Создавать переиспользуемые дашборды, оповещения, runbook'и и шаблоны сервисов