Курс Production Reliability Engineering (SRE) | Ingress Ac
Создать аккаунт и подать заявку
РАЗРАБОТКА ПРОГРАММНОГО ОБЕСПЕЧЕНИЯ · ПРОДВИНУТЫЙ УРОВЕНЬ

Site Reliability Engineering (SRE)

Интенсивная 2-месячная практическая программа по SRE, которая научит вас измерять, мониторить и защищать надёжность продакшена в современных облачных и Kubernetes-средах.

Продвинутый8 недели48 часовОнлайн
Выбранный курс будет перенесён в Ingress Portal.
ПРЕИМУЩЕСТВА КУРСА
📊

Надёжность на основе метрик

Научитесь определять SLI, SLO и error budget, превращая надёжность в измеримую и практичную инженерную дисциплину.

🚨

Реальные симуляции инцидентов

Практикуйте алертинг, RCA и безвиновные постмортемы на реалистичных сценариях продакшн-инцидентов, а не только в теории.

☸️

Надёжность на основе Kubernetes

Применяйте продвинутые паттерны Kubernetes, такие как PDB, правила affinity и прогрессивные раскатки, для построения отказоустойчивых продакшн-систем.

Не уверены, что готовы? Пройдите бесплатную оценку навыков
ВАШ УРОВЕНЬ
НачальныйСреднийПродвинутыйЭксперт
ЧТО ВЫ СМОЖЕТЕ ДЕЛАТЬ

Навыки, которыми вы овладеете к концу этого курса.

  • Определять и рассчитывать SLI, SLO, SLA и error budget для продакшн-сервисов
  • Строить и интерпретировать стеки observability с использованием Prometheus, Grafana, логов и трейсов
  • Разрабатывать эффективные стратегии алертинга и управлять полным жизненным циклом инцидента
  • Применять паттерны надёжности Kubernetes, включая пробы, автомасштабирование, PDB и стратегии деплоя
  • Внедрять безопасную доставку ПО на основе GitOps с техниками отката и прогрессивного деплоя
  • Планировать стратегии аварийного восстановления и проводить упражнения по chaos engineering и нагрузочному тестированию
  • Проводить анализ первопричин и составлять безвиновные постмортемы и runbook'и
  • Использовать инструменты на базе ИИ для поиска неисправностей, RCA и реагирования на инциденты
КРАТКАЯ ПРОГРАММА

Ознакомьтесь со структурой, не читая учебник.

Модули свёрнуты для быстрого просмотра. Откройте любой модуль, чтобы увидеть его темы.

01Введение в Site Reliability Engineering6 уроков+

Что такое SRE? Эволюция от Operations к DevOps и к SRE

DevOps vs SRE и принципы инженерии надёжности

Продакшн-мышление и жизненный цикл сервиса

Модель разделённой ответственности, toil и автоматизация

Роли и обязанности SRE

Лабораторная: расчёт доступности и выявление toil

02Измерение надёжности сервиса6 уроков+

Почему надёжности нужны метрики: доступность vs надёжность

Service Level Indicators (SLI) и Objectives (SLO)

Service Level Agreements (SLA) и error budget

MTTD, MTTR и MTBF

Метрики DORA для оценки производительности доставки

Лабораторная: определение SLO и расчёт error budget

03Мониторинг и Observability6 уроков+

Мониторинг vs Observability и три столпа наблюдаемости

Основы метрик, логов и трейсов

Golden Signals, метод RED и метод USE

Сбор метрик с помощью Prometheus

Визуализация состояния системы с Grafana и распределённой трассировкой

Лабораторная: анализ дашбордов и выявление узких мест

04Алертинг и управление инцидентами6 уроков+

Принципы алертинга и Prometheus Alertmanager

Усталость от алертов, приоритизация и уровни серьёзности

Жизненный цикл инцидента и процесс реагирования

Лучшие практики дежурств и безвиновные постмортемы

Анализ первопричин и написание эффективных runbook'ов

Лабораторная: симуляция инцидентов, проведение RCA и написание постмортема

05Инженерия надёжности в Kubernetes6 уроков+

Самовосстановление, пробы liveness, readiness и startup

Запросы и лимиты ресурсов, горизонтальное/вертикальное автомасштабирование

Pod Disruption Budgets и планирование ради надёжности

Node affinity, anti-affinity и topology spread constraints

Надёжные стратегии деплоя: Rolling, Blue-Green, Canary

Лабораторная: диагностика подов, симуляция сбоя ноды и тестирование HPA

06Надёжная доставка ПО6 уроков+

Надёжность CI/CD и принципы GitOps

Прогрессивная доставка и безопасные практики деплоя

Rollback vs roll-forward и управление релизами

Управление конфигурацией и секретами

Управление изменениями, верификация деплоя и безопасность цепочки поставок

Лабораторная: синхронизация GitOps и симуляция безопасного релиза в продакшн

07Устойчивость продакшена и аварийное восстановление6 уроков+

Основы аварийного восстановления и архитектура высокой доступности

Резервное копирование и восстановление, RTO и RPO

Единая точка отказа и повторение вопросов планирования мощностей

Концепции нагрузочного тестирования и chaos engineering

Стратегии восстановления: Active-Active, Active-Passive, Warm Standby, Pilot Light

Лабораторная: восстановление из резервной копии и запуск сценариев chaos-тестирования

08Современные операции SRE и продакшн-сценарии6 уроков+

Сквозная методология диагностики проблем

Типичные продакшн-сбои и разбор кейсов

Компромиссы между стоимостью и надёжностью

ИИ для SRE: AIOps, ИИ-ассистированная диагностика и RCA

Карьерный путь SRE и непрерывное улучшение

Итоговая лабораторная: полная симуляция продакшн-инцидента

БЛИЖАЙШИЕ ГРУППЫ

Выберите группу, которую вы действительно сможете посещать.

Показаны только текущие открытые группы.

НАЧАЛО

Будет объявлено

Онлайн
Расписание
Будет объявлено
Формат
Онлайн
Длительность
8 недели · 48 часов
Язык
Уточните у консультанта
Записаться в лист ожидания
КОНТЕКСТНОЕ ПОДТВЕРЖДЕНИЕ
“Программа помогла мне связать отдельные навыки с тем, как реальные команды проектируют, создают и поставляют ПО.”

Смотрите реальные истории выпускников из сообщества Ingress.

Изучить результаты выпускников
ЗАЯВКА ЧЕРЕЗ INGRESS PORTAL

Выбранный курс сохраняется, пока вы создаёте аккаунт.

Мы используем один аккаунт Portal для заявок, оценок и будущего прогресса обучения. Вам не нужно отправлять данные по почте или снова выбирать курс.

Сначала вопросы? Поговорите с консультантом
  1. 01

    Создайте аккаунт Portal или войдитеВаши контактные данные привязаны к одному профилю студента.

  2. 02

    Подтвердите данные заявкиSite Reliability Engineering (SRE) уже выбран.

  3. 03

    Отправьте заявкуПриёмная команда получает её сразу и может связаться с вами через Portal.

ВЫБРАННЫЙ КУРСSite Reliability Engineering (SRE)Онлайн

Продолжить в Ingress Portal Уже зарегистрированы? Portal позволит вам войти.