Дежурство без паники
Набор на поток
--:--:-- MSK
Для практикующих DevOps- и SRE-инженеров уровня Middle · воркшоп на один уикенд

Десять настоящих аварий за уикенд — на копии боевой инфраструктуры

Вы разбираете десять инцидентов на стенде-двойнике и получаете отработанный алгоритм диагностики — раньше, чем этот алгоритм потребует у вас продакшен.

Два дня подряд · стенд разворачивается на нашей стороне Гарантия двухслойная · детали ниже
Аварий на стенде
10
Формат
48часов
Личных разборов
2сессии
Сопровождение после
30дней
Опыт автора
19лет
// Без чего это происходит

Шесть вещей,
которых здесь не будет

И три, которые нужны от вас: рабочий опыт эксплуатации от года, браузер с доступом к стенду и два свободных дня подряд.

01
Риска для настоящего прода
Стенд-двойник ломается по кнопке и восстанавливается по кнопке. За это никого не увольняют.
02
Месяцев теории до практики
Первый инцидент запускается в первые часы, а не после вводного модуля про то, что такое SLA.
03
Выпрашивания контура
А где вы видели компанию, которая выдаёт тестовый контур по первой просьбе?
04
Публичной оценки
Разбор идёт один на один. Никто не увидит, чего вы не знали на третьем инциденте.
05
Чужого графика
Без домашних заданий к дате и вебинаров, на которые не попасть после смены.
06
Перебора курсов
Входная диагностика за тридцать минут выдаёт список из трёх тем — ваших, а не «для всех».
// Точка А

Ждать настоящей аварии,
чтобы проверить себя,
больше не нужно

Вы прошли курсы, посмотрели доклады — а когда прилетел настоящий Sev1, в голове оказалось пусто. На стенде это будет уже одиннадцатый раз.

before → after

$ list --no-longer-needed

× Ждать настоящей аварии, чтобы узнать, справитесь ли вы
× Выпрашивать у компании тестовый контур под тренировку
× Собирать по Хабру и докам обрывки чужих разборов
× Придумывать себе учебные инциденты, которых не бывает в бою
× Проходить сплошную программу, где половина — то, что вы и так знаете
× Платить ментору 15 000 ₽ за час, чтобы разобрать один кейс
× Показывать коллегам, чего именно вы не знаете

# сколько обычно уходит, чтобы перестать бояться дежурства?
Год? Три? Пять случайных аварий, из которых удалось выбраться? Теперь 48 часов.

$ workshop --run
Ломает инфраструктуру сам. Ставит задачу как боевой тикет сам. Считает время до диагноза сам.

// Вопрос — ответ

Шесть возражений,
которые вы уже себе задавали

Ни одно из них не придумано мной: это то, что пишут и говорят инженеры, когда речь заходит о тренировке на инцидентах.

Вы прошли курсы, посмотрели доклады — а когда прилетел настоящий Sev1, в голове оказалось пусто?

Больше и не надо. На стенде это будет уже одиннадцатый раз.

Где тренироваться, если ронять настоящий прод нельзя?

Стенд-двойник ломается по кнопке и восстанавливается по кнопке — и за это, что характерно, никого не увольняют.

Вариантов развития десятки: с чего начать, что учить первым?

И не надо знать. Диагностика за тридцать минут выдаёт список из трёх тем — ваших, а не «для всех».

Приходится самому собирать материалы по крупицам, а потом самому же придумывать себе задачи для тренировки?

Можете забыть об этом. Инциденты ставятся как боевые тикеты, с алертами и эскалацией.

Не понимаете, по каким критериям вас вообще оценивают — на дежурстве, на собеседовании?

Чек-лист выдаётся до старта, а не после провала. Согласитесь, это несколько разные вещи.

Сколько обычно уходит, чтобы перестать бояться дежурства? Год? Три? Пять случайных аварий, из которых удалось выбраться?

Теперь сорок восемь часов.

«Дежурство без паники» делает всё сам. Ломает инфраструктуру сам. Ставит задачу как боевой тикет сам. Считает время до диагноза сам. Уже не нужен ментор за 15 000 ₽ в час, чтобы разобрать один инцидент: стенд выдаёт десять — и каждый доводится до причины, а не до «перезагрузка помогла». Перезагрузка, признаем, иногда действительно помогает — просто это не диагноз, а отсрочка.

// Что конкретно вы получите

Шесть компонентов

Каждый существует не для полноты набора, а под конкретную причину, по которой рефлекс диагностики не появляется сам.

Компонент 1
Инцидент-симулятор
«10 дежурств за уикенд»

Десять сценариев из личной практики на проектах-миллионниках: падение Nginx под пиком, split-brain кворума etcd, деградация базы на распродаже, утечка file descriptors, каскадный отказ через таймауты. Каждый — под таймером, с настоящими алертами и эскалацией.

Компонент 2
Изолированный
стенд-двойник

Копия нагруженной инфраструктуры с генератором боевого трафика. Один инцидент можно перепройти пять раз подряд, меняя гипотезу.

По кнопкеБез риска
Компонент 3
Входная диагностика
и карта развития

Один маршрут из трёх-пяти тем вместо перебора программ месяцами. Плюс зафиксированный факт: что вы уже тянете на уровне Senior.

30 минут
Компонент 4
Точечные модули
под ваши пробелы

По два-четыре часа, каждый с измеримым артефактом: рабочий конфиг, дашборд, runbook. Назначаются по итогам диагностики, а не по каталогу.

КонфигДашбордRunbook
Компонент 5
Постмортем-протокол
«От симптома к причине»

После каждого инцидента — блок «что стояло за симптомом» и письменный постмортем: гипотеза, проверка, опровержение, корень, что чинит класс проблем целиком.

Шаблон10 постмортемов
Компонент 6
1:1 разбор вашего решения

Две персональные сессии по записи вашего прохождения, а не по общему эталону. Не «правильный ответ», а развилки: где вы потеряли пятнадцать минут на ложной гипотезе и по какому признаку её можно было отбросить сразу.

Один на одинПо вашей записи
// Честный ответ конкуренту

«Чем это отличается
от того, что уже есть?»

Правильный вопрос, и я отвечу прямо, без «у нас уникальная авторская методика».

Что есть на рынке«Задачник DevOps» Слёрма: десять инцидентов на стендах с автопроверкой, от 7 900 ₽. Траблшутинг-соревнования Rebrain: вход стоит рубль. Если нужно просто потренироваться гасить аварии — идите туда, это хорошие продукты и они в разы дешевле.
Разница ровно однаТам проверяют результат. Здесь проверяют метод. Автопроверка смотрит, поднялся сервис или нет: она не отличает того, кто дошёл до причины, от того, кто наугад перезапустил три компонента и попал.
Что из этого следуетЗадачник научит гасить десять конкретных аварий. Здесь вы получаете метод, который переносится на одиннадцатую — ту, которой на стенде не было и которую пришлёт ваш собственный продакшен. Если этой разницы вам не нужно — берите Задачник, серьёзно. Он дешевле и своё дело делает.
чего нет в автопроверке

$ diff --autocheck vs method

Автопроверка на стенде смотрит одно: поднялся сервис или не поднялся. Она не отличает инженера, который дошёл до причины, от инженера, который наугад перезапустил три компонента и попал. Обе попытки засчитываются одинаково. А на дежурстве в три ночи и на собеседовании через месяц разница между ними — решающая.

# поэтому здесь после каждой аварии есть то, чего автопроверка не даёт:

+ письменный постмортем по шаблону: гипотеза, проверка, чем опровергли, корень, что чинит класс проблем целиком
+ две персональные сессии по записи вашего прохождения — не «правильный ответ», а развилки, где вы потеряли пятнадцать минут на ложной версии
+ тридцать дней сопровождения на вашем настоящем инциденте после практики: стенд заканчивается, а дежурства нет

// Подойдёт ли вам это

Задайте себе
три вопроса

Прежде чем смотреть на цену — прикиньте, во что вам обходится её отсутствие.

Если бы вы за один уикенд получили отработанный алгоритм диагностики — и на следующем дежурстве команда увидела, что вы справляетесь сами, без звонка старшему в три ночи, — стоило бы это 400 000 рублей?
А если бы вам больше не нужно было ждать настоящей аварии, чтобы проверить себя, выпрашивать тестовый контур и собирать материалы по крупицам, — и вся практика занимала один уикенд?
А если бы вы могли возвращаться на стенд перед каждым собеседованием и каждой сменой стека, а свою библиотеку runbook'ов приносить в любую новую команду как готовый актив?

И ещё одно соображение — про риск. Главный практический совет Талеба — «стратегия штанги»: держать 80–90% активов в безопасном и предсказуемом, а оставшееся вкладывать в ставки с ограниченным риском и большой потенциальной выгодой. Он пережил по этой схеме и «Чёрный понедельник» 1987 года, и кризис 2008-го, причём оба раза с прибылью. Ваша зарплата и текущий грейд — это те самые 80–90%. Один уикенд и один платёж — как раз оставшаяся часть: риск ограничен суммой, а выгода при удачном исходе измеряется грейдом, а не процентами.

// Сколько это стоит собрать иначе

Счёт за то же самое,
собранное по частям

Десять разборов инцидентов с ментором-практиком (10 × 12 000 ₽)120 000 ₽
Изолированный контур с кластером, мониторингом и генератором нагрузки силами подрядчикаот 50 000 ₽
Комплект регламентов инцидент-реагирования под заказот 40 000 ₽
Собрать всё по частям на открытом рынке — двенадцать позиций, каждую можно проверить427 000 ₽

А если сами?

Сколько лет уходит, чтобы дойти до уверенности на дежурстве? Сколько настоящих Sev1 нужно пройти, чтобы появился рефлекс? И всё это без гарантии, что вам «повезёт» с частотой и тяжестью аварий.

Цена входа, а не цена всего

Я отдаю систему в шесть раз дешевле по стратегической причине: хочу стать вашим первым результатом, которому вы доверяете. Дальше у меня есть вещи дороже и глубже, и там чек другой.

Только на входе

Эта цена — для тех, кто со мной ещё не работал. Один раз.

427 000 ₽
69 900
×6дешевле сборки по частям
357 100 ₽разница в рублях
48 чвместо лет случайных дежурств
// Что идёт вместе с воркшопом

Шесть бонусов

Пятый достаётся первым десяти в потоке, шестой работает тридцать дней после — уже на вашем настоящем инциденте.

Бонус 1

AI в эксплуатации:
второй дежурный, который не устаёт

Модель отвечает уверенно всегда — и когда права, и когда нет. Здесь про то, как получать от неё пользу в три часа ночи и не пойти по красиво сформулированной ложной версии.

  • двенадцать готовых промптов под разбор инцидента
  • приёмы проверки: как за минуту понять, что модель придумала
  • где она ускоряет вдвое, а где гарантированно врёт
Результат: вы используете LLM как ускоритель гипотез, а не как источник версий, которые потом приходится опровергать.
Собрать на рынке: 15 000 ₽ — отдельный модуль в профильном курсе
Бонус 2

Личная библиотека
runbook'ов

После уикенда у вас остаются не впечатления, а файлы. Десять постмортемов по шаблону и runbook'и к каждому классу аварий — написанные вашими руками и вашим языком.

  • десять разборов: гипотеза, проверка, опровержение, корень
  • runbook на каждый класс — можно положить в вики как есть
  • формат, который читается коллегой без вашего присутствия
Результат: вы приносите в команду готовый актив, а не рассказ о том, как хорошо провели выходные.
Собрать на рынке: 40 000 ₽ — комплект регламентов под заказ
Бонус 3

«Как вас реально
оценивают»

Самое неприятное в оценке — что критерии есть, но их никто не проговаривает. Ни на дежурстве, ни на собеседовании. Здесь они выписаны.

  • что смотрят на дежурстве: не скорость, а порядок действий
  • что слушают на собеседовании в рассказе про инцидент
  • по каким признакам отличают «починил» от «понял»
Результат: вы готовитесь к тому, что оценивают, а не к тому, что легче выучить.
Собрать на рынке: 10 000 ₽ — одно mock-интервью
Бонус 4

«Радар технологий
квартала», год доступа

Раз в квартал — короткий разбор того, что реально входит в вакансии и в инциденты, а что живёт только в лентах и на конференциях.

  • по каждой позиции пометка: платят за это или только обсуждают
  • что чинит целый класс аварий, а что косметика
  • собирается по требованиям вакансий и по задачам заказчиков
Результат: вы выбираете, чему учиться в этом квартале, за десять минут вместо вечера в лентах.
Собрать на рынке: 12 000 ₽ — технологический обзор у внешнего эксперта
Бонус 5

Разбор вашего
личного стека

Стенд — это общая инфраструктура. А инциденты вам будет присылать ваша собственная, со своими странностями. Здесь мы смотрим именно её.

  • где у вашего стека самые вероятные точки отказа
  • какие из десяти сценариев ближе всего к вашей реальности
  • что стоит проверить в понедельник, не дожидаясь аварии
Результат: практика переносится на вашу инфраструктуру, а не остаётся на стенде.
Только первым десяти в потоке — это мои часы
Бонус 6

Ваш первый настоящий
инцидент — разбираем вместе

Стенд заканчивается в воскресенье, а дежурства — нет. Самый ценный разбор в вашей жизни случится не на стенде, а на первой боевой аварии после него.

  • тридцать дней после воркшопа: присылаете свой инцидент
  • разбираем вашу запись и вашу последовательность действий
  • показываю развилку, где потерялось время, — на вашем случае
Результат: метод закрепляется на настоящей аварии, пока он ещё свежий.
Собрать на рынке: 24 000 ₽ — два часа ментора-практика
// Давайте подытожим

Что входит в «Оптимальный»

Инцидент-симулятор «10 дежурств за уикенд»входит
Изолированный стенд-двойниквходит
Входная диагностика и персональная карта развитиявходит
Точечные модули под ваши пробелывходит
Постмортем-протокол «От симптома к причине»входит
1:1 разбор вашего решения с экспертом — две сессиивходит
Шесть бонусов, включая тридцать дней сопровождениявходит
Собрать это по частям на рынке — 427 000 ₽. Ваша цена69 900 ₽
// Тарифы

Три варианта участия

Эконом
62 900 ₽только стенд и метод
  • 10 аварий на стенде под таймером
  • Изолированный стенд-двойник
  • Входная диагностика и карта развития
  • Постмортем-протокол
  • 1:1 разбор вашего решения
  • Шесть бонусов
Тем, кому нужен только стенд и ничего больше
Выбрать [ССЫЛКА]
Оптимальный · целевой
69 900 ₽+7 000 ₽ к «Эконому» — и шесть бонусов
  • Всё из «Эконома»
  • Модуль «AI в эксплуатации»
  • Личная библиотека runbook'ов
  • Чек-лист «Как вас реально оценивают»
  • «Радар технологий», год
  • 30 дней сопровождения на вашем инциденте
Разница в 7 000 ₽ против шести бонусов — я не буду делать вид, что это сложный выбор
Выбрать [ССЫЛКА]
Максимальный
199 000 ₽с личным разбором вашей ситуации
  • Всё из «Оптимального»
  • Разбор личного стека — гарантированно, без лотереи
  • Час персонального разбора вашей ситуации с планом действий
  • Отдельный продукт «Готовый план вместо недели сомнений» входит целиком
Не «то же самое, но дороже»: внутри отдельный продукт, оплаченный одним платежом
Выбрать [ССЫЛКА]
Оплата через работодателяСчёт на компанию, договор, акт, обмен через ЭДО с квалифицированной подписью. Плюс письмо-обоснование для руководителя с расчётом окупаемости — чтобы разговор был служебной задачей, а не личной просьбой.
Оплата физлицомПолная оплата или части — [УСЛОВИЯ РАССРОЧКИ]. Реквизиты ИП и документы — в подвале страницы.
Нужен только метод?Если стенд вам не нужен, есть отдельный пакет материалов — «Протокол дежурного» за 19 900 ₽. Его стоимость засчитывается сюда в течение 30 дней.
// Что остаётся у вас на руках

Воркшоп заканчивается.
Артефакты — нет

Самый частый исход обучения — «было полезно» без единого файла на выходе. Здесь наоборот: всё, что вы сделали, остаётся у вас и переносится в команду.

01
Решённых инцидентов
10с таймером
По каждому зафиксировано время до диагноза — есть с чем сравнивать через квартал.
02
Написанных постмортемов
10по шаблону
Предметный артефакт, а не ощущение: гипотеза, проверка, опровержение, корень.
03
Личная карта пробелов
3—5тем
Не «что учить DevOps», а что держит на месте именно вас.
04
Библиотека runbook'ов
в викикак есть
Можно принести в свою команду и положить без переписывания.
05
Чек-лист критериев
1страница
По чему вас оценивают на дежурстве и на собеседовании.
06
«Радар технологий»
4выпуска
Год доступа: что имеет смысл знать в этом квартале.
// Как заплатить

Три способа,
включая самый удобный

Самый частый вопрос на этом месте — не «сколько», а «как это провести».

За счёт работодателяСчёт на компанию, договор, акт, обмен через ЭДО с квалифицированной электронной подписью. Плюс готовое письмо-обоснование для руководителя: что компания получает, за сколько и как это окупается — чтобы разговор был служебной задачей, а не личной просьбой.
Своими средствамиПолная оплата картой или по счёту от ИП. Возможна оплата частями — [УСЛОВИЯ РАССРОЧКИ]. Все документы приходят на почту сразу после оплаты.
Если нужен только методСтенд стоит денег, потому что это работающая инфраструктура. Если практика вам не нужна, есть отдельный пакет материалов — «Протокол дежурного» за 19 900 ₽, и его стоимость засчитывается сюда в течение тридцати дней.
// Гарантия

Две гарантии,
а не одна общая фраза

Первая закрывает риск «мне не подойдёт формат», вторая — риск «я не получу результат».

Слой 1. Первый инцидентПрошли первый инцидент на стенде и поняли, что это не ваше, — возвращаю деньги полностью. Без объяснений и без обсуждения.
Слой 2. Результат уикендаЕсли после воркшопа у вас на руках нет десяти постмортемов, карты пробелов и библиотеки runbook'ов — возвращаю деньги. Проверяется не ощущением, а тем, что лежит в ваших файлах.
Что нужно от васПрийти на оба дня и пройти инциденты. Гарантия не требует доказывать старание — она требует только присутствия.
// Вместо отзывов

Разбор реальной аварии

Отзывов выпускников у меня пока нет, и выдумывать их я не стану. Вместо них — открытый разбор, по которому видно метод в работе.

incident — все компоненты зелёные, а продакшн лежит

$ postmortem --case=firewall

Симптом. Приложение не отвечает. Метрики базы полностью зелёные, все компоненты в норме, мониторинг молчит.

Что оказалось. Потеряна сетевая связность между новым облаком и основным дата-центром: собственные правила файрвола, применённые пайплайном. Кеш какое-то время маскировал отказ и удлинил диагностику.

Диагностика заняла втрое больше времени, чем устранение. Ответ лежал в истории изменений инфраструктуры, куда за первые пятнадцать минут не посмотрел никто.

# вывод, который переносится: при инфраструктуре как код вопрос «что изменилось за последний час» адресуется git, а не людям в чате.

$ open habr.com/ru/articles/1078876 # ~10 000 читателей

Ведёт Олег БукатчукDevOps/SRE-инженер, 19 лет в эксплуатации. cian.ru, aliexpress.ru, mos.ru — каждый проект больше миллиона пользователей в день.
Все десять сценариев — из личной практикиНи один не опубликован: это не пересказ чужих постмортемов с Хабра.
Проверить, не спрашивая разрешенияgithub.com/olegbukatchuk и интервью «Как хорошо больше не писать код» на «Мы обречены» — десять минут с нужного места.
Страница выпуска интервью на YouTube: 30 тыс. просмотров
// Про места и сроки

Почему мест
ограниченное число

Это не приём: под каждый заход поднимается отдельный стенд.

Стенд — это оплаченные ресурсыКопия нагруженной инфраструктуры с генератором трафика работает в облаке и стоит денег всё время, пока работает. Поэтому заходы идут по расписанию, а не «в любой момент».
Ближайший заход[ДАТЫ ЗАХОДА] · мест: [ЧИСЛО]. Формат — два дня подряд.
Первым десятиРазбор личного стека достаётся первым десяти участникам потока. Это тоже не лотерея ради лотереи: разбор — это мои часы.
P.S.

Если вы дочитали досюда, дело не в том, что вы мало знаете. Дело в том, что знание проверяется только под давлением, а давление на работе приходит без предупреждения и не в тот момент, когда вам удобно. Стенд — это способ получить давление по расписанию.

P.P.S.

Первый инцидент — и вы уже понимаете, ваше это или нет. Если нет — возвращаю деньги полностью, без объяснений. То есть решение стоит вам не 69 900 ₽, а одного вечера субботы.

P.P.P.S.

И про честность до конца: если вам нужно просто потренироваться гасить аварии, «Задачник DevOps» Слёрма за 7 900 ₽ сделает это дешевле. Разница здесь одна — там проверяют результат, здесь проверяют метод. Нужен только результат — берите Задачник, я не обижусь.

// Пока не станет рефлексом

Один уикенд против года случайных дежурств

Через два дня у вас на руках десять решённых инцидентов с зафиксированным временем до диагноза, карта из трёх-пяти пробелов, десять постмортемов и библиотека runbook'ов, которую можно принести в свою команду.

Кому не подойдёт. Это апгрейд, а не вход с нуля: нужен рабочий опыт эксплуатации от года. Если вы дежурите давно и уверенно, а не хватает только системы — вам дешевле взять «Протокол дежурного».