Вы разбираете десять инцидентов на стенде-двойнике и получаете отработанный алгоритм диагностики — раньше, чем этот алгоритм потребует у вас продакшен.
И три, которые нужны от вас: рабочий опыт эксплуатации от года, браузер с доступом к стенду и два свободных дня подряд.
Вы прошли курсы, посмотрели доклады — а когда прилетел настоящий Sev1, в голове оказалось пусто. На стенде это будет уже одиннадцатый раз.
$ list --no-longer-needed
× Ждать настоящей аварии, чтобы узнать, справитесь ли вы
× Выпрашивать у компании тестовый контур под тренировку
× Собирать по Хабру и докам обрывки чужих разборов
× Придумывать себе учебные инциденты, которых не бывает в бою
× Проходить сплошную программу, где половина — то, что вы и так знаете
× Платить ментору 15 000 ₽ за час, чтобы разобрать один кейс
× Показывать коллегам, чего именно вы не знаете
# сколько обычно уходит, чтобы перестать бояться дежурства?
Год? Три? Пять случайных аварий, из которых удалось выбраться? Теперь 48 часов.
$ workshop --run
Ломает инфраструктуру сам. Ставит задачу как боевой тикет сам. Считает время до диагноза сам.
Ни одно из них не придумано мной: это то, что пишут и говорят инженеры, когда речь заходит о тренировке на инцидентах.
Вы прошли курсы, посмотрели доклады — а когда прилетел настоящий Sev1, в голове оказалось пусто?
Больше и не надо. На стенде это будет уже одиннадцатый раз.
Где тренироваться, если ронять настоящий прод нельзя?
Стенд-двойник ломается по кнопке и восстанавливается по кнопке — и за это, что характерно, никого не увольняют.
Вариантов развития десятки: с чего начать, что учить первым?
И не надо знать. Диагностика за тридцать минут выдаёт список из трёх тем — ваших, а не «для всех».
Приходится самому собирать материалы по крупицам, а потом самому же придумывать себе задачи для тренировки?
Можете забыть об этом. Инциденты ставятся как боевые тикеты, с алертами и эскалацией.
Не понимаете, по каким критериям вас вообще оценивают — на дежурстве, на собеседовании?
Чек-лист выдаётся до старта, а не после провала. Согласитесь, это несколько разные вещи.
Сколько обычно уходит, чтобы перестать бояться дежурства? Год? Три? Пять случайных аварий, из которых удалось выбраться?
Теперь сорок восемь часов.
«Дежурство без паники» делает всё сам. Ломает инфраструктуру сам. Ставит задачу как боевой тикет сам. Считает время до диагноза сам. Уже не нужен ментор за 15 000 ₽ в час, чтобы разобрать один инцидент: стенд выдаёт десять — и каждый доводится до причины, а не до «перезагрузка помогла». Перезагрузка, признаем, иногда действительно помогает — просто это не диагноз, а отсрочка.
Каждый существует не для полноты набора, а под конкретную причину, по которой рефлекс диагностики не появляется сам.
Десять сценариев из личной практики на проектах-миллионниках: падение Nginx под пиком, split-brain кворума etcd, деградация базы на распродаже, утечка file descriptors, каскадный отказ через таймауты. Каждый — под таймером, с настоящими алертами и эскалацией.
Копия нагруженной инфраструктуры с генератором боевого трафика. Один инцидент можно перепройти пять раз подряд, меняя гипотезу.
Один маршрут из трёх-пяти тем вместо перебора программ месяцами. Плюс зафиксированный факт: что вы уже тянете на уровне Senior.
По два-четыре часа, каждый с измеримым артефактом: рабочий конфиг, дашборд, runbook. Назначаются по итогам диагностики, а не по каталогу.
После каждого инцидента — блок «что стояло за симптомом» и письменный постмортем: гипотеза, проверка, опровержение, корень, что чинит класс проблем целиком.
Две персональные сессии по записи вашего прохождения, а не по общему эталону. Не «правильный ответ», а развилки: где вы потеряли пятнадцать минут на ложной гипотезе и по какому признаку её можно было отбросить сразу.
Правильный вопрос, и я отвечу прямо, без «у нас уникальная авторская методика».
$ diff --autocheck vs method
Автопроверка на стенде смотрит одно: поднялся сервис или не поднялся. Она не отличает инженера, который дошёл до причины, от инженера, который наугад перезапустил три компонента и попал. Обе попытки засчитываются одинаково. А на дежурстве в три ночи и на собеседовании через месяц разница между ними — решающая.
# поэтому здесь после каждой аварии есть то, чего автопроверка не даёт:
+ письменный постмортем по шаблону: гипотеза, проверка, чем опровергли, корень, что чинит класс проблем целиком
+ две персональные сессии по записи вашего прохождения — не «правильный ответ», а развилки, где вы потеряли пятнадцать минут на ложной версии
+ тридцать дней сопровождения на вашем настоящем инциденте после практики: стенд заканчивается, а дежурства нет
Прежде чем смотреть на цену — прикиньте, во что вам обходится её отсутствие.
И ещё одно соображение — про риск. Главный практический совет Талеба — «стратегия штанги»: держать 80–90% активов в безопасном и предсказуемом, а оставшееся вкладывать в ставки с ограниченным риском и большой потенциальной выгодой. Он пережил по этой схеме и «Чёрный понедельник» 1987 года, и кризис 2008-го, причём оба раза с прибылью. Ваша зарплата и текущий грейд — это те самые 80–90%. Один уикенд и один платёж — как раз оставшаяся часть: риск ограничен суммой, а выгода при удачном исходе измеряется грейдом, а не процентами.
| Десять разборов инцидентов с ментором-практиком (10 × 12 000 ₽) | 120 000 ₽ |
| Изолированный контур с кластером, мониторингом и генератором нагрузки силами подрядчика | от 50 000 ₽ |
| Комплект регламентов инцидент-реагирования под заказ | от 40 000 ₽ |
| Собрать всё по частям на открытом рынке — двенадцать позиций, каждую можно проверить | 427 000 ₽ |
Сколько лет уходит, чтобы дойти до уверенности на дежурстве? Сколько настоящих Sev1 нужно пройти, чтобы появился рефлекс? И всё это без гарантии, что вам «повезёт» с частотой и тяжестью аварий.
Я отдаю систему в шесть раз дешевле по стратегической причине: хочу стать вашим первым результатом, которому вы доверяете. Дальше у меня есть вещи дороже и глубже, и там чек другой.
Эта цена — для тех, кто со мной ещё не работал. Один раз.
Пятый достаётся первым десяти в потоке, шестой работает тридцать дней после — уже на вашем настоящем инциденте.
Модель отвечает уверенно всегда — и когда права, и когда нет. Здесь про то, как получать от неё пользу в три часа ночи и не пойти по красиво сформулированной ложной версии.
После уикенда у вас остаются не впечатления, а файлы. Десять постмортемов по шаблону и runbook'и к каждому классу аварий — написанные вашими руками и вашим языком.
Самое неприятное в оценке — что критерии есть, но их никто не проговаривает. Ни на дежурстве, ни на собеседовании. Здесь они выписаны.
Раз в квартал — короткий разбор того, что реально входит в вакансии и в инциденты, а что живёт только в лентах и на конференциях.
Стенд — это общая инфраструктура. А инциденты вам будет присылать ваша собственная, со своими странностями. Здесь мы смотрим именно её.
Стенд заканчивается в воскресенье, а дежурства — нет. Самый ценный разбор в вашей жизни случится не на стенде, а на первой боевой аварии после него.
| Инцидент-симулятор «10 дежурств за уикенд» | входит |
| Изолированный стенд-двойник | входит |
| Входная диагностика и персональная карта развития | входит |
| Точечные модули под ваши пробелы | входит |
| Постмортем-протокол «От симптома к причине» | входит |
| 1:1 разбор вашего решения с экспертом — две сессии | входит |
| Шесть бонусов, включая тридцать дней сопровождения | входит |
| Собрать это по частям на рынке — 427 000 ₽. Ваша цена | 69 900 ₽ |
Самый частый исход обучения — «было полезно» без единого файла на выходе. Здесь наоборот: всё, что вы сделали, остаётся у вас и переносится в команду.
Самый частый вопрос на этом месте — не «сколько», а «как это провести».
Первая закрывает риск «мне не подойдёт формат», вторая — риск «я не получу результат».
Отзывов выпускников у меня пока нет, и выдумывать их я не стану. Вместо них — открытый разбор, по которому видно метод в работе.
$ postmortem --case=firewall
Симптом. Приложение не отвечает. Метрики базы полностью зелёные, все компоненты в норме, мониторинг молчит.
Что оказалось. Потеряна сетевая связность между новым облаком и основным дата-центром: собственные правила файрвола, применённые пайплайном. Кеш какое-то время маскировал отказ и удлинил диагностику.
Диагностика заняла втрое больше времени, чем устранение. Ответ лежал в истории изменений инфраструктуры, куда за первые пятнадцать минут не посмотрел никто.
# вывод, который переносится: при инфраструктуре как код вопрос «что изменилось за последний час» адресуется git, а не людям в чате.
$ open habr.com/ru/articles/1078876 # ~10 000 читателей
Это не приём: под каждый заход поднимается отдельный стенд.
Если вы дочитали досюда, дело не в том, что вы мало знаете. Дело в том, что знание проверяется только под давлением, а давление на работе приходит без предупреждения и не в тот момент, когда вам удобно. Стенд — это способ получить давление по расписанию.
Первый инцидент — и вы уже понимаете, ваше это или нет. Если нет — возвращаю деньги полностью, без объяснений. То есть решение стоит вам не 69 900 ₽, а одного вечера субботы.
И про честность до конца: если вам нужно просто потренироваться гасить аварии, «Задачник DevOps» Слёрма за 7 900 ₽ сделает это дешевле. Разница здесь одна — там проверяют результат, здесь проверяют метод. Нужен только результат — берите Задачник, я не обижусь.
Через два дня у вас на руках десять решённых инцидентов с зафиксированным временем до диагноза, карта из трёх-пяти пробелов, десять постмортемов и библиотека runbook'ов, которую можно принести в свою команду.
Кому не подойдёт. Это апгрейд, а не вход с нуля: нужен рабочий опыт эксплуатации от года. Если вы дежурите давно и уверенно, а не хватает только системы — вам дешевле взять «Протокол дежурного».