Ведущий SRE-инженер [Скоринг, МТС Веб Сервисы]

з/п не указана
МТС
Москва Постоянная занятость Полный день

Описание

BIG DATA МТС – место, где телеком данные превращаются в реально работающие IT-продукты. Мы создали и протестировали несколько десятков сервисов. Самые успешные из них уже стали частью экосистемы МТС. Например, МТС Маркетолог, рекомендации в KION (МТС ТВ), услуга “Кто звонит?” или Спам blacklist. КОГО МЫ ИЩЕМ? SENIOR PRODUCT SRE В ПРОДУКТ СКОРИНГ ОПИСАНИЕ ПРОДУКТА:Скоринг - это коммерческий B2B продукт для уменьшения рисков и затрат B2B-клиентов. Скоринг состоит из 2-х направлений: рисковый и антифрод. ЧЕМ ПРЕДСТОИТ ЗАНИМАТЬСЯ Обеспечивать и развивать надежность ИТ-продукта: формировать технический бэклог по SRE-направлению, приоритизировать задачи по устранению технического долга внутри продукта. Внедрять методологию управления надежностью (SLA/SLO/SLI) для сервисов продукта, проектировать сквозные метрики стабильности инфраструктуры и приложений. Разрабатывать и внедрять архитектурные стандарты отказоустойчивости распределенных компонентов внутри продукта (highload-сервисы, очереди, аналитические БД). Построить и развивать систему сквозной наблюдаемости (Observability): проектировать и внедрять кастомные метрики, дашборды, логирование и распределенную трассировку для всей инфраструктуры продукта. Локализовать и устранять инциденты: участвовать в дежурствах (on-call), организовывать разбор аварий (Post-mortem), находить корневые причины сбоев (Root Cause) и автоматизировать их предотвращение. Плотно взаимодействовать с командой разработки: помогать разработчикам и аналитикам проектировать архитектуру приложения с учетом нефункциональных требований и бюджетов ошибок (Error Budgets). ЧТО НУЖНО ДЛЯ ЭТОЙ РАБОТЫ Опыт работы в роли SRE / Infrastructure / DevOps / Platform Engineer от 3–5 лет в крупных высоконагруженных или Big Data проектах. Отличное понимание Highload-архитектуры и специфики Big Data решений: практический опыт работы с распределенными брокерами (Apache Kafka), аналитическими БД (Hadoop, ClickHouse) и микросервисами. Глубокие знания в области построения систем Observability: экспертное владение стеком Prometheus, VictoriaMetrics, OpenTelemetry, Grafana; умение настраивать сквозной мониторинг от системных до бизнес-метрик. Понимание архитектурных паттернов отказоустойчивости распределенных систем (Circuit Breaker, Rate Limiting, Graceful Shutdown, механизмы репликации и кэширования). Инженерный подход к разбору инцидентов: опыт внедрения культуры Post-mortem, умение декомпозировать сложные системные аварии на понятные технические задачи. Развитые коммуникативные навыки: умение аргументированно защищать требования к надежности перед командой разработки и совместно находить баланс между скоростью доставки фич и стабильностью системы. ЧТО ПРЕДЛАГАЕМ собственную платформу MTS Ocean для получения ИТ-ресурсов, а это значит, что деплой, мониторинг, observability — не будут для тебя проблемой, ты сможешь сосредоточиться на фичах; профессиональные гильдии инженеров, где мы поддерживаем друг друга и помогаем стать лучше; внутреннюю площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации; участие во внешних IT конференциях. Мы выступаем на HighLoad++, DataFest, Mobius, Test Driven Conf, Joker, DevOps, Матемаркетинг и даже проводим собственную конференцию по архитектуре True Tech Arch; полезные курсы и вебинары в корпоративном университете и электронную библиотеку. А еще: ДМС с первого месяца работы, включая стоматологию; страхование от несчастных случаев с 1 месяца работы. Материальную помощь в сложных жизненных ситуациях; отпуск 28 календарных дней; прием врачей общей практики и массаж в офисе; мобильная связь за счет компании и льготные тарифы для близких; подписка на онлайн-кинотеатр KION, сервис МТС Музыка, книжный сервис Строки от МТС, безлимитные мессенджеры и соцсети.

Откликнуться
Источник: hh · 3 дня назад

Похожие вакансии в городе Москва

Все вакансии в городе Москва →