SRE-инженер в команду AI-агентов Фантеха
Плюс Фантех
Санкт-Петербург
Полная занятость
Описание
Фантех — бизнес-юнит Яндекса. Мы развиваем развлекательные онлайн-сервисы Яндекс Плюса: Кинопоиск, Музыку, Яндекс Афишу, Книги и другие продукты. Наша задача — создавать технологии, которые помогают пользователям быстрее и удобнее находить интересный контент.
Наша команда разрабатывает AI‑продукты. Один из них — Люмен, AI‑собеседник на медийную тематику. Он помогает выбирать контент в сервисах Фантеха, учитывает интересы пользователя и поддерживает разговор о кино, музыке, книгах и других развлечениях.
Мы ищем SRE-инженера для эксплуатации уже работающих AI‑сервисов, развития наблюдаемости и поддержки команд при запуске новых микросервисов.
Какие задачи вас ждут:
Обеспечивать надёжность AI‑сервисов
Вы будете следить за состоянием работающих сервисов, участвовать в дежурствах, диагностировать нештатные ситуации и устранять их причины. Важно не только восстанавливать работу системы, но и снижать вероятность повторения подобных сбоев.
Развивать наблюдаемость
Вам предстоит улучшать мониторинг, логирование и алертинг, определять критичные показатели сервисов и внедрять практики SLI, SLO и error budget. Это поможет команде принимать решения о надёжности на основе данных и раньше замечать проблемы.
Помогать запускать новые микросервисы
Вы будете вместе с разработчиками проектировать инфраструктуру новых компонентов, настраивать их развёртывание и интеграцию с общей платформой. В работе мы используем внутренние инструменты Яндекса, включая Yandex Deploy и IDP.
Автоматизировать эксплуатацию
Вы станете писать инструменты на Python, развивать CI/CD и автоматизировать создание и настройку инфраструктуры. Цель — уменьшать объём ручных операций и делать запуск изменений предсказуемее.
Развивать инженерные практики
Вам предстоит участвовать в проектировании отказоустойчивых решений, разбирать инциденты и помогать команде улучшать процессы разработки и эксплуатации.
Больше о разработке в Яндексе — в канале Yandex for Developers
Мы ждем, что вы:
- Работали с Linux или другими Unix-системами и умеете диагностировать системные проблемы
- Понимаете сетевые протоколы, DNS, HTTP, балансировку и маршрутизацию
- Умеете строить мониторинг, анализировать логи и настраивать полезные алерты
- Программируете на Python и используете код для автоматизации инфраструктурных задач
- Работали с системами оркестрации и Infrastructure as Code: Kubernetes, Terraform, Ansible или аналогами
- Понимаете устройство CI/CD и путь изменения от кода до эксплуатации в продакшене
- Работали с облачной инфраструктурой
- Умеете работать с базами данных, очередями и кешами
- Понимаете принципы построения отказоустойчивых распределённых систем
- Знакомы с SLI и SLO и готовы участвовать в развитии этих практик
- Готовы участвовать в дежурствах и сопровождать критичные сервисы
- Умеете обсуждать инфраструктурные и архитектурные решения с разработчиками
Будет плюсом:
- Эксплуатировали высоконагруженные системы и занимались capacity planning
- Внедряли SLI, SLO и error budget
- Обеспечивали надёжность сервисов, взаимодействующих с LLM или внешними API
- Знакомы с особенностями наблюдаемости и диагностики AI‑систем
- Проводили нагрузочное тестирование и оптимизировали производительность сервисов
Наша команда разрабатывает AI‑продукты. Один из них — Люмен, AI‑собеседник на медийную тематику. Он помогает выбирать контент в сервисах Фантеха, учитывает интересы пользователя и поддерживает разговор о кино, музыке, книгах и других развлечениях.
Мы ищем SRE-инженера для эксплуатации уже работающих AI‑сервисов, развития наблюдаемости и поддержки команд при запуске новых микросервисов.
Какие задачи вас ждут:
Обеспечивать надёжность AI‑сервисов
Вы будете следить за состоянием работающих сервисов, участвовать в дежурствах, диагностировать нештатные ситуации и устранять их причины. Важно не только восстанавливать работу системы, но и снижать вероятность повторения подобных сбоев.
Развивать наблюдаемость
Вам предстоит улучшать мониторинг, логирование и алертинг, определять критичные показатели сервисов и внедрять практики SLI, SLO и error budget. Это поможет команде принимать решения о надёжности на основе данных и раньше замечать проблемы.
Помогать запускать новые микросервисы
Вы будете вместе с разработчиками проектировать инфраструктуру новых компонентов, настраивать их развёртывание и интеграцию с общей платформой. В работе мы используем внутренние инструменты Яндекса, включая Yandex Deploy и IDP.
Автоматизировать эксплуатацию
Вы станете писать инструменты на Python, развивать CI/CD и автоматизировать создание и настройку инфраструктуры. Цель — уменьшать объём ручных операций и делать запуск изменений предсказуемее.
Развивать инженерные практики
Вам предстоит участвовать в проектировании отказоустойчивых решений, разбирать инциденты и помогать команде улучшать процессы разработки и эксплуатации.
Больше о разработке в Яндексе — в канале Yandex for Developers
Мы ждем, что вы:
- Работали с Linux или другими Unix-системами и умеете диагностировать системные проблемы
- Понимаете сетевые протоколы, DNS, HTTP, балансировку и маршрутизацию
- Умеете строить мониторинг, анализировать логи и настраивать полезные алерты
- Программируете на Python и используете код для автоматизации инфраструктурных задач
- Работали с системами оркестрации и Infrastructure as Code: Kubernetes, Terraform, Ansible или аналогами
- Понимаете устройство CI/CD и путь изменения от кода до эксплуатации в продакшене
- Работали с облачной инфраструктурой
- Умеете работать с базами данных, очередями и кешами
- Понимаете принципы построения отказоустойчивых распределённых систем
- Знакомы с SLI и SLO и готовы участвовать в развитии этих практик
- Готовы участвовать в дежурствах и сопровождать критичные сервисы
- Умеете обсуждать инфраструктурные и архитектурные решения с разработчиками
Будет плюсом:
- Эксплуатировали высоконагруженные системы и занимались capacity planning
- Внедряли SLI, SLO и error budget
- Обеспечивали надёжность сервисов, взаимодействующих с LLM или внешними API
- Знакомы с особенностями наблюдаемости и диагностики AI‑систем
- Проводили нагрузочное тестирование и оптимизировали производительность сервисов