Инженер данных в Автономный транспорт

Автономный транспорт
Санкт-Петербург
Полная занятость

Описание

Мы занимаемся инженерией данных в очень амбициозном и инновационном направлении Яндекса — в Автономном транспорте. Наша главная задача — обеспечивать полную и своевременную поставку данных с автономного флота в аналитические инструменты, благодаря которым команда может своевременно принимать решения и увеличивать скорость разработки.

Технологии, которые мы используем:
- Языки программирования — Python, SQL
- Хранилища — YTsaurus, ClickHouse, Logbroker (Kafka)
- Оркестраторы ETL-процессов, разработанные в Яндексе, — Nirvana, Logos

Какие задачи вас ждут:
Поставка и обработка данных в околореальном времени

Ключевая метрика автономного транспорта — среднее расстояние, пройденное до вмешательства водителя в управление автономным транспортным средством. Чтобы отслеживать эту метрику и оперативно реагировать на её изменения, крайне важно как можно быстрее получать структурированные и обработанные данные.

Повышение надёжности и оптимизация долговременного хранилища данных

Хранилище данных автономного транспорта занимает более 180 петабайт, и с увеличением размеров флота приток данных становится всё больше. Нам нужно уметь хранить данные как можно эффективнее, поскольку на их запись и хранение тратится много средств. Также необходимо внедрить систему бэкапов, чтобы обезопасить ключевые данные от массовых аварий в дата-центре.

Мониторинг скорости и полноты поставки данных

Нам крайне важно, чтобы разработанные нами пайплайны поставляли полные данные своевременно, а в случае проблем мы бы узнавали о них как можно раньше. Для этого мы разрабатываем систему сбора и визуализации метрик работы наших пайплайнов.

Поддержка и развитие аналитического DWH

Кроме основного массива данных с сенсоров машин, существует множество сервисов для операционного управления флотом. Чтобы снабжать аналитиков и операционных менеджеров необходимыми данными, мы построили DWH на основе данных этих сервисов.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

Мы ждем, что вы:
- Работали с Hadoop/YTsaurus/ClickHouse/другими MPP СУБД
- Уверенно владеете Python и SQL
- Умеете писать надёжные и производительные пайплайны обработки данных
- Не пренебрегаете инженерной культурой и инструментами разработки

Будет плюсом:
- Участвовали в проектировании и разработке хранилищ больших данных
- Владеете или хотите овладеть C++

Похожие вакансии