ML-аналитик в AI-команду Яндекс 360
Описание
Мы ищем ML-аналитика, который возьмёт на себя оценку качества продуктовых ИИ-функций и агентов. Такие решения уже появляются в Почте, Диске, Документах, Таблицах, Календаре, Телемосте и других сервисах Яндекс 360. ИИ-функции ищут информацию, готовят документы, пересказывают встречи и выполняют действия через инструменты. Для каждого сценария нужно понимать, насколько хорошо он работает на реальных запросах и что меняется после обновления модели, промпта, агента или тулов. Какие задачи вас ждут Построение системы оценки качества моделей и агентовВам предстоит разработать и внедрить LLM-as-a-judge для автоматической оценки ответов моделей, а также построить eval-систему для оценки качества агентов. С её помощью команда будет проверять, насколько хорошо агенты решают пользовательские задачи и работают с тулами на каждом шаге. Создание пайплайнов обработки данныхВы будете работать с текстовыми и мультимодальными данными, создавая надёжные и эффективные пайплайны для сбора данных обучения и оценки. Ваша задача — автоматизировать процессы, чтобы данные были всегда актуальными и качественными. Разработка end-to-end-метрик для агентов Яндекс 360Вы поможете разработать систему офлайн-метрик для агентов Яндекс 360: определить критерии качества, построить пайплайны и подобрать данные для оценки. Встраивание решений в продакшнСозданные вами инструменты и метрики не должны оставаться в виде прототипов. Важной частью работы будет интеграция ваших решений в продовые процессы команды ML-разработчиков и аналитиков. Мы ждём, что вы Уверенно работаете с Python и SQL, анализируете данные с помощью pandas или похожих инструментов Пишете поддерживаемый аналитический код и умеете доводить пайплайны до регулярной работы Хорошо знаете теорию вероятностей и математическую статистику Понимаете, как работают ML-модели и как оценивать их качество Умеете ставить эксперименты, собирать репрезентативные выборки и находить смещения в данных Можете связать качество модели с продуктовым сценарием и поведением пользователей Самостоятельно разбираетесь в новой области и умеете договориться с разработчиками и продуктовыми командами о критериях качества Будет плюсом, если вы Оценивали LLM, RAG-системы или агентов, которые работают с инструментами Работали с экспертной или краудсорсинговой разметкой Проводили онлайн-эксперименты и анализ продуктовых метрик Знакомы с NLP или мультимодальными моделями Запускали новую аналитическую или ML-практику