fokcus

MLOps (банк)

Selecty · Россия · удалённо

Свежая вакансия Появилась 6 дн назад

Обязанности

  • Разработка и поддержка CI/CD пайплайнов для деплоя AI-агентов и мультиагентных систем.
  • Развертывание и оптимизация LLM/VLM моделей с использованием vLLM, Triton Inference Server, SGLang.
  • Обеспечение высокой доступности сервисов, масштабирование и управление состоянием агентов.
  • Внедрение мониторинга метрик CPU/GPU, задержек, качества генерации, дрейфа данных и оценки тональности ответов.

Требования

  • Опыт вывода LLM-решений в продакшен.
  • Уверенное владение Python, asyncio, Kubernetes (Helm, управление кластерами).
  • Знание Gitlab CI, Jenkins.
  • Понимание архитектуры RAG-систем, embedding-моделей и ранжирования.
  • Навыки оптимизации инференса: квантизация, continuous batching, PagedAttention.
  • Приветствуется опыт с графовыми БД и мультиагентными системами.

Технологии

Python, FastAPI, langchain/llamaindex/haystack, Kubernetes, Docker, S3, Postgres, векторные и графовые БД.

Условия

  • Оформление по ТК РФ в IT-аккредитованную компанию.
  • ДМС, включая стоматологию.
  • Компенсация фитнеса.
  • Скидки на обучение английскому (Skyeng).
  • Индексация зарплаты.
  • Современная техника.

Навыки

Показать как в источнике
Публикатор: Nelly
Обсуждение: 
#вакансия #MLOps #DevOps #Python #LLM #AI #MachineLearning
#Kubernetes #Docker #CI_CD #PostgreSQL

Мы создаем экосистему цифровых сотрудников на базе передовых открытых LLM/VLM-моделей. Наши ИИ-агенты автоматизируют ключевые операционные процессы, напрямую влияя на эффективность и конкурентное преимущество бизнеса наших заказчиков.

Компания: Selecty 
Позиция: MLOps (банк)
Уровень дохода: 250-340 к гросс
Формат: оформление по ТК РФ
Удаленка РФ


чем предстоит заниматься:

Ты станешь ключевым инженером, который превращает исследовательские прототипы в отказоустойчивую GenOps-фабрику цифровых агентов. 

Твои задачи: DevOps для AI: 
Проектирование и развитие самообслуживания CI/CD пайплайнов для внутреннего деплоя AI-агентов и мультиагентных систем. 

Инференс под управление: Развертывание и оптимизация LLM/VLM в процессе разработки (оптимизация памяти, формирование скорости) с использованием vLLM, Triton Inference Server, SGLang. 

Надёжность: Обеспечение высокой доступности сервисов, работа с масштабированием горизонтальных подов и управление состоянием агентов. 

Мониторинг 360°: Внедрение комплексного наблюдения: от стандартных метрик (CPU/GPU, задержка) до конкретных ML-метрик (качество генерации, дрейф данных, оценка тональности ответов).

Обязательные требования

   Опыт вывода LLM-решений в прод.
 * Уверенное владение Python и асинхронным программированием (asyncio).
 * Уверенное владение Kubernetes (Helm, управление кластерами).
 * Знание Gitlab CI, Jenkins и пр
 * Понимание архитектуры RAG-систем, работы embedding-моделей и ранжирования.
 * Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
 * Будет плюсом: опыт с графовыми БД и построением мультиагентных систем

  Технологический стек:
 Python, FastAPI, langchain/llamaindex/haystack k8s, docker, S3, postgres
Опыт работы с векторными и графическими БД.


 Условия

Оформление по ТК РФв в IT-аккредитованную компанию
ДМС (включая стоматологию)
Компенсация фитнеса
Скидки на обучение английскому (Skyeng)
Индексация заработной платы
Современная техника
IT-аккредитация компании

Место для откликов: @Nelly_Selecty

@DevOpsSRE_Jobs

Похожие вакансии