fokcus

Инженер ИТ

ООО "БИТРИКС" · Калининградская область

Уже не новая Висит 2 мес назад. Часто такие уже закрыли, но объявление не сняли

Обязанности

  • Разработка, развёртывание и оптимизация инфраструктуры для инференса больших языковых моделей (LLM), включая BitrixGPT, локальные и облачные модели.
  • Внедрение и обслуживание стеков для LLM, таких как vLLM, Nvidia Triton Inference Server и аналоги.
  • Оптимизация распределения нагрузки, батчинга и стриминга токенов.
  • Настройка, эксплуатация и оптимизация GPU-кластеров: управление ресурсами, планирование загрузки, снижение стоимости владения.
  • Профилирование и отладка сервисов инференса для улучшения latency и throughput.
  • Настройка наблюдаемости AI-стека: сбор метрик, логирование, трассировка, алертинг с использованием Prometheus, Grafana и других инструментов.
  • Разработка дашбордов для мониторинга доступности, задержек, ошибок и стоимости инференса.
  • Участие в разработке и улучшении платформенных процессов, сотрудничество с командами разработки и data science, ревью архитектуры и сервисов, обмен экспертизой.

Требования

  • Опыт эксплуатации ML-/LLM-сервисов.
  • Практические навыки контейнеризации и оркестрации (Docker).
  • Владение Python для разработки сервисов, утилит, оркестрации и автоматизации.
  • Понимание архитектуры трансформеров, токенизации, контекстного окна, влияния параметров (batch size, KV-cache) на latency и throughput.
  • Опыт настройки мониторинга и логирования в production (Prometheus, Grafana, ELK-стек, Sentry или аналоги).
  • Навыки анализа и оптимизации производительности сервисов: профилирование, устранение узких мест.
  • Готовность отстаивать мнение и предлагать улучшения.
  • Желателен опыт работы с vLLM и/или SGLang.
  • Опыт работы с GPU-инфраструктурой: CUDA, мониторинг и тюнинг GPU-нагрузки.
  • Знание принципов безопасной разработки и эксплуатации веб-сервисов.

Навыки

Показать как в источнике
Инженер ИТ

ЧТО МЫ ОЖИДАЕМ ОТ КАНДИДАТА:Продовый опыт эксплуатации ML-/LLM-сервисов.Практический опыт работы с контейнеризацией и оркестрацией (Docker).Владение Python для разработки сервисов, утилит, оркестрации и автоматизации.Понимание устройства современных LLM: архитектура трансформеров, токенизация, контекстное окно, влияние параметров (batch size, KV-cache) на latency и throughput.Опыт настройки мониторинга и логирования в production (Prometheus, Grafana, ELK-стек, Sentry или аналоги).Навыки анализа и оптимизации производительности сервисов: профилирование, поиск и устранение узких мест.Готовность отстаивать своё мнение и предлагать улучшения для достижения наилучшего результата.ТАКЖЕ ДЛЯ НАС ВАЖНО:Практический опыт работы с vLLM и/или SGLang.Опыт работы с GPU-инфраструктурой: CUDA, мониторинг и тюнинг GPU-нагрузки.Знание принципов безопасной разработки и эксплуатации веб-сервисов.

MLOps (Инженер LLM-инфраструктуры) AI Platform Team отвечает за всю инфраструктуру AI: от исследований моделей до их продакшн-запуска.Наша задача дать продуктам надёжный и эффективный доступ к LLM. Строить отказоустойчивые системы, которые держат нагрузку.Мы ищем инженера, который будет проектировать, разворачивать и оптимизировать платформу для инференса больших языковых моделей. Работать с vLLM/Triton, GPU-кластерами, observability-стеком, чтобы модели работали быстро, стабильно и экономично.Если вы строили высоконагруженные ML-системы и хотите решать инфраструктурные задачи в области LLM давайте обсудим.ЧЕМ ПРЕДСТОИТ ЗАНИМАТЬСЯ:Развитие и эксплуатация инфраструктуры для инференса LLM, включая BitrixGPT, локальные и облачные модели:внедрение стеков для эффективного обслуживания LLM, таких как vLLM, Nvidia Triton Inference Server и их аналогов,оптимизация схем распределения нагрузки, батчинга и стриминга токенов.Настройка, эксплуатация и оптимизация GPU-кластеров для инференса:управление ресурсами, планирование загрузки (capacity planning), снижение стоимости владения.Профилирование и отладка сервисов инференса:поиск и устранение узких мест, влияющих на задержки (latency) и пропускную способность (throughput).Настройка наблюдаемости (observability) AI-стека:сбор метрик, логирование, трассировка и алертинг (Prometheus, Grafana и других инструментов,разработка дашбордов для мониторинга доступности, задержек, ошибок и стоимости инференса.Участие в разработке и улучшении платформенных процессов:совместная работа с командами разработки и data science,ревью архитектуры и сервисов, обмен экспертизой на внутренних митапах.

Похожие вакансии