368,634open jobs
9,437companies
50,578added this week
Browse all
Salary
$18k – $46k per year (Estimated)
Location
Remote/Hybrid (Moscow, Russia)
Employment
Full-Time
Overview
Company
Impact
Profile match
Cloud.ru is a major Russian provider of cloud services and artificial intelligence solutions, formerly operating under the name SberCloud. The company offers full-stack infrastructure and platform tools (IaaS, PaaS, and machine learning environments) to support enterprises, startups, and developers across various industries. Operating through robust Tier III data centers, it delivers high-performance compute resources, managed cloud products, and enterprise-grade security compliance.

Обязанности:

  • Готовить LLM и другие генеративные модели к промышленному запуску;

  • Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;

  • Создавать воспроизводимые контейнерные образы и конфигурации model serving;

  • Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;

  • Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;

  • Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;

  • Проводить профилирование, функциональные и нагрузочные тесты моделей;

  • Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;

  • Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;

  • Настраивать метрики, логи и трассировку model-serving-сервисов;

  • Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;

  • Контролировать потребление GPU, утилизацию памяти и стоимость inference;

  • Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;

  • Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;

  • Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;

  • Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;

  • Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.

Требования:

  • Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;

  • Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;

  • Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;

  • Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью;

  • Знание методов квантизации и их влияния на качество и производительность;

  • Практический опыт работы с GPU, CUDA и инструментами диагностики;

  • Уверенное владение Python;

  • Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes;

  • Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency;

  • Опыт настройки мониторинга и профилирования inference-сервисов;

  • Знание Linux, Git и основных принципов CI/CD;

  • Умение документировать эксперименты и принимать решения на основании измеримых результатов.

## Будет преимуществом

  • Опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference;
  • Знание PyTorch и Hugging Face Transformers;
  • Опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels;
  • Опыт работы с Ray Serve, KServe, Seldon или аналогичными системами;
  • Понимание особенностей MoE-моделей, speculative decoding и prefix caching;
  • Опыт построения автоматизированного контура оценки качества LLM;
  • Опыт эксплуатации моделей в on-premise или изолированных средах;
  • Опыт расчета и оптимизации unit-экономики inference.
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
368,634 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Similar stack
Same company
Moscow
$18k – $46k per year (Estimated) • In office • Full-Time • Moscow
DevOps
Ansible
ArgoCD
AWS
CI/CD
Docker
GitLab CI
Helm
Kubernetes
OpenTofu
Terraform
Terragrunt
Yandex Cloud
GitLab
Apply
$32k – $57k per year (Estimated) • Remote • 4+ years exp • Moscow
Python
Python
Django
FastAPI
Databases
MySQL
PostgreSQL
DevOps
CI/CD
Docker
Grafana
Prometheus
Apply
$23k – $62k per year (Estimated) • In office • Full-Time • 10+ years exp • Gurgaon
C#
SQL
Databases
Apache Kafka
Redis
DevOps
Azure
CI/CD
Docker
gRPC
Kubernetes
Apply
up to $48k per year (net) • Remote/Hybrid • Moscow
Node JS
Python
TypeScript
JavaScript
Node JS
Nest.JS
Python
Django
FastAPI
Databases
Apache Kafka
pgvector
Pinecone
PostgreSQL
Qdrant
RabbitMQ
Redis
AI/ML
Chain-of-Thought
Claude
Claude Code
Copilot
Cursor
LangChain
LlamaIndex
LLM
Prompt Engineering
RAG
Anthropic
Function Calling
OpenAI
Structured Outputs
Frontend
GraphQL
Next.js
React.js
Redux
Redux Toolkit
Zustand
Mobile
State Management
DevOps
AWS
CI/CD
Docker
GCP
GitHub Actions
GitLab CI
Grafana
Kubernetes
Prometheus
Yandex Cloud
GitHub
GitLab
Apply
$24k – $64k per year (Estimated) • Remote/Hybrid • Full-Time • 8+ years exp • Bachelor's Degree • Chennai
Python
Scala
SQL
TypeScript
JavaScript
Java
Python
pySpark
Java
Spring Boot
Databases
Apache Kafka
Databricks
AI/ML
AI Agents
Copilot
Google ADK
LLM
NLP
Prompt Engineering
Spark
Devin
Model Context Protocol
Frontend
Angular
React.js
DevOps
AWS
Azure
CI/CD
Docker
GCP
Kubernetes
OpenShift
GitHub
Analytics
ETL/ELT
Apply
$12k – $22k per year (Estimated) • Remote • Full-Time • Moscow
Databases
Apache Kafka
MySQL
PostgreSQL
Redis
DevOps
Kubernetes
Nginx
OpenStack
Proxmox VE
VMWare
Apply
$18k – $45k per year (Estimated) • Remote • Full-Time • Moscow
DevOps
CI/CD
Loki
OpenTelemetry
Prometheus
SLI/SLO/SLA
Grafana
Chips/EDA
PoC Library
Analytics
ETL/ELT
Apply
$17k – $44k per year (Estimated) • Remote • Moscow
DevOps
Ansible
ArgoCD
CI/CD
Git
GitOps
Kubernetes
Terraform
Cybersecurity
Least Privilege
Apply
$23k – $49k per year (Estimated) • Remote/Hybrid • 3+ years exp • Moscow
DevOps
AWS
Azure
GCP
Kubernetes
Yandex Cloud
Apply
$18k – $49k per year (Estimated) • Remote/Hybrid • Moscow
AI/ML
Embeddings
Fine-tuning
LLM
RAG
Apply
$22k – $41k per year (Estimated) • Remote • 3+ years exp • Moscow
Python
SQL
AI/ML
LLM
OpenAI
Analytics
Power BI
Tableau
Apply
$21k – $44k per year (Estimated) • Remote • Full-Time • 3+ years exp • Moscow
Python
SQL
Databases
ClickHouse
PostgreSQL
AI/ML
Airflow
DevOps
Amazon S3
Apply
$21k – $35k per year • In office • Moscow
Bash
Python
Databases
MySQL
PostgreSQL
DevOps
Ansible
Debian
Grafana
Proxmox VE
Ubuntu
Zabbix
Apply
$11k – $22k per year (Estimated) • In office • Full-Time • Moscow
Management
Confluence
Jira
Apply
$19k – $46k per year (Estimated) • Remote • Full-Time • Moscow
SQL
Management
Confluence
Jira
Apply
See all jobs
This is one of many
368,634 more open roles from verified company boards, updated every day.