778,720open jobs
48,939companies
119,268added this week
Browse all
Salary
≈ $20k – $41k per year (Estimated)
Location
In office (Moscow)
Seniority
Architect

Confirmed on the employer's own hiring board on Sep 24, 2026. First seen by Alion on Sep 25, 2026. Sber scores A on the Alion truth index.

Overview
Company
Impact
Profile match
Sber is Russia's largest bank and the centre of one of the country's biggest technology ecosystems, tracing its origins to savings institutions established in 1841. It serves over a hundred million retail customers and several million businesses through branch, mobile and web channels, and holds a dominant share of the national deposit, lending and payment markets. Over the past decade the group has built out an ecosystem well beyond banking, spanning e-commerce, food delivery, streaming media, cloud infrastructure, devices and the GigaChat family of large language models developed by its own AI research teams.

Мы развиваем GigaChat и ищем сильного руководителя направления RL Efficiency. Это роль для человека, который возьмёт на себя эффективность всего RL-контура: обучающий цикл, rollout, reward-сигналы, взаимодействие с инференсом и инфраструктура под онлайн-эксперименты.

Цель направления - сделать так, чтобы online RL / RLHF / RLVR обучение GigaChat было максимально быстрым, стабильным и дешёвым: сократить time-to-feedback по экспериментам, поднять утилизацию кластера и упростить запуск новых RL-рецептов на масштабе.

Обязанности

Развивать направление RL Efficiency целиком

  • Определять, как должно развиваться направление эффективности RL: какие места критичны на данный момент, как измерять прогресс и что в первую очередь ограничивает скорость экспериментов.
  • Вести направление целиком: от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения.
  • Принимать решения о приоритетах между ускорением rollout, оптимизацией обучающего цикла, инфраструктурой и системой оценки качества.

Ускорять цикл online RL

  • Оптимизировать пайплайн online RL: генерация rollout'ов, сбор reward-сигналов, обновление весов модели, overlap этапов.
  • Выстраивать эффективное взаимодействие между обучающим контуром и инференс-движком (vLLM / SGLang / собственные решения), добиваясь высокой утилизации и низкой задержки.
  • Работать с весами и KV-cache: быстрое обновление весов между итерациями, снижение overhead синхронизаций, оптимизация памяти.
  • Повышать стабильность больших RL-прогонов: контроль деградаций, автоматическое восстановление, диагностика сбоев.

Развивать инфраструктуру под RL-эксперименты

  • Развивать фреймворк обучения, поддерживающий RLHF / RLVR / PPO / GRPO / DPO и их вариации на масштабе.
  • Делать так, чтобы новые RL-рецепты можно было быстро и безопасно запускать на больших моделях без ручной поддержки для каждого эксперимента.
  • Обеспечивать воспроизводимость RL-экспериментов: версионирование данных, конфигов, чекпоинтов, reward-моделей.

Писать ключевой код и оставаться сильным инженером

  • Самостоятельно писать и дорабатывать критичные части RL-пайплайна.
  • Профилировать обучение на всех уровнях стека и находить узкие места в rollout, обучении и коммуникациях.
  • Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и взаимодействии с hardware.

Руководить сильной технической командой

  • Руководить командой инженеров по эффективности RL, задавать высокую планку по качеству решений и перфу.
  • Помогать команде превращать исследовательские идеи в работающие решения, которые можно встроить в основной цикл RL-обучения.
  • Удерживать баланс между глубиной оптимизаций, инженерной надёжностью и практическим результатом для модели.

Требования

  • Отличное владение Python и PyTorch (DDP/FSDP, distributed training).
  • Практический опыт с обучением LLM и понимание механики RL post-training: RLHF, RLVR, PPO / GRPO / DPO.
  • Опыт оптимизации обучения и инференса LLM: профилирование, узкие места, параллелизм, mixed precision.
  • Понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), MoE и их влияние на rollout.
  • Способность самостоятельно взять направление и довести его до результата: от постановки задач до внедрения в продакшн-RL.
  • Опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

Будет плюсом

  • Опыт работы с современными RL-стэками: verl, TRL или собственные решения.
  • Опыт работы с large-scale inference (vLLM, SGLang, TRT-LLM) и оптимизацией генерации.
  • Опыт написания CUDA / Triton ядер и понимание особенностей NVIDIA GPU.
  • Понимание коммуникационного стека больших обучений: NCCL, NVSHMEM, RDMA/IB.
  • Опыт работы с кластерными системами: Slurm, Kubernetes, Ray или собственные оркестраторы.
  • Публикации, open-source вклад или сильный прикладной research track record.

Условия

  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
  • Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.
  • Команду сильных инженеров и исследователей.
  • Возможность совмещать управление направлением с глубокой технической работой.
  • Конкурентную компенсацию, премии и расширенный соцпакет.
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
778,720 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account Continue with Google
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Field & Service
Similar stack
Same company
Moscow
≈ $42k – $95k per year (Estimated) • In office • Full-Time • 4+ years exp • Aguadilla
Apply
$44k – $48k per year • In office • Full-Time • 2+ years exp • Kissimmee
Apply
Golf Cart Mechanic 2 hours ago
$32k per year • In office • Full-Time • High School Diploma • Kissimmee
Apply
$12k per year (net) • In office • Full-Time • Bratsk
Apply
$21k per year (net) • In office • Contractor • Moscow
Apply
≈ $15k – $36k per year (Estimated) • Remote (likely EAEU) • 1+ year exp • Moscow
Python
Python
FastAPI
Databases
PostgreSQL
Redis
Apache Kafka
AI/ML
LangGraph
LangChain
LoRA
Model Context Protocol
vLLM
Fine-tuning
Embeddings
Prompt Engineering
Function Calling
AI Agents
NLP
Ollama
PEFT
LLM
RAG
BERT
Reranking
Hybrid Search
Hugging Face
Structured Outputs
Tool Use
DevOps
Rest API
Docker Compose
Git
Docker
Apply
≈ $33k – $70k per year (Estimated) • In office • Moscow
Python
AI/ML
GigaChat
Transformers
PyTorch
LLM
Mixture of Experts
Apply
≈ $67k – $140k per year (Estimated) • Hybrid • Full-Time • Bachelor's Degree • United States
Python
PowerShell
DevOps
Rest API
Terraform
Ansible
Red Hat
VMWare
Windows Server
Hyper-V
Linux
Management
Agile
Apply
≈ $70k – $145k per year (Estimated) • In office • Full-Time • 5+ years exp • Lynchburg
Python
Java
PowerShell
Databases
ElasticSearch
DevOps
Prometheus
CI/CD
Grafana
Linux
Windows
Apply
≈ $39k – $117k per year (Estimated) • Remote (United Kingdom, Ireland) • 4+ years exp
Python
Java
Ruby
PowerShell
C#
Bash
C#
.NET
DevOps
Puppet
Ansible
Chef
CI/CD
AWS
Configuration Management
AWS Lambda
API Gateway
Linux
Windows
DNS
Management
Agile
Apply
≈ $20k – $41k per year (Estimated) • In office • Moscow
Python
AI/ML
RLHF
Chain-of-Thought
GigaChat
PyTorch
LLM
Synthetic Data
SFT
Post-training
Reward Modeling
Apply
≈ $18k – $37k per year (Estimated) • In office • Moscow
DevOps
SLI/SLO/SLA
Management
Telegram
Apply
≈ $14k – $29k per year (Estimated) • In office • Full-Time • 2+ years exp • Bachelor's Degree • Ufa
Apply
≈ $15k – $30k per year (Estimated) • In office • Full-Time • Nizhny Novgorod
Web3
DeFi
Management
Confluence
Jira
BPMN
Apply
≈ $19k – $40k per year (Estimated) • Hybrid • Moscow
Apply
≈ $26k – $53k per year (Estimated) • In office • 4+ years exp • Moscow
Databases
MySQL
PostgreSQL
ClickHouse
RabbitMQ
DevOps
Ansible
Zabbix
Docker Swarm
etcd
Prometheus
Git
Docker
Nginx
Grafana
Proxmox VE
Linux
DNS
Apply
≈ $13k – $23k per year (Estimated) • In office • 2+ years exp • Moscow
DevOps
Rest API
OpenShift
Jenkins
Git
Grafana
Bitbucket
Management
Confluence
Jira
Apply
≈ $20k – $50k per year (Estimated) • In office • Bachelor's Degree • Moscow
DevOps
Linux
Windows
Cybersecurity
IBM QRadar
SIEM
Apply
$21k – $28k per year • Remote (likely EAEU) • Moscow
PHP
PHP
Bitrix
AI/ML
Cursor
AI Agents
DevOps
SLI/SLO/SLA
Management
n8n
Apply
See all jobs
This is one of many
778,720 more open roles from verified company boards, updated every day.