663,523open jobs
38,718companies
99,026added this week
Browse all
Salary
$23k – $60k per year (Estimated)
Location
In office (Moscow)
Overview
Company
Impact
Profile match
Sber is Russia's largest bank and the centre of one of the country's biggest technology ecosystems, tracing its origins to savings institutions established in 1841. It serves over a hundred million retail customers and several million businesses through branch, mobile and web channels, and holds a dominant share of the national deposit, lending and payment markets. Over the past decade the group has built out an ecosystem well beyond banking, spanning e-commerce, food delivery, streaming media, cloud infrastructure, devices and the GigaChat family of large language models developed by its own AI research teams.

Наша команда отвечает за оценку модельного риска и независимый контроль генеративных моделей Банка. В нашей зоне ответственности GigaChat - текстовые и мультимодальные LLM - и open-source модели: команда первой видит, на что способна новая версия, прежде чем она выйдет к пользователям.

Нам нужен специалист, который возьмет на себя измерение качества GigaChat:

  • разработку бенчмарков и измерение на них качества модели - на собственных данных, а не по публичным лидербордам
  • развитие собственной библиотеки валидации LLM полного цикла: от сбора данных и разметки до финальных метрик и отчетов
  • вынесение заключения по модельному риску: при каких условиях версию можно выпускать и что осталось непроверенным.

Эта роль про независимое измерение фундаментального качества модели: не про обучение GigaChat - этим занимается отдельная команда - и не про продуктовые метрики вроде DAU и retention.

Обязанности

Развивать собственный фреймворк оценки LLM

  • писать чистый код фреймворка и проверять чужой: регулярные код-ревью, PR, поддержка растущей кодовой базы
  • настраивать автоматизацию и CI под растущую аудиторию и вести регулярную валидацию версий GigaChat и open-source альтернатив по единой методике - фреймворком пользуются команды по всему Банку.

Разрабатывать бенчмарки и проектировать проверку

  • разрабатывать и актуализировать собственные бенчмарки под ключевые сценарии Банка: подбор задач, редкие и намеренно трудные случаи, эталонные ответы
  • превращать запрос «модель стала лучше?» в план проверки: что измеряем, на какой выборке, с чем сравниваем.

Строить LLM-судей и автоматические метрики

  • делать судей под задачу, знать их перекосы (self-preference, position bias, length bias) и калибровать оценки против человеческих
  • понимать, где автоматическая оценка не годится и нужен другой подход, и снижать стоимость измерений без потери достоверности.

Давать заключение по модельному риску

  • оценивать автономность модели в сценарии и цену ее ошибки: что она делает без человека, что необратимого может произойти, какой худший реалистичный исход
  • формулировать условия выпуска - доля трафика, ограничения по сценариям, митигации, мониторинг - с явным перечнем непроверенного и защищать выводы перед командой разработки и руководством.

Следить за фронтиром

  • следить за новыми подходами в научном сообществе, читать статьи, писать собственные, внедрять лучшие практики оценки в процессы Банка
  • когда нужного инструмента не существует - создавать его самостоятельно.

Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.

Требования

  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой
  • статистика и дизайн эксперимента: доверительные интервалы, оценка необходимого размера выборки, проверка гипотез, поправки на множественные сравнения, разница между статистической и практической значимостью
  • понимаете, как устроены LLM изнутри: как работает трансформер и механизм внимания, почему текст разбивается на токены и к чему это приводит, как параметры генерации влияют на ответ, чем отличаются этапы обучения - предобучение, дообучение на инструкциях и обучение на человеческих предпочтениях
  • опыт работы с LLM и понимание, как оценивают генеративные модели: метрики, human evaluation, LLM-as-a-judge и его ограничения
  • привычка выяснять цену ошибки до начала работы - не бросаться считать метрики, не поняв, что именно проверяете
  • Готовность работать без готовой методологии, проактивность, умение декомпозировать большие задачи на решаемые.

Будет плюсом:

  • опыт с open-source моделями и инференсом: vLLM, SGLang, inference API, prompt engineering
  • опыт работы с мультимодальными моделями: изображения, аудио
  • опыт построения evaluation-фреймворков и evaluation harness, встраивание оценок в CI/CD
  • работа с асессорами: постановка задачи разметчикам, контроль согласованности разметки
  • работа с coding-агентами (Claude Code, Codex, Cursor и аналоги)
  • представление о том, как удешевляют инференс: квантизация, дистилляция, PEFT/LoRA, спекулятивное декодирование
  • опыт с RAG: умеете оценивать поиск и генерацию по отдельности, понимаете, почему модель выдумывает факты и как на это влияют разбиение документов на фрагменты и их ранжирование; работали с векторным поиском и эмбеддингами.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • возможность выбрать удобный график - офис / гибрид
  • ежегодный пересмотр зарплаты и годовая премия по итогам работы 2-4 оклада
  • программа адаптации и помощь руководителя на старте
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • корпоративный спортзал и зоны отдыха
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трех близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
663,523 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account Continue with Google
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Similar stack
Same company
Moscow
$24k – $55k per year (Estimated) • In office • Full-Time • 4+ years exp • Bachelor's Degree • Gurgaon
Python
Ruby
PowerShell
Cybersecurity
GDPR
HIPAA
NIST 800-53
Threat Modeling
Apply
Remote • Part-Time • Athens
Python
JavaScript
SQL
Python
Django
Databases
PostgreSQL
DevOps
GCP
DigitalOcean
Heroku
Azure
AWS
Apply
$143k – $271k per year • Equity • In office • Full-Time • 5+ years exp • Master's Degree • San Jose
Python
AI/ML
Function Calling
AI Agents
NLP
PyTorch
LLM
RAG
Multi-Agent Systems
Tool Use
DevOps
Rest API
Azure
AWS
Docker
Apply
$8.5k – $13k per year • Remote • Full-Time • Nizhny Novgorod
Python
Java
Apply
$21k – $44k per year (Estimated) • In office • 4+ years exp • Moscow
Python
JavaScript
Java
TypeScript
Python
FastAPI
Java
Spring Boot
Databases
PostgreSQL
ElasticSearch
AI/ML
AI Agents
Frontend
React.js
Design
Figma
Management
Agile
Apply
$21k – $44k per year (Estimated) • In office • 4+ years exp • Moscow
Python
JavaScript
Java
TypeScript
Python
FastAPI
Java
Spring Boot
Databases
PostgreSQL
ElasticSearch
AI/ML
AI Agents
Frontend
React.js
Design
Figma
Management
Agile
Apply
$29k – $55k per year (Estimated) • In office • 5+ years exp • Moscow
SQL
Databases
PostgreSQL
Frontend
GraphQL
DevOps
gRPC
WebSockets
Design
Figma
Axure RP
Balsamiq
IoT
MQTT
QA
Swagger
Apply
$19k – $38k per year (Estimated) • In office • 2+ years exp • Moscow
Python
SQL
Apply
$20k – $41k per year (Estimated) • In office • 2+ years exp • Moscow
AI/ML
LLM
Management
Agile
Apply
$43k per year (net) • In office • 3+ years exp • Moscow
Python
Python
Asyncio
Databases
Apache Kafka
AI/ML
AI Agents
LLM
RAG
DevOps
OpenShift
GitLab CI
CI/CD
Jenkins
Kubernetes
Self-Healing
Pipeline as Code
QA
Selenium
Playwright
Pytest
Apply
$24k per year (net) • In office • Bachelor's Degree • Moscow
JavaScript
Databases
ClickHouse
DevOps
gRPC
Docker
Nginx
Management
Agile
Scrum
Apply
$24k per year (net) • In office • Moscow
Python
C++
C++
Qt
AI/ML
OpenCV
CUDA Toolkit
CUDA
Management
Agile
Scrum
Apply
$30k – $64k per year (net) • Remote/Hybrid • Full-Time • Moscow
Apply
$24k – $46k per year (Estimated) • Remote/Hybrid • 4+ years exp • Moscow
Python
SQL
Databases
ClickHouse
Apply
Creative Designer 1 day ago
$13k – $29k per year (Estimated) • Remote • Moscow
Design
Adobe Photoshop
Figma
Adobe After Effects
Apply
See all jobs
This is one of many
663,523 more open roles from verified company boards, updated every day.