372,576open jobs
9,648companies
49,982added this week
Browse all
Salary
$30k – $88k per year (Estimated)
Location
In office (Moscow)
Employment
Full-Time
Overview
Company
Impact
Profile match
Sber is Russia's largest financial institution and one of the leading technology ecosystems in Eastern Europe. Originally founded as a state savings bank, it has evolved into a comprehensive digital service provider offering banking, e-commerce, cloud computing, and AI-driven solutions. Serving over 100 million retail clients, it plays a central role in the nation's financial system and digital transformation.

Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка.

Наша основная задача оценить флагманские генеративные модели Сбера - GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Мы не просто «проверяем метрики», а:

  • глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели
  • критически рассматриваем архитектурные и методологические решения и предлагаем улучшения
  • разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска
  • проводим оценку логов пользователей для построения наиболее релевантного тестирования

Отдельный фокус - R&D деятельность:

  • создание новых методологий оценки качества
  • участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)
  • адаптация передовых мировых бенчмарков под специфику банковских кейсов
  • и многое другое

Эта роль про независимое измерение фундаментального качества модели: не про их обучение - этим занимается отдельная команда.

Обязанности

Придумывать, как вообще измерить модель

ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве.

Отвечать за достоверность измерений

Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили.

Разбираться в причинах ошибок

«Модель ошиблась» - это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация - в следующую версию модели, которая этой ошибки уже не делает.

Строить автоматическую оценку

Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей.

Строить то, чем пользуются другие

Фреймворки оценки, который вы развиваете - общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне.

Требования

  • Умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов.
  • Статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
  • Понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация;
  • Понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
  • Опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
  • Продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели.
  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой.

Будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding

Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • гибкий формат и удаленной работы, в т.ч. на территории РФ
  • ежегодный пересмотр зарплаты и годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
372,576 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Similar stack
Same company
Moscow
LLM Model Developer 2 hours ago
$33k – $83k per year (Estimated) • In office • Full-Time • 5+ years exp • Pune
Java
Python
Python
Pydantic
AI/ML
A2A
AI Agents
Context Engineering
Fine-tuning
LangChain
LangGraph
LlamaIndex
LLM
Model Context Protocol
OpenAI
Prompt Engineering
RAG
TensorFlow
DevOps
Azure
Vector
Apply
$69k – $160k per year (Estimated) • In office • Full-Time • Bachelor's Degree • Germany
Python
SQL
Python
pySpark
AI/ML
PyTorch
Spark
DevOps
OpenShift
Apply
$107k – $147k per year • Remote/Hybrid • Full-Time • 6+ years exp • Bachelor's Degree • Columbia
Go
Java
Kotlin
Python
AI/ML
AI Agents
DevOps
Platform Engineering
Cybersecurity
HIPAA
Apply
$27k – $61k per year (Estimated) • Remote • Full-Time • 5+ years exp • Bachelor's Degree • India
PowerShell
Python
DevOps
Azure
Azure DevOps
GitLab
Grafana
Rest API
Cybersecurity
ISO 27001
OWASP SAMM
Threat Modeling
Analytics
Power BI
Tableau
Management
Jira
ServiceNow
Apply
$61k – $123k per year • In office • Full-Time • 1+ year exp • Bachelor's Degree • Madison
Bash
PowerShell
Python
AI/ML
Red Teaming
DevOps
AWS
Azure
Git
Kali Linux
Rest API
Cybersecurity
BloodHound
Burp Suite
CVSS
CWE
Metasploit
MITRE ATT&CK
Nmap
OWASP Top 10
Apply
$33k – $82k per year (Estimated) • In office • Full-Time • Nizhny Novgorod
Python
SQL
AI/ML
GigaChat
DevOps
CI/CD
Git
Management
Confluence
Jira
Apply
$46k – $87k per year (Estimated) • In office • Full-Time • 5+ years exp • Moscow
SQL
Databases
Apache Kafka
Management
Jira
Apply
Backend Developer 5 hours ago
$35k – $88k per year (Estimated) • In office • Full-Time • Moscow
Go
Java
Python
Python
Django
FastAPI
Databases
PostgreSQL
Redis
AI/ML
LangChain
LlamaIndex
LLM
RAG
Apply
$38k – $88k per year (Estimated) • In office • Full-Time • Samara
JavaScript
TypeScript
Frontend
AG Grid
ESLint
Headless UI
React Aria
React Query
React.js
Redux
Stylelint
TanStack Table
Zustand
Apply
$46k – $88k per year (Estimated) • In office • Full-Time • Moscow
Python
SQL
Python
pySpark
Databases
Greenplum
PostgreSQL
AI/ML
Hadoop
Spark
DevOps
Git
Apply
$14k – $29k per year (Estimated) • In office • Bachelor's Degree • Moscow
Design
Adobe Photoshop
Apply
$18k per year (net) • Remote/Hybrid • Bachelor's Degree • Moscow
MATLAB
MATLAB
Simulink
Chips/EDA
Altium Designer
KiCad
LTspice
Design
SolidWorks
Apply
$30k – $88k per year (Estimated) • In office • Full-Time • Moscow
Python
SQL
JavaScript
Python
Django
FastAPI
Databases
PostgreSQL
RabbitMQ
AI/ML
Function Calling
LangChain
LangGraph
LLM
NumPy
RAG
Structured Outputs
Frontend
Next.js
React.js
DevOps
CI/CD
Prometheus
Rest API
WebSockets
Apply
DevOps (middle) 1 hour ago
$22k – $40k per year (Estimated) • Remote • Full-Time • Moscow
Java
Kotlin
DevOps
Ansible
CI/CD
Docker
Git
GitHub
GitHub Actions
GitLab
GitLab CI
Grafana
Helm
Jenkins
Kubernetes
Prometheus
Apply
$17k per year (net) • In office • Full-Time • 1+ year exp • Moscow
SQL
Databases
MySQL
Apply
See all jobs
This is one of many
372,576 more open roles from verified company boards, updated every day.