690,007open jobs
40,470companies
97,511added this week
Browse all
Salary
$23k – $62k per year (Estimated)
Location
In office (Moscow)
Overview
Company
Impact
Profile match
Sber is Russia's largest bank and the centre of one of the country's biggest technology ecosystems, tracing its origins to savings institutions established in 1841. It serves over a hundred million retail customers and several million businesses through branch, mobile and web channels, and holds a dominant share of the national deposit, lending and payment markets. Over the past decade the group has built out an ecosystem well beyond banking, spanning e-commerce, food delivery, streaming media, cloud infrastructure, devices and the GigaChat family of large language models developed by its own AI research teams.

О команде

Мы занимаемся независимой оценкой качества и модельных рисков Kandinsky - семейства генеративных моделей для создания и редактирования изображений, видео и аудиовизуального контента, а также моделей мира (world models).

Наша задача - находить слабые места моделей, проверять выбранные подходы к оценке и готовить рекомендации, которые помогают принимать решения о релизе и возможных сценариях применения моделей.

Мы работаем с новыми версиями Kandinsky до их выхода к пользователям. Разрабатываем собственные методологии, бенчмарки и инструменты полного цикла, объединяя автоматические метрики, human evaluation и подходы LLM/VLM-as-a-judge.

О роли

Мы ищем специалиста на стыке исследований и инженерной разработки.

В этой работе не всегда существует готовая методология или универсальная метрика. Нужно определить, из чего складывается качество модели, спроектировать проверяемый эксперимент и реализовать воспроизводимый evaluation-пайплайн.

Роль охватывает весь цикл оценки: от формулирования критериев и подготовки тестовых данных до анализа результатов и рекомендаций для команды разработки. Важно не только измерить качество модели, но и понять, насколько она подходит для реальных пользовательских и бизнес-сценариев, какие ограничения критичны и что осталось непроверенным.

Обязанности

Проектировать оценку с нуля

  • декомпозировать качество на измеримые критерии и собирать под них тестовые сценарии, промпты и выборки
  • проектировать оценку там, где готовой методологии ещё нет.

Разрабатывать evaluation-пайплайны

  • реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик
  • обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки
  • готовить инструкции для асессоров и контролировать качество разметки.

Строить VLM-as-a-judge

  • разрабатывать судей под конкретные критерии, учитывать их bias и ограничения
  • понимать, где автоматическая оценка работает, а где без человека нельзя.

Разбираться в ошибках моделей

  • понимать ограничения diffusion-моделей и причины типовых артефактов
  • отличать реальную проблему модели от ошибки методологии или замера.

Формировать заключение по модельному риску

  • анализировать качество по отдельным сценариям, типам промптов и срезам, а не только по среднему значению
  • формулировать условия релиза, ограничения и явно фиксировать то, что осталось непроверенным.

Требования

Хорошее понимание устройства генеративных моделей:

  • понимание принципов работы Transformers, diffusion- и мультимодальных моделей и основных задач: T2I, Image Editing, T2V, Audio, Video-Audio.;
  • понимание типовых ограничений, ошибок и артефактов моделей; способность разбираться в причинах ошибок и способах их проверки.

Способность проектировать оценку качества моделей:

  • декомпозировать качество на измеримые критерии и проектировать тестовые сценарии, промпты и выборки.
  • выбирать корректный подход к оценке: human evaluation, автоматические метрики, LLM/VLM-as-a-judge, а также подходящие модели для сравнения;
  • проверять валидность метрик и уметь проектировать оценку для новых задач и модальностей, где ещё нет готовой методологии.

Навыки работы с LLM и VLM:

  • prompt engineering, structured output, tool calling и работа с контекстом и ограничениями моделей;
  • построение и валидация LLM/VLM-as-a-judge, включая проверку автоматической оценки относительно человеческой;
  • понимание нестабильности, bias и галлюцинаций моделей; умение подбирать модель под конкретную исследовательскую задачу.

Понимание AI-агентов и агентных систем:

  • понимать, чем агент отличается от обычного вызова LLM;
  • знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация;
  • понимать, когда агентный подход действительно полезен, а когда создаёт лишнюю сложность;
  • уметь оценивать надёжность и ограничения агентных решений.

Умение проводить технический и научный ресерч:

  • находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации;
  • сравнивать решения с актуальными подходами и оценивать достоверность результатов;
  • переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов.
Будет плюсом

Умение работать с агентами и субагентами:

  • декомпозировать задачи между агентами, задавая им чёткие роли и зоны ответственности;
  • управлять контекстом и изоляцией субагентов, организовывать проверку результатов;
  • собирать результаты нескольких агентов в единое решение и критически оценивать их выводы.

Навыки вайбкодинга и AI-assisted coding:

  • уверенно работать с Codex, Claude Code и другими coding-агентами
  • проверять и дорабатывать сгенерированный код, использовать агентов для тестирования;
  • понимать архитектуру создаваемого решения

Продуктовое мышление:

  • связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта;
  • приоритизировать направления проверки и переводить результаты оценки в рекомендации для разработки;
  • понимать влияние результатов на релиз и дальнейшее развитие модели.

Дополнительный релевантный опыт:

  • оценка Image, Video, Audio и мультимодальных моделей; разработка собственных бенчмарков и методологий;
  • работа с асессорами, большими массивами пользовательских запросов и построение аналитических пайплайнов/отчётов;
  • понимание GPU-инфраструктуры и инференса; практический опыт построения multi-agent систем.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • возможность выбрать удобный график - офис / гибрид
  • ежегодный пересмотр зарплаты и годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
690,007 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account Continue with Google
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Similar stack
Same company
Moscow
$31k – $62k per year (Estimated) • Remote/Hybrid • Full-Time • 3+ years exp • Bachelor's Degree • Gurgaon
Python
Java
SQL
C#
C++
Databases
Snowflake
AI/ML
AI Agents
OpenAI
Copilot Studio
Analytics
Power BI
Management
Power Automate
Microsoft Office
QA
Selenium
Apply
$62k – $131k per year (Estimated) • Remote/Hybrid • Full-Time • 9+ years exp • Bengaluru
Python
Go
Java
Databases
MySQL
ElasticSearch
AI/ML
Model Context Protocol
Prompt Engineering
LLM
DevOps
GCP
Azure
CI/CD
Jenkins
AWS
Docker
Kubernetes
Apply
$144k – $180k per year • Equity • Remote/Hybrid
Python
AI/ML
Copilot
Claude
Claude Code
AI Agents
Perplexity
DevOps
Rest API
Terraform
Git
SLI/SLO/SLA
Cybersecurity
Okta
SOC 2
HIPAA
Least Privilege
Management
Slack
Confluence
Jira
Google Workspace
Zapier
Apply
$59k – $88k per year • Remote/Hybrid • Full-Time • PhD • United Kingdom
Python
Apply
$12k – $27k per year (Estimated) • In office • 1+ year exp • Moscow
Python
PHP
SQL
PHP
Bitrix
Databases
PostgreSQL
DevOps
Kibana
Git
Grafana
QA
Postman
Apply
$23k – $62k per year (Estimated) • In office • Bachelor's Degree • Moscow
AI/ML
LLM
Machine Learning
Apply
$24k – $47k per year (Estimated) • In office • 3+ years exp • Moscow
AI/ML
Model Context Protocol
AI Agents
LLM
OCR
Computer Use
DevOps
OpenTelemetry
AIOps
Windows
Management
UiPath
UML
Apply
$36k – $87k per year (Estimated) • In office • Full-Time • Moscow
Python
Python
FastAPI
pySpark
Databases
Redis
Apache Kafka
AI/ML
Spark
MLFlow
GigaChat
PyTorch
DevOps
Kubernetes
Amazon S3
Apply
Data Engineer 4 hours ago
$27k – $65k per year (Estimated) • In office • Full-Time • Moscow
SQL
Databases
PostgreSQL
ClickHouse
RabbitMQ
Apache Kafka
AI/ML
Spark
Airflow
AI Agents
LLM
DevOps
Prometheus
CI/CD
Git
Docker
Kubernetes
Grafana
SLI/SLO/SLA
Analytics
Tableau
Power BI
QlikSense
ETL/ELT
Apache NiFi
Superset
Management
Scrum
Kanban
Apply
Senior Java Engineer 4 hours ago
$36k – $79k per year (Estimated) • In office • Full-Time • 5+ years exp • Moscow
Java
Kotlin
Java
Hibernate
Databases
PostgreSQL
Apache Kafka
DevOps
OpenShift
Git
Docker
Kubernetes
Gitflow
Apply
$11k – $14k per year • In office • Moscow
Design
Figma
Canva
Apply
$22k – $65k per year (Estimated) • In office • Internship • Moscow
Databases
Apache Kafka
DevOps
CI/CD
Docker
Grafana
Apply
$36k per year (net) • Remote • Full-Time • Moscow
Python
PowerShell
Bash
DevOps
Terraform
Ansible
Zabbix
VMWare
Prometheus
GitLab CI
Azure
CI/CD
AWS
Ubuntu
Grafana
Linux
BGP
OSPF
Cybersecurity
Keycloak
Apply
$23k – $62k per year (Estimated) • In office • Full-Time • Moscow
AI/ML
AI Agents
LLM
Machine Learning
DevOps
Platform Engineering
Apply
See all jobs
This is one of many
690,007 more open roles from verified company boards, updated every day.