679,351open jobs
39,352companies
99,642added this week
Browse all
Salary
$19k – $50k per year (Estimated)
Location
In office (Novosibirsk)
Overview
Company
Impact
Profile match
Sber is Russia's largest bank and the centre of one of the country's biggest technology ecosystems, tracing its origins to savings institutions established in 1841. It serves over a hundred million retail customers and several million businesses through branch, mobile and web channels, and holds a dominant share of the national deposit, lending and payment markets. Over the past decade the group has built out an ecosystem well beyond banking, spanning e-commerce, food delivery, streaming media, cloud infrastructure, devices and the GigaChat family of large language models developed by its own AI research teams.

Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка.

Наша основная задача оценить флагманские генеративные модели Сбера - GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Мы не просто «проверяем метрики», а:

  • глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели
  • критически рассматриваем архитектурные и методологические решения и предлагаем улучшения
  • разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска
  • проводим оценку логов пользователей для построения наиболее релевантного тестирования

Отдельный фокус - R&D деятельность:

  • создание новых методологий оценки качества
  • участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)
  • адаптация передовых мировых бенчмарков под специфику банковских кейсов
  • и многое другое

Эта роль про независимое измерение фундаментального качества модели: не про их обучение - этим занимается отдельная команда.

Что предстоит делать

  • придумывать, как вообще измерить модель

ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве.

  • отвечать за достоверность измерений

Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили.

  • разбираться в причинах ошибок

«Модель ошиблась» - это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация - в следующую версию модели, которая этой ошибки уже не делает.

  • строить автоматическую оценку

Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей

  • строить то, чем пользуются другие

Фреймворки оценки, который вы развиваете - общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне.

Требования

  • умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов
  • статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
  • понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация
  • понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
  • опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
  • продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели
  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой
  • будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding.

Условия

  • годовая премия до 6 окладов и регулярный пересмотр зарплат
  • гибкий формат удаленной работы на территории г. Новосибирска
  • расширенный ДМС, льготное страхование для семьи
  • более 400 образовательных программ СберУниверситета
  • DS&AI community (600+ специалистов, митапы, мастер-классы)
  • корпоративный спортзал
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких.
  • реферальная программа для сотрудников: можно пригласить в команду знакомых профессионалов и получить вознаграждение
  • современный офис и гибридный формат, спортзал, снэки и кофе.
Free account
Stop reading job ads. Get the ones that fit.
One free account turns this page into a shortlist built around your stack, your level and your pay.
Match on every job. Stack, seniority, pay and location, scored against your profile.
679,351 open roles. Read straight off company career pages, refreshed every day.
Unlimited applications. Every one you send is tracked in one place, on-site or on a company board.
3 tailored CVs a month. Rewritten for the exact job you are applying to. Included free.
Create a free account Continue with Google
Free forever. No card. Under a minute.

Your match

How well do you fit this role?
Two answers are enough for a real match. No account needed.
Check my fit
Answers stay in this browser until you create an account.

Recommended for you based on this role

Similar stack
Same company
Novosibirsk
Remote/Hybrid • 1+ year exp
AI/ML
Function Calling
AI Agents
LLM
Text-to-Speech
Voice Agents
Tool Use
DevOps
GitHub
GitLab
Management
Slack
Discord
Marketing
LinkedIn
QA
Postman
Apply
$25k – $55k per year (Estimated) • In office • 4+ years exp • Bachelor's Degree • Bengaluru
Python
Java
SQL
Java
Spring Boot
Databases
Redis
RabbitMQ
Apache Kafka
AI/ML
Cursor
Claude Code
LLM
DevOps
CI/CD
Git
AWS
Docker
AWS Lambda
Amazon EC2
Amazon S3
Apply
$22k – $27k per year • In office • Bachelor's Degree • Astana
Python
JavaScript
PHP
PHP
Laravel
Databases
MySQL
PostgreSQL
Frontend
Vue.js
React.js
DevOps
Rest API
CI/CD
Git
Apply
Data Engineer 3 hours ago
$37k – $83k per year (Estimated) • In office • 10+ years exp • Bengaluru
Python
SQL
Python
pySpark
Databases
Databricks
AI/ML
Spark
DevOps
CI/CD
Git
AWS
Analytics
ETL/ELT
Apply
IT Analyst 3 hours ago
$16k – $37k per year (Estimated) • In office • 2+ years exp • Bengaluru
Python
DevOps
GCP
SLI/SLO/SLA
IAM
Cybersecurity
Crowdstrike
Analytics
Master Data Management
Management
Google Workspace
Apply
Python Lead 3 hours ago
$33k – $64k per year (Estimated) • In office • Moscow
Python
Python
FastAPI
Django
Databases
PostgreSQL
Apache Kafka
AI/ML
SciPy
AI Agents
Pandas
NumPy
Streamlit
DevOps
OpenShift
CI/CD
Kubernetes
Apply
$23k – $54k per year (Estimated) • In office • Bachelor's Degree • Yekaterinburg
Python
SQL
Databases
PostgreSQL
Oracle
Greenplum
DevOps
Jenkins
Git
Bitbucket
Analytics
ETL/ELT
Management
Confluence
Jira
Agile
Apply
$35k – $63k per year (Estimated) • In office • 2+ years exp • Moscow
Python
SQL
AI/ML
Claude
Prompt Engineering
GigaChat
LLM
RAG
DevOps
Rest API
Apply
$20k – $50k per year (Estimated) • In office • 4+ years exp • Moscow
Swift
Swift
Swift Concurrency
AI/ML
AI Agents
GigaChat
Mobile
iOS SDK
XCTest
Apply
$23k – $44k per year (Estimated) • In office • 3+ years exp • Moscow
Python
SQL
AI/ML
AI Agents
Analytics
Tableau
Power BI
Superset
Apply
$11k – $16k per year • Remote/Hybrid • Full-Time • Novosibirsk
Management
Telegram
Apply
$27k – $60k per year (Estimated) • Remote/Hybrid • 6+ years exp • Novosibirsk
C#
C#
.NET
Databases
PostgreSQL
RabbitMQ
DevOps
Docker
GitLab
Apply
$21k per year • In office • 2+ years exp • Novosibirsk
Apply
In office • Novosibirsk
Game Dev
Unity
Cocos2d-x
Design
Figma
Apply
See all jobs
This is one of many
679,351 more open roles from verified company boards, updated every day.