{"id":1223098,"url":"https://alion.io/job/sber-deep-learningcuda-engineer-gigachat-2","title":"Deep Learning/CUDA Engineer (GigaChat)","company":{"id":67,"name":"Sber","domain":"sber.ru","url":"https://alion.io/company/sber","size_band":"5000+","is_staffing_agency":false,"employer_type":"direct","is_intermediary":false,"listed_via":null,"ats_vendor":"HeadHunter","truth_index":{"grade":"A","score":100,"open_postings":156,"ghost_share":0.006,"stale_share":0,"repost_share":0.032,"time_to_fill_p50_days":7,"computed_at":"2026-09-26T05:45:00Z"}},"role":"AI/ML","role_family":"AI/ML","seniority":null,"employment_type":"full_time","work_mode":"on_site","remote_scope":null,"remote_scope_basis":null,"remote_working_hours":null,"hiring_geo_confidence":"structured","locations":["Moscow, Russia"],"countries":["RU"],"hiring_countries":[],"hiring_countries_total":0,"salary":null,"salary_estimate":{"min_usd":22000,"max_usd":61000,"period":"year","method":"role_country_seniority_unknown","sample_n":116},"experience_years_min":null,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"AI Agents","optional":false},{"name":"CUDA","optional":false},{"name":"CUDA Toolkit","optional":false},{"name":"GigaChat","optional":false},{"name":"KV Cache","optional":false},{"name":"LLM","optional":false},{"name":"Python","optional":false},{"name":"SGLang","optional":false},{"name":"Speculative Decoding","optional":false},{"name":"TensorRT-LLM","optional":false},{"name":"vLLM","optional":false},{"name":"TensorRT","optional":true}],"status":"live","first_seen_at":"2026-09-25T12:57:20Z","employer_posted_date":"2026-09-25","last_verified_at":"2026-09-27T03:48:59Z","board_verified":true,"closed_at":null,"days_open":1,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":1},"description":"Мы - команда инференса GigaChat. Всё, что модель отвечает пользователю, проходит через наш движок - и наша работа в том, чтобы это происходило быстро, дёшево и не падало никогда.У нас нет опции «подождём, пока это появится в vLLM». GigaChat - это свои архитектуры и свои мультимодальные модели, и когда исследователи приносят новую архитектуру, именно мы делаем так, чтобы она летала на проде: пишем ядра, придумываем, как разложить её по GPU, выжимаем токены в секунду там, где, казалось бы, выжимать уже нечего.Это работа, где результат меряется в миллисекундах и мегаваттах: каждый процент ускорения - это тысячи GPU-часов и реальные деньги. И где между «прочитал свежую статью» и «это крутится на проде под нагрузкой» проходят недели, а не годы.\n Обязанности\n Чем предстоит заниматься:\n Заставлять новые архитектуры GigaChat (включая мультимодальные) работать на проде быстро\n Ускорять всё, что можно ускорить: кастомные CUDA-ядра, квантизация, speculative decoding, оптимизации KV-cache, continuous batching - и то, чему ещё нет устоявшегося названия\n Придумывать, как разложить большую модель по GPU и по кластеру так, чтобы ни один FLOPS не простаивал: тензорный/пайплайн-параллелизм, disaggregated prefill/decode, шедулинг запросов\n Профилировать честно и глубоко: находить, куда на самом деле уходят миллисекунды - в ядре, в раскладке памяти, в сети или в планировщике - и убирать это\n Держать прод: движок, через который проходят все запросы к GigaChat, должен успешно переживать абсолютно всё\n Читать свежие статьи и код лучших движков (vLLM, SGLang, TensorRT-LLM) не как пользователь, а как конкурент: понимать, что у них хорошо, и делать у себя лучше - с поправкой на наши архитектуры\n Требования\n опыт работы в области глубокого обучения, в том числе с LLM\n глубокое знание CUDA и Python\n опыт использования GigaChat, Kandinsky и аналогов в продуктах\n навыки создания и использования AI-агентов.\n Условия\n комфортный современный офис рядом с м. Кутузовская\n возможность выбрать удобный график - офис/гибрид/удаленка (в РФ)\n годовая премия\n корпоративный спортзал и зоны отдыха\n более 400 образовательных программ СберУниверситета для профессионального и карьерного развития\n расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа\n ипотека для сотрудников по дисконтной прогамме\n бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров\n вознаграждение за рекомендацию друзей в команду Сбера.","description_format":"text","description_chars":2448,"description_truncated":false,"requirements":{"experience_years_min":null,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Russian","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[],"hiring_excludes":[],"relocation_offered":false,"industries":["LLM & Generative AI","Cloud Platforms (IaaS & PaaS)","Wealth Management & Financial Advisors","Investment Banking & M&A Advisory"],"lifecycle":[{"event":"open","at":"2026-09-25T12:59:35Z"}],"liveness":{"score":90,"band":"hot","label":"Hiring now","p_open":1,"p_active":0.903,"p_room":1,"age_days":0,"expected_fill_days":7,"reasons":["conf:2","velocity","win:early","comp:brand"],"computed_at":"2026-09-26T05:45:00Z"},"pay":null,"html_url":"https://alion.io/job/sber-deep-learningcuda-engineer-gigachat-2","json_url":"https://alion.io/job/sber-deep-learningcuda-engineer-gigachat-2.json","meta":{"generated_at":"2026-09-27T05:18:49Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers","usage":{"tier":"crawler","counted_by":"address","units_charged":1,"used_today":4661,"day_limit":5000,"remaining_today":339,"minute_limit":60,"resets_at":"2026-09-28T00:00:00Z"}}}