Overview
Timeline
Roles

Overview

Сферы изучения: ML (классическое и глубокое), data analytics, NLP (Word2vec, GloVe, BERTA и ее аналоги, BERTopic, Transormer-модели). Практической опыт брал с Kaggle, HuggingFace. Многие работы завязаны в медицинской сфере: • прогнозирование костного возраста по рентген снимку (ResNET50, CNN); • прогнозирование состояния пациента; • оценка щитовидной железы; • определение заболевания легких; • определение депрессии по сообщению (BERTA, RoBERTA). Использовал инструменты для создания полного жизненного цикла модели начиная от сбора и агрегации данных, логированием и мониторингом (MLFlow, Apache Airflow). Также интересуюсь data engineering.

Timeline

ML Engineer Middle
Этажи Full-Time
May 2025 to Oct 2025 5 Months In office

Разработал модели для решение таких задач как:

- ФИО их исправление и классификация на корректные/исправить/некорректные (LSTM, biLSTM, Markov chains, seq2seq + attension), может исправить с 1-3 символов в Ф/И/О. Также предсказание пола по одному полю из Фамилии, Имени, Отчеству с точностью в 90%+. с 80% может определить что Ф/И/О корректное.

- Создал NER-модель для разметки и разбиения адресов на 5 ключевых полей. Вытаскивание ключевых слов из текста и транскрибированных диалогов атрибутов для обогащения БД и анализа.

- Разворачивал локальные LLM (через Ollama) и разрабатывал API-сервисы для интеграции в продукты компании (FastAPI).

- Настраивал локальные LLM под задачи извлечение атрибутов из звонков и чатов (промпт-инжиниринг, custom parameters, модификация modelfile), что повысило качество извлечения данных и обогащения бд.

- Использование LLM для сравнение полных адресов.

- Сегментация клиентов при помощи кластеров.

Для проекта Системы агрегации данных недвижимости: уменьшило появление дублирующих объектов на 37%.

- Классификация комнат: bathroom, livingroom, bedroom, kitchen, dinnig. (Resnet-34, общая уверенность для всех классов 90%+). создавалась для уменьшений дубликатов объектов.

- Сравнение фотографии на схожесть (использовалась ViT-B/32, и были 2 оценки для классификации на сколько похожи: cos, lpips что отбирать только нужные фотографии). создавалась для уменьшений дубликатов объектов.