Estamos buscando uma pessoa Data Scientist focada em integração e modelagem para construir e evoluir nosso data lake e camadas analíticas. Não é uma posição orientada a “big data”/streaming massivo, e sim a integrações sólidas, pipelines de transformação estáveis e organização de dados de mercado (histórico e distribuição) com boa governança e qualidade.
Responsabilidades:
- Traduzir dados de eventos digitais (web/app) em modelos de comportamento do usuário;
- Desenvolver análises exploratórias e avançadas para identificação de padrões, jornadas e fricções;
- Gerar insights acionáveis que influenciem decisões de produto, marketing e experiência do cliente;
- Estruturar e conduzir hipóteses analíticas, garantindo sua validação através de testes e experimentação;
- Projetar, desenvolver e escalar modelos de Machine Learning e IA, com foco em comportamento e personalização;
- Implementar estratégias de experimentação (A/B testing, causal inference, uplift modeling);
- Trabalhar em conjunto com squads de produto, engenharia e analytics para garantir a correta instrumentação e qualidade dos dados;
- Evoluir frameworks e metodologias de mensuração de comportamento e impacto de iniciativas;
- Apoiar a democratização de dados, garantindo clareza e entendimento dos insights gerados.
Requisitos para este desafio:
- Experiência como Cientista de Dados;
- Domínio de análise de dados comportamentais digitais (eventos de front-end, tracking, jornada do usuário);
- Experiência com SQL (otimização de queries, modelagem relacional e analítica);
- Experiência prática com Snowflake (warehousing, roles, tasks, performance, custos) e dbt (models, tests, sources, exposures);
- Experiência construindo pipelines de dados em Airflow (DAGs, sensores, retries, SLA) e AWS Lambda;
- Conhecimento de Postgres (ingestão, replicação/CDC básica ou manutenção, rotinas);
- Vivência com Python para dados (Pandas) e desenvolvimento de APIs com FastAPI;
- Prática em ELT/ETL orientado a batches, versionamento em Git e CI/CD (deploy seguro de pipelines/modelos dbt);
- Noções de segurança e governança de dados (controle de acesso, linhagem, documentação, dados sensíveis).
Diferenciais:
- Data platform: Snowflake, dbt;
- Orquestração e Cloud: Airflow (AWS), AWS Lambda, EKS (quando aplicável);
- Linguagens e libs: Python, Pandas, FastAPI;
- Bancos: Postgres, Snowflake;
- Dev: Git, CI/CD (GitHub Actions/GitLab CI/CodeBuild), IaC (CloudFormation/Terraform é plus);
- Observabilidade: CloudWatch, (Grafana/Prometheus como plus).

