{"id":1266861,"url":"https://alion.io/job/mclarenss-cloudera-data-engineer","title":"Cloudera Data Engineer","company":{"id":3801259,"name":"Mclarenss","domain":"mclarenss.com","url":"https://alion.io/company/mclarenss","size_band":null,"is_staffing_agency":false,"employer_type":"direct","is_intermediary":false,"listed_via":null,"ats_vendor":"Zoho Recruit","truth_index":{"grade":"B","score":75,"open_postings":5,"ghost_share":0,"stale_share":1,"repost_share":0,"time_to_fill_p50_days":null,"computed_at":"2026-09-28T05:45:00Z"}},"role":"Data Science","role_family":"Data Science","seniority":"senior","employment_type":"full_time","work_mode":"on_site","remote_scope":null,"remote_scope_basis":null,"remote_working_hours":null,"hiring_geo_confidence":"structured","locations":["Bengaluru, India"],"countries":["IN"],"hiring_countries":[],"hiring_countries_total":0,"salary":null,"salary_estimate":{"min_usd":22000,"max_usd":44000,"period":"year","method":"role_seniority_country_remote_cell","sample_n":51},"experience_years_min":8,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Agile","optional":false},{"name":"AWS","optional":false},{"name":"Azure","optional":false},{"name":"Azure DevOps","optional":false},{"name":"CI/CD","optional":false},{"name":"Databricks","optional":false},{"name":"dbt","optional":false},{"name":"Delta Lake","optional":false},{"name":"ETL/ELT","optional":false},{"name":"GCP","optional":false},{"name":"Git","optional":false},{"name":"Great Expectations","optional":false},{"name":"HIPAA","optional":false},{"name":"Jenkins","optional":false},{"name":"pySpark","optional":false},{"name":"Python","optional":false},{"name":"SLI/SLO/SLA","optional":false},{"name":"Spark","optional":false},{"name":"SQL","optional":false}],"status":"live","first_seen_at":"2026-05-27T00:00:00Z","employer_posted_date":"2026-05-27","last_verified_at":"2026-09-26T05:27:02Z","board_verified":false,"closed_at":null,"days_open":124,"trust":{"level":"stale","repost_count":0,"flags":["stale"],"days_open":124},"description":"KeyResponsibilities Design, build, and optimize end-to-end ETL/ELT pipelines in Databricks using Delta Lake, Delta Live Tables (DLT), Auto Loader, PySpark, and Spark SQL for high-volume, multi-format partner ingestion. Implement Medallion (zoned) architecture - Raw (bronze), Standardized (silver) with advanced validation, quarantine/reject logic, schema enforcement, and Curated (gold) consumer-ready datasets optimized for downstream COB/PI analytics. Leverage Unity Catalog for data governance, access control, lineage, and secure multi-tenant data management. Develop incremental processing, change data capture (CDC), backfill strategies, late-arriving data handling, and partitioning/optimization techniques (Z-Ordering, Liquid Clustering, Auto-Optimize) to eliminate performance bottlenecks. Build robust data quality frameworks using Delta constraints, expectations, and monitoring to ensure clean, reliable data for downstream consumption. Create production-grade Databricks Workflows, Jobs, and orchestration for reliable batch and near-real-time processing using Spark Structured Streaming. Perform data profiling, mapping, reconciliation, and performance tuning of large-scale Spark jobs on Databricks clusters. Collaborate with Senior Data Architect and Data Modeller to translate target-state lakehouse design into implementable, testable increments. Deliver shippable, production-ready increments in Agile sprints within the implementation window, including CI/CD integration, unit/integration testing, and operational runbooks. Establish comprehensive observability using Databricks Lakehouse Monitoring, SQL Alerts, and dashboards for pipeline health and SLA compliance.\nRequirements Required Qualifications & Experience 8+ years of hands-on data engineering experience 5+ years building enterprise-scale solutions on Databricks (Unity Catalog, Delta Lake, Delta Live Tables) Proven track record delivering Medallion/zonal lakehouse architectures in production Strong experience with high-volume, regulated data workloads (claims, financial, or healthcare data highly preferred) Technical Skills - Databricks Expertise (Core) Databricks Platform: Unity Catalog, Delta Lake, Delta Live Tables (DLT), Auto Loader, Workflows, Jobs, Repos, Lakehouse Monitoring Core Technologies: PySpark, Spark SQL, Spark Structured Streaming, Delta constraints & expectations Optimization & Performance: Liquid Clustering, Z-Ordering, Auto-Optimize, Dynamic Partition Overwrite, Photon engine Governance & Quality: Unity Catalog ACLs, data lineage, schema evolution, Great Expectations (or equivalent) Orchestration & CI/CD: Databricks Workflows, dbt on Databricks, Git integration, Azure DevOps / Jenkins Languages: Expert Python (PySpark), SQL Cloud: AWS/Azure/GCP (Databricks on any cloud)\nPreferred\nQualifications Prior experience modernizing healthcare claims data lakes (COB, Payment Integrity, Medicaid/Medicare) Exposure to partner ingestion patterns, multi-format data (EDI, flat files, APIs), and downstream analytical workloads Familiarity with CMS/HIPAA data handling and compliance in Databricks environments","description_format":"text","description_chars":3120,"description_truncated":false,"requirements":{"experience_years_min":8,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[]},"benefits":[],"hiring_locations":[],"hiring_excludes":[],"relocation_offered":false,"industries":["Information Technology","IT Consulting & Digital Transformation"],"lifecycle":[{"event":"open","at":"2026-09-25T22:38:55Z"}],"liveness":{"score":7,"band":"cold","label":"Long shot","p_open":0.9,"p_active":0.26,"p_room":0.28,"age_days":124,"expected_fill_days":23,"reasons":["conf:48","win:tail","crowd:"],"computed_at":"2026-09-28T05:45:00Z"},"pay":null,"html_url":"https://alion.io/job/mclarenss-cloudera-data-engineer","json_url":"https://alion.io/job/mclarenss-cloudera-data-engineer.json","meta":{"generated_at":"2026-09-28T23:31:40Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers","usage":{"tier":"crawler","counted_by":"address","units_charged":1,"used_today":1181,"day_limit":5000,"remaining_today":3819,"minute_limit":60,"resets_at":"2026-09-29T00:00:00Z"}}}