Holistic Partners, Inc

Data Engineer

⭐ - Featured Role | Apply direct with Data Freelance Hub
This role is for a Data Engineer (Ab Initio Developer) in Charlotte, North Carolina, for 12 months at a W2 pay rate. Key skills include 4+ years in Data Engineering, PL/SQL, Ab Initio, Python, and ETL design.
🌎 - Country
United States
πŸ’± - Currency
$ USD
-
πŸ’° - Day rate
Unknown
-
πŸ—“οΈ - Date
August 7, 2026
πŸ•’ - Duration
More than 6 months
-
🏝️ - Location
On-site
-
πŸ“„ - Contract
W2 Contractor
-
πŸ”’ - Security
Unknown
-
πŸ“ - Location detailed
Charlotte, NC
-
🧠 - Skills detailed
#Programming #Data Governance #Data Pipeline #Datasets #Scala #Informatica #Data Management #GCP (Google Cloud Platform) #Clustering #IAM (Identity and Access Management) #Airflow #Classification #Jenkins #PySpark #Data Migration #Data Engineering #Metadata #Oracle #"ETL (Extract #Transform #Load)" #Python #Spark (Apache Spark) #Informatica IDQ (Informatica Data Quality) #Monitoring #Data Modeling #SQL (Structured Query Language) #Teradata #GIT #Debugging #Code Reviews #Data Processing #Cloud #Ab Initio #Data Quality #Batch #Migration #AI (Artificial Intelligence) #Security #Automated Testing #GitHub #Integration Testing #Documentation #BigQuery
Role description
Job Title: Ab Initio Developer Location: Charlotte, North Carolina ( onsite) Local only Tax Term: W2 only Duration: 12 months Interview Process: Virtual About this role Join the Home Lending Data and Insights team as a Software Engineer 3 - Contingent, where you’ll build, run, and modernize enterprise data pipelines in a hybrid landscapeβ€”spanning on prem platforms (Python, Oracle, Teradata and Ab Initio) and a modern Google Cloud stack (Big Query, Dataplex). You’ll focus on dependable batch and near real-time processing, operational excellence, and the transition from legacy scheduling and ETL patterns to cloud-native orchestration with Google Cloud Composer, backed by strong data quality standards using Informatica Data Quality In this role, you will β€’ Build and maintain scalable batch and near real-time data pipelines using AB Initio, Python, PySpark, PL / SQL and SQL to ingest, transform, and publish curated datasets across on-prem and Google Cloud platforms. β€’ Develop and optimize big Query transformations and data models, including partitioning, clustering, query optimization, and cost/performance tuning. β€’ Support modernization/migration from Teradata and Ab Initio workflows to GCP/BigQuery, including logic re-platforming, reconciliation, parallel runs, and controlled cutovers. β€’ Implement orchestration and scheduling for pipelines using legacy Autosys while driving migration toward Google Cloud Composer (Airflow), including dependency management, retries, SLAs, and backfills. β€’ Apply data governance and discovery practices using Dataplex: metadata management, dataset organization, classification support, and ensuring data is consumption-ready. β€’ Build and operationalize data quality controls using Informatica Data Quality: profiling, rule implementation, thresholds, exception handling, and embedding quality gates into pipelines. β€’ Ensure operational excellence: monitoring, alerting, runbooks, incident triage/root cause analysis, and continuous improvements to reliability and performance. β€’ Implement secure data engineering practices: least-privilege access, PII handling/masking where required, retention controls, and audit-friendly documentation. β€’ Partner with product, analytics, and engineering stakeholders to translate requirements into clear data contracts, curated datasets, and maintainable documentation (data dictionaries, reconciliation notes, operational runbooks). β€’ Must-have: Use AI-assisted coding tools (e.g., GitHub Copilot, Devin, or similar) to accelerate development while maintaining strong code review discipline, testing, and secure coding standards. β€’ Closely partner with Product Owners, Architects and Engineers on definition, design, development, integration, testing and support of reliable and reusable Data pipelines. β€’ Analyze highly complex business requirements; generate technical specifications to design ETL processes. β€’ Act as an expert technical resource for analysis and provides critical direction to less experienced staff. Work with team members to provide insight into solving complex problems with middleware while leveraging enterprise and industry best practices (including scalability, availability, maintainability, and flexibility). Required Qualifications β€’ 4+ years of Data Engineering experience, or equivalent demonstrated through one or a combination of the following: work experience, training, military experience, education β€’ 4+ years PL/SQL and SQL skills with proven experience in Oracle, Teradata, Python and/or Big Query: complex query development, tuning, and debugging. β€’ 4+ years Ab Initio skills with proven experience to build complex graphs, Psets, performance tuning. β€’ 3+ years programming skills in Python; hands-on PySpark for distributed data processing β€’ 3+ years of ETL/ETL design, data warehousing concepts, and data modeling best practices Desired Qualifications β€’ Production operations experience: monitoring, SLAs, incident response, root cause analysis, and performance optimization. β€’ Experience working in hybrid environments (on-prem + cloud) and supporting data migration/modernization initiatives. β€’ Experience with scheduling/orchestration in Autosys and Airflow-based orchestration (Cloud Composer direction). β€’ Experience with Git-based workflows, code reviews, and automated testing practices for data pipelines. β€’ Experience with Harness, Jenkins and uDeploy based CICD environments. β€’ Practical experience using AI-assisted coding tools in daily development to improve productivity without compromising quality or security. β€’ Ab Initio development/maintenance experience and/or hands-on migration of Ab Initio graphs to modern Spark/SQL patterns. β€’ Experience with Dataplex and broader data governance concepts (metadata, classification, stewardship, lineage practices). β€’ Experience with Informatica Data Quality implementation patterns (profiling, rules, scorecards/metrics, exception workflows). β€’ Experience designing near real-time patterns (micro-batch/event-driven concepts) and handling late-arriving/out-of-order data. β€’ Familiarity with GCP operational practices for data workloads (service accounts/IAM basics, job monitoring, quota/cost controls).