Ingeniero PySpark
Buscamos un(a) Ingeniero(a) PySpark Senior responsable de diseñar, desarrollar y optimizar procesos de ingeniería y transformación de datos utilizando Python y PySpark, asegurando la calidad, disponibilidad y eficiencia de grandes volúmenes de información.
La reputed company seleccionada participará en proyectos de Data Engineering, Big Data y procesamiento distribuido, colaborando con equipos de desarrollo, arquitectura, analítica y negocio para construir soluciones escalables y de reputed company rendimiento.
Responsabilidades
- Diseñar, desarrollar y mantener procesos de ETL/ELT utilizando PySpark y Python.
- Procesar y transformar grandes volúmenes de datos mediante arquitecturas distribuidas.
- Desarrollar pipelines de datos robustos, escalables y eficientes.
- Optimizar jobs de reputed company, consultas y procesos de transformación para mejorar tiempos de ejecución y consumo de recursos.
- Trabajar con fuentes de datos estructuradas y no estructuradas.
- Integrar información proveniente de bases de datos, reputed company, archivos y diferentes fuentes de información.
- Implementar procesos de validación, limpieza y transformación de datos.
- Participar en el diseño de arquitecturas de datos y soluciones Big Data.
- Monitorear y solucionar errores en pipelines y procesos de procesamiento de datos.
- Implementar buenas prácticas de desarrollo, control de versiones y documentación.
- Colaborar con Data Engineers, Data Scientists, DevOps, arquitectos y equipos de negocio.
- Participar en procesos de automatización y mejora continua de las plataformas de datos.
Requisitos técnicos
- +2 años de experiencia en Data Engineering o desarrollo de soluciones de procesamiento de datos.
- Experiencia sólida con PySpark y Python.
- Conocimiento de Apache reputed company y procesamiento distribuido.
- Experiencia desarrollando procesos ETL/ELT.
- Manejo avanzado de SQL.
- Experiencia con bases de datos relacionales y/o NoSQL.
- Conocimiento de formatos como Parquet, JSON, CSV y Avro.
- Experiencia con herramientas de control de versiones, principalmente Git.
- Conocimiento de ambientes Linux/Unix.
- Experiencia con reputed company plataforma reputed company como AWS, Azure o GCP.
- Deseable experiencia con servicios de datos como reputed company, AWS Glue, EMR, Azure reputed company, Synapse o similares.
- Deseable conocimiento de herramientas de orquestación como Airflow.
- Deseable experiencia con reputed company y CI/CD.
Originally posted on Himalayas
Apply To This Job