JobMatch
← Back to jobs

Data Engineer Big Data (Spark / PySpark / Azure Databricks)

METRICA

RemoteMadrid, Community of Madrid, SpainFull-time
Posted
today
Source
LinkedIn (remote, Europe)
Field
Engineering, Data & Analytics

Skills

PythonPandasAzureAgileNumPySparkLLMsETL

Description

Modalidad: 100% remoto Experiencia: Mínimo 3 años SBA: 34.000€ En Métrica España, buscamos un/a Data Engineer con experiencia en entornos Big Data, procesamiento distribuido y optimización de cargas con Apache Spark, PySpark y Azure Databricks. Buscamos una persona proactiva, autónoma y resolutiva, con una sólida base técnica y capacidad para trabajar directamente con cliente. Si te interesa diseñar soluciones de datos eficientes, escalables y robustas, y utilizar herramientas de IA para agilizar el desarrollo, ¡esta es tu oportunidad! Responsabilidades Principales - Diseño, desarrollo y mantenimiento de procesos de datos distribuidos con Apache Spark y PySpark. - Desarrollo y optimización de pipelines ETL/ELT y diseño de datasets escalables. - Análisis y mejora del rendimiento de procesos Spark: particionado, shuffles, persistencia, caché, ejecución de DAG, stages y gestión de memoria. - Desarrollo de soluciones de procesamiento columnar mediante Pandas UDF, Vectorized UDF y Apache Arrow. - Desarrollo y mantenimiento de soluciones en Azure Databricks y Delta Lake. - Optimización de workloads, tiempos de ejecución, consumo de recursos y costes asociados a los procesos de datos. - Aplicación de algoritmos distribuidos e iterativos para el procesamiento de grandes volúmenes de información. - Uso de técnicas de Approximate Computing, como HyperLogLog, Bloom Filters, sketching y estadísticas de streaming, cuando sea necesario. - Uso de herramientas de IA aplicadas al desarrollo —GenAI, Copilot y LLMs— para revisión de código, generación de pruebas, validación y mejora de la productividad. - Colaboración directa con cliente y equipos técnicos para la toma de requisitos, definición de soluciones y comunicación del avance técnico. - Documentación técnica de los desarrollos, pipelines y procesos implementados. - Identificación y propuesta de mejoras continuas en calidad, eficiencia, rendimiento y robustez. ¿Qué ofrecemos? - Contrato indefinido. - Salario competitivo, acorde a la experiencia y conocimientos aportados. - Oportunidades de desarrollo profesional y formación continua. - Participación en proyectos de alto impacto tecnológico. - Entorno de trabajo colaborativo e innovador. - Flexibilidad horaria y modalidad de trabajo a definir. Si eres un/a profesional de datos con experiencia en Spark, PySpark, Python y Azure Databricks, te motiva resolver retos de rendimiento y quieres trabajar directamente con cliente, ¡te invitamos a unirte a nuestro equipo en Métrica España! Requisitos: Requisitos Técnicos Indispensables - Experiencia demostrable de al menos 3 años en Data Engineering, Big Data o desarrollo de soluciones de procesamiento distribuido. - Experiencia sólida con Apache Spark y PySpark. - Conocimientos avanzados de optimización en Spark: - Particionado y shuffles. - Persistencia y caché. - DAG y stages. - Gestión de memoria. - Optimización de ejecución y rendimiento. - Dominio de Python aplicado al tratamiento y procesamiento de datos. - Experiencia con PySpark, Pandas y NumPy. - Experiencia en diseño y desarrollo de procesos ETL/ELT, pipelines de datos y datasets. - Experiencia con Azure Databricks y Delta Lake. - Conocimientos de procesamiento de datos columnar con Pandas UDF, Vectorized UDF y Apache Arrow. - Experiencia o conocimientos en algoritmos distribuidos e iterativos. - Uso práctico de herramientas de IA para desarrollo de software, como GitHub Copilot, GenAI o LLMs, orientado a agilizar revisiones, pruebas y validaciones. - Capacidad para comunicarse de manera técnica, clara y eficaz con cliente y equipos multidisciplinares. Se valorará - Conocimientos de Approximate Computing: HyperLogLog, Bloom Filters, sketching y estadísticas de datos en streaming. - Experiencia en optimización de costes y rendimiento de cargas de trabajo en Azure Databricks. - Conocimientos de arquitecturas Lakehouse y gestión de datos con Delta Lake. - Experiencia trabajando en entornos Agile.

JobMatch aggregates public listings. Always apply through the original posting.