Ingeniero Senior de Datos

Compañía
Descripción
Resumen: Intellias busca un Ingeniero Senior de Datos para construir una plataforma de datos sanitarios a gran escala basada en FHIR utilizando Python, Spark y AWS, centrándose en la ingesta de datos, la calidad de los mismos y soluciones impulsadas por IA. Aspectos destacados: 1. Rol de alta responsabilidad en la construcción de sistemas intensivos en datos a gran escala 2. Desarrollo de soluciones impulsadas por IA para desafíos complejos relacionados con datos sanitarios 3. Enfoque en el desarrollo de una plataforma de datos sanitarios basada en FHIR Conozca a su reclutador Sara Abdelaziz Sherif sara.abdelaziz@intellias.com https://www.linkedin.com... Detalles de la vacante Ingeniería de Datos Ingeniero de Datos Senior Bulgaria, Colombia, Croacia, Egipto, India, Polonia, Portugal, España, Ucrania, Estados Unidos Remoto Intellias busca un **Ingeniero Senior de Datos** para unirse a una iniciativa digital sanitaria centrada en la construcción de una plataforma de datos sanitarios a gran escala que ayude a millones de personas a encontrar proveedores sanitarios, conectarse con su información médica y tomar decisiones más informadas sobre su atención. Este es un **rol técnico de alta responsabilidad**, destinado a alguien con experiencia en la construcción y operación de sistemas intensivos en datos a gran escala. Usted será responsable de capacidades críticas de ingesta y procesamiento de datos, mejorará la calidad y fiabilidad de los datos y desarrollará soluciones impulsadas por IA para desafíos complejos del mundo real relacionados con datos sanitarios. Buscamos un ingeniero que combine una sólida experiencia en **Python e ingeniería de datos con desarrollo nativo en la nube, responsabilidad operativa en producción y una mentalidad de ingeniería centrada en IA**. ¿Qué proyecto tenemos para usted? El proyecto consiste en construir una **plataforma de datos sanitarios basada en FHIR**, que agrega información sobre proveedores procedente de registros nacionales, sistemas de historias clínicas electrónicas (EHR), redes sanitarias y fuentes de datos de socios. La plataforma ingiere datos sanitarios fragmentados y frecuentemente inconsistentes, los transforma en recursos FHIR estandarizados, resuelve identidades y relaciones duplicadas y pone a disposición información fiable sobre proveedores mediante servicios de búsqueda y datos de alta capacidad. El reto de ingeniería va mucho más allá de un proceso tradicional ETL. Los datos sobre proveedores provienen de cientos de fuentes heterogéneas y contienen duplicados, registros obsoletos, identidades contradictorias, relaciones incompletas y esquemas inconsistentes. La plataforma debe determinar cómo se relacionan dichas fuentes y mejorar continuamente la precisión y confianza de los datos resultantes. El entorno tecnológico incluye **Python, Apache Spark, Prefect, AWS, Kubernetes, MongoDB, OpenSearch y FHIR**, incorporando cada vez más IA tanto como parte del ciclo de vida de ingeniería como dentro de las soluciones de procesamiento de datos. ¿Qué hará usted? * Diseñar, construir y operar **tuberías escalables de ingesta de datos** para incorporar información sobre proveedores sanitarios procedentes de sistemas EHR, registros nacionales, redes sanitarias y fuentes de datos de socios. * Transformar datos fuente heterogéneos en modelos de datos estandarizados y fiables, incluidos **recursos nativos FHIR**. * Asumir la responsabilidad **extremo a extremo de la calidad de los datos**, incluidas las reglas de validación, umbrales de calidad, puntuación de confianza, monitoreo automatizado y alertas. * Diseñar e implementar soluciones para **resolución de entidades, eliminación de duplicados, inferencia de relaciones, clasificación, enriquecimiento y puntuación de calidad de datos**. * Construir y evolucionar tuberías distribuidas de procesamiento de datos utilizando **Python, Spark y tecnologías modernas de orquestación**. * Mejorar la fiabilidad, escalabilidad, observabilidad y rendimiento de las tuberías para que nuevas fuentes de datos puedan incorporarse de forma eficiente y segura. * Establecer y evolucionar **estándares de gobernanza de datos**, incluidos esquemas, modelos intermedios, procesos de validación y flujos de refinamiento de datos. * Diseñar y operar soluciones de almacenamiento y búsqueda de datos que soporten conjuntos de datos sanitarios a gran escala. * Construir **herramientas de datos impulsadas por IA** que mejoren la precisión, automatización e inteligencia de los flujos de trabajo de procesamiento de datos. * Utilizar herramientas modernas de desarrollo de IA como parte integral del flujo de trabajo de ingeniería para acelerar la implementación, pruebas, depuración, documentación y análisis de datos. * Asumir la responsabilidad operativa en producción de las soluciones que construya, incluyendo monitoreo, solución de problemas, respuesta ante incidencias y análisis de causas raíz. * Colaborar con los equipos de Analítica y Ciencia de Datos para desarrollar paneles de control, métricas y reportes sobre la calidad de los datos. * Colaborar con los interesados de Producto y Negocio para priorizar fuentes de datos y mejoras según su impacto en clientes y negocio. * Contribuir a revisiones técnicas de diseño y ayudar a establecer patrones de ingeniería escalables en toda la plataforma de datos. ¿Qué necesita para este puesto? * **Más de 5 años de experiencia profesional** construyendo y operando sistemas de backend o de ingeniería de datos intensivos en datos a gran escala. * Amplia experiencia práctica en **Python**, incluida la creación de servicios de procesamiento de datos y backend listos para producción. * Experiencia sólida diseñando y construyendo **tuberías escalables de ingesta de datos y ETL/ELT** para grandes conjuntos de datos heterogéneos. * Instinto consolidado en ingeniería de datos, incluidos **modelado de datos, diseño de almacenamiento, evolución de esquemas, optimización de consultas, estrategias de caché y selección de patrones adecuados de procesamiento por lotes o en tiempo real**. * Experiencia práctica con **Apache Spark o Databricks** para procesamiento distribuido de datos. * Experiencia con tecnologías de orquestación de flujos de trabajo como **Prefect, Apache Airflow**, o equivalentes. * Comprensión sólida de **modelado de datos, diseño de esquemas, estrategias de validación, transformación de datos y gestión de calidad de datos**. * Experiencia diseñando soluciones para **eliminación de duplicados, resolución de entidades, enriquecimiento de datos, clasificación o vinculación de registros**. * Experiencia con bases de datos relacionales y orientadas a documentos; conocimientos prácticos de tecnologías como **MongoDB** o plataformas NoSQL comparables. * Experiencia con tecnologías de búsqueda como **OpenSearch, Elasticsearch**, o soluciones comparables. * Amplia experiencia con AWS, incluidos servicios como **S3, ECS/EKS, Lambda**, o tecnologías nativas en la nube equivalentes. * Experiencia práctica con **Docker, Kubernetes, CI/CD**, y operación de cargas de trabajo nativas en la nube en producción. * Comprensión sólida de aspectos operativos de tuberías de datos en producción, incluidos **fiabilidad, tolerancia a fallos, observabilidad, monitoreo, alertas y respuesta ante incidencias**. * Experiencia estableciendo y manteniendo **estándares de gobernanza de datos**, esquemas, reglas de validación y procesos repetibles de refinamiento de datos. * Experiencia práctica utilizando **herramientas de ingeniería de software asistidas por IA** como parte del ciclo habitual de desarrollo. * Mentalidad sólida de propiedad y capacidad para identificar de forma independiente problemas de datos o de ingeniería, proponer soluciones, implementarlas y operarlas en producción. * Excelentes habilidades comunicativas y capacidad para colaborar directamente con interesados de ingeniería, analítica, producto, ciencia de datos y negocio. * Inglés profesional suficiente para colaborar directamente con equipos con sede en Estados Unidos. **Valorable** * Experiencia trabajando con **datos sanitarios, plataformas HealthTech o interoperabilidad sanitaria**. * Conocimientos de **FHIR**, especialmente recursos como Practitioner, Organization, PractitionerRole, Endpoint y Location. * Experiencia integrando datos procedentes de **sistemas EHR/EMR, registros sanitarios, redes de proveedores**, o ecosistemas de datos complejos similares. * Experiencia diseñando plataformas de datos que manejen **PHI/PII u otra información regulada y sensible**. * Familiaridad con consideraciones de protección y seguridad de datos relacionadas con HIPAA. * Experiencia construyendo **soluciones de procesamiento de datos impulsadas por IA**, particularmente en resolución de entidades, inferencia de relaciones, clasificación, enriquecimiento, detección de anomalías o puntuación de calidad de datos. * Experiencia práctica integrando **modelos de lenguaje grande (LLM) en flujos de trabajo de datos en producción**, incluidas consideraciones sobre evaluación, fiabilidad, latencia, coste y protección de datos. * Experiencia con herramientas de ingeniería de IA como **Claude Code, GitHub Copilot, Cursor**, o plataformas similares. Cómo es trabajar en Intellias En Intellias, donde la tecnología ocupa el centro del escenario, las personas siempre están por encima de los procesos. Al crear un ambiente cómodo en nuestro equipo, empoderamos a los individuos para que descubran su verdadero potencial y logren resultados extraordinarios. Por eso ofrecemos una serie de beneficios que apoyan su bienestar y potencian su crecimiento profesional. Nos comprometemos a fomentar la equidad, la diversidad y la inclusión como empleador que ofrece igualdad de oportunidades. Todos los solicitantes serán considerados para empleo sin discriminación por raza, color, religión, edad, género, nacionalidad, discapacidad, orientación sexual, identidad o expresión de género, condición de veterano o cualquier otra característica protegida por la ley aplicable. Acogemos y celebramos la singularidad de cada individuo. Únase a Intellias para una carrera en la que sus perspectivas y contribuciones sean fundamentales para nuestro éxito compartido. Habilidades Python Spark
Publicado por

Valentina Rodríguez
Indeed · HR