Descripción
Resumen:
Buscamos un/a talentoso/a desarrollador/a de datos para diseñar, construir y optimizar canalizaciones de datos escalables y arquitecturas de data lakes para plataformas de datos modernas, aprovechando soluciones nativas en la nube dentro de AWS.
Aspectos destacados:
1. Impulsar la evolución de plataformas de datos modernas para los clientes.
2. Diseñar, construir y optimizar canalizaciones de datos escalables y arquitecturas de data lakes.
3. Trabajar con soluciones nativas en la nube, especialmente dentro del ecosistema de AWS.
En CI\&T ayudamos a grandes empresas a transformar el potencial de la inteligencia artificial (IA) en un impacto empresarial real mediante la implementación de IA, la ejecución nativa de IA y soluciones tecnológicas integradas al negocio.
Con 30 años de experiencia en transformación tecnológica, aceleramos la innovación con experiencia en SDLC Agentic, modernización de aplicaciones, Datos e IA, Martech y estrategia empresarial.
Somos 8.000 personas de CI\&T en más de 25 países, colaborando para construir soluciones con un impacto real. La IA ya forma parte de cómo trabajamos, evolucionamos e innovamos cada día.
A medida que CI\&T continúa expandiendo sus capacidades en datos y análisis, buscamos un/a desarrollador/a de datos talentoso/a y experimentado/a para unirse a nuestro equipo e impulsar la evolución de plataformas de datos modernas para nuestros clientes. Este puesto es fundamental para diseñar, construir y optimizar canalizaciones de datos escalables y arquitecturas de data lakes que potencien la toma de decisiones basada en datos en toda la organización.
El/la desarrollador/a de datos trabajará con soluciones nativas en la nube para apoyar todo el ciclo de vida de los datos: desde la ingesta y la transformación hasta la optimización del almacenamiento y la habilitación del análisis. Este puesto requiere una sólida experiencia técnica en procesamiento distribuido de datos, un dominio avanzado de SQL y una comprensión profunda de la infraestructura en la nube, especialmente dentro del ecosistema de AWS. El/la candidato/a ideal equilibrará rendimiento, costo y mantenibilidad mientras contribuye a soluciones de datos reutilizables y bien arquitectadas.
#### **Responsabilidades:**
**Desarrollo y optimización de canalizaciones de datos:**
* Diseñar, construir y mantener procesos robustos de ETL/ELT para ingerir, transformar y entregar datos en una arquitectura moderna de data lake
* Desarrollar y optimizar flujos de trabajo de procesamiento distribuido de datos mediante Python y PySpark para manejar eficientemente conjuntos de datos a gran escala
* Implementar y refinar estrategias de particionamiento para marcos de almacenamiento de data lakes (como Delta Lake o Apache Iceberg) para equilibrar el rendimiento de las consultas con los costos de almacenamiento
**Transformación y modelado de datos:**
* Escribir, optimizar y traducir consultas SQL complejas que incluyan expresiones condicionales, funciones ventana, CTE y agregaciones
* Migrar y modernizar canalizaciones de datos desde plataformas heredadas de RDBMS hacia entornos analíticos nativos en la nube
* Aprovechar los principios de programación orientada a objetos para contribuir a bibliotecas internas destinadas a la reutilización y estandarización del código
**Infraestructura y orquestación en la nube:**
* Trabajar con confianza con servicios nativos de AWS como Glue (trabajos, catálogo, desencadenadores, flujos de trabajo), Athena, Redshift, S3, Lambda, EventBridge y otros servicios relacionados con datos
* Colaborar con los equipos de infraestructura y DevOps para aprovisionar y gestionar recursos de datos mediante herramientas de Infraestructura como Código (IaC), como CloudFormation, CDK o Terraform
* Supervisar la salud y el rendimiento de las canalizaciones de datos mediante CloudWatch y otras herramientas de observabilidad, abordando proactivamente los problemas y mejorando la confiabilidad
**Gobernanza y calidad de los datos:**
* Garantizar la integridad, coherencia y cumplimiento normativo de los datos en todas las canalizaciones y capas de almacenamiento
* Implementar seguimiento de métricas y marcos de observabilidad para ofrecer transparencia sobre los flujos de trabajo de datos y los acuerdos de nivel de servicio (SLA)
* Apoyar la gestión del catálogo de datos y las prácticas de gobernanza de metadatos
**Colaboración y mejora continua:**
* Colaborar con analistas de datos, científicos de datos y partes interesadas del negocio para comprender los requisitos y traducirlos en soluciones técnicas escalables
* Contribuir a la documentación técnica, revisiones de código y compartición de conocimientos dentro del equipo
* Mantenerse actualizado/a sobre las prácticas emergentes de ingeniería de datos, herramientas e innovaciones nativas en la nube
#### **Requisitos:**
* Experiencia sólida trabajando con procesos ETL y desarrollo de canalizaciones de datos con **AWS**
* Dominio avanzado de **Python** como lenguaje principal de programación, con experiencia demostrable en escritura y optimización de código **PySpark** para procesamiento distribuido de datos
* Comprensión exhaustiva de **SQL**, incluidas consultas complejas (CTE, funciones ventana, agregaciones, expresiones condicionales) y experiencia en la migración de cargas de trabajo desde plataformas heredadas de RDBMS
* Experiencia práctica con **AWS Glue** (trabajos, catálogo, desencadenadores, flujos de trabajo), **Athena** y **Redshift**
* Comprensión sólida de **arquitecturas de data lakes** y estrategias de particionamiento para optimizar rendimiento y costos
* Buen conocimiento de los principios de **programación orientada a objetos (POO)** y experiencia trabajando con bibliotecas de código reutilizable
* Capacidad para trabajar con **Git**, **scripts de Shell** y entornos **Linux**
* Familiaridad con prácticas de observabilidad, monitoreo y seguimiento de métricas
* Inglés avanzado/fluido
#### **Deseable:**
* Experiencia con formatos abiertos de tablas como **Delta Lake** o **Apache Iceberg**
* Conocimientos de **TypeScript**
* Experiencia práctica con herramientas de Infraestructura como Código (IaC), como **CloudFormation** (preferible), **CDK** o **Terraform**
* Familiaridad con otros servicios de AWS, como **SageMaker AI**, **ECS**, **RDS**, **DynamoDB**, **IAM** o **EventBridge**
* Experiencia trabajando con **Pandas** para manipulación y análisis de datos
* Exposición a flujos de trabajo de aprendizaje automático o iniciativas de datos impulsadas por IA
\#LI\-JP3
**Nuestros beneficios incluyen:**
* Seguro médico premium
* Vales de comida
* Licencias de maternidad y paternidad
* Subsidio para servicios móviles
* Pago por enfermedad\-Seguro de vida
* Universidad CI\&T
* Festivos colombianos
* Vacaciones pagas
Y muchos otros.
La colaboración es nuestra superpotencia, la diversidad nos une y la excelencia es nuestro estándar.
Valoramos identidades diversas y experiencias vitales distintas, fomentando un entorno laboral diverso, inclusivo y seguro. Animamos a personas de grupos diversos y subrepresentados a presentar su candidatura a nuestras ofertas laborales.