Descripción
Resumen:
Buscamos un Ingeniero de Confiabilidad del Sitio proactivo para reforzar la confiabilidad, escalabilidad y seguridad de los entornos de producción, actuando como puente entre el desarrollo de software y las operaciones.
Aspectos destacados:
1. Diseñar y mantener infraestructura en la nube mediante prácticas de Infraestructura como Código
2. Construir y optimizar tuberías CI/CD para despliegues y flujos de trabajo automatizados
3. Liderar análisis posteriores a incidentes sin asignación de culpas para identificar las causas fundamentales y prevenir su recurrencia
Buscamos un **Ingeniero de Confiabilidad del Sitio** proactivo para reforzar la confiabilidad, escalabilidad y seguridad de los entornos de producción. Usted actuará como puente entre el desarrollo de software y las operaciones mediante la automatización, la observabilidad y la respuesta a incidentes; ¡postúlese ahora para ayudar a reducir el tiempo de inactividad y permitir lanzamientos rápidos y seguros!
**Responsabilidades**
* Diseñar y mantener infraestructura en la nube mediante prácticas de Infraestructura como Código
* Construir y optimizar tuberías CI/CD para automatizar despliegues y flujos de trabajo operativos
* Implementar registros, monitoreo y alertas para mejorar la observabilidad y la confiabilidad
* Definir y supervisar Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) con informes claros
* Responder a incidentes en producción y garantizar la restauración rápida del servicio
* Liderar análisis posteriores a incidentes sin asignación de culpas para identificar las causas fundamentales y prevenir su recurrencia
* Colaborar con ingenieros para mejorar el rendimiento, la escalabilidad y la planificación de capacidad
* Automatizar tareas operativas repetitivas para reducir la carga operativa innecesaria (toil) y el riesgo operativo
* Reforzar los entornos de producción para mejorar la resiliencia y las prácticas seguras de cambio
**Requisitos**
* 2\+ años de experiencia en ingeniería de confiabilidad del sitio, DevOps o administración de sistemas
* Experiencia práctica con Infraestructura como Código utilizando Terraform o CloudFormation
* Experiencia práctica construyendo y mejorando tuberías CI/CD para despliegues automatizados
* Habilidades sólidas de resolución de problemas y liderazgo en respuesta a incidentes en entornos de producción
* Capacidad comprobada para coordinar trabajos de confiabilidad con equipos de desarrollo de software
* Competencia en programación o creación de scripts con Python, Bash, Go o Rust
* Experiencia con plataformas en la nube como AWS, Azure o GCP
* Experiencia con contenedores mediante Docker y Kubernetes
* Conocimientos profundos en administración de Linux/Unix y fundamentos de redes (TCP/IP, DNS, HTTP, SSL/TLS)
* Excelentes habilidades comunicativas y mentalidad centrada en la confiabilidad, con énfasis en la automatización y la reducción de la carga operativa innecesaria (toil)
* Dominio avanzado del inglés (nivel C1, Avanzado)
**Deseable**
* Experiencia con Prometheus, Grafana o Datadog
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales compuestos por profesionales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificaciones
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn
*EPAM es un empleador que ofrece igualdad de oportunidades. Todos los candidatos calificados recibirán consideración para el empleo sin distinción de raza, color, religión, sexo, origen nacional, edad, orientación sexual, identidad o expresión de género, discapacidad, condición de veterano protegido o cualquier otra característica protegida por la ley aplicable.*