Descripción
Resumen:
Buscamos un Ingeniero Senior de Confiabilidad del Sitio (SRE) proactivo para cerrar la brecha entre el desarrollo de software y las operaciones de sistemas, automatizar operaciones, escalar infraestructura y garantizar entornos de producción altamente disponibles.
Aspectos destacados:
1. Cerrar la brecha entre el desarrollo de software y las operaciones de sistemas
2. Construir, ejecutar y proteger entornos de producción
3. Automatizar operaciones y escalar infraestructura
Buscamos un Ingeniero Senior de Confiabilidad del Sitio (SRE) experimentado y proactivo para unirse a nuestro equipo de ingeniería. En este puesto, usted cerrará la brecha entre el desarrollo de software y las operaciones de sistemas, aplicando principios de ingeniería de software para automatizar operaciones, escalar infraestructura y garantizar que los sistemas permanezcan altamente disponibles, resilientes y con buen rendimiento. Su misión consiste en construir, ejecutar y proteger los entornos de producción que impulsan nuestras aplicaciones, minimizando el tiempo de inactividad y ayudándonos a implementar software de forma rápida y segura.
**Responsabilidades**
* Diseñar, construir y mantener infraestructura en la nube mediante prácticas modernas de Infraestructura como Código (IaC), como Terraform y CloudFormation
* Construir y optimizar canalizaciones CI/CD para automatizar implementaciones de software, gestión de configuraciones y tareas operativas repetitivas
* Diseñar e implementar sistemas robustos de registro, monitoreo y alertas para establecer Objetivos de Nivel de Servicio (SLO) e Indicadores de Nivel de Servicio (SLI) claros
* Responder a incidentes en producción y liderar esfuerzos de resolución de problemas para restablecer los servicios rápidamente
* Realizar análisis posteriores a incidentes sin asignación de culpas para identificar causas fundamentales y prevenir su recurrencia
* Colaborar con desarrolladores de software para optimizar el rendimiento del sistema y planificar la capacidad
* Garantizar que los servicios puedan escalar para manejar el crecimiento y picos de tráfico
**Requisitos**
* 3 años o más de experiencia en administración de sistemas, DevOps o desarrollo de software centrado en sistemas
* Competencia en al menos un lenguaje de scripting o programación, como Python, Bash, Go o Rust
* Experiencia con proveedores de nube pública, como AWS, Azure o GCP, y herramientas de contenerización como Docker y Kubernetes
* Conocimientos sobre administración de Linux/Unix y fundamentos de redes, incluidos TCP/IP, DNS y HTTP/SSL/TLS
* Familiaridad con herramientas de monitoreo y observabilidad, como Prometheus, Grafana y Datadog
* Pasión por la automatización, la eliminación de tareas repetitivas y la construcción de sistemas resilientes que fallen con elegancia
* Dominio del inglés a nivel B2 o superior
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales compuestos por profesionales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Una cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn
*EPAM es un Empleador que ofrece Igualdad de Oportunidades. Todos los solicitantes calificados recibirán consideración para el empleo sin importar raza, color, religión, sexo, origen nacional, edad, orientación sexual, identidad o expresión de género, discapacidad, condición de veterano protegido u otra característica protegida por la ley aplicable.*