Descripción
Resumen:
Únase a un equipo pequeño y enfocado como Ingeniero Senior de Data DevOps para construir una puerta de enlace de IA empresarial desde cero, definir su diseño y automatizar la gobernanza de la IA a escala.
Aspectos destacados:
1. Diseñar una puerta de enlace de IA empresarial desde las primeras decisiones de diseño
2. Centrarse en la automatización para la gobernanza de la IA y la gestión de la plataforma
3. Contribuir a decisiones arquitectónicas y de diseño significativas
Buscamos un Ingeniero Senior de Data DevOps para unirse a nuestro equipo. Estamos construyendo una puerta de enlace de IA empresarial completamente desde cero. Actúa como el único punto de entrada que todos los equipos de la empresa utilizan para interactuar con modelos de lenguaje grande. También funciona como nuestro medio para gobernar la IA a escala, abordando quién puede acceder a qué modelos, qué gastos se generan y qué se registra. La intención es que el sistema se ejecute de forma autónoma. La incorporación de equipos, agentes y servidores MCP, junto con la gestión de claves, permisos, límites y salvaguardias, debe realizarse mediante automatización en lugar de procesos manuales basados en tickets. Gran parte de esto aún no se ha construido, lo que le brinda la oportunidad de dar forma al sistema desde las primeras decisiones de diseño en adelante. Dado que el equipo es pequeño y enfocado, las decisiones se toman rápidamente y sus contribuciones serán fácilmente visibles. Buscamos a alguien que, por defecto, recurra a la automatización y que valore la gobernanza de la IA tanto como a los propios modelos.
**Responsabilidades**
* Crear y configurar la estructura fundamental de la puerta de enlace de IA empresarial comenzando desde cero
* Desarrollar automatización para incorporar equipos, agentes y servidores MCP, incluida la gestión de claves, permisos, límites y salvaguardias
* Construir y mantener infraestructura como código para ofrecer funcionalidad escalable y autoservicio en toda la plataforma
* Configurar capacidades de supervisión, registro y seguimiento de costos para mantener visible y controlado el uso de la IA
* Diseñar salvaguardias y estructuras de gobernanza que determinen qué equipos y modelos pueden acceder a determinados recursos
* Mantener la confiabilidad, tiempo de actividad y rendimiento de los sistemas de producción que respaldan la puerta de enlace
* Interactuar directamente con los usuarios de la plataforma, responder preguntas y ayudar en la resolución de problemas conforme surjan
* Mejorar constantemente la automatización para reducir el trabajo manual y la dependencia de procesos basados en tickets
* Evaluar y adoptar nuevos patrones, marcos y protocolos de IA generativa (GenAI) e IA agente dentro de la plataforma
* Contribuir a decisiones arquitectónicas y de diseño significativas a medida que la plataforma evolucione más allá de sus etapas iniciales
**Requisitos**
* Al menos 3 años de experiencia relevante
* Sólidas capacidades en Python para automatización, extensiones e integraciones
* Experiencia sólida en SRE, con historial comprobado de mantenimiento de la estabilidad de sistemas de producción
* Competencia con Git para control de versiones
* Experiencia trabajando con Google Cloud Platform
* Conocimiento de prácticas LLMOps
* Experiencia usando Terraform y Helm para automatización de infraestructura
* Conocimientos prácticos de conceptos de IA generativa/IA agente, incluidos patrones, marcos y protocolos relevantes
* Excelentes habilidades comunicativas, con capacidad para explicar claramente temas técnicos, dado el contacto regular con los usuarios de la plataforma para responder preguntas y resolver incidencias
* Excelente dominio del inglés (nivel B2 o superior)
**Deseable**
* Experiencia práctica con Google Vertex AI, especialmente con puntos finales para servicio de modelos y Model Armor
* Experiencia con servicios de GCP como BigQuery, Cloud Run e IAM
* Experiencia en la construcción de agentes de IA, por ejemplo, utilizando el Kit de Desarrollo de Agentes (ADK) de Google
* Experiencia con AWS Bedrock
* Amplia experiencia con Kubernetes, idealmente con GKE
* Conocimiento de Groovy
* Experiencia con pipelines CI/CD usando Jenkins
* Experiencia en producción con una puerta de enlace de IA, como LiteLLM o EPAM DIAL, considerada altamente valiosa
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de colegas altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días libres remunerados y licencias por enfermedad
* Cursos de actualización de habilidades, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22.000 cursos
* Oportunidades profesionales globales
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn
*EPAM es un empleador que ofrece igualdad de oportunidades. Todos los candidatos calificados recibirán consideración para el empleo sin discriminación por raza, color, religión, sexo, origen nacional, edad, orientación sexual, identidad o expresión de género, discapacidad, condición de veterano protegido u otra característica protegida por la ley aplicable.*