Descripción
Resumen:
Buscamos a un Ingeniero Líder de DevOps de Datos para construir desde cero una Puerta de Enlace de IA Empresarial, influir en su diseño y automatizar la gobernanza de IA en toda la empresa.
Aspectos destacados:
1. Diseñar y establecer desde el principio la estructura central de la Puerta de Enlace de IA Empresarial
2. Influir en las decisiones de diseño dentro de un equipo pequeño y enfocado, con impacto rápido
3. Impulsar decisiones clave de arquitectura y diseño a medida que la plataforma crece
Buscamos a un Ingeniero Líder de DevOps de Datos para que se una a nuestro equipo. Estamos desarrollando completamente desde cero una Puerta de Enlace de IA Empresarial. Esta funciona como el único punto de acceso que todos los equipos de la empresa utilizan para trabajar con modelos de lenguaje grandes. También sirve como nuestro mecanismo para controlar la IA a escala, abarcando quién puede acceder a qué modelos, los costos asociados y qué actividades se registran. La visión es que el sistema opere de forma independiente. La incorporación de equipos, agentes y servidores MCP, junto con la gestión de claves, permisos, límites y salvaguardias, debe estar impulsada por la automatización y no por procesos manuales basados en tickets. La mayor parte de esto aún no está construida, por lo que usted tendrá influencia sobre ello desde las primeras decisiones de diseño. Dado el tamaño reducido y el enfoque específico del equipo, las decisiones se toman rápidamente y su impacto será inmediatamente evidente. Buscamos a alguien cuyo instinto primario sea la automatización y que otorgue tanta importancia a la gobernanza de IA como a los propios modelos.
**Responsabilidades**
* Diseñar y establecer desde el principio la estructura central de la Puerta de Enlace de IA Empresarial
* Construir automatizaciones para la incorporación de equipos, agentes y servidores MCP, cubriendo la configuración de claves, permisos, límites y salvaguardias
* Desarrollar y mantener infraestructura como código para habilitar capacidades escalables y de auto-servicio en toda la plataforma
* Implementar herramientas de supervisión, registro y seguimiento de costos para mantener una visibilidad clara del uso de IA
* Crear salvaguardias y marcos de gobernanza que regulen qué equipos y modelos pueden acceder a recursos específicos
* Garantizar que los sistemas de producción que soportan la puerta de enlace permanezcan fiables, disponibles y con buen rendimiento
* Interactuar directamente con los usuarios de la plataforma, responder preguntas y ayudar a solucionar problemas conforme surjan
* Mejorar continuamente la automatización para reducir los esfuerzos manuales y la dependencia de procesos basados en tickets
* Revisar e integrar nuevos patrones, marcos y protocolos de IA generativa y de agentes en la plataforma
* Contribuir a tomar decisiones clave de arquitectura y diseño a medida que la plataforma evolucione más allá de sus etapas iniciales
**Requisitos**
* Un mínimo de 5 años de experiencia relevante
* Al menos un año de experiencia liderando y gestionando equipos
* Conocimientos sólidos de Python aplicados a la automatización, extensiones e integraciones
* Experiencia sólida en SRE, con un historial comprobado de mantenimiento de sistemas de producción estables
* Competencia en el uso de Git para control de versiones
* Experiencia previa con Google Cloud Platform
* Conocimiento de las prácticas de LLMOps
* Experiencia aplicando Terraform y Helm para la automatización de infraestructura
* Conocimientos prácticos de conceptos de IA generativa y de agentes, incluidos patrones, marcos y protocolos relacionados
* Excelentes habilidades comunicativas, con capacidad para explicar temas técnicos de forma clara, dada la interacción diaria con los usuarios de la plataforma para responder preguntas y resolver incidencias
* Excelente dominio del inglés (nivel B2 o superior)
**Deseable**
* Experiencia práctica con Google Vertex AI, especialmente con endpoints para servicio de modelos y Model Armor
* Experiencia con servicios de GCP tales como BigQuery, Cloud Run e IAM
* Experiencia en el desarrollo de agentes de IA, por ejemplo mediante el Kit de Desarrollo de Agentes (ADK) de Google
* Experiencia con AWS Bedrock
* Amplia experiencia con Kubernetes, idealmente involucrando GKE
* Conocimiento de Groovy
* Experiencia con pipelines CI/CD basadas en Jenkins
* Experiencia en producción con una puerta de enlace de IA, como LiteLLM o EPAM DIAL, considerada muy valiosa
**Ofrecemos**
* Proyectos internacionales con marcas líderes
* Trabajo con equipos globales de profesionales altamente calificados y diversos
* Beneficios médicos
* Programas financieros para empleados
* Días de vacaciones pagados y licencias por enfermedad
* Cursos de actualización de competencias, reconversión profesional y certificación
* Acceso ilimitado a la biblioteca de LinkedIn Learning y a más de 22.000 cursos
* Oportunidades de carrera global
* Oportunidades de voluntariado y participación comunitaria
* Grupos de empleados de EPAM
* Una cultura galardonada reconocida por Glassdoor, Newsweek y LinkedIn
*EPAM es un Empleador que ofrece Igualdad de Oportunidades. Todos los candidatos calificados recibirán consideración para el empleo sin distinción de raza, color, religión, sexo, origen nacional, edad, orientación sexual, identidad o expresión de género, discapacidad, condición de veterano protegido u otra característica protegida por la ley aplicable.*