MLOps Engineer

Remote

Apply for this Job

MLOps Engineer

Remote

Apply for this Job

Description

Objetivo del Puesto:


Buscamos un MLOps Engineer especializado en infraestructura y orquestación para liderar la automatización, escalabilidad y confiabilidad del ciclo de vida de nuestras soluciones de Machine Learning. Serás el puente entre los equipos de Data Science y Platform Engineering, construyendo la arquitectura necesaria para llevar modelos desde la fase de experimentación hasta un entorno de producción altamente disponible, seguro y monitoreado.



Responsabilidades Principales

  • Pipelines de ML y CI/CD/CT:
  • Diseñar, construir y mantener pipelines automatizados de entrenamiento, validación y despliegue continuo de modelos (Continuous Training & Deployment).
  • Implementar prácticas avanzadas de CI/CD adaptadas al ciclo de vida de Machine Learning utilizando GitHub Actions, GitLab CI o herramientas similares.
  • Infraestructura como Código (IaC) y Gestión Cloud:
  • Provisionar, escalar y mantener infraestructura en la nube (AWS/GCP/Azure) utilizando Terraform o CloudFormation.
  • Administrar clústeres de Kubernetes (EKS/GKE/AKS) optimizados para cargas de trabajo de IA/ML, gestionando el cómputo en CPU/GPU de forma eficiente.
  • Versionado de Artefactos:
  • Garantizar la trazabilidad y reproducibilidad total del ciclo de aprendizaje mediante el versionado de código, datos (Data Versioning) y modelos (usando herramientas como DVC, MLflow o similares).
  • Monitoreo, Observabilidad y Calidad:
  • Implementar sistemas de monitoreo en tiempo real para detectar Data Drift, Concept Drift y degradación del rendimiento de los modelos en producción.
  • Configurar alertas proactivas y tableros de métricas para garantizar SLAs operativos exigentes.
  • Gobernanza, Seguridad y Colaboración:
  • Integrar políticas de seguridad, gestión de identidades y accesos (IAM), cifrado de datos y cumplimiento normativo en los pipelines.
  • Colaborar de cerca con Data Scientists, Data Engineers y Cloud/DevOps Engineers para definir estándares arquitectónicos y reducir el tiempo de salida al mercado (Time-to-Market).


Requirements

Técnicos (Obligatorios)

  • Experiencia: 3+ años en roles de MLOps, DevOps enfocado en Datos, o Cloud Infrastructure Engineer en entornos de producción.
  • Plataformas Cloud: Dominio sólido en al menos una nube principal (AWS, GCP o Azure) y sus servicios administrados de datos/ML.
  • Orquestación y MLOps: Experiencia práctica en MLflow, Kubeflow, Apache Airflow, Prefect o Ray.
  • Contenedores y Serverless: Experiencia avanzada en Docker y orquestación con Kubernetes.
  • Infraestructura como Código: Dominio de Terraform o CloudFormation.
  • Lenguajes de Programación: Nivel avanzado de Python y manejo de scripts en Bash.
  • Bases de Datos y Datos: Familiaridad con arquitecturas de datos (Feature Stores, Data Lakes) y consulta de bases de datos relacionales y NoSQL.



Deseables (Plus)

  • Certificación oficial en la nube (ej. AWS Certified Machine Learning / DevOps Engineer, GCP Professional ML Engineer).
  • Experiencia trabajando con Feature Stores (Feast, Hopsworks, Tecton).
  • Conocimiento en la optimización e inferencia de modelos de lenguaje masivos (LLMs) o arquitecturas Deep Learning.
  • Manejo de KServe, Triton Inference Server o Ray Serve para inferencias a baja latencia.



Habilidades Blandas

  • Mentalidad orientada a la automatización y la mejora continua.
  • Excelentes habilidades de comunicación técnica para traducir necesidades entre Data Science y Platform Operations.
  • Capacidad analítica y resolución de problemas bajo presión en entornos de producción.