Senior AI Infrastructure / LLM Engineer

FACTECH continúa creciendo y estamos en búsqueda de un/a Senior AI Infrastructure / LLM Engineer para integrarse a nuestro equipo y participar en proyectos internacionales de alto impacto, trabajando con infraestructura GPU, despliegue de modelos de lenguaje, plataformas Cloud, Kubernetes

Beneficios


  • Contrato indefinido.
  • Modalidad de trabajo 100% remota.
  • Medicina prepagada.
  • Plan de carrera y crecimiento profesional.
  • Acceso a cursos, certificaciones y diplomados sin costo.
  • Descuentos en programas de pregrado, posgrado y especializaciones.
  • Viajes internacionales por cumplimiento de objetivos.
  • Incentivos por desempeño y premios tecnológicos.
  • Participación en proyectos internacionales con tecnologías de Inteligencia Artificial, LLM, Cloud, GPU y plataformas de última generación.
  • Flexibilidad laboral y cultura enfocada en el desarrollo del talento.
Requisitos
  • Experiencia sólida en infraestructura Cloud, DevOps, Platform Engineering, SRE o roles equivalentes.
  • Mínimo 4 años de experiencia en infraestructura Cloud o DevOps.
  • Mínimo 1 año de experiencia demostrable desplegando y operando modelos de lenguaje en producción.
  • Experiencia práctica en despliegue, configuración, operación y optimización de modelos de lenguaje open source sobre infraestructura GPU.
  • Experiencia en plataformas de inferencia como vLLM o SGLang.
  • Experiencia trabajando con AWS o Azure, específicamente con instancias y recursos GPU.
  • Experiencia avanzada con Terraform para Infrastructure as Code.
  • Dominio de Docker y Kubernetes, incluyendo despliegue de workloads orientados a GPU.
  • Dominio de Python 3.11+, especialmente asyncio y FastAPI.
  • Experiencia trabajando con PostgreSQL.
  • Experiencia con bases de datos vectoriales como pgvector, Qdrant o Weaviate.
  • Experiencia utilizando Redis como sistema de caché.
  • Experiencia implementando soluciones de observabilidad, monitorización y métricas con Prometheus y Grafana.
  • Dominio de entornos Linux.
  • Experiencia en cuantización de modelos utilizando tecnologías como FP8, AWQ, GPTQ o GGUF.
  • Conocimientos sólidos en dimensionamiento de memoria GPU, incluyendo cálculo de VRAM, KV Cache, contexto y gestión de concurrencia.

Será un plus si cuentas con experiencia en


  • Arquitecturas de modelos MoE (Mixture of Experts).
  • FinOps aplicado a infraestructura GPU y Cloud.
  • Optimización de costes asociados a infraestructura GPU.
  • Arquitecturas RAG (Retrieval-Augmented Generation).
  • Bases de datos vectoriales a escala.
  • LangGraph, CrewAI o AutoGen
  • LiteLLM.
  • GitHub Actions o GitLab CI.
  • Ansible.
  • CUDA / NVIDIA Container Toolkit.
  • Arquitecturas multi-model y multi-tenant
  • Implementación de plataformas internas de LLM / Generative AI.
  • Experiencia en entornos regulados o con requisitos de RGPD y residencia de datos en la Unión Europea.
  • Contribuciones a proyectos Open Source

Principales responsabilidades


  • Diseñar, desplegar, configurar y optimizar servicios de inferencia de modelos de lenguaje open source sobre infraestructura GPU.
  • Implementar y operar plataformas de inferencia utilizando vLLM y/o SGLang.
  • Diseñar y desplegar infraestructura GPU sobre AWS y/o Azure.
  • Dimensionar recursos de cómputo mediante pruebas de carga, benchmarking y análisis de rendimiento.
  • Optimizar el rendimiento de los servicios de inferencia considerando latencia, throughput, concurrencia, utilización de GPU, VRAM y KV Cache.
  • Implementar estrategias de cuantización y optimización de modelos utilizando tecnologías como FP8, AWQ, GPTQ o GGUF.
  • Diseñar y mantener infraestructura mediante Terraform, aplicando buenas prácticas de Infrastructure as Code.
  • Implementar y mantener los diferentes entornos de desarrollo, preproducción y producción.
  • Diseñar y mantener procesos de CI/CD para infraestructura, servicios y aplicaciones de Inteligencia Artificial.
  • Desplegar, configurar y administrar servicios utilizando Docker y Kubernetes.
  • Gestionar workloads de GPU sobre Kubernetes, optimizando la asignación y utilización de recursos.

Requisitos mínimos

Stack tecnológico


  • Inferencia: vLLM, SGLang.
  • Cloud: AWS, Azure, instancias GPU.
  • IaC: Terraform.
  • Contenedores: Docker, Kubernetes.
  • Lenguaje: Python 3.11+, asyncio, FastAPI.
  • Base de datos: PostgreSQL.
  • Vectorial: pgvector, Qdrant, Weaviate.
  • Caché: Redis.
  • Observabilidad: Prometheus, Grafana, Langfuse.
  • Sistema: Linux.
  • GPU / AI Infrastructure: CUDA, NVIDIA Container Toolkit.
  • CI/CD: GitHub Actions, GitLab CI.
  • Automatización: Ansible.
  • Networking: Nginx, Traefik.
  • LLM / Agentic AI: LangGraph, CrewAI, AutoGen, LiteLLM, MCP.
  • Seguridad: HashiCorp Vault.

Modalidad


  • Trabajo 100% remoto