
Senior AI Infrastructure / LLM Engineer
FACTECH continúa creciendo y estamos en búsqueda de un/a Senior AI Infrastructure / LLM Engineer para integrarse a nuestro equipo y participar en proyectos internacionales de alto impacto, trabajando con infraestructura GPU, despliegue de modelos de lenguaje, plataformas Cloud, Kubernetes
Beneficios
- Contrato indefinido.
- Modalidad de trabajo 100% remota.
- Medicina prepagada.
- Plan de carrera y crecimiento profesional.
- Acceso a cursos, certificaciones y diplomados sin costo.
- Descuentos en programas de pregrado, posgrado y especializaciones.
- Viajes internacionales por cumplimiento de objetivos.
- Incentivos por desempeño y premios tecnológicos.
- Participación en proyectos internacionales con tecnologías de Inteligencia Artificial, LLM, Cloud, GPU y plataformas de última generación.
- Flexibilidad laboral y cultura enfocada en el desarrollo del talento.
- Experiencia sólida en infraestructura Cloud, DevOps, Platform Engineering, SRE o roles equivalentes.
- Mínimo 4 años de experiencia en infraestructura Cloud o DevOps.
- Mínimo 1 año de experiencia demostrable desplegando y operando modelos de lenguaje en producción.
- Experiencia práctica en despliegue, configuración, operación y optimización de modelos de lenguaje open source sobre infraestructura GPU.
- Experiencia en plataformas de inferencia como vLLM o SGLang.
- Experiencia trabajando con AWS o Azure, específicamente con instancias y recursos GPU.
- Experiencia avanzada con Terraform para Infrastructure as Code.
- Dominio de Docker y Kubernetes, incluyendo despliegue de workloads orientados a GPU.
- Dominio de Python 3.11+, especialmente asyncio y FastAPI.
- Experiencia trabajando con PostgreSQL.
- Experiencia con bases de datos vectoriales como pgvector, Qdrant o Weaviate.
- Experiencia utilizando Redis como sistema de caché.
- Experiencia implementando soluciones de observabilidad, monitorización y métricas con Prometheus y Grafana.
- Dominio de entornos Linux.
- Experiencia en cuantización de modelos utilizando tecnologías como FP8, AWQ, GPTQ o GGUF.
- Conocimientos sólidos en dimensionamiento de memoria GPU, incluyendo cálculo de VRAM, KV Cache, contexto y gestión de concurrencia.
Será un plus si cuentas con experiencia en
- Arquitecturas de modelos MoE (Mixture of Experts).
- FinOps aplicado a infraestructura GPU y Cloud.
- Optimización de costes asociados a infraestructura GPU.
- Arquitecturas RAG (Retrieval-Augmented Generation).
- Bases de datos vectoriales a escala.
- LangGraph, CrewAI o AutoGen
- LiteLLM.
- GitHub Actions o GitLab CI.
- Ansible.
- CUDA / NVIDIA Container Toolkit.
- Arquitecturas multi-model y multi-tenant
- Implementación de plataformas internas de LLM / Generative AI.
- Experiencia en entornos regulados o con requisitos de RGPD y residencia de datos en la Unión Europea.
- Contribuciones a proyectos Open Source
Principales responsabilidades
- Diseñar, desplegar, configurar y optimizar servicios de inferencia de modelos de lenguaje open source sobre infraestructura GPU.
- Implementar y operar plataformas de inferencia utilizando vLLM y/o SGLang.
- Diseñar y desplegar infraestructura GPU sobre AWS y/o Azure.
- Dimensionar recursos de cómputo mediante pruebas de carga, benchmarking y análisis de rendimiento.
- Optimizar el rendimiento de los servicios de inferencia considerando latencia, throughput, concurrencia, utilización de GPU, VRAM y KV Cache.
- Implementar estrategias de cuantización y optimización de modelos utilizando tecnologías como FP8, AWQ, GPTQ o GGUF.
- Diseñar y mantener infraestructura mediante Terraform, aplicando buenas prácticas de Infrastructure as Code.
- Implementar y mantener los diferentes entornos de desarrollo, preproducción y producción.
- Diseñar y mantener procesos de CI/CD para infraestructura, servicios y aplicaciones de Inteligencia Artificial.
- Desplegar, configurar y administrar servicios utilizando Docker y Kubernetes.
- Gestionar workloads de GPU sobre Kubernetes, optimizando la asignación y utilización de recursos.
Requisitos mínimos
Stack tecnológico
- Inferencia: vLLM, SGLang.
- Cloud: AWS, Azure, instancias GPU.
- IaC: Terraform.
- Contenedores: Docker, Kubernetes.
- Lenguaje: Python 3.11+, asyncio, FastAPI.
- Base de datos: PostgreSQL.
- Vectorial: pgvector, Qdrant, Weaviate.
- Caché: Redis.
- Observabilidad: Prometheus, Grafana, Langfuse.
- Sistema: Linux.
- GPU / AI Infrastructure: CUDA, NVIDIA Container Toolkit.
- CI/CD: GitHub Actions, GitLab CI.
- Automatización: Ansible.
- Networking: Nginx, Traefik.
- LLM / Agentic AI: LangGraph, CrewAI, AutoGen, LiteLLM, MCP.
- Seguridad: HashiCorp Vault.
Modalidad
- Trabajo 100% remoto