← Toutes les offres
INFRASTRUCTURE

Staff DevOps / HPC Engineer

Paris Hybride 5 ans+ CDI
MISSIONS
  • Concevoir, déployer et opérer des clusters HPC (GPU et CPU) pour des workloads ML et de simulation
  • Gérer l'ordonnancement des jobs (SLURM, Kubernetes) et optimiser l'utilisation des ressources GPU
  • Automatiser le provisionnement et la configuration de l'infrastructure (IaC) avec Terraform et Ansible
  • Construire et maintenir les pipelines CI/CD pour les workloads ML et les déploiements logiciels
  • Assurer la surveillance, l'alerting et la réponse aux incidents sur l'ensemble du parc infrastructure
  • Collaborer avec les équipes ML pour optimiser les performances des pipelines d'entraînement et d'inférence
STACK TECHNIQUE
  • Orchestration : Kubernetes, SLURM, MPI
  • IaC : Terraform, Ansible, Pulumi
  • Cloud : AWS, GCP ou Azure (au moins un, multi-cloud apprécié)
  • Containers : Docker, Singularity (HPC)
  • Monitoring : Prometheus, Grafana, Datadog
  • Réseau HPC : InfiniBand, RDMA
  • GPU : NVIDIA CUDA, NCCL, drivers et firmware
PROFIL RECHERCHÉ
  • Bac+5 en informatique, systèmes ou réseaux, ou expérience équivalente
  • 5 ans d'expérience minimum en administration système, DevOps ou infrastructure HPC
  • Expérience avec des clusters GPU (NVIDIA A100/H100) et des workloads ML distribués
  • Maîtrise de Kubernetes et des outils IaC (Terraform, Ansible)
  • Solides compétences en scripting (Python, Bash) et en réseaux (TCP/IP, InfiniBand)
  • Capacité à travailler dans un environnement exigeant avec de forts enjeux de disponibilité
Retour en haut