Ingénieur AI Infrastructure

Mission principale

Gère les clusters GPU, l'entraînement distribué et les coûts de calcul.

5 responsabilités clés

  • Concevoir et opérer les clusters GPU d'entraînement et d'inférence.
  • Optimiser l'utilisation du calcul : scheduling, parallélisme, files d'attente.
  • Piloter les coûts de calcul et les arbitrages cloud vs on-premise.
  • Garantir la fiabilité des jobs longs : checkpointing, reprise, monitoring.
  • Outiller les équipes ML pour qu'elles soient autonomes sur l'infra.

Compétences clés

Kubernetes, Slurm, GPU (CUDA), réseau haute performance, cloud, FinOps du calcul.

Ce qui est attendu

Un calcul disponible, rapide et au juste coût : l'infra est le nerf de la guerre des modèles.

Évolutions possibles

Architecte plateforme IA, Head of Infrastructure, Ingénieur HPC.

Offres en ce moment

Aucune offre pour ce métier en ce moment.

Soyez alerté dès qu’un poste de Ingénieur AI Infrastructure est publié.

Créer une alerte emploi →