Ingénieur AI Infrastructure
Mission principale
Gère les clusters GPU, l'entraînement distribué et les coûts de calcul.
5 responsabilités clés
- Concevoir et opérer les clusters GPU d'entraînement et d'inférence.
- Optimiser l'utilisation du calcul : scheduling, parallélisme, files d'attente.
- Piloter les coûts de calcul et les arbitrages cloud vs on-premise.
- Garantir la fiabilité des jobs longs : checkpointing, reprise, monitoring.
- Outiller les équipes ML pour qu'elles soient autonomes sur l'infra.
Compétences clés
Kubernetes, Slurm, GPU (CUDA), réseau haute performance, cloud, FinOps du calcul.
Ce qui est attendu
Un calcul disponible, rapide et au juste coût : l'infra est le nerf de la guerre des modèles.
Évolutions possibles
Architecte plateforme IA, Head of Infrastructure, Ingénieur HPC.
Offres en ce moment
Aucune offre pour ce métier en ce moment.
Soyez alerté dès qu’un poste de Ingénieur AI Infrastructure est publié.
Créer une alerte emploi →