Ingénieur post-training / RLHF
Mission principale
Affine le comportement des modèles après l'entraînement initial, à grande échelle.
5 responsabilités clés
- Concevoir les pipelines de fine-tuning par feedback humain et IA à grande échelle.
- Construire et gérer les datasets de préférences et leurs annotateurs.
- Entraîner les reward models et surveiller leurs biais.
- Évaluer les modèles post-entraînés : utilité, sécurité, style.
- Industrialiser les itérations rapides entre versions de modèles.
Compétences clés
RLHF, DPO, reward modeling, gestion de données de préférence, entraînement distribué.
Ce qui est attendu
Des modèles dont le comportement s'améliore de façon mesurable à chaque itération, sans régression de sécurité.
Évolutions possibles
Research Engineer senior, Lead post-training, Chercheur alignement.
Offres en ce moment
Aucune offre pour ce métier en ce moment.
Soyez alerté dès qu’un poste de Ingénieur post-training / RLHF est publié.
Créer une alerte emploi →