Ingénieur post-training / RLHF

Mission principale

Affine le comportement des modèles après l'entraînement initial, à grande échelle.

5 responsabilités clés

  • Concevoir les pipelines de fine-tuning par feedback humain et IA à grande échelle.
  • Construire et gérer les datasets de préférences et leurs annotateurs.
  • Entraîner les reward models et surveiller leurs biais.
  • Évaluer les modèles post-entraînés : utilité, sécurité, style.
  • Industrialiser les itérations rapides entre versions de modèles.

Compétences clés

RLHF, DPO, reward modeling, gestion de données de préférence, entraînement distribué.

Ce qui est attendu

Des modèles dont le comportement s'améliore de façon mesurable à chaque itération, sans régression de sécurité.

Évolutions possibles

Research Engineer senior, Lead post-training, Chercheur alignement.

Offres en ce moment

Aucune offre pour ce métier en ce moment.

Soyez alerté dès qu’un poste de Ingénieur post-training / RLHF est publié.

Créer une alerte emploi →