Chercheur en apprentissage par renforcement (RL)
Mission principale
Développe les méthodes d'apprentissage par récompense qui pilotent agents et robots.
5 responsabilités clés
- Concevoir des algorithmes d'apprentissage par récompense et leurs environnements.
- Définir des fonctions de récompense robustes et non contournables.
- Entraîner et évaluer des agents sur des tâches séquentielles complexes.
- Étudier l'exploration, la généralisation et la stabilité des politiques.
- Transférer les méthodes RL vers la robotique, les jeux et les LLM.
Compétences clés
RL (PPO, Q-learning, RLHF), simulation, mathématiques de l'optimisation, PyTorch.
Ce qui est attendu
Des agents qui apprennent des comportements utiles sans exploiter les failles de leur récompense.
Évolutions possibles
Ingénieur post-training, Chercheur robotique, Research Lead RL.
Offres en ce moment
Aucune offre pour ce métier en ce moment.
Soyez alerté dès qu’un poste de Chercheur en apprentissage par renforcement (RL) est publié.
Créer une alerte emploi →