Post-training Engineer / RLHF
Main mission
Refines model behavior after initial training, at scale.
5 key responsibilities
- Design fine-tuning pipelines via human and AI feedback at scale.
- Build and manage preference datasets and their annotators.
- Train reward models and monitor their biases.
- Evaluate post-trained models: utility, safety, style.
- Industrialize rapid iterations between model versions.
Key skills
RLHF, DPO, reward modeling, preference data management, distributed training.
What's expected
Models whose behavior measurably improves with each iteration, without safety regressions.
Career paths
Senior Research Engineer, Lead Post-training, Alignment Researcher.
Openings right now
No opening for this role at the moment.
Get alerted as soon as a Post-training Engineer / RLHF position is published.
Create a job alert →