Post-training Engineer / RLHF

Main mission

Refines model behavior after initial training, at scale.

5 key responsibilities

  • Design fine-tuning pipelines via human and AI feedback at scale.
  • Build and manage preference datasets and their annotators.
  • Train reward models and monitor their biases.
  • Evaluate post-trained models: utility, safety, style.
  • Industrialize rapid iterations between model versions.

Key skills

RLHF, DPO, reward modeling, preference data management, distributed training.

What's expected

Models whose behavior measurably improves with each iteration, without safety regressions.

Career paths

Senior Research Engineer, Lead Post-training, Alignment Researcher.

Openings right now

No opening for this role at the moment.

Get alerted as soon as a Post-training Engineer / RLHF position is published.

Create a job alert →