{
  "id": "direct-preference-optimization",
  "code": "PTL-0012",
  "term": "Direct Preference Optimization",
  "aliases": [
    "DPO"
  ],
  "category": "foundations",
  "definition": "Direct preference optimization (DPO) aligns a language model to human preferences by training directly on preferred-versus-rejected response pairs, without fitting a separate reward model or running reinforcement learning.",
  "description": "DPO reframes the RLHF objective as a simple classification-style loss over preference pairs. It became a common alternative to RLHF because it is stable and cheap to run.",
  "example": null,
  "broader": [
    "rlhf"
  ],
  "narrower": [],
  "related": [],
  "introduced": 2023,
  "sources": [
    {
      "title": "Direct Preference Optimization: Your Language Model is Secretly a Reward Model",
      "authors": "Rafailov et al.",
      "year": 2023,
      "url": "https://arxiv.org/abs/2305.18290"
    }
  ],
  "url": "https://protologue.com/t/direct-preference-optimization/",
  "citation": "Protologue. (2026). Direct Preference Optimization. In Protologue: A Taxonomy of Prompting and LLM Techniques (v1.0.0, PTL-0012). https://protologue.com/t/direct-preference-optimization/"
}