PromptHub

Quick Definition

Alignment method bypassing reward model for preference learning

Full Definition

Direct Preference Optimization, a simplified alignment method that bypasses explicit reward model training.

Examples

LLM alignment, preference learning, simpler RLHF alternative

Related Terms

rlhf alignment reward-model

More Large Language Models Terms