Large Language Models
23 views
DPO
Quick Definition
Alignment method bypassing reward model for preference learning
Full Definition
Direct Preference Optimization, a simplified alignment method that bypasses explicit reward model training.
Examples
LLM alignment, preference learning, simpler RLHF alternative
Related Terms
rlhf
alignment
reward-model
More Large Language Models Terms
Temperature
Parameter controlling randomness in text generation
Jailbreaking
Circumventing AI safety restrictions through prompt techniques
GPT
OpenAI's family of autoregressive large language models
SentencePiece
Language-agnostic tokenizer operating on raw text bytes
BPE
Subword tokenization algorithm merging frequent character pairs
RAG
Enhancing LLMs by retrieving relevant external knowledge