Artificial Intelligence
22 views
Red Teaming AI
Quick Definition
Adversarial testing of AI models for vulnerabilities
Full Definition
Systematic adversarial testing of AI models to identify vulnerabilities biases and safety risks.
Examples
safety evaluation, bias discovery, adversarial probing
Related Terms
ai-safety
adversarial-attack
penetration-testing
More Artificial Intelligence Terms
Neural Architecture Search
Automating the design of optimal neural network architectures
Reward Modeling
Training models to predict human preferences for RLHF
AI Alignment
Ensuring AI systems act in accordance with human values
Superintelligence
Hypothetical AI surpassing all human cognitive abilities
Word Embedding
Dense vector representation capturing word semantic meaning
AI Safety
Research ensuring AI is developed safely without harm