RESEARCHInvestigateNEXT 12 MONTHS
Procedural Fairness Failures in RLHF from Preference Averaging
arXiv cs.LG — Machine Learning
Factual evidence
What the source reports
Research shows RLHF preference averaging systematically suppresses minority group preferences, causing procedural fairness failures in alignment.
Open source