Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
Apple ML Research proposes Personalized Group Relative Policy Optimization (PGRPO) to align LLMs with heterogeneous individual preferences beyond single global objectives.