
GroupDPO: Memory-Efficient Group-Wise Preference Optimization for LLMs
Researchers introduce GroupDPO, a method to optimize LLMs using multiple response candidates per prompt, improving efficiency and scalability. This approach leverages underutilized data in preference datasets, enhancing model alignment with user preferences.