Hugging Face开源的大语言模型后训练框架,支持SFT、RLHF、DPO、蒸馏等多种训练方法,广泛用于LLM微调与对齐研究
社区涌现出RLHF的简化替代方案,包括 DPO(直接偏好优化)和 RLAIF(用AI反馈替代人类反馈),并在 TRL、OpenRLHF 等开源框架中实现