共 1 篇相关文章
探索式建模通过让模型生成K个候选预测并择优学习,在训练中引入探索机制。本文深入解析Best-of-K训练策略的核心原理、适用场景及其与强化学习、拒绝采样微调的关联,探讨计算开销与评估可靠性等关键挑战。