待验证50% 置信事实精确时间
策略梯度方法本质上是on-policy的,因为梯度估计中的期望是关于当前策略分布的
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证策略梯度的核心思想源自 REINFORCE 算法(Williams, 1992),通过对轨迹回报的蒙特卡洛估计来计算策略参数的梯度73% 相似待验证传统自回归推理中,模型每一步只能基于已有上下文预测下一个token,是串行依赖关系67% 相似待验证动态规划遵循最小承诺原则以换取更强适应性,代价是推理开销增加(每步都需要一次完整的LLM推理)64% 相似待验证在需要多步骤推理、长上下文理解或开放性架构决策等发散型任务上,新模型的优势可能显著62% 相似待验证贝叶斯优化通过构建目标函数的概率代理模型(通常是高斯过程),利用采集函数(如Expected Improvement或Upper Confidence Bound)决定下一个采样点61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/690913API
curl https://kongchang.com/api/v1/knowledge/claims/690913MCP
get_claim(id=690913)