[控场AI]
已验证65% 置信事实精确时间

TRPO由John Schulman等人在2015年提出,将策略更新形式化为约束优化问题:最大化替代目标函数同时约束新旧策略之间的KL散度不超过阈值

3
来源数
65%
置信度
长期有效
时效性
2026/8/5
首次发现

来源

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/691006
API
curl https://kongchang.com/api/v1/knowledge/claims/691006
MCP
get_claim(id=691006)