[控场AI]
已验证90% 置信事实时间未知

GRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择

14
来源数
90%
置信度
长期有效
时效性
2026/5/31
首次发现

来源

涉及实体

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/5808
API
curl https://kongchang.com/api/v1/knowledge/claims/5808
MCP
get_claim(id=5808)