待验证50% 置信基准精确时间
实验发现塑形奖励配置下的task_score仅为0.125,而朴素奖励配置为0.417,效应量d=4.47
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/7
首次发现
有效期至:2026/12/6
来源
涉及实体
相关事实
待验证OSWorld 2.0采用细粒度检查点部分奖励评分,平均每个任务有27.25个检查点,不要求固定顺序66% 相似待验证在实验中,由4B模型编写技能时27B模型在LiveMath上得分61.0%,而27B自己编写技能时得分56.3%63% 相似待验证跑分排名不等于所有场景的实际表现,Terra跑分接近5.5但游戏任务中5.5完成度略高63% 相似待验证MiniMax M2.7每任务提问0.6个问题,但澄清推进率只有60.7%,存在低信息增益提问问题62% 相似待验证Sonnet 5 的 Max Effort 模式相比 Sonnet 4.6,每个 Intelligence Index 任务的输出 Token 多约 40%61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/871626API
curl https://kongchang.com/api/v1/knowledge/claims/871626MCP
get_claim(id=871626)