待验证50% 置信事实精确时间
Self-Refine的核心机制是让大语言模型对自己的初始输出进行批评性评价,然后根据评价反馈生成改进版本,循环直到满足要求或达到迭代上限,整个过程仅依赖单一模型的推理能力,无需外部奖励模型或人类反馈
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
待验证自我改进机制主要在推理阶段通过上下文工程实现行为优化,不同于涉及模型参数更新的在线微调74% 相似待验证Self-Refine(Madaan等,2023)让模型生成初始输出后以批评者身份评估并给出改进建议再重新生成73% 相似待验证自我反思通过让模型评估自身输出质量并迭代改进来实现,Reflexion框架展示了Agent可以从失败尝试中学习并在下一轮迭代中调整策略72% 相似待验证大模型生成输出采用自回归方式逐个token生成,每生成一个token都需重新计算对所有前文的注意力72% 相似待验证By introducing external feedback, ReAct allows models to think while doing and adjust while thinking, effectively mitigating the drift problem of pure reasoning.71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/831915API
curl https://kongchang.com/api/v1/knowledge/claims/831915MCP
get_claim(id=831915)