待验证50% 置信事实精确时间
自我改进机制主要在推理阶段通过上下文工程实现行为优化,不同于涉及模型参数更新的在线微调
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
待验证策略更新的参数化方式直接修改模型权重(如LoRA微调层在线更新),能力上限更高但引入灾难性遗忘风险;非参数化方式通过修改提示、检索内容或工具配置改变行为,可逆性强但表达能力有限76% 相似待验证自我反思通过让模型评估自身输出质量并迭代改进来实现,Reflexion框架展示了Agent可以从失败尝试中学习并在下一轮迭代中调整策略75% 相似待验证推理增强模型本质上是以推理时算力(Inference-time Compute)换取准确率74% 相似待验证提示词工程正在从通用技巧向模型特定优化方向演进74% 相似待验证使用高能力模型进行优化的推荐交互模式包括:明确定义成功指标、提供基线方案、让模型提出改进假设并预估收益、将执行结果反馈给模型迭代调整73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/829598API
curl https://kongchang.com/api/v1/knowledge/claims/829598MCP
get_claim(id=829598)